Android Bench 2.0: KI-Modelle im Langhorizont-Task-Test mit Agenten
LONDON (IT BOLTWISE) – Google hat Android Bench in der Version 2.0 weiterentwickelt und stärker auf KI-gestĂĽtzte Langhorizont-Aufgaben ausgerichtet. Statt nur „pass/fail“ zu bewerten, nutzt der Benchmark eine kontinuierliche Bewertung ĂĽber Funktionalität, visuelle Qualität und das Vermeiden von Regressionen. Bei komplexen Projekten wie Feature-Erweiterungen oder App-Neuentwicklungen zeigt sich, dass selbst Frontier-Modelle das Optimum nicht erreichen. […]


#Sophos