Artificial Analysis hat Version 4.2 seines Intelligence Index veröffentlicht. Diese Aktualisierung erfolgt mutmaßlich als Reaktion auf Kritik, dass frühere Bewertungen den tatsächlichen Fortschritt von OpenAI’s GPT-6 Astra nicht adäquat abbildeten. Mit der neuen Version erzielt GPT-6 Astra nun vier Punkte mehr als sein Vorgänger, liegt jedoch weiterhin hinter Anthropic’s Claude Fable 5.1.
Zuvor hatten verschiedene andere Evaluierungen, darunter auch OpenAI’s eigene Tests, GPT-6 Astra deutlich an die Spitze gesetzt. Epoch AI beispielsweise bewertete das Modell mit 169 Punkten als bestes von 267 Modellen über mehr als 50 standardisierte Testverfahren (Benchmarks). ARC-AGI-3 zeigte ebenfalls je nach verwendetem Testumfeld einen großen bis sehr großen Fortschritt. Im Gegensatz dazu hatte Artificial Analysis Astra ursprünglich lediglich auf dem Niveau seines Vorgängers eingestuft.
Neubewertung und Rangliste der führenden KI-Modelle
Mit dem aktualisierten Index verbessert sich GPT-6 Astra um vier Punkte gegenüber seinem Vorgänger. In der Gesamtwertung führt weiterhin Anthropic’s Claude Fable 5.1, gefolgt von Astra auf dem zweiten Platz und Meta auf dem dritten Rang. Laut Artificial Analysis benötigt Astra zudem weniger Tokens pro Aufgabe als jedes andere führende Modell. Tokens sind die grundlegenden Recheneinheiten, die ein KI-Modell zur Verarbeitung von Informationen verwendet. Beim Kosten-Leistungs-Verhältnis teilen sich Anthropic, OpenAI, Meta und Zhipu AI die Führung.
Anpassungen an der Bewertungsmethodik
Der Index wurde um zwei neue Benchmarks erweitert: AA-Briefcase, der Fähigkeiten im Bereich der Wissensarbeit in der realen Welt bewertet, und GDP.pdf von Surge AI für die Analyse von PDF-Dokumenten. Der Benchmark GPQA-Diamond wurde entfernt, da die Modelle diesen bereits gelöst haben. Um eine Manipulation der Testergebnisse zu erschweren, machen private Testdaten nun 40 Prozent der Gewichtung aus. Artificial Analysis hat außerdem Bewertungsfehler in mehreren Benchmarks behoben und sein Bewertungssystem angepasst, um stabilere Ergebnisse zu erzielen.
Hintergrund und Ausblick
Artificial Analysis gibt an, Aktualisierungen zurückgehalten zu haben, um die Ergebnisse während wichtiger Modellveröffentlichungen stabil zu halten. Die schnelle Entwicklung an der Spitze der Rangliste machte jedoch eine Zwischenaktualisierung notwendig. Version 5 des Intelligence Index sei bereits seit acht Monaten in Arbeit und werde stufenweise eingeführt.
Thema: Anthropic. Quelle/Inspiration: The Decoder.