Ein Wasserschwein ist überrascht vom neuen Ergebnis

Ein Benchmark-Update und plötzlich ist Astra Zweiter

Andreas Becker GPT-Images-2.0
Ein Wasserschwein ist überrascht vom neuen Ergebnis

Neuer Benchmark Index

Noch gestern lagen GPT-6 Astra und GPT-5.6 Sol im Intelligence Index praktisch gleichauf. In der vorherigen Version erreichten beide 61 Punkte. Claude Fable 5.1 führte mit 66 Punkten, Claude Opus 5 kam auf 63 und Meta Muse Spark 1.3 auf 62.

Quelle: Artificial Intelligence

Mit dem neuen Intelligence Index v4.2 sieht die Reihenfolge deutlich anders aus. Fable bleibt mit 57 Punkten vorne, doch Astra springt mit 55 Punkten auf Rang zwei. Opus fällt mit 54 Punkten dahinter, Muse Spark erreicht 53 und Sol nur noch 51 Punkte. Ohne dass sich die Modelle selbst verändert haben, beträgt der Abstand zwischen Astra und Sol plötzlich vier Punkte. Artificial Analysis hebt genau diesen Vorsprung nun als eines der wichtigsten Ergebnisse hervor.

Quelle: Artificial Intelligence

Das hat sich geändert

Der Grund ist eine überarbeitete Benchmark-Mischung. Artificial Analysis ergänzt mit AA-Briefcase einen privaten Test für agentische Wissensarbeit und mit GDP.pdf einen Test für komplexes Dokumentverständnis über insgesamt 4.592 PDF-Seiten. Gleichzeitig fliegt GPQA Diamond heraus, weil der Test laut Artificial Analysis inzwischen weitgehend ausgereizt ist.

Zudem stammen nun 40 Prozent der Gewichtung aus privaten, zurückgehaltenen Testsets – doppelt so viel wie zuvor. Auch Bewertungsverfahren und einzelne Testumgebungen wurden angepasst.

Das macht den neuen Index nicht automatisch besser oder schlechter. Es zeigt aber, warum eine einzelne Rangliste nie als absolute Wahrheit gelten sollte. Schon Änderungen bei Aufgaben, Gewichtung und Bewertung können verschieben, welches Modell als »intelligenter« gilt.

Nach OpenAIs angekündigtem Rollout sollte Astra jetzt in allen Pro- und Plus-Abos verfügbar sein.

Anzeige

Von Menschen für Menschen

Jeder Artikel entsteht durch menschliche Ideen und sorgfältige Prüfung. KI unterstützt uns vor allem bei Recherche und Feinschliff. Wir freuen uns über jede Unterstützung.

Jeder Beitrag zählt – auch das Teilen.