OpenAI erweitert die GPT-6-Familie um zwei günstigere Modelle. Sol ist für anspruchsvolle Aufgaben gedacht, Luna für schnelle und preiswerte Einsätze. Im Intelligence Index von Artificial Analysis bleiben die Ergebnisse nahezu auf dem Niveau von GPT-5.6, während die Kosten pro Aufgabe stark sinken.
Unabhängiger Index zeigt kaum mehr Leistung
Artificial Analysis hat Sol und Luna im Intelligence Index v4.3.2 getestet. Er bündelt zehn Prüfungen aus Bereichen wie Wissen, Programmierung und mehrstufigen Arbeitsabläufen. Bei maximaler Reasoning-Stufe erreicht GPT-6 Sol 48 Punkte, GPT-5.6 Sol kommt auf 47. GPT-6 Luna und sein Vorgänger liegen beide bei 37 Punkten. GPT-6 Astra erzielt 53 Punkte, das heute ebenfalls erschiene Claude Opus 5.5 erreicht 58.
Quelle: Artificial Intelligence
Bei der Preis pro Index-Aufgabe ist der Abstand größer. Sol kostet im gewichteten Durchschnitt 1,06 statt 1,99 Dollar, Luna 0,07 statt 0,18 Dollar. Das entspricht einem Rückgang um rund 47 beziehungsweise 61 Prozent. Diese Werte beschreiben die Kosten der Aufgaben im Index und sind keine festen Preise für beliebige Anfragen. Die gemeinsame Grafik aus Punktzahl und Kosten zeigt beide neuen Modelle mit fast gleicher Leistung wie ihre Vorgänger, aber deutlich geringeren Kosten.
Mehr Arbeit für weniger Geld
Der auffälligste Sprung zeigt sich bei Arbeitsabläufen über mehrere Anwendungen. Im AutomationBench erledigt GPT-6 Sol mit der Reasoning-Stufe »xhigh« 33 Prozent der Aufgaben für 0,27 Dollar pro Aufgabe. Claude Opus 5 kommt bei maximaler Stufe auf 27 Prozent und kostet dabei etwa elfmal so viel. Luna verbessert sich auf der Stufe »high« gegenüber GPT-5.6 Luna um fünf Prozentpunkte.
Quelle: OpenAI
Auffällig ist, dass die höheren Reasoning-Stufen in diesem Index nicht durchweg die besten Ergebnisse liefern. Bei Luna schneidet »high« besser ab als »xhigh«, bei Sol »high« besser als »max«. Das könnte auch ein Grund für die schlechten Ergebnisse auf Artificial Intelligence sein.
Im Agents’ Last Exam, einem Test für längere berufliche Aufgaben, erreicht Sol mit maximaler Reasoning-Stufe 56 Prozent. Das liegt über dem besten Wert von Claude Opus 5, bei 60 Prozent geringeren Kosten!
Quelle: OpenAI
Beim Programmieren rücken beide neuen Modelle ebenfalls vor. Sol löst im DeepSWE 69 Prozent der Aufgaben in echten Codeprojekten, Claude Fable 5 schafft 70 Prozent und kostet pro Aufgabe ungefähr fünfmal so viel. Luna erreicht starke 67 Prozent. Im Computerbenchmark OSWorld 2.0 liegen Sol und Claude Opus 5 jeweils bei rund 60 Prozent, wobei Sol etwa 80 Prozent weniger kostet.
In diesen Praxistests steigen die Werte, während der unabhängige Gesamtindex kaum mehr Leistung zeigt. Der größte Fortschritt ist aber ohne Frage ganz klar der Preis.
Anzeige
Immerhin weniger Täuschung bei GPT-6
In einem gezielt schwierigen Test für irreführende Angaben über Programmierarbeit sinkt die Täuschungsrate von zehn Prozent bei GPT-5.6 Sol auf ein Prozent bei GPT-6 Sol. Der Anteil unerlaubter Aktionen nach Kontakt mit Nachrichten anderer Agenten fällt von 52 auf elf Prozent. Luna zeigte in diesem zweiten Test keine solchen Aktionen.
Halbierte API-Preise und Start in Codex
Eine Million Eingabetokens kostet bei Sol zwei Dollar, eine Million Ausgabetokens zehn Dollar. Beides ist halb so teuer wie bei GPT-5.6 Sol. Luna kostet 0,10 Dollar für Eingaben und 0,50 Dollar für Ausgaben. Bei Luna sinkt der Ausgabepreis damit sogar um rund 58 Prozent. Wiederverwendete Eingaben erhalten durch verbessertes Prompt-Caching einen Rabatt von 90 Prozent.
Quelle: OpenAI
Sol und Luna starten in ChatGPT Work und Codex für Nutzer mit Plus-, Pro-, Business-, Enterprise- und Edu-Abo. Nutzer der kostenlosen Version und von Go bekommen Luna in der Desktop-App. In der API heißen die Modelle `gpt-6-sol` und `gpt-6-luna`. Im normalen Chat sind sie vorerst nicht verfügbar, die Freischaltung in Work und Codex erfolgt schrittweise. Bei uns sind sie gerade schon erschienen zur Auswahl.










