Eine Person denkt über KI Modelle nach

Diese KI-Modelle empfehlen wir heute!

Andreas Becker GPT-Images-2.0
Eine Person denkt über KI Modelle nach

In dieser Woche hat sich mit dem Release einiger KI-Modelle viel getan. Mit Opus 5.5 gibt es einen neuen Spitzenreiter. Mit GPT-6 Sol und Luna gibt es deutlich günstigere Modelle und mit MiMo 2.6 Pro ein wirklich interessantes Modell aus China.

Wir zeigen, welche Modelle sich aktuell lohnen und warum.

Anzeige

Opus 5.5 ist die Wahl für besonders schwierige Aufgaben

Claude Opus 5.5 erreicht 58 Punkte im Intelligence Index. Claude Fable 5.1 und GPT-6 Astra folgen mit jeweils 53 Punkten, Opus 5 kommt auf 51. Wer für einen schwierigen Auftrag die höchste gemessene Leistung sucht, greift damit derzeit zu Opus 5.5. Besonders bei komplexer Wissensarbeit und beim Programmieren fällt sein Vorsprung auf.

Quelle: Artificial Intelligence

Anthropic hat zugleich den Preis gesenkt. Eine Million Ausgabetoken kosten 20 statt 25 Dollar, bei den Eingabetoken sind es 4 statt 5 Dollar. Für typische Aufträge nennt Anthropic außerdem einen geringeren Rechenaufwand und rund 40 Prozent niedrigere Kosten als bei Opus 5.

Die maximale Thinking-Stufe zeigt jedoch, warum aus einem günstigeren Tokenpreis nicht automatisch eine günstigere Aufgabe wird. In den Messungen von Artificial Analysis erzeugt Opus 5.5 im Schnitt rund 119.000 Ausgabetoken pro Index-Aufgabe. Opus 5 benötigt etwa 73.000. Das neue Modell liefert mehr Leistung, denkt in dieser Einstellung aber auch wesentlich ausführlicher als sein Vorgänger.

So kostet eine Index-Aufgabe mit Opus 5.5 rund 5,98 Dollar und mit Opus 5 rund 5,86 Dollar. Fable 5.1 liegt bei 7,63 Dollar, GPT-6 Astra bei 3,26 Dollar. Opus 5.5 ist in diesem Test also günstiger als Fable, aber nicht halb so teuer und auch nicht günstiger als Astra oder Opus 5. Anthropics Angabe zu typischen Aufträgen und der Benchmark auf maximaler Stufe beschreiben unterschiedliche Nutzungsarten.

Quelle: Artificial Intelligence

Pauschal kann man sagen, dass Opus 5.5 derzeit das beste Modell ist.

GPT-6 Sol gewinnt beim Preis statt bei den Punkten

GPT-6 Sol erreicht 48 Punkte, sein Vorgänger GPT-5.6 Sol 47. Bei Luna bleibt der Wert bei 37 Punkten. OpenAI hat mit den beiden neuen Modellen im Gesamtindex also kaum zusätzliche Leistung gewonnen. Einzelne Programmier- und Automatisierungstests fallen besser aus, bei anderen Aufgaben gibt es sogar Rückschritte.

Der große Sprung steckt im Preis. Bei Sol kostet eine Million Ausgabetoken nun 10 statt 20 Dollar, eine Million Eingabetoken 2 statt 4 Dollar. GPT-5.6 Sol war bei seiner Einführung mit 30 Dollar pro Million Ausgabetoken gestartet, bevor OpenAI den Preis vorübergehend auf 20 Dollar senkte.

Selbst GPT-5.6 Terra kostete zum Start mit 15 Dollar pro Million Ausgabetoken mehr als Sol heute. Die 10-Dollar-Marke erinnert an den früheren Ausgabepreis von GPT-4o.

Luna wird noch günstiger. Der Preis pro Million Eingabetoken fällt von 20 auf 10 Cent, der für Ausgabetoken von 1,20 Dollar auf 50 Cent. Das sind beim Output rund 58 Prozent weniger. In der Benchmark-Rechnung sinken die durchschnittlichen Kosten pro Aufgabe bei Sol von 1,99 auf 1,06 Dollar und bei Luna von 18 auf 7 Cent.

Quelle: Artificial Intelligence

Kurz gesagt: OpenAI liefert eine sehr gute Leistung zu einem attraktiven Preis.

Die Alternativen

Xiaomis MiMo-V2.6-Pro erreicht 46 Punkte und liegt damit nur zwei Punkte hinter GPT-6 Sol. Eine Index-Aufgabe kostet im Schnitt 13 Cent, gegenüber 1,06 Dollar bei Sol. Luna ist mit 7 Cent noch günstiger, erreicht allerdings neun Punkte weniger.

Quelle: Artificial Intelligence

Auch andere Modelle drängen in diesen Bereich. Muse Spark 1.3 erreicht 48 Punkte, Grok 4.7 und MiMo kommen auf 46, GLM-5.3 auf 45 und Kimi K3 auf 44. Sol steht mit 48 Punkten damit mitten in einem großen Feld. Gegenüber Muse, Grok, GLM und Kimi ist es pro Index-Aufgabe günstiger, Xiaomi unterbietet es jedoch deutlich.

MiMo-V2.6-Pro hat noch einen weiteren Reiz. Xiaomi veröffentlicht die Modellgewichte unter einer MIT-Lizenz. Wer ein leistungsfähiges Modell mit frei verfügbaren Gewichten oder eine günstige API sucht, findet hier gerade einen starken Kandidaten.

Anzeige

Warum OpenAI so günstig anbieten kann

OpenAI hat die Verarbeitung und Zwischenspeicherung verbessert und kann dadurch API-Preise senken. Dazu kommt ein Vorteil, der beim Blick auf die Preisliste leicht untergeht.

So erzeugt GPT-6 Sol im Index rund 31.000 Ausgabetoken pro Aufgabe, MiMo etwa 64.000, GLM rund 71.000 und Grok rund 81.000. Für den Testmix benötigt Sol also deutlich weniger Ausgabetoken als diese Modelle.

Verbraucht man beispielsweise nur die Hälfte der Token, sind natürlich auch die Kosten nur halb so hoch.

Quelle: Artificial Intelligence

In ChatGPT Work und Codex kommt weniger vom Preisnachlass an

Bei der API ist die Rechnung einfach. Für denselben Umfang an Ein- und Ausgabetoken kostet Sol nur noch halb so viel. Nutzer eines ChatGPT-Abos erhalten dagegen nicht automatisch doppelt so viel enthaltene Nutzung.

OpenAIs Richtwerte für lokale Nachrichten innerhalb von fünf Stunden steigen im Plus-Abo von 10 bis 100 bei GPT-5.6 Sol auf 15 bis 150 bei GPT-6 Sol. Das sind 50 Prozent mehr.

Quelle: OpenAI

Hier scheint OpenAI die Hälfte an die Nutzer weiterzugeben und die andere Hälfte der Preissenkung sich selbst einzustecken. Ob dadurch die Gewinne steigen oder die Verluste nur geringer werden? Keine Ahnung.

Wartezeit ist ebenfalls ein Preis

Wer mit einem Modell arbeitet, bezahlt nicht nur die API-Rechnung oder das Abo. Eine Antwort nach einer Minute lässt sich unmittelbar prüfen und weiterverwenden. Bei 20 Minuten Wartezeit stockt der Arbeitsablauf, besonders wenn danach noch eine Korrekturrunde nötig ist. Gesparte Cents helfen wenig, wenn ein Mitarbeiter regelmäßig auf Ergebnisse warten muss.

Artificial Analysis schätzt für eine Index-Aufgabe mit GPT-6 Sol rund vier Minuten reine Ausgabezeit. Bei MiMo-V2.6-Pro sind es etwa 17 Minuten, bei Kimi K3 rund 20 Minuten.

Quelle: OpenAI

Mehr erzeugte Token verlängern die Ausgabe, wenn zwei Anbieter sie gleich schnell ausliefern. Wenn also Anthropic dreimal mehr Token benötigt, dauert die Aufgabe auch dreimal länger. Eine langsame Infrastruktur kann den Effekt zusätzlich verstärken. Genau deshalb kann ein günstiges Modell in der Praxis teuer werden, obwohl seine API-Rechnung niedrig bleibt.

Sol verbindet einen moderaten Aufgabenpreis mit einer deutlich kürzeren Wartezeit als viele ähnlich platzierte Konkurrenten.

Anzeige

Welche Modelle sich jetzt lohnen

Unsere Empfehlung für die meisten Nutzer ist aktuell ein Abo bei OpenAI. Die Kombination aus Leistung, Preis, Zuverlässigkeit und vor allem Schnelligkeit macht das Produkt sehr rund.

Wer allerdings höchste Ansprüche hat, kommt an Claude Opus 5.5 nicht vorbei. Fable und Astra sind hingegen aktuell etwas nutzlos und eignen sich nur für sehr spezielle Aufgaben.

Als chinesische Alternative bleibt außerdem Xiamois MiMo 2.6 Pro. Hierzu müssen wir aber erst noch eigene Erfahrungen sammeln.

Von Menschen für Menschen

Jeder Artikel entsteht durch menschliche Ideen und sorgfältige Prüfung. KI unterstützt uns vor allem bei Recherche und Feinschliff. Wir freuen uns über jede Unterstützung.

Jeder Beitrag zählt – auch das Teilen.