---
title: GPT-5.6 Sol verdreifacht seine Leistung im AGI-3 Test
description: Zwei simple Einstellungen verdreifachen die Leistung des KI-Modells. Das Modell speichert nun eigene Gedankengänge.
author: Andreas Becker
url: https://www.all-ai.de/news/news26/gpt-sol-agi3-test
---

![Ein OpenAI Gedächnis](https://www.all-ai.de/images/2-news/7-26/gpt-arc-agi3-1600.webp)

# GPT-5.6 Sol verdreifacht seine Leistung im AGI-3 Test

Zwei simple Einstellungen verdreifachen die Leistung des KI-Modells. Das Modell speichert nun eigene Gedankengänge.

[Andreas Becker](https://www.all-ai.de/charaktere)·30.07.26

GPT-Images-2.0

![Ein OpenAI Gedächnis](https://www.all-ai.de/images/2-news/7-26/gpt-arc-agi3-1600.webp#joomlaImage://local-images/2-news/7-26/gpt-arc-agi3-1600.webp?width=1600&height=900)

Kurzfassung
 ▾

Quellen
 ▾

- Das OpenAI-Modell GPT-5.6 Sol scheiterte zunächst im ARC-AGI-3-Benchmark, da die Testumgebung seine Gedankengänge löschte.
- Durch die Aktivierung von zwei API-Funktionen behält die KI nun ihre Überlegungen im Kontextfenster.
- Diese Anpassung verdreifachte die Leistung bei Logikrätseln und machte das Modell zum State-of-the-Art.
- Gleichzeitig sank der Token-Verbrauch für die Lösungswege auf ein Sechstel.

- [OpenAI: How enabling two settings tripled our scores on the ARC-AGI-3 benchmark](https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/)
- [Tibo auf X: GPT-5.6 Sol is actually SoTA on ARC-AGI-3](https://x.com/thsottiaux/status/2082609662231502932)
- [OpenAI auf X: GPT-5.6 Sol ARC-AGI-3](https://x.com/OpenAI/status/2082616636989952217)

OpenAI hat das Rätsel um die schwache Leistung von GPT-5.6 Sol im ARC-AGI-3-Benchmark gelöst. Durch zwei API-Funktionen behält das Modell nun seine eigenen Gedankengänge im Speicher. Die Punktzahl verdreifachte sich, der Token-Verbrauch sank deutlich.

#### Ein unerwarteter Flop

Eigentlich löst GPT-5.6 Sol komplexe mathematische Probleme. Im ARC-AGI-3-Benchmark, der das logische Denken anhand unbekannter 2D-Puzzlespiele misst, enttäuschte es jedoch zunächst mit einer Erfolgsquote von nur 13,3 Prozent.

OpenAI untersuchte die Testläufe und fand die Fehlerquelle in der Testumgebung. Das Standard-Framework des Benchmarks verwarf nach jeder Aktion die privaten Gedankengänge. GPT-5.6 Sol musste die Puzzles also für jeden Zug komplett neu entschlüsseln. Es konnte nicht auf seine eigenen Vorüberlegungen zurückgreifen.

Zudem kappte die Umgebung bei einem vollen Kontextfenster einfach die ältesten Nachrichten. Das Modell verlor dadurch auch die Erinnerung an vergangene Aktionen.

Twitter Beitrag - Cookies links unten aktivieren.

> GPT-5.6 Sol has been used to solve open problems in mathematics. So why was it struggling with ARC-AGI-3, a benchmark of 2D puzzle games?
>
> We investigated. The harness was not letting it remember what it had learned.
>
> We found that enabling two API settings tripled our scores… [pic.twitter.com/0mv05MnSn2](https://t.co/0mv05MnSn2)
>
> — OpenAI (@OpenAI) [July 29, 2026](https://x.com/OpenAI/status/2082616636989952217?ref_src=twsrc%5Etfw)

#### Zwei Einstellungen bringen die Wende

Die Entwickler wechselten auf die aktuelle Responses-API, um die Bedingungen aus dem echten Betrieb herzustellen. Dort aktivierten sie die Funktion »Retained Reasoning«, womit GPT-5.6 Sol seine Denkschritte abspeichert. Das Modell erfasst die Spiele nun deutlich schneller, weil es nicht mehr jeden Zug isoliert betrachten muss.

Zusätzlich schaltete OpenAI die Komprimierungsfunktion »Compaction« ein, die verhindert, dass der Verlauf bei langen Aufgaben hart abgeschnitten wird. Das Wissen über die Puzzles bleibt so im Kontextfenster erhalten, ohne die Leistung zu drosseln.

Die Punktzahl von GPT-5.6 Sol stieg durch diese Anpassungen auf 38,3 Prozent. Laut OpenAI-Entwickler Tibo erreicht es damit den ersten Platz auf der ARC-AGI-3-Rangliste. Menschliche Tester erzielen bei diesen Aufgaben im Schnitt 48 Prozent.

Wie die Grafik verdeutlicht, sank zudem der Ressourcenbedarf: GPT-5.6 Sol verbrauchte für die höhere Punktzahl sechsmal weniger Output-Token. Das spart bei der Nutzung viel Zeit und Rechenleistung.

![arc agi 3 benchmark](https://www.all-ai.de/images/2-news/7-26/gpt-arc-agi3-1.webp)

###### Quelle: OpenAI

OpenAI empfiehlt Entwicklern, API-Schnittstellen künftig stets so zu konfigurieren, dass Reasoning-Nachrichten erhalten bleiben und der Kontext komprimiert wird.

###### Anzeige
