OpenAIs GPT-5.6 Sol hat beeindruckende Erfolge bei mathematischen Beweisen und komplexen Spielen erzielt. Doch beim ARC-AGI-3-Benchmark, einem anspruchsvollen Test mit unbekannten 2D-Puzzle-Spielen, schnitt das Modell zunächst erstaunlich schlecht ab. Die Ursache lag nicht im Modell selbst, sondern in zwei versteckten API-Einstellungen. Wir zeigen, wie die Scores mit einem simplen Handgriff verdreifacht werden konnten.
Das ARC-AGI-3 Benchmark-Rätsel
Als OpenAI die ersten Ergebnisse von GPT-5.6 Sol auf dem ARC-AGI-3-Benchmark sah, war das Team verwirrt. Das Modell hatte bereits anspruchsvolle mathematische Probleme wie die Cycle-Double-Cover-Vermutung gelöst und sogar Pokémon FireRed gemeistert. Auf dem ARC-AGI-3-Benchmark, der aus unbekannten 2D-Puzzle-Spielen besteht, erreichte es jedoch nur magere 7,8 Prozent. Der Vorgänger GPT-5.5 war mit 0,4 Prozent noch schlechter.
Benchmarks messen längst nicht mehr nur die Fähigkeiten eines KI-Modells. Sie spiegeln auch weniger sichtbare Entscheidungen wider: API-Einstellungen, das Harness-Design und Prompting-Strategien. Im Falle von ARC-AGI-3 entdeckte das Team, dass zwei in ChatGPT und Codex genutzte Funktionen die Ergebnisse verdreifachten und die Ausgabetokens um das Sechsfache reduzierten.
Warum die Leistung anfangs so gering war
ARC-AGI-3 verwendet ein absichtlich generisches Harness ohne spezielle Tools oder Features. Die Philosophie dahinter: Ein einfaches Harness macht Schwächen von Modellen deutlicher und Vergleiche fairer. Kommerzielle Entwickler optimieren hingegen die Testumgebung gezielt für die Stärken und Eigenheiten jedes Modells.
Inspiriert durch die Analyse von ARC untersuchte OpenAI die Versuche von GPT-5.6 Sol genauer. Das Modell wirkte nicht weniger intelligent, sondern verbrachte viel Zeit mit einzelnen Aktionen und kam kaum voran. Der Grund dafür lag tiefer in der technischen Ausführung.
Verworfenes Reasoning nach jedem Zug
Nach jeder Spielaktion wurde das private Reasoning von GPT-5.6 Sol komplett verworfen. Das bedeutete: Das Modell musste das Spiel bei jedem neuen Zug komplett neu interpretieren. Es konnte zwar eine Liste vergangener Aktionen sehen, aber nicht die Pläne, Erkenntnisse und Gedanken, die dazu geführt hatten.
Die Problematik der Rolling Truncation
Zusätzlich nutzte das Harness ein rolling truncation window. Ältere Aktionen verschwanden nach und nach aus dem Kontextfenster, sobald die Historie zu lang wurde. GPT-5.6 Sol verlor somit nicht nur seine Denkprozesse, sondern auch den Zugriff auf eigene vergangene Aktionen.
Die Lösung: Retained Reasoning und Compaction
OpenAIs Modelle sind darauf trainiert, mit privaten Reasoning-Nachrichten zu denken, bevor sie Antworten oder Tool-Aufrufe ausgeben. Diese internen Denkprozesse bleiben normalerweise als Teil des Gesprächsverlaufs erhalten. Wird ein Gespräch zu lang, wird es zusammengefasst und fortgesetzt.
Retained Reasoning sorgt für Lernerfolge
Um die Produktionsumgebung besser abzubilden, implementierte OpenAI das ARC-AGI-3-Harness mit der Responses API. Diese ermöglicht es, durch Übergabe der vorherigen Response-ID das Reasoning über Tool-Aufrufe und Züge hinweg zu erhalten.
Mit aktiviertem Reasoning zeigten sich zwei entscheidende Verbesserungen. Erstens verbrachte GPT-5.6 Sol weniger Zeit mit Nachdenken vor jeder Aktion, da es das Spiel nicht mehr jedes Mal neu deuten musste. Zweitens entwickelte es im Laufe der Zeit bessere Strategien und lernte kontinuierlich dazu.
Compaction statt Rolling Truncation
Der zweite entscheidende Faktor war die Ersetzung der Rolling Truncation durch Compaction. Das ARC-AGI-3-Harness warf ab 175.000 Zeichen die ältesten Nachrichten einfach weg. Das hatte zwei Nachteile: Das Modell verlor frühere Beobachtungen und arbeitete große Teile der Aufgabe mit einem vollen Kontextfenster, was die Leistung leicht beeinträchtigte.
Durch die Aktivierung von Compaction konnte GPT-5.6 Sol sein Wissen über jedes Spiel über längere Läufe hinweg bewahren. Das Ergebnis: eine deutlich höhere Punktzahl bei gleichzeitig um das Sechsfache reduzierten Ausgabetokens.
Fazit und Empfehlungen für Entwickler
Die Ergebnisse zeigen eindrücklich, dass Evaluierungen selten Modelle isoliert messen. Sie reflektieren stets auch versteckte Entscheidungen über API-Einstellungen, Harness-Design und Prompting.
Für API-Entwickler, die die Leistung maximieren möchten, empfiehlt OpenAI folgende Einstellungen, die auch in ChatGPT und Codex zum Einsatz kommen:
- Responses API verwenden: Nutzen Sie die moderne Responses API anstelle der veralteten Chat Completions API.
- Reasoning beibehalten: Lassen Sie das interne Reasoning des Modells als Teil des Gesprächskontexts erhalten.
- Compaction aktivieren: Ersetzen Sie Rolling Truncation durch intelligentes Zusammenfassen des Kontexts.
Wer Modelle miteinander vergleicht, sollte auf Benchmarks setzen, die diese Einstellungen berücksichtigen – denn so entsprechen sie am ehesten der realen Nutzung in ChatGPT und Codex.
Quelle: OpenAI Blog