OpenAI hat GPT-5.6 am 9. Juli 2026 öffentlich gemacht, und es ist jetzt das leistungsfähigste ChatGPT-Modell, das du wirklich nutzen kannst. Das Flaggschiff Sol erzielt 88,8 % auf Terminal-Bench 2.1 (und 91,9 % im Sol-Ultra-Modus mit höchstem Aufwand), übertrifft GPT-5.5's eigene 88,0 % auf demselben Agentic-Coding-Test und wird zusammen mit zwei günstigeren Stufen, Terra und Luna, veröffentlicht, die die Vorgängergeneration beim Preis unterbieten.
In weniger als einem Jahr hat OpenAI sieben unterschiedliche Versionen von GPT-5 veröffentlicht, jede mit eigener Identität und eigenem Preispunkt. Wenn du den Überblick verloren hast, was GPT-5.0 von GPT-5.6 unterscheidet: Dieser Leitfaden behandelt jedes Modell der Familie, Erscheinungsdaten, Kontextfenster, Benchmarks, Preise und die wesentlichen Unterschiede, auf die es wirklich ankommt. GPT-5.6 erschien zuerst am 26. Juni als regierungsbeschränkte Vorschau für etwa 20 Organisationen und wurde am 9. Juli vollständig öffentlich. Es treibt jetzt die Reasoning-Optionen in ChatGPTs bezahlten Plänen an und ist über die API vollständig verfügbar. Wir schauen auch voraus, was ChatGPT 6 werden soll. Wer neu bei ChatGPT ist: Unser ChatGPT-Leitfaden für Einsteiger ist ein guter Startpunkt, bevor du Modellunterschiede vergleichst.
Die wichtigsten Punkte
- GPT-5.6 (öffentlich ab 9. Juli 2026) ist die aktuelle Spitze. Es erscheint in drei Stufen: Sol (Flaggschiff), Terra (ausgewogen) und Luna (günstigste), wobei Sol 88,8 % auf Terminal-Bench 2.1 und ein API-Kontextfenster von 1,05 Mio. Tokens erzielt.
- GPT-5.5 (23. April 2026) ist das vorherige Flaggschiff und nach wie vor ein ausgezeichnetes Allround-Modell. Es erzielt 93,6 % auf GPQA Diamond und 78,7 % auf OSWorld-Verified, beides besser als GPT-5.4, und erscheint in zwei Varianten: GPT-5.5 Standard und GPT-5.5 Pro.
- GPT-5.4 (5. März 2026) liegt zwei Generationen zurück, ist aber immer noch relevant. Es führte ein 1-Mio.-Token-Kontextfenster (nur API) und native Computernutzung ein, mit 75,0 % auf OSWorld-Verified und 57,7 % auf SWE-Bench Pro.
- GPT-5.3 Instant (3. März 2026) behob den übermäßig vorsichtigen Ton und lieferte 26,8 % weniger Halluzinationen als GPT-5.2 mit aktivierter Websuche, ist aber nicht mehr auf OpenAIs API-Preisseite aufgeführt. Nur
gpt-5.3-codexüberlebt aus dieser Generation.- GPT-5.2 war das erste Modell, das 90 %+ auf ARC-AGI-1 (Pro) erzielte und ein perfektes 100 % auf AIME 2025 Mathematik erreichte.
- GPT-5.1 führte adaptives Reasoning ein, 2 bis 3-mal schneller bei einfachen Aufgaben, bei gleichem Preis von $1.25 / $10 wie GPT-5.0.
- Die Preise in GPT-5.6 sind nach Stufen aufgeteilt. Sol bleibt bei $5 / $30 pro 1 Mio. Tokens (wie GPT-5.5), Terra fällt auf $2 / $12, und Luna kostet nur noch $0.20 / $1.20, nachdem OpenAI beide Stufen am 30. Juli 2026 gesenkt hat: Luna um 80 % und Terra um 20 %.
- 15 ältere Modell-Snapshots verlieren am 23. Juli 2026 den API-Zugang, darunter fünf Codex-Snapshots und beide
chat-latest-Aliase. Es ist eine reine API-Änderung; die ChatGPT-Modellauswahl bleibt unberührt.- ChatGPT 6 ist noch nicht erschienen. Ein Launch Mitte bis Ende 2026 gilt noch als wahrscheinlichstes Zeitfenster, mit einer Verlagerung hin zu persistentem Gedächtnis und autonomen Agenten.
Alle ChatGPT-5-Modelle im Überblick
| Modell | Erschienen | Kontextfenster | API-Preis (Input / Output) | Am besten für |
|---|---|---|---|---|
| GPT-5.0 | Aug 7, 2025 | 400K / 128K out | $1.25 / $10 per 1M | Allgemeine Nutzung, Ausgangsbasis |
| GPT-5.1 | Nov 13, 2025 | 400K (272K in) | $1.25 / $10 per 1M | Adaptive Geschwindigkeit, Konversationsaufgaben |
| GPT-5.2 | Dec 11, 2025 | 400K (272K in) | $1.75 / $14 per 1M | Tiefes Reasoning, Coding, Recherche |
| GPT-5.3 Instant | Mar 3, 2026 | 400K | ~$0.30 / ~$1.20 per 1M | Alltägliches Schreiben, kostenbewusste Nutzung |
| GPT-5.4 | Mar 5, 2026 | 1M (API only) | $2.50 / $15 per 1M | Agentische Arbeit, Computernutzung |
| GPT-5.5 | Apr 23, 2026 | 1M (API only) | $5 / $30 per 1M (Pro: $30 / $180) | Agentisches Coding, Wissensarbeit |
| GPT-5.6 | Jul 9, 2026 | 1.05M (128K out) | Sol $5/$30, Terra $2/$12, Luna $0.20/$1.20 | Aktuelle Spitze: agentisches Coding, Wissensarbeit |
Ein Hinweis zu dieser Tabelle. Sie ist eine Geschichte der Familie, keine aktuelle Bestellliste. OpenAIs API-Preisseite listet heute nur noch gpt-5.3-codex, die GPT-5.4-Familie, GPT-5.5, GPT-5.5 Pro und die drei GPT-5.6-Stufen. GPT-5.0, 5.1, 5.2 und das Standard-GPT-5.3 sind von dieser Seite verschwunden, und die noch erreichbaren Snapshots laufen ab: gpt-5.3-chat-latest wird am 10. August 2026 abgeschaltet, und das ursprüngliche gpt-5-2025-08-07 samt Mini-, Nano- und Pro-Varianten am 11. Dezember 2026. Die Preise unten sind aufgeführt, weil sie erklären, wie sich die Familie entwickelt hat, nicht weil du alle noch kaufen könntest.
Wie diese API-Preise auf ChatGPT-Abostufen (Free, Go, Plus, Pro, Business, Enterprise) abgebildet werden, erklärt unser ChatGPT-Preisleitfaden.

GPT-5.0: Das Fundament
Erschienen: 7. August 2025
Das ursprüngliche GPT-5 war ein echter Sprung über GPT-4o, nicht nur bei rohen Benchmarks, sondern auch in der Architektur. Laut OpenAIs Launch-Ankündigung wurde es als einheitliches System gebaut, mit einem schnellen Basismodell für alltägliche Anfragen und einer tieferen Reasoning-Schicht (GPT-5 Thinking), die automatisch aktiviert wird, wenn die Anfrage es erfordert. Ein Echtzeit-Router entscheidet basierend auf Komplexität, Tool-Bedarf und Kontext, sodass du es nicht manuell steuern musst.
GPT-5.0 Benchmarks
| Benchmark | GPT-5.0 Ergebnis |
|---|---|
| AIME 2025 (Mathematik) | 94,6 % ohne Tools; 100 % mit Python-Tools (Pro) |
| GPQA Diamond (Wissenschaft auf PhD-Niveau) | 89,4 % |
| SWE-bench Verified (Coding) | 74,9 % |
| Aider Polyglot (reales Coding) | 88 % |
| Humanity's Last Exam | 42 % |
| Halluzinationen | Under 1% on open-source prompts; 1.6% on hard medical cases |
GPT-5.0 erschien mit einem Kontextfenster von 400K Input / 128K Output und war für alle ChatGPT-Nutzer verfügbar; Pro-Abonnenten erhielten erweiterten Zugang zu erweitertem Reasoning.
API-Preis: $1.25 pro 1 Mio. Input-Tokens / $10 pro 1 Mio. Output-Tokens
Was sich gegenüber GPT-4o geändert hat
GPT-5 halluzinierte mit aktivierter Websuche etwa 45 % seltener als GPT-4o. Das einheitliche Routing eliminierte den manuellen Wechsel zwischen Chat- und Reasoning-Modus, ein Reibungspunkt, den viele Nutzer mit den o-Serien-Modellen hatten.
GPT-5.1: Schneller ohne Leistungseinbußen
Erschienen: 13. November 2025
Laut OpenAIs GPT-5.1-Ankündigung war GPT-5.1 kein Fähigkeitssprung, sondern ein Effizienz-Upgrade. Das Hauptmerkmal war adaptives Reasoning, bei dem das Modell den Rechenaufwand dynamisch nach Anfragekomplexität anpasst. Stelle eine einfache Frage, und es antwortet 2 bis 3-mal schneller als das Standardmodell. Stelle eine komplexe Frage, und es wechselt in den vollständigen Reasoning-Modus. Genau dieser Reasoning-Modus erklärt auch, warum leistungsstärkere Modelle sich träge anfühlen können; unser Leitfaden darüber, warum ChatGPT so langsam ist, erklärt, wann die Wartezeit am Modell liegt und wann du selbst etwas tun kannst.
OpenAI stimmte auch den Ton wärmer und gesprächiger ab, was die steife Förmlichkeit abbaute, die GPT-5.0 gelegentlich kalt wirken ließ. Es verwendete 30 % weniger Thinking-Tokens als seine Codex-Variante, bei nahezu identischen Benchmark-Werten bei den meisten Aufgaben.
GPT-5.1 Benchmarks
| Benchmark oder Spezifikation | GPT-5.1 |
|---|---|
| AIME 2025 | 94 % (leicht unter GPT-5.0's 94,6 %) |
| GPQA Diamond | 87 % |
| MMMU (multimodal) | 85,4 % |
| SWE-Bench Verified | 76,3 % (Codex-Max-Variante: 77,9 %) |
| Kontextfenster | 400K Tokens (272K Input / 128K Output) |
| API-Preis | $1.25 pro 1 Mio. Input / $10 pro 1 Mio. Output, wie GPT-5.0 |
GPT-5.1 Varianten
OpenAI lieferte eine vollständige Familie mit GPT-5.1: Instant (schnell), Thinking (tiefes Reasoning), Auto (Routing) und Pro (Forschungsqualität), plus drei Codex-Varianten: Standard-Codex, Codex-Mini für leichte Aufgaben und Codex-Max für agentische Coding-Aufgaben über 24+ Stunden. Alle drei Codex-Snapshots verlieren am 23. Juli 2026 den API-Zugang, mit gpt-5.5 als Ersatz für Codex und Codex-Max und gpt-5.4-mini für Codex-Mini.
Was GPT-5.1 richtig gemacht hat
Der Parameter reasoning_effort (none / low / medium / high) gab Entwicklern feinkörnige Kontrolle darüber, wie viel Rechenaufwand pro Anfrage investiert wird, ein praktisches Werkzeug für die Balance zwischen Kosten und Qualität im Produktionsbetrieb.
GPT-5.2: Der Reasoning-Meilenstein
Erschienen: 11. Dezember 2025
GPT-5.2 war das Modell, das neue Maßstäbe setzte. Es war die erste KI, die 90 %+ auf ARC-AGI-1 erzielte, einem Benchmark, der speziell entwickelt wurde, um Pattern-Matching zu widerstehen und echtes Reasoning zu testen. Es erreichte auch ein perfektes 100 % bei AIME-2025-Mathematikaufgaben. Das waren keine marginalen Gewinne; sie überschritten Schwellen, die jahrelang die Grenze des Möglichen definiert hatten.
OpenAI führte mit GPT-5.2 eine Drei-Stufen-Architektur ein. GPT-5.2 Instant war auf Durchsatz optimiert, was es zur ersten Wahl für Kundensupport, Content-Erstellung und Übersetzungen machte. GPT-5.2 Thinking ergänzte konfigurierbare Reasoning-Tiefe durch Einstellungen wie Light, Medium, Heavy und xhigh, die es erlauben, Latenz gegen Genauigkeit pro Anfrage zu tauschen. GPT-5.2 Pro saß ganz oben mit maximalem Rechenaufwand und bis zu 30 Minuten dauerhafter Verarbeitung für die anspruchsvollsten Aufgaben.
GPT-5.2 Benchmarks
| Benchmark | Ergebnis |
|---|---|
| AIME 2025 | 100 % |
| GPQA Diamond (Pro) | 93,2 % |
| GPQA Diamond (Thinking) | 92,4 % |
| SWE-Bench Verified | 80,0 % |
| SWE-Bench Pro | 55,6 % |
| ARC-AGI-1 (Pro) | 90 %+ |
| ARC-AGI-2 (Pro) | 54,2 % |
| FrontierMath | 40,3 % |
GPT-5.2 lieferte 38 % weniger Fehler als GPT-5.1, der größte Zuverlässigkeitssprung in der GPT-5-Familie bisher.
Das Kontextfenster blieb bei 400K Tokens (272K Input / 128K Output), aber der API-Preis stieg auf $1.75 pro 1 Mio. Input / $14 pro 1 Mio. Output, ein Anstieg von 40 % gegenüber GPT-5.1.
Eine agentische Coding-Variante, GPT-5.2-Codex, folgte am 14. Januar 2026, speziell entwickelt für die Planung und autonome Ausführung von mehrstufigen Engineering-Aufgaben. Sie wird am 23. Juli 2026 aus der API entfernt, zusammen mit den GPT-5.0- und 5.1-Codex-Snapshots.
Hinweis: GPT-5.2 Thinking wurde am 3. Juni 2026 eingestellt. Wer es für analytische Arbeit genutzt hat, findet in GPT-5.4 Thinking, GPT-5.5 oder GPT-5.6 Sol den vorgesehenen Nachfolger.
GPT-5.3: Das Upgrade für den Alltag
Erschienen: 3. März 2026
GPT-5.3 Instant behob etwas, das frühere Modelle stillschweigend falsch gemacht hatten: den Ton. Frühere GPT-5-Versionen neigten zu übermäßigen Vorbehalten, unnötigem Absichern und dem, was Nutzer als „cringe" bezeichneten, also KI-Übervorsicht, die jede Antwort wie einen rechtlichen Haftungsausschluss wirken ließ. GPT-5.3 drehte das zurück und erzeugte direktere und natürlichere Antworten.
Es lieferte auch eine spürbare Verbesserung der Genauigkeit. Mit aktivierter Websuche erzeugt GPT-5.3 26,8 % weniger Halluzinationen als GPT-5.2 Instant. Ohne Suche beträgt die Verbesserung immer noch 19,7 %. Von Nutzern gemeldete Fehler sanken um 22,5 %.
GPT-5.3 Spezifikationen
| Spezifikation | GPT-5.3 Instant |
|---|---|
| Kontextfenster | 400K Tokens |
| HealthBench | 54,1 % (leichter Rückgang gegenüber GPT-5.2's 55,4 %) |
| Halluzinationen | 26,8 % weniger mit Websuche gegenüber GPT-5.2 |
| API-Preis | ~$0.30 pro 1 Mio. Input / ~$1.20 pro 1 Mio. Output |
Dieser Preis war ein dramatischer Rückgang gegenüber GPT-5.2's $1.75 / $14, und GPT-5.3 Instant war als hochwertiges, günstiges Alltagsmodell positioniert, nicht als Reasoning-Kraftpaket. Es erscheint nicht mehr auf OpenAIs API-Preisseite, also gilt dieser Preis nur als historischer Wert. Wer heute diese Rolle sucht, findet in GPT-5.6 Luna zu $0.20 / $1.20 den direkten Nachfolger, der seit OpenAIs Kürzung um 80 % am 30. Juli 2026 günstiger ist als GPT-5.3 Instant je war.
GPT-5.3 Kompromisse
Das Anti-Cringe-Update brachte einen Kompromiss: Die Einhaltung von Sicherheitsregeln in manchen Kategorien sank. Die Filterung grafischer Gewaltdarstellungen fiel von 85,2 % auf 78,1 % im Vergleich zu GPT-5.2, eine Entscheidung, die OpenAI offenbar bewusst getroffen hat und dabei einige Sicherheitskontrollen auf die Produktebene statt ins Modell verlagert.
Die GPT-5.3-Codex-Variante (5. Februar 2026) verdient separate Erwähnung. Sie verfügt über ein Kontextfenster von einer Million Tokens (wie GPT-5.4), läuft 25 % schneller als GPT-5.2-Codex und ist die beste Option für groß angelegtes agentisches Coding zu geringeren Kosten als 5.4 oder 5.5. Wer eine Codex-Variante lokal betreibt, sollte zuerst unseren Bericht über den Codex-Speicherfehler lesen, weil ein unkontrollierter Logger SSD-Kapazität verbrannte, bis OpenAI ihn im Juni 2026 weitgehend behoben hatte.
GPT-5.4: Die professionelle Spitze
Erschienen: 5. März 2026
GPT-5.4 hielt den Titel „leistungsfähigstes Modell, das OpenAI je veröffentlicht hat" sechs Wochen lang, bis GPT-5.5 Ende April 2026 erschien. Laut OpenAIs offizieller GPT-5.4-Ankündigung waren die zwei genuinen Neuerungen, die es von allen Vorgängermodellen abhoben, die native Computernutzung und ein Kontextfenster von einer Million Tokens (über die API).
Computernutzung bedeutet, dass GPT-5.4 direkt mit Software-Oberflächen interagieren kann: Desktops navigieren, UI-Elemente anklicken, Befehle ausführen, Ergebnisse prüfen und in einem Build-Run-Verify-Fix-Zyklus Fehler korrigieren. Auf OSWorld-Verified, dem Benchmark für Desktop-Computernutzung, erzielt es 75,0 %, was den gemessenen menschlichen Basiswert von 72,4 % übertrifft.
GPT-5.4 Benchmarks
| Benchmark | GPT-5.4 | GPT-5.2 |
|---|---|---|
| OSWorld-Verified (Computernutzung) | 75,0 % | 47,3 % |
| GDPval (Wissensarbeit, 44 Berufe) | 83,0 % | 70,9 % |
| SWE-Bench Pro (Coding) | 57,7 % | 55,6 % |
| GPQA (Wissenschaft) | 92,8 % | 93,2 % |
| ARC-AGI v2 | 73,3 % | 54,2 % |
| FrontierMath | 47,6 % | 40,3 % |
| MMMU-Pro (multimodal) | 81,2 % | – |
| BrowseComp (Webrecherche) | 82,7 % | – |
| Tabellenkalkulations-Aufgaben | 87,3 % | – |
| Halluzinationen gegenüber GPT-5.2 | 33 % weniger (einzelne Behauptungsfehler) | – |
GPT-5.4 Hauptfunktionen
Kontextfenster von einer Million Tokens (nur API). Das volle 1M-Fenster ist über die API verfügbar. ChatGPT-Plus-, Team- und Pro-Abonnenten in der Chat-Oberfläche erhalten den erweiterten Kontext nicht. Wichtig zu wissen: OpenAI berechnet den doppelten Standardpreis, sobald der Input in einer einzelnen Anfrage 272K Tokens überschreitet.
Tool-Suche. Statt alle Tool-Definitionen im Voraus zu laden, kann GPT-5.4 Tool-Definitionen bei Bedarf abrufen. Das reduziert den Token-Verbrauch in tool-intensiven Workflows um 47 %, eine praktische Kosteneinsparung für alle, die Agenten entwickeln.
Bildverarbeitung in voller Auflösung. GPT-5.4 verarbeitet Bilder bis zu 10,24 Megapixeln, was es für detaillierte medizinische Bildgebung, Architekturpläne und hochauflösende Dokumentenanalyse geeignet macht.
Kompaktierungstraining. Das Modell wird trainiert, lange Agenten-Trajektorien zu komprimieren und dabei den wesentlichen Kontext zu erhalten, nützlich für mehrtägige autonome Workflows.
GPT-5.4 Preise
| Stufe | Input pro 1 Mio. | Output pro 1 Mio. |
|---|---|---|
| Standard | $2.50 | $15.00 |
| Batch / async | $1.25 | $7.50 |
| Priority | $5.00 | $30.00 |
| GPT-5.4 Pro | $30.00 | $180.00 |
GPT-5.4 Pro ist deutlich teurer. Zum Vergleich: Anthropic's Claude Opus 4.8 kostet $5 pro 1 Mio. Input / $25 pro 1 Mio. Output, womit GPT-5.4 Pro den sechsfachen Input-Preis hat.
GPT-5.4 erscheint in drei Varianten: Standard (professionelle Alltagsnutzung), Thinking (tiefes mehrstufiges Reasoning, für Plus-/Team-/Pro-Abonnenten) und Pro (maximale Leistung).
GPT-5.5: Das bisherige Flaggschiff
Erschienen: 23. April 2026
GPT-5.5 hielt den Flaggschiff-Platz von Ende April bis zur Veröffentlichung von GPT-5.6 im Juli und ist weiterhin verfügbar. Seine schnelle Variante, GPT-5.5 Instant, ist immer noch das Standardmodell für schnelle Alltagsantworten in jedem ChatGPT-Plan, einschließlich Free. Es erschien 49 Tage nach GPT-5.4, womit es den schnellsten Flaggschiff-Wechsel in der GPT-5-Familie darstellt. Lies OpenAIs offizielle GPT-5.5-Ankündigung für das vollständige technische Briefing und unsere eigene GPT-5.5-Launch-Coverage für die vollständigen Benchmark-Tabellen und reale Tests.
Zwei Varianten werden veröffentlicht. GPT-5.5 Standard ist für alle bezahlten ChatGPT-Stufen und Codex verfügbar, und GPT-5.5 Pro ist auf Pro-, Business- und Enterprise-Stufen beschränkt. OpenAI positioniert GPT-5.5 als ein Modell, das „speziell für echte Arbeit und für den Antrieb von Agenten gebaut wurde", mit den größten Effizienzgewinnen bei agentischem Coding und langfristiger Wissensarbeit.
GPT-5.5 Benchmarks
| Benchmark | GPT-5.5 | GPT-5.5 Pro |
|---|---|---|
| Terminal-Bench 2.0 | 82,7 % | – |
| GDPval (Wissensarbeit) | 84,9 % | – |
| OSWorld-Verified (Computernutzung) | 78,7 % | – |
| SWE-Bench Pro (Coding) | 58,6 % | – |
| GPQA Diamond (Wissenschaft) | 93,6 % | – |
| BrowseComp (Webrecherche) | 84,4 % | 90,1 % |
| FrontierMath Tier 4 | 35,4 % | 39,6 % |
| Humanity's Last Exam (ohne Tools) | 41,4 % | 43,1 % |
| CyberGym | 81,8 % | – |
Gegenüber GPT-5.4 sind die herausragenden Gewinne: OSWorld-Verified (+3,7 Punkte), GPQA Diamond (+0,8), SWE-Bench Pro (+0,9) und Terminal-Bench 2.0 (+7,6). Die Zahlen unterschätzen jedoch, wie sich das Modell in der Nutzung anfühlt. OpenAI berichtet, dass bei NVIDIA Debugging-Zyklen „von Tagen auf Stunden" sanken mit GPT-5.5's agentischem Workflow, was genau die Art von realem Gewinn ist, der in einer Benchmark-Tabelle nicht auftaucht.
GPT-5.5 Hauptfunktionen
Agentisches Coding als Standard. GPT-5.5 erscheint auf mehrstufige Engineering-Workflows abgestimmt. Dasselbe Codex-Tool, das früher Aufsicht benötigte, kann jetzt apply_patch, Terminalbefehle und Verifikationsschritte über längere Zeiträume verketten, ohne den Faden zu verlieren.
Computernutzung, jetzt produktionsreif. 78,7 % auf OSWorld-Verified platziert GPT-5.5 deutlich über dem menschlichen Basiswert von 72,4 %. Desktop-Automatisierungsworkflows, die auf 5.4 noch unzuverlässig waren, werden auf 5.5 realistisch.
Geringere Halluzinationsrate. OpenAI meldet deutlich weniger Halluzinationen gegenüber GPT-5.4 bei Standard-Wissensarbeitsaufgaben, hat jedoch keine einzelne Gesamtzahl veröffentlicht.
API-Zugang folgte der App. Beim Launch war GPT-5.5 zuerst in ChatGPT und Codex live, mit API-Zugang kurz danach unter anderen Sicherheitsvorgaben als der ChatGPT-Rollout. Beide Oberflächen sind seit Monaten allgemein verfügbar.
GPT-5.5 Preise
| Stufe | Input pro 1 Mio. | Output pro 1 Mio. |
|---|---|---|
| GPT-5.5 Standard | $5.00 | $30.00 |
| GPT-5.5 Pro | $30.00 | $180.00 |
Standard kostet genau das Doppelte von GPT-5.4 Standard. GPT-5.5 Pro entspricht GPT-5.4 Pro's $30 / $180, wenn du also bereits für Pro zahlst, ist der Wechsel zu 5.5 Pro auf API-Ebene effektiv kostenlos.
GPT-5.6: Die aktuelle Spitze (Sol, Terra, Luna)
Erschienen: 9. Juli 2026 (26. Juni 2026 regierungsbeschränkte Vorschau)
GPT-5.6 ist OpenAIs neuestes und leistungsfähigstes Modell, und es ist die Version, die die Aufstellung in drei benannte Stufen statt eines „Standard plus Pro"-Splits umstrukturiert hat. Es erschien zunächst am 26. Juni als Vorschau für etwa 20 zugelassene Organisationen im Rahmen des neuen föderalen Überprüfungsregimes für Frontier-Modelle, wurde dann am 9. Juli vollständig öffentlich und ist jetzt in ChatGPTs bezahlten Stufen, Codex und der API auswählbar. Alle drei Stufen teilen ein Kontextfenster von 1,05 Mio. Tokens und 128K maximale Ausgabe.
Die drei Stufen entsprechen klar Budget und Leistung. Sol ist das Flaggschiff, auf agentisches Coding und langfristige Arbeit abgestimmt, mit einem hochaufwändigen Sol-Ultra-Modus obendrauf. Terra ist die ausgewogene Mitteloption, konkurrenzfähig mit GPT-5.5 zu 60 % weniger. Luna ist die schnellste und günstigste, ausgerichtet auf hochvolumige Alltagsnutzung. Auf Terminal-Bench 2.1, dem agentischen Coding-Benchmark, erzielt Sol 88,8 % und Sol Ultra 91,9 %, was GPT-5.5's 88,0 % auf demselben Test übertrifft.
| Stufe | Input pro 1 Mio. | Output pro 1 Mio. | Rolle |
|---|---|---|---|
| Sol (+ Sol Ultra) | $5.00 | $30.00 | Flaggschiff, agentisches Coding, schwerstes Reasoning |
| Terra | $2.00 | $12.00 | Ausgewogen, ca. GPT-5.5-Qualität zu 60 % weniger |
| Luna | $0.20 | $1.20 | Schnellste und günstigste, hochvolumige Aufgaben |
So erscheint GPT-5.6 tatsächlich in ChatGPT
Die API verkauft Sol, Terra und Luna namentlich. In ChatGPT selbst sind dieselben Modelle hinter Reasoning-Ebenen verborgen, was viele verwirrt. GPT-5.5 Instant ist immer noch der Standard für schnelle Alltagsantworten in jedem Plan, einschließlich Free. GPT-5.6 Sol treibt die Optionen Medium, High und Extra High an, und GPT-5.6 Sol Pro die Option Pro. Extra High ist der ChatGPT-seitige Name für denselben maximalen Aufwandsmodus, den OpenAI in Benchmarks als Sol Ultra bezeichnet.
| ChatGPT-Plan | Medium und High | Extra High | Pro |
|---|---|---|---|
| Free und Go | Nicht enthalten | Nicht enthalten | Nicht enthalten |
| Plus | Enthalten | Nicht enthalten | Nicht enthalten |
| Pro | Enthalten | Enthalten | Enthalten |
| Business | Enthalten | Enthalten | Enthalten |
| Enterprise | Enthalten | Enthalten | Enthalten |
Zwei Konsequenzen sind wichtig, bevor du für irgendetwas zahlst. Terra und Luna sind in einer normalen ChatGPT-Unterhaltung überhaupt nicht auswählbar; sie tauchen nur in Work, Codex und der API auf. Work und Codex sind in jedem Plan der ChatGPT-Desktop-App verfügbar, wo Free- und Go-Nutzer Terra erhalten und bezahlte Pläne alle drei wählen können; im Web und auf Mobilgeräten wurde Work nur für bezahlte Pläne gestartet. Und wenn du dein GPT-5.6-Reasoning-Kontingent aufbrauchst, wechselt ChatGPT still zu GPT-5.4 Thinking mini statt dich abzuschneiden, also prüf vor einer langen analytischen Antwort, welches Modell geantwortet hat.
Diese Preise sind die Kurzkontext-Tarife. Überschreitet eine einzelne Anfrage OpenAIs Langkontext-Schwelle, berechnet OpenAI die gesamte Anfrage zu 2-fachem Input und 1,5-fachem Output, womit Sol auf $10 / $45, Terra auf $4 / $18 und Luna auf $0.40 / $1.80 steigt. Plane die Stufe ein, die du tatsächlich erreichen wirst.
Ein Hinweis ist erwähnenswert: OpenAI hat keine GPT-5.6-Zahlen für die Standard-Benchmarks veröffentlicht, die bei früheren Modellen verwendet wurden (keine SWE-bench Verified-, GPQA- oder OSWorld-Werte für Sol bisher), und der unabhängige Bewerter METR stellte fest, dass die Familie ungewöhnlich gut bei Benchmark-ähnlichen Aufgaben ist, also sollte man den Terminal-Bench-Vorsprung als einen einzelnen Datenpunkt und nicht als vollständiges Bild behandeln. Für die vollständige Aufschlüsselung der Stufen, Benchmarks und des Rollouts, siehe unseren GPT-5.6 Sol, Terra und Luna-Erklärer. Sobald du eine Stufe ausgewählt hast, erklärt unser GPT-5.6-Prompting-Leitfaden sieben Tipps für schärfere Antworten.
Was OpenAI am 23. Juli 2026 einstellt
Sieben Versionen in elf Monaten hinterlassen Altlasten, und OpenAI räumt diese jetzt auf. Am 23. Juli 2026 verlieren 15 Modell-Snapshots in einer einzigen Welle den API-Zugang, angekündigt schon am 22. April unter dem Titel „Legacy GPT model snapshots." OpenAIs Begründung ist einfach: Zuverlässigkeit verbessern und die Auswahl des richtigen Modells erleichtern.
Lies den Umfang sorgfältig durch, bevor du dich sorgst. Das ist eine reine API-Abschaltung und entfernt nichts aus der ChatGPT-Modellauswahl. Wer ChatGPT über die App oder das Web nutzt, dem ändert sich am 23. Juli nichts. Wer die API direkt aufruft oder ein Tool betreibt, das einen bestimmten Modell-Snapshot anheftet, für den gilt diese harte Frist.
Die Codex-Snapshots erleiden den größten Einschnitt
Fünf Codex-Snapshots vor 5.3 werden gemeinsam eingestellt, was dies zum bisher größten einzelnen Einschnitt in die Codex-Aufstellung macht. Die beiden chat-latest-Aliase werden am selben Tag eingestellt, ebenso wie beide Deep-Research-Snapshots und die ursprüngliche Computer-Use-Vorschau. Die folgende Tabelle zeigt die Einträge, die am häufigsten in einer GPT-5-era-Codebasis vorkommen dürften.
| Eingestellt am 23. Juli 2026 | OpenAIs Ersatz |
|---|---|
gpt-5-codex |
gpt-5.5 |
gpt-5.1-codex |
gpt-5.5 |
gpt-5.1-codex-max |
gpt-5.5 |
gpt-5.1-codex-mini |
gpt-5.4-mini |
gpt-5.2-codex |
gpt-5.5 |
gpt-5-chat-latest |
gpt-5.5 |
gpt-5.1-chat-latest |
gpt-5.5 |
o3-deep-research-2025-06-26 |
gpt-5.5-pro |
o4-mini-deep-research-2025-06-26 |
gpt-5.5-pro |
computer-use-preview-2025-03-11 |
gpt-5.4-mini |
Die verbleibenden fünf sind GPT-4o-Relikte statt GPT-5-Modelle, darunter das Search-Preview-Paar, ein Text-to-Speech-Snapshot sowie veraltete Audio- und Realtime-Mini-Snapshots. Beachte, was nicht auf der Liste steht. GPT-5.3-Codex überlebt, was wichtig ist, da er ein Kontextfenster von 1 Mio. Tokens mitbringt und die günstigere Option für groß angelegtes agentisches Arbeiten mit großen Codebasen bleibt. GPT-5.4, GPT-5.5 und GPT-5.5 Pro bleiben ebenfalls im Verkauf.
Die größere Welle kommt im Oktober
Der 23. Juli ist der kleinere der beiden Fristen. Am 23. Oktober 2026 stellt OpenAI eine viel bekanntere Gruppe ein, darunter gpt-3.5-turbo-0125, gpt-4-0613, gpt-4-turbo, gpt-4o-2024-05-13, o1, o1-pro, o3-mini, o4-mini und das ursprüngliche gpt-image-1, zusammen mit feinabgestimmten Modellen auf Basis von GPT-3.5 Turbo und GPT-4. Wer noch ein Fine-Tune auf diesen Basismodellen betreibt, hat drei Monate Zeit zum Neutrainieren, was der Teil ist, den die meisten Teams unterschätzen. Eine dritte Welle folgt am 11. Dezember 2026 und nimmt die ursprünglichen GPT-5-Snapshots mit, gpt-5-2025-08-07 plus Mini-, Nano- und Pro-Varianten, zusammen mit o3 und o3-pro. Separat laufen die Videos API und alle Sora-2-Snapshots am 24. September 2026 aus. Alle Fristen lassen sich auf OpenAIs Deprecations-Seite verfolgen.
Welches ChatGPT-Modell solltest du nutzen?
Die richtige Wahl hängt vollständig vom Einsatzgebiet ab, von günstigem Alltagschat bis hin zu erstklassigem Reasoning und Coding, und die folgende Tabelle zeigt, welches Modell am besten zu welcher Aufgabe passt. Wer stattdessen Googles Aufstellung abwägt: Unser Gemini-Modellvergleich macht dieselbe versionsweise Aufschlüsselung für Flash, Pro und Flash-Lite.
| Aufgabe | Bestes Modell | Warum |
|---|---|---|
| Alltägliches Schreiben, E-Mails, Zusammenfassungen | GPT-5.6 Luna | Günstigste aktuelle Frontier-Stufe zu $0.20 / $1.20 |
| Hochvolumige API (Kosten entscheidend) | GPT-5.4-nano oder GPT-5.6 Luna | Luna ($0.20 / $1.20) entspricht jetzt Nano beim Input und unterbietet es beim Output, mit Frontier-Qualität obendrein |
| Tiefes analytisches Reasoning | GPT-5.6 Sol (oder Sol Ultra) | Neuestes Flaggschiff, beste agentische Coding-Werte |
| Komplexes Coding, Fehlersuche | GPT-5.6 Sol | 88,8 % Terminal-Bench 2.1, der höchste in der Familie |
| Agentische, mehrstufige Automatisierung | GPT-5.6 Sol | Beste agentische Coding-Leistung bisher |
| Computernutzung / Desktop-Automatisierung | GPT-5.5 | 78,7 % OSWorld-Verified (noch kein 5.6-Wert veröffentlicht) |
| Lange Dokumentenanalyse (1 Mio.+ Tokens) | GPT-5.6 oder GPT-5.5 (API) | Beide bieten ein 1 Mio.+ Kontextfenster |
| Enterprise / maximale Genauigkeit | GPT-5.6 Sol Ultra | Höchster Aufwandsmodus, 91,9 % Terminal-Bench 2.1 |
| Ausgewogene Qualität zu niedrigeren Kosten | GPT-5.6 Terra | Ca. GPT-5.5-Qualität zu 60 % weniger ($2 / $12) |
Für einen breiteren Vergleich einschließlich Claude, Gemini und anderen führenden Modellen, siehe unseren Hub der besten KI-Modelle. Für einen direkten Vergleich zwischen OpenAI und Anthropic, schau unseren Claude-vs-ChatGPT-Vergleich an. Für Googles Seite, lies unsere Gemini-3.5-Rezension und Pro-Launch-Tracker. Und wer lieber spricht als tippt: Unser ChatGPT-Live-Voice-Leitfaden erklärt OpenAIs neuen Echtzeit-GPT-Live.
Ausblick: Was ist ChatGPT 6?
Stand Juli 2026 wurde ChatGPT 6 noch nicht veröffentlicht. Was wir wissen, basiert auf bestätigten Aussagen von Sam Altman und unterstützenden Signalen aus OpenAIs Forschungs- und Infrastrukturinvestitionen. Altman hat bestätigt, dass GPT-6 früher erscheinen wird als der 2,5-Jahres-Abstand zwischen GPT-4 und GPT-5. Mit GPT-5.6 bereits veröffentlicht und noch keiner GPT-6-Ankündigung gilt ein Launch Ende 2026, möglicherweise bis in 2027 verschoben, als die am häufigsten genannte Schätzung.
Was GPT-6 voraussichtlich bringen wird
Persistentes Gedächtnis. Statt mit jedem Gespräch neu zu beginnen, soll GPT-6 Kontext über Wochen oder Monate hinweg erhalten. Es wird vergangene Diskussionen, Präferenzen und deinen Arbeitsstil referenzieren und sich so weniger wie eine Suchmaschine anfühlen und mehr wie ein Mitarbeiter, der dich wirklich kennt.
Echte Autonomie. GPT-5 verbesserte Reasoning und reduzierte Fehler. GPT-6's entscheidende Verschiebung soll Eigenständigkeit sein: mehrstufige reale Aufgaben in Browsern, Apps und Unternehmenssystemen ohne ständige menschliche Eingriffe ausführen. GPT-5.4 führte Computernutzung als Grundlage ein, GPT-5.5 machte sie produktionsreif, und GPT-6 soll das zum Kernbetriebsmodus machen.
Anpassbares Verhalten. Altman hat angedeutet, dass Nutzer mehr Kontrolle darüber erhalten, wie GPT-6 antwortet, auch bei meinungsabhängigen Themen. Der Standard-Standpunkt des Modells zu hinterfragen soll tatsächlich einstellbar werden.
Potenzielles Selbstlernen. Es gibt unbestätigte Spekulationen über persistente Gewichtsaktualisierungen, bei denen das Modell sitzungsübergreifend lernt statt nur innerhalb einer Sitzung. OpenAI hat nicht bestätigt, dass dies Teil von GPT-6's Design ist.
Alle bestätigten Details, erwarteten Funktionen und die neuesten Leaks haben wir in unserem vollständigen ChatGPT-6-Leitfaden zusammengefasst.
Benchmark-Entwicklung in der GPT-5-Familie
| Benchmark | GPT-5.0 | GPT-5.1 | GPT-5.2 | GPT-5.3 | GPT-5.4 | GPT-5.5 |
|---|---|---|---|---|---|---|
| AIME 2025 (Mathematik) | 94,6 % | 94 % | 100 % | – | 100 % | – |
| GPQA Diamond | 89,4 % | ~87 % | 93,2 % | – | 92,8 % | 93,6 % |
| SWE-Bench Verified | 74,9 % | 76,3 % | 80,0 % | – | ~52,8 %* | – |
| SWE-Bench Pro | – | – | 55,6 % | – | 57,7 % | 58,6 % |
| ARC-AGI-1 | – | – | 86,2 % | – | 93,7 % | – |
| ARC-AGI-2 | – | 17,6 % | 54,2 % | – | 73,3 % | – |
| FrontierMath (T1–3) | 26,6 % | – | 40,3 % | – | 47,6 % | – |
| FrontierMath (T4) | – | – | – | – | 27,1 % | 35,4 % (Pro 39,6 %) |
| MMMU | 84,2 % | 85,4 % | – | – | 84,2 % | – |
| MMMU-Pro | – | – | 86,5 % | – | 81,2 % | – |
| HealthBench Hard | 46,2 % | – | 55,4 % | 54,1 % | 62,6 % | – |
| GDPval (Wissensarbeit) | – | – | 70,9 % | – | 83,0 % | 84,9 % |
| OSWorld (Computernutzung) | – | – | 47,3 % | – | 75,0 % | 78,7 % |
| BrowseComp | – | – | 65,8 % | – | 82,7 % | 84,4 % (Pro 90,1 %) |
| Terminal-Bench 2.0 | – | 58,1 % | 64,9 % | – | 75,1 % | 82,7 % |
| Tabellenkalkulations-Modellierung | – | – | 68,4 % | – | 87,3 % | – |
| HLE (Humanity's Last Exam) | 42 % | – | – | – | 52,1 % | 41,4 % (ohne Tools) |
| LiveCodeBench | – | – | – | – | 72,5 % | – |
| Aider Polyglot | 88 % | – | – | – | – | – |
| CyberGym | – | – | – | – | – | 81,8 % |
| Halluzinationsreduktion | -45 % vs GPT-4o | – | -38 % vs 5.1 | -26,8 % vs 5.2 | -33 % vs 5.2 | niedriger als 5.4 (noch keine Einzelzahl) |
Der SWE-Bench-Verified-Wert von GPT-5.4 stammt von einer Nicht-Thinking-Variante; OpenAI hat keine offizielle Zahl für diesen Benchmark veröffentlicht. Die Humanity's-Last-Exam-Zahlen sind nicht direkt vergleichbar: GPT-5.5's 41,4 % ist die Zahl ohne Tools; GPT-5.4's 52,1 % ist mit Tools.
Die Tabelle endet bei GPT-5.5 mit Absicht. Stand Juli 2026 ist der einzige Benchmark, den OpenAI für GPT-5.6 veröffentlicht hat, Terminal-Bench 2.1, wo Sol 88,8 % und Sol Ultra 91,9 % erzielt. Das Unternehmen hat noch keine vergleichbaren GPQA-, OSWorld-, SWE-Bench- oder FrontierMath-Zahlen für die neue Familie veröffentlicht, sodass GPT-5.6 in die älteren Zeilen einzuordnen bedeuten würde zu raten. Man darf erwarten, dass diese Tabelle vollständiger wird, sobald die vollständige Modellkarte erscheint.
Jede GPT-5-Variante plus Claude, Gemini und Grok in einer Mac-App?
Wenn du für ChatGPT, Claude Pro und Google AI Pro zahlst, nur um Modellausgaben zu vergleichen, gibt es ein einfacheres Setup. Fello AI ist eine native Mac-App, die deine Prompts über eine einzige Oberfläche zu ChatGPT, Claude, Gemini, Grok und DeepSeek leitet, für $9.99/Monat. Ein Preis, alle Top-Modelle, kein Tab-Wechsel.
Das ist wichtig in einer Welt, in der OpenAI alle sechs Wochen eine neue GPT-5-Variante veröffentlicht und jede direkt mit Veröffentlichungen von Anthropic, Google und xAI konkurriert. Wenn GPT-5.6 heute beim agentischen Coding führt, Claude oder Gemini aber nächsten Monat bei einer bestimmten Aufgabe vorne liegt, kannst du innerhalb derselben App das Modell wechseln, ohne deinen Workflow zu ändern.
Du kannst Fello AI im App Store herunterladen und alle diese Modelle nebeneinander auf Mac, iPhone und iPad nutzen, für $9.99/Monat. Es funktioniert als Alternative zu drei separaten Abonnements oder als Ergänzung zu dem, das du bereits hast, und verarbeitet Bilder, Dokumente und Tabellen, nicht nur Chat.
Zum Thema persistentes Gedächtnis, lies Anthropic's neues Agenten-Gedächtnissystem.
Praktische Tipps zu effektiver ChatGPT-Nutzung findest du in unserem vollständigen Leitfaden.
Fazit
Die GPT-5-Familie hat sich schnell entwickelt. In elf Monaten ist OpenAI von einem leistungsfähigen Allzweckmodell zu einem übergegangen, das Software wie ein Mensch bedient, eine komplette Codebasis im Kontext hält und Branchenprofis bei Wissensarbeits-Benchmarks in 44 Berufen übertrifft. GPT-5.5 machte mehrstufige agentische Coding-Workflows ohne menschliche Aufsicht möglich, und GPT-5.6's Sol-Stufe führt die Familie jetzt genau bei dieser Arbeit an.
Für die meisten Nutzer ist die Alltagswahl jetzt GPT-5.6 Luna, das Frontier-Qualität auf $0.20 / $1.20 pro 1 Mio. Tokens senkt, was seit dem Schnitt vom 30. Juli 2026 dem alten GPT-5.4-nano beim Input entspricht und es beim Output schlägt. Für professionelle Workflows, die agentisches Coding, ein 1-Mio.-Token-Kontextfenster oder maximale Reasoning-Tiefe brauchen, ist GPT-5.6 Sol jetzt die erste Wahl, mit GPT-5.5 als solider Rückfallposition. Und wenn die Aufgabe ganz und gar nicht ChatGPTs Stärke ist, zeigt unser Leitfaden zu welche KI wann zu nutzen, welches Modell du stattdessen öffnen solltest. Wer etwas entwickelt, das noch in 12 Monaten laufen soll: Behalte ChatGPT 6 im Blick, die Verschiebung vom Werkzeug zum autonomen Mitarbeiter kommt.
FAQ
Was ist das neueste ChatGPT-Modell im Jahr 2026?
GPT-5.6, öffentlich gemacht am 9. Juli 2026. Es erscheint in drei Stufen: Sol (Flaggschiff), Terra (ausgewogen) und Luna (günstigste) und ist in ChatGPTs bezahlten Stufen, Codex und der API auswählbar. Sol erzielt 88,8 % auf Terminal-Bench 2.1 (91,9 % im Sol-Ultra-Modus) und alle drei Stufen teilen ein Kontextfenster von 1,05 Mio. Tokens. GPT-5.5 bleibt als vorheriges Flaggschiff verfügbar.
Was ist der Unterschied zwischen GPT-5.4 und GPT-5.5?
GPT-5.5 übertrifft GPT-5.4 bei jedem Frontier-Benchmark, besonders bei Terminal-Bench 2.0 (82,7 % vs. 75,1 %), OSWorld-Verified (78,7 % vs. 75,0 %) und SWE-Bench Pro (58,6 % vs. 57,7 %). Der Kompromiss ist der Preis: GPT-5.5 Standard kostet $5 / $30 pro 1 Mio. Tokens, doppelt so viel wie GPT-5.4's $2.50 / $15. GPT-5.5 Pro entspricht beim Preis GPT-5.4 Pro mit $30 / $180.
Was ist der Unterschied zwischen GPT-5.3 und GPT-5.5?
GPT-5.5 fügt native Computernutzung, ein Kontextfenster von 1 Mio. Tokens und deutlich stärkeres Reasoning und agentisches Coding hinzu. GPT-5.3 Instant war mit etwa $0.30 / $1.20 dramatisch günstiger, wird aber nicht mehr über die API verkauft, sodass das aktuelle Budget-Äquivalent GPT-5.6 Luna zu $0.20 / $1.20 ist, das seit dem Schnitt vom 30. Juli 2026 weniger kostet als das alte GPT-5.4-nano zu $0.20 / $1.25.
Ist GPT-5.5 den Preis wert?
Für agentische Workflows, Computernutzung und professionelles Coding: ja, obwohl GPT-5.6 Sol jetzt denselben Preis von $5 / $30 hat und beim agentischen Coding besser abschneidet, womit Sol bei diesem Preis die bessere Wahl ist. Für Standard-Schreiben und Chat deckt GPT-5.6 Luna zu $0.20 / $1.20 die Aufgabe für ein Fünfundzwanzigstel des Preises ab. Nutze die günstige Stufe standardmäßig und greife nur zum Flaggschiff, wenn die Aufgabe es wirklich erfordert.
Wann kommt ChatGPT 6 heraus?
Kein offizielles Datum. Mit GPT-5.6 bereits öffentlich und noch keiner GPT-6-Ankündigung gilt Ende 2026 oder bis in 2027 als häufigste Schätzung. Sam Altman hat bestätigt, dass es früher kommen wird als der Abstand zwischen GPT-4 und GPT-5.
Welche ChatGPT-Modelle werden 2026 eingestellt?
Fünfzehn ältere Snapshots verlieren am 23. Juli 2026 den API-Zugang, darunter fünf Codex-Snapshots (gpt-5-codex, gpt-5.1-codex, gpt-5.1-codex-max, gpt-5.1-codex-mini, gpt-5.2-codex), beide chat-latest-Aliase, beide Deep-Research-Snapshots und die ursprüngliche Computer-Use-Vorschau. Eine größere Welle folgt am 23. Oktober 2026 mit GPT-3.5 Turbo, GPT-4, GPT-4 Turbo, o1, o3-mini, o4-mini und gpt-image-1, dann eine dritte am 11. Dezember 2026 mit den ursprünglichen GPT-5-Snapshots, o3 und o3-pro. Alle drei betreffen nur die API; die ChatGPT-Modellauswahl bleibt unberührt.
Welches ChatGPT-Modell ist am besten für Coding?
GPT-5.6 Sol ist die erste Wahl für agentische, mehrstufige Engineering-Aufgaben, mit Sol-Ultra-Modus für die schwersten Probleme (88,8 % und 91,9 % auf Terminal-Bench 2.1). GPT-5.5 und GPT-5.5 Pro bleiben starke Alternativen, und GPT-5.3-Codex ist immer noch eine solide günstigere Option für Arbeit mit großen Codebasen dank seines 1-Mio.-Kontextfensters.