Nach wochenlangen Leaks und LM-Arena-Sichtungen hat OpenAI ChatGPT Images 2.0 am 21. April 2026 veröffentlicht. Das zugrundeliegende Modell, gpt-image-2, ist in ChatGPT, in Codex und in der API live. Wenn dir Kosten mehr als rohe Leistung wichtig sind, schau dir die besten kostenlosen KI-Bildgeneratoren an.
Das ist das erste OpenAI-Bildmodell mit eingebautem Reasoning, das erste, das dichten Text auf Japanisch, Koreanisch, Chinesisch, Hindi und Bengali rendern kann, und das erste, das vor dem Zeichnen eines einzigen Pixels im Web suchen kann. Es hebt die KI-Bildgenerierung auch über die „Inspirationsboard"-Phase hinaus – hin zu etwas, das du direkt als Produktionsasset nutzen kannst.
Was wirklich neu ist
ChatGPT Images 2.0 ersetzt die GPT-4o-Bildpipeline, die ChatGPT im vergangenen Jahr angetrieben hat. Der Wissensstand liegt bei Dezember 2025, sodass das Modell aktuelle Markenlogos, Produktdesigns, geografische Karten und aktuelle Kulturverweise korrekt rendert – Dinge, bei denen das alte Modell halluzinierte oder in einer Version von 2024 steckenblieb.
OpenAI bezeichnet es als interaktive Kreativ-Engine statt als einmaligen Generator. Diese Einordnung ist wichtig: Reasoning, Websuche und Bildgenerierung laufen jetzt in einer einzigen Schleife. Das Modell kann seine Ausgabe in mehreren Durchläufen innerhalb derselben Anfrage verfeinern, statt dich zum Neugenerieren von vorn zu zwingen.
Konkrete Verbesserungen:
- Bis zu 2K-Auflösung (2.048 Pixel Breite) pro Ausgabe
- Seitenverhältnisse von 3:1 bis 1:3, stufenlos statt fester Voreinstellungen
- Bis zu 8 konsistente Bilder aus einem Prompt mit gemeinsamen Charakteren, Beleuchtung und Stil
- Funktionierende QR-Codes, die mit jeder Handykamera scannen
- Websuche während der Generierung
- Selbstprüfung vor der Ausgabe
- Transparente Hintergrundexporte für die direkte Pipeline-Integration
- Scharfer Kleintext, UI-Elemente, Ikonografie und dichte Kompositionen
Die LM-Arena-Codenamen „maskingtape" und „gaffertape" erwiesen sich als frühe Testvarianten. „Duct tape" war die Instant-Variante. „Packingtape" war der Thinking-Mode-Build.
Warum Textrendering das schwierige Problem war
Drei Jahre lang haben alle großen Bildmodelle Text als eine Art Textur behandelt. Das Modell lernte, dass „Buchstaben so aussehen", ohne zu verstehen, was bestimmte Wörter als Glyphen bedeuten. Deshalb erzeugten GPT-4o, Midjourney V7 und DALL-E 3 Poster mit verworren wirkendem „WELCOOMM"-Text statt „WELCOME" und deshalb brachen dichte Layouts (Speisekarten, Infografiken, Verpackungen) in Unsinn zusammen.

ChatGPT Images 2.0 behandelt Text als erstklassiges Element. Tester prüften das Modell anhand von Speisekarten, Konferenzbadges, Produktverpackungen und redaktionellen Layouts. Das Modell hält Typografie, Laufweite, Hierarchie und Rechtschreibung ein. Überschriften bleiben in 2K scharf. Kleine Bildunterschriften sind lesbar. Artikelnummern, Datumsangaben, Preise und Labels folgen dem Prompt, statt in plausibel aussehenden Unsinn korrigiert zu werden.
Das ist die Veränderung, die KI-Bildgenerierung von „gut genug für ein Mood Board" zu „gut genug für das eigentliche Deliverable" macht.

Thinking Mode
ChatGPT Images 2.0 kommt in zwei Modi.
Instant Mode generiert schnell und priorisiert Geschwindigkeit. Er enthält alle Textrendering- und Mehrsprachigkeitsverbesserungen. Das ist, was alle Nutzer standardmäßig erhalten.
Thinking Mode fügt vor der Generierung einen Reasoning-Durchlauf hinzu. Das Modell kann im Web suchen, hochgeladene Materialien analysieren (PDFs, Screenshots, Brand Guidelines), das Layout vor dem Zeichnen durchdenken, bis zu 8 konsistente Ausgaben generieren und seine eigenen Ergebnisse gegenchecken, bevor es sie zurückgibt. Bei einem komplexen Prompt kann das bis zu zwei Minuten dauern, während Instant Mode in Sekunden antwortet.
Das ist es, was die seitenlangen Manga-Sequenzen, Multi-Frame-Storyboards und vollständigen Infografiken ermöglicht, die seit dem Launch soziale Medien fluten. Der Reasoning-Durchlauf ist auch der Grund, warum ein einzelner Prompt wie „Erstelle eine 4-Folien-Präsentation zur Quantentunnelung" tatsächlich 4 zusammenhängende Folien mit konsistenter Designsprache erzeugt – statt 4 unzusammenhängenden Bildern, die zufällig dasselbe Thema teilen.

Der Thinking Mode ist der Teil des Launches, den niemand so wirklich kommen sah. Es ist im Grunde ein Reasoning-Modell mit einem Pinsel.
Funktionierende QR-Codes und warum sie wichtig sind
QR-Codes wirken wie ein Zaubertrick, bis du verstehst, was sie beweisen. Ein QR-Code ist eine präzise mathematische Kodierung. Ein falsches Quadrat und der Code lässt sich nicht scannen. Jedes bisherige Bildmodell erzeugte QR-Code-ähnliche Bilder, die nicht wirklich funktionierten.
ChatGPT Images 2.0 generiert funktionierende QR-Codes, weil der Thinking-Mode-Reasoning-Durchlauf die Kodierung tatsächlich berechnet, bevor er sie zeichnet. Das Modell kann den QR außerdem mit Markenfarben gestalten, ein Logo in der Mitte einbetten und ihn in ein vollständig gestaltetes Poster integrieren. Für Marketing-Teams, die bisher einen QR-Generator, einen Designer und ein Layout-Tool brauchten, um ein einzelnes Werbemittel zu erstellen, kollabiert das drei Schritte in einen Prompt.
Es zeigt auch, wozu die Architektur über Bilder hinaus fähig ist. Alles, was Präzision statt Gefühl erfordert – wissenschaftliche Diagramme, technische Schemata, genaue Karten – wird damit machbar.
Auflösung und Seitenverhältnisse
| Spec | GPT Image 1 (GPT-4o) | ChatGPT Images 2.0 |
|---|---|---|
| Max resolution | 1024 x 1024 | 2048 x 2048 (2K) |
| Aspect ratios | 1:1, 2:3, 3:2 | 3:1 to 1:3 (continuous) |
| Images per prompt | 1 | Up to 8 |
| Web access | No | Yes (thinking) |
| Self-verification | No | Yes (thinking) |
| Knowledge cutoff | October 2024 | December 2025 |
| Transparent backgrounds | Limited | Yes |
Der Bereich von 3:1 bis 1:3 deckt breite Banner, Slides, Poster, Stories, Thumbnails und TikTok-Vertikale ab – alles aus demselben Modell, ohne Upscaling oder Zuschneiden. Das beseitigt den umständlichen Workflow „Quadrat generieren, in Photoshop zuschneiden, halbe Komposition verlieren", der seit DALL-E 2 Standard war.

Mehrsprachiger Text
OpenAI hob explizit Japanisch, Koreanisch, Chinesisch, Hindi und Bengali als Sprachen mit signifikanten Verbesserungen hervor. Tester prüften das Ergebnis – der Text liest sich nativ, nicht wie das Zeichengewirr, das jedes bisherige Bildmodell produzierte.
Die tiefere Veränderung ist die Handhabung gemischter Schriften. Das Modell kann ein japanisches Poster mit lateinischen Produktnamen rendern, eine arabische Restaurantspeisekarte mit westlichen Preisen oder einen chinesischen Filmuntertitel über einem englischen Titel. Gemischte Schriftlayouts waren in jedem kommerziellen Bildmodell bis jetzt kaputt.



Für Nicht-englische Märkte ist das das erste KI-Bildmodell, das für Produktionsarbeiten außerhalb des lateinischen Alphabets nutzbar ist. Bengali-, Hindi- und Devanagari-Typografie war in DALL-E 3 und Midjourney praktisch unbrauchbar.


Preise und API
Die gpt-image-2-API ist live. Die Preisgestaltung ist tokenbasiert:
| Token Type | Price |
|---|---|
| Image input tokens | $8 per million |
| Image output tokens | $30 per million |
Die endgültigen Kosten pro Bild hängen von Qualitätsstufe und Auflösung ab. Schätzungen pro Bild bei Standard 1024 x 1024:
| Quality Tier | Cost per Image |
|---|---|
| Low | ~$0.006 |
| Medium | ~$0.053 |
| High | ~$0.211 |
2K-Ausgaben kosten proportional mehr durch die zusätzlichen Tokens. Es gibt zwei API-Oberflächen: die Image API (Modell-ID gpt-image-2) für einmalige Generierung und Bearbeitung sowie die Responses API mit Bildgenerierung als eingebautem Tool. Entwickler, die möchten, dass ihre App der Produktionsversion von ChatGPT folgt, können den Alias chatgpt-image-latest verwenden, der sich automatisch aktualisiert.
Einige API-Accounts benötigen eine OpenAI-Organisationsverifizierung, bevor die Endpunkte aufrufbar werden.
Verfügbarkeit nach Plan
| User Tier | Standard | Thinking Mode |
|---|---|---|
| Free ChatGPT | Yes | No |
| ChatGPT Plus | Yes | Yes |
| ChatGPT Pro | Yes | Yes (highest limits) |
| ChatGPT Business | Yes | Yes |
| ChatGPT Enterprise | Yes | Yes |
| Codex users | Yes | Yes |
| API (gpt-image-2) | Yes | Yes |
Der Mobile-Rollout läuft über das neueste ChatGPT-App-Update. DALL-E bleibt innerhalb von ChatGPT verfügbar, ist jetzt aber als sekundäre Option für Nutzer mit bestehenden Prompt-Bibliotheken oder spezifischen stilistischen Anforderungen positioniert, bei denen DALL-E punktet.
Der Vergleich
Praxisberichte von VentureBeat, TechCrunch und TechRadar stellen es wie folgt gegen die Konkurrenz:
| Capability | ChatGPT Images 2.0 | Midjourney V8 | Nano Banana Pro | Flux 2 |
|---|---|---|---|---|
| Photorealism | Excellent | Excellent | Very good | Excellent |
| Text rendering | Best in class | Good | Very good | Good |
| Multilingual text | Best in class | Limited | Good | Limited |
| Reasoning before generation | Yes | No | No | No |
| Web search | Yes | No | No | No |
| Multi-image consistency | Up to 8 | Limited | Up to 4 | Limited |
| Max resolution | 2K | 2K (upscaled) | ~1.5K | 2K |
| API access | Yes | No | Yes | Yes |
ChatGPT Images 2.0 führt bei Textgenauigkeit, mehrsprachiger Unterstützung und Reasoning-Workflows. Midjourney hat bei bestimmten stilisierten Ästhetiken noch einen Vorsprung, vor allem bei malerischen und illustrativen Arbeiten, wo sein älteres, präferenz-getuentes Dataset zeigt. Nano Banana Pro liegt bei Fotorealismus näher als erwartet und gewinnt nach wie vor in puncto Rohgeschwindigkeit. Flux bleibt die stärkste open-source-Option für Teams, die selbst hosten müssen. Wenn du dir bei einem Ergebnis nicht sicher bist, ob es echt ist, findest du hier, wie du erkennst, ob ein Bild KI-generiert ist.




Die Image-Arena-Zahlen
Einen Tag nach dem Launch veröffentlichte Arena.ai die Leaderboard-Ergebnisse – und sie sind eindeutig. GPT-Image-2 belegte Platz 1 in jeder Image-Arena-Kategorie mit den größten Abständen, die auf der Plattform je verzeichnet wurden:
| Category | GPT-Image-2 Score | Lead Over #2 |
|---|---|---|
| Text-to-Image (overall) | 1512 | +242 over Nano-banana-2 |
| Single-Image Edit | 1513 | +125 over Nano-banana-pro |
| Multi-Image Edit | 1464 | +90 over Nano-banana-2 |
Der Vorsprung von +242 Punkten in Text-to-Image ist der größte Abstand, den Arena je verzeichnet hat. Zum Vergleich: Modell-Upgrades bewegen das Leaderboard typischerweise 30 bis 60 Punkte.
GPT-Image-2 gewann außerdem alle 7 Text-to-Image-Unterkategorien und schlug seinen eigenen Vorgänger GPT-Image-1.5 mit großem Abstand:
- Product, Branding & Commercial Design: +277 Punkte
- 3D Imaging & Modeling: +274 Punkte
- Cartoon, Anime & Fantasy: +296 Punkte
- Photorealistic & Cinematic Imagery: +247 Punkte
- Art: +197 Punkte
- Portraits: +296 Punkte
- Text Rendering: +316 Punkte
Der Sprung von +316 Punkten bei Text Rendering ist die Headline-Zahl und bestätigt, was Tester anekdotisch berichteten. Das Modell hat Text nicht nur verbessert. Es hat die gesamte Obergrenze angehoben.
Modelle, gegen die es durchgehend gewann: Nano-banana-2, Nano-Banana-Pro-Varianten, MAI-Image-2, Reve-V1.5 und Grok-Imagine-Image.
Was es noch nicht kann
Nicht alles ist gelöst. Tester verzeichneten einige Schwachstellen:
- Bereichsselektive Bearbeitungen sind ungenau. Wenn du einen bestimmten Bereich maskierst und eine Änderung anforderst, kann die Bearbeitung über die Maske hinausbluten. Für Präzisionsarbeit ist ein schriftlicher Prompt, der beschreibt, was geändert werden soll, aktuell zuverlässiger als eine räumliche Selektion.
- Thinking Mode ist langsam. Zwei Minuten für einen komplexen Prompt sind für Produktionsarbeit in Ordnung, töten aber das Modell für Casual Exploration. Die meisten Nutzer bleiben für alltägliche Prompts im Instant Mode.
- Stark stilisierte Illustrationen. Midjourneys malerische Ästhetik hat für redaktionelle Illustrationen und Buchcover noch einen Vorsprung, wo Stimmung mehr zählt als Genauigkeit.
- Live-Video und Animation. Das ist ein Standbild-Modell. Sora behandelt Bewegtbild separat.
- Konsistenz des Markenauftritts über lange Sessions. Acht Bilder aus einem Prompt sind konsistent. Zwanzig über mehrere Sessions hinweg driften noch ab.
Anwendungsfälle
Workflows, die OpenAI hervorhob und die Tester größtenteils bereits geprüft haben:
- Marketing-Creatives: Bannerwerbung, Social-Media-Grafiken, Produkt-Mockups in verschiedenen Formaten aus einem einzigen Prompt
- Infografiken und Slides: vollständige informationsdichte Visuals mit präzisem Kleintext, Diagrammen und Datenbeschriftungen
- Storyboarding und Spielprototyping: 8-Frame-konsistente Charaktersequenzen mit gemeinsamer Beleuchtung und Posenkontinuität
- Manga- und Comicseiten: mehrseitige Layouts mit konsistenten Charakteren und lesbaren Sprechblasen
- Bildungsdiagramme, Karten, wissenschaftliche Illustrationen: präzise Beschriftungen, geografische Details, Maßstab
- UI- und Produkt-Mockups: lesbarer Interface-Text und realistischer Komponentenabstand
- Gebrandete QR-Codes: Codes, die tatsächlich scannen, eingebettet in vollständig gestaltete Poster
- Lokalisierte Creatives: Poster, Anzeigen und Verpackungen in Landessprache für internationale Märkte
- Redaktionelle Layouts und Buchcover: typografielastige Layouts mit nicht-lateinischen Schriften
Für Agenturen kollabiert das drei oder vier Tools (Bildgenerator, Layout-App, Typografie-Editor, QR-Generator) in einen Prompt. Für Einzelpersonen ist es der Unterschied zwischen dem Brauchen eines Designers und dem Nicht-Brauchen.
Warum Codex Labs am selben Tag startete
OpenAI launche am 21. April auch Codex Labs, einen technischen Trainings- und Integrationsdienst für Organisationen, die Codex einsetzen. Der simultane Launch ist kein Zufall. Beide Produkte signalisieren dieselbe Verschiebung: OpenAI bewegt sich von generischen Chat-Assistenten zu spezialisierten Agenten, die vollständige Workflows übernehmen. ChatGPT Images 2.0 besitzt den visuellen Kreativ-Loop. Codex besitzt den Engineering-Loop. Codex Labs ist der Beratungsarm, der Unternehmen beim tatsächlichen Einsatz hilft.
Dieses Muster – ein starkes Spezialmodell launchen, dann die Dienste launchen, die es in die Produktion bringen – verfolgen Anthropic und Google seit einem Jahr. Dass OpenAI auf der Enterprise-Seite aufholt, ist strategisch womöglich wichtiger als das Bildmodell selbst.




So probierst du es aus
Eine vollständige Anleitung mit Prompt-Formeln und Anwendungsfällen für Lehrer, Schüler, Marketer und Büroangestellte findest du in unserem kompletten Leitfaden zur Nutzung von ChatGPT Images 2.0.
- In ChatGPT oder Codex: Öffne einen neuen Chat und gib einen Prompt ein. Free-Nutzer erhalten Instant Mode. Plus- und Pro-Nutzer können für Reasoning, Websuche... auf ein Thinking-Modell umschalten.
- Auf dem Handy: Aktualisiere auf die neueste ChatGPT-App. Der Bildgenerator ist jetzt standardmäßig auf Images 2.0 eingestellt.
- In der API: Verwende die Modell-ID
gpt-image-2oderchatgpt-image-latest, wenn du den produktionsverfolgten Alias möchtest. Gleiche Endpunktstruktur wiegpt-image-1. - In Fello AI: ChatGPT, Claude 4.6, Gemini 3 und DeepSeek leben in einer leichtgewichtigen nativen App für Mac, iPhone und iPad. GPT-Image-2-Unterstützung wird in den nächsten Tagen hinzugefügt. Fello AI ausprobieren.
Fazit
Die Leaks haben das hier unterschätzt. Vor dem Release konzentrierten sich die Gerüchte auf Textrendering und Seitenverhältnisse – beides hat geliefert. Niemand hatte vorhergesagt, dass OpenAI ein vollständiges Reasoning-Modell an die Bildpipeline schrauben und gleichzeitig Websuche, Selbstprüfung, funktionierende QR-Codes und 8-Bild-Konsistenz liefern würde. Diese Konsistenz haben wir in einem KI-Reisefoto-Set mit neun Destinationen eingesetzt, das aus einem einzigen Quell-Selfie generiert wurde.
Zum ersten Mal generiert ein Bildmodell nicht einfach nur Pixel. Es plant, recherchiert, entwirft und überarbeitet. Das ist eine andere Kategorie von Tool – und sie wird den Workflow jedes Teams umgestalten, das visuelle Inhalte produziert.