Nach wochenlangen Leaks und LM-Arena-Sichtungen hat OpenAI ChatGPT Images 2.0 am 21. April 2026 veröffentlicht. Das zugrundeliegende Modell, gpt-image-2, ist in ChatGPT, in Codex und in der API live. Wenn dir Kosten mehr als rohe Leistung wichtig sind, schau dir die besten kostenlosen KI-Bildgeneratoren an.

Das ist das erste OpenAI-Bildmodell mit eingebautem Reasoning, das erste, das dichten Text auf Japanisch, Koreanisch, Chinesisch, Hindi und Bengali rendern kann, und das erste, das vor dem Zeichnen eines einzigen Pixels im Web suchen kann. Es hebt die KI-Bildgenerierung auch über die „Inspirationsboard"-Phase hinaus – hin zu etwas, das du direkt als Produktionsasset nutzen kannst.

Was wirklich neu ist

ChatGPT Images 2.0 ersetzt die GPT-4o-Bildpipeline, die ChatGPT im vergangenen Jahr angetrieben hat. Der Wissensstand liegt bei Dezember 2025, sodass das Modell aktuelle Markenlogos, Produktdesigns, geografische Karten und aktuelle Kulturverweise korrekt rendert – Dinge, bei denen das alte Modell halluzinierte oder in einer Version von 2024 steckenblieb.

OpenAI bezeichnet es als interaktive Kreativ-Engine statt als einmaligen Generator. Diese Einordnung ist wichtig: Reasoning, Websuche und Bildgenerierung laufen jetzt in einer einzigen Schleife. Das Modell kann seine Ausgabe in mehreren Durchläufen innerhalb derselben Anfrage verfeinern, statt dich zum Neugenerieren von vorn zu zwingen.

Konkrete Verbesserungen:

  • Bis zu 2K-Auflösung (2.048 Pixel Breite) pro Ausgabe
  • Seitenverhältnisse von 3:1 bis 1:3, stufenlos statt fester Voreinstellungen
  • Bis zu 8 konsistente Bilder aus einem Prompt mit gemeinsamen Charakteren, Beleuchtung und Stil
  • Funktionierende QR-Codes, die mit jeder Handykamera scannen
  • Websuche während der Generierung
  • Selbstprüfung vor der Ausgabe
  • Transparente Hintergrundexporte für die direkte Pipeline-Integration
  • Scharfer Kleintext, UI-Elemente, Ikonografie und dichte Kompositionen

Die LM-Arena-Codenamen „maskingtape" und „gaffertape" erwiesen sich als frühe Testvarianten. „Duct tape" war die Instant-Variante. „Packingtape" war der Thinking-Mode-Build.

Warum Textrendering das schwierige Problem war

Vom Herausgeber

Jedes KI-Modell in einer App

Fello AI vereint GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 und mehr in einer nativen App für Mac und iPhone.

Jetzt herunterladen!

Drei Jahre lang haben alle großen Bildmodelle Text als eine Art Textur behandelt. Das Modell lernte, dass „Buchstaben so aussehen", ohne zu verstehen, was bestimmte Wörter als Glyphen bedeuten. Deshalb erzeugten GPT-4o, Midjourney V7 und DALL-E 3 Poster mit verworren wirkendem „WELCOOMM"-Text statt „WELCOME" und deshalb brachen dichte Layouts (Speisekarten, Infografiken, Verpackungen) in Unsinn zusammen.

Frau, die ChatGPT-Bildwerkzeuge verwendet – generiert mit GPT-Image-2.0.

ChatGPT Images 2.0 behandelt Text als erstklassiges Element. Tester prüften das Modell anhand von Speisekarten, Konferenzbadges, Produktverpackungen und redaktionellen Layouts. Das Modell hält Typografie, Laufweite, Hierarchie und Rechtschreibung ein. Überschriften bleiben in 2K scharf. Kleine Bildunterschriften sind lesbar. Artikelnummern, Datumsangaben, Preise und Labels folgen dem Prompt, statt in plausibel aussehenden Unsinn korrigiert zu werden.

Das ist die Veränderung, die KI-Bildgenerierung von „gut genug für ein Mood Board" zu „gut genug für das eigentliche Deliverable" macht.

Eine von GPT-Image-2.0 generierte Restaurantspeisekarte

Thinking Mode

ChatGPT Images 2.0 kommt in zwei Modi.

Instant Mode generiert schnell und priorisiert Geschwindigkeit. Er enthält alle Textrendering- und Mehrsprachigkeitsverbesserungen. Das ist, was alle Nutzer standardmäßig erhalten.

Thinking Mode fügt vor der Generierung einen Reasoning-Durchlauf hinzu. Das Modell kann im Web suchen, hochgeladene Materialien analysieren (PDFs, Screenshots, Brand Guidelines), das Layout vor dem Zeichnen durchdenken, bis zu 8 konsistente Ausgaben generieren und seine eigenen Ergebnisse gegenchecken, bevor es sie zurückgibt. Bei einem komplexen Prompt kann das bis zu zwei Minuten dauern, während Instant Mode in Sekunden antwortet.

Das ist es, was die seitenlangen Manga-Sequenzen, Multi-Frame-Storyboards und vollständigen Infografiken ermöglicht, die seit dem Launch soziale Medien fluten. Der Reasoning-Durchlauf ist auch der Grund, warum ein einzelner Prompt wie „Erstelle eine 4-Folien-Präsentation zur Quantentunnelung" tatsächlich 4 zusammenhängende Folien mit konsistenter Designsprache erzeugt – statt 4 unzusammenhängenden Bildern, die zufällig dasselbe Thema teilen.

Fotorealistischer Reis mit Erbsen auf Zeitungspapier – Textur und Beleuchtung generiert von GPT-Image-2.0

Der Thinking Mode ist der Teil des Launches, den niemand so wirklich kommen sah. Es ist im Grunde ein Reasoning-Modell mit einem Pinsel.

Funktionierende QR-Codes und warum sie wichtig sind

QR-Codes wirken wie ein Zaubertrick, bis du verstehst, was sie beweisen. Ein QR-Code ist eine präzise mathematische Kodierung. Ein falsches Quadrat und der Code lässt sich nicht scannen. Jedes bisherige Bildmodell erzeugte QR-Code-ähnliche Bilder, die nicht wirklich funktionierten.

ChatGPT Images 2.0 generiert funktionierende QR-Codes, weil der Thinking-Mode-Reasoning-Durchlauf die Kodierung tatsächlich berechnet, bevor er sie zeichnet. Das Modell kann den QR außerdem mit Markenfarben gestalten, ein Logo in der Mitte einbetten und ihn in ein vollständig gestaltetes Poster integrieren. Für Marketing-Teams, die bisher einen QR-Generator, einen Designer und ein Layout-Tool brauchten, um ein einzelnes Werbemittel zu erstellen, kollabiert das drei Schritte in einen Prompt.

Es zeigt auch, wozu die Architektur über Bilder hinaus fähig ist. Alles, was Präzision statt Gefühl erfordert – wissenschaftliche Diagramme, technische Schemata, genaue Karten – wird damit machbar.

Auflösung und Seitenverhältnisse

SpecGPT Image 1 (GPT-4o)ChatGPT Images 2.0
Max resolution1024 x 10242048 x 2048 (2K)
Aspect ratios1:1, 2:3, 3:23:1 to 1:3 (continuous)
Images per prompt1Up to 8
Web accessNoYes (thinking)
Self-verificationNoYes (thinking)
Knowledge cutoffOctober 2024December 2025
Transparent backgroundsLimitedYes

Der Bereich von 3:1 bis 1:3 deckt breite Banner, Slides, Poster, Stories, Thumbnails und TikTok-Vertikale ab – alles aus demselben Modell, ohne Upscaling oder Zuschneiden. Das beseitigt den umständlichen Workflow „Quadrat generieren, in Photoshop zuschneiden, halbe Komposition verlieren", der seit DALL-E 2 Standard war.

GPT-Image-2.0 erlaubt die Generierung von Bildern in deutlich breiteren Seitenverhältnissen

Mehrsprachiger Text

OpenAI hob explizit Japanisch, Koreanisch, Chinesisch, Hindi und Bengali als Sprachen mit signifikanten Verbesserungen hervor. Tester prüften das Ergebnis – der Text liest sich nativ, nicht wie das Zeichengewirr, das jedes bisherige Bildmodell produzierte.

Die tiefere Veränderung ist die Handhabung gemischter Schriften. Das Modell kann ein japanisches Poster mit lateinischen Produktnamen rendern, eine arabische Restaurantspeisekarte mit westlichen Preisen oder einen chinesischen Filmuntertitel über einem englischen Titel. Gemischte Schriftlayouts waren in jedem kommerziellen Bildmodell bis jetzt kaputt.

Für Nicht-englische Märkte ist das das erste KI-Bildmodell, das für Produktionsarbeiten außerhalb des lateinischen Alphabets nutzbar ist. Bengali-, Hindi- und Devanagari-Typografie war in DALL-E 3 und Midjourney praktisch unbrauchbar.

Preise und API

Die gpt-image-2-API ist live. Die Preisgestaltung ist tokenbasiert:

Token TypePrice
Image input tokens$8 per million
Image output tokens$30 per million

Die endgültigen Kosten pro Bild hängen von Qualitätsstufe und Auflösung ab. Schätzungen pro Bild bei Standard 1024 x 1024:

Quality TierCost per Image
Low~$0.006
Medium~$0.053
High~$0.211

2K-Ausgaben kosten proportional mehr durch die zusätzlichen Tokens. Es gibt zwei API-Oberflächen: die Image API (Modell-ID gpt-image-2) für einmalige Generierung und Bearbeitung sowie die Responses API mit Bildgenerierung als eingebautem Tool. Entwickler, die möchten, dass ihre App der Produktionsversion von ChatGPT folgt, können den Alias chatgpt-image-latest verwenden, der sich automatisch aktualisiert.

Einige API-Accounts benötigen eine OpenAI-Organisationsverifizierung, bevor die Endpunkte aufrufbar werden.

Verfügbarkeit nach Plan

User TierStandardThinking Mode
Free ChatGPTYesNo
ChatGPT PlusYesYes
ChatGPT ProYesYes (highest limits)
ChatGPT BusinessYesYes
ChatGPT EnterpriseYesYes
Codex usersYesYes
API (gpt-image-2)YesYes

Der Mobile-Rollout läuft über das neueste ChatGPT-App-Update. DALL-E bleibt innerhalb von ChatGPT verfügbar, ist jetzt aber als sekundäre Option für Nutzer mit bestehenden Prompt-Bibliotheken oder spezifischen stilistischen Anforderungen positioniert, bei denen DALL-E punktet.

Der Vergleich

Praxisberichte von VentureBeat, TechCrunch und TechRadar stellen es wie folgt gegen die Konkurrenz:

CapabilityChatGPT Images 2.0Midjourney V8Nano Banana ProFlux 2
PhotorealismExcellentExcellentVery goodExcellent
Text renderingBest in classGoodVery goodGood
Multilingual textBest in classLimitedGoodLimited
Reasoning before generationYesNoNoNo
Web searchYesNoNoNo
Multi-image consistencyUp to 8LimitedUp to 4Limited
Max resolution2K2K (upscaled)~1.5K2K
API accessYesNoYesYes

ChatGPT Images 2.0 führt bei Textgenauigkeit, mehrsprachiger Unterstützung und Reasoning-Workflows. Midjourney hat bei bestimmten stilisierten Ästhetiken noch einen Vorsprung, vor allem bei malerischen und illustrativen Arbeiten, wo sein älteres, präferenz-getuentes Dataset zeigt. Nano Banana Pro liegt bei Fotorealismus näher als erwartet und gewinnt nach wie vor in puncto Rohgeschwindigkeit. Flux bleibt die stärkste open-source-Option für Teams, die selbst hosten müssen. Wenn du dir bei einem Ergebnis nicht sicher bist, ob es echt ist, findest du hier, wie du erkennst, ob ein Bild KI-generiert ist.

Die Image-Arena-Zahlen

Einen Tag nach dem Launch veröffentlichte Arena.ai die Leaderboard-Ergebnisse – und sie sind eindeutig. GPT-Image-2 belegte Platz 1 in jeder Image-Arena-Kategorie mit den größten Abständen, die auf der Plattform je verzeichnet wurden:

CategoryGPT-Image-2 ScoreLead Over #2
Text-to-Image (overall)1512+242 over Nano-banana-2
Single-Image Edit1513+125 over Nano-banana-pro
Multi-Image Edit1464+90 over Nano-banana-2

Der Vorsprung von +242 Punkten in Text-to-Image ist der größte Abstand, den Arena je verzeichnet hat. Zum Vergleich: Modell-Upgrades bewegen das Leaderboard typischerweise 30 bis 60 Punkte.

GPT-Image-2 gewann außerdem alle 7 Text-to-Image-Unterkategorien und schlug seinen eigenen Vorgänger GPT-Image-1.5 mit großem Abstand:

  • Product, Branding & Commercial Design: +277 Punkte
  • 3D Imaging & Modeling: +274 Punkte
  • Cartoon, Anime & Fantasy: +296 Punkte
  • Photorealistic & Cinematic Imagery: +247 Punkte
  • Art: +197 Punkte
  • Portraits: +296 Punkte
  • Text Rendering: +316 Punkte

Der Sprung von +316 Punkten bei Text Rendering ist die Headline-Zahl und bestätigt, was Tester anekdotisch berichteten. Das Modell hat Text nicht nur verbessert. Es hat die gesamte Obergrenze angehoben.

Modelle, gegen die es durchgehend gewann: Nano-banana-2, Nano-Banana-Pro-Varianten, MAI-Image-2, Reve-V1.5 und Grok-Imagine-Image.

Was es noch nicht kann

Nicht alles ist gelöst. Tester verzeichneten einige Schwachstellen:

  • Bereichsselektive Bearbeitungen sind ungenau. Wenn du einen bestimmten Bereich maskierst und eine Änderung anforderst, kann die Bearbeitung über die Maske hinausbluten. Für Präzisionsarbeit ist ein schriftlicher Prompt, der beschreibt, was geändert werden soll, aktuell zuverlässiger als eine räumliche Selektion.
  • Thinking Mode ist langsam. Zwei Minuten für einen komplexen Prompt sind für Produktionsarbeit in Ordnung, töten aber das Modell für Casual Exploration. Die meisten Nutzer bleiben für alltägliche Prompts im Instant Mode.
  • Stark stilisierte Illustrationen. Midjourneys malerische Ästhetik hat für redaktionelle Illustrationen und Buchcover noch einen Vorsprung, wo Stimmung mehr zählt als Genauigkeit.
  • Live-Video und Animation. Das ist ein Standbild-Modell. Sora behandelt Bewegtbild separat.
  • Konsistenz des Markenauftritts über lange Sessions. Acht Bilder aus einem Prompt sind konsistent. Zwanzig über mehrere Sessions hinweg driften noch ab.

Anwendungsfälle

Workflows, die OpenAI hervorhob und die Tester größtenteils bereits geprüft haben:

  • Marketing-Creatives: Bannerwerbung, Social-Media-Grafiken, Produkt-Mockups in verschiedenen Formaten aus einem einzigen Prompt
  • Infografiken und Slides: vollständige informationsdichte Visuals mit präzisem Kleintext, Diagrammen und Datenbeschriftungen
  • Storyboarding und Spielprototyping: 8-Frame-konsistente Charaktersequenzen mit gemeinsamer Beleuchtung und Posenkontinuität
  • Manga- und Comicseiten: mehrseitige Layouts mit konsistenten Charakteren und lesbaren Sprechblasen
  • Bildungsdiagramme, Karten, wissenschaftliche Illustrationen: präzise Beschriftungen, geografische Details, Maßstab
  • UI- und Produkt-Mockups: lesbarer Interface-Text und realistischer Komponentenabstand
  • Gebrandete QR-Codes: Codes, die tatsächlich scannen, eingebettet in vollständig gestaltete Poster
  • Lokalisierte Creatives: Poster, Anzeigen und Verpackungen in Landessprache für internationale Märkte
  • Redaktionelle Layouts und Buchcover: typografielastige Layouts mit nicht-lateinischen Schriften

Für Agenturen kollabiert das drei oder vier Tools (Bildgenerator, Layout-App, Typografie-Editor, QR-Generator) in einen Prompt. Für Einzelpersonen ist es der Unterschied zwischen dem Brauchen eines Designers und dem Nicht-Brauchen.

Warum Codex Labs am selben Tag startete

OpenAI launche am 21. April auch Codex Labs, einen technischen Trainings- und Integrationsdienst für Organisationen, die Codex einsetzen. Der simultane Launch ist kein Zufall. Beide Produkte signalisieren dieselbe Verschiebung: OpenAI bewegt sich von generischen Chat-Assistenten zu spezialisierten Agenten, die vollständige Workflows übernehmen. ChatGPT Images 2.0 besitzt den visuellen Kreativ-Loop. Codex besitzt den Engineering-Loop. Codex Labs ist der Beratungsarm, der Unternehmen beim tatsächlichen Einsatz hilft.

Dieses Muster – ein starkes Spezialmodell launchen, dann die Dienste launchen, die es in die Produktion bringen – verfolgen Anthropic und Google seit einem Jahr. Dass OpenAI auf der Enterprise-Seite aufholt, ist strategisch womöglich wichtiger als das Bildmodell selbst.

So probierst du es aus

Eine vollständige Anleitung mit Prompt-Formeln und Anwendungsfällen für Lehrer, Schüler, Marketer und Büroangestellte findest du in unserem kompletten Leitfaden zur Nutzung von ChatGPT Images 2.0.

  1. In ChatGPT oder Codex: Öffne einen neuen Chat und gib einen Prompt ein. Free-Nutzer erhalten Instant Mode. Plus- und Pro-Nutzer können für Reasoning, Websuche... auf ein Thinking-Modell umschalten.
  2. Auf dem Handy: Aktualisiere auf die neueste ChatGPT-App. Der Bildgenerator ist jetzt standardmäßig auf Images 2.0 eingestellt.
  3. In der API: Verwende die Modell-ID gpt-image-2 oder chatgpt-image-latest, wenn du den produktionsverfolgten Alias möchtest. Gleiche Endpunktstruktur wie gpt-image-1.
  4. In Fello AI: ChatGPT, Claude 4.6, Gemini 3 und DeepSeek leben in einer leichtgewichtigen nativen App für Mac, iPhone und iPad. GPT-Image-2-Unterstützung wird in den nächsten Tagen hinzugefügt. Fello AI ausprobieren.

Fazit

Die Leaks haben das hier unterschätzt. Vor dem Release konzentrierten sich die Gerüchte auf Textrendering und Seitenverhältnisse – beides hat geliefert. Niemand hatte vorhergesagt, dass OpenAI ein vollständiges Reasoning-Modell an die Bildpipeline schrauben und gleichzeitig Websuche, Selbstprüfung, funktionierende QR-Codes und 8-Bild-Konsistenz liefern würde. Diese Konsistenz haben wir in einem KI-Reisefoto-Set mit neun Destinationen eingesetzt, das aus einem einzigen Quell-Selfie generiert wurde.

Zum ersten Mal generiert ein Bildmodell nicht einfach nur Pixel. Es plant, recherchiert, entwirft und überarbeitet. Das ist eine andere Kategorie von Tool – und sie wird den Workflow jedes Teams umgestalten, das visuelle Inhalte produziert.