Der Bildgenerator von ChatGPT läuft auf gpt-image-2, dem Modell, das OpenAI am 21. April 2026 im Rahmen von ChatGPT Images 2.0 veröffentlicht hat. Es ersetzte die GPT-4o-Bildpipeline, die das Tool im Jahr zuvor angetrieben hatte. Der praktische Unterschied ist, dass ChatGPT Bilder jetzt nativ im Chatfenster zeichnet, statt deinen Prompt wie in der DALL·E-Ära an ein separates Tool weiterzugeben.

Dieser Wandel hat verändert, wofür sich das Tool eignet. Text in Bildern ist jetzt lesbar statt verzerrt, die Ausgabe erreicht bis zu 2K-Auflösung, und in kostenpflichtigen Plänen kann das Modell über ein Layout nachdenken, bevor es überhaupt etwas zeichnet. Im Folgenden zeigen wir, was der Generator eigentlich ist, wie man ihn nutzt und was OpenAI zu Gratis-Limits veröffentlicht und was nicht. Außerdem geht es um Prompts, die zuverlässig funktionieren, und darum, was zu tun ist, wenn das Tool die Generierung komplett verweigert.

Das Wichtigste in Kürze

  • Der Bildgenerator von ChatGPT wird von gpt-image-2 angetrieben, live seit 21. April 2026, nicht von DALL·E 3 und nicht von der alten GPT-4o-Pipeline.
  • Bildgenerierung ist in jedem ChatGPT-Plan inklusive Free verfügbar. Thinking Mode ist der Teil, der nur zahlenden Nutzern vorbehalten ist.
  • OpenAI veröffentlicht kein numerisches Bildlimit für Verbraucherpläne, weshalb jede online kursierende Zahl wie „2 bis 3 Bilder pro Tag“ eher eine Schätzung als ein offizielles Limit ist.
  • Die Ausgabe erreicht 2048 Pixel mit Seitenverhältnissen von 3:1 bis 1:3, und ein einzelner Prompt kann bis zu 8 konsistente Bilder liefern.
  • Über die API kostet ein Standardbild je nach angeforderter Qualitätsstufe etwa $0.006 bis $0.211.

Was der ChatGPT-Bildgenerator eigentlich ist

Vom Herausgeber

Jedes KI-Modell in einer App

Fello AI vereint GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 und mehr in einer nativen App für Mac und iPhone.

Jetzt herunterladen!

Der ChatGPT-Bildgenerator ist kein eigenständiges Produkt mit einem eigenen Tab. Er ist eine Funktion, die direkt in das normale Chatfenster eingebaut ist, weshalb so viele Menschen danach suchen, wie das Ganze eigentlich heißt, ohne eine klare Antwort zu finden. Du tippst eine Beschreibung ein, ChatGPT gibt ein Bild im Gespräch zurück, und du verfeinerst es, indem du weiterredest, statt den Prompt komplett neu zu schreiben.

OpenAIs offizielle Bezeichnung für die aktuelle Version ist ChatGPT Images 2.0, und das dahinterliegende Modell ist gpt-image-2. Beide Namen meinen dasselbe. Wenn ein Tutorial noch von DALL·E 3 oder von GPT-4o als Bildersteller spricht, stammt es von vor April 2026 und beschreibt eine Pipeline, die nicht mehr der Standard ist.

Es gibt keine separate Bilder-App zum Herunterladen und nichts, was du erst einschalten müsstest.

Welches Modell dahintersteckt

Jedes Bild, das du heute in ChatGPT generierst, kommt von gpt-image-2. Sein Wissensstand reicht bis Dezember 2025, weshalb es aktuelle Markenzeichen, Produktdesigns und neuere popkulturelle Bezüge korrekt darstellt, während das ältere Modell eine Version aus dem Jahr 2024 gezeigt oder sich etwas plausibel Aussehendes ausgedacht hätte.

DALL·E wurde nicht gelöscht. Es bleibt in ChatGPT als zweite Option verfügbar, vor allem für Menschen mit bestehenden Prompt-Bibliotheken oder einem bestimmten Look, den DALL·E besonders gut trifft. Für fast alles andere ist das neuere Modell besser, und das ist auch das, was du standardmäßig bekommst. Den vollständigen Launch haben wir in unserer Analyse zum Start von ChatGPT Images 2.0 behandelt.

Warum native Generierung besser ist als die alte Weitergabe

In der DALL·E-Ära las ChatGPT deine Anfrage, schrieb sie in einen Prompt um und gab diesen Prompt an ein komplett separates Bildmodell weiter. Alles, was der Chat über eure Unterhaltung verstanden hatte, ging dabei verloren. Deshalb führten Folgebearbeitungen so oft zu einem völlig neuen Bild statt zu einer angepassten Version des Bildes, das dir gefallen hatte.

Native Generierung hält alles in einem Modell. Dasselbe System, das dein Briefing gelesen hat, zeichnet auch das Bild, weshalb es sich an die Figur erinnert, die du vor drei Nachrichten festgelegt hast, und bearbeitet statt neu zu generieren.

Das ist der wichtigste Grund, warum sich das Tool anders anfühlt als die Version, die die meisten zuletzt ausprobiert haben.

So nutzt du den ChatGPT-Bildgenerator

Es gibt keinen Befehl zum Auswendiglernen und keinen Button, den du suchen musst. Die einfache Sprache ist die Oberfläche, und der häufigste Anfängerfehler ist, die Anfrage zu überformatieren, als wäre sie ein Midjourney-String. Fünf Schritte decken den kompletten Ablauf ab.

  1. Öffne einen neuen Chat im Web, in der Desktop-App oder auf dem Handy. Ein spezieller Modus ist nicht nötig.
  2. Beschreibe das gewünschte Bild in einem vollständigen Satz. Sag, was das Motiv ist, wo es sich befindet, wie das Licht aussieht und welches Format die fertige Datei haben soll.
  3. Schick die Anfrage ab und warte. Einfache Anfragen kommen in Sekunden zurück, komplexe Layouts dauern länger, weil das Modell sie durchdenkt, bevor es zeichnet.
  4. Verfeinere im Gespräch. Antworte mit „mach die Jacke rot“ oder „verschiebe das Logo nach unten links“, statt den gesamten Prompt neu zu schreiben.
  5. Lade das Bild über das Speichersymbol herunter. Bitte vorher um einen transparenten Hintergrund, wenn du das Ergebnis in eine Designdatei einfügen willst.

Ein bereits erstelltes Bild bearbeiten

Beim gesprächsbasierten Bearbeiten zeigt das aktuelle Modell, was es kann. Du kannst Elemente hinzufügen, entfernen oder zwei Referenzen mischen, während der Rest der Komposition unverändert bleibt, und besonders Gesichter überstehen Bearbeitungen inzwischen deutlich besser als früher. Der Trick ist, pro Nachricht nur eine Sache zu ändern.

Fünf Änderungen in eine einzige Anweisung zu packen, führt dazu, dass das Modell alles neu zeichnet und die Version verloren geht, die dir gefallen hat. Ändere zuerst den Hintergrund, prüfe ihn, ändere dann das Licht. Du kannst auch dein eigenes Foto hochladen und dieses bearbeiten, was die Grundlage der meisten Transformations-Prompts ist, einschließlich der in unserem Leitfaden zu KI-Reisefoto-Prompts.

Lesbaren Text in einem Bild erzeugen

Die Textdarstellung ist die auffälligste Verbesserung, und es lohnt sich zu verstehen, warum sie so schwer war. Ältere Bildmodelle behandelten Buchstaben als Textur. Sie lernten, wie Wörter ungefähr aussehen, ohne zu lernen, was einzelne Zeichen bedeuten, weshalb am Ende Poster mit „WELCOOMM“ und Speisekarten herauskamen, die bei kleiner Größe zu Kauderwelsch zerfielen.

Das aktuelle Modell behandelt Typografie als vollwertiges Element, sodass Überschriften scharf bleiben, Bildunterschriften lesbar bleiben und Preise sowie Daten deinem Prompt folgen, statt automatisch zu etwas korrigiert zu werden, das nur richtig aussieht. Für die besten Ergebnisse setzt du den exakten Wortlaut in Anführungszeichen in deinen Prompt und gibst an, wo er stehen soll. OpenAI nannte Japanisch, Koreanisch, Chinesisch, Hindi und Bengalisch als Sprachen mit den größten Fortschritten, und Layouts mit gemischten Schriftsystemen halten inzwischen so gut zusammen wie bei keinem früheren kommerziellen Modell.

Thinking Mode vs. Instant Mode

ChatGPT Images 2.0 gibt es in zwei Modi, und kaum ein Leitfaden erklärt den Unterschied wirklich gut. Welchen Modus du bekommst, hängt von deinem Plan und davon ab, wie komplex deine Anfrage ist, und das erklärt den größten Teil der Unterschiede, die Nutzer bei Geschwindigkeit und Qualität bemerken.

Instant Mode

Instant Mode priorisiert Geschwindigkeit und ist das, was jeder Nutzer standardmäßig bekommt, auch im Free-Plan. Er enthält weiterhin die vollständige Textdarstellung und die mehrsprachigen Verbesserungen, ist also keine abgespeckte Version des Modells. Für ein einzelnes Motiv, ein Produktfoto oder eine Social-Media-Grafik mit kurzer Überschrift reicht er meist völlig aus.

Thinking Mode

Thinking Mode fügt vor der Generierung einen Denkschritt hinzu und ist kostenpflichtigen Plänen vorbehalten. In diesem Schritt kann das Modell im Web suchen, hochgeladene Materialien wie PDFs oder Markenrichtlinien lesen, das Layout planen, bevor es zeichnet, und seine eigene Ausgabe prüfen, bevor es sie zurückgibt. Ein komplexer Prompt kann bis zu zwei Minuten dauern, während Instant Mode in Sekunden antwortet.

Das macht mehrteilige Arbeiten überhaupt erst möglich. Bitte um ein Erklär-Deck mit vier Folien, und du bekommst vier Folien mit einer konsistenten Designsprache statt vier unzusammenhängender Bilder zum selben Thema. Dasselbe erlaubt es dem Modell auch, QR-Codes zu erzeugen, die tatsächlich scannbar sind, weil der Denkschritt die Kodierung berechnet, statt nur etwas QR-Ähnliches zu zeichnen.

Es ist ein Reasoning-Modell mit einem Pinsel.

Ist der ChatGPT-Bildgenerator kostenlos?

Ja. Bildgenerierung ist in jedem ChatGPT-Plan verfügbar, und das schließt die Gratisversion mit ein. Was sich mit einem höheren Plan ändert, ist, wie viel du generieren kannst, bevor du an eine Grenze stößt, und ob dir Thinking Mode überhaupt zur Verfügung steht.

PlanBildgenerierungThinking ModeVeröffentlichtes numerisches Limit
FreeJaNeinKeines
PlusJaJaKeines
ProJaJa, höchste LimitsKeines, beschrieben als unbegrenzt vorbehaltlich Missbrauchsschutz
BusinessJaJaKeines
EnterpriseJaJaKeines
API (gpt-image-2)JaJaPro Bild bezahlen

Was OpenAI zu den Limits tatsächlich veröffentlicht

Dieser Teil lohnt sich zum genauen Lesen, denn die meisten Seiten, die für diese Frage ranken, liegen falsch. OpenAI dokumentiert, welche Pläne Zugang haben, und beschreibt Limits nur relativ, indem es heißt, dass kostenlose Konten strengere Obergrenzen für fortgeschrittene Funktionen wie die Bilderstellung haben. Eine feste Zahl an Bildern pro Tag oder Stunde für Verbraucherpläne veröffentlicht OpenAI nicht.

Suchst du nach dem Limit, findest du selbstbewusst formulierte Zahlen wie zwei bis drei Bilder pro Tag bei Free und fünfzig pro drei Stunden bei Plus. Verfolgst du diese Angaben zurück, führen sie zu anderen Blogs, API-Wiederverkäufern und, wie eine Quelle offen zugibt, zu Community-Tests.

Der klarste Beweis dafür, dass nichts davon offiziell ist, ist, dass sich die Zahlen widersprechen. Eine viel zitierte Seite setzt das Gratiskontingent bei zwei bis drei Bildern pro rollierenden 24 Stunden an. Eine andere nennt fünf Bilder pro Tag. Eine dritte gibt für Plus fünfzig Bilder pro drei Stunden an, eine vierte fünfzig pro Tag. Es sind Schätzungen, sie schwanken mit der Nachfrage, und keine zwei stimmen überein.

Niemand außerhalb von OpenAI kann dir die echte Zahl nennen, denn OpenAI hat keine veröffentlicht.

Die praktische Version ist einfacher. Im Free-Plan generierst du eine Handvoll Bilder, bevor du zum Warten aufgefordert wirst, und das Zeitfenster setzt sich rollierend zurück statt um Mitternacht. Kostenpflichtige Pläne verschieben diese Grenze so weit nach hinten, dass die meisten sie gar nicht mehr bemerken.

Stößt du regelmäßig an diese Grenze, ist das das eigentliche Signal für ein Upgrade.

Was es über die API kostet

Entwickler bekommen transparente Preise, während Verbraucher vage Formulierungen erhalten. Die gpt-image-2-API wird pro Token abgerechnet statt mit einer festen Pauschale pro Bild, was für ein quadratisches Standardbild ungefähr auf die unten stehenden Kosten hinausläuft.

Qualitätsstufe (1024 x 1024)Ungefähre Kosten pro Bild
Niedrig~$0.006
Mittel~$0.053
Hoch~$0.211

Ausgaben in 2K kosten proportional mehr, weil sie mehr Token verbrauchen, und Bearbeitungen sind teurer, als sie aussehen, weil Referenzbilder immer in hoher Qualität verarbeitet werden. Manche Konten benötigen außerdem eine OpenAI Organization Verification, bevor die Endpunkte überhaupt antworten.

Was sich mit ChatGPT Images 2.0 geändert hat

Wenn du ChatGPT zuletzt 2025 für Bilder genutzt hast, erklären die Spezifikationen unten, warum dein alter Workflow nicht mehr funktioniert. Der Sprung bei Auflösung und Seitenverhältnissen hat den üblichen Kreislauf beendet, ein quadratisches Bild zu generieren, es in einem anderen Tool zuzuschneiden und dabei die halbe Komposition zu verlieren.

SpezifikationBisherige GPT-4o-PipelineChatGPT Images 2.0
Maximale Auflösung1024 x 10242048 x 2048 (2K)
Seitenverhältnisse1:1, 2:3, 3:23:1 bis 1:3
Bilder pro Prompt1Bis zu 8, konsistent
Webzugriff während der GenerierungNeinJa, im Thinking Mode
SelbstprüfungNeinJa, im Thinking Mode
WissensstandOktober 2024Dezember 2025
Transparente HintergründeEingeschränktJa

Die erweiterte Bandbreite an Seitenverhältnissen ist der unauffällig nützliche Teil. Breite Banner, Präsentationsfolien, Poster, Stories, Thumbnails und vertikale Video-Cover kommen alle aus demselben Modell in der richtigen Form, ganz ohne Hochskalieren und ohne Zuschneiden. Alle Details zum Launch stehen in OpenAIs Ankündigung zu ChatGPT Images 2.0, und Neurohives Launch-Bericht deckt die Spezifikationen unabhängig ab.

Prompts, die zuverlässig funktionieren

Die Prompt-Formel, die bei diesem Modell funktioniert, unterscheidet sich vom Keyword-Stuffing-Stil, der zu Midjourney passt. Schreib ein Briefing, keine Tag-Liste. Nenne Motiv, Umgebung, Licht, Stimmung und das gewünschte Format in normalen Sätzen, und setz jeden Text, der abgebildet werden soll, in Anführungszeichen.

Gestalte ein breites Banner für eine Kaffee-Abo-Marke. Warmes Morgenlicht, eine Keramiktasse auf einer Leinenfläche, geringe Schärfentiefe. Die Überschrift lautet „Letzten Donnerstag geröstet“ in einer klaren Serifenschrift, unten links. Lass das rechte Drittel leer für ein Produktfoto. Seitenverhältnis 3:1.

Diese Struktur funktioniert, weil sie dem Modell sagt, wofür das Bild gedacht ist, nicht nur, was darauf zu sehen ist. Beachte, dass der leere Raum ausdrücklich angefordert wird, was die alte Pipeline konsequent ignoriert hat.

Bitte um den Freiraum, und du bekommst ihn.

Verwandle das Foto, das ich hochgeladen habe, in ein Filmstandbild aus den 1970ern. Behalte mein Gesicht und meine Kleidung genau so, wie sie sind. Füge Filmkorn, einen warmen Farbstich, eine leichte Objektivvignettierung und eine weiche Lichtquelle von links hinzu. Ändere die Hintergrundkomposition nicht.

Bei Transformations-Prompts wie diesem zeigen sich die Bearbeitungsverbesserungen am deutlichsten. Die Anweisung, bestimmte Elemente zu erhalten, leistet echte Arbeit, und wenn sie fehlt, beschweren sich so viele Leute, dass das Modell ihr Gesicht verändert hat. Weitere Muster wie diese findest du in unserem KI-Prompts-Hub.

Wenn der ChatGPT-Bildgenerator nicht funktioniert

Die Bildgenerierung schlägt so oft fehl, dass „funktioniert nicht“ und „ist down“ zu den meistgesuchten Begriffen rund um dieses Tool gehören. Die Ursachen lassen sich in wenige Kategorien einteilen, und die Reihenfolge, in der du sie prüfst, erspart dir viel unnötige Fehlersuche.

Prüfe zuerst, ob es wirklich ein Ausfall ist

Die Bildgenerierung fällt unabhängig vom Rest von ChatGPT aus, weshalb Textantworten einwandfrei funktionieren können, während jede Bildanfrage fehlschlägt. Bevor du auch nur eine Einstellung änderst, öffne die OpenAI-Statusseite und schau nach einem Vorfall, der die Bildgenerierung nennt. Teilausfälle, die speziell Bilder betreffen, kamen 2026 wiederholt vor, unter anderem im Juli.

Ist ein Vorfall aktiv, hilft auf deiner Seite gar nichts. Warte es ab, statt Caches zu leeren und Apps neu zu installieren.

Ein Ausschlag bei Downdetector ist ein nützliches zweites Signal.

Die anderen häufigen Ursachen

Ist die Statusseite unauffällig, ist die nächstwahrscheinlichste Erklärung, dass du dein Kontingent aufgebraucht hast. In dem Fall stockt oder verweigert das Modell, statt es dir klar zu sagen. Eine Stunde zu warten und es dann erneut zu versuchen, ist die schnellste Diagnose.

Die dritte Ursache ist eine Sperre durch die Inhaltsrichtlinien. Sie zeigt sich meist als eine Generierung, die startet und dann abbricht, und wird am häufigsten durch eine namentlich genannte Person des öffentlichen Lebens, eine erkennbare Marke oder alles ausgelöst, was der Filter als reale Person einstuft.

Langsamkeit ist ein anderes Problem als ein Fehler. Komplexe Prompts, die über Thinking Mode laufen, brauchen bis zu zwei Minuten, sodass eine lange Wartezeit oft bedeutet, dass das Modell arbeitet, statt dass der Dienst ausfällt. Wenn sich ChatGPT insgesamt träge anfühlt und nicht nur bei Bildern, sind die Ursachen breiter gefächert, und wir haben sie in unserem Leitfaden dazu, warum ChatGPT so langsam ist, behandelt.

Wie es sich mit anderen Bildgeneratoren vergleicht

Der Generator von ChatGPT liegt bei Textgenauigkeit, mehrsprachiger Darstellung und reasoning-gesteuerten Layouts vorn. Er ist aber nicht überall automatisch der Gewinner, und ehrlich gesagt gewinnen verschiedene Tools nach wie vor unterschiedliche Aufgaben.

FähigkeitChatGPT Images 2.0Midjourney V8Nano Banana Pro
TextdarstellungBeste der KlasseGutSehr gut
Mehrsprachiger TextBeste der KlasseEingeschränktGut
Reasoning vor der GenerierungJaNeinNein
Maximale Auflösung2K2K hochskaliert~1.5K

Midjourney hat weiterhin die Nase vorn bei malerischen und illustrativen Stilen, wo sich sein auf Vorlieben abgestimmter Datensatz zeigt. Nano Banana Pro liegt beim Fotorealismus näher dran, als die meisten erwarten, und bleibt schneller. Adobe Firefly bietet OpenAIs Bildmodell inzwischen als Partneroption an, sodass du ein ähnliches Ergebnis direkt aus einem Creative-Cloud-Workflow erreichen kannst, wenn du dort ohnehin schon arbeitest.

Wenn eher die Kosten als die Fähigkeiten die Grenze setzen, gibt es solide Optionen, die nie nach einer Karte fragen, und wir haben zehn davon in unserer Übersicht der besten kostenlosen KI-Bildgeneratoren getestet. Für einen umfassenderen Blick darauf, welcher ChatGPT-Plan insgesamt zu deiner Nutzung passt, schlüsselt unser ChatGPT-Modellvergleich die Pläne Funktion für Funktion auf. Für Metas Pendant siehe unseren Leitfaden zum Meta-AI-Bildgenerator.

Wer für unterschiedliche Aufgaben zwischen Bildmodellen hin und her wechselt, bevorzugt manchmal ein einziges Abo statt mehrerer. Fello AI verfolgt genau diesen Ansatz und bündelt mehrere Modelle in einer einzigen App ab $9.99 pro Monat mit 27.000+ Bewertungen im App Store. Es ergänzt ChatGPT, statt es zu ersetzen.

Fazit

Der ChatGPT-Bildgenerator hat im April 2026 eine Schwelle überschritten. Lesbarer Text, 2K-Ausgabe, echte Bearbeitung und Nachdenken vor dem Zeichnen haben ihn von einem Tool für Moodboards zu einem gemacht, das Assets liefert, die du tatsächlich verwenden kannst. Wenn dein Bild im Kopf noch das von DALL·E ist, das ein quadratisches Bild mit verzerrter Schrift zurückgibt, lohnt sich ein zweiter Blick.

Starte im Free-Plan und schreib ein Briefing in ganzen Sätzen statt einer Tag-Liste. Wenn du regelmäßig an die Grenze stößt oder mehrteilige Layouts und dokumentenbewusste Generierung brauchst, zahlt sich Thinking Mode in einem kostenpflichtigen Plan aus.

FAQ

Welchen Bildgenerator nutzt ChatGPT?

ChatGPT nutzt gpt-image-2, das Modell hinter ChatGPT Images 2.0, das am 21. April 2026 die GPT-4o-Bildpipeline ersetzt hat. Es erzeugt Bilder nativ im Chat, statt deinen Prompt an ein separates Tool weiterzugeben. DALL·E lässt sich weiterhin als zweite Option auswählen, ist aber nicht mehr der Standard.

Wie viele Bilder kann ich kostenlos generieren?

OpenAI veröffentlicht kein numerisches Limit für Verbraucherpläne. Das Unternehmen bestätigt, dass Bildgenerierung in jedem Plan verfügbar ist und dass kostenlose Konten strengere Obergrenzen für fortgeschrittene Funktionen haben, ohne eine Zahl zu nennen. Konkrete Zahlen, die du anderswo findest, sind Community-Schätzungen, und das tatsächliche Kontingent schwankt mit der Nachfrage.

Gibt es einen Befehl, um ein Bild zu generieren?

Es ist kein Befehl und kein Slash-Präfix nötig. Es reicht, das gewünschte Bild in einem normalen Satz zu beschreiben, und ChatGPT entscheidet selbst, ob es generiert oder in Text antwortet. Beginnst du deine Nachricht mit „erstelle ein Bild von“, beseitigst du jede Zweideutigkeit, falls das Modell deine Absicht falsch versteht.

Kann ich ChatGPT-Bilder kommerziell nutzen?

OpenAIs Nutzungsbedingungen übertragen dir alle Rechte, Titel und Interessen an der von dir generierten Ausgabe, sodass kommerzielle Nutzung erlaubt ist. Zwei Einschränkungen sind wichtig. Marken, erkennbare Personen und urheberrechtlich geschützte Figuren werden nicht automatisch unbedenklich, nur weil ein Modell sie gezeichnet hat, und rein KI-generierte Werke wird der Urheberrechtsschutz oft verweigert, wenn keine nennenswerte menschliche Urheberschaft vorliegt.

Warum ist der ChatGPT-Bildgenerator so langsam?

Komplexe Prompts laufen über Thinking Mode, der vor dem Zeichnen über das Layout nachdenkt und dabei bis zu zwei Minuten dauern kann. Hohe Nachfrage kommt noch dazu, und OpenAI beschreibt die Generierung im Pro-Plan als schneller als in niedrigeren Stufen. Eine lange Wartezeit bedeutet meist, dass das Modell arbeitet, statt zu scheitern.