Tras semanas de filtraciones y apariciones en LM Arena, OpenAI lanzó ChatGPT Images 2.0 el 21 de abril de 2026. El modelo subyacente, gpt-image-2, está disponible en ChatGPT, en Codex y en la API. Si el coste importa más que la potencia bruta, compara los mejores generadores de imágenes con IA gratuitos.

Es el primer modelo de imágenes de OpenAI con razonamiento integrado, el primero capaz de renderizar texto denso en japonés, coreano, chino, hindi y bengalí, y el primero que puede buscar en la web antes de dibujar un solo píxel. Además, lleva la generación de imágenes con IA más allá del «tablero de inspiración» y la convierte en algo que puedes usar directamente como material de producción.

Qué hay realmente de nuevo

ChatGPT Images 2.0 reemplaza el pipeline de imágenes de GPT-4o que ha impulsado ChatGPT durante el último año. La fecha de corte de conocimiento es diciembre de 2025, por lo que el modelo renderiza correctamente los logotipos de marcas actuales, diseños de productos, mapas geográficos y referencias culturales recientes en las que el modelo anterior alucinaría o se quedaría atascado en la versión de 2024.

OpenAI lo llama un motor creativo interactivo en lugar de un generador de un solo disparo. Ese enfoque importa porque el razonamiento, la búsqueda web y la generación de imágenes ahora funcionan en un solo bucle, y el modelo puede refinar su resultado en varios pasos dentro de la misma solicitud sin obligarte a regenerar desde cero.

Mejoras concretas:

  • Hasta resolución 2K (2.048 píxeles de ancho) por imagen
  • Relaciones de aspecto de 3:1 a 1:3, continuas en lugar de preajustes fijos
  • Hasta 8 imágenes coherentes desde un solo prompt, con personajes, iluminación y estilo compartidos
  • Códigos QR funcionales que se escanean con cualquier cámara de teléfono
  • Búsqueda web durante la generación
  • Autoverificación antes de la salida
  • Exportación con fondo transparente para integración directa en pipelines
  • Texto pequeño nítido, elementos de interfaz, iconografía y composiciones densas

Los nombres en clave de LM Arena "maskingtape" y "gaffertape" resultaron ser variantes de prueba tempranas. "Duct tape" fue la variante instantánea. "Packingtape" era la compilación del modo de razonamiento.

Por qué el renderizado de texto era el gran reto

Del editor

Todos los modelos de IA en una sola app

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 y más en una sola app nativa para Mac y iPhone.

¡Descárgala ahora!

Durante tres años, todos los grandes modelos de imágenes han tratado el texto como una especie de textura. El modelo aprendió que «las letras tienen este aspecto» sin aprender qué significan palabras concretas como glifos. Por eso GPT-4o, Midjourney V7 y DALL-E 3 producían pósteres con texto incomprensible del tipo "WELCOOMM" en lugar de "WELCOME", y por eso los diseños densos (menús, infografías, packaging) se convertían en puro caos.

Woman using ChatGPT image tools generated with GPT-Image-2.0.

ChatGPT Images 2.0 trata el texto como un elemento de primer orden. Los revisores lo probaron con tarjetas de menú, acreditaciones de conferencias, packaging de productos y maquetaciones editoriales. El modelo mantiene la tipografía, el kerning, la jerarquía y la ortografía. Los titulares se mantienen nítidos a 2K. Los subtítulos pequeños siguen siendo legibles. SKUs, fechas, precios y etiquetas siguen el prompt en lugar de autocorregirse con jerigonza plausible.

Este es el cambio que convierte la generación de imágenes con IA de «suficientemente buena para un tablero de ideas» en «suficientemente buena para el entregable real».

A restaurant menu generated entirely by GPT-Image-2.0

Modo de razonamiento

ChatGPT Images 2.0 viene en dos modos.

Instant Mode genera imágenes rápidamente, priorizando la velocidad. Incluye todas las mejoras de renderizado de texto y multilingüismo. Es lo que todos los usuarios obtienen por defecto.

Thinking Mode añade una fase de razonamiento antes de la generación. El modelo puede buscar en la web, analizar materiales que subas (PDFs, capturas de pantalla, guías de marca), razonar sobre la maquetación antes de dibujar, generar hasta 8 resultados coherentes y verificar sus propias salidas antes de devolverlas. Puede tardar hasta dos minutos con un prompt complejo, mientras que Instant Mode responde en segundos.

Esto es lo que hace posibles las secuencias de manga de varias páginas, los storyboards de múltiples fotogramas y las infografías completas que inundaron las redes sociales desde el lanzamiento. La fase de razonamiento también explica por qué un solo prompt como «diseña una presentación de 4 diapositivas sobre el efecto túnel cuántico» produce realmente 4 diapositivas coherentes con un lenguaje visual consistente, en lugar de 4 imágenes sin relación que comparten un tema.

Photorealistic rice with peas on newspaper, highlighting texture and lighting generated by GPT-Image-2.0

Thinking Mode es la parte del lanzamiento que nadie esperaba del todo. Es, en la práctica, un modelo de razonamiento con un pincel.

Códigos QR funcionales y por qué son importantes

Los códigos QR parecen un truco de magia hasta que entiendes qué demuestran. Un código QR es una codificación matemática precisa. Un cuadrado incorrecto y el código deja de funcionar. Todos los modelos de imágenes anteriores producían imágenes con forma de QR que en realidad no funcionaban.

ChatGPT Images 2.0 genera códigos QR funcionales porque la fase de razonamiento del Thinking Mode calcula realmente la codificación antes de dibujar. El modelo también puede estilizar el QR con los colores de la marca, incrustar un logo en el centro y colocarlo dentro de un póster completamente diseñado. Para los equipos de marketing que antes necesitaban un generador de QR, un diseñador y una herramienta de maquetación para publicar una sola pieza de material, esto colapsa tres pasos en un solo prompt.

También señala lo que la arquitectura puede hacer más allá de las imágenes. Todo lo que requiere precisión en lugar de intuición (diagramas científicos, esquemas técnicos, mapas exactos) se vuelve viable.

Resolución y relaciones de aspecto

EspecificaciónGPT Image 1 (GPT-4o)ChatGPT Images 2.0
Resolución máxima1024 x 10242048 x 2048 (2K)
Relaciones de aspecto1:1, 2:3, 3:23:1 a 1:3 (continuo)
Imágenes por prompt1Hasta 8
Acceso webNoSí (thinking)
AutoverificaciónNoSí (thinking)
Corte de conocimientoOctubre de 2024Diciembre de 2025
Fondos transparentesLimitado

El rango de 3:1 a 1:3 cubre banners anchos, diapositivas, pósteres, Stories, miniaturas y verticales para TikTok, todo desde el mismo modelo sin necesidad de ampliación ni recorte. Eso elimina el incómodo flujo de trabajo de «generar cuadrado, recortar en Photoshop, perder la mitad de la composición» que ha sido el estándar desde DALL-E 2.

GPT-Image-2.0 allows generating images in much wider aspect ratios

Texto multilingüe

OpenAI destacó específicamente el japonés, el coreano, el chino, el hindi y el bengalí como los idiomas con mayores avances. Los revisores lo probaron y los resultados se leen como texto nativo, no como los caracteres incomprensibles que producía cualquier modelo de imágenes anterior.

El cambio más profundo es el manejo de scripts mixtos. El modelo puede renderizar un póster japonés con nombres de productos en latín, un menú de restaurante árabe con precios occidentales, o un subtítulo de película en chino sobre un título en inglés. Los diseños con scripts mixtos han estado rotos en todos los modelos de imágenes comerciales hasta ahora.

Para los mercados no angloparlantes, este es el primer modelo de imágenes con IA utilizable para trabajo de producción fuera del alfabeto latino. La tipografía en bengalí, hindi y devanagari en particular era prácticamente inutilizable en DALL-E 3 y Midjourney.

Precios y API

La API de gpt-image-2 ya está disponible. Los precios se basan en tokens:

Tipo de tokenPrecio
Tokens de entrada de imagen$8 por millón
Tokens de salida de imagen$30 por millón

El coste final por imagen depende del nivel de calidad y la resolución. Estimaciones por imagen a 1024 x 1024 estándar:

Nivel de calidadCoste por imagen
Bajo~$0,006
Medio~$0,053
Alto~$0,211

Las salidas 2K cuestan más en proporción a los tokens adicionales. Hay dos superficies de API: la Image API (ID de modelo gpt-image-2) para generación y edición de un solo disparo, y la Responses API con generación de imágenes como herramienta integrada. Los desarrolladores que quieran que su aplicación siga la versión de producción de ChatGPT pueden usar el alias chatgpt-image-latest, que se actualiza automáticamente.

Algunas cuentas de API necesitarán la Verificación de Organización de OpenAI antes de que los endpoints sean accesibles.

Disponibilidad por plan

Nivel de usuarioEstándarThinking Mode
ChatGPT gratuitoNo
ChatGPT Plus
ChatGPT ProSí (límites más altos)
ChatGPT Business
ChatGPT Enterprise
Usuarios de Codex
API (gpt-image-2)

La distribución en móviles se está realizando a través de la última actualización de la app de ChatGPT. DALL-E sigue disponible dentro de ChatGPT, pero ahora se posiciona como opción secundaria para usuarios con bibliotecas de prompts existentes o necesidades estilísticas concretas que DALL-E domina.

Cómo se compara

Las coberturas prácticas de VentureBeat, TechCrunch y TechRadar lo sitúan frente al resto del campo así:

CapacidadChatGPT Images 2.0Midjourney V8Nano Banana ProFlux 2
FotorrealismoExcelenteExcelenteMuy buenoExcelente
Renderizado de textoEl mejor de su claseBuenoMuy buenoBueno
Texto multilingüeEl mejor de su claseLimitadoBuenoLimitado
Razonamiento antes de generarNoNoNo
Búsqueda webNoNoNo
Consistencia entre imágenesHasta 8LimitadaHasta 4Limitada
Resolución máxima2K2K (escalada)~1,5K2K
Acceso a la APINo

ChatGPT Images 2.0 lidera en precisión de texto, soporte multilingüe y flujos de trabajo con razonamiento. Midjourney sigue teniendo ventaja en ciertos estilos visuales, especialmente en trabajos pictóricos e ilustrativos donde su dataset ajustado a preferencias antiguas se nota. Nano Banana Pro está más cerca en fotorrealismo de lo esperado y aún gana en velocidad bruta. Flux sigue siendo la opción de pesos abiertos más potente para equipos que necesitan autoalojar. Si no estás seguro de si un resultado es real, aquí te explicamos cómo detectar si una imagen ha sido generada por IA.

Los números de Image Arena

Un día después del lanzamiento, Arena.ai publicó los resultados del ranking y no hay comparación. GPT-Image-2 tomó el puesto n.º 1 en todas las categorías de Image Arena con los márgenes más grandes jamás registrados en la plataforma:

CategoríaPuntuación de GPT-Image-2Ventaja sobre el n.º 2
Text-to-Image (general)1512+242 sobre Nano-banana-2
Edición de imagen única1513+125 sobre Nano-banana-pro
Edición de múltiples imágenes1464+90 sobre Nano-banana-2

La ventaja de +242 puntos en Text-to-Image es la mayor brecha que Arena ha registrado jamás. Para contexto, las actualizaciones de modelos normalmente mueven el ranking entre 30 y 60 puntos.

GPT-Image-2 también arrasó en las 7 subcategorías de Text-to-Image, superando a su propio predecesor GPT-Image-1.5 por amplios márgenes:

  • Producto, branding y diseño comercial: +277 puntos
  • Imagen y modelado 3D: +274 puntos
  • Dibujos animados, anime y fantasía: +296 puntos
  • Imagen fotorrealista y cinematográfica: +247 puntos
  • Arte: +197 puntos
  • Retratos: +296 puntos
  • Renderizado de texto: +316 puntos

El salto de +316 puntos en renderizado de texto es el número titular y confirma lo que los revisores decían de forma anecdótica. El modelo no solo mejoró en texto. Elevó todo el techo.

Modelos a los que venció en todas las categorías: Nano-banana-2, variantes de Nano-Banana-Pro, MAI-Image-2, Reve-V1.5 y Grok-Imagine-Image.

Lo que todavía no puede hacer

No todo está resuelto. Los revisores señalaron algunos puntos débiles:

  • Las ediciones por región seleccionada son imprecisas. Cuando enmascaras un área concreta y pides un cambio, la edición puede desbordarse más allá de la máscara. Para trabajos de precisión, un prompt escrito que describa qué cambiar es actualmente más fiable que una selección espacial.
  • Thinking Mode es lento. Dos minutos para un prompt complejo está bien para trabajo de producción, pero lo hace poco viable para la exploración casual. La mayoría de los usuarios se quedarán en Instant Mode para los prompts del día a día.
  • Ilustración muy estilizada. La estética pictórica de Midjourney sigue teniendo ventaja para ilustración editorial y portadas de libros donde el ambiente importa más que la precisión.
  • Vídeo en vivo y animación. Este es un modelo de imágenes estáticas. Sora gestiona el movimiento por separado.
  • Consistencia de imagen de marca en sesiones largas. Ocho imágenes de un solo prompt son coherentes. Veinte a lo largo de múltiples sesiones siguen derivando.

Casos de uso

Flujos de trabajo destacados por OpenAI, la mayoría ya probados por revisores:

  • Creatividad de marketing: banners publicitarios, gráficos para redes sociales y maquetas de productos en múltiples formatos desde un solo prompt
  • Infografías y presentaciones: visuales con información densa y texto pequeño preciso, gráficos y etiquetas de datos
  • Storyboarding y prototipado de juegos: secuencias de 8 fotogramas con personajes consistentes y continuidad de iluminación y postura
  • Páginas de manga y cómics: maquetaciones de múltiples paneles con personajes consistentes y bocadillos de diálogo legibles
  • Diagramas educativos, mapas e ilustraciones científicas: etiquetas precisas, accidentes geográficos y escala
  • Maquetas de interfaz y producto: texto de interfaz legible y espaciado de componentes realista
  • Códigos QR con marca: códigos que realmente funcionan, integrados dentro de pósteres completamente diseñados
  • Creatividad localizada: pósteres, anuncios y packaging en idioma nativo para mercados internacionales
  • Portadas editoriales y de libros: maquetaciones con tipografía pesada y scripts no latinos

Para las agencias, esto colapsa tres o cuatro herramientas (generador de imágenes, app de maquetación, editor tipográfico, generador de QR) en un solo prompt. Para los creadores independientes, es la diferencia entre necesitar un diseñador y no necesitarlo.

Por qué Codex Labs se lanzó el mismo día

OpenAI también lanzó Codex Labs el 21 de abril, un servicio de formación técnica e integración para organizaciones que adoptan Codex. El lanzamiento simultáneo no es una coincidencia. Ambos productos señalan el mismo cambio: OpenAI está pasando de asistentes de chat genéricos a agentes especializados que se hacen cargo de flujos de trabajo completos. ChatGPT Images 2.0 se encarga del bucle creativo visual. Codex se encarga del bucle de ingeniería. Codex Labs es el brazo de consultoría que ayuda a las empresas a implantarlos de verdad.

Este patrón (lanzar un modelo especialista sólido y luego los servicios que lo llevan a producción) es lo que Anthropic y Google han estado haciendo durante el último año. Que OpenAI se ponga al día en el lado empresarial es quizás más importante desde el punto de vista estratégico que el propio modelo de imágenes.

Cómo probarlo

Para una guía completa con fórmulas de prompt y casos de uso para docentes, estudiantes, profesionales de marketing y trabajadores de oficina, consulta nuestra guía completa sobre cómo usar ChatGPT Images 2.0.

  1. En ChatGPT o Codex: abre un nuevo chat y escribe un prompt. Los usuarios gratuitos obtienen Instant Mode. Los usuarios de Plus y Pro pueden cambiar a un modelo de razonamiento para razonamiento, búsqueda web,….
  2. En móvil: actualiza a la última versión de la app de ChatGPT. El generador de imágenes ahora usa Images 2.0 por defecto.
  3. En la API: usa el ID de modelo gpt-image-2, o chatgpt-image-latest si quieres el alias de seguimiento de producción. Misma estructura de endpoint que gpt-image-1.
  4. En Fello AI: ChatGPT, Claude 4.6, Gemini 3 y DeepSeek están disponibles en una app nativa ligera para Mac, iPhone e iPad. La compatibilidad con GPT-Image-2 se añadirá en los próximos días. Prueba Fello AI.

Conclusión

Las filtraciones se quedaron cortas. Los rumores previos al lanzamiento se centraban en el renderizado de texto y las relaciones de aspecto, y ambos cumplieron. Nadie predijo que OpenAI añadiría un modelo de razonamiento completo al pipeline de imágenes y lanzaría búsqueda web, autoverificación, códigos QR funcionales y consistencia de 8 imágenes al mismo tiempo. Pusimos esa consistencia a prueba en un set de fotos de viaje a nueve destinos generado por IA desde un único selfie.

Por primera vez, un modelo de imágenes no solo genera píxeles. Planifica, investiga, redacta y revisa. Eso es una categoría distinta de herramienta, y va a redefinir el flujo de trabajo de todos los equipos que producen contenido visual.