Tras semanas de filtraciones y apariciones en LM Arena, OpenAI lanzó ChatGPT Images 2.0 el 21 de abril de 2026. El modelo subyacente, gpt-image-2, está disponible en ChatGPT, en Codex y en la API. Si el coste importa más que la potencia bruta, compara los mejores generadores de imágenes con IA gratuitos.
Es el primer modelo de imágenes de OpenAI con razonamiento integrado, el primero capaz de renderizar texto denso en japonés, coreano, chino, hindi y bengalí, y el primero que puede buscar en la web antes de dibujar un solo píxel. Además, lleva la generación de imágenes con IA más allá del «tablero de inspiración» y la convierte en algo que puedes usar directamente como material de producción.
Qué hay realmente de nuevo
ChatGPT Images 2.0 reemplaza el pipeline de imágenes de GPT-4o que ha impulsado ChatGPT durante el último año. La fecha de corte de conocimiento es diciembre de 2025, por lo que el modelo renderiza correctamente los logotipos de marcas actuales, diseños de productos, mapas geográficos y referencias culturales recientes en las que el modelo anterior alucinaría o se quedaría atascado en la versión de 2024.
OpenAI lo llama un motor creativo interactivo en lugar de un generador de un solo disparo. Ese enfoque importa porque el razonamiento, la búsqueda web y la generación de imágenes ahora funcionan en un solo bucle, y el modelo puede refinar su resultado en varios pasos dentro de la misma solicitud sin obligarte a regenerar desde cero.
Mejoras concretas:
- Hasta resolución 2K (2.048 píxeles de ancho) por imagen
- Relaciones de aspecto de 3:1 a 1:3, continuas en lugar de preajustes fijos
- Hasta 8 imágenes coherentes desde un solo prompt, con personajes, iluminación y estilo compartidos
- Códigos QR funcionales que se escanean con cualquier cámara de teléfono
- Búsqueda web durante la generación
- Autoverificación antes de la salida
- Exportación con fondo transparente para integración directa en pipelines
- Texto pequeño nítido, elementos de interfaz, iconografía y composiciones densas
Los nombres en clave de LM Arena "maskingtape" y "gaffertape" resultaron ser variantes de prueba tempranas. "Duct tape" fue la variante instantánea. "Packingtape" era la compilación del modo de razonamiento.
Por qué el renderizado de texto era el gran reto
Durante tres años, todos los grandes modelos de imágenes han tratado el texto como una especie de textura. El modelo aprendió que «las letras tienen este aspecto» sin aprender qué significan palabras concretas como glifos. Por eso GPT-4o, Midjourney V7 y DALL-E 3 producían pósteres con texto incomprensible del tipo "WELCOOMM" en lugar de "WELCOME", y por eso los diseños densos (menús, infografías, packaging) se convertían en puro caos.

ChatGPT Images 2.0 trata el texto como un elemento de primer orden. Los revisores lo probaron con tarjetas de menú, acreditaciones de conferencias, packaging de productos y maquetaciones editoriales. El modelo mantiene la tipografía, el kerning, la jerarquía y la ortografía. Los titulares se mantienen nítidos a 2K. Los subtítulos pequeños siguen siendo legibles. SKUs, fechas, precios y etiquetas siguen el prompt en lugar de autocorregirse con jerigonza plausible.
Este es el cambio que convierte la generación de imágenes con IA de «suficientemente buena para un tablero de ideas» en «suficientemente buena para el entregable real».

Modo de razonamiento
ChatGPT Images 2.0 viene en dos modos.
Instant Mode genera imágenes rápidamente, priorizando la velocidad. Incluye todas las mejoras de renderizado de texto y multilingüismo. Es lo que todos los usuarios obtienen por defecto.
Thinking Mode añade una fase de razonamiento antes de la generación. El modelo puede buscar en la web, analizar materiales que subas (PDFs, capturas de pantalla, guías de marca), razonar sobre la maquetación antes de dibujar, generar hasta 8 resultados coherentes y verificar sus propias salidas antes de devolverlas. Puede tardar hasta dos minutos con un prompt complejo, mientras que Instant Mode responde en segundos.
Esto es lo que hace posibles las secuencias de manga de varias páginas, los storyboards de múltiples fotogramas y las infografías completas que inundaron las redes sociales desde el lanzamiento. La fase de razonamiento también explica por qué un solo prompt como «diseña una presentación de 4 diapositivas sobre el efecto túnel cuántico» produce realmente 4 diapositivas coherentes con un lenguaje visual consistente, en lugar de 4 imágenes sin relación que comparten un tema.

Thinking Mode es la parte del lanzamiento que nadie esperaba del todo. Es, en la práctica, un modelo de razonamiento con un pincel.
Códigos QR funcionales y por qué son importantes
Los códigos QR parecen un truco de magia hasta que entiendes qué demuestran. Un código QR es una codificación matemática precisa. Un cuadrado incorrecto y el código deja de funcionar. Todos los modelos de imágenes anteriores producían imágenes con forma de QR que en realidad no funcionaban.
ChatGPT Images 2.0 genera códigos QR funcionales porque la fase de razonamiento del Thinking Mode calcula realmente la codificación antes de dibujar. El modelo también puede estilizar el QR con los colores de la marca, incrustar un logo en el centro y colocarlo dentro de un póster completamente diseñado. Para los equipos de marketing que antes necesitaban un generador de QR, un diseñador y una herramienta de maquetación para publicar una sola pieza de material, esto colapsa tres pasos en un solo prompt.
También señala lo que la arquitectura puede hacer más allá de las imágenes. Todo lo que requiere precisión en lugar de intuición (diagramas científicos, esquemas técnicos, mapas exactos) se vuelve viable.
Resolución y relaciones de aspecto
| Especificación | GPT Image 1 (GPT-4o) | ChatGPT Images 2.0 |
|---|---|---|
| Resolución máxima | 1024 x 1024 | 2048 x 2048 (2K) |
| Relaciones de aspecto | 1:1, 2:3, 3:2 | 3:1 a 1:3 (continuo) |
| Imágenes por prompt | 1 | Hasta 8 |
| Acceso web | No | Sí (thinking) |
| Autoverificación | No | Sí (thinking) |
| Corte de conocimiento | Octubre de 2024 | Diciembre de 2025 |
| Fondos transparentes | Limitado | Sí |
El rango de 3:1 a 1:3 cubre banners anchos, diapositivas, pósteres, Stories, miniaturas y verticales para TikTok, todo desde el mismo modelo sin necesidad de ampliación ni recorte. Eso elimina el incómodo flujo de trabajo de «generar cuadrado, recortar en Photoshop, perder la mitad de la composición» que ha sido el estándar desde DALL-E 2.

Texto multilingüe
OpenAI destacó específicamente el japonés, el coreano, el chino, el hindi y el bengalí como los idiomas con mayores avances. Los revisores lo probaron y los resultados se leen como texto nativo, no como los caracteres incomprensibles que producía cualquier modelo de imágenes anterior.
El cambio más profundo es el manejo de scripts mixtos. El modelo puede renderizar un póster japonés con nombres de productos en latín, un menú de restaurante árabe con precios occidentales, o un subtítulo de película en chino sobre un título en inglés. Los diseños con scripts mixtos han estado rotos en todos los modelos de imágenes comerciales hasta ahora.



Para los mercados no angloparlantes, este es el primer modelo de imágenes con IA utilizable para trabajo de producción fuera del alfabeto latino. La tipografía en bengalí, hindi y devanagari en particular era prácticamente inutilizable en DALL-E 3 y Midjourney.


Precios y API
La API de gpt-image-2 ya está disponible. Los precios se basan en tokens:
| Tipo de token | Precio |
|---|---|
| Tokens de entrada de imagen | $8 por millón |
| Tokens de salida de imagen | $30 por millón |
El coste final por imagen depende del nivel de calidad y la resolución. Estimaciones por imagen a 1024 x 1024 estándar:
| Nivel de calidad | Coste por imagen |
|---|---|
| Bajo | ~$0,006 |
| Medio | ~$0,053 |
| Alto | ~$0,211 |
Las salidas 2K cuestan más en proporción a los tokens adicionales. Hay dos superficies de API: la Image API (ID de modelo gpt-image-2) para generación y edición de un solo disparo, y la Responses API con generación de imágenes como herramienta integrada. Los desarrolladores que quieran que su aplicación siga la versión de producción de ChatGPT pueden usar el alias chatgpt-image-latest, que se actualiza automáticamente.
Algunas cuentas de API necesitarán la Verificación de Organización de OpenAI antes de que los endpoints sean accesibles.
Disponibilidad por plan
| Nivel de usuario | Estándar | Thinking Mode |
|---|---|---|
| ChatGPT gratuito | Sí | No |
| ChatGPT Plus | Sí | Sí |
| ChatGPT Pro | Sí | Sí (límites más altos) |
| ChatGPT Business | Sí | Sí |
| ChatGPT Enterprise | Sí | Sí |
| Usuarios de Codex | Sí | Sí |
| API (gpt-image-2) | Sí | Sí |
La distribución en móviles se está realizando a través de la última actualización de la app de ChatGPT. DALL-E sigue disponible dentro de ChatGPT, pero ahora se posiciona como opción secundaria para usuarios con bibliotecas de prompts existentes o necesidades estilísticas concretas que DALL-E domina.
Cómo se compara
Las coberturas prácticas de VentureBeat, TechCrunch y TechRadar lo sitúan frente al resto del campo así:
| Capacidad | ChatGPT Images 2.0 | Midjourney V8 | Nano Banana Pro | Flux 2 |
|---|---|---|---|---|
| Fotorrealismo | Excelente | Excelente | Muy bueno | Excelente |
| Renderizado de texto | El mejor de su clase | Bueno | Muy bueno | Bueno |
| Texto multilingüe | El mejor de su clase | Limitado | Bueno | Limitado |
| Razonamiento antes de generar | Sí | No | No | No |
| Búsqueda web | Sí | No | No | No |
| Consistencia entre imágenes | Hasta 8 | Limitada | Hasta 4 | Limitada |
| Resolución máxima | 2K | 2K (escalada) | ~1,5K | 2K |
| Acceso a la API | Sí | No | Sí | Sí |
ChatGPT Images 2.0 lidera en precisión de texto, soporte multilingüe y flujos de trabajo con razonamiento. Midjourney sigue teniendo ventaja en ciertos estilos visuales, especialmente en trabajos pictóricos e ilustrativos donde su dataset ajustado a preferencias antiguas se nota. Nano Banana Pro está más cerca en fotorrealismo de lo esperado y aún gana en velocidad bruta. Flux sigue siendo la opción de pesos abiertos más potente para equipos que necesitan autoalojar. Si no estás seguro de si un resultado es real, aquí te explicamos cómo detectar si una imagen ha sido generada por IA.




Los números de Image Arena
Un día después del lanzamiento, Arena.ai publicó los resultados del ranking y no hay comparación. GPT-Image-2 tomó el puesto n.º 1 en todas las categorías de Image Arena con los márgenes más grandes jamás registrados en la plataforma:
| Categoría | Puntuación de GPT-Image-2 | Ventaja sobre el n.º 2 |
|---|---|---|
| Text-to-Image (general) | 1512 | +242 sobre Nano-banana-2 |
| Edición de imagen única | 1513 | +125 sobre Nano-banana-pro |
| Edición de múltiples imágenes | 1464 | +90 sobre Nano-banana-2 |
La ventaja de +242 puntos en Text-to-Image es la mayor brecha que Arena ha registrado jamás. Para contexto, las actualizaciones de modelos normalmente mueven el ranking entre 30 y 60 puntos.
GPT-Image-2 también arrasó en las 7 subcategorías de Text-to-Image, superando a su propio predecesor GPT-Image-1.5 por amplios márgenes:
- Producto, branding y diseño comercial: +277 puntos
- Imagen y modelado 3D: +274 puntos
- Dibujos animados, anime y fantasía: +296 puntos
- Imagen fotorrealista y cinematográfica: +247 puntos
- Arte: +197 puntos
- Retratos: +296 puntos
- Renderizado de texto: +316 puntos
El salto de +316 puntos en renderizado de texto es el número titular y confirma lo que los revisores decían de forma anecdótica. El modelo no solo mejoró en texto. Elevó todo el techo.
Modelos a los que venció en todas las categorías: Nano-banana-2, variantes de Nano-Banana-Pro, MAI-Image-2, Reve-V1.5 y Grok-Imagine-Image.
Lo que todavía no puede hacer
No todo está resuelto. Los revisores señalaron algunos puntos débiles:
- Las ediciones por región seleccionada son imprecisas. Cuando enmascaras un área concreta y pides un cambio, la edición puede desbordarse más allá de la máscara. Para trabajos de precisión, un prompt escrito que describa qué cambiar es actualmente más fiable que una selección espacial.
- Thinking Mode es lento. Dos minutos para un prompt complejo está bien para trabajo de producción, pero lo hace poco viable para la exploración casual. La mayoría de los usuarios se quedarán en Instant Mode para los prompts del día a día.
- Ilustración muy estilizada. La estética pictórica de Midjourney sigue teniendo ventaja para ilustración editorial y portadas de libros donde el ambiente importa más que la precisión.
- Vídeo en vivo y animación. Este es un modelo de imágenes estáticas. Sora gestiona el movimiento por separado.
- Consistencia de imagen de marca en sesiones largas. Ocho imágenes de un solo prompt son coherentes. Veinte a lo largo de múltiples sesiones siguen derivando.
Casos de uso
Flujos de trabajo destacados por OpenAI, la mayoría ya probados por revisores:
- Creatividad de marketing: banners publicitarios, gráficos para redes sociales y maquetas de productos en múltiples formatos desde un solo prompt
- Infografías y presentaciones: visuales con información densa y texto pequeño preciso, gráficos y etiquetas de datos
- Storyboarding y prototipado de juegos: secuencias de 8 fotogramas con personajes consistentes y continuidad de iluminación y postura
- Páginas de manga y cómics: maquetaciones de múltiples paneles con personajes consistentes y bocadillos de diálogo legibles
- Diagramas educativos, mapas e ilustraciones científicas: etiquetas precisas, accidentes geográficos y escala
- Maquetas de interfaz y producto: texto de interfaz legible y espaciado de componentes realista
- Códigos QR con marca: códigos que realmente funcionan, integrados dentro de pósteres completamente diseñados
- Creatividad localizada: pósteres, anuncios y packaging en idioma nativo para mercados internacionales
- Portadas editoriales y de libros: maquetaciones con tipografía pesada y scripts no latinos
Para las agencias, esto colapsa tres o cuatro herramientas (generador de imágenes, app de maquetación, editor tipográfico, generador de QR) en un solo prompt. Para los creadores independientes, es la diferencia entre necesitar un diseñador y no necesitarlo.
Por qué Codex Labs se lanzó el mismo día
OpenAI también lanzó Codex Labs el 21 de abril, un servicio de formación técnica e integración para organizaciones que adoptan Codex. El lanzamiento simultáneo no es una coincidencia. Ambos productos señalan el mismo cambio: OpenAI está pasando de asistentes de chat genéricos a agentes especializados que se hacen cargo de flujos de trabajo completos. ChatGPT Images 2.0 se encarga del bucle creativo visual. Codex se encarga del bucle de ingeniería. Codex Labs es el brazo de consultoría que ayuda a las empresas a implantarlos de verdad.
Este patrón (lanzar un modelo especialista sólido y luego los servicios que lo llevan a producción) es lo que Anthropic y Google han estado haciendo durante el último año. Que OpenAI se ponga al día en el lado empresarial es quizás más importante desde el punto de vista estratégico que el propio modelo de imágenes.




Cómo probarlo
Para una guía completa con fórmulas de prompt y casos de uso para docentes, estudiantes, profesionales de marketing y trabajadores de oficina, consulta nuestra guía completa sobre cómo usar ChatGPT Images 2.0.
- En ChatGPT o Codex: abre un nuevo chat y escribe un prompt. Los usuarios gratuitos obtienen Instant Mode. Los usuarios de Plus y Pro pueden cambiar a un modelo de razonamiento para razonamiento, búsqueda web,….
- En móvil: actualiza a la última versión de la app de ChatGPT. El generador de imágenes ahora usa Images 2.0 por defecto.
- En la API: usa el ID de modelo
gpt-image-2, ochatgpt-image-latestsi quieres el alias de seguimiento de producción. Misma estructura de endpoint quegpt-image-1. - En Fello AI: ChatGPT, Claude 4.6, Gemini 3 y DeepSeek están disponibles en una app nativa ligera para Mac, iPhone e iPad. La compatibilidad con GPT-Image-2 se añadirá en los próximos días. Prueba Fello AI.
Conclusión
Las filtraciones se quedaron cortas. Los rumores previos al lanzamiento se centraban en el renderizado de texto y las relaciones de aspecto, y ambos cumplieron. Nadie predijo que OpenAI añadiría un modelo de razonamiento completo al pipeline de imágenes y lanzaría búsqueda web, autoverificación, códigos QR funcionales y consistencia de 8 imágenes al mismo tiempo. Pusimos esa consistencia a prueba en un set de fotos de viaje a nueve destinos generado por IA desde un único selfie.
Por primera vez, un modelo de imágenes no solo genera píxeles. Planifica, investiga, redacta y revisa. Eso es una categoría distinta de herramienta, y va a redefinir el flujo de trabajo de todos los equipos que producen contenido visual.