Depois de semanas de fugas de informação e aparições no LM Arena, a OpenAI lançou o ChatGPT Images 2.0 a 21 de abril de 2026. O modelo subjacente, gpt-image-2, está disponível no ChatGPT, no Codex e na API. Se o custo é mais importante do que o desempenho máximo, compare com os melhores geradores de imagens de IA gratuitos.

Este é o primeiro modelo de imagem da OpenAI com raciocínio integrado, o primeiro capaz de renderizar texto denso em japonês, coreano, chinês, hindi e bengali, e o primeiro que pode pesquisar na web antes de desenhar um único pixel. Representa também a transição da geração de imagens de IA da fase de «quadro de inspiração» para algo que pode ser utilizado diretamente como ativo de produção.

O que há de realmente novo

O ChatGPT Images 2.0 substitui o pipeline de imagem GPT-4o que alimentou o ChatGPT no último ano. O corte de conhecimento é dezembro de 2025, pelo que o modelo renderiza corretamente logótipos de marcas atuais, designs de produtos, mapas geográficos e referências culturais recentes que o modelo anterior alucinava ou ficava preso numa versão de 2024.

A OpenAI designa-o como um motor criativo interativo em vez de um gerador de imagem única. Esta distinção é importante porque o raciocínio, a pesquisa na web e a geração de imagens funcionam agora num único ciclo, e o modelo pode refinar os resultados em várias passagens dentro do mesmo pedido, sem obrigar a gerar de novo a partir do zero.

Melhorias concretas:

  • Até resolução 2K (2048 píxeis de largura) por resultado
  • Proporções de 3:1 a 1:3, contínuas em vez de predefinidas
  • Até 8 imagens coerentes a partir de um único prompt, com personagens, iluminação e estilo partilhados
  • Códigos QR funcionais que qualquer câmara de telemóvel consegue ler
  • Pesquisa na web durante a geração
  • Auto-verificação antes do resultado final
  • Exportações com fundo transparente para integração direta em pipelines
  • Texto pequeno nítido, elementos de interface, iconografia e composições densas

Os codinomes do LM Arena «maskingtape» e «gaffertape» revelaram ser variantes de teste iniciais. «Duct tape» foi a variante instantânea. «Packingtape» foi a versão com modo de raciocínio.

Por que a renderização de texto era o problema difícil

Do editor

Todos os modelos de IA numa só aplicação

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 e mais numa só aplicação nativa para Mac e iPhone.

Descarregue já!

Durante três anos, todos os principais modelos de imagem trataram o texto como uma espécie de textura. O modelo aprendeu que «as letras têm este aspeto» sem aprender o que palavras específicas significam enquanto glifos. Por isso o GPT-4o, o Midjourney V7 e o DALL-E 3 produziam cartazes com texto «WELCOOMM» deformado em vez de «WELCOME», e por isso os layouts densos (menus, infográficos, embalagens) colapsavam em disparate.

Woman using ChatGPT image tools generated with GPT-Image-2.0.

O ChatGPT Images 2.0 trata o texto como um elemento de primeira classe. Os avaliadores testaram-no com menus, credenciais de conferência, embalagens de produtos e layouts editoriais. O modelo mantém a tipografia, o kerning, a hierarquia e a ortografia. Os títulos ficam nítidos a 2K. As legendas pequenas continuam legíveis. SKUs, datas, preços e rótulos seguem o prompt em vez de serem autocorrigidos para disparate com aparência plausível.

Esta é a mudança que transforma a geração de imagens de IA de «suficientemente boa para um quadro de humor» em «suficientemente boa para o entregável final».

A restaurant menu generated entirely by GPT-Image-2.0

Modo de Raciocínio

O ChatGPT Images 2.0 está disponível em dois modos.

Modo Instantâneo gera rapidamente, dando prioridade à velocidade. Inclui a renderização de texto completa e as melhorias multilingues. É o que todos os utilizadores obtêm por omissão.

Modo de Raciocínio acrescenta uma passagem de raciocínio antes da geração. O modelo pode pesquisar na web, analisar materiais que carregue (PDFs, capturas de ecrã, diretrizes de marca), raciocinar sobre o layout antes de desenhar, gerar até 8 resultados coerentes e verificar os seus próprios resultados antes de os devolver. Pode demorar até dois minutos num prompt complexo, enquanto o Modo Instantâneo responde em segundos.

É isto que permite as longas sequências de manga, os storyboards com múltiplos fotogramas e os infográficos completos que inundaram as redes sociais desde o lançamento. A passagem de raciocínio é também a razão pela qual um único prompt como «cria uma apresentação de 4 diapositivos a explicar o efeito de túnel quântico» produz efetivamente 4 diapositivos coerentes com uma linguagem de design consistente, em vez de 4 imagens sem relação que partilham apenas um tema.

Photorealistic rice with peas on newspaper, highlighting texture and lighting generated by GPT-Image-2.0

O Modo de Raciocínio é a parte do lançamento que ninguém esperava. É efetivamente um modelo de raciocínio com um pincel.

Códigos QR funcionais e por que razão importam

Os códigos QR parecem um truque de salão até perceber o que provam. Um código QR é uma codificação matemática precisa. Um quadrado errado e o código não é lido. Todos os modelos de imagem anteriores produziam imagens com aspeto de código QR que na prática não funcionavam.

O ChatGPT Images 2.0 gera códigos QR funcionais porque a passagem de raciocínio do modo de raciocínio calcula efetivamente a codificação antes de desenhar. O modelo também consegue estilizar o QR com as cores da marca, incorporar um logótipo ao centro e integrá-lo num cartaz totalmente concebido. Para as equipas de marketing que antes precisavam de um gerador de QR, um designer e uma ferramenta de layout para publicar um único material de comunicação, isto colapsa três etapas num único prompt.

Sinais também o que a arquitetura consegue fazer além das imagens. Tudo o que exige precisão em vez de intuição: diagramas científicos, esquemas técnicos, mapas rigorosos, torna-se viável.

Resolução e proporções

EspecificaçãoGPT Image 1 (GPT-4o)ChatGPT Images 2.0
Resolução máxima1024 x 10242048 x 2048 (2K)
Proporções1:1, 2:3, 3:23:1 a 1:3 (contínuas)
Imagens por prompt1Até 8
Acesso à webNãoSim (raciocínio)
Auto-verificaçãoNãoSim (raciocínio)
Corte de conhecimentooutubro de 2024dezembro de 2025
Fundos transparentesLimitadoSim

O intervalo de 3:1 a 1:3 abrange banners largos, diapositivos, cartazes, Stories, miniaturas e verticais para TikTok, tudo a partir do mesmo modelo sem necessidade de ampliação ou recorte. Elimina o fluxo de trabalho incómodo de «gerar quadrado, recortar no Photoshop, perder metade da composição» que tem sido padrão desde o DALL-E 2.

GPT-Image-2.0 allows generating images in much wider aspect ratios

Texto multilingue

A OpenAI destacou especificamente o japonês, o coreano, o chinês, o hindi e o bengali como línguas com ganhos significativos. Os avaliadores testaram-no e os resultados lêem-se como texto nativo, não como os caracteres incompreensíveis que todos os modelos de imagem anteriores produziam.

A mudança mais profunda é o tratamento de scripts mistos. O modelo consegue renderizar um cartaz japonês com nomes de produtos em caracteres latinos, um menu árabe de restaurante com preços ocidentais, ou uma legenda de filme chinesa sobre um título em inglês. Os layouts com scripts mistos estavam quebrados em todos os modelos de imagem comerciais até agora.

Para mercados fora do espaço anglófono, este é o primeiro modelo de IA de imagem utilizável para trabalho de produção fora do alfabeto latino. A tipografia em bengali, hindi e Devanagari em particular era essencialmente inutilizável no DALL-E 3 e no Midjourney.

Preços e API

A API gpt-image-2 está disponível. O preço é baseado em tokens:

Tipo de tokenPreço
Tokens de entrada de imagem$8 por milhão
Tokens de saída de imagem$30 por milhão

O custo final por imagem depende do nível de qualidade e da resolução. Estimativas por imagem no padrão 1024 x 1024:

Nível de qualidadeCusto por imagem
Baixo~$0.006
Médio~$0.053
Alto~$0.211

Os resultados 2K custam mais, em proporção com os tokens adicionais. Existem duas superfícies de API: a Image API (ID de modelo gpt-image-2) para geração e edição de imagem única, e a Responses API com geração de imagem como ferramenta integrada. Os programadores que pretendam que a sua aplicação siga a versão de produção do ChatGPT podem utilizar o alias chatgpt-image-latest, que se atualiza automaticamente.

Algumas contas de API poderão precisar de Verificação de Organização OpenAI antes de os endpoints ficarem acessíveis.

Disponibilidade por plano

Nível de utilizadorPadrãoModo de Raciocínio
ChatGPT gratuitoSimNão
ChatGPT PlusSimSim
ChatGPT ProSimSim (limites mais elevados)
ChatGPT BusinessSimSim
ChatGPT EnterpriseSimSim
Utilizadores CodexSimSim
API (gpt-image-2)SimSim

A disponibilização em dispositivos móveis está a acontecer através da atualização mais recente da aplicação ChatGPT. O DALL-E continua disponível dentro do ChatGPT, mas é agora apresentado como opção secundária para utilizadores com bibliotecas de prompts existentes ou necessidades estilísticas específicas que o DALL-E satisfaz particularmente bem.

Como se compara

A cobertura prática do VentureBeat, do TechCrunch e do TechRadar coloca-o face à concorrência da seguinte forma:

CapacidadeChatGPT Images 2.0Midjourney V8Nano Banana ProFlux 2
FotorrealismoExcelenteExcelenteMuito bomExcelente
Renderização de textoMelhor da categoriaBomMuito bomBom
Texto multilingueMelhor da categoriaLimitadoBomLimitado
Raciocínio antes da geraçãoSimNãoNãoNão
Pesquisa na webSimNãoNãoNão
Consistência de múltiplas imagensAté 8LimitadoAté 4Limitado
Resolução máxima2K2K (ampliado)~1,5K2K
Acesso à APISimNãoSimSim

O ChatGPT Images 2.0 lidera na precisão de texto, no suporte multilingue e nos fluxos de trabalho com raciocínio. O Midjourney ainda tem vantagem em determinadas estéticas estilizadas, particularmente no trabalho pictórico e ilustrativo onde o seu conjunto de dados antigo ajustado por preferências se nota. O Nano Banana Pro aproxima-se mais do que o esperado no fotorrealismo e continua a ganhar em velocidade bruta. O Flux permanece a opção de pesos abertos mais sólida para equipas que precisam de alojamento próprio. Se tiver dúvidas sobre se um resultado é real, veja como perceber se uma imagem foi gerada por IA.

Os números do Image Arena

Um dia após o lançamento, o Arena.ai publicou os resultados da tabela de líderes e não há margem para dúvidas. O GPT-Image-2 ficou em #1 em todas as categorias do Image Arena com as maiores margens alguma vez registadas na plataforma:

CategoriaPontuação GPT-Image-2Vantagem sobre o #2
Text-to-Image (geral)1512+242 sobre Nano-banana-2
Edição de imagem única1513+125 sobre Nano-banana-pro
Edição de múltiplas imagens1464+90 sobre Nano-banana-2

A vantagem de +242 pontos em Text-to-Image é a maior diferença alguma vez registada pelo Arena. Para contextualizar, as atualizações de modelo movem tipicamente a tabela entre 30 e 60 pontos.

O GPT-Image-2 varreu ainda todas as 7 subcategorias de Text-to-Image, superando o seu predecessor GPT-Image-1.5 por margens expressivas:

  • Design de Produto, Marca e Comercial: +277 pontos
  • Imagem e Modelação 3D: +274 pontos
  • Cartoon, Anime e Fantasia: +296 pontos
  • Imagem Fotorrealista e Cinematográfica: +247 pontos
  • Arte: +197 pontos
  • Retratos: +296 pontos
  • Renderização de Texto: +316 pontos

O salto de +316 pontos em Renderização de Texto é o número de destaque e confirma o que os avaliadores diziam de forma anedótica. O modelo não melhorou apenas no texto. Deslocou todo o teto.

Os modelos que derrotou em todas as categorias: Nano-banana-2, variantes Nano-Banana-Pro, MAI-Image-2, Reve-V1.5 e Grok-Imagine-Image.

O que ainda não consegue fazer

Nem tudo está resolvido. Os avaliadores sinalizaram alguns pontos menos conseguidos:

  • As edições por região selecionada são imprecisas. Quando se mascara uma área específica e se pede uma alteração, a edição pode transbordar para além da máscara. Para trabalho de precisão, um prompt escrito a descrever o que alterar é atualmente mais fiável do que uma seleção espacial.
  • O Modo de Raciocínio é lento. Dois minutos para um prompt complexo está bem para trabalho de produção, mas inviabiliza a exploração casual. A maioria dos utilizadores manterá o Modo Instantâneo para prompts do dia a dia.
  • Ilustração altamente estilizada. A estética pictórica do Midjourney ainda tem vantagem para ilustração editorial e capas de livros onde o ambiente importa mais do que a precisão.
  • Vídeo em direto e animação. Este é um modelo de imagens estáticas. O Sora trata o movimento separadamente.
  • Consistência da identidade de marca em sessões longas. Oito imagens a partir de um prompt são consistentes. Vinte ao longo de múltiplas sessões ainda derivam.

Casos de utilização

Fluxos de trabalho destacados pela OpenAI, a maioria já testados por avaliadores:

  • Criativo de marketing: anúncios em banner, gráficos para redes sociais, maquetes de produtos em vários formatos a partir de um único prompt
  • Infográficos e diapositivos: visuais densos em informação com texto pequeno rigoroso, gráficos e rótulos de dados
  • Storyboarding e prototipagem de jogos: sequências de personagens coerentes em 8 fotogramas com continuidade de iluminação e pose
  • Páginas de manga e banda desenhada: layouts de múltiplos painéis com personagens consistentes e balões de fala legíveis
  • Diagramas educativos, mapas e ilustrações científicas: rótulos rigorosos, elementos geográficos, escala
  • Maquetes de interface e produto: texto de interface legível e espaçamento realista de componentes
  • Códigos QR de marca: códigos que realmente funcionam, integrados em cartazes totalmente desenhados
  • Criativo localizado: cartazes, anúncios e embalagens em língua nativa para mercados internacionais
  • Editorial e capas de livros: layouts com tipografia densa e scripts não latinos

Para agências, isto colapsa três ou quatro ferramentas (gerador de imagens, aplicação de layout, editor de tipografia, gerador de QR) num único prompt. Para criadores independentes, é a diferença entre precisar de um designer e não precisar.

Por que razão o Codex Labs foi lançado no mesmo dia

A OpenAI também lançou o Codex Labs a 21 de abril, um serviço de formação técnica e integração para organizações que adotam o Codex. O lançamento no mesmo dia não é coincidência. Ambos os produtos sinalizam a mesma mudança: a OpenAI está a passar de assistentes de chat genéricos para agentes especializados que dominam fluxos de trabalho completos. O ChatGPT Images 2.0 domina o ciclo criativo visual. O Codex domina o ciclo de engenharia. O Codex Labs é o braço de consultoria que ajuda as empresas a implementá-los efetivamente.

Este padrão (lançar um modelo especialista sólido, depois lançar os serviços que o colocam em produção) é o que a Anthropic e a Google têm feito no último ano. A aproximação da OpenAI ao lado empresarial é, a nível estratégico, argumentavelmente mais importante do que o próprio modelo de imagem.

Como experimentar

Para um guia completo com fórmulas de prompt e casos de utilização para professores, estudantes, profissionais de marketing e trabalhadores de escritório, consulte o nosso guia completo sobre como usar o ChatGPT Images 2.0.

  1. No ChatGPT ou no Codex: abra uma nova conversa e escreva o prompt. Os utilizadores gratuitos obtêm o Modo Instantâneo. Os utilizadores Plus e Pro podem mudar para um modelo de raciocínio para raciocínio, pesquisa na web…
  2. Em dispositivos móveis: atualize para a versão mais recente da aplicação ChatGPT. O gerador de imagens passa agora a usar o Images 2.0 por omissão.
  3. Na API: utilize o ID de modelo gpt-image-2, ou chatgpt-image-latest se preferir o alias de produção rastreado. A estrutura do endpoint é a mesma que a do gpt-image-1.
  4. No Fello AI: ChatGPT, Claude 4.6, Gemini 3 e DeepSeek disponíveis numa aplicação nativa e leve para Mac, iPhone e iPad. O suporte ao GPT-Image-2 será adicionado em breve. Experimente o Fello AI.

Conclusão

As fugas de informação subestimaram este lançamento. Os rumores pré-lançamento focavam-se na renderização de texto e nas proporções, e ambas cumpriram. Ninguém previu que a OpenAI fosse integrar um modelo de raciocínio completo no pipeline de imagem e lançar ao mesmo tempo pesquisa na web, auto-verificação, códigos QR funcionais e consistência de 8 imagens. Pusemos essa consistência à prova num conjunto de fotografias de viagem de IA de nove destinos gerado a partir de uma única selfie original.

Pela primeira vez, um modelo de imagem não se limita a gerar píxeis. Planeia, pesquisa, esboça e revê. É uma categoria diferente de ferramenta, e vai remodelar o fluxo de trabalho de todas as equipas que produzem conteúdo visual.