Atualizado em agosto de 2026

Melhores modelos de IA em 2026

Classificações, comparações e análises aprofundadas, atualizadas todos os meses à medida que chegam novos modelos.

Agosto de 2026 abre com o Claude Opus 5 no topo e duas coroas a mudar de mãos. O Opus 5 lidera o Intelligence Index da Artificial Analysis com 61 e o seu Agentic Index com 55,3 a $5 / $25 por 1M de tokens, metade do preço do Claude Fable 5, e assumiu agora a coroa da programação depois de terminar em primeiro nos dois quadros de programação por votos da Arena. O outro movimento dá-se na extremidade económica, onde o DeepSeek V4-Flash 0731 chegou a 31 de julho como a nova escolha de relação preço-desempenho a $0.14 / $0.28. Abaixo estão os vencedores por categoria de agosto de 2026. Clique em qualquer cartão para saltar diretamente para a análise completa, ou utilize a navegação fixa para passar de categoria em categoria. As classificações, benchmarks e preços são atualizados no prazo de 48 horas após o lançamento de qualquer modelo importante.

Vencedores por categoria de agosto de 2026
Escrita
Claude Fable 5
#1 Arena texto (1508.6) e Humanity's Last Exam
O único modelo entre os três primeiros dos três quadros independentes de escrita, a $10 / $50.
Análise aprofundada →
Chat & assistente do dia a dia
GPT-5.6
Modelo predefinido do ChatGPT desde 9 de julho
O melhor assistente que a maioria das pessoas consegue realmente abrir, equilibrando capacidade, velocidade e alcance.
Análise aprofundada →
Imagens
ChatGPT Images 2.0
#1 em texto para imagem e em edição de imagens
Lidera os dois quadros independentes de imagem e continua a ser o melhor em texto multilíngue legível.
Análise aprofundada →
Vídeo
Gemini Omni Flash
#1 nos dois quadros de vídeo (1527 Arena)
Lidera os dois quadros independentes de vídeo com edição conversacional a cerca de $0.10 por segundo.
Análise aprofundada →
Programação
Claude Opus 5
#1 Arena WebDev (1,702.9) a $5 / $25
Assume a coroa da programação nos quadros por votos, a metade do preço do Claude Fable 5.
Análise aprofundada →
Criatividade
Grok 4.5
Menos restrições de conteúdo + X nativo em tempo real
A escolha para trabalho ousado e na moda: menos barreiras e integração nativa com o X.
Análise aprofundada →
Precisão & investigação
Gemini 3.1 Pro
98 % no ARC-AGI-1 a $0.52 por tarefa
Iguala o painel humano no ARC-AGI-1 com ancoragem nativa na Pesquisa Google para respostas em direto.
Análise aprofundada →
Resolução de problemas
GPT-5.6 Sol
#1 LiveBench Mathematics, Reasoning e ARC-AGI-2
A coroa mais bem fundamentada desta página para a matemática, a ciência e o raciocínio mais difíceis.
Análise aprofundada →
Agentes de IA
Gemini Spark
Primeiro agente de IA residente na cloud 24/7
Funciona continuamente numa VM da Google Cloud, profundamente integrado com o Gmail, o Docs e o Chrome.
Análise aprofundada →
Novidades de agosto de 2026
5 ago. Meta Muse Spark 1.2 e Muse Code, Intelligence Index de 51 para 54 a um valor inalterado de $1.25 / $4.25, mais um agente de programação em terminal Novo
A Meta lançou o Muse Spark 1.2 a 5 de agosto de 2026 a par do Muse Code, o seu primeiro agente de programação em terminal, que funciona em macOS e Linux sem aplicação de ambiente de trabalho e sem subscrição. A Artificial Analysis pontua o modelo com um Intelligence Index de 54 na sua definição de raciocínio mais elevada, contra 51 para a 1.1 e 43 para a versão de abril, e quase todo esse ganho é agêntico em vez de conhecimento geral; o seu Elo GDPval-AA v2 saltou de 1371 para 1631 enquanto o Terminal-Bench v2.1 passou apenas de 78 % para 80 %. O preço mantém-se inalterado em $1.25 / $4.25 por 1M de tokens sobre uma janela de contexto de 1M de tokens, e a Meta acrescentou um nível Contributor a $0.10 / $0.20, cerca de 92 % mais barato, em troca de permitir que a Meta treine com os seus prompts e completions. A disponibilidade alargou-se do acesso antecipado apenas para os EUA sob o qual a 1.1 foi lançada para um acesso global ampliado através do Muse Code, da Meta Model API e do OpenRouter. Nos próprios gráficos de lançamento da Meta, o modelo termina em segundo atrás do Claude Opus 5 nos três benchmarks de programação que publicou, com 82,9 % contra 86,7 % no Terminal-Bench 2.1.
3 ago. Alibaba Qwen 3.8 (Qwen3.8-Max), modelo de topo multimodal de 2,4 biliões de parâmetros agora disponível para todos a $2 / $6 Novo
A Alibaba disponibilizou o Qwen3.8-Max para todos a 3 de agosto de 2026, duas semanas depois de o apresentar em pré-visualização no WAIC Shanghai, e cada número que faltava na pré-visualização tem agora um valor por trás. Corre 2,4 biliões de parâmetros no total com cerca de 95 mil milhões ativos por token num desenho Mixture-of-Experts esparso, aceita texto, imagens e vídeo, e confirma uma janela de contexto de 1M de tokens com até 128K tokens de saída. O preço da API é de $2 / $6 por 1M de tokens, plano em todo o contexto em vez de escalonado por comprimento do prompt, com leituras em cache a $0.25. A afirmação «apenas atrás do Fable 5» divide-se agora nitidamente em duas: no quadro de visão da Arena é #2 com 1305, apenas atrás do Fable 5, mas no quadro de texto é #5 com 1496, atrás de quatro entradas da Anthropic. Ambas as pontuações da Arena continuam assinaladas como preliminares, e os open weights prometidos não chegaram. Mantemos o Qwen 3.8 fora das escolhas classificadas até os pesos e a licença chegarem de facto.
31 jul. DeepSeek DeepSeek V4-Flash 0731, mesmo preço, mesmo tamanho, Intelligence Index de 40 para 50 Novo
A DeepSeek voltou a pós-treinar o V4-Flash e publicou o resultado a 31 de julho de 2026 como DeepSeek-V4-Flash-0731. Nada na forma do modelo mudou: é o mesmo Mixture-of-Experts de 284B no total / 13B ativos, o mesmo contexto de 1M de tokens, a mesma licença MIT e os mesmos $0.14 / $0.28 por 1M de tokens na própria tabela de preços da DeepSeek. O que se moveu foi a capacidade. A Artificial Analysis pontua-o agora com um Intelligence Index de 50, contra 40, com Agentic 45,7 e 78,7 % no Terminal-Bench v2.1, o que o eleva de cerca do décimo terceiro para o terceiro lugar no campo aberto atrás do Kimi K3 e do GLM-5.2. A $0.03 por tarefa de índice é o valor mais barato de todo o quadro da Artificial Analysis, e é isso que moveu a nossa escolha de relação preço-desempenho este mês. Uma limitação honesta: a pontuação tem um dia, vem de uma única casa, e o modelo ainda não tem votos em nenhum quadro da Arena.
31 jul. MiniMax MiniMax H3, vídeo 2K com áudio estéreo nativo a partir de $0.13 por segundo Novo
A MiniMax lançou o H3 (Hailuo 3.0) a 31 de julho de 2026 como um modelo de vídeo multimodal de uso geral que aceita texto, imagem, vídeo e áudio como entrada. Produz clips 2K de 4 a 15 segundos com áudio estéreo nativo, suporta transferência de movimento, geração guiada por referência e edição de vídeo generativa, e é faturado por segundo a $0.13 para 2K e $0.09 para 768p. A Artificial Analysis coloca-o em #2 no seu quadro de vídeo com 1241,5, a 3,3 Elo do Gemini Omni Flash. Mantivemos a coroa do vídeo onde está: essa diferença tem um dia e vem do único quadro que não se reproduziu entre análises, e o corte de texto para vídeo da Arena é anterior ao H3 por completo, pelo que este não venceu nada nos votos. A MiniMax prometeu os pesos para o início de agosto, e não tinham sido publicados quando esta atualização entrou em direto.
Final de jul. Thinking Machines Inkling Small, um quarto do tamanho do Inkling com uma pontuação quase igual Novo
A Thinking Machines fez seguir o seu primeiro modelo open-weight com o Inkling Small, um Mixture-of-Experts de 276B no total / 12B ativos sob Apache 2.0 que encaminha cada token para 6 de 256 especialistas mais 2 partilhados. Aceita entrada de texto, imagem e áudio e devolve texto, e a Artificial Analysis pontua-o com um Intelligence Index de 40 contra 41 para o Inkling de tamanho completo, com cerca de um quarto dos parâmetros. As fontes não concordam quanto à data exata de publicação, pelo que não imprimimos nenhuma. Os pesos, uma build NVFP4 e as receitas de implementação estão todos no Hugging Face.
30 jul. OpenAI Descida de preço do GPT-5.6, Luna 80 % mais barato, Terra 20 % mais barato, Sol inalterado
A OpenAI reduziu o preço da API dos seus dois níveis GPT-5.6 mais baratos a 30 de julho de 2026, três semanas depois de a família ter atingido a disponibilidade geral. O Luna caiu 80 % para $0.20 / $1.20 por 1M de tokens e o Terra caiu 20 % para $2 / $12, com as leituras de entrada em cache a descerem para $0.02 no Luna e $0.20 no Terra. O modelo de topo Sol mantém-se em $5 / $30, os prompts acima de 272K tokens de entrada continuam a ser faturados a 2x a entrada e 1,5x a saída, e nenhum preço de subscrição do ChatGPT mudou, pelo que Free, Go a $8, Plus a $20, Pro a $100 e $200 e Business a $25-30 por lugar mantêm-se todos inalterados. A descida deixa o Luna num Intelligence Index de 51 na Artificial Analysis por cerca de $0.07 por tarefa de índice, um ponto acima do Gemini 3.6 Flash na pontuação e bem abaixo dos seus $0.56 por tarefa.
24 jul. Anthropic Claude Opus 5, novo #1 na Artificial Analysis, lidera tanto o Intelligence Index (61) como o Agentic Index (55.3) Novo
A Anthropic lançou o Claude Opus 5 a 24 de julho de 2026, o seu quarto modelo em menos de dois meses depois do Mythos 5, Fable 5 e Sonnet 5. No quadro de classificação v4.1 recalibrado da Artificial Analysis é agora o modelo mais bem classificado no geral, liderando tanto o Intelligence Index com 61 como o Agentic Index com 55,3, à frente do Fable 5 (60 / 52,8) e do GPT-5.6 Sol (59 / 54,0). O preço da API é de $5 / $25 por 1M de tokens, idêntico ao Opus 4.8 e metade do custo do Fable 5, sob a API id claude-opus-5. Acrescenta um modo Fast que corre cerca de 2,5x mais depressa ao dobro do preço base, mais uma definição de effort de low a high e um novo nível max. Também arrebata por completo o quadro GDPval-AA v2 de entregáveis profissionais da Artificial Analysis com 1858, à frente dos 1746 do Fable 5. A Arena classificou-o desde então nos seus quadros, colocando-o em #1 no WebDev, image-to-WebDev, Document e no quadro Agent e em #6 no texto, o que lhe valeu a coroa da programação este mês. É o modelo predefinido no Claude Max e o mais forte no Claude Pro.
24 jul. Sakana AI Fugu-Ultra v1.1, renovação do motor de orquestração com ganhos reportados pelo fornecedor de até 7,9 pontos sobre a v1.0 ao mesmo preço Novo
A Sakana AI entregou o Fugu-Ultra v1.1 a 24 de julho de 2026, uma renovação dos modelos frontier dentro do seu motor de orquestração TRINITY em vez de um novo modelo base. O próprio anúncio da Sakana reivindica ganhos de até 7,9 pontos sobre a v1.0 a preço inalterado, mas não publica as pontuações da v1.0 lado a lado, pelo que trate isso como o número do fornecedor. Todos os números de benchmark vêm do scaffolding próprio da Sakana em vez de testes independentes: nos seus próprios gráficos lidera à frente do Opus 4.8, GPT-5.5 e Gemini 3.1 Pro, com 73,7 % no SWE-Bench Pro, 82,1 % no Terminal-Bench 2.1, 93,2 % no LiveCodeBench e 95,5 no GPQA-Diamond. Ainda assim não varre o campo: os seus 50,0 no Humanity's Last Exam são um empate por arredondamento com os 49,8 do Opus 4.8. O preço é inalterado face à v1.0 em $5 / $30 por 1M de tokens de entrada/saída (mais $0.50 em cache), subindo para $10 / $45 acima da marca de contexto de 272K tokens; a API é compatível com OpenAI com uma janela de contexto de 1M de tokens.
21 jul. Google Gemini 3.6 Flash, saída mais barata, mais rápido, mesmo Intelligence Index
O Gemini 3.6 Flash é o mais recente modelo Flash da Google e aquele que a aplicação gratuita Gemini alcança agora. A saída cai para $7.50 por 1M de tokens desde $9.00 enquanto a entrada se mantém em $1.50, pelo que a redução é apenas na saída. A Google diz que «reduz a utilização de tokens de saída em 17 % face ao 3.5 Flash», e até 65 % em trabalho agêntico de longo horizonte como o DeepSWE, pelo que a poupança real por tarefa é maior do que o preço de tabela. A Artificial Analysis pontua o 3.6 Flash e o 3.5 Flash com o mesmo Intelligence Index de 50 na v4.1, pelo que o trate como mais barato e mais rápido em vez de mais inteligente. Chegou a par do Gemini 3.5 Flash-Lite a $0.30 / $2.50, e está em direto através da Gemini API no Google AI Studio e no Android Studio, na Gemini Enterprise Agent Platform e na aplicação Gemini para todos. A Google também anunciou o Gemini 3.5 Flash Cyber, mas esse não saiu: destina-se a governos e parceiros de confiança através do CodeMender como piloto de acesso limitado.
16 jul. Moonshot AI Kimi K3, 2,8B de parâmetros, o maior modelo open-weight alguma vez lançado (pesos publicados a 27 de julho) Novo
A Moonshot AI lançou o Kimi K3 na véspera de 16 de julho de 2026, o seu novo modelo de topo e o sucessor da linha K2, e depois publicou os open weights completos a 27 de julho de 2026. O cartão de modelo no Hugging Face confirma um desenho Mixture-of-Experts de 2,8 biliões de parâmetros com 104 mil milhões de parâmetros ativos por token, uma janela de contexto de 1 048 576 tokens e entrada de texto, imagem e vídeo (sem áudio). O raciocínio está sempre ligado, e o reasoning_effort aceita agora low, high ou max, com max como predefinição. A Artificial Analysis coloca o K3 num Intelligence Index de 57, o mais alto de qualquer modelo open-weight, e na Arena é #3 no quadro Agent e #2 no WebDev atrás do Claude Opus 5. O preço oficial da API é de $3 / $15 por 1M de tokens com entrada em cache a $0.30, mais $0.005 por cada chamada de pesquisa na web bem-sucedida. A transferência são 96 shards safetensors e cerca de 1,56 TB sob uma licença própria Kimi K3 License em vez de MIT, pelo que o auto-alojamento é um trabalho multi-nó; existe um nível de chat básico gratuito na aplicação Kimi, com a utilização agêntica mais intensa medida nos planos pagos.
9 jul. OpenAI GPT-5.6 Sol, Terra e Luna, família de nova geração em direto no ChatGPT, Codex e na API
A OpenAI abriu a sua família GPT-5.6 à disponibilidade geral a 9 de julho de 2026, pondo fim à pré-visualização fechada de duas semanas que começou a 26 de junho por trás de uma revisão de segurança do governo dos EUA. A gama vai do menos ao mais capaz: Luna, um nível rápido e de baixo custo; Terra, um modelo equilibrado para o dia a dia que a OpenAI diz igualar o GPT-5.5 a cerca de metade do custo; e Sol, o modelo de topo, afinado para biologia, química e cibersegurança. O GPT-5.6 está agora a ser implementado no ChatGPT, Codex e na API como predefinição da OpenAI, com preços de API de lançamento de Sol $5 / $30, Terra $2.50 / $15 e Luna $1 / $6 por 1M de tokens; o Terra e o Luna foram reduzidos a 30 de julho de 2026 para $2 / $12 e $0.20 / $1.20. Nos poucos benchmarks que a OpenAI publicou, o Sol obtém 88,8 % no Terminal-Bench 2.1 (91,9 % no seu modo «ultra» de maior computação) contra os 88,0 % do GPT-5.5, e 60,5 no HealthBench Professional; a OpenAI reteve notoriamente os habituais números do SWE-bench Verified, GPQA e FrontierMath, e a sua janela de contexto ainda não foi publicada oficialmente. Uma ressalva: o próprio system card da OpenAI e o avaliador externo METR assinalaram um comportamento de «scheming» elevado no Sol, incluindo a manipulação de um teste de engenharia de software à taxa mais alta que o METR alguma vez registou.
Pendente Google Gemini 3.5 Pro, ainda por lançar, meses atrasado segundo a Bloomberg Atrasado
O Gemini 3.5 Pro continua a ser o maior lançamento pendente. A Google anunciou-o na I/O a 19 de maio a par do Gemini 3.5 Flash, mas apenas o Flash saiu, e a meta de junho escorregou. A Bloomberg noticiou a 16 de julho de 2026 que o modelo está meses atrasado e ficou aquém das metas internas da Google, com a empresa ainda a trabalhar para melhorar as suas capacidades, em particular na programação. É este todo o quadro com fontes. A Google nunca confirmou publicamente uma data de lançamento, e a Google não publicou especificações finais como a janela de contexto ou os modos de raciocínio, pelo que trate os números em circulação como não confirmados. Utilize o Gemini 3.6 Flash entretanto; passaremos o 3.5 Pro para a classificação principal no momento em que entrar em direto.
Escolha de categoria, agosto de 2026

Melhor IA para escrita

1
Claude Fable 5
Melhor escrita no geral
2
Kimi K3
Ficção criativa
3
Claude Sonnet 5
Grátis para o dia a dia

A melhor IA para escrita é o Claude Fable 5, o único modelo entre os três primeiros dos três quadros independentes de escrita, com o Claude Sonnet 5 como escolha de relação qualidade-preço da versão gratuita e o GPT-5.5 como alternativa para escrita empresarial ancorada em factos. O Fable 5 lidera o quadro de escrita criativa da Arena, encabeça o LiveBench Language com 90,7 e fica em terceiro no EQ-Bench Creative Writing v3 atrás do Kimi K3 e do GPT-5.6 Sol. Nenhum outro modelo está entre os três primeiros em mais do que um deles. É uma mudança face ao mês passado, quando o Claude Sonnet 5 ocupava este lugar no GDPval-AA; os quadros de preferência não sustentam essa colocação, pelo que o Sonnet 5 é agora a escolha de relação qualidade-preço em vez do líder de qualidade. O Fable 5 custa $10 / $50 por 1M de tokens e está incluído em permanência no Claude Max e Team Premium a cerca de 50 % dos limites de utilização habituais. Se a sua escrita for um entregável de trabalho em vez de prosa, o Claude Opus 5 arrebata por completo o quadro GDPval-AA v2 de entregáveis profissionais da Artificial Analysis com 1858, bem à frente dos 1746 do Fable 5.

ModeloMelhor paraPonto fortePonto fracoPreço (por 1M de tokens)
Claude Fable 5Melhor escrita no geral#1 Arena texto no geral (1508.6), #1 LiveBench Language (90.7), #3 EQ-BenchA opção mais cara aqui$10 / $50
Kimi K3Ficção criativa e voz#1 EQ-Bench Creative Writing (2377), 234 Elo à frente do segundoApenas #10 na Arena escrita criativa$3 / $15
Claude Sonnet 5Escrita gratuita para o dia a diaGrátis e predefinido no claude.ai, contexto 1M#53 Arena escrita criativa; 75,0 LiveBench Language$2 / $10 introdutório (depois $3 / $15)
Claude Opus 5Entregáveis profissionais#1 GDPval-AA v2 com 1858, à frente do Fable 5 (1746)Atrás do Fable 5 na Arena texto e no Humanity's Last Exam$5 / $25
GPT-5.5Escrita empresarial ancorada em factosGanhos documentados de fiabilidade factual sobre o GPT-5.4Níveis de raciocínio agora marcados como obsoletos$5 / $30
Gemini 3.6 FlashRascunhos em massa à escala17 % menos tokens de saída do que o 3.5 FlashMais fraco no raciocínio mais difícil$1.50 / $7.50
Segundo lugar e alternativas: o Kimi K3 é o segundo para ficção criativa e vence o EQ-Bench por completo, o Claude Sonnet 5 é o segundo em relação qualidade-preço e o que utilizar se não pagar, o Claude Opus 5 é a escolha para entregáveis profissionais, e o Gemini 3.6 Flash é a escolha para a redação de rascunhos em massa.
O que mudou este mês

A coroa da escrita fica com o Claude Fable 5, e é a decisão mais bem fundamentada da página. O Fable 5 é agora #1 no quadro de texto da Arena com 1508.6 na data de fecho de 1 de agosto, #1 no Humanity's Last Exam com 53,3 % e #1 no AA-Omniscience com 40, o que são três casas diferentes a concordar. O Claude Opus 5 mantém a faixa dos entregáveis profissionais no GDPval-AA v2, onde o quadro reajustado marca agora 1858 contra os 1746 do Fable 5.

Escolha de categoria, agosto de 2026

Melhor IA para chat & assistente do dia a dia

1
GPT-5.6
Predefinição do ChatGPT
2
Claude Fable 5
O mais bem avaliado
3
Claude Opus 5
Profundidade ponderada

A melhor IA para o chat do dia a dia é o GPT-5.6, e a razão honesta é o alcance em vez da posição nos quadros. É o modelo que o ChatGPT serve por predefinição à maior base de utilizadores da categoria, o que faz dele o melhor assistente que a maioria das pessoas consegue realmente abrir. Em preferência humana pura não é o líder: o GPT-5.6 Sol situa-se em #14 no quadro de texto da Arena com 1482,8, onde o Claude Fable 5 lidera com 1508.6. A maioria dos utilizadores do ChatGPT recebe o nível equilibrado Terra, que a OpenAI diz igualar o GPT-5.5 e que, desde a descida de preço de 30 de julho de 2026, custa 60 % menos. Está disponível dentro do ChatGPT (grátis com limites, Plus a $20/mês, Pro a $100/mês), através da API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $5 / $30 por 1M de tokens), e integrado dentro do Fello AI a par do Claude, Gemini, Grok e DeepSeek. Uma ressalva: o system card da OpenAI e o avaliador METR assinalaram um comportamento de «scheming» elevado no Sol, pelo que o GPT-5.5 Instant continua a ser a escolha mais segura para trabalho sensível a alucinações.

ModeloMelhor paraPonto fortePonto fracoPreço
GPT-5.6Chat do dia a dia, predefinição do ChatGPTO assistente que a maioria consegue abrir; o Terra iguala o GPT-5.5 a ~metade do custo#14 na Arena texto; scheming assinalado pelo METRGrátis / $20/mês Plus; API $0.20 / $1.20 a $5 / $30
Claude Fable 5A conversa mais bem avaliada#1 na Arena texto no geral (1508.6) e em 6 de 7 subcategoriasSem versão gratuita; acesso por créditos de utilização no Pro$10 / $50 API
Claude Opus 5Respostas ponderadas e matizadas#1 Artificial Analysis Intelligence Index (61) e Agentic Index (55.3)#6 na Arena texto, atrás do Claude Fable 5$20/mês Pro, $5 / $25 API
GPT-5.5 InstantTrabalho diário sensível a alucinações52,5 % menos afirmações alucinadas vs 5.3 InstantNíveis de raciocínio agora marcados como obsoletos$20/mês Plus; API $5 / $30
Gemini 3.6 FlashRápido, grátis, multimodalGrátis na aplicação Gemini, contexto 1M, #12 na Arena textoMais fraco no raciocínio mais difícilGrátis / $1.50 / $7.50 API
Fello AITodos os melhores modelos, uma aplicaçãoChatGPT + Claude + Gemini + Grok + DeepSeek e mais no Mac, iPhone e iPadEncaminhado pela aplicação, não direto$9.99/mês
Segundo lugar e alternativas: o Claude Fable 5 é o segundo e o verdadeiro líder de preferência, o Claude Opus 5 é o segundo para uma utilização diária ponderada, o Gemini 3.6 Flash é o segundo para rápido e grátis, e o Grok 4.5 é a escolha de nicho para os dias de notícias em direto. O Fello AI é a escolha natural se quiser os melhores modelos numa aplicação de Mac e iOS por $9.99/mês em vez de fazer malabarismos com subscrições.
O que mudou este mês

O GPT-5.6 mantém a escolha de chat pelo alcance, e a distância para o líder de preferência alargou-se em vez de se fechar. Na data de fecho de 1 de agosto o Sol situa-se em #14 na Arena texto com 1482,8, a descer de #11, enquanto o Claude Fable 5 lidera com 1508.6. Nada mudou quanto ao produto, pelo que a coroa não se move: continua a ser sobre qual o assistente que a maioria das pessoas consegue realmente abrir.

Escolha de categoria, agosto de 2026

Melhor IA para imagens

1
ChatGPT Images 2.0
Texto nas imagens
2
Reve 2.1
Layout & 4K
3
Muse Image
Edição de imagens

A melhor IA para a geração de imagens é o ChatGPT Images 2.0, e é a coroa menos contestada desta página. O GPT Image 2 lidera o quadro de texto para imagem da Arena com 1385 Elo e o seu quadro de edição de imagens com 1463, e a Artificial Analysis coloca-o em primeiro na sua própria arena de imagem com 1339,4. É a escolha natural sempre que a sua imagem tem de conter palavras legíveis, em português ou noutra escrita, e está incluído no ChatGPT Plus e Pro. Os segundos lugares mudaram. O Reve 2.1 (9 de julho) é o verdadeiro #2 em texto para imagem com 1302, e o Reve 2.0 situa-se agora atrás dele nos dois quadros. O Muse Image da Meta é #3 no quadro de texto para imagem da Arena e #2 em edição de imagens, o melhor desempenho que algum modelo de imagem da Meta alguma vez alcançou. O Nano Banana Pro da Google já não é o segundo no geral: em texto para imagem classifica-se entre #8 e #11, abaixo do seu próprio irmão mais barato Nano Banana 2, embora se coloque mais alto em edição de imagens.

ModeloMelhor paraPonto fortePonto fracoPreço
ChatGPT Images 2.0Imagens com texto legível#1 texto para imagem (1385) e #1 edição de imagens (1463)Menos fotorrealista do que a linha de imagem GeminiIncluído no ChatGPT Plus
Reve 2.1Layout, tipografia, 4K nativo#2 texto para imagem com 1302, edição que preserva o layoutEcossistema mais pequenoGrátis / a partir de $7.99/mês
Muse ImageEdição de imagens, ecossistema Meta#3 texto para imagem, #2 edição de imagens (1407)Novo, ferramentas escassas em redorAplicação Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Retratos e produtos fotorrealistasSupera o Nano Banana Pro nos dois quadrosMais fraco em texto dentro da imagemAplicação Gemini / AI Studio
Seedream 5.0 ProTexto multilíngue + edição por regiões10+ idiomas incl. árabe RTL, edição com laço e camadasSem benchmarks independentes; incerteza de direitos de autorBytePlus / Magnific
Midjourney v8Arte estilizada, ilustraçãoBase estética que a maioria dos artistas prefereMais fraco em texto dentro da imagem$10-$120/mês
Grok ImagineNSFW / Spicy ModeAs barreiras mais permissivasUm modelo mais pequeno por trás$30/mês SuperGrok
Segundo lugar e alternativas: o Reve 2.1 é o segundo no geral e a escolha para layout e tipografia, o Muse Image é o segundo para editar uma imagem que já tem, e o Nano Banana 2 é a escolha fotorrealista. O Grok Imagine continua a ser o único modelo frontier que permite conteúdo para adultos em Spicy Mode.
O que mudou este mês

A coroa da imagem está inalterada e o GPT Image 2 continua a liderar os três quadros que seguimos, na Arena texto para imagem (1385), Arena edição de imagens (1463) e na arena de imagem da Artificial Analysis (1339,4). O único acrescento é o MAI-Image-2.5 da Microsoft, que se situa em terceiro no quadro de imagem da Artificial Analysis com 1269,7 e em terceiro no quadro de edição de imagens da Arena, pelo que o terceiro lugar depende agora de qual a casa que lê.

Escolha de categoria, agosto de 2026

Melhor IA para vídeo

1
Gemini Omni Flash
#1 nos dois quadros de vídeo
2
MiniMax H3
2K + áudio nativo
3
Dreamina Seedance 2.0
O concorrente mais próximo

A melhor IA para a geração de vídeo é o Gemini Omni Flash, que lidera o quadro de texto para vídeo da Arena com 1527 Elo, 45 pontos completos à frente do segundo lugar, e também encabeça a arena de vídeo da Artificial Analysis. É #1 nas duas casas, algo que nenhum outro modelo de vídeo consegue. O preço vai de $1.50 na entrada e $17.50 por 1M de tokens de saída de vídeo, o que dá cerca de $0.10 por segundo de vídeo terminado, e suporta edição conversacional. O único limite real é a duração: o Omni Flash gera clips de 10 segundos. Se precisar de planos mais longos, o Veo 3.1 continua a ser a ferramenta certa dentro da aplicação Gemini, no AI Studio e no Vertex AI, com áudio nativo e saída 1080p. Isto substitui o Veo 3.1 no topo da categoria; o Veo 3.1 é um bom modelo mas não o líder, com a sua melhor variante em #6 no quadro de texto para vídeo da Arena. O candidato a vigiar é o MiniMax H3 (31 de julho), que gera clips 2K de 4 a 15 segundos com áudio estéreo nativo e é faturado por segundo a partir de $0.13 em 2K, já #2 no quadro de vídeo da Artificial Analysis com 1241,5. Não movemos a coroa por isso: a pontuação tem um dia, vem do único quadro que não se reproduziu entre análises, e o corte de votos de texto para vídeo da Arena é anterior ao H3.

ModeloMelhor paraPonto fortePonto fracoPreço
Gemini Omni FlashMelhor vídeo de IA no geral#1 nos dois quadros de vídeo (1527 Arena), edição conversacionalLimitado a gerações de 10 segundos~$0.10/s; aplicação Gemini / AI Studio
MiniMax H3Clips 2K com áudio nativo4-15 s em 2K, áudio estéreo nativo; #2 no AA vídeo (1241.5)Um dia de existência, ainda sem votos na Arena; pesos não publicados$0.13/s em 2K
Dreamina Seedance 2.0O concorrente mais próximo#2 texto para vídeo (1482) e #1 em imagem para vídeoEcossistema ByteDance, acesso ocidental limitadoDreamina / BytePlus
Muse VideoVídeo no ecossistema Meta#3 texto para vídeo com 1459O mais recente do grupo, ferramentas escassasAplicação Meta AI
Veo 3.1Clips de produção mais longosÁudio nativo, 1080p, forte consistência física#6 na Arena vídeo, não o líder de qualidadeGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboIteração rápida a menor custo4K nativo, 60fps, clips de 15 segundos; o Turbo saiu a 17 de junhoFora do top 16 na Arena texto para vídeoA partir de $10/mês
Luma Ray 3Cenas fotorrealistasForte realismo para paisagensComunidade mais pequenaGrátis / a partir de $9.99/mês
Segundo lugar e alternativas: o Dreamina Seedance 2.0 é o segundo no geral e até bate o Omni Flash em imagem para vídeo, o Muse Video é o terceiro, e o Veo 3.1 é a escolha quando 10 segundos não bastam. A OpenAI retirou a aplicação de consumo Sora 2 a 26 de abril de 2026 e resta apenas a API para programadores, até 24 de setembro de 2026.
O que mudou este mês

O Gemini Omni Flash mantém a coroa do vídeo, e continua a ser #1 nos dois quadros, com 1527,5 na Arena e 1244,8 na Artificial Analysis. O MiniMax H3 (31 de julho) entra como candidato em #2 no quadro de vídeo da Artificial Analysis (1241,5), a 3,3 Elo, e bate o Omni Flash em especificações com saída 2K, clips até 15 segundos e áudio estéreo nativo. Mantemos a coroa porque essa margem tem um dia, é de um único quadro e não traz votos na Arena, cujo corte de texto para vídeo é anterior ao lançamento.

Escolha de categoria, agosto de 2026

Melhor IA para programação

1
Claude Opus 5
#1 Arena WebDev
2
Claude Fable 5
Longo horizonte mais difícil
3
Kimi K3
Apps web e agentes

A melhor IA para programação é o Claude Opus 5, e vence nos dois quadros onde os programadores votam no resultado final em vez de um script a medir um harness. É #1 no quadro WebDev da Arena com 1,702.9 e #1 em image-to-WebDev com 1,668.6, em cortes de votos de 1 de agosto e 31 de julho. O preço é a segunda metade do argumento: o Opus 5 corre a $5 / $25 por 1M de tokens contra os $10 / $50 do Claude Fable 5, e a Artificial Analysis mede-o em $2.34 por tarefa de índice contra os $3.15 do Fable 5. A própria documentação da Anthropic diz aos programadores para começarem com o Opus 5 para programação agêntica complexa e reservarem o Fable 5 para cargas que precisem da capacidade mais alta disponível. O Claude Fable 5 é o segundo e continua a ser a escolha para o trabalho de longo horizonte mais difícil, em #4 no WebDev (1,630.7) e #2 em image-to-WebDev (1,625.7). O candidato é o Kimi K3, que arrebata o #2 no WebDev com 1,675.5 e o #3 no quadro Agent da Arena, o programador open-weight mais forte dos quadros, embora auto-alojá-lo signifique 1,56 TB de pesos. No Coding Index da Artificial Analysis não é uma varrida da Claude: o GPT-5.6 Sol (xhigh) lidera com 78,3 com o Opus 5 (max) em 78,0, perto o suficiente para lhe chamar empate. O candidato sério mais barato é agora o DeepSeek V4-Flash 0731 a $0.14 / $0.28.

ModeloMelhor paraPonto fortePonto fracoPreço (por 1M de tokens)
Claude Opus 5Melhor programação no geral#1 Arena WebDev (1,702.9) e #1 image-to-WebDev (1,668.6); $2.34 por tarefa de índiceO Coding Index da Artificial Analysis tem o GPT-5.6 Sol um nadinha à frente$5 / $25
Claude Fable 5O trabalho agêntico de longo horizonte mais difícil#2 Arena image-to-WebDev (1,625.7), #4 WebDev; contexto 1MO mais caro; o Coding Index da Artificial Analysis coloca-o em 7.º$10 / $50
Kimi K3Construção de apps web e agentes#2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index aberto mais alto (57)1,56 TB para auto-alojar$3 / $15
GPT-5.6 SolModelo de topo da OpenAI, programação agêntica#1 Artificial Analysis Coding Index com 78,3 (xhigh)Ausente do quadro oficial Terminal-Bench; manipulação de avaliações assinalada pelo METR$5 / $30
Muse Spark 1.2Programação agêntica barataIntelligence Index 54 a $1.25 / $4.25; 80 % no Terminal-Bench 2.1 (Artificial Analysis)Segundo atrás do Opus 5 nos três gráficos de programação próprios da Meta (82,9 % vs 86,7 %); a Scale SEAL só avaliou a 1.1$1.25 / $4.25
Grok 4.5Programador barato de boa relação qualidade-preço#4 no quadro oficial Terminal-Bench 2.1 com 79,3 % via Cursor CLITaxa de alucinação mais alta; consola API da UE ainda fechada$2 / $6
Gemini 3.6 FlashProgramação de agentes à escalaIntelligence Index 50, 17 % menos tokens de saída do que o 3.5 FlashMais fraco no raciocínio mais difícil$1.50 / $7.50
GLM-5.2Melhor programador open-weight que consegue alojarIntelligence Index 51, #6 Arena WebDev (1,587.1), licença MITO Kimi K3 supera-o; apenas auto-alojamento ou fornecedorOpen weights (MIT)
Segundo lugar e alternativas: o Kimi K3 é o segundo no quadro WebDev da Arena e a escolha se quiser os open weights mais fortes, o Claude Fable 5 é o segundo para o trabalho de longo horizonte mais difícil, o GPT-5.6 Sol é o segundo no compósito da Artificial Analysis, e o GLM-5.2 é a escolha open-weight para equipas que o alojam elas próprias. Dentro dos IDE, o Cursor com o Claude continua a ser a combinação mais popular e o Claude Code é a escolha natural se vive no terminal.
O que mudou este mês

A coroa da programação passou para o Claude Opus 5. A Arena terminou de o avaliar, e ficou em primeiro nos dois quadros de programação, WebDev com 1,702.9 e image-to-WebDev com 1,668.6, com o Claude Fable 5 em quarto e segundo. São quadros por votos com cortes publicados, pelo que a coroa assenta agora em comparações humanas em vez de num único harness, e o Opus 5 fá-lo a metade do preço do Fable 5. O Fable 5 passa a ser o segundo para o trabalho de longo horizonte mais difícil, e o Kimi K3 continua a ser o candidato em #2 no WebDev. O Muse Spark 1.2 da Meta chegou a 5 de agosto e não muda isso, porque nos próprios gráficos da Meta termina em segundo atrás do Opus 5 em cada benchmark de programação que publicou.

Escolha de categoria, agosto de 2026

Melhor IA para criatividade

1
Grok 4.5
Menos barreiras
2
Claude Fable 5
Prosa da mais alta qualidade
3
Kimi K3
Ficção e voz

A melhor IA para trabalho criativo sem filtros e na moda é o Grok 4.5, e queremos ser exatos quanto ao porquê. Esta escolha é sobre o produto, não sobre a qualidade da prosa. O Grok 4.5 tem as menos restrições de conteúdo de qualquer modelo frontier e a única integração nativa com o X em tempo real, o que faz dele o único modelo que se envolve com briefings ousados, atuais ou deliberadamente provocadores que os outros recusam. É o modelo predefinido na aplicação Grok para subscritores SuperGrok e X Premium+ a $30/mês. Não é o melhor escritor, e os quadros são diretos quanto a isso. O Grok 4.5 situa-se em #33 no EQ-Bench Creative Writing e #41 no quadro de escrita criativa da Arena, perdendo em ambos para o mais antigo Grok 4.20-beta1. Se escolher apenas pela qualidade da saída, o Claude Fable 5 vence por completo em #1 na Arena escrita criativa, e o Kimi K3 vence o EQ-Bench. Escolha o Grok 4.5 pelo que lhe permite criar, não por quão bem escreve.

ModeloMelhor paraPonto fortePonto fracoPreço
Grok 4.5Sem filtros, com opinião, na modaAs menos restrições de conteúdo, ancoragem nativa no X em tempo real#33 EQ-Bench, #41 Arena escrita criativa$30/mês SuperGrok
Claude Fable 5Prosa criativa da mais alta qualidade#1 Arena escrita criativa, #1 LiveBench LanguageBarreiras cautelosas em briefings ousados$10 / $50 API
Kimi K3Ficção e voz distintiva#1 EQ-Bench Creative Writing com 2377Apenas #10 na Arena escrita criativa$3 / $15
Claude Opus 5Criatividade estruturada de formato longoMantém fios longos e autoedita-se; #1 Intelligence IndexO mais cauteloso do grupo$20/mês Pro; $5 / $25 API
Gemini 3.1 ProCriativo multimodalForte cadeia de texto, imagem e vídeoQuotas dentro da aplicação GeminiGrátis / $2.00-$4.00 API entrada
Grok Imagine (Spicy Mode)NSFW / criativo para adultosA geração de imagens mais permissivaCaso de utilização de nicho$30/mês SuperGrok
Segundo lugar e alternativas: o Claude Fable 5 é o segundo e a escolha certa se a qualidade importar mais do que a liberdade, o Kimi K3 é a escolha para ficção, e o Claude Opus 5 é a escolha para projetos criativos que se estendem por muitos turnos. Para trabalho criativo para adultos, o Grok Imagine Spicy Mode continua a ser a única opção de nível frontier.
O que mudou este mês

O Grok 4.5 mantém esta escolha, e nada se moveu quanto ao produto. Está aqui pela sua permissividade e pelo seu acesso em direto ao X, não pela posição nos quadros, e o Claude Fable 5 continua a ser o modelo a utilizar quando quer a melhor escrita. Uma nota de nome para agosto: a xAI cota agora nos quadros como SpaceXAI, e o modelo está inalterado.

Escolha de categoria, agosto de 2026

Melhor IA para precisão & investigação

1
Gemini 3.1 Pro
98 % ARC-AGI-1
2
Claude Fable 5
Pesquisa ancorada
3
GPT-5.6 Sol
Raciocínio inédito

A melhor IA para precisão e investigação é o Gemini 3.1 Pro. O seu resultado mais forte é no ARC-AGI-1 da ARC Prize, onde pontua 98 % e iguala o painel humano, e fá-lo a $0.52 por tarefa. Essa combinação é o argumento: vários modelos estão próximos em capacidade, nenhum o iguala no custo para trabalho factual fiável. Combina-o com ancoragem nativa na Pesquisa Google, o que quer quando a resposta tem de ser atual em vez de meramente plausível. Também pontua 94,1 % no GPQA Diamond, onde o GPT-5.6 Sol agora o iguala em vez de ficar atrás, e 44,4 % no Humanity's Last Exam, e encabeça o quadro HLE da Scale SEAL com 46,44. Abandonámos o enquadramento anterior via ARC-AGI-2: os seus 77,1 % continuam corretos, mas o quadro moveu-se e essa pontuação coloca-o agora à volta do 14.º lugar. Duas ressalvas honestas. Na pesquisa ancorada em concreto, o quadro de pesquisa da Arena é liderado pela Anthropic, não pela Google, com o Gemini 3.1 Pro com ancoragem em #7. E no raciocínio inédito, o GPT-5.6 Sol lidera o ARC-AGI-2 e o Claude Opus 5 lidera o ARC-AGI-3 com 30 %, cerca de 3,75x o modelo seguinte. Não movemos a coroa para o Opus 5 porque a Artificial Analysis mede a sua taxa de alucinação em 50 % e coloca-o abaixo do Fable 5 no AA-Omniscience.

ModeloMelhor paraBenchmark-chavePonto fracoPreço
Gemini 3.1 ProTrabalho factual barato e fiável98 % ARC-AGI-1 (iguala o painel humano) a $0.52/tarefa, 94,1 % GPQA (igualado pelo Sol)ARC-AGI-2 77,1 % agora ~14.º; #7 na Arena pesquisa$2.00-$4.00 / $12.00-$18.00 (escalonado)
Claude Fable 5Pesquisa ancorada#1 e #3 no quadro de pesquisa da Arena, à frente da GoogleSem um único nível barato$10 / $50 (Fable 5)
GPT-5.6 SolRaciocínio inédito#1 ARC-AGI-2 com 93 %, contra um painel humano de 100 %Scheming assinalado pelo METR$5 / $30
Claude Opus 5Os problemas inéditos mais difíceis#1 ARC-AGI-3 com 30 %, ~3,75x o modelo seguinte (ARC Prize)A Artificial Analysis mede uma taxa de alucinação de 50 %$5 / $25
Qwen 3.7 MaxPrecisão frontier a preço vantajoso92,4 GPQA Diamond, 200 pedidos grátis/diaApenas API, sem front-end de chat$1.25 / $3.75 promo; $2.50 / $7.50 tabela
Claude Opus 4.6Honestidade sob pressão#1 no quadro MASK da Scale SEAL com 96,28; a Anthropic ocupa o top 5Substituído como modelo de topoModelo legacy da Anthropic
Segundo lugar e alternativas: os modelos da Anthropic são o segundo para pesquisa ancorada e varrem o quadro de honestidade sob pressão, o GPT-5.6 Sol é o segundo para raciocínio inédito, e o Qwen 3.7 Max é a escolha de relação qualidade-preço na fronteira.
O que mudou este mês

O Gemini 3.1 Pro mantém a coroa da precisão, mas o seu número de destaque já não é uma vantagem. A sua pontuação GPQA Diamond foi reajustada para 94,1 % e o GPT-5.6 Sol iguala-o agora exatamente, pelo que a coroa assenta no resultado do ARC-AGI-1 a $0.52 por tarefa mais a ancoragem da Pesquisa em vez de no GPQA. Esta é a próxima coroa que voltamos a testar: o Claude Fable 5 encabeça os três quadros que medem quão frequentemente um modelo simplesmente erra, com 40 no AA-Omniscience, 61 % no Omniscience Accuracy e 53,3 % no Humanity's Last Exam.

Escolha de categoria, agosto de 2026

Melhor IA para resolução de problemas

1
GPT-5.6 Sol
Modelo de topo STEM
2
Claude Opus 5
Cadeias agênticas
3
GPT-5.5 Pro
FrontierMath verificado

A melhor IA para a resolução de problemas difíceis é o GPT-5.6 Sol, e é a coroa mais bem fundamentada desta página. Arrebata o #1 no LiveBench Mathematics com 96,2, o #1 no LiveBench Reasoning com 91,7 e o #1 no ARC-AGI-2 com 93 %, o mais perto que algum modelo alguma vez chegou do painel humano de 100 %. Três casas distintas colocam-no em primeiro nas tarefas de raciocínio que importam, o que é mais concordância do que produz qualquer outra categoria desta página. A OpenAI ainda não publicou a pontuação FrontierMath do Sol, pelo que a marca OpenAI verificada continua a ser os 39,6 % do GPT-5.5 Pro no FrontierMath Tier 4, e inseriremos o número do Sol no momento em que for tornado público. O Qwen 3.7 Max é a alternativa de relação qualidade-preço para problemas de estilo competição com 97,1 no índice HMMT de fevereiro de 2026 e 44,5 no Apex, a uma fração do custo do ChatGPT Pro, e inclui agora 200 pedidos de modelo grátis por dia. O Claude Opus 5 é a alternativa para longas cadeias de raciocínio agêntico, liderando o Agentic Index da Artificial Analysis com 55,3 e o ARC-AGI-3 da ARC Prize com 30 %, cerca de 3,75x o modelo seguinte.

ModeloMelhor paraBenchmark-chavePonto fracoPreço
GPT-5.6 SolA matemática, a ciência e o raciocínio mais difíceis#1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (93 %)FrontierMath ainda por publicar; scheming assinalado pelo METR$100/mês ChatGPT Pro; API $5 / $30
Claude Opus 5Longas cadeias de raciocínio agêntico#1 Agentic Index (55.3), #1 ARC-AGI-3 (30 %)Segundo no LiveBench Reasoning; taxa de alucinação de 50 %$5 / $25
GPT-5.5 ProLíder verificado do FrontierMath39,6 % FrontierMath Tier 4Substituído pelo Sol como modelo de topo$100/mês ChatGPT Pro
Qwen 3.7 MaxMatemática de competição com orçamento apertado97,1 HMMT 2026 fev., 44,5 Apex, 200 pedidos grátis/diaApenas API$1.25 / $3.75 promo; $2.50 / $7.50 tabela
Claude Fable 5Matemática dentro de um fluxo de programação#1 na subcategoria de matemática da Arena (1543), 96,0 LiveBench MathematicsA opção mais cara aqui$10 / $50
GLM-5.2Resolução de problemas open-weightIntelligence Index aberto mais alto com 51, MIT, contexto 1MApenas auto-alojamento ou fornecedorOpen weights (MIT)
Segundo lugar e alternativas: o Claude Opus 5 é o segundo e a escolha natural para raciocínio agêntico de cadeia longa, o Claude Fable 5 é o segundo no quadro de matemática da Arena, o Qwen 3.7 Max é a escolha de relação qualidade-preço, e o GLM-5.2 é a escolha open-weight.
O que mudou este mês

O GPT-5.6 Sol mantém esta coroa, e ganhou um segundo argumento. O Sol lidera agora também o Terminal-Bench v2.1 da Artificial Analysis com 89,5 % e o seu Coding Index com 78,3, e iguala o Gemini 3.1 Pro no GPQA Diamond com 94,1 %. O Claude Opus 5 continua a ser a alternativa de raciocínio agêntico pela força do ARC-AGI-3. A 1 de agosto a OpenAI deu à sua próxima família de modelos o nome Astra e publicou dez novos resultados matemáticos de uma versão interna, embora o Astra não tenha sido lançado e não tenha data, preço nem disponibilidade.

Escolha de categoria, agosto de 2026

Melhor agente de IA

1
Gemini Spark
Cloud 24/7
2
Claude Cowork
IA de ambiente de trabalho
3
ChatGPT Codex
Agente de programação

O melhor agente de IA neste momento é o Gemini Spark para trabalho residente na cloud 24/7 e o Claude Cowork para trabalho residente no ambiente de trabalho, com o ChatGPT Codex como alternativa para agentes de programação e os agentes de navegador de classe OpenAI Operator como alternativa para tarefas web. Os agentes de IA são a categoria que mais depressa se move em 2026: cada fornecedor de topo lança agora um produto de agente, e a escolha prática é entre agentes que vivem na cloud (funcionam enquanto o seu portátil está fechado) e agentes que vivem no seu ambiente de trabalho (conduzem as suas aplicações diretamente). O Gemini Spark foi lançado na Google I/O a 19 de maio de 2026 e é o primeiro agente na cloud 24/7. O Claude Cowork atingiu a disponibilidade geral a 9 de abril de 2026 e funciona como um agente de ambiente de trabalho que conduz as suas aplicações locais. O ChatGPT Codex Mobile (14 de maio) é a escolha para trabalho de agente de programação. Leia a comparação completa Gemini Spark vs Claude Cowork.

AgenteMelhor paraOnde funcionaPonto fortePreço
Gemini SparkTarefas na cloud 24/7, fluxos do WorkspaceVM da Google Cloud (sempre ativa)Primeiro verdadeiro agente 24/7, integração profunda com o Workspace$99.99/mês Google AI Ultra
Claude CoworkAmbiente de trabalho, condução de aplicações, design + códigoO seu ambiente de trabalho Mac/WindowsConduz aplicações locais, vê o seu ecrã$20/mês Claude Pro
ChatGPT Codex MobileAgente de programação no telemóvelCloud da OpenAI + iOS/AndroidAprovar diffs e reencaminhar o trabalho a partir do telemóvelIncluído nos planos ChatGPT
Grok Agentic (Grok 4.5)Investigação em tempo real, scraping do XCloud da xAIIntegração nativa com o X$30/mês SuperGrok
OpenAI de classe OperatorTarefas de navegador, formulários webCloud da OpenAI + o seu navegadorAutomação webChatGPT Pro
Segundo lugar e alternativas: o Claude Cowork é o segundo no geral e a escolha natural quando quer o agente na sua máquina a conduzir as suas aplicações. O ChatGPT Codex Mobile é o segundo para agentes de programação. O Grok Agentic é a escolha de nicho para investigação em tempo real.
O que mudou este mês

Não saíram novos agentes de consumo, e o Muse Code da Meta (5 de agosto) é uma ferramenta de terminal para programadores em vez de uma de consumo, pelo que a escolha entre o Gemini Spark (cloud) e o Claude Cowork (ambiente de trabalho) continua a guiar a maioria das decisões sobre agentes para utilizadores individuais. A camada de modelo por baixo deles moveu-se de novo: o Claude Opus 5 (24 de julho) arrebatou o #1 no Agentic Index da Artificial Analysis com 55,3, à frente do GPT-5.6 Sol com 54,0 e do Claude Fable 5 com 52,8, e custa $5 / $25. O Opus 5 também encabeça o quadro Agent da Arena, com o Kimi K3 em terceiro. Para equipas que constroem os seus próprios agentes, o Muse Spark 1.2 da Meta (5 de agosto) é uma opção agent-native barata a $1.25 / $4.25 cujo Elo agêntico GDPval-AA v2 saltou de 1371 para 1631, embora a Scale SEAL só tenha avaliado a mais antiga 1.1, que lidera o seu quadro de utilização de ferramentas MCP Atlas com 88,1. O GLM-5.2 (MIT) é o modelo de agente open-weight mais forte que consegue alojar em hardware modesto, em #5 no quadro Agent da Arena.

Guia de utilização, agosto de 2026

Melhor IA para estudantes

1
GPT-5.5 Free
Ensaios & investigação
2
Gemini 3.6 Flash
STEM + PDFs
3
Claude Sonnet 5
Escrita & revisão

A melhor IA para estudantes é o GPT-5.5 Free dentro do ChatGPT para trabalho de curso geral e o Gemini 3.6 Flash Free dentro da aplicação Gemini para STEM e estudo multimodal, com o Qwen 3.7 Max como alternativa por API para conjuntos de problemas mais difíceis (200 pedidos grátis por dia) e o Claude Opus 5 como alternativa para revisão de ensaios. A maioria dos estudantes não precisa de pagar: o nível gratuito do ChatGPT usa agora o GPT-5.6 por predefinição (com o GPT-5.5 ainda disponível), o Gemini 3.6 Flash está na aplicação gratuita Gemini e no AI Studio, o Claude Sonnet 5 é a nova predefinição gratuita do Claude, e o DeepSeek V4 é grátis no site de chat da DeepSeek. Para o desenvolvimento passo a passo na matemática mais difícil, o GPT-5.6 Sol é o novo modelo de topo da OpenAI (a sua pontuação FrontierMath ainda não foi publicada, com os 39,6 % verificados do GPT-5.5 Pro no FrontierMath Tier 4 como marca atual), embora ambos sejam apenas pagos; o Qwen 3.7 Max é a alternativa de relação qualidade-preço com 97,1 no HMMT 2026 fevereiro com preço de API de $1.25 / $3.75 na sua promo atual de 50 % ($2.50 / $7.50 tabela).

TarefaMelhor modeloPorquêGrátis?Alternativa
Ensaios & trabalho de cursoGPT-5.5Grátis no ChatGPT, fiabilidade factual melhorada vs 5.4SimClaude Sonnet 5 (Claude grátis)
Resolução de problemas STEMGPT-5.6 Sol / Qwen 3.7 MaxNovo modelo de topo STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 fev.Pro pago / Qwen API pagoGemini 3.6 Flash (grátis)
Investigação & precisãoGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarefa, ancoragem nativa na Pesquisa GoogleSim (aplicação Gemini)Claude Opus 5
Revisão de escritaClaude Sonnet 5Grátis e predefinido no claude.ai; o Claude Fable 5 é o líder de qualidadeSim (Claude grátis)Claude Fable 5
Estudo multimodal (PDFs, slides, imagens)Gemini 3.6 FlashContexto 1M, grátis na aplicação GeminiSimNotebookLM (Google)
Segundo lugar e alternativas: o Claude Sonnet 5 (grátis) é o segundo para a escrita e revisão de ensaios. O Gemini 3.6 Flash (grátis) é o segundo para o estudo multimodal e a ingestão de PDF. O DeepSeek V4 é o segundo para a resolução de problemas com um orçamento estritamente de custo zero.
Guia de utilização, agosto de 2026

Melhor IA para o trabalho & profissionais

1
GPT-5.6
Trabalho de conhecimento diário
2
Claude Opus 5
Programação & escrita
3
Gemini 3.1 Pro
Investigação & briefings

A melhor IA para trabalho profissional é o GPT-5.6 (predefinição do ChatGPT desde 9 de julho) para trabalho de conhecimento diário, o Claude Opus 5 para programação e escrita de alto risco, e o Gemini Spark para fluxos agênticos 24/7. A maioria dos profissionais tira o máximo partido ao manter duas subscrições pagas (ChatGPT Plus a $20/mês mais Claude Pro a $20/mês, um total de $40/mês), ou ao consolidar com o Fello AI a $9.99/mês para os cinco melhores modelos numa aplicação de Mac/iOS. Para trabalho agêntico que corre enquanto dorme, o Gemini Spark no Google AI Ultra a $99.99/mês é o único verdadeiro agente na cloud 24/7.

Caso de utilizaçãoMelhor modeloDado-chavePreçoAlternativa
Trabalho de conhecimento diárioGPT-5.6Predefinição do ChatGPT desde 9 de julho; o assistente que a maioria consegue abrir$20/mês ChatGPT PlusClaude Opus 5
Programação (proprietária)Claude Opus 5#1 na Arena WebDev (1,702.9) e image-to-WebDev (1,668.6); a predefinição recomendada pela Anthropic$20/mês Claude ProClaude Fable 5
Programação (económica)Qwen 3.7 Max80,4 SWE-Verified, contexto 1M$1.25 / $3.75 promo; $2.50 / $7.50 tabelaDeepSeek V4-Flash 0731
Investigação & briefingsGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarefa, ancoragem GoogleGoogle AI Pro / UltraClaude Opus 5
Matemática, física, modelação financeira difíceisGPT-5.6 SolNovo modelo de topo STEM da OpenAI (5.5 Pro verificado em 39,6 % FrontierMath)$100/mês ChatGPT ProQwen 3.7 Max
Fluxos de agente sempre ativosGemini SparkPrimeiro agente na cloud 24/7$99.99/mês Google AI UltraClaude Cowork
Notícias em direto, criativo com contexto do XGrok 4.5Classe Opus + ancoragem nativa no X$30/mês SuperGrokGemini 3.1 Pro
Consolidação tudo-em-umFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/mêsPagar a cada fornecedor em separado
Segundo lugar e alternativas: para a maioria das equipas profissionais, o Claude Opus 5 é o segundo atrás do GPT-5.6 para o trabalho diário e agora o líder da programação por completo a $5 / $25, com o Claude Fable 5 como o segundo para o trabalho de longo horizonte mais difícil. O Gemini 3.1 Pro é o segundo para funções com muita investigação, e o Gemini Spark é a escolha única se conseguir pôr um agente na cloud a trabalhar em tarefas longas.
Comparação de preços

Preços dos modelos de IA em agosto de 2026

De versões gratuitas a $0 até $199.99/mês do Google AI Ultra. O preço mais determinante desta tabela é o Claude Opus 5 a $5 / $25, porque é o modelo #1 no Intelligence Index da Artificial Analysis a metade do custo do Claude Fable 5. O Muse Spark 1.2 da Meta é listado a $1.25 / $4.25, com um nível Contributor a $0.10 / $0.20 para quem estiver disposto a deixar a Meta treinar com os seus prompts, e o Grok 4.5 é listado a $2 / $6. A escolha de relação preço-desempenho é agora o DeepSeek V4-Flash 0731 a $0.14 / $0.28, que iguala o Intelligence Index de 50 do Gemini 3.6 Flash e custa $0.03 por tarefa de índice contra os $0.56 do Flash. Entre os modelos fechados, o GPT-5.6 Luna é o mais barato a $0.20 / $1.20 após a descida da OpenAI de 30 de julho. Para uma análise mais aprofundada, consulte o nosso Guia completo de comparação de preços de IA.

ModeloEntrada (por 1M)Saída (por 1M)ContextoAcesso grátis?
GPT-5.5$5.00$30.001M (400K no Codex)ChatGPT Free; API paga
GPT-5.5 Pro$30.00$180.001MChatGPT Pro a partir de $100/mês (nível de maior utilização a $200)
GPT-5.6 Sol$5.00$30.00Não publicadoEm direto no ChatGPT, Codex & API (9 de julho)
GPT-5.6 Terra$2.00$12.00Não publicadoEm direto no ChatGPT, Codex & API (9 de julho)
GPT-5.6 Luna$0.20$1.20Não publicadoEm direto no ChatGPT, Codex & API (9 de julho)
Claude Opus 5$5.00$25.001MPredefinição no Claude Pro/Max; API paga
Claude Opus 4.8$5.00$25.001MModelo legacy na Anthropic; Pro/Max/API
Claude Fable 5$10.00$50.001MPermanente no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos
Claude Sonnet 5$2.00 introdutório / $3.00 tabela$10.00 introdutório / $15.00 tabela1MPredefinição no Claude Free & Pro; API paga
Claude Sonnet 4.6$3.00$15.001MAPI paga (substituído pelo Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MAplicação Gemini limitada; API paga
Gemini 3.6 Flash$1.50$7.501MAplicação Gemini/AI Studio; nível API gratuito + API paga
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; nível API gratuito + API paga
Qwen 3.7 Max$1.25 promo / $2.50 tabela$3.75 promo / $7.50 tabela1M200 pedidos grátis/dia; API paga para além disso
MiniMax M3$0.30 (50 % de desconto sobre $0.60)$1.20 (≤512K)1MOpen weights; custos de alojamento aplicáveis
LongCat-2.0Depende do fornecedorDepende do fornecedor1MOpen weights (MIT); custos de alojamento aplicáveis
NVIDIA Nemotron 3 UltraDepende do fornecedorDepende do fornecedor1MOpen weights (OpenMDW); custos de alojamento aplicáveis
Qwen 3.5 (open-weight)Auto-alojamento / TogetherAuto-alojamento / Together1MOpen weights; custos de alojamento aplicáveis
Nex-N2-ProAuto-alojamento / fornecedoresAuto-alojamento / fornecedores1MOpen weights (Apache 2.0); custos de alojamento aplicáveis
Rio 3.5 Open 397BAuto-alojamento / fornecedoresAuto-alojamento / fornecedores1MOpen weights (MIT); custos de alojamento aplicáveis
Grok 4.3$1.25$2.501MPlano de consumo gratuito; API paga
Grok 4.5$2.00$6.00500KGrok Build / Cursor / consola xAI; UE parcial, consola API ainda fechada
Muse Spark 1.2$1.25 ($0.10 nível Contributor)$4.25 ($0.20 nível Contributor)1MAPI paga; Muse Code, Meta Model API e OpenRouter; o nível Contributor troca direitos de treino por um desconto de ~92 %
Kimi K3$3.00 ($0.30 cache-hit)$15.001MNível básico gratuito na aplicação Kimi; open weights no Hugging Face (Kimi K3 License)
Gemini Omni Flash (vídeo)$1.50$17.50 (saída de vídeo)Clips de 10 segundosAplicação Gemini / Flow; AI Studio + API
DeepSeek V4-Pro$0.435 ($0.0036 cache-hit)$0.871MDeepSeek Chat grátis; API paga
DeepSeek V4-Flash 0731$0.14$0.281MDeepSeek Chat grátis; API paga
Kimi K2.7 CodeDepende do fornecedorDepende do fornecedor256KOpen weights; custos de alojamento aplicáveis
GLM-5.2Depende do fornecedorDepende do fornecedor1MOpen weights; custos de alojamento aplicáveis
ERNIE 5.1Preço para a região ChinaPreço para a região China256KNível gratuito da Baidu
Gemini Spark (agente)Sem preço de APISem preço de API1M (base Gemini)Google AI Ultra $99.99 ou $199.99/mês
Fello AI (agregador)Encaminhado pela aplicaçãoEncaminhado pela aplicaçãoDepende do modelo$9.99/mês, versão gratuita disponível

As tarifas do GPT-5.5 e GPT-5.5 Pro acima são preços de contexto curto; a OpenAI já não publica os números específicos de contexto longo. Os níveis GPT-5.6 são faturados a 2x a entrada e 1,5x a saída assim que um prompt ultrapassa os 272K tokens de entrada, o que coloca o Terra de contexto longo em $4 / $18 e o Luna em $0.40 / $1.80. Se quiser acesso a vários modelos de IA sem gerir subscrições separadas, o Fello AI disponibiliza GPT, Claude, Gemini, Grok, Perplexity e mais numa única aplicação para Mac, iPhone e iPad a partir de $9.99/mês.

Modelos open-weight

Melhores modelos open-weight em agosto de 2026

O melhor modelo open-weight em agosto de 2026 é o Kimi K3, e assumiu a liderança no momento em que a Moonshot publicou os pesos a 27 de julho de 2026. Detém o Intelligence Index mais alto de qualquer modelo open-weight com 57 na Artificial Analysis v4.1, seis pontos à frente do GLM-5.2, e na Arena continua a ser a entrada aberta mais bem posicionada, em #2 no WebDev (1,675.5) atrás apenas do Claude Opus 5 e #3 no quadro Agent. Um senão decide qual dos dois deve realmente utilizar. A transferência do K3 são 96 shards safetensors e cerca de 1,56 TB, o que precisa de um cluster de GPU multi-nó em vez de uma estação de trabalho, e chega sob uma licença própria Kimi K3 License em vez de MIT. Por isso o GLM-5.2 (Z.ai, MIT) continua a ser a nossa recomendação prática para equipas que fazem correr os seus próprios pesos, num Intelligence Index de 51, #6 na Arena WebDev (1,587.1) e #5 no quadro Agent. O terceiro lugar mudou de mãos no último dia de julho: o DeepSeek V4-Flash 0731 foi novamente pós-treinado e saltou de um Intelligence Index de 40 para 50, a $0.14 / $0.28 sob MIT.

ModeloMelhor paraBenchmark-chaveContexto / LicençaOnde executar
Kimi K3Modelo open-weight mais bem pontuado, trabalho agêntico e webII 57 (v4.1), o mais alto de qualquer modelo open-weight; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B ativos1M / Kimi K3 LicenseHugging Face (96 shards, 1.56 TB), Moonshot API, fornecedores
GLM-5.2Programação agêntica de longo horizonte, contexto 1MII 51 (v4.1), o mais alto que consegue alojar em hardware modesto; 744B/40B ativos1M / MITZ.ai, Hugging Face, OpenRouter
DeepSeek V4-Flash 0731Melhor relação qualidade-preço de qualquer modelo da páginaII 50 (v4.1), de 40 a 31 de julho; $0.03 por tarefa de índice, 284B/13B ativos1M / MITDeepSeek API ($0.14/$0.28), local
LongCat-2.0Programador aberto frontier treinado em chips chinesesII 33 (v4.1); 59,5 % SWE-Bench Pro (fornecedor), 1.6T/~48B ativos1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Multimodal de classe frontier baratoII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / licença por definirHugging Face, API $0.30/1M (50 % de desconto)
Nex-N2-ProPontuação de programação aberta mais forteII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B ativosBaseado em Qwen / Apache 2.0Hugging Face, fornecedores, auto-alojamento
Kimi K2.7 CodeProgramador aberto com licença comercial mais forte+21,8 % no Kimi Code Bench v2 vs K2.6 (fornecedor); 1T/32B ativos256K / Modified MITHugging Face, DeepInfra, fornecedores
DeepSeek V4-ProTrabalho agêntico em condições reaisII 44 (v4.1), 1.6T/49B ativos1M / MITDeepSeek API ($0.435/$0.87), local
Hy3O mais recente participante com licença permissivaII 41 (v4.1); #22 na Arena WebDev (1,516.4)Apache 2.0Hugging Face, fornecedores, auto-alojamento
InklingPrimeiro modelo open-weight da Thinking MachinesII 41 (v4.1), agêntico 32,3, lançado a 15 de julhoOpen weightsHugging Face, fornecedores, auto-alojamento
Inkling SmallMesma família a um quarto do tamanhoII 40 (v4.1), agêntico 30,8; 276B/12B ativos, entrada de texto, imagem e áudioApache 2.0Hugging Face (BF16 e NVFP4), fornecedores, auto-alojamento
NVIDIA Nemotron 3 UltraAfinado pela NVIDIA, licença totalmente permissivaII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B ativos1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 auto-alojamento)
Qwen 3.5 (397B / 17B ativos)Multimodal, descodificação rápida88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / abertoTogether, OpenRouter, local
Qwen3.6-35B-A3BProgramador agêntico aberto eficiente (3B ativos)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B ativos262K (até 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, local
Qwen3.6-27BProgramador denso executável em portátil87,8 GPQA Diamond, denso 27B, multimodal256K / Apache 2.0Local Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune de Qwen 3.5, raciocínio multilíngue70,8 Terminal-Bench 2.1 (first-party), bate o Qwen 3.7 Plus em 4/5397B/17B ativos / MITHugging Face, fornecedores, auto-alojamento
Llama 4 MaverickModelo de topo da linha Meta17B ativos / 400B de parâmetros no totalLlama 4 licenseCloud da Meta, Hugging Face, local
NVIDIA Nemotron 3 Nano OmniEdge / baixo consumoMultimodal, pegada muito reduzidaCompacto / abertoLocal, ferramenta NVIDIA

Aqui a licença importa tanto como a pontuação bruta: Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Nex-N2-Pro (Apache 2.0) e Nemotron 3 Ultra (OpenMDW) permitem todos claramente a utilização comercial, ao passo que o MiniMax M3 chega sob a sua própria licença comunitária e o Kimi K3 assenta na sua própria licença personalizada com um limiar de receita para quem o revenda como serviço. Nenhum modelo open-weight é já o primeiro em qualquer quadro da Arena que seguimos: o Claude Opus 5 arrebatou o quadro Agent em julho, o último que um modelo open-weight liderou.

Como avaliamos

Benchmarks, preços e utilização prática

Cada classificação desta página combina três entradas: benchmarks públicos de sete casas independentes (Artificial Analysis, Arena antiga LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize e o quadro oficial Terminal-Bench 2.1, cobrindo os índices Intelligence e Agentic, GPQA Diamond, ARC-AGI-1 a 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas e o Remote Labor Index), preços de API e subscrição publicados na página de preços oficial de cada fornecedor, e utilização prática pela equipa editorial da FelloAI que executa prompts reais sobre a mesma tarefa em cada modelo. Voltamos a obter as fontes oficiais de preços e benchmarks antes de cada atualização mensal.

Os benchmarks são ponderados consoante o caso de utilização: o SWE-bench e o Terminal-Bench impulsionam a programação, o GPQA Diamond e o ARC-AGI-2 impulsionam a precisão, o GDPval-AA (o benchmark de entregáveis profissionais da Artificial Analysis) informa a qualidade das tarefas profissionais ao passo que o estilo de escrita é avaliado sobretudo por testes práticos, o FrontierMath e o HMMT impulsionam a resolução de problemas. Revelamos quando um benchmark é reportado pelo fornecedor mas não verificado de forma independente, e descartamos qualquer afirmação que não conseguimos reproduzir contra uma fonte em direto. Não movemos a coroa de uma categoria pela força de um único quadro, e quando um modelo novo é demasiado recente para que os quadros de preferência humana o tenham avaliado, dizemo-lo em vez de o coroar apenas por pontuações de benchmark. Quando um modelo passa por uma atualização importante entre atualizações, reclassificamos a categoria e acrescentamos uma linha «O que mudou este mês» no fundo da análise aprofundada.

Perguntas frequentes

Perguntas comuns

Qual é o melhor modelo de IA neste momento em agosto de 2026?
Depende da tarefa. Na pontuação global de benchmark, o Claude Opus 5 (24 de julho) é #1 no Intelligence Index da Artificial Analysis com 61 e o seu Agentic Index com 55,3, e a Arena avaliou-o agora no topo de quatro dos seus quadros, incluindo os dois de programação. Para o chat do dia a dia, o GPT-5.6 é a predefinição do ChatGPT desde 9 de julho e o assistente que a maioria das pessoas consegue realmente abrir, embora o Claude Fable 5 lidere o quadro de texto da Arena. Para programação, o Claude Opus 5 é #1 nos quadros WebDev (1,702.9) e image-to-WebDev (1,668.6) da Arena a metade do preço do Fable 5. Para escrita, o Claude Fable 5 é #1 no quadro de texto da Arena (1508.6), no Humanity's Last Exam (53,3 %) e no AA-Omniscience (40). Para precisão, o Gemini 3.1 Pro iguala o painel humano no ARC-AGI-1 com 98 % por $0.52 por tarefa. Para matemática e raciocínio difíceis, o GPT-5.6 Sol é #1 no LiveBench Mathematics, LiveBench Reasoning e ARC-AGI-2. Para imagens, o ChatGPT Images 2.0 lidera os dois quadros, e para vídeo o Gemini Omni Flash lidera os dois. Para agentes, o Gemini Spark é o agente na cloud 24/7 e o Claude Cowork o de ambiente de trabalho.
O que é o Claude Opus 5?
O Claude Opus 5 é o mais recente modelo de topo da Anthropic, lançado a 24 de julho de 2026, e o atual modelo #1 na Artificial Analysis. Lidera tanto o Intelligence Index com 61 como o Agentic Index com 55,3, e encabeça o quadro GDPval-AA v2 de entregáveis profissionais com 1858, bem à frente dos 1746 do Claude Fable 5. O preço da API é de $5 / $25 por 1M de tokens, o mesmo que o Opus 4.8 e metade do custo do Fable 5, com uma janela de contexto de 1M de tokens e uma data de corte de conhecimento de maio de 2026. A ARC Prize confirma de forma independente a afirmação de lançamento da Anthropic sobre o ARC-AGI-3, onde o Opus 5 pontua 30 % contra 8 % do modelo seguinte, cerca de 3,75x. A Arena avaliou-o desde então, colocando-o em #1 no WebDev, image-to-WebDev, Document e no quadro Agent e em #6 no texto, e é isso que lhe valeu a coroa da programação. Uma coisa a ter em conta: a Artificial Analysis mede a sua taxa de alucinação em 50 %, razão pela qual não detém nenhuma coroa de precisão nesta página.
O Claude Fable 5 está de volta?
Sim. A Anthropic voltou a implementar o Claude Fable 5 a 1 de julho de 2026 depois de o governo dos EUA ter levantado a restrição de controlo de exportações que impusera a 12 de junho. Está de novo disponível na Claude API, no Claude.ai, no Claude Code e no Claude Cowork. A Anthropic tornou o Fable 5 permanente nos planos pagos a 20 de julho de 2026. O Max e o Team Premium incluem-no a cerca de 50 % dos limites de utilização habituais; o Pro e o Team Standard alcançam-no através de créditos de utilização com um crédito inicial único de $100. O preço da API é de $10 / $50 por milhão de tokens. O Fable 5 é um modelo de classe Mythos construído para trabalho agêntico de longo horizonte com um contexto de 1M de tokens, e é o segundo para programação atrás do Claude Opus 5, em #2 no quadro image-to-WebDev da Arena (1,625.7) e #4 no WebDev.
O que é o GPT-5.6 e posso utilizá-lo?
Sim, desde 9 de julho de 2026. O GPT-5.6 é a família de modelos de nova geração da OpenAI, e após uma pré-visualização fechada de duas semanas que começou a 26 de junho por trás de uma revisão de segurança do governo dos EUA, atingiu a disponibilidade geral a 9 de julho. Há três níveis, do menos ao mais capaz: Luna, o nível rápido e mais barato ($0.20 / $1.20 por 1M de tokens); Terra, um modelo equilibrado para o dia a dia que a OpenAI diz igualar o GPT-5.5 ($2 / $12); e Sol, o modelo de topo afinado para biologia, química e cibersegurança ($5 / $30). A OpenAI reduziu o Luna em 80 % e o Terra em 20 % a 30 de julho de 2026, e deixou o Sol e todos os preços de subscrição do ChatGPT intactos. Está agora em direto no ChatGPT, Codex e na API como modelo predefinido da OpenAI. Uma ressalva: o system card da OpenAI e o avaliador externo METR assinalaram um comportamento de «scheming» elevado no Sol, pelo que o trate com cuidado para trabalho factual de alto risco até os resultados independentes assentarem.
O Grok 4.5 já saiu?
Sim. A xAI lançou o Grok 4.5 publicamente a 8 de julho de 2026, o seu primeiro modelo de topo desde que a SpaceX absorveu a empresa e entrou em bolsa como SPCX. Elon Musk descreve-o como «um modelo de classe Opus, mas mais rápido, mais eficiente em tokens e de menor custo». É treinado com o Cursor e orientado para programação e trabalho agêntico, com um preço de $2 / $6 por 1M de tokens e uma janela de contexto de 500K tokens. Está em direto no Grok Build, no Cursor em todos os planos e na consola xAI. O acesso na UE começou a ser implementado após um anúncio de 16 de julho e continua parcial, com o Cursor a reportar disponibilidade ao passo que a consola API da xAI permanece fechada para os utilizadores da UE. A Artificial Analysis pontua-o com um Intelligence Index de 54 na v4.1, a par do campo no Terminal-Bench 2.1 (83,3 %) mas ficando atrás no SWE-Bench Pro com 64,7 %, pelo que é a escolha de relação qualidade-preço em vez do líder claro de benchmarks. O Grok 4.5 é também a nossa escolha para criatividade, por motivos de produto em vez de qualidade, dado que se situa em #33 no EQ-Bench Creative Writing; para a melhor saída escrita, o Claude Fable 5 vence por completo.
Qual é a melhor IA para programar?
O Claude Opus 5 é o melhor para programar, e vence os dois quadros onde os programadores votam no resultado em vez de um harness a executar um script: #1 no quadro WebDev da Arena (1,702.9) e #1 em image-to-WebDev (1,668.6), em cortes de votos de 1 de agosto e 31 de julho. Corre a $5 / $25 por 1M de tokens, metade do Claude Fable 5, e a própria documentação da Anthropic diz para começar com o Opus 5 para programação agêntica complexa. O Claude Fable 5 é o segundo para o trabalho de longo horizonte mais difícil em #2 image-to-WebDev e #4 WebDev, e o Kimi K3 é o candidato em #2 no WebDev (1,675.5). Note que o Coding Index da Artificial Analysis não é uma varrida da Claude: o GPT-5.6 Sol (xhigh) lidera-o com 78,3 com o Opus 5 em 78,0, perto o suficiente para lhe chamar empate. O DeepSeek V4-Flash 0731 é a escolha de relação preço-desempenho a $0.14 / $0.28, e o GLM-5.2 (MIT) é o melhor programador open-weight que consegue alojar por conta própria.
Qual é a melhor IA para escrever?
O Claude Fable 5 é o melhor para escrever, e é o único modelo entre os três primeiros dos três quadros independentes de escrita: #1 na Arena escrita criativa, #1 no LiveBench Language (90.7) e #3 no EQ-Bench Creative Writing v3. Custa $10 / $50 por 1M de tokens. O Claude Sonnet 5 é a escolha de relação qualidade-preço e o que a maioria das pessoas deveria realmente utilizar, uma vez que é grátis e predefinido no claude.ai a um preço introdutório de $2 / $10, embora se classifique em #53 na Arena escrita criativa. O Kimi K3 vence o EQ-Bench por completo com 2377 se quiser ficção distintiva, o Claude Opus 5 encabeça o quadro GDPval-AA v2 de entregáveis profissionais com 1858, o GPT-5.5 é a alternativa para escrita empresarial ancorada em factos, e o Gemini 3.6 Flash é a escolha de relação preço-desempenho para conteúdo em massa.
Qual é o melhor modelo de IA open-weight em 2026?
O Kimi K3 é o melhor modelo open-weight neste momento, e é-o desde que a Moonshot publicou os pesos a 27 de julho de 2026. Tem o Intelligence Index mais alto de qualquer modelo open-weight com 57 na Artificial Analysis v4.1, e na Arena é #2 no WebDev e #3 no quadro Agent. O senão é que são 96 shards e cerca de 1,56 TB sob uma licença própria Kimi K3 License, pelo que o GLM-5.2 (13 de junho, MIT) continua a ser o modelo que a maioria das equipas consegue realmente alojar, num Intelligence Index de 51 e #6 na Arena WebDev. O terceiro é o DeepSeek V4-Flash 0731, que saltou de um Intelligence Index de 40 para 50 a 31 de julho sem mudar de preço, tamanho ou licença, o que faz dele a melhor relação qualidade-preço no campo aberto a $0.14 / $0.28 sob MIT. Vale a pena saber, com honestidade, que nenhum modelo open-weight é já o primeiro em qualquer quadro da Arena que seguimos.
Qual é o modelo de IA de classe frontier mais barato?
No preço de API por milhão de tokens, o GPT-5.6 Luna é agora o modelo fechado de classe frontier mais barato a $0.20 / $1.20, depois de a OpenAI o ter reduzido em 80 % a 30 de julho de 2026, e a Artificial Analysis pontua-o com um Intelligence Index de 51, um ponto acima do Gemini 3.6 Flash. Ainda mais barato, o DeepSeek V4-Flash 0731 a $0.14 / $0.28 é agora a nossa escolha de relação preço-desempenho: iguala o Intelligence Index de 50 do Gemini 3.6 Flash e custa $0.03 por tarefa de índice contra os $0.56 do Flash, sob uma licença MIT que consegue auto-alojar. O MiniMax M3 é agora listado a $0.30 por milhão de tokens de entrada com um desconto permanente de 50 %, com o LongCat-2.0 como forte alternativa MIT. O Qwen 3.7 Max a $1.25 / $3.75 na sua promo atual é a escolha de relação qualidade-preço num Intelligence Index de 46, embora o Luna o supere agora tanto no preço como na pontuação.
Que modelos de IA são grátis?
O ChatGPT Free usa agora o GPT-5.6 por predefinição (com o GPT-5.5 ainda disponível) sob limites de utilização. O Gemini Free faz correr o Gemini 3.6 Flash na aplicação Gemini e no Google AI Studio. O Claude Free faz correr o Claude Sonnet 5 (a nova predefinição) com limites diários. O DeepSeek Chat faz correr o DeepSeek V4 grátis no site da DeepSeek. O Grok tem um plano de consumo gratuito limitado (o X Premium é um extra pago). O Qwen 3.5, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4 e GLM-5.2 são open-weight e grátis para auto-alojar. O Qwen 3.7 Max é apenas API sem front-end de chat de consumo, mas a Alibaba inclui agora 200 pedidos de modelo grátis por dia. O Kimi tem um nível básico gratuito na sua aplicação, com a utilização agêntica mais intensa medida.
O que é o Gemini Spark e vale $99.99/mês?
O Gemini Spark é o primeiro agente de IA da Google residente na cloud 24/7, lançado na Google I/O a 19 de maio de 2026 e exclusivo do plano Google AI Ultra, que a Google reestruturou para incluir um nível de entrada a $99.99/mês e um nível de topo a $199.99/mês. O Spark é construído sobre os modelos base Gemini com o harness Antigravity da Google numa VM da Google Cloud, integra-se com o Gmail, o Google Docs e outras aplicações do Google Workspace, e consegue interagir com o Chrome e o sistema Halo do Android do lado do dispositivo. Vale o gasto para utilizadores que têm fluxos repetíveis de longa duração (triagem da caixa de entrada, sínteses de investigação, tarefas agendadas). Para tarefas pontuais, o Claude Cowork a $20/mês cobre a maioria das necessidades de agente de ambiente de trabalho.
O que é o Fello AI?
O Fello AI é um chatbot de IA para Mac, iPhone e iPad que lhe permite utilizar todos os melhores modelos de IA como o ChatGPT, Claude, Gemini, Grok e DeepSeek numa única aplicação, com modelos atualizados regularmente para que tenha sempre os mais recentes. Custa $9.99/mês com uma avaliação de 4,7 estrelas ao longo de mais de 27 000 críticas.
Com que frequência atualizam esta página?
Atualizamos esta página pelo menos uma vez por mês e no prazo de 24-48 horas após o lançamento de qualquer modelo importante.
Artigos relacionados
Claude vs ChatGPT: qual a IA que é realmente melhor em 2026?

O Claude atingiu o #1 na App Store no início de 2026, empurrando o ChatGPT para fora do primeiro lugar pela primeira vez. O catalisador foi a recusa pública da Anthropic em ceder à exigência do Pentágono de implementar os seus modelos para armas autónomas.

Ler mais →
Grok vs ChatGPT: qual o chatbot de IA que é realmente melhor em 2026?

Ambos os chatbots acabaram de mudar para novos modelos de topo. O ChatGPT corre agora o GPT-5.6 (níveis Sol, Terra, Luna) e o Grok é alimentado pelo Grok 4.5, a versão da xAI focada em programação de 8 de julho.

Ler mais →
ChatGPT vs Gemini em 2026: qual a IA que deve realmente utilizar?

O ChatGPT mudou para o GPT-5.6 como modelo de topo, enquanto o Gemini 3.1 Pro continua a ser o modelo de topo pago da Google. Frente a frente em escrita, programação, imagens e preço.

Ler mais →
Classificações da melhor IA de fevereiro de 2026

GPT-5.2, Claude Opus 4.6 e Gemini 3.1 Pro frente a frente. A nossa análise aprofundada mensal de fevereiro com benchmarks e resultados práticos.

Ler mais →
Melhores modelos de IA em janeiro de 2026

Gemini 3 Pro, Claude 4.5, ChatGPT (GPT-5.2), Grok 4.1 e DeepSeek classificados. A nossa escolha mensal de janeiro de 2026 em cada modelo importante.

Ler mais →
Gemini Nano Banana Pro vs GPT-Image-1.5: comparação definitiva

A nossa comparação prática original de dezembro de 2025 dos dois principais modelos de geração de imagens, com amostras de saída reais lado a lado.

Ler mais →

Experimente todos os modelos.
Uma aplicação linda.

Todos os modelos deste guia numa aplicação nativa: ChatGPT, Claude, Gemini, Grok e DeepSeek. Grátis para começar.

Fello AI a funcionar no Mac, iPad e iPhone

Avaliação de 4,7·mais de 27 000 críticas·Grátis para começar