Atualizado 23 de setembro de 2026

Melhores modelos de IA em 2026

Classificações, comparações e análises aprofundadas, atualizadas todos os meses à medida que chegam novos modelos.

A Anthropic lançou o Claude Opus 5.5 a 22 de setembro e ele fica com a coroa da programação. A Artificial Analysis mede-o em 57,6 no Intelligence Index v4.3.2, a pontuação mais alta que alguma vez publicou e 4,3 pontos à frente do Claude Fable 5.1, e leva com ele o GDPval-AA v2.1, o AA-Briefcase v1.1 e o Humanity's Last Exam. Consegue-o a $4 / $20 por 1M de tokens, abaixo do Claude Opus 5 a $5 / $25, por isso o melhor modelo é agora também o mais barato.

A OpenAI respondeu cerca de noventa minutos depois com o GPT-6 Sol e o GPT-6 Luna e com eles cortou para metade os preços da sua API: o Sol fica a $2 / $10 por 1M de tokens e o Luna a $0,10 / $0,50, e nenhum deles está ainda na janela de chat do ChatGPT. O GPT-6 Astra mantém os dois quadros de programação da Arena, porque o Opus 5.5 ainda não tem votos lá, e o Claude Fable 5.1 mantém escrita e precisão nos quadros que decidem essas categorias. Esta página ordena por pontuações medidas, por isso uma coroa muda assim que um modelo supera o detentor, sem esperar pelos quadros baseados em votos. O nosso guia de benchmarks de IA explica como esse índice é construído e porque o seu número de versão importa.

A SpaceXAI lançou o Grok 4.7 a 21 de setembro sobre um modelo base novo e maior, e fica acima do Astra nos dois quadros agênticos que a Artificial Analysis publica. O Intelligence Index marca 46,3 contra os 44,3 do Grok 4.6 e o preço por tokens não se mexe, $2 / $6, mas uma tarefa do índice custa $2,73 contra $1,86, porque o 4.7 emite cerca do dobro da saída. Arrancou na API, no Cursor e no Grok Build; a aplicação Grok continua a servir o 4.6.

O campo aberto também tem novo líder: o MiMo-V2.6-Pro da Xiaomi, publicado a 21 de setembro sob MIT simples, pontua 46,3 e resolve uma tarefa do índice por $0,13, o mais barato entre os modelos abertos desta página. Abaixo estão os vencedores por categoria de setembro de 2026. Clique num cartão para ir direto à análise completa, ou use a navegação fixa para saltar entre categorias. Classificações, benchmarks e preços são atualizados no prazo de 48 horas após qualquer lançamento importante.

Vencedores por categoria de setembro de 2026
Escrita
Claude Fable 5.1
#2 EQ-Bench Creative Writing e #2 LiveBench Language
O único modelo entre os seis primeiros nos três quadros de prosa. Melhor valor: Claude Sonnet 5, grátis em claude.ai.
Análise aprofundada →
Chat & assistente do dia a dia
GPT-5.6
Modelo predefinido do ChatGPT desde 9 de julho
O melhor assistente que a maioria das pessoas consegue realmente abrir, equilibrando capacidade, velocidade e alcance.
Análise aprofundada →
Imagens
ChatGPT Images 2.5
#1 e #2 nos quatro quadros de imagem que acompanhamos
Os seus dois modelos ocupam os dois primeiros lugares em todos os quadros de imagem que acompanhamos, tanto da Arena como da Artificial Analysis, e é a predefinição em todos os planos ChatGPT, incluindo o gratuito. Melhor valor: o Flare, o mais rápido dos dois, ao mesmo preço por tokens do GPT Image 2.
Análise aprofundada →
Vídeo
Gemini Omni 1.1 Flash
#1 Arena texto para vídeo (1516), cenas de 40 segundos
O mais recente modelo de vídeo da Google: extensão de cena até 40 segundos, saída em 4K, desde $0.03 por segundo.
Análise aprofundada →
Programação
Claude Opus 5.5
#1 Terminal-Bench 4.0 (59,6 %) e #1 Intelligence Index (57,6)
O topo de gama da Anthropic de 22 de setembro lidera o Terminal-Bench 4.0 da Artificial Analysis e os dois quadros de programação do LiveBench, a $4 / $20 contra os $10 / $50 do GPT-6 Astra. O Astra mantém os dois quadros de programação da Arena, que ainda não têm votos para o Opus 5.5.
Análise aprofundada →
Criatividade
Grok 4.7
Menos restrições de conteúdo + X nativo em tempo real
A escolha para trabalho ousado e na moda: menos barreiras e integração nativa com o X. O Grok 4.7 está na API, no Cursor e no Grok Build; a aplicação Grok de $30 por mês continua a servir o 4.6.
Análise aprofundada →
Precisão & investigação
Claude Fable 5.1
A maior precisão factual que a Artificial Analysis mediu (67 %)
Lidera os quadros que medem com que frequência um modelo está simplesmente errado. Melhor valor: Gemini 3.1 Pro a $0,52 por tarefa com ancoragem no Google Search.
Análise aprofundada →
Resolução de problemas
GPT-6 Astra
#1 LiveBench Reasoning (92,65) e #1 ARC-AGI-2 (95 %)
Tirou ao GPT-5.6 Sol os quadros de raciocínio mais duros dias depois do lançamento. Melhor valor: GPT-6 Sol a $2 / $10, que supera o GPT-5.6 Sol no Intelligence Index por metade do preço.
Análise aprofundada →
Agentes de IA
Gemini Spark
Primeiro agente de IA residente na cloud 24/7
Funciona continuamente numa VM da Google Cloud, profundamente integrado com o Gmail, o Docs e o Chrome.
Análise aprofundada →

Quer os melhores modelos de IA sem fazer malabarismos com subscrições separadas? O Fello AI reúne os principais modelos numa aplicação nativa para Mac, iPhone e iPad.

Descarregar Fello AI
Novidades de setembro de 2026
22 set. OpenAI O GPT-6 Sol e o GPT-6 Luna cortam para metade os preços da API da OpenAI e chegam a todo o lado menos ao chat do ChatGPT Novo
A OpenAI lançou o GPT-6 Sol e o GPT-6 Luna a 22 de setembro de 2026, cerca de noventa minutos depois de a Anthropic ter lançado o Claude Opus 5.5, e o lançamento é um argumento sobre custo por tarefa, não sobre o topo do quadro. O Sol desce de $4 / $20 para $2 / $10 por 1M de tokens e o Luna de $0,20 / $1,20 para $0,10 / $0,50, com as leituras de cache com 90 % de desconto, para $0,20 e $0,01. A OpenAI rotula ambos os cortes como de 50 %, mas a saída do Luna cai 58,3 %, e a comparação é com os preços promocionais do GPT-5.6, não com o tarifário. Dois porta-vozes e Tibo Sottiaux, da OpenAI, dizem todos que as novas taxas são permanentes. Onde os pode usar é a parte que todos os resumos achataram: os modelos estão no ChatGPT Work e no Codex para Plus, Pro, Business, Enterprise e Edu, os utilizadores Free e Go chegam ao Luna na aplicação de computador, e a OpenAI diz sem rodeios que «ainda não estão disponíveis no Chat». De forma independente, a Artificial Analysis pontua o Sol em 47,5 no Intelligence Index v4.3.2 em esforço máximo contra os 47,0 do GPT-5.6 Sol, a $1,06 por tarefa do índice contra $1,99, com 43,9 % no Terminal-Bench 4.0 contra 39,9 % e a taxa de alucinação a descer de 92 % para 60 %. O Luna fica ao nível do GPT-5.6 Luna com 37,3, mas resolve uma tarefa do índice por $0,07 contra $0,18, o que faz dele o modelo mais barato por tarefa do índice desta página. A ARC Prize pontuou o Luna, 59,3 % no ARC-AGI-2 contra os 59,5 % da versão 5.6, e não publicou nada sobre o Sol. As avaliações da própria OpenAI são todas argumentos de custo: no AutomationBench 1.0.6, o Sol em esforço xhigh leva 33,2 % por $0,27 à tarefa, e a linha rival mais próxima é o Claude Fable 5.1 com recurso ao Opus 5 em 31,4 %, pelo que a vantagem real é de 1,8 pontos e não dos 6,3 que a linha do Claude Opus 5 sugere. A OpenAI diz que o Sol comete cerca de metade dos erros do GPT-5.6 Sol, «aproximando-se da fiabilidade do Astra a um custo muito menor», e repete que o Astra continua a ser o seu melhor modelo em geral. Nada disto muda uma coroa: o Sol e o Luna são mais baratos, não melhores. Não existe GPT-6 Terra, e a OpenAI não disse se está previsto. Todo o detalhe na nossa análise do GPT-6 Sol e Luna.
22 set. Anthropic O Claude Opus 5.5 leva o Intelligence Index com 57,6 e fica abaixo do preço do Opus 5 Novo
A Anthropic lançou o Claude Opus 5.5 a 22 de setembro de 2026, o primeiro modelo de uma nova família Claude 5.5, e é o maior avanço num único dia que esta página registou. A Artificial Analysis mede-o em 57,6 no Intelligence Index v4.3.2, 4,3 pontos acima do Claude Fable 5.1 e a pontuação mais alta que publicou para qualquer modelo, e leva com ele o GDPval-AA v2.1 com 1846 contra os 1735 do Fable 5.1, o AA-Briefcase v1.1 com 1822 contra 1678, o Humanity's Last Exam com 61,4 % contra 59,1 % e a própria campanha de Terminal-Bench 4.0 da Artificial Analysis com 59,6 % contra os 59,1 % do GPT-6 Astra. O preço desce em vez de subir: $4 / $20 por 1M de tokens contra os $5 / $25 do Opus 5, leituras de cache 60 % mais baratas a $0,20 e escritas a $5, com os testes da própria Anthropic a colocar uma carga de trabalho típica 40 % mais barata do que no Opus 5 e a saída mais de 30 % mais rápida. Um modo rápido no Claude Code e na Claude Platform duplica o preço por até 2,5 vezes a velocidade. No harness da própria Anthropic a distância na programação é ainda maior, 66,4 % no Terminal-Bench 4.0 contra os 57,9 % que a OpenAI reporta para o Astra, mais 54,4 % no FrontierCode v1.1 e 57,8 % no CursorBench 4.0. Duas coisas que não ganha: o AutomationBench da Zapier, onde o Astra faz 41,4 % contra os seus 40,0 %, e o Terminal-Bench-Science 0.1, onde o Astra faz 64,6 % contra os seus 58,7 %. Leia as margens com a ressalva que a própria Anthropic imprime, de que o modelo "performs at the level of Claude Fable 5.1 on most work" e de que "benchmark margins have become a less reliable guide to real-world differences". Está disponível de forma geral na Claude Platform como claude-opus-5-5 e na AWS, Google Cloud e Microsoft Azure, os limites de cinco horas sobem nos planos Pro, Max e Team, e o Claude Sonnet 5.5 e o Claude Haiku 5.5 seguem nas próximas semanas. Como iguala o Claude Mythos 5.1 em biologia e cibersegurança, sai com as salvaguardas do Fable 5.1 e com um novo Life Sciences Verification Program para laboratórios verificados. Nenhum quadro da Arena o avaliou ainda. Todo o detalhe na nossa análise do Claude Opus 5.5.
21 set. SpaceXAI O Grok 4.7 chega sobre um modelo base maior aos mesmos $2 / $6 e custa mais 47 % por tarefa Novo
A SpaceXAI lançou o Grok 4.7 a 21 de setembro de 2026 como o seu modelo mais capaz para programação e trabalho de conhecimento. Assenta num modelo base novo e maior do que o Grok 4.6, com uma campanha mais longa de aprendizagem por reforço orientada para tarefas que demoram muitas horas, e foi treinado para perceber nativamente o harness do Grok Bot. A empresa não publica qualquer contagem de parâmetros. Pelos seus próprios números faz 46,3 % no CursorBench 4.0 contra os 40,4 % do Grok 4.6 e os 41,7 % do GPT-5.6 Sol, 71,0 % no DeepSWE v1.1 em esforço alto, 64,0 % no EEBench, 38,0 % no Terminal-Bench 4.0, 19,6 % no benchmark de agente jurídico da Harvey e 56,7 % no HealthBench Professional. De forma independente, a Artificial Analysis coloca-o em 46,3 no Intelligence Index v4.3.2 em esforço alto contra os 44,3 do Grok 4.6, e em 1695 no GDPval-AA v2.1 e 1657 no AA-Briefcase v1.1, ambos acima dos 1542 e 1569 do GPT-6 Astra. O preço não se mexe, $2 / $6 por 1M de tokens com o pedido inteiro refaturado a $4 / $12 acima dos 200 000 tokens de prompt, e uma variante rápida corre ao dobro da velocidade de saída pelo dobro do preço. O que se mexe é o custo por tarefa: $2,73 contra os $1,86 do Grok 4.6, porque o 4.7 emite cerca do dobro dos tokens de saída para chegar ao mesmo sítio, e o esforço xhigh não traz pontos de índice extra em nenhuma das gerações. Na segurança a SpaceXAI reporta a maior resistência a recusas e jailbreaks que testou, 62,4 % no benchmark de biossegurança da LatchBio e 3,3 % de prompts de duplo uso arriscados deixados passar no seu próprio HackerBench v0.3. A disponibilidade é do lado dos programadores: a API do Grok, o Cursor, o Grok Build, harnesses de programação de terceiros e routers na nuvem. O anúncio nada diz sobre a aplicação Grok para consumidores, que continua a servir o Grok 4.6. Todo o detalhe na nossa análise do Grok 4.7.
21 set. Xiaomi O MiMo-V2.6-Pro da Xiaomi é o modelo aberto com a maior pontuação alguma vez medida, a $0,13 por tarefa do índice sob MIT Novo
A Xiaomi publicou o MiMo-V2.6-Pro a 21 de setembro de 2026 sob MIT simples, com os pesos no Hugging Face em XiaomiMiMo/MiMo-V2.6-Pro-RL no próprio dia. É uma mistura de especialistas de 1,02 biliões de parâmetros com 42 mil milhões ativos e contexto de 1M de tokens. A Artificial Analysis mede-o, e não o estima, em 46,3 no Intelligence Index v4.3.2, a maior pontuação aberta que alguma vez publicou: acima do GLM-5.3 com 44,8, acima do Kimi K3 com 43,6 e a par do acabado de sair Grok 4.7 da SpaceXAI. A outra metade da história é o custo. Resolve uma tarefa do Intelligence Index por $0,13 a $0,435 / $0,87 por 1M de tokens, mais barato por tarefa do que qualquer outro modelo aberto desta página, cerca de metade do que custa o GLM 5.3 Flash por mais quatro pontos e meio. Faz também 34,8 % no Terminal-Bench 4.0, 1673 no GDPval-AA v2.1, 49,4 % no Humanity's Last Exam e 86,3 % no AA-LCR, o que o coloca acima do Kimi K3 em três desses quatro. Dois limites merecem ser ditos sem rodeios. Nenhum quadro da Arena o avaliou, por isso não há qualquer prova de preferência humana sobre ele, e foi publicado há quatro dias, pelo que não tem histórico independente para além da Artificial Analysis. E 1,02 biliões de parâmetros são um cluster, não uma estação de trabalho, razão pela qual o GLM 5.3 Flash continua a ser a nossa recomendação para equipas que querem mesmo alojar o seu. Fica com a coroa dos pesos abertos desta página pela pontuação medida e pelo custo.
15 set. TypeSafe A TypeSafe sai do modo furtivo com o Jev, um modelo que devolve decisões tipadas em vez de texto, a $0.042 por 1M de tokens Novo
A TypeSafe AI saiu de dois anos em modo furtivo a 15 de setembro de 2026 com 40 milhões de dólares de financiamento inicial liderado pela DCVC e um modelo que não gera texto nenhum. O Jev é o primeiro daquilo a que a empresa chama modelos System One: envia-se um bloco de estado e um conjunto fixo de perguntas tipadas, e ele responde a todas numa única passagem paralela, devolvendo uma escolha, uma pontuação ou uma probabilidade de sim ou não em vez de uma frase. Como o espaço de respostas é definido antes da chamada, não pode devolver um resultado mal formado, e daí vem a frase do anúncio de que o Jev não pode alucinar. Ainda assim pode escolher a opção errada, e a própria documentação da TypeSafe diz que a calibração não garante que uma resposta individual esteja correta. O preço é de $42 por mil milhões de tokens de entrada, ou seja $0.042 por 1M, com saída gratuita, contexto de 64k e apenas entrada de texto. Os números de desempenho exigem cuidado, porque a empresa publicou quatro diferentes em três dias: desde menos de 100 milissegundos e até 100x mais rápido no comunicado até 193.6x mais rápido e 444.6x mais barato na página inicial, cada um medido contra um rival diferente, e a sua própria nota de rodapé chama aos números grandes o limite superior dos ganhos reais. A sua avaliação de fluxos de trabalho mede-se contra a média do GPT-6 Astra e do Fable 5.1 em vez de uma verdade de referência, e a empresa não publica qualquer pontuação pública de benchmark por opção. Dois testes independentes de 18 de setembro mediram cerca de 6x menos custo e 8x mais velocidade face a um modelo barato com o raciocínio desligado, e a calibração aguentou. Nada disto altera uma escolha desta página: o Jev não tem interface de consumidor e está em acesso antecipado com lista de espera. Todos os detalhes na nossa explicação dos modelos System One.
10 set. DeepSeek A DeepSeek retira o V4-Flash, substitui-o pelo V4.1-Flash e corta a tarifa Flash em cerca de um terço Novo
A DeepSeek retirou o DeepSeek-V4-Flash a 10 de setembro de 2026 e colocou o DeepSeek-V4.1-Flash no seu lugar. O nome do modelo é agora deepseek-flash; os nomes antigos deepseek-v4-flash e deepseek-v4-flash-vision-exp continuam a resolver, mas os modelos por trás deles foram retirados e os pedidos são servidos pelo V4.1-Flash, faturados ao preço Flash. Esse preço desce cerca de um terço: $0.15 / $0.60 por 1M de tokens fora de ponta e $0.30 / $1.20 em hora de ponta, contra $0.22 / $0.66 e $0.44 / $1.32 da versão que substitui, com acertos de cache a $0.003 fora de ponta. As janelas de ponta não mudam, das 01:00 às 04:00 e das 06:00 às 10:00 UTC em dias úteis, com as restantes horas a metade do preço. O V4-Pro fica intacto a $0.66 / $1.98 fora de ponta, e a DeepSeek disse que o continuará a servir para lá da data de retirada de 14 de setembro. O modelo novo é um mixture-of-experts de 552 mil milhões de parâmetros sobre um desenho causal encoder-decoder que ativa 8 mil milhões de parâmetros no prefill e 16 mil milhões na descodificação, aceita um contexto de 1M de tokens, lê imagens de forma nativa e apareceu no Hugging Face sob MIT no mesmo dia. A Artificial Analysis pontua-o com 39,5 no Intelligence Index v4.3 contra 34,5 da versão V4-Flash 0731 que substitui, a $0.27 por tarefa do índice. Não recupera a escolha de relação preço-desempenho: o GLM 5.3 Flash marca 41,9 a $0.25 por tarefa. Todo o detalhe no nosso guia de preços da DeepSeek.
3 set. OpenAI O GPT-6 Astra sai a $10 / $50 e, num dia, está no Plus e no Pro e lidera os quadros de programação Novo
A OpenAI lançou o GPT-6 Astra a 3 de setembro de 2026, o que encerra a discussão que durou todo o ano: isto é o GPT-6, não mais uma versão intermédia da linha GPT-5. O presidente da empresa, Greg Brockman, disse numa conferência de imprensa «Bem-vindos à era da AGI.» Os números independentes são mais contidos do que o enquadramento. A Artificial Analysis dá ao Astra 61 no Intelligence Index v4.1.1 em esforço max, exatamente ao nível do GPT-5.6 Sol, cinco pontos atrás do Claude Fable 5.1 com 66 e dois atrás do Claude Opus 5 com 63, e cobra $10 / $50 por 1M de tokens contra os $4 / $20 do Sol, o que dá mais 75 % por tarefa do índice do que o modelo que substitui. O resultado mais forte está no Coding Agent Index, onde o Astra no Codex faz 67, ao nível do Claude Opus 5 e do Claude Fable 5 no Claude Code e atrás dos 70 do Claude Fable 5.1, e chega lá com um terço dos tokens do Sol e um quinto dos do Opus 5, o que o coloca na fronteira de eficiência de custo. Também reduz para metade as alucinações no AA-Omniscience, de 92 % para 51 % em esforço max, ganhando ao mesmo tempo quatro pontos de precisão, e soma cerca de 80 Elo no AA-Briefcase e seis pontos no Humanity's Last Exam. Em sentido contrário, perde cerca de 80 Elo no GDPval-AA v2 e recua dois a três pontos em apoio ao cliente, no SciCode e no raciocínio de contexto longo. Duas ressalvas acompanham os números do lançamento: os 98,6 % no ARC-AGI-3 não são uma taxa de resolução mas uma pontuação de eficiência de ações face a uma referência humana, medida num arnês que a própria OpenAI mostrou poder triplicar o resultado, e a Epoch AI revela que a OpenAI financiou o FrontierMath e tem acesso exclusivo a uma parte. A verdadeira limitação é a disponibilidade. O Astra é o primeiro modelo que a OpenAI classificou como crítico em cibersegurança no seu Preparedness Framework, pelo que chegou primeiro aos defensores aprovados do programa Daybreak. O ChatGPT Business e Pro seguiram a 4 de setembro e o Plus umas horas depois, enquanto a API, a AWS, o Azure e o plano gratuito continuam pendentes. A Artificial Analysis retirou entretanto o Coding Agent Index e, na sua própria campanha de Terminal-Bench 4.0, o Astra lidera agora de forma clara, 60 % contra os 55 % do Claude Fable 5.1, que foi o que moveu a coroa de programação desta página para o Astra. Todo o detalhe na nossa análise do GPT-6 Astra.
2 set. Alibaba Qwen3.8-Max-0902 tira ao Claude Opus 5 o quadro WebDev da Arena por três pontos, a $2 / $6 Novo
A Alibaba lançou o Qwen3.8-Max-0902 a 2 de setembro de 2026, e a primeira coisa a perceber bem é o nome: trata-se de uma renovação de pós-treino do Qwen3.8-Max que saiu a 3 de agosto, e não de uma versão nova, com os mesmos 2,4 biliões de parâmetros e a mesma janela de contexto de 1M de tokens. A Qwen diz que foi adicionalmente pós-treinado em programação e trabalho do tipo Cowork. O que importa é o quadro que moveu. A Arena anunciou nesse mesmo dia que o Qwen3.8-Max-0902 estreou em #1 geral no Code Arena: WebDev com 1691 pontos, três acima do Claude Opus 5 (Max), dezassete acima do Kimi K3 (Max) e vinte e dois acima do anterior Qwen3.8-Max, arrebatando também o #1 nas categorias Data & Analytics e Consumer Product. É a primeira vez este ano que um modelo da Anthropic é destronado do topo de um quadro de programação por votos. O preço é de $2 / $6 por 1M de tokens com cache hits a $0.17 explícito e $0.25 implícito, o que a Arena contabiliza como $5 misturados por milhão e a melhor posição na sua fronteira de Pareto. Leia isto com três ressalvas. Três pontos cabem no ruído de um quadro por votos, a Artificial Analysis não tinha então publicado qualquer Intelligence Index para o instantâneo 0902 e atribuiu-lhe entretanto 45,4 na v4.3, e este é um modelo alojado na QwenCloud sem interface de chat de consumo: os pesos abertos que a Alibaba prometeu para o Qwen3.8-Max em agosto continuam por chegar, pelo que nada disto muda a nossa escolha open-weight. A Arena diz que as pontuações da Agent Arena ainda estão para vir. O Qwen3.8-Max-0902 caiu entretanto para quarto no WebDev, atrás do GPT-6 Astra, do Claude Fable 5.1 e do Claude Opus 5, e a categoria de programação passou para o Astra. Todo o detalhe na nossa análise do Qwen 3.8.
2 set. Meta Muse Spark 1.3, Intelligence Index de 57 para 61 a um valor inalterado de $1.25 / $4.25, ganha na programação e perde todas as linhas de agente Novo
A Meta lançou o Muse Spark 1.3 a 2 de setembro de 2026, o seu quarto modelo Muse Spark em cinco meses, no Muse Code e na Meta Model API. A Artificial Analysis pontua-o com 61 no Intelligence Index v4.1.1, contra 57 do 1.2 e 53 do 1.1, oito pontos em dois meses e a subida mais rápida que alguém consegue nesta página. O preço não se mexeu de todo: $1.25 / $4.25 por 1M de tokens sobre uma janela de contexto de 1M de tokens, e o nível Contributor continua nos $0.10 / $0.20 em troca de permitir que a Meta treine com os seus prompts e completions. Há duas coisas neste lançamento que convém ler com atenção. No quadro da própria Meta o modelo ganha todas as linhas de programação, DeepSWE v1.1 com 75,4 contra os 74,0 do Claude Opus 5 e SWEAtlas CodeBase QnA com 59,4, empata com o GPT-5.6 Sol no Terminal-Bench 2.1 em 88,8 e leva as duas bandas de contexto longo do MRCR com folga, 98,1 na banda de 512K a 1M contra os 55,5 do 1.2. Também perde as seis linhas que a Meta agrupa sob Agent, quatro para o Opus 5 e duas para o GPT-5.6 Sol, e essa metade do gráfico quase não foi noticiada. O outro senão é qual o modelo medido: a coluna avaliada é o Muse Spark 1.3 (max), um acesso antecipado limitado para parceiros da Meta que pontua 62, enquanto a versão que qualquer pessoa pode chamar hoje é a xhigh com 61, e a Meta correu a coluna de comparação do 1.2 em xhigh e não em max. A Meta lançou-o primeiro para programadores, no Muse Code e na Meta Model API, e disse que uma implementação no Facebook, no Instagram e na app Meta AI se seguiria nos dias seguintes, e a promessa de pesos abertos voltou a escorregar: o compromisso de agosto de publicar os pesos do Muse Spark 1.2 tornou-se uma frase sem data sobre pesos abertos que chegarão em breve. Todo o detalhe na nossa análise do Muse Spark 1.3.
2 set. Google Gemini 3.8 Flash, mais três pontos no Intelligence Index pelo mesmo $0.75 / $3.75 Novo
A Google disponibilizou o Gemini 3.8 Flash de forma geral a 2 de setembro de 2026, três semanas depois do 3.7 Flash e como o seu terceiro lançamento Flash em 43 dias. Todas as especificações se mantêm inalteradas: 1M de contexto de entrada, um limite de saída de 64K, conhecimento até março de 2026, a mesma lista de modalidades e os mesmos $0.75 / $3.75 introdutórios por 1M de tokens, que duplicam para $1.50 / $7.50 a 1 de janeiro de 2027. Só as pontuações se mexeram, e mexeram-se em todas as linhas publicadas. O DeepSWE v1.1 passa de 65,3 % para 73,7 %, o Terminal-bench 2.1 de 85,8 % para 89,4 %, o Terminal-bench 4.0 de 11,2 % para 19,1 % e o BioMysteryBench Human Difficult de 43,5 % para 56,5 %. A Artificial Analysis dá-lhe 59 no Intelligence Index v4.1.1 contra os 56 do 3.7 Flash, e mede 304,6 tokens de saída por segundo contra 279,4, com um lento tempo até ao primeiro token de 13,39 segundos que faz dele um modelo para lotes e agentes e não para conversa interativa. Leia as vitórias a par das derrotas: a própria tabela comparativa da Google dá ao 3.8 Flash 8 das 14 linhas, e o Claude Opus 5 continua a levar o Terminal-bench 4.0 por 51,8 % contra 19,1 %, o OSWorld-2.0 por 75,4 % contra 59,0 % e o GDPVal-AA v2 por 1824 contra 1545 de Elo. O número do DeepSWE republicado por boa parte da cobertura do lançamento, 71,0 %, não é o do PDF da Google, que indica 73,7 % contra os 74,0 % do Opus 5. O acesso para programadores estava ativo no anúncio, através da API Gemini, do AI Studio, do Antigravity e da Gemini Enterprise Agent Platform. O acesso de consumo é reportado para subscritores do Google AI Pro e Ultra, mas as notas de versão das aplicações Gemini ainda não têm qualquer entrada sobre ele, e o nível gratuito do Gemini continua a correr o 3.6 Flash. Todos os detalhes na nossa análise do Gemini 3.8 Flash.
1 set. Anthropic Claude Fable 5.1 e Mythos 5.1, um novo #1 na Artificial Analysis com 66 e um corte de 75 % nas leituras de cache Novo
A Anthropic lançou o Claude Fable 5.1 e o Claude Mythos 5.1 a 1 de setembro de 2026, e são um modelo em duas configurações de salvaguardas, não dois modelos. O Fable 5.1 está disponível para todos; o Mythos 5.1 alivia as restrições em biologia e cibersegurança e é distribuído por convite, sem critérios de elegibilidade publicados. A Artificial Analysis pontua o Fable 5.1 com 66 no seu Intelligence Index v4.1.1 em effort max, a pontuação mais alta que alguma vez mediu, à frente do Claude Opus 5 com 63, do Claude Fable 5 com 62 e do GPT-5.6 Sol e do Grok 4.6 com 61. Arrebatou então também o Agentic Index com 61 contra os 59 do Opus 5, o quadro GDPval-AA v2 de entregáveis profissionais com 1853 contra 1824, e o Humanity's Last Exam com 59,1 % contra os 55,5 % do Fable 5. A definição de effort pesa aqui mais do que é habitual: o mesmo modelo marca 58 em low, 60 em medium, 62 em high e 65 em xhigh, e essas definições abrangem uma diferença de onze vezes nos tokens de saída, de 13,1 milhões a 143,7 milhões em todo o conjunto. Os preços mantêm-se inalterados em $10 / $50 por 1M de tokens, mas as leituras de cache descem 75 % para $0.25, contra $1.00 no Fable 5, e é aí que está a verdadeira poupança nas execuções agênticas longas. Pelos números da própria Anthropic atinge 52,6 % no Terminal-Bench-Science 0.1 contra os 29,0 % do Opus 5, e o system card de 212 páginas subiu a avaliação de risco de alinhamento da própria empresa de muito baixo para baixo. Duas coisas a pesar antes de mudar: a Anthropic continua a recomendar começar pelo Opus 5 para a maioria das cargas, a metade do preço, e no lançamento nenhum quadro da Arena tinha votos para qualquer um dos modelos. O Fable 5.1 já está classificado: é segundo nos dois quadros de programação da Arena e quinto no de texto. Todos os detalhes na nossa análise do Claude Fable 5.1 e do Mythos 5.1.
28 ago. Z.ai Os pesos do GLM 5.3 já saíram após a pausa de segurança, mas a licença não é MIT Novo
A Z.ai publicou os pesos do GLM 5.3 no Hugging Face a 28 de agosto de 2026, duas semanas depois do lançamento da API e exatamente na data que o marcador de posição indicava, pelo que a avaliação de segurança prometida aconteceu mesmo e a pausa fica fechada em vez de em aberto. O que mudou foi a licença. O GLM 5.3 Flash tinha saído sob MIT puro dois dias antes; o modelo de topo traz um documento próprio intitulado GLM 5.3 License, e o campo de licença da ficha do modelo diz glm-5.3 e não mit. A concessão de direitos segue de perto o MIT, com direito a executar, implementar, afinar, modificar, distribuir e vender, e com os pesos explicitamente incluídos na definição do software, pelo que o uso comercial fica aberto a quase toda a gente. Uma cláusula é realmente nova: um operador de model-as-a-service cuja receita ultrapasse os 10 mil milhões de dólares em quaisquer doze meses consecutivos tem de passar uma revisão de segurança da Z.ai antes de implementar comercialmente, reservando-se a Z.ai o direito de determinar sozinha o âmbito e o método dessa revisão. Repare ainda que o Hugging Face conta o checkpoint publicado em 753B parâmetros, contra a base de 744B que a Z.ai diz partilhar com o GLM-5.2; é o tipo de diferença que uma contagem mecânica de parâmetros produz, não a prova de um modelo diferente. Isto não move a nossa escolha open-weight. O GLM 5.3 Flash continua a ser o modelo que alojaríamos, porque 320B sob MIT puro é bastante mais fácil de operar e de resolver juridicamente do que 753B sob uma licença própria. Todos os detalhes na nossa análise do GLM 5.3.
28 ago. Tencent Tencent Hy4 Preview, 770B de pesos abertos sob Apache 2.0 e o maior modelo permissivo até agora Novo
A Tencent lançou e abriu o Hy4 preview a 28 de agosto de 2026, o novo modelo de topo da sua linha Hunyuan e o maior modelo alguma vez publicado sob Apache 2.0. Corre com 770 mil milhões de parâmetros no total e 49 mil milhões ativos por token numa arquitetura mixture-of-experts, aceita uma janela de contexto que a Tencent descreve como superior a 1M de tokens, e é distribuído com uma build FP8 a par dos pesos em precisão total. O preço da API é $0.834 por 1M de tokens de entrada, $2.501 de saída e $0.042 de entrada em cache, o que é barato para este tamanho. A licença é a verdadeira notícia: o Apache 2.0 é mais permissivo do que o documento próprio do Kimi K3 e do que a licença que a Z.ai juntou ao GLM 5.3 no mesmo dia. Trate a alegação de qualidade com cuidado, porque a única prova até agora é a do fabricante. A Tencent fez uma avaliação cega interna de 203 tarefas de engenharia pontuadas por 163 especialistas, e o Hy4 preview obtém aí 2,99 em 4,00 contra 2,94 do Kimi K3 e 2,92 do GLM 5.3. É o painel da própria Tencent, as margens cabem numa décima de ponto, e nenhuma casa independente tinha então publicado um Intelligence Index ou uma classificação da Arena. A Arena coloca-o entretanto em décimo primeiro no WebDev com 1624, enquanto a Artificial Analysis continua sem lhe dar um Intelligence Index, pelo que o listamos em vez de o classificar. A Tencent afirma ainda que o modelo ajudou a automatizar a otimização do seu próprio processo de treino e elevou o seu próprio débito de inferência em 31,8 % medidos. Está disponível como pesos abertos e através do WorkBuddy, CodeBuddy, Yuanbao e ima, além do Tencent Cloud TokenHub e do OpenRouter, com acesso gratuito no WorkBuddy e no CodeBuddy durante duas semanas a contar do lançamento. Todo o detalhe na nossa análise do Tencent Hy4 Preview.
26 ago. Z.ai GLM 5.3 Flash, o Ox Alpha revelado, e os primeiros pesos MIT que a Z.ai publica desde o GLM-5.2 Novo
A Z.ai lançou o GLM 5.3 Flash a 26 de agosto de 2026, e não é o modelo por que o setor esperava. Os pesos retidos a 14 de agosto pertencem ao GLM 5.3; este é um modelo à parte sobre uma base recém-treinada, 320 mil milhões de parâmetros com 18 mil milhões ativos, o primeiro modelo nativamente multimodal da linha GLM-5, e chegou ao Hugging Face sob licença MIT no mesmo dia. É também o modelo furtivo que servia tráfego no OpenRouter com o nome Ox Alpha, executado durante essa pré-visualização inteiramente em chips de IA chineses, o que descreve como foi servido, não como foi treinado. A Artificial Analysis pontua-o com 57 no Intelligence Index v4.1.1, quatro pontos acima do GLM-5.2 com menos de metade do tamanho, e coloca-o na fronteira de Pareto entre inteligência e custo. No índice v4.3 de hoje marca 41,9 contra os 34,0 do GLM-5.2, a $0.25 por tarefa do índice. O preço de tabela é $0.15 / $0.50 por 1M de tokens; a promoção de lançamento de 50 % correu até às 24:00 de 9 de setembro e terminou. A substituição pelo V4.1-Flash na DeepSeek a 10 de setembro fechou quase toda a diferença: fora de ponta os dois empatam agora em $0.15 na entrada, com o GLM mais barato na saída, $0.50 contra $0.60, e em hora de ponta o GLM fica abaixo dos dois lados. Trate os números de programação e agênticos com cuidado: vêm do gráfico da própria Z.ai, que escolhe o Claude Opus 4.8 e o GPT-5.6 Terra como comparação em vez dos líderes atuais, e nele lê-se Terminal Bench 2.1 84,3, DeepSWE v1.1 63,4 contra 46,2 do GLM-5.2 e AutomationBench 48,8. O único número desse gráfico medido pela Artificial Analysis é o GDPval-AA v2, onde o GLM 5.3 Flash atinge 1773 Elo, o mais alto ali representado. A Arena já o classificou, décimo sétimo no WebDev e décimo no image-to-WebDev. Isto move de facto a nossa escolha open-weight: o GLM 5.3 Flash substitui o GLM-5.2 como o modelo MIT que alojaríamos. Um aviso sobre hardware: 18B ativos não significa 18B para alojar, porque o encaminhamento mixture-of-experts precisa dos 320B de pesos residentes, pelo que se trata de um servidor multi-GPU e não de uma estação de trabalho. Todos os detalhes na nossa análise do GLM 5.3 Flash.
26 ago. Alibaba Qwen3.8-Flash-Next, pesos abertos e o primeiro olhar público sobre a arquitetura Qwen4 Novo
A Alibaba publicou o Qwen3.8-Flash-Next no Hugging Face a 26 de agosto de 2026, e o que aqui conta é mais a arquitetura do que a tabela de pontuações: a Qwen apresenta-o como um olhar antecipado sobre o desenho que a família Qwen4 vai usar, publicado para que a comunidade se possa preparar. É um mixture-of-experts de 125 mil milhões de parâmetros com apenas 6 mil milhões ativos por token, mais um embedding de N-gramas à parte com 51 mil milhões de parâmetros, e aceita texto, imagem e vídeo. O contexto é de 262 144 tokens de forma nativa, extensível até 1M. Entre os números publicados pela Qwen estão 91,7 no GPQA Diamond, 62,5 no SWE-Bench Pro, 58,7 no DeepSWE 1.1, 81,0 no SWE-Bench Multilingual e 84,5 no AndroidWorld vision, todos do fabricante e, na altura, sem qualquer classificação independente. A Artificial Analysis deu-lhe entretanto 39,9 no Intelligence Index v4.3 e a Arena coloca-o em nono no WebDev com 1635. Convém ler a licença antes de construir sobre ela, porque não é Apache. A Qwen Community License 1.0 permite uso comercial, modificação e alojamento, mas exige mostrar de forma visível o nome do modelo assim que um produto ultrapasse os 100 milhões de utilizadores ativos mensais ou os 20 milhões de dólares de receita mensal, e exige uma licença à parte da Qwen para explorar um negócio de model-as-a-service ou de assistente de trabalho com IA. O uso interno está isento dessa segunda condição.
21 ago. OpenAI GPT-5.6 Sol desce mais de 20 % e fica abaixo do Claude Opus 5 dos dois lados Novo
A OpenAI reduziu o GPT-5.6 Sol de $5 / $30 para $4 / $20 por 1M de tokens a 21 de agosto de 2026, a primeira descida no modelo de topo desde o lançamento da família GPT-5.6 em julho. A taxa é promocional e a OpenAI diz que dura cerca de três meses. Abrange a API e os créditos do Codex e do ChatGPT Work; os preços de subscrição do Plus, Pro e Business não mudam. A $4 / $20, o Sol fica agora abaixo do Claude Opus 5 a $5 / $25 tanto no input como no output, a primeira vez que o modelo de topo da OpenAI é o mais barato dos dois.
16 ago. DeepSeek A DeepSeek sobe os preços da API cerca de quatro vezes e divide a tabela em horas de ponta e fora de ponta Novo
A DeepSeek passou os seus dois modelos V4 para uma nova tabela de preços às 16:00 UTC de 16 de agosto de 2026, e a direção é invulgar neste setor: os preços subiram, cerca de quatro vezes em hora de ponta. O V4-Flash 0731 passou de $0.14 / $0.28 fixos por 1M de tokens para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta, e o V4-Pro 0813 de $0.435 / $0.87 para $0.66 / $1.98 fora de ponta e $1.32 / $3.96 em hora de ponta, com a entrada em cache a $0.007 e $0.022 fora de ponta respetivamente. A hora de ponta vai das 01:00 às 04:00 e das 06:00 às 10:00 UTC, de segunda a sexta, e qualquer outra hora é fora de ponta, a exatamente metade do preço de ponta. A DeepSeek apresentou a mudança como uma repartição mais razoável da capacidade. Nada mudou nos modelos em si, pelo que se trata de um acontecimento puramente económico, mas de peso para esta página: custou ao DeepSeek V4-Flash a escolha de relação preço-desempenho, que passou para o GLM 5.3 Flash a $0.15 / $0.50 de tabela. A DeepSeek reverteu quase toda a subida a 10 de setembro, retirou o V4-Flash e substituiu-o pelo V4.1-Flash a $0.15 / $0.60 fora de ponta, pelo que os dois voltam a estar ao mesmo nível na entrada fora de ponta. Os pesos continuam sob MIT, pelo que quem o aloja por conta própria não é afetado. Todos os detalhes na nossa análise do DeepSeek V4.
14 ago. Z.ai GLM 5.3, um grande salto agêntico só com pós-treino, lançado sem os open weights Novo
A Z.ai lançou o GLM 5.3 a 14 de agosto de 2026, e o que é notável é o que não mudou: corre sobre a mesma base de 744 mil milhões de parâmetros do GLM-5.2, sem novo pré-treino. Todo o ganho vem de pós-treino à escala, e o agêntico é grande. No próprio gráfico da Z.ai, o Terminal-Bench 3.0 passa de 4,6 para 28,3, o DeepSWE v1.1 de 46,2 para 66,9 e o CyberGym de 77,2 % para 84,5 %, o que, segundo a empresa, supera à tangente o Claude Mythos 5 com 83,8 e o GPT-5.6 Sol com 83,6. Todos estes números são do fabricante, ainda sem auditoria independente, e o gráfico é menos lisonjeiro noutros pontos: no Code Bench interno da Z.ai, o Claude Fable 5 continua a liderar com 39,5 % contra 31,4 % do GLM 5.3, e no ExploitBench os líderes frontier estão nos 78,0 % contra 54,4 %. O senão é a licença, não a pontuação. O GLM-5.2 publicou pesos com licença MIT em poucos dias; o GLM 5.3 saiu sem nenhum, e a Z.ai disse que chegariam após uma avaliação de segurança da capacidade do modelo para descobrir vulnerabilidades, dentro de cerca de duas semanas. Isso resolveu-se a 28 de agosto de 2026, quando a Z.ai publicou os pesos exatamente na data que o marcador de posição indicava, ainda que sob uma GLM 5.3 License própria em vez do MIT puro que o GLM-5.2 e o GLM 5.3 Flash receberam. O preço por token já está publicado, $1.40 / $4.40 por 1M de tokens, a par do GLM Coding Plan e do ZCode. O que chegou a 26 de agosto foi, em vez disso, o GLM 5.3 Flash, um modelo diferente e mais pequeno que publicou mesmo pesos MIT, e é esse lançamento que moveu a nossa escolha open-weight. Todos os detalhes na nossa análise do GLM 5.3.
13 ago. Google Gemini 3.7 Flash, as pontuações de programação sobem e o preço desce para metade, $0.75 / $3.75, até janeiro Novo
A Google lançou o Gemini 3.7 Flash a 13 de agosto de 2026, 23 dias depois do 3.6 Flash e como o seu terceiro lançamento Flash em menos de dois meses, enquanto o Gemini 3.5 Pro continua por sair. Os ganhos em programação são o essencial: o DeepSWE v1.1 sobe de 49,0 % para 65,3 %, o FrontierCode 1.1 Main de 34,4 % para 43,6 %, e o AutomationBench quase duplica, de 17,0 % para 30,4 %. A Artificial Analysis pontua-o com 56 no seu índice v4.1.1 contra 52 do 3.6 Flash, e coloca-o em primeiro entre 182 modelos na velocidade de saída com 385,1 tokens por segundo, o que o coloca na fronteira de Pareto entre inteligência e tempo. A janela de contexto e o limite de saída de 64K mantêm-se face ao 3.6 Flash, pelo que nada foi sacrificado. Duas ressalvas pesam mais do que os benchmarks. O valor de $0.75 / $3.75 é introdutório e expira a 31 de dezembro de 2026, após o que duplica para $1.50 / $7.50, exatamente o que o 3.6 Flash custava no lançamento; a Google passou também o 3.6 Flash para o mesmo valor, pelo que ambos custam agora o mesmo e a atualização é uma decisão puramente de capacidade. E o acesso de consumo passa apenas pelo Spark, que exige Google AI Pro ou Ultra e exclui o Espaço Económico Europeu, o Reino Unido, a Suíça e a Nigéria, pelo que a maioria dos leitores europeus não lhe consegue chegar na aplicação Gemini. O nível gratuito do Gemini continua a receber o 3.6 Flash. O acesso por API não é afetado em lado nenhum. Todos os detalhes na nossa análise do Gemini 3.7 Flash.
12 ago. SpaceXAI Grok 4.6, o pós-treino sobe o Intelligence Index de 56 para 61 com $2 / $6 inalterados Novo
A SpaceXAI lançou o Grok 4.6 a 12 de agosto de 2026, e não é explicitamente um novo modelo base: a empresa manteve a fundação do Grok 4.5 e comprou os ganhos com uma fase de treino suplementar mais longa, trajetórias de afinação regeneradas e aprendizagem por reforço em ambientes agênticos. Não foi publicada qualquer arquitetura nova nem contagem de parâmetros. A Artificial Analysis pontua-o com um Intelligence Index de 61, cinco pontos acima do Grok 4.5, o que o coloca empatado com o GPT-5.6 Sol no terceiro lugar, atrás do Claude Opus 5 com 63 e do Claude Fable 5 com 62, tal como o índice estava nesse mês; o Claude Fable 5.1 passou desde então acima dos três com 66. Os números agênticos são mais fortes do que o índice composto: um Elo de 1753 no GDPval-AA v2 atrás apenas do Opus 5, 88,4 % no Terminal-Bench v2.1 e 50,7 % no tau3-Banking. O argumento era então a eficiência, a $0.84 por tarefa de índice e cerca de 53 voltas e 0,5 mil milhões de tokens de entrada em trabalhos longos, contra cerca de 103 voltas e 2,0 mil milhões do Opus 5. Com os números v4.3 atuais da Artificial Analysis esse argumento enfraquece: o Grok 4.6 custa $1.86 por tarefa de índice, mais do que os $1.61 do Muse Spark 1.3 com pontuação superior. Os preços mantêm-se inalterados em $2 / $6 por 1M de tokens com entrada em cache a $0.50, na mesma janela de contexto de 500K tokens, mas há uma armadilha que convém conhecer: assim que um prompt atinge os 200 000 tokens, a SpaceXAI volta a faturar o pedido inteiro a $4 / $12, e não apenas o excedente. Um aviso quanto à cobertura dos benchmarks, porque muita imprensa já a baralhou: o Terminal-Bench v3.0 é um teste diferente e bastante mais difícil do que a v2.1, pelo que 26 % na v3.0 e 88,4 % na v2.1 são ambas afirmações verdadeiras sobre o mesmo modelo. Está disponível desde o primeiro dia na API da SpaceXAI, no Cursor e no Grok Build, e em parceiros como OpenRouter, Vercel e Cloudflare. Todos os detalhes na nossa análise de benchmarks e preços do Grok 4.6.
5 ago. Meta Muse Spark 1.2 e Muse Code, Intelligence Index de 51 para 57 a um valor inalterado de $1.25 / $4.25, mais um agente de programação em terminal Novo
A Meta lançou o Muse Spark 1.2 a 5 de agosto de 2026 a par do Muse Code, o seu primeiro agente de programação em terminal, que funciona em macOS e Linux sem aplicação de ambiente de trabalho e sem subscrição. A Artificial Analysis pontua o modelo com um Intelligence Index de 57 na sua definição de raciocínio mais elevada no seu índice atual v4.1.1, contra 51 para a 1.1 e 43 para a versão de abril, e quase todo esse ganho é agêntico em vez de conhecimento geral; o seu Elo GDPval-AA v2 saltou de 1371 para 1631 enquanto o Terminal-Bench v2.1 passou apenas de 78 % para 80 %. O preço mantém-se inalterado em $1.25 / $4.25 por 1M de tokens sobre uma janela de contexto de 1M de tokens, e a Meta acrescentou um nível Contributor a $0.10 / $0.20, cerca de 92 % mais barato, em troca de permitir que a Meta treine com os seus prompts e completions. A disponibilidade alargou-se do acesso antecipado apenas para os EUA sob o qual a 1.1 foi lançada para um acesso global ampliado através do Muse Code, da Meta Model API e do OpenRouter. Nos próprios gráficos de lançamento da Meta, o modelo termina em segundo atrás do Claude Opus 5 nos três benchmarks de programação que publicou, com 82,9 % contra 86,7 % no Terminal-Bench 2.1.
3 ago. Alibaba Qwen 3.8 (Qwen3.8-Max), modelo de topo multimodal de 2,4 biliões de parâmetros agora disponível para todos a $2 / $6 Novo
A Alibaba disponibilizou o Qwen3.8-Max para todos a 3 de agosto de 2026, duas semanas depois de o apresentar em pré-visualização no WAIC Shanghai, e cada número que faltava na pré-visualização tem agora um valor por trás. Corre 2,4 biliões de parâmetros no total com cerca de 95 mil milhões ativos por token num desenho Mixture-of-Experts esparso, aceita texto, imagens e vídeo, e confirma uma janela de contexto de 1M de tokens com até 128K tokens de saída. O preço da API é de $2 / $6 por 1M de tokens, plano em todo o contexto em vez de escalonado por comprimento do prompt, com leituras em cache a $0.25. A afirmação «apenas atrás do Fable 5» divide-se agora nitidamente em duas: no quadro de visão da Arena é #2 com 1305, apenas atrás do Fable 5, mas no quadro de texto é #5 com 1496, atrás de quatro entradas da Anthropic. Ambas as pontuações da Arena continuam assinaladas como preliminares, e os open weights prometidos não chegaram. Mantemos o Qwen 3.8 fora das escolhas classificadas até os pesos e a licença chegarem de facto.
Pendente Google Gemini 3.5 Pro, ainda por lançar, meses atrasado segundo a Bloomberg Atrasado
O Gemini 3.5 Pro continua a ser o maior lançamento pendente. A Google anunciou-o na I/O a 19 de maio a par do Gemini 3.5 Flash, mas apenas o Flash saiu, e a meta de junho escorregou. A Bloomberg noticiou a 16 de julho de 2026 que o modelo está meses atrasado e ficou aquém das metas internas da Google, com a empresa ainda a trabalhar para melhorar as suas capacidades, em particular na programação. É este todo o quadro com fontes. A Google nunca confirmou publicamente uma data de lançamento, e a Google não publicou especificações finais como a janela de contexto ou os modos de raciocínio, pelo que trate os números em circulação como não confirmados. Utilize o Gemini 3.8 Flash entretanto se trabalhar através da API, ou o Gemini 3.6 Flash se estiver na aplicação gratuita Gemini, que continua a executá-lo; passaremos o 3.5 Pro para a classificação principal no momento em que entrar em direto.
Escolha de categoria, setembro de 2026

Melhor IA para escrita

1
Claude Fable 5.1
Melhor escrita no geral
2
Kimi K3
Ficção criativa
3
Claude Sonnet 5
Grátis para o dia a dia

A melhor IA para escrever é o Claude Fable 5.1, e o argumento a seu favor é a consistência, não um primeiro lugar isolado. É o único modelo entre os seis primeiros dos três quadros de prosa: segundo no EQ-Bench Creative Writing v3 com 2152,7, segundo no LiveBench Language com 89,5 e sexto no quadro de escrita criativa da Arena. Mais nenhum consegue isso. O GPT-6 Astra lidera o EQ-Bench com 2163,9 mas está em 25.º na escrita criativa da Arena; o Claude Fable 5 lidera os quadros de texto e de escrita criativa da Arena e encabeça o LiveBench Language com 90,7, mas caiu para oitavo no EQ-Bench. O Claude Opus 5.5, que a 22 de setembro tirou ao Fable 5.1 o Intelligence Index e o Humanity's Last Exam, não está avaliado no EQ-Bench nem na Arena e é oitavo no LiveBench Language, por isso ainda não tem qualquer argumento nos quadros de escrita e a coroa não passa para ele. Se a sua escrita é um entregável de trabalho e não prosa, isso é outra questão, e o quadro de entregáveis profissionais GDPval-AA v2.1 é liderado pelo Claude Opus 5.5 com 1846 à frente do Claude Fable 5.1 com 1735 e do Claude Opus 5 com 1708. O Claude Sonnet 5 continua a ser a melhor relação no escalão gratuito e o Claude Fable 5 a escolha se der mais peso aos votos humanos da Arena do que às pontuações de harness; o Fable 5 custa $10 / $50 por 1M de tokens e está incluído em permanência no Claude Max e no Team Premium com cerca de 50 % dos limites de uso habituais. A tradução é uma questão à parte com um vencedor à parte, que tratamos no nosso guia da melhor IA para traduzir.

ModeloMelhor paraPonto fortePonto fracoPreço (por 1M de tokens)
Claude Fable 5.1Melhor escrita no geral#2 EQ-Bench Creative Writing (2152,7), #2 LiveBench Language (89,5) e #6 escrita criativa da Arena, a melhor colocação combinada de todosNão lidera nenhum dos três de forma isolada; o Claude Opus 5.5 levou o Intelligence Index e o Humanity's Last Exam a 22 de setembro$10 / $50
Claude Fable 5Lidera os quadros de votos humanos da Arena#1 Arena texto no geral (1505,7), #1 LiveBench Language (90.7), #8 EQ-BenchA opção mais cara aqui$10 / $50
Kimi K3Ficção criativa e voz#4 EQ-Bench Creative Writing (2070.6)Apenas #27 na Arena escrita criativa$3 / $15
Claude Sonnet 5Escrita gratuita para o dia a diaGrátis e predefinido no claude.ai, contexto 1M#53 Arena escrita criativa; 75,0 LiveBench Language$2 / $10, agora permanente
Claude Opus 5Entregáveis profissionais com melhor preço#2 GDPval-AA v2.1 com 1708, à frente do Fable 5 (1632)Atrás do Fable 5 na Arena texto, atrás do Fable 5.1 no GDPval-AA v2.1$5 / $25
GPT-5.5Escrita empresarial ancorada em factosGanhos documentados de fiabilidade factual sobre o GPT-5.4Níveis de raciocínio agora marcados como obsoletos$5 / $30
Gemini 3.8 FlashRascunhos em massa à escalaIntelligence Index 40,9, 308,4 tok/s de saída, contexto 1MAfinado para agentes e não para prosa; o preço introdutório duplica a 1 de janeiro de 2027$0.75 / $3.75
Segundo lugar e alternativas: o Claude Fable 5 é o segundo e a escolha se der mais peso aos votos humanos da Arena, o Kimi K3 é a escolha para ficção com voz própria, embora esteja agora em quarto no EQ-Bench, o Claude Sonnet 5 é a escolha de relação qualidade-preço e a que usar se não pagar, o Claude Opus 5 é a opção mais barata para entregáveis profissionais, e o Gemini 3.8 Flash é a escolha para redigir em volume.
O que mudou este mês

A coroa da escrita fica com o Claude Fable 5.1, mas o seu fundamento mudou. O Claude Opus 5.5 tirou-lhe o Intelligence Index e o Humanity's Last Exam a 22 de setembro, que era precisamente o que este cartão citava, por isso voltámos a assentar a escolha nos quadros que medem mesmo prosa. Neles, o Fable 5.1 é o único modelo entre os seis primeiros dos três: segundo no EQ-Bench Creative Writing, segundo no LiveBench Language e sexto no quadro de escrita criativa da Arena. O Opus 5.5 não está avaliado em dois dos três e é oitavo no outro, por isso ainda não tem argumento na escrita. A Arena já avaliou o Fable 5.1, o que elimina a ressalva que trazíamos do mês passado de que os quadros de preferência humana ainda não se tinham pronunciado: é quinto no quadro de texto com 1498,5, onde o Claude Fable 5 continua a liderar com 1505,7. O GDPval-AA v2.1 foi novamente reancorado e marca agora 1846 para o Opus 5.5, 1735 para o Fable 5.1 e 1708 para o Opus 5, por isso os números deste bloco ficam bem abaixo dos que citávamos em agosto.

Escolha de categoria, setembro de 2026

Melhor IA para chat & assistente do dia a dia

1
GPT-5.6
Predefinição do ChatGPT
2
Claude Fable 5
O mais bem avaliado
3
Claude Opus 5
Profundidade ponderada

A melhor IA para o chat do dia a dia é o GPT-5.6, e a razão honesta é o alcance em vez da posição nos quadros. É o modelo que o ChatGPT serve por predefinição à maior base de utilizadores da categoria, o que faz dele o melhor assistente que a maioria das pessoas consegue realmente abrir. Em preferência humana pura não é o líder: o GPT-5.6 Sol situa-se em #18 no quadro de texto da Arena com 1483,5, onde o Claude Fable 5 lidera com 1505,7. A maioria dos utilizadores do ChatGPT recebe o nível equilibrado Terra, que a OpenAI diz igualar o GPT-5.5 e que, desde a descida de preço de 30 de julho de 2026, custa 60 % menos. Está disponível dentro do ChatGPT (grátis com limites, Plus a $20/mês, Pro a $100/mês), através da API (os níveis da 5.6: Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 por 1M de tokens), e integrado dentro do Fello AI a par do Claude, Gemini, Grok e DeepSeek. Uma ressalva: o system card da OpenAI e o avaliador METR assinalaram um comportamento de «scheming» elevado no Sol, pelo que o GPT-5.5 Instant continua a ser a escolha mais segura para trabalho sensível a alucinações.

ModeloMelhor paraPonto fortePonto fracoPreço
GPT-5.6Chat do dia a dia, predefinição do ChatGPTO assistente que a maioria consegue abrir; o Terra iguala o GPT-5.5 a ~metade do custo#14 na Arena texto; scheming assinalado pelo METRGrátis / $20/mês Plus; API $0.20 / $1.20 a $4 / $20
Claude Fable 5A conversa mais bem avaliada#1 no Arena texto geral (1505,7) e em quatro das suas oito subcategoriasSem versão gratuita; acesso por créditos de utilização no Pro$10 / $50 API
Claude Opus 5Respostas ponderadas e matizadasTerceiro no Intelligence Index da Artificial Analysis (50,8), atrás do Claude Fable 5.1 e do GPT-6 Astra#10 na Arena texto, atrás do Claude Fable 5$20/mês Pro, $5 / $25 API
GPT-5.5 InstantTrabalho diário sensível a alucinações52,5 % menos afirmações alucinadas vs 5.3 InstantNíveis de raciocínio agora marcados como obsoletos$20/mês Plus; API $5 / $30
Gemini 3.6 FlashRápido, grátis, multimodalContinua a ser o modelo servido pelo nível gratuito do Gemini, contexto 1M, #12 na Arena textoMais fraco no raciocínio mais difícil; o 3.8 Flash supera-o ao mesmo preçoGrátis / $0.75 / $3.75 API
Fello AITodos os melhores modelos, uma aplicaçãoChatGPT + Claude + Gemini + Grok + DeepSeek e mais no Mac, iPhone e iPadEncaminhado pela aplicação, não direto$9.99/mês
Segundo lugar e alternativas: o Claude Fable 5 é o segundo e o verdadeiro líder de preferência, o Claude Opus 5 é o segundo para uma utilização diária ponderada, o Gemini 3.6 Flash é o segundo para rápido e grátis, e o Grok 4.6 é a escolha de nicho para os dias de notícias em direto. O Fello AI é a escolha natural se quiser os melhores modelos numa aplicação de Mac e iOS por $9.99/mês em vez de fazer malabarismos com subscrições.
O que mudou este mês

O GPT-5.6 mantém a escolha para conversa pelo alcance, e a distância para o líder de preferência voltou a alargar. O Sol está agora em 18.º no quadro de texto da Arena com 1483,5, descendo do 14.º, enquanto o Claude Fable 5 lidera com 1505,7. Nada mudou no produto, por isso a coroa não se mexe: continua a ser sobre que assistente mais gente consegue mesmo abrir. Dois lançamentos que de outro modo seriam candidatos não o são: o GPT-6 Astra chegou ao ChatGPT Business, Pro e Plus no início de setembro mas a OpenAI nada anunciou para o escalão gratuito, e o Claude Opus 5.5, que levou o Intelligence Index a 22 de setembro, é um modelo para a API e para os planos Claude, não um assistente por omissão para mil milhões de pessoas. A OpenAI lançou o GPT-6 Sol e o GPT-6 Luna a 22 de setembro e colocou-os no ChatGPT Work e no Codex, dizendo sem rodeios que ainda não estão no Chat, por isso a janela onde a maioria escreve continua a correr GPT-5.6.

Escolha de categoria, setembro de 2026

Melhor IA para imagens

1
ChatGPT Images 2.5
Texto nas imagens
2
MAI-Image-2.6
#1 edição AA
3
Muse Image
Ecossistema Meta AI

A melhor IA para gerar imagens é o ChatGPT Images 2.5, que a OpenAI tornou predefinição em todos os planos ChatGPT a 8 de setembro e que lidera agora os quatro quadros de imagem que acompanhamos. Os seus dois modelos ficam em primeiro e segundo em cada um: o GPT-Image-2.5 Sunburst, feito para precisão, lidera o Arena texto para imagem com 1423,2 e o Arena edição de imagens com 1526,0, e lidera também o Elo de qualidade da Artificial Analysis com 1196,8 e o seu quadro de edição com 1221,3, com o mais rápido GPT-Image-2.5 Flare em segundo nos quatro. É uma mudança face ao mês passado, quando a Artificial Analysis não tinha avaliado nenhum dos dois e os seus quadros contradiziam os da Arena. Ainda assim, leia a distância entre o Sunburst e o Flare como provisória, porque essas colocações na Arena assentam em alguns milhares de votos cada contra os 83 000 e 259 000 do GPT Image 2, e em texto para imagem os dois partilham a mesma banda de posição. O segundo é o MAI-Image-2.6, terceiro no quadro de edição da Artificial Analysis com 1191,6 e quarto no de texto para imagem da Arena com 1334,0, com o Muse Image da Meta em terceiro. O Reve 2.1 mantém o seu argumento de paginação, tipografia e 4K nativo mas saiu do pódio: é sexto no Arena texto para imagem e décimo quarto no Arena edição de imagens. A nossa análise completa do que saiu está em ChatGPT Images 2.5.

ModeloMelhor paraPonto fortePonto fracoPreço
ChatGPT Images 2.5Imagens com texto legível#1 e #2 nos quatro quadros: Arena texto para imagem (1423,2 / 1401,3), Arena edição (1526,0 / 1481,8), qualidade da Artificial Analysis (1196,8 / 1190,4) e edição (1221,3 / 1207,0)As colocações na Arena assentam em alguns milhares de votosPredefinição em todos os planos ChatGPT
MAI-Image-2.6Editar uma imagem que já tem#3 na edição de imagens da Artificial Analysis (1191,6) e #4 no Arena texto para imagem (1334,0)Pré-visualização pública, ainda não no Copilot nem no Bing; perdeu a liderança da edição da Artificial Analysis para o ChatGPT Images 2.5MAI Playground / Microsoft Foundry
Muse ImageEdição de imagens, ecossistema Meta#5 na edição de imagens da Artificial Analysis (1171,3) e #7 no seu Elo de qualidadeNovo, com poucas ferramentas à voltaAplicação Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Retratos e produtos fotorrealistas#4 em texto para imagem da Artificial Analysis, à frente do Nano Banana Pro no da ArenaNa edição de imagens da Arena, o Nano Banana Pro está à frenteAplicação Gemini / AI Studio
Seedream 5.0 ProTexto multilíngue + edição por regiões10+ idiomas incl. árabe RTL, edição com laço e camadasPor volta do décimo lugar nos quadros independentes; incerteza de direitos de autorBytePlus / Magnific
Midjourney v8Arte estilizada, ilustraçãoBase estética que a maioria dos artistas prefereMais fraco em texto dentro da imagem$10-$120/mês
Grok ImagineNSFW / modo SpicyAs barreiras mais permissivas; a Arena coloca o seu modelo Image 2.0 em #5 no texto para imagem e em #4 na edição, e a Artificial Analysis tem-no agora em #4 no Elo de qualidadeNada no registo de lançamentos mostra que o Image 2.0 tenha saído como produto$30 por mês SuperGrok
Segundo lugar e alternativas: o MAI-Image-2.6 é o segundo no geral e a escolha para editar uma imagem que já tem, o Muse Image é o terceiro e a escolha dentro das aplicações da Meta, e o Nano Banana 2 continua a ser a escolha fotorrealista. O Reve 2.1 continua a ser a escolha para layout, tipografia e 4K nativo, mesmo depois de sair do pódio. O Grok Imagine continua a ser o único modelo frontier que permite conteúdo para adultos em Spicy Mode, e a Arena coloca agora o seu modelo Image 2.0 em quinto em texto para imagem e em quarto em edição de imagens.
O que mudou este mês

O ChatGPT Images 2.5 mantém a coroa da imagem e o seu argumento ficou mais forte. No mês passado a Artificial Analysis não tinha avaliado nenhum dos seus dois modelos de API, por isso os quadros que acompanhamos contradiziam-se: a Arena tinha o Sunburst e o Flare em primeiro e segundo enquanto a Artificial Analysis mantinha o GPT Image 2 à frente do texto para imagem e o MAI-Image-2.6 da Microsoft à frente da edição. A Artificial Analysis já avaliou os dois, e também aí ficam em primeiro e segundo, 1196,8 e 1190,4 no Elo de qualidade e 1221,3 e 1207,0 na edição de imagens. Isso faz dele #1 e #2 nos quatro quadros. O MAI-Image-2.6 continua em segundo mas desce para terceiro no quadro de edição que liderava, e o Grok Imagine Image 2.0 é agora quarto no Elo de qualidade da Artificial Analysis e quarto no quadro de edição da Arena, melhor colocação do que o terceiro lugar do pódio; continuamos a reportá-lo em vez de o coroar, porque nada no registo de lançamentos mostra que tenha saído como produto.

Escolha de categoria, setembro de 2026

Melhor IA para vídeo

1
Gemini Omni 1.1 Flash
#1 Arena texto para vídeo
2
MiniMax H3
2K + áudio nativo
3
Dreamina Seedance 2.0
O concorrente mais próximo

A melhor IA para gerar vídeo é o Gemini Omni 1.1 Flash, que a Google lançou a 27 de agosto e que lidera o quadro de texto para vídeo da Arena com 1516, mesmo à frente do seu próprio antecessor Gemini Omni Flash com 1513. Leia isso como um empate: os dois caem dentro dos intervalos de confiança um do outro e a própria Arena dá ao 1.1 Flash uma banda de posição de um a quatro. O que desempata é a ficha técnica, onde o 1.1 Flash é claramente o modelo mais capaz: extensão de cena em blocos de 10 segundos até 40 segundos acumulados, controlo do primeiro e do último fotograma, referências de vídeo, rascunhos em 360p e saída em 1080p ou 4K, a cerca de $0,03 por segundo em 360p, $0,10 em 720p, $0,15 em 1080p e $0,30 em 4K. O Gemini Omni Flash continua a ser a opção mais barata, à volta de $0,10 por segundo, mas fica-se por clipes de 10 segundos. Dois limites a conhecer. A Artificial Analysis não avaliou de todo o 1.1 Flash; no seu quadro de texto para vídeo lidera o mais antigo Omni Flash com 1512,8 à frente do Wan 3.0 da Alibaba com 1431,4 e do MiniMax H3 com 1407,7. E no quadro de imagem para vídeo da Arena o 1.1 Flash é segundo com 1488,5 atrás do MiniMax H3 com 1495,4, por isso a coroa assenta no texto para vídeo e na ficha técnica, não numa varredura. Se precisa de planos mais longos dentro das ferramentas da Google, o Veo 3.1 continua a correr na aplicação Gemini, no AI Studio e no Vertex AI com áudio nativo e saída em 1080p. O MiniMax H3 (31 de julho) continua a ser o rival na ficha técnica, com clipes em 2K de 4 a 15 segundos e áudio estéreo nativo desde $0,13 por segundo.

ModeloMelhor paraPonto fortePonto fracoPreço
Gemini Omni 1.1 FlashMelhor vídeo com IA no geral#1 Arena texto para vídeo (1516); extensão de cena até 40 segundos, saída em 4KNão avaliado pela Artificial Analysis; segundo atrás do MiniMax H3 no Arena imagem para vídeo$0,03-$0,30/s; Gemini API / AI Studio / Flow
Gemini Omni FlashClipes de dez segundos mais baratos#2 Arena texto para vídeo (1511), #2 vídeo da AA (1238); edição conversacionalFica-se por gerações de dez segundos~$0.10/s; aplicação Gemini / AI Studio
Wan 3.0Vídeo a partir de documentos e diapositivos#1 no quadro de vídeo da Artificial Analysis (1239); 2-30 s, até 1080p, entrada Omni-ReferenceApenas API, sem pesos publicados; #3 na Arena$0.05-$0.20/s
MiniMax H3Clipes 2K com áudio nativo4-15 s em 2K, áudio estéreo nativo; #8 Arena texto para vídeo (1462)#4 no vídeo da AA (1227); os pesos abertos excluem o upscaler 2K e exigem candidatura nos EUA, na UE, no Reino Unido e na Coreia do Sul$0.13/s em 2K
Dreamina Seedance 2.5Rival da ByteDance#6 Arena texto para vídeo (1482); lidera imagem para vídeo com áudioEcossistema ByteDance, acesso ocidental limitadoDreamina / BytePlus
Muse VideoVídeo no ecossistema Meta#3 texto para vídeo com 1459O mais recente do grupo, ferramentas escassasAplicação Meta AI
Veo 3.1Clips de produção mais longosÁudio nativo, 1080p, forte consistência física#6 na Arena vídeo, não o líder de qualidadeGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboIteração rápida a menor custo4K nativo, 60fps, clips de 15 segundos; o Turbo saiu a 17 de junhoFora do top 16 na Arena texto para vídeoA partir de $10/mês
Luma Ray 3Cenas fotorrealistasForte realismo para paisagensComunidade mais pequenaGrátis / a partir de $9.99/mês
Segundo lugar e alternativas: o MiniMax H3 é o segundo e lidera agora o quadro de imagem para vídeo da Arena com 1495,4, à frente do Gemini Omni 1.1 Flash com 1488,5. O Dreamina Seedance 2.0 é terceiro e continua a ser a escolha para imagem para vídeo com áudio. O Veo 3.1 é a escolha quando 10 segundos não chegam, e o Wan 3.0 da Alibaba o que usar quando o material de partida é um documento, uma folha de cálculo ou uma apresentação. A OpenAI retirou a aplicação para consumidores Sora 2 a 26 de abril de 2026 e resta apenas a API para programadores, até 24 de setembro de 2026. Acompanhamos as datas de retirada dos modelos antigos de todos os fornecedores numa lista à parte em curso.
O que mudou este mês

O Gemini Omni 1.1 Flash mantém a coroa do vídeo, mas o quadro à sua volta está mais confuso do que a entrada do mês passado sugeria. Continua a liderar o quadro de texto para vídeo da Arena, 1516 contra os 1513 do Gemini Omni Flash, e a Arena dá-lhe uma banda de posição de um a quatro, por isso continua a ser um empate desempatado pela ficha técnica. Duas coisas que reportámos em agosto mudaram. A Artificial Analysis reancorou o seu Elo de vídeo e o antigo trio 1239 / 1238 / 1235 já não existe: o Gemini Omni Flash lidera agora esse quadro com 1512,8 à frente do Wan 3.0 com 1431,4 e do MiniMax H3 com 1407,7, e a Artificial Analysis continua a não avaliar de todo o 1.1 Flash. E o MiniMax H3 assumiu o topo do quadro de imagem para vídeo da Arena com 1495,4, empurrando o 1.1 Flash para segundo com 1488,5, o primeiro quadro que esta coroa perdeu.

Escolha de categoria, setembro de 2026

Melhor IA para programação

1
Claude Opus 5.5
Lidera todos os harnesses
2
GPT-6 Astra
Os dois quadros de programação da Arena
3
Claude Fable 5.1
Segundo nos harnesses

A melhor IA para programar é o Claude Opus 5.5, que a Anthropic lançou a 22 de setembro e que lidera todos os harnesses de programação que acompanhamos: a própria campanha de Terminal-Bench 4.0 da Artificial Analysis com 59,6 % contra os 59,1 % do GPT-6 Astra, o LiveBench Coding com 89,3 contra 80,4 e o LiveBench Agentic Coding com 71,7 contra 57,3. Consegue-o a $4 / $20 por 1M de tokens, menos de metade do preço de tabela dos dois modelos que lideravam este quadro no mês passado, com leituras de cache a $0,20, e segundo os testes da própria Anthropic uma carga de trabalho típica custa 40 % menos do que no Claude Opus 5. A campanha interna de Terminal-Bench 4.0 da Anthropic alarga ainda mais a distância, 66,4 % contra os 57,9 % que a OpenAI reporta para o Astra, a par de 54,4 % no FrontierCode v1.1 e 57,8 % no CursorBench 4.0. O GPT-6 Astra mantém os dois quadros de programação da Arena, WebDev com 1793 e imagem para WebDev com 1733, porque o Opus 5.5 ainda não tem um único voto na Arena, e essa é a divisão honesta aqui: a OpenAI lidera na preferência humana, a Anthropic em todos os harnesses medidos. Leia com cuidado a margem de meio ponto no Terminal-Bench, porque a própria Anthropic reporta um erro padrão de cerca de 2,6 pontos nesse benchmark, por isso trate os dois como iguais aí e deixe os quadros do LiveBench e o preço decidir. O Claude Fable 5.1 é segundo nos dois quadros da Arena e terceiro nos harnesses. O Qwen3.8-Max-0902 da Alibaba segurou o quadro WebDev da Arena cerca de três dias no início de setembro e está agora em quinto com 1662. Entre os pesos abertos o panorama mudou a 21 de setembro: o MiMo-V2.6-Pro da Xiaomi faz 34,8 % no Terminal-Bench 4.0 sob MIT simples a $0,13 por tarefa do índice, enquanto o GLM-5.3 continua a ser o modelo aberto mais forte nesse harness com 41,9 % e o Kimi K3 é o modelo aberto mais bem colocado no Arena WebDev, sétimo com 1658, com apenas 12,6 % no harness. A Artificial Analysis retirou tanto o seu Coding Index como o Coding Agent Index, por isso as duas classificações compostas de programação que esta página citava já não existem.

ModeloMelhor paraPonto fortePonto fracoPreço (por 1M de tokens)
Claude Opus 5.5Melhor programação no geral#1 Terminal-Bench 4.0 (59,6 %), #1 Intelligence Index (57,6, v4.3.2) e #1 LiveBench Coding (89,3)Ainda sem votos na Arena, por isso o Astra mantém os seus dois quadros de programação$4 / $20
GPT-6 AstraTopo dos dois quadros de programação da Arena#1 Arena WebDev (1793) e #1 imagem para WebDev (1733); 59,1 % Terminal-Bench 4.02,5 vezes o preço do Opus 5.5 e atrás dele em todos os harnesses$10 / $50
Claude Fable 5.1Maior pontuação composta antes do Opus 5.5#2 nos dois quadros de programação da Arena; Intelligence Index 53,4; AA-Briefcase 167852,0 % Terminal-Bench 4.0; 2,5 vezes o preço do Opus 5.5$10 / $50
Claude Opus 5Substituído pelo Opus 5.549,0 % Terminal-Bench 4.0 e #3 nos dois quadros de programação da ArenaCusta mais por token do que o Opus 5.5 e pontua sete pontos abaixo$5 / $25
Claude Fable 5Trabalho agêntico mais duro e de horizonte longoIntelligence Index 49,6; 42,4 % Terminal-Bench 4.0; contexto de 1MO mais caro por tarefa do índice neste quadro, $8,75; #6 no Arena imagem para WebDev$10 / $50
Qwen3.8-Max-0902Detentor breve do quadro WebDev da Arena#5 Code Arena: WebDev (1662); Intelligence Index 45,4; 2,4 biliões de parâmetros, contexto de 1MApenas API da QwenCloud, sem interface para consumidores; perdeu a liderança do WebDev em dias$2 / $6
Kimi K3Modelo aberto mais bem colocado na Arena#7 Arena WebDev (1658), a melhor colocação aberta nesse quadro; 2,8 biliões/104 mil milhões ativosApenas 12,6 % no Terminal-Bench 4.0; 1,56 TB para alojar$3 / $15
GPT-5.6 SolO topo de gama mais barato da OpenAIIntelligence Index 47,0; 39,9 % Terminal-Bench 4.0Substituído pelo GPT-6 Sol, que pontua mais alto por metade do preço; a METR assinalou manipulação de avaliações$4 / $20
GPT-6 SolProgramação GPT-6 barata no CodexIntelligence Index 47,5 (v4.3.2) e 43,9 % no Terminal-Bench 4.0, ambos acima do GPT-5.6 Sol e por metade do preçoSem votos na Arena; apenas no Codex e no ChatGPT Work, não no Chat$2 / $10
Muse Spark 1.3Programação agêntica barataIntelligence Index 48,1 a $1,25 / $4,25 e $1,60 por tarefa do índice33,3 % no Terminal-Bench 4.0; as vitórias em programação vêm do gráfico da própria Meta, medido numa variante max só para parceiros$1,25 / $4,25
Grok 4.7Programador barato com boa relação46,3 % CursorBench 4.0 e 71,0 % DeepSWE v1.1 pelos números da própria SpaceXAI; Intelligence Index 46,324,7 % no Terminal-Bench 4.0; prompts de 200K tokens ou mais refaturam o pedido inteiro ao dobro$2 / $6
Gemini 3.8 FlashProgramação agêntica em escalaIntelligence Index 40,9; 308,4 tokens de saída por segundo19,7 % no Terminal-Bench 4.0; o preço de lançamento duplica a 1 de janeiro de 2027$0,75 / $3,75
GLM 5.3 FlashO programador sério mais barato que consegue alojar32,8 % Terminal-Bench 4.0 a $0,25 por tarefa do índice; MIT, 320 mil milhões/18 mil milhões ativosO GLM-5.3 chega a 41,9 % no mesmo harness; sem produto para consumidoresPesos abertos (MIT)
MiMo-V2.6-ProO maior Intelligence Index aberto46,3 na v4.3.2 e 34,8 % Terminal-Bench 4.0 a $0,13 por tarefa do índice; MIT, 1,02 biliões/42 mil milhões ativosPublicado a 21 de setembro, por isso ainda sem votos na Arena nem histórico independente$0,435 / $0,87
Segundo lugar e alternativas: o GPT-6 Astra é o segundo e continua a liderar os dois quadros de programação da Arena, o Claude Fable 5.1 é segundo nesses quadros e terceiro nos harnesses, e o Claude Opus 5 é agora substituído por um modelo ao mesmo tempo mais barato e melhor. Entre os pesos abertos, o MiMo-V2.6-Pro da Xiaomi é o novo líder em pontuação e em custo, o GLM-5.3 é o mais forte no Terminal-Bench 4.0 da Artificial Analysis, o Kimi K3 é o modelo aberto mais bem colocado no quadro WebDev da Arena, e o GLM 5.3 Flash é a escolha para equipas que alojam o seu, a $0,25 por tarefa do índice sob MIT simples. Dentro dos IDE, o Cursor com o Claude continua a ser a dupla mais popular e o Claude Code é a escolha natural se vive no terminal.
O que mudou este mês

A coroa da programação passou para o Claude Opus 5.5, quatro dias depois de ter passado para o GPT-6 Astra. A Anthropic lançou-o a 22 de setembro e ele lidera todos os harnesses de programação que acompanhamos: 59,6 % contra os 59,1 % do Astra na própria campanha de Terminal-Bench 4.0 da Artificial Analysis, 89,3 contra 80,4 no LiveBench Coding e 71,7 contra 57,3 no LiveBench Agentic Coding, a $4 / $20 contra $10 / $50. O Astra mantém os dois quadros de programação da Arena porque o Opus 5.5 ainda não tem votos lá, por isso isto é uma divisão e não uma varredura. A margem no Terminal-Bench é de meio ponto contra um erro padrão que a Anthropic situa à volta de 2,6, por isso o que decide mesmo são os quadros do LiveBench e o preço. O Claude Opus 5 sai do pódio: o Opus 5.5 custa menos por token, gasta menos tokens e pontua sete pontos acima no Intelligence Index, o que torna o velho argumento de valor do Opus 5 não apenas mais fraco mas obsoleto. O MiMo-V2.6-Pro da Xiaomi e o Grok 4.7 da SpaceXAI entram ambos no quadro, e todos os números de índice desta página passaram para a v4.3.2, o que os deixa ligeiramente abaixo dos do mês passado. O GPT-6 Sol entra na tabela no mesmo dia a $2 / $10: a Artificial Analysis mede-o em 47,5 no índice e em 43,9 % no Terminal-Bench 4.0, acima do GPT-5.6 Sol em ambos e por metade do preço, mas muito atrás do Opus 5.5, e chega aos programadores pelo Codex e não pela janela de chat.

Escolha de categoria, setembro de 2026

Melhor IA para criatividade

1
Grok 4.7
Menos barreiras
2
Claude Fable 5
Prosa da mais alta qualidade
3
Kimi K3
Ficção e voz

A melhor IA para trabalho criativo sem filtros e na moda é o Grok 4.7, e queremos ser exatos quanto ao motivo. Esta escolha é sobre a linha de produto, não sobre a qualidade da prosa. O Grok tem as menores restrições de conteúdo de qualquer modelo de fronteira e a única integração nativa com o X em tempo real, o que faz dele o único modelo que pega em encargos ousados, atuais ou deliberadamente provocadores que os outros recusam. Leia a disponibilidade com atenção: a SpaceXAI lançou o Grok 4.7 a 21 de setembro na API do Grok, no Cursor, no Grok Build, em harnesses de terceiros e em routers na nuvem, e o seu anúncio nada diz sobre a aplicação para consumidores, que continua a servir o Grok 4.6 aos assinantes SuperGrok e X Premium+ por $30 por mês. Não é o melhor a escrever. A Arena já avaliou o Grok 4.6, que está em 32.º no quadro de escrita criativa, à frente do Grok 4.5 em 36.º mas atrás do mais antigo Grok 4.20-beta1 em 23.º. O EQ-Bench não avaliou nem o 4.6 nem o 4.7, e nesse quadro o Grok 4.5 está em 46.º com 1576,0, agora mesmo à frente do Grok 4.20-beta em vez de atrás. Como a SpaceXAI orientou ambos os lançamentos para programação e trabalho agêntico e não para prosa, não assumimos que o 4.7 tenha mudado alguma coisa aqui. Se escolher só pela qualidade do resultado, o Claude Fable 5 continua a liderar o quadro de escrita criativa da Arena, enquanto o EQ-Bench coloca o GPT-6 Astra em primeiro com 2163,9, o Claude Fable 5.1 em segundo e o Kimi K3 em quarto. Escolha o Grok pelo que ele o deixará fazer, não por como escreve.

ModeloMelhor paraPonto fortePonto fracoPreço
Grok 4.7Sem filtros, com opinião, na modaMenos restrições de conteúdo, ancoragem nativa no X em tempo realNenhum quadro de escrita criativa o avaliou; o Grok 4.6 está em #32 na escrita criativa da Arena$2 / $6 API; app SuperGrok de $30 por mês, ainda no 4.6
Claude Fable 5Prosa criativa da mais alta qualidade#1 Arena escrita criativa, #1 LiveBench LanguageBarreiras cautelosas em briefings ousados$10 / $50 API
Kimi K3Ficção e voz própria#4 EQ-Bench Creative Writing com 2070,6Apenas #27 na escrita criativa da Arena$3 / $15
Claude Opus 5Criatividade estruturada de formato longoMantém fios longos e autoedita-se; Intelligence Index 50,8, atrás do Claude Fable 5.1 e do GPT-6 AstraO mais cauteloso do grupo$20/mês Pro; $5 / $25 API
Gemini 3.1 ProCriativo multimodalForte cadeia de texto, imagem e vídeoQuotas dentro da aplicação GeminiGrátis / $2.00-$4.00 API entrada
Grok Imagine (Spicy Mode)NSFW / criativo para adultosA geração de imagens mais permissivaCaso de utilização de nicho$30/mês SuperGrok
Segundo lugar e alternativas: o Claude Fable 5 é o segundo e a escolha certa se a qualidade importar mais do que a liberdade, o Kimi K3 é a escolha para ficção, e o Claude Opus 5 é a escolha para projetos criativos que se estendem por muitos turnos. Para trabalho criativo para adultos, o Grok Imagine Spicy Mode continua a ser a única opção de nível frontier.
O que mudou este mês

O Grok mantém esta escolha, agora com o Grok 4.7, que a SpaceXAI lançou a 21 de setembro sobre um modelo base novo e maior. Nada mudou na permissividade do produto nem no seu acesso em direto ao X, que é aquilo em que a escolha assenta. O modelo por baixo é outra vez mais forte, 46,3 no Intelligence Index contra os 44,3 do Grok 4.6, mas esse ganho caiu na programação e no trabalho agêntico e não na prosa, e nenhum quadro de escrita criativa avaliou o 4.7. Uma correção à entrada do mês passado: a Arena já avaliou o Grok 4.6, que está em 32.º no seu quadro de escrita criativa, por isso a frase de que nenhum dos quadros o tinha avaliado já não se sustenta. Repare também na disponibilidade dividida, porque para esta categoria importa: o 4.7 está na API, no Cursor e no Grok Build, enquanto a aplicação Grok de $30 por mês, de que o argumento da permissividade realmente trata, continua a servir o 4.6. O Claude Fable 5 continua a ser o modelo a usar quando quer a melhor escrita.

Escolha de categoria, setembro de 2026

Melhor IA para precisão & investigação

1
Claude Fable 5.1
Maior precisão factual
2
Gemini 3.1 Pro
Melhor valor, $0,52/tarefa
3
GPT-5.6 Sol
Raciocínio inédito

A melhor IA para precisão e investigação é o Claude Fable 5.1, que detém a maior precisão factual que a Artificial Analysis mediu, 67 % no AA-Omniscience. É exatamente a coluna pela qual esta categoria se decide, e passou um teste duro a 22 de setembro: o Claude Opus 5.5 bateu o Fable 5.1 em quase tudo o resto, incluindo o Humanity's Last Exam com 61,4 % contra 59,1 % e o índice AA-Omniscience penalizado por alucinações com 46,4 contra 43,5, mas na precisão factual em bruto marca 66 % contra os 67 % do Fable 5.1. Trate essa diferença de um ponto por si só como um empate e leia os dois em conjunto: o Opus 5.5 é a melhor aposta quando uma resposta errada é pior do que nenhuma, e o Fable 5.1 quando quer o maior número de factos certos. A escolha por valor é o Gemini 3.1 Pro, e continua a ser aquilo a que recorreríamos quando o custo conta. O seu melhor resultado é no ARC-AGI-1 da ARC Prize, onde faz 98 % e iguala o painel humano, a $0,52 por tarefa, embora o Claude Fable 5 e o GPT-6 Astra já tenham passado o painel com 98,5 %. Junta a isso ancoragem nativa no Google Search, que é o que quer quando a resposta tem de ser atual e não apenas plausível. Faz também 94,1 % no GPQA Diamond, onde o GPT-5.6 Sol agora o iguala em vez de ficar atrás, e 44,4 % no Humanity's Last Exam, e 46,44 no quadro HLE da Scale SEAL, que o Claude Fable 5 agora lidera com 55,5 %. Duas ressalvas honestas. Na pesquisa ancorada em concreto, o quadro de pesquisa da Arena é liderado pela OpenAI e não pela Google nem pela Anthropic: o GPT-5.6 Sol encabeça com 1257, com o Claude Fable 5 em quinto e o Gemini 3.1 Pro com ancoragem em nono. E no raciocínio inédito a coroa está noutro lado por completo, com o GPT-6 Astra a liderar tanto o ARC-AGI-2 como o ARC-AGI-3. Não passámos esta coroa para o Claude Opus 5 porque a Artificial Analysis mede a sua taxa de alucinação em 50 % e o coloca bem abaixo dos dois modelos Fable no AA-Omniscience.

ModeloMelhor paraBenchmark-chavePonto fracoPreço
Claude Fable 5.1Maior precisão factual medida67 % de precisão factual no AA-Omniscience, a maior que a Artificial Analysis mediu, um ponto acima do Claude Opus 5.5Sem escalão barato; não avaliado no quadro de pesquisa da Arena; o Opus 5.5 lidera o Humanity's Last Exam e o índice AA-Omniscience$10 / $50
Gemini 3.1 ProMelhor valor, trabalho factual barato98 % ARC-AGI-1 (iguala o painel humano) a $0.52/tarefa, 94,1 % GPQA (igualado pelo Sol)ARC-AGI-2 77,1 % agora ~14.º; #9 na Arena pesquisa$2.00-$4.00 / $12.00-$18.00 (escalonado)
Claude Fable 5Pesquisa ancorada#5 no quadro de pesquisa da Arena, atrás do GPT-5.6 SolSem um único nível barato$10 / $50 (Fable 5)
GPT-5.6 SolRaciocínio inédito#3 ARC-AGI-2 com 92,5 %, atrás do GPT-6 Astra (95 %) e do Claude Opus 5.5 (93,3 %)Scheming assinalado pelo METR$4 / $20
Claude Opus 5Os problemas inéditos mais difíceis#1 ARC-AGI-3 com 30 %, ~3,75x o modelo seguinte (ARC Prize)A Artificial Analysis mede uma taxa de alucinação de 50 %$5 / $25
Qwen 3.7 MaxPrecisão frontier a preço vantajoso92,4 GPQA Diamond, 200 pedidos grátis/diaApenas API, sem front-end de chat$1.25 / $3.75 promo; $2.50 / $7.50 tabela
Claude Opus 4.6Honestidade sob pressão#1 no quadro MASK da Scale SEAL com 96,28; a Anthropic ocupa o top 5Substituído como modelo de topoModelo legacy da Anthropic
Segundo lugar e alternativas: o Gemini 3.1 Pro é o segundo e a escolha de relação qualidade-preço a $0,52 por tarefa com ancoragem no Google Search, o GPT-5.6 Sol é o segundo para raciocínio inédito, o Claude Opus 4.6 domina o quadro de honestidade sob pressão, e o Qwen 3.7 Max é a escolha de valor na fronteira.
O que mudou este mês

A coroa da precisão fica com o Claude Fable 5.1, e foi testada a sério. O Claude Opus 5.5 chegou a 22 de setembro e levou o Humanity's Last Exam com 61,4 % contra 59,1 % e o índice AA-Omniscience penalizado por alucinações com 46,4 contra 43,5, mas esta categoria decide-se pela coluna de precisão factual em bruto e aí o Fable 5.1 continua a marcar 67 % contra os 66 % do Opus 5.5. É um ponto de diferença, por isso o bloco diz agora sem rodeios que os dois se repartem em vez de fingir que o Fable 5.1 varre tudo: use o Opus 5.5 quando uma resposta errada é pior do que nenhuma, e o Fable 5.1 quando quer o maior número de factos certos. E ainda duas correções à entrada do mês passado. Dizia que o GPT-5.6 Sol liderava o ARC-AGI-2 e que o Claude Opus 5 liderava o ARC-AGI-3; o GPT-6 Astra lidera os dois desde o lançamento a 3 de setembro, como o bloco de resolução de problemas já dizia, e essa contradição desapareceu. E o ARC-AGI-1 passou à frente do painel humano: o Claude Fable 5 e o GPT-6 Astra fazem ambos 98,5 % onde o painel de 2025 faz 98 %, por isso os 98 % do Gemini 3.1 Pro a $0,52 por tarefa continuam verdadeiros e continuam a ser o argumento de valor, mas já não são o topo desse quadro. O outro movimento do mês na precisão é o GPT-6 Sol, e acontece abaixo da coroa: a Artificial Analysis mede a sua taxa de alucinação em 60 % contra os 92 % do GPT-5.6 Sol, enquanto a precisão factual pura desce de 59 % para 55 %, o que sobe o seu índice AA-Omniscience de 22,0 para 27,1.

Escolha de categoria, setembro de 2026

Melhor IA para resolução de problemas

1
GPT-6 Astra
Líder em raciocínio
2
Claude Opus 5
Cadeias agênticas
3
GPT-5.6 Sol
Topo de gama STEM acessível

A melhor IA para resolução de problemas difíceis é o GPT-6 Astra, que tirou ao GPT-5.6 Sol os quadros de raciocínio poucos dias depois de ser lançado. Lidera o LiveBench Reasoning com 92,65 e o ARC-AGI-2 com 95 %, a pontuação mais alta alguma vez obtida contra o painel humano de 100 % desse quadro, e é terceiro no LiveBench Mathematics com 96,81 atrás dos 97,08 do Claude Opus 5.5 e dos 97,01 do Claude Fable 5.1. Reporta também 97,6 % no FrontierMath Tier 4 v2, um número a ler juntamente com a divulgação da Epoch AI de que a OpenAI financiou o benchmark e detém acesso exclusivo a parte dele. O senão é o preço e o alcance: $10 / $50 por 1M de tokens contra os $4 / $20 do Sol, e exige um plano pago do ChatGPT. O GPT-5.6 Sol é a alternativa de valor, terceiro em ambos os quadros LiveBench com 96,20 e 91,65 e terceiro no ARC-AGI-2 desde que o Claude Opus 5.5 marcou 93,3 %. O GPT-6 Sol custa metade, $2 / $10, e supera-o no índice da Artificial Analysis, mas nenhum quadro de raciocínio o avaliou ainda. O Qwen 3.7 Max é a escolha económica para problemas de competição com 97,1 no índice HMMT de fevereiro de 2026 e 44,5 no Apex, com 200 pedidos gratuitos por dia. O Claude Opus 5 continua a ser a alternativa para longas cadeias de raciocínio agêntico, embora o Astra também lhe tenha tirado o ARC-AGI-3.

ModeloMelhor paraBenchmark-chavePonto fracoPreço
GPT-6 AstraMatemática, ciência e raciocínio mais difíceis#1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3Exige um plano pago do ChatGPT; 2,5x o preço do Sol$10 / $50
Claude Opus 5Longas cadeias de raciocínio agêntico#2 AA-Briefcase (1673) e #2 GDPval-AA v2.1 (1708); 30,2 % ARC-AGI-3O Astra lidera agora o ARC-AGI-3; 50 % de taxa de alucinação$5 / $25
GPT-5.6 SolTopo de gama STEM acessível#3 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) e Reasoning (91,65)FrontierMath ainda não publicado; METR sinalizou comportamento manipulador$100/mês ChatGPT Pro; API $4 / $20
GPT-6 SolO mesmo nível por metade do preçoIntelligence Index 47,5 (v4.3.2) contra os 47,0 do GPT-5.6 Sol, a $1,06 por tarefa do índice contra $1,99Nem o LiveBench nem a ARC Prize o avaliaram, por isso não detém aqui nenhum quadro$2 / $10
Qwen 3.7 MaxMatemática de competição com orçamento apertado97,1 HMMT 2026 fev., 44,5 Apex, 200 pedidos grátis/diaApenas API$1.25 / $3.75 promo; $2.50 / $7.50 tabela
Claude Fable 5Matemática dentro de um fluxo de programação#1 na subcategoria de matemática da Arena (1543), 96,0 LiveBench MathematicsA opção mais cara aqui$10 / $50
GLM 5.3 FlashResolução de problemas open-weightIntelligence Index 41,8 sob MIT, quase oito pontos acima do GLM-5.2 com menos de metade do tamanho; 320B/18B ativos, contexto 1MExige um servidor multi-GPU, não uma estação de trabalho; o GLM 5.3 pontua mais alto segundo os números da própria Z.ai e é transferível desde 28 de agosto, mas com mais do dobro do tamanho e sob uma licença própriaOpen weights (MIT)
Segundo lugar e alternativas: o GPT-5.6 Sol é o segundo e a escolha de valor a $4 / $20, o Claude Opus 5 é a escolha natural para raciocínio agêntico de cadeia longa, o Qwen 3.7 Max é a escolha económica, e o GLM 5.3 Flash é a escolha open-weight. O nosso guia dedicado à melhor IA para matemática detalha a divisão tarefa a tarefa e as opções gratuitas.
O que mudou este mês

A coroa da resolução de problemas passou para o GPT-6 Astra, que levou os quadros pelos quais esta categoria se decide poucos dias após o lançamento a 3 de setembro. Lidera o LiveBench Reasoning com 92,65 contra os 91,65 do GPT-5.6 Sol, leva o ARC-AGI-2 com 95 % contra os 92,5 % do Sol e destronou o Claude Opus 5 no ARC-AGI-3, onde os seus 62,7 % no harness padrão batem os 30,2 % do Opus 5. Leia os números do ARC-AGI-3 com atenção: esse quadro mede eficiência de ação ao nível humano em ambientes inéditos, não problemas resolvidos, e os 98,6 % tão citados vêm de um harness com adaptador do fornecedor, não do padrão. O Sol desce ao terceiro lugar em ambos os quadros LiveBench mas continua a ser a alternativa de valor a $4 / $20 contra os $10 / $50 do Astra, e o LiveBench Mathematics mudou de mãos duas vezes desde então, para o Claude Fable 5.1 com 97,01 e a 22 de setembro para o Claude Opus 5.5 com 97,08. Depois disso mexeram-se duas coisas. A ARC Prize pontuou o Claude Opus 5.5 com 93,3 % no ARC-AGI-2, o que faz o GPT-5.6 Sol descer para terceiro nesse quadro, e a 22 de setembro chegou o GPT-6 Sol a $2 / $10, metade do que custa o nível 5.6, com um Intelligence Index mais alto mas ainda sem nota própria no LiveBench nem na ARC Prize.

Escolha de categoria, setembro de 2026

Melhor agente de IA

1
Gemini Spark
Reside na cloud
2
Claude Cowork
Reside no computador
3
ChatGPT Codex
Agente de programação

O melhor agente de IA é o Gemini Spark se quiser o agente na cloud e o Claude Cowork se o quiser no seu computador. São escolhas conjuntas e não um primeiro e um segundo: o Spark corre numa VM da Google Cloud, pelo que continua a trabalhar com o portátil fechado, ligado ao Gmail, ao Docs e, desde o início de setembro, ao Google Fotos; o Cowork corre no seu Mac ou Windows e comanda as suas aplicações locais e o seu ecrã. Nenhum quadro independente mede os dois produtos um contra o outro, pelo que a escolha é sobre onde o trabalho tem de acontecer e não sobre quem pontua mais. O preço também já não desempata: o Spark chega agora ao nível Google AI Pro de $19.99/mês nos EUA e em mais de 160 outros países, e o Cowork está incluído sem custo adicional em todos os planos pagos do Claude a partir de $20/mês. O ChatGPT Codex Mobile (14 de maio) é a alternativa para trabalho de agente de programação, e os agentes de navegador da classe OpenAI Operator para tarefas web. Leia a comparação completa entre Gemini Spark e Claude Cowork.

AgenteMelhor paraOnde funcionaPonto fortePreço
Gemini SparkTarefas na cloud 24/7, fluxos do WorkspaceVM da Google Cloud (sempre ativa)Primeiro verdadeiro agente 24/7, integração profunda com o WorkspaceDesde $19.99/mês Google AI Pro
Claude CoworkAmbiente de trabalho, condução de aplicações, design + códigoO seu ambiente de trabalho Mac/WindowsConduz aplicações locais, vê o seu ecrã$20/mês Claude Pro
ChatGPT Codex MobileAgente de programação no telemóvelCloud da OpenAI + iOS/AndroidAprovar diffs e reencaminhar o trabalho a partir do telemóvelIncluído nos planos ChatGPT
Grok Agentic (Grok 4.7)Investigação em tempo real, recolha do XNuvem da SpaceXAIIntegração nativa com o X; Elo 1695 no GDPval-AA v2.1, quarto entre modelos distintos$30 por mês SuperGrok, ainda no 4.6
OpenAI de classe OperatorTarefas de navegador, formulários webCloud da OpenAI + o seu navegadorAutomação webChatGPT Pro
Segundo lugar e alternativas: o Gemini Spark e o Claude Cowork são escolhas conjuntas separadas por onde o agente corre, não um primeiro e um segundo. O ChatGPT Codex Mobile é a escolha para agentes de programação, e o Grok Agentic é a escolha de nicho para investigação em tempo real. O Google AI Ultra a $99.99 ou $199.99 por mês compra agora no Spark limites de utilização mais altos e não o acesso, que começa no nível Pro de $19.99.
O que mudou este mês

Não saiu nenhum produto de agente para consumidores novo, por isso as coroas não se mexem: o Gemini Spark (nuvem) e o Claude Cowork (computador) continuam a ser escolhas conjuntas separadas por onde o agente corre. O Spark expandiu-se ainda assim, chegou ao plano Google AI Pro de $19,99 por mês e ganhou o Google Fotos, onde consegue pesquisar, editar, organizar e correr fluxos agendados. A camada de modelos por baixo mexeu-se bastante, e quase tudo foi a 22 de setembro. O Claude Opus 5.5 lidera agora os dois quadros agênticos que a Artificial Analysis publica: o AA-Briefcase v1.1 com 1822 contra os 1678 do Claude Fable 5.1 e os 1673 do Claude Opus 5, e o GDPval-AA v2.1 com 1846 contra 1735 e 1708. Iguala ainda o GPT-6 Astra no Terminal-Bench 4.0 a $4 / $20 contra $10 / $50, o que faz dele o modelo sobre o qual a maioria das equipas deve agora construir, em vez da recomendação do Opus 5 que este bloco trazia. A Agent Arena da Arena não o avaliou, e aí continua a liderar o Claude Fable 5.1 na conclusão de tarefas com 19,8 %, com o GPT-6 Astra em segundo com 17,7 %, o DeepSeek V4.1-Flash em terceiro e o Claude Opus 5 em quarto. O outro movimento é o Grok 4.7 da SpaceXAI (21 de setembro): 1695 no GDPval-AA v2.1 e 1657 no AA-Briefcase colocam-no em quarto e sétimo, acima do GPT-6 Astra nos dois, ainda que chegue à API, ao Cursor e ao Grok Build e não a um produto de agente para consumidores. O Muse Spark 1.3 da Meta fica em quinto entre modelos distintos no GDPval-AA v2.1 com 1674, abaixo do Grok 4.7 e não acima como reportámos no mês passado, e a Scale SEAL continua a ter avaliado apenas o mais antigo 1.1, que lidera o seu quadro de uso de ferramentas MCP Atlas com 88,1. O GLM 5.3 Flash (26 de agosto, MIT) continua a ser o modelo agêntico aberto que alojaríamos, com AutomationBench 48,8 no gráfico da própria Z.ai onde o Claude Opus 4.8 faz 41,0; no sinal de conclusão de tarefas da Agent Arena o GLM-5.2 está em décimo sétimo e o Kimi K3 em quinto, sendo o modelo aberto mais bem colocado o DeepSeek V4.1-Flash em terceiro.

Fello AI a funcionar no Mac, iPhone e iPad
Todos os melhores modelos de IA, uma aplicação

Os principais modelos como ChatGPT, Claude e Gemini, juntos no Mac, iPhone e iPad.

Grátis para começar, 4,7★ em mais de 27 000 críticas.

Descarregar Fello AI

Guia de utilização, setembro de 2026

Melhor IA para estudantes

1
GPT-5.6 Luna
Ensaios & investigação
2
Gemini 3.6 Flash
STEM + PDFs
3
Claude Sonnet 5
Escrita & revisão

A melhor IA para estudantes é o GPT-5.6 Luna dentro do ChatGPT para trabalho de curso geral e o Gemini 3.6 Flash dentro da aplicação Gemini para STEM e estudo multimodal, com o Qwen 3.7 Max como alternativa por API para conjuntos de problemas mais difíceis (200 pedidos grátis por dia) e o Claude Opus 5 como alternativa para revisão de ensaios. A maioria dos estudantes não precisa de pagar, e o nível gratuito melhorou a 6 de agosto: o GPT-5.6 Luna passou a ser o modelo por omissão do ChatGPT Free e Go, com conversas de texto ilimitadas e um botão Think para perguntas mais difíceis, embora os carregamentos de ficheiros e as ferramentas de imagem continuem limitados. A 22 de setembro a OpenAI acrescentou o GPT-6 Luna para os utilizadores Free e Go na aplicação de computador do ChatGPT, um modelo da geração atual no nível gratuito logo no primeiro dia, embora no índice da Artificial Analysis faça os mesmos 37,3 que o GPT-5.6 Luna. O Gemini 3.6 Flash continua a ser o que a aplicação Gemini gratuita serve, o Claude Sonnet 5 é o Claude gratuito por omissão, e o DeepSeek V4 é grátis no site de conversa da DeepSeek. O Luna é o membro mais barato da família GPT-5.6 e não o mais forte, por isso recorra ao botão Think ou mude para o GPT-5.5 quando um ensaio exigir mais cuidado. Para trabalhar passo a passo a matemática mais dura, o GPT-5.6 Sol é o carro-chefe pago da OpenAI e o GPT-6 Astra reporta agora 97,6 % no FrontierMath Tier 4 v2 contra os 39,6 % verificados do GPT-5.5 Pro, embora o Astra ainda não está no nível gratuito do ChatGPT; o Qwen 3.7 Max é a alternativa de valor com 97,1 no índice HMMT de fevereiro de 2026 e preços de API de $1,25 / $3,75 na sua promoção atual de 50 % ($2,50 / $7,50 de tabela).

TarefaMelhor modeloPorquêGrátis?Alternativa
Ensaios & trabalho de cursoGPT-5.6 LunaPor omissão e grátis no ChatGPT desde 6 de agosto; conversas de texto ilimitadas, e GPT-6 Luna na aplicação de computador desde 22 de setembroSimClaude Sonnet 5 (Claude grátis)
Resolução de problemas STEMGPT-5.6 Sol / Qwen 3.7 MaxCarro-chefe STEM pago; o Astra reporta 97,6 % no FrontierMath Tier 4 v2 / 97,1 HMMT fev 2026Pro pago / Qwen API pagoGemini 3.6 Flash (grátis)
Investigação & precisãoGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarefa, ancoragem nativa na Pesquisa GoogleSim (aplicação Gemini)Claude Opus 5
Revisão de escritaClaude Sonnet 5Grátis e predefinido no claude.ai; o Claude Fable 5 é o líder de qualidadeSim (Claude grátis)Claude Fable 5
Estudo multimodal (PDFs, slides, imagens)Gemini 3.6 FlashContexto 1M, grátis na aplicação GeminiSimNotebookLM (Google)
Segundo lugar e alternativas: o Claude Sonnet 5 (grátis) é o segundo para a escrita e revisão de ensaios. O Gemini 3.6 Flash (grátis) é o segundo para o estudo multimodal e a ingestão de PDF. O DeepSeek V4 é o segundo para a resolução de problemas com um orçamento estritamente de custo zero.
O que mudou este mês

O nível gratuito é o que se moveu neste guia. A 6 de agosto a OpenAI tornou o GPT-5.6 Luna o modelo por omissão do ChatGPT Free e Go e deu a ambos conversas de texto ilimitadas mais um botão Think para perguntas mais difíceis, pelo que a escolha gratuita é agora o Luna em vez do GPT-5.5, que continua selecionável quando um ensaio exige mais cuidado. Os carregamentos de ficheiros, as imagens e outras ferramentas continuam limitados. Do lado da Google nada se moveu: o Gemini 3.8 Flash saiu a 2 de setembro mas chega aos utilizadores gratuitos apenas através do AI Studio e da API, pelo que a aplicação Gemini gratuita continua a servir o 3.6 Flash e este mantém a linha multimodal. O GPT-6 Astra (3 de setembro) é o modelo a vigiar para conjuntos de problemas difíceis, com 97,6 % reportados no FrontierMath Tier 4 v2 contra os 39,6 % verificados do GPT-5.5 Pro, mas exige um plano pago do ChatGPT e nenhum nível gratuito o inclui. O nível gratuito voltou a mexer-se a 22 de setembro: os utilizadores Free e Go chegam agora ao GPT-6 Luna na aplicação de computador do ChatGPT. Leia-o como mais barato e não como mais inteligente, porque a Artificial Analysis dá-lhe 37,3, ao nível da versão 5.6, e a ARC Prize separa os dois por duas décimas de ponto no ARC-AGI-2.

Guia de utilização, setembro de 2026

Melhor IA para o trabalho & profissionais

1
GPT-5.6
Trabalho de conhecimento diário
2
Claude Opus 5
Programação & escrita
3
Gemini 3.1 Pro
Investigação & briefings

A melhor IA para trabalho profissional é o GPT-5.6 (predefinição do ChatGPT desde 9 de julho) para trabalho de conhecimento diário, o Claude Opus 5 para programação e escrita de alto risco, e o Gemini Spark para fluxos agênticos 24/7. A maioria dos profissionais tira o máximo partido ao manter duas subscrições pagas (ChatGPT Plus a $20/mês mais Claude Pro a $20/mês, um total de $40/mês), ou ao consolidar com o Fello AI a $9.99/mês para os cinco melhores modelos numa aplicação de Mac/iOS. Para trabalho agêntico que corre enquanto dorme, o Gemini Spark é o único verdadeiro agente na cloud 24/7 e, desde 30 de julho, chega ao nível Google AI Pro de $19.99/mês além do Google AI Ultra.

Caso de utilizaçãoMelhor modeloDado-chavePreçoAlternativa
Trabalho de conhecimento diárioGPT-5.6Predefinição do ChatGPT desde 9 de julho; o assistente que a maioria consegue abrir$20/mês ChatGPT PlusClaude Opus 5
ChatGPT Work e CodexGPT-6 SolNo ChatGPT Work e no Codex para Plus, Pro, Business, Enterprise e Edu desde 22 de setembro, a $2 / $10 na API$20/mês ChatGPT PlusGPT-6 Luna para trabalho de volume
Programação (proprietária)Claude Opus 5.5#1 Terminal-Bench 4.0 (59,6 %) e #1 nos dois quadros de programação do LiveBench, a $4 / $20$20 por mês Claude ProGPT-6 Astra, que mantém os dois quadros de programação da Arena
Programação (económica)Qwen3.8-Max-0902#5 Code Arena: WebDev (1662), atrás do GPT-6 Astra, do Claude Fable 5.1, do Claude Opus 5 e do anterior Qwen3.8-Max; apenas API na QwenCloud$2 / $6Qwen 3.7 Max; DeepSeek V4.1-Flash
Investigação & briefingsGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarefa, ancoragem GoogleGoogle AI Pro / UltraClaude Opus 5
Matemática difícil, física, modelação financeiraGPT-6 Astra#1 LiveBench Reasoning e ARC-AGI-2 (95 %); reporta 97,6 % no FrontierMath Tier 4 v2$100/mês ChatGPT ProGPT-5.6 Sol; Qwen 3.7 Max
Fluxos de agente sempre ativosGemini SparkPrimeiro agente na cloud 24/7Desde $19.99/mês Google AI ProClaude Cowork
Notícias em direto, criativo com contexto do XGrok 4.7Intelligence Index 46,3 + ancoragem nativa no X; a aplicação Grok continua a servir o 4.6$30 por mês SuperGrokGemini 3.1 Pro
Consolidação tudo-em-umFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/mêsPagar a cada fornecedor em separado
Segundo lugar e alternativas: para a maioria das equipas profissionais, o Claude Opus 5.5 é o segundo atrás do GPT-5.6 para o trabalho diário e ao mesmo tempo o líder da programação em todos os harnesses a $4 / $20, com o GPT-6 Astra em segundo nos quadros de programação que funcionam com votos humanos. O Gemini 3.1 Pro é o segundo para funções com muita investigação, e o Gemini Spark é a escolha única se conseguir pôr um agente na nuvem a trabalhar em tarefas longas.
O que mudou este mês

Três lançamentos caíram nos primeiros três dias de setembro e um quarto a 22 de setembro, e é este último que muda o argumento de preço em que este bloco assenta. O Claude Opus 5.5 encabeça o Intelligence Index da Artificial Analysis com 57,6 na v4.3.2 e os seus dois quadros agênticos, e fá-lo a $4 / $20 contra os $5 / $25 do Claude Opus 5. O raciocínio que este bloco trazia, de que as equipas deviam começar pelo Opus 5 por custar metade dos modelos melhores, já não se aplica: o Opus 5.5 é ao mesmo tempo melhor e mais barato, por isso fica com a linha da programação proprietária e é o modelo sobre o qual construiríamos o trabalho diário. O GPT-5.6 mantém ainda assim a linha do assistente diário, porque essa linha é sobre alcance e não sobre pontuação, e nem o Opus 5.5 nem o GPT-6 Astra são a opção por omissão de centenas de milhões de pessoas. O Qwen3.8-Max-0902 da Alibaba (2 de setembro) mantém a linha da programação económica a $2 / $6, ainda que só exista na API da QwenCloud sem interface para consumidores. O GPT-6 Sol e o GPT-6 Luna aterraram a 22 de setembro exatamente na superfície de que trata este bloco: o ChatGPT Work e o Codex, para Plus, Pro, Business, Enterprise e Edu, a $2 / $10 e $0,10 / $0,50 na API, e não na janela de chat comum.

Comparação de preços

Preços dos modelos de IA em setembro de 2026

De escalões gratuitos a $0 até ao Google AI Ultra a $199,99 por mês. O preço mais consequente deste quadro é o Claude Opus 5.5 a $4 / $20, porque a 22 de setembro a Anthropic lançou o modelo com a pontuação mais alta que qualquer avaliador independente já mediu por um preço de tabela inferior ao do modelo que substitui: o Claude Opus 5 custa $5 / $25, e as leituras de cache descem 60 % para $0,20, com o número da própria Anthropic a colocar uma carga de trabalho típica 40 % mais barata do que no Opus 5. Isso inverte a forma que esta secção teve todo o ano, em que o melhor modelo era também o mais caro. O Claude Fable 5.1 e o GPT-6 Astra estão ambos a $10 / $50 e ambos pontuam agora abaixo. O Muse Spark 1.3 da Meta custa $1,25 / $4,25, sem alterações ao longo de três saltos de capacidade desde julho, com um escalão Contributor a $0,10 / $0,20 para quem aceitar que a Meta treine com os seus prompts, e tanto o Grok 4.6 como o Grok 4.7 estão a $2 / $6, com a ressalva de que um prompt de 200 000 tokens ou mais refatura o pedido inteiro a $4 / $12. O Grok 4.7 é o caso mais claro desta página de um preço que não se mexeu enquanto o custo se mexeu: os tokens custam o mesmo e uma tarefa do Intelligence Index custa $2,73 contra os $1,86 do Grok 4.6, porque o 4.7 emite cerca do dobro da saída para lá chegar. A ponta barata mexeu-se duas vezes. A DeepSeek subiu os dois modelos V4 cerca de quatro vezes a 16 de agosto, o que custou ao V4-Flash a escolha de relação preço-desempenho, e reverteu a maior parte a 10 de setembro: o V4-Flash foi retirado e o V4.1-Flash tomou o seu lugar a $0,15 / $0,60 fora de pico e $0,30 / $1,20 em pico. Entre os modelos que se compram ao token a escolha continua a ser o GLM 5.3 Flash, agora no seu preço de tabela simples de $0,15 / $0,50 desde que a promoção de lançamento expirou a 9 de setembro, porque a Artificial Analysis mede-o em $0,25 por tarefa do Intelligence Index com uma pontuação de 41,8 contra os $0,27 da DeepSeek com 39,5. Fora de pico os dois estão iguais na entrada e o GLM é mais barato na saída; em pico o GLM ganha nas duas. Um modelo aberto bate-os aos dois no custo por tarefa e tem quatro dias: o MiMo-V2.6-Pro da Xiaomi resolve uma tarefa do índice por $0,13 com uma pontuação de 46,3 sob MIT simples, mas é preciso alojar 1,02 biliões de parâmetros para isso. Na fronteira a escolha por valor é o Muse Spark 1.3 da Meta, a $1,60 por tarefa do índice com 48,1. Entre os modelos fechados o GPT-6 Luna ficou com esse título a 22 de setembro, a $0,10 / $0,50 ao token e $0,07 por tarefa do índice, o mais barato por tarefa de toda esta página; o GPT-6 Sol desceu da mesma forma, de $4 / $20 para $2 / $10, exatamente sobre o tarifário do Claude Sonnet 5, e a OpenAI diz que os dois cortes são permanentes e não promocionais. Para uma análise mais aprofundada, veja o nosso guia completo de comparação de preços de IA.

ModeloEntrada (por 1M)Saída (por 1M)ContextoAcesso grátis?
GPT-6 Astra$10.00$50.001 050 000 (entrada máx. 922 000)No Chat em Pro, Business e Enterprise desde 4 de setembro; o Plus tem-no no ChatGPT Work e no Codex, não no Chat; sem plano gratuito; ativo na API
GPT-6 Sol$2.00$10.001 050 000 (entrada máx. 922 000)ChatGPT Work e Codex em Plus, Pro, Business, Enterprise e Edu desde 22 de setembro; API; não no Chat
GPT-6 Luna$0.10$0.501 050 000 (entrada máx. 922 000)Free e Go na aplicação de computador do ChatGPT; ChatGPT Work e Codex nos planos pagos; API; não no Chat
GPT-5.5$5.00$30.001M (400K no Codex)ChatGPT Free; API paga
GPT-5.5 Pro$30.00$180.001MChatGPT Pro a partir de $100/mês (nível de maior utilização a $200)
GPT-5.6 Sol$4.00$20.00Não publicadoEm direto no ChatGPT, Codex & API (9 de julho); tarifa promocional pelo menos até 21 de novembro de 2026
GPT-5.6 Terra$2.00$12.00Não publicadoEm direto no ChatGPT, Codex & API (9 de julho)
GPT-5.6 Luna$0.20$1.20Não publicadoEm direto no ChatGPT, Codex & API (9 de julho)
Claude Opus 5.5$4.00$20.001MClaude Pro/Max/Team; API paga; leituras de cache $0,20
Claude Opus 5$5.00$25.001MPredefinição no Claude Pro/Max; API paga
Claude Opus 4.8$5.00$25.001MModelo legacy na Anthropic; Pro/Max/API
Claude Fable 5.1$10.00$50.001MLeituras de cache $0.25; no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos. O Mythos 5.1 fatura de forma idêntica, apenas por convite
Claude Fable 5$10.00$50.001MPermanente no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos
Claude Sonnet 5$2.00$10.001MPredefinição no Claude Free & Pro; API paga
Claude Sonnet 4.6$3.00$15.001MAPI paga (substituído pelo Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MAplicação Gemini limitada; API paga
Gemini 3.8 Flash$0.75 introdutório / $1.50 a partir de 1/1/2027$3.75 introdutório / $7.50 a partir de 1/1/20271MAI Studio, Antigravity, Gemini Enterprise + API paga; na aplicação Gemini reportado para AI Pro/Ultra
Gemini 3.7 Flash$0.75 introdutório / $1.50 a partir de 1/1/2027$3.75 introdutório / $7.50 a partir de 1/1/20271MAI Studio, Android Studio, Antigravity + API paga; na aplicação Gemini apenas via Spark (AI Pro/Ultra, exclui EEE/RU/CH/Nigéria)
Gemini 3.6 Flash$0.75 introdutório / $1.50 a partir de 1/1/2027$3.75 introdutório / $7.50 a partir de 1/1/20271MModelo predefinido da aplicação Gemini gratuita; AI Studio; nível API gratuito + API paga
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; nível API gratuito + API paga
Qwen3.8-Max-0902$2.00 ($0.17 cache hit explícito, $0.25 implícito)$6.001M (saída de 128K)Apenas API na QwenCloud; sem chat de consumo, sem pesos abertos
Qwen 3.7 Max$1.25 promo / $2.50 tabela$3.75 promo / $7.50 tabela1M200 pedidos grátis/dia; API paga para além disso
MiniMax M3$0.30 (50 % de desconto sobre $0.60)$1.20 (≤512K)1MOpen weights; custos de alojamento aplicáveis
LongCat-2.0Depende do fornecedorDepende do fornecedor1MOpen weights (MIT); custos de alojamento aplicáveis
NVIDIA Nemotron 3 UltraDepende do fornecedorDepende do fornecedor1MOpen weights (OpenMDW); custos de alojamento aplicáveis
Qwen 3.5 (open-weight)Auto-alojamento / TogetherAuto-alojamento / Together1MOpen weights; custos de alojamento aplicáveis
Nex-N2-ProAuto-alojamento / fornecedoresAuto-alojamento / fornecedores1MOpen weights (Apache 2.0); custos de alojamento aplicáveis
Rio 3.5 Open 397BAuto-alojamento / fornecedoresAuto-alojamento / fornecedores1MOpen weights (MIT); custos de alojamento aplicáveis
Grok 4.3$1.25$2.501MPlano de consumo gratuito; API paga
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI da SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Grok 4.7$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI da SpaceXAI, Cursor, Grok Build, harnesses e routers na nuvem; não na aplicação Grok
Muse Spark 1.3$1.25 ($0.10 nível Contributor)$4.25 ($0.20 nível Contributor)1MAPI paga; Muse Code, Meta Model API e OpenRouter; o nível Contributor troca direitos de treino por um desconto de ~92 %
Kimi K3$3.00 ($0.30 cache-hit)$15.001MNível básico gratuito na aplicação Kimi; open weights no Hugging Face (Kimi K3 License)
Gemini Omni Flash (vídeo)$1.50$17.50 (saída de vídeo)Clips de 10 segundosAplicação Gemini / Flow; AI Studio + API
DeepSeek V4-Pro$0.66 fora de ponta / $1.32 em ponta ($0.022 cache-hit fora de ponta)$1.98 fora de ponta / $3.96 em ponta1MDeepSeek Chat grátis; API paga, preços de ponta e fora de ponta desde 16 de agosto
DeepSeek V4.1-Flash$0.15 fora de ponta / $0.30 em ponta ($0.003 acerto de cache fora de ponta)$0.60 fora de ponta / $1.20 em ponta1MDeepSeek Chat gratuito; API paga, tarifas fora de ponta e em ponta; substituiu o V4-Flash a 10 de setembro
Kimi K2.7 CodeDepende do fornecedorDepende do fornecedor256KOpen weights; custos de alojamento aplicáveis
GLM-5.2Depende do fornecedorDepende do fornecedor1MOpen weights; custos de alojamento aplicáveis
GLM 5.3$1.40 ($0.26 cache-hit)$4.401MAPI da Z.ai, GLM Coding Plan e ZCode; pesos no Hugging Face desde 28 de agosto sob a licença própria GLM 5.3 License
GLM 5.3 Flash$0.15 ($0.03 cache-hit); $0.075 em promoção$0.50; $0.25 em promoção1MAPI da Z.ai, GLM Coding Plan, OpenRouter; pesos MIT no Hugging Face; promoção acaba a 9 de setembro
Tencent Hy4 Preview$0.834 ($0.042 cache-hit)$2.5011M+Pesos abertos (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextDepende do fornecedorDepende do fornecedor262K (até 1M)Pesos abertos (Qwen Community License 1.0); acrescem custos de alojamento
MiMo-V2.6-Pro$0.435$0.871MPesos abertos (MIT); os custos de alojamento aplicam-se
ERNIE 5.1Preço para a região ChinaPreço para a região China256KNível gratuito da Baidu
Gemini Spark (agente)Sem preço de APISem preço de API1M (base Gemini)Google AI Pro $19.99, AI Ultra $99.99 ou $199.99/mês
Fello AI (agregador)Encaminhado pela aplicaçãoEncaminhado pela aplicaçãoDepende do modelo$9.99/mês, versão gratuita disponível

As tarifas do GPT-5.5 e GPT-5.5 Pro acima são preços de contexto curto; a OpenAI já não publica os números específicos de contexto longo. Os níveis GPT-5.6 são faturados a 2x a entrada e 1,5x a saída assim que um prompt ultrapassa os 272K tokens de entrada, o que coloca o Terra de contexto longo em $4 / $18 e o Luna em $0.40 / $1.80. Para os níveis GPT-6 a OpenAI não publica sobretaxa de contexto longo, e as suas leituras de cache ficam 90 % mais baratas: $1.00 no Astra, $0.20 no Sol e $0.01 no Luna. O Grok 4.6 funciona da mesma forma, mas morde com mais força: a partir de 200 000 tokens de prompt, a SpaceXAI volta a faturar o pedido inteiro à taxa mais alta em vez de apenas o excedente, pelo que ultrapassar o limite por mil tokens duplica o custo de toda a chamada. A outra tabela que convém ler duas vezes é a da DeepSeek: desde 16 de agosto, os seus dois modelos V4 são faturados ao preço de ponta das 01:00 às 04:00 e das 06:00 às 10:00 UTC nos dias úteis, e a exatamente metade em qualquer outra hora, pelo que a mesma tarefa pode custar o dobro consoante a hora a que a executar. Se quiser acesso a vários modelos de IA sem gerir subscrições separadas, o Fello AI disponibiliza GPT, Claude, Gemini, Grok, Perplexity e mais numa única aplicação para Mac, iPhone e iPad a partir de $9.99/mês.

Modelos open-weight

Melhores modelos open-weight em setembro de 2026

O melhor modelo de pesos abertos em setembro de 2026 é o MiMo-V2.6-Pro, que a Xiaomi publicou a 21 de setembro sob MIT simples: 1,02 biliões de parâmetros com 42 mil milhões ativos, contexto de 1M de tokens e os pesos no Hugging Face no próprio dia. A Artificial Analysis mede-o em 46,3 no Intelligence Index v4.3.2, a maior pontuação aberta que alguma vez publicou, acima do GLM-5.3 com 44,8 e do Kimi K3 com 43,6, e fá-lo a $0,13 por tarefa do Intelligence Index, mais barato do que qualquer outro modelo aberto desta página. Consegue também 34,8 % no Terminal-Bench 4.0 e 1673 no GDPval-AA v2.1, o que o coloca acima do Kimi K3 nos dois. Dois limites honestos: nenhum quadro da Arena o avaliou, por isso não há qualquer prova de preferência humana sobre ele, e foi publicado há quatro dias, pelo que não tem histórico independente. O Kimi K3 continua a ser o modelo aberto mais bem colocado na Arena, sétimo no WebDev com 1658 e quinto no sinal de conclusão de tarefas da Agent Arena, e o GLM-5.3 continua a ser o modelo aberto mais forte no Terminal-Bench 4.0 da Artificial Analysis com 41,9 % contra os 34,8 % do MiMo, sob uma licença própria da Z.ai e não MIT. A recomendação prática para equipas que alojam os seus próprios pesos continua a ser o GLM 5.3 Flash (Z.ai, MIT), lançado a 26 de agosto e com 41,8 na v4.3.2, 320 mil milhões no total com 18 mil milhões ativos, porque um modelo de 1,02 biliões de parâmetros não é coisa para uma estação de trabalho e o descarregamento do K3 são 96 fragmentos safetensors e cerca de 1,56 TB. O patamar aberto barato mudou outra vez a 10 de setembro: a DeepSeek retirou o V4-Flash 0731 e substituiu-o pelo DeepSeek-V4.1-Flash, 552 mil milhões com 8 mil milhões ativos no prefill e 16 mil milhões na descodificação, nativamente multimodal, sob MIT no próprio dia, com 39,5 na v4.3.2 contra 34,3 da versão que substitui, e com o preço de volta a $0,15 / $0,60 fora de pico. É também terceiro no sinal de conclusão de tarefas da Agent Arena, o modelo aberto mais bem colocado ali. Dos três lançamentos que fecharam agosto, o GLM 5.3 publicou os seus pesos a 28 de agosto sob uma licença própria com uma cláusula que obriga qualquer operador de model-as-a-service acima de 10 mil milhões de dólares de receita a passar primeiro uma revisão de segurança da Z.ai; o Qwen3.8-Flash-Next da Alibaba, uma mistura de especialistas de 125 mil milhões com apenas 6 mil milhões ativos que antecipa a arquitetura Qwen4, pontua 39,8 e é nono no quadro WebDev da Arena; e o Hy4 Preview da Tencent, 770 mil milhões no total e 49 mil milhões ativos sob Apache 2.0, não tem avaliação da Artificial Analysis mas está em 11.º no Arena WebDev com 1624. Note também que o GLM 5.3 Flash não é um GLM 5.3 reduzido mas um modelo separado sobre uma base treinada de novo, e foi por isso que pôde sair sob MIT simples enquanto o topo de gama não pôde.

ModeloMelhor paraBenchmark-chaveContexto / LicençaOnde executar
MiMo-V2.6-ProO maior Intelligence Index aberto alguma vez medidoII 46,3 (v4.3.2), acima do GLM-5.3 e do Kimi K3, a $0,13 por tarefa do índice; 34,8 % Terminal-Bench 4.0; GDPval-AA v2.1 1673; 1,02 biliões/42 mil milhões ativos1M / MITHugging Face (XiaomiMiMo), fornecedores, alojamento próprio
Kimi K3Modelo aberto mais bem colocado na ArenaII 43,6 (v4.3.2); #5 Arena WebDev, a melhor posição aberta; #5 Agent Arena; 2.8T/104B ativos1M / Kimi K3 LicenseHugging Face (96 shards, 1.56 TB), Moonshot API, fornecedores
GLM 5.3 FlashMelhor modelo aberto que a maioria das equipas consegue mesmo executarII 41,8 (v4.3.2), na fronteira de Pareto entre inteligência e custo, a cerca de $0.25 por tarefa do índice; 320B/18B ativos, nativamente multimodal1M / MITHugging Face, API da Z.ai ($0.15/$0.50), OpenRouter
GLM-5.2Recurso com historial independenteII 33,7 (v4.3.2); #19 Arena WebDev (1,591.8), #17 Agent Arena; 744B/40B ativos1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Aberto desde 28 de agosto, mas com licença própriaII 44,8 (v4.3.2), a pontuação aberta mais alta que encontrámos; mesma base de 744B do GLM-5.2, apenas pós-treinada, checkpoint publicado contado em 753B; CyberGym 84,5 % e Terminal-Bench 3.0 28,3 (números do fabricante)1M / GLM 5.3 License (model-as-a-service acima de 10 mil milhões USD de receita precisa de revisão de segurança da Z.ai)Hugging Face, API da Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4.1-FlashMelhor relação qualidade-preço aberta se o alojar por conta própriaII 39,5 (v4.3.2) contra 34,3 da versão V4-Flash 0731 que substitui; 552B, 8B ativos no prefill e 16B na descodificação1M / MITDeepSeek API ($0.15/$0.60 fora de ponta, $0.30/$1.20 em ponta desde 10 de setembro), local
Tencent Hy4 PreviewMaior modelo com licença permissiva até agora770B/49B ativos; 2,99/4,00 no painel próprio da Tencent com 203 tarefas contra 2,94 do Kimi K3 e 2,92 do GLM 5.3 (fabricante); sem classificação da Artificial Analysis; #11 Arena WebDev (1624)1M+ / Apache 2.0Hugging Face (BF16 e FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextAntevisão da arquitetura Qwen4125B no total mais um embedding de N-gramas de 51B, 6B ativos; 91,7 GPQA Diamond e 62,5 SWE-Bench Pro (fabricante); II 39,8 (v4.3.2); #9 Arena WebDev (1635)262K a 1M / Qwen Community License 1.0Hugging Face, fornecedores, auto-alojamento
LongCat-2.0Programador aberto frontier treinado em chips chinesesII 33 (v4.1); 59,5 % SWE-Bench Pro (fornecedor), 1.6T/~48B ativos1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Multimodal de classe frontier baratoII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / licença por definirHugging Face, API $0.30/1M (50 % de desconto)
Nex-N2-ProPontuação de programação aberta mais forteII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B ativosBaseado em Qwen / Apache 2.0Hugging Face, fornecedores, auto-alojamento
Kimi K2.7 CodeProgramador aberto com licença comercial mais forte+21,8 % no Kimi Code Bench v2 vs K2.6 (fornecedor); 1T/32B ativos256K / Modified MITHugging Face, DeepInfra, fornecedores
DeepSeek V4-ProTrabalho agêntico em condições reaisII 44 (v4.1), 1.6T/49B ativos1M / MITDeepSeek API ($0.66/$1.98 fora de pico, $1.32/$3.96 em pico desde 16 de agosto), local
Hy3O mais recente participante com licença permissivaII 41 (v4.1); #22 na Arena WebDev (1,516.4)Apache 2.0Hugging Face, fornecedores, auto-alojamento
InklingPrimeiro modelo open-weight da Thinking MachinesII 41 (v4.1), agêntico 32,3, lançado a 15 de julhoOpen weightsHugging Face, fornecedores, auto-alojamento
Inkling SmallMesma família a um quarto do tamanhoII 40 (v4.1), agêntico 30,8; 276B/12B ativos, entrada de texto, imagem e áudioApache 2.0Hugging Face (BF16 e NVFP4), fornecedores, auto-alojamento
NVIDIA Nemotron 3 UltraAfinado pela NVIDIA, licença totalmente permissivaII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B ativos1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 auto-alojamento)
Qwen 3.5 (397B / 17B ativos)Multimodal, descodificação rápida88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / abertoTogether, OpenRouter, local
Qwen3.6-35B-A3BProgramador agêntico aberto eficiente (3B ativos)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B ativos262K (até 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, local
Qwen3.6-27BProgramador denso executável em portátil87,8 GPQA Diamond, denso 27B, multimodal256K / Apache 2.0Local Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune de Qwen 3.5, raciocínio multilíngue70,8 Terminal-Bench 2.1 (first-party), bate o Qwen 3.7 Plus em 4/5397B/17B ativos / MITHugging Face, fornecedores, auto-alojamento
Llama 4 MaverickModelo de topo da linha Meta17B ativos / 400B de parâmetros no totalLlama 4 licenseCloud da Meta, Hugging Face, local
NVIDIA Nemotron 3 Nano OmniEdge / baixo consumoMultimodal, pegada muito reduzidaCompacto / abertoLocal, ferramenta NVIDIA

Aqui a licença importa tanto como a pontuação bruta, e agosto alargou a distância entre os dois grupos. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) e Nemotron 3 Ultra (OpenMDW) permitem todos claramente a utilização comercial sem qualquer teste de receita. Os restantes trazem condições que convém ler antes de construir sobre eles: o MiniMax M3 e o MiniMax H3 chegam sob as suas próprias licenças comunitárias, exigindo o H3 ainda um pedido a partir dos EUA, da UE, do Reino Unido e da Coreia do Sul; o Kimi K3 assenta numa licença própria com um limiar de receita para quem o revenda como serviço; o GLM 5.3 exige uma revisão de segurança da Z.ai a qualquer operador de model-as-a-service acima de 10 mil milhões de dólares de receita; e a Qwen Community License 1.0 do Qwen3.8-Flash-Next exige uma licença à parte da Qwen para explorar um negócio de model-as-a-service ou de assistente de trabalho com IA, embora o uso interno esteja isento. Nenhum modelo open-weight é já o primeiro em qualquer quadro da Arena que seguimos: o Claude Opus 5 arrebatou o quadro Agent em julho, o último que um modelo open-weight liderou.

Como avaliamos

Benchmarks, preços e utilização prática

Cada classificação desta página combina três entradas: benchmarks públicos de sete casas independentes (Artificial Analysis, Arena antiga LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize e o quadro oficial Terminal-Bench 4.0, cobrindo o Intelligence Index, GPQA Diamond, ARC-AGI-1 a 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas e o Remote Labor Index), preços de API e subscrição publicados na página de preços oficial de cada fornecedor, e utilização prática pela equipa editorial da FelloAI que executa prompts reais sobre a mesma tarefa em cada modelo. Voltamos a obter as fontes oficiais de preços e benchmarks antes de cada atualização mensal.

Os benchmarks são ponderados consoante o caso de utilização: o SWE-bench e o Terminal-Bench impulsionam a programação, o GPQA Diamond e o ARC-AGI-2 impulsionam a precisão, o GDPval-AA (o benchmark de entregáveis profissionais da Artificial Analysis) informa a qualidade das tarefas profissionais ao passo que o estilo de escrita é avaliado sobretudo por testes práticos, o FrontierMath e o HMMT impulsionam a resolução de problemas. Revelamos quando um benchmark é reportado pelo fornecedor mas não verificado de forma independente, e descartamos qualquer afirmação que não conseguimos reproduzir contra uma fonte em direto. Classificamos por pontuações medidas: a coroa de uma categoria muda assim que um modelo supera o detentor nos quadros que definem essa categoria, sem esperar pelos quadros baseados em votos, e um modelo que ainda não está amplamente disponível é assinalado no seu cartão em vez de ficar sem ele. Reverificamos as posições tanto como os números, porque uma pontuação pode continuar correta enquanto o quadro à sua volta se move. Quando um modelo passa por uma atualização importante entre atualizações, reclassificamos a categoria e acrescentamos uma linha «O que mudou este mês» no fundo da análise aprofundada.

Fello AI a funcionar no Mac, iPhone e iPad
Não sabe qual modelo escolher?

O Fello AI reúne os melhores modelos de IA numa aplicação nativa e leve.

Alterne entre eles a qualquer momento, sem subscrições separadas.

Descarregar Fello AI
Perguntas frequentes

Perguntas comuns

Qual é o melhor modelo de IA neste momento em setembro de 2026?
Depende da tarefa, mas um modelo lidera agora mais quadros do que qualquer outro. Na pontuação global, o Claude Opus 5.5 (22 de setembro) é o #1 do Intelligence Index da Artificial Analysis com 57,6 na v4.3.2, 4,3 pontos à frente do Claude Fable 5.1, e lidera também o GDPval-AA v2.1 com 1846, o AA-Briefcase v1.1 com 1822 e o Humanity's Last Exam com 61,4 %, a $4 / $20 por 1M de tokens. Para programação, o Opus 5.5 lidera o Terminal-Bench 4.0 da Artificial Analysis com 59,6 % e os dois quadros de programação do LiveBench, enquanto o GPT-6 Astra mantém os dois quadros de programação da Arena por o Opus 5.5 ainda não ter votos lá. Para conversa diária, o GPT-5.6 é a predefinição do ChatGPT desde 9 de julho e é o assistente que mais gente consegue mesmo abrir, embora o Claude Fable 5 lidere o quadro de texto da Arena. Para escrita, o Claude Fable 5.1 é o único modelo entre os seis primeiros dos três quadros de prosa. Para precisão, o Claude Fable 5.1 mantém a maior precisão factual medida pela Artificial Analysis, 67 % no AA-Omniscience, um ponto acima do Opus 5.5. Para matemática difícil e raciocínio, o GPT-6 Astra lidera o LiveBench Reasoning e o ARC-AGI-2. Para imagens, o ChatGPT Images 2.5 lidera os quatro quadros que acompanhamos, e para vídeo o Gemini Omni 1.1 Flash lidera o texto para vídeo da Arena. Para agentes, o Gemini Spark é o agente na nuvem 24/7 e o Claude Cowork o do computador. Entre os pesos abertos, o MiMo-V2.6-Pro da Xiaomi pontua 46,3 sob MIT simples a $0,13 por tarefa do índice. A OpenAI cortou para metade os preços de API dos seus níveis intermédios a 22 de setembro, o que faz do GPT-6 Luna, com $0.07, o modelo mais barato por tarefa do Intelligence Index desta página.
O GPT-6 já saiu e é agora o melhor modelo?
O GPT-6 saiu. A OpenAI lançou-o como GPT-6 Astra a 3 de setembro de 2026, o que resolve a pergunta de um ano sobre se o Astra sairia como GPT-6 ou como mais uma versão intermédia do GPT-5. Não é o melhor modelo nos quadros independentes, e a 22 de setembro caiu mais. A Artificial Analysis dá-lhe 52,7 no Intelligence Index v4.3.2, 5,7 pontos à frente do GPT-5.6 Sol mas 0,7 atrás do Claude Fable 5.1 com 53,4 e 4,9 atrás do Claude Opus 5.5 com 57,6, cobrando $10 / $50 por 1M de tokens contra os $4 / $20 do Sol e do Opus 5.5. A programação era o seu argumento mais forte e está agora repartida: o Astra levou o Terminal-Bench 4.0 da Artificial Analysis com 59,1 % e segurou-o até o Opus 5.5 passar com 59,6 %, uma margem dentro das barras de erro do próprio benchmark, enquanto o Astra mantém os dois quadros de programação da Arena por o Opus 5.5 ainda não ter votos lá. Reduz também grosso modo para metade a alucinação no AA-Omniscience, dos 92 % do Sol para 51 % em esforço máximo, e continua a ganhar o AutomationBench da Zapier e o Terminal-Bench-Science 0.1 frente ao Opus 5.5. Precisa de um plano pago: o Astra é o primeiro modelo que a OpenAI classificou como Critical em cibersegurança, por isso os defensores aprovados do seu programa Daybreak receberam-no primeiro, com o ChatGPT Business e Pro a 4 de setembro e o Plus umas horas depois, e nada foi anunciado para o escalão gratuito. A nossa análise completa do GPT-6 Astra cobre os benchmarks e as ressalvas. A família cresceu a 22 de setembro com o GPT-6 Sol a $2 / $10 e o GPT-6 Luna a $0,10 / $0,50, que a Artificial Analysis pontua com 47,5 e 37,3 contra os 52,7 do Astra. Ambos estão no ChatGPT Work, no Codex e na API, e a OpenAI diz que nenhum está ainda no Chat; o resto está na nossa análise do GPT-6 Sol e Luna.
O que é o Claude Opus 5?
O Claude Opus 5 é o modelo de topo da Anthropic de 24 de julho de 2026, e foi o modelo #1 na Artificial Analysis até o Claude Fable 5.1 chegar a 1 de setembro. Está agora em terceiro no Intelligence Index com 50,8, contra os 53,4 do Claude Fable 5.1 e os 52,7 do GPT-6 Astra, em segundo no AA-Briefcase com 1673 contra 1678, e com esforço max lidera mesmo o quadro GDPval-AA v2.1 de entregáveis profissionais com 1708 contra os 1735 do Fable 5.1, com intervalos de confiança sobrepostos, ainda bem à frente dos 1695 do Grok 4.7 e dos 1632 do Claude Fable 5. O preço da API é de $5 / $25 por 1M de tokens, o mesmo que o Opus 4.8 e metade do custo do Fable 5, com uma janela de contexto de 1M de tokens e uma data de corte de conhecimento de maio de 2026. A ARC Prize confirma de forma independente a afirmação de lançamento da Anthropic sobre o ARC-AGI-3, onde o Opus 5 pontua 30 % contra 8 % do modelo seguinte, cerca de 3,75x. A Arena coloca-o agora em terceiro nos dois quadros de programação, atrás do GPT-6 Astra e do Claude Fable 5.1, em primeiro no Document, em quarto no sinal de cumprimento de tarefas da Agent Arena e em décimo no texto. Uma coisa a ter em conta: a Artificial Analysis mede a sua taxa de alucinação em 50 %, razão pela qual não detém nenhuma coroa de precisão nesta página.
O que é o Claude Fable 5.1?
O Claude Fable 5.1 é o lançamento da Anthropic de 1 de setembro de 2026 e o modelo mais bem pontuado que a Artificial Analysis alguma vez mediu, com 53,4 no seu Intelligence Index v4.3.2 em effort max e primeiro no AA-Briefcase com 1678. Saiu ao lado do Claude Mythos 5.1, que é o mesmo modelo com as salvaguardas em biologia e cibersegurança aliviadas, disponível apenas por convite e sem critérios de elegibilidade publicados. O preço é de $10 / $50 por 1M de tokens, inalterado face ao Fable 5, mas as leituras de cache descem 75 % para $0.25, numa janela de contexto de 1M de tokens e com data de corte de conhecimento de junho de 2026. Está incluído no Claude Max e Team Premium a cerca de 50 % dos limites semanais e é alcançável a partir do Pro através de créditos. A Anthropic continua a recomendar começar pelo Claude Opus 5 para a maioria das cargas, uma vez que custa metade e corre mais depressa. A nossa análise completa do Claude Fable 5.1 e do Mythos 5.1 cobre o system card e a divisão das salvaguardas.
O Claude Fable 5 está de volta?
Sim. A Anthropic voltou a implementar o Claude Fable 5 a 1 de julho de 2026 depois de o governo dos EUA ter levantado a restrição de controlo de exportações que impusera a 12 de junho. Está de novo disponível na Claude API, no Claude.ai, no Claude Code e no Claude Cowork. A Anthropic tornou o Fable 5 permanente nos planos pagos a 20 de julho de 2026. O Max e o Team Premium incluem-no a cerca de 50 % dos limites de utilização habituais; o Pro e o Team Standard alcançam-no através de créditos de utilização com um crédito inicial único de $100. O preço da API é de $10 / $50 por milhão de tokens. O Fable 5 é um modelo de classe Mythos construído para trabalho agêntico de longo horizonte com um contexto de 1M de tokens, e é o segundo para programação atrás do Claude Opus 5, em #2 no quadro image-to-WebDev da Arena (1,625.7) e #4 no WebDev.
O que é o GPT-5.6 e posso utilizá-lo?
Sim, desde 9 de julho de 2026. O GPT-5.6 é a família de modelos de nova geração da OpenAI, e após uma pré-visualização fechada de duas semanas que começou a 26 de junho por trás de uma revisão de segurança do governo dos EUA, atingiu a disponibilidade geral a 9 de julho. Há três níveis, do menos ao mais capaz: Luna, o nível rápido e mais barato ($0.20 / $1.20 por 1M de tokens); Terra, um modelo equilibrado para o dia a dia que a OpenAI diz igualar o GPT-5.5 ($2 / $12); e Sol, o modelo de topo afinado para biologia, química e cibersegurança ($4 / $20). A OpenAI reduziu o Luna em 80 % e o Terra em 20 % a 30 de julho de 2026 e deixou o Sol intacto, e depois reduziu o Sol em mais de 20 % a 21 de agosto de 2026, uma taxa promocional de cerca de três meses. Nenhum preço de subscrição do ChatGPT mudou. Está agora em direto no ChatGPT, Codex e na API como modelo predefinido da OpenAI. Uma ressalva: o system card da OpenAI e o avaliador externo METR assinalaram um comportamento de «scheming» elevado no Sol, pelo que o trate com cuidado para trabalho factual de alto risco até os resultados independentes assentarem. Uma nota de nomes desde 22 de setembro: a OpenAI reutilizou Sol e Luna para a geração GPT-6, por isso um «Sol» ou «Luna» sem versão é agora ambíguo. O GPT-6 Sol custa $2 / $10 e o GPT-6 Luna $0,10 / $0,50, contra $4 / $20 e $0,20 / $1,20 dos níveis 5.6, que a OpenAI continua a vender.
O Grok 4.7 já saiu?
Sim. A SpaceXAI lançou o Grok 4.7 a 21 de setembro de 2026, substituindo o Grok 4.6 como topo de gama. Ao contrário do 4.6, que era um pós-treino da mesma base, o 4.7 usa um modelo base novo e maior, treinado com uma campanha mais longa de aprendizagem por reforço orientada para trabalhos de muitas horas; a SpaceXAI não publica contagem de parâmetros. A Artificial Analysis dá-lhe 46,3 no Intelligence Index v4.3.2 em esforço alto contra os 44,3 do Grok 4.6, e nos dois quadros agênticos fica acima do GPT-6 Astra, 1695 contra 1542 no GDPval-AA v2.1 e 1657 contra 1569 no AA-Briefcase v1.1. O preço não muda, $2 / $6 por 1M de tokens numa janela de 500K, ainda que prompts de 200 000 tokens ou mais refaturem o pedido inteiro a $4 / $12, e uma variante rápida corre ao dobro da velocidade de saída pelo dobro do preço. O custo por tarefa do Intelligence Index mexeu-se, de $1,86 para $2,73, porque o 4.7 emite cerca do dobro dos tokens de saída. Está ativo na API do Grok, no Cursor, no Grok Build, em harnesses de programação de terceiros e em routers na nuvem. O anúncio da SpaceXAI nada diz sobre a aplicação Grok para consumidores, que a $30 por mês continua a servir o Grok 4.6. O Grok é também a nossa escolha para criatividade, por razões de produto e não pela qualidade da prosa; para o melhor texto escrito ganha o Claude Fable 5 de forma clara. Todos os números estão na nossa análise do Grok 4.7.
Qual é a melhor IA para programar?
O Claude Opus 5.5 é o melhor para programar desde que a Anthropic o lançou a 22 de setembro. Lidera a própria campanha de Terminal-Bench 4.0 da Artificial Analysis com 59,6 % contra os 59,1 % do GPT-6 Astra, o LiveBench Coding com 89,3 contra 80,4 e o LiveBench Agentic Coding com 71,7 contra 57,3, e fá-lo a $4 / $20 por 1M de tokens contra os $10 / $50 do Astra. No harness da própria Anthropic a distância é maior, 66,4 % no Terminal-Bench 4.0 contra os 57,9 % que a OpenAI reporta para o Astra, a par de 54,4 % no FrontierCode v1.1 e 57,8 % no CursorBench 4.0. O GPT-6 Astra é o segundo e mantém os dois quadros de programação da Arena, WebDev com 1793 e imagem para WebDev com 1733, porque o Opus 5.5 ainda não tem votos lá, por isso a leitura honesta é que a OpenAI lidera na preferência humana e a Anthropic em todos os harnesses medidos. Trate a margem de meio ponto no Terminal-Bench como um empate, porque a Anthropic reporta nele um erro padrão de cerca de 2,6 pontos. O Claude Fable 5.1 é terceiro. Entre os pesos abertos, o GLM-5.3 é o mais forte no Terminal-Bench 4.0 com 41,9 % e o Kimi K3 é o modelo aberto mais bem colocado no Arena WebDev, em sétimo, enquanto o GLM 5.3 Flash é o que a maioria das equipas consegue alojar, a $0,25 por tarefa do índice sob MIT simples. A Artificial Analysis retirou tanto o seu Coding Index como o Coding Agent Index.
Qual é a melhor IA para escrever?
O Claude Fable 5.1 é o melhor para escrever, encabeça o Humanity's Last Exam com 59,1 % e o quadro de entregáveis profissionais GDPval-AA v2.1. O Claude Fable 5 é a escolha se valorizar os votos humanos: continua a liderar a Arena escrita criativa e o LiveBench Language (90.7), mas está agora em #8 no EQ-Bench Creative Writing v3. Custa $10 / $50 por 1M de tokens. O Claude Sonnet 5 é a escolha de relação qualidade-preço e o que a maioria das pessoas deveria realmente utilizar, uma vez que é grátis e predefinido no claude.ai a $2 / $10, um preço de lançamento que a Anthropic tornou permanente em agosto de 2026, embora se classifique em #53 na Arena escrita criativa. O Kimi K3 é quarto no EQ-Bench com 2070.6 se quiser ficção distintiva, o Claude Fable 5.1 encabeça o quadro GDPval-AA v2.1 de entregáveis profissionais com 1846, com o Claude Opus 5 em segundo com 1735, o GPT-5.5 é a alternativa para escrita empresarial ancorada em factos, e o Gemini 3.8 Flash é a escolha de relação preço-desempenho para conteúdo em massa.
Qual é o melhor modelo de IA open-weight em 2026?
O MiMo-V2.6-Pro da Xiaomi, publicado a 21 de setembro de 2026 sob MIT simples. A Artificial Analysis mede-o em 46,3 no Intelligence Index v4.3.2, a maior pontuação aberta que alguma vez publicou, acima do GLM-5.3 com 44,8 e do Kimi K3 com 43,6, e resolve uma tarefa do índice por $0,13, mais barato do que qualquer outro modelo aberto desta página. É uma mistura de especialistas de 1,02 biliões de parâmetros com 42 mil milhões ativos, contexto de 1M de tokens e os pesos no Hugging Face desde o primeiro dia. Duas ressalvas: nenhum quadro da Arena o avaliou, por isso não há qualquer prova de preferência humana, e tem quatro dias. O Kimi K3 continua a ser o modelo aberto mais bem colocado na Arena, sétimo no WebDev e quinto no sinal de conclusão de tarefas da Agent Arena, e o GLM-5.3 continua a ser o modelo aberto mais forte no Terminal-Bench 4.0 da Artificial Analysis com 41,9 %, sob uma licença própria da Z.ai e não MIT. Para equipas que querem mesmo alojar o seu, o GLM 5.3 Flash (Z.ai, MIT) continua a ser a recomendação prática, com 41,8 no índice e 320 mil milhões no total com 18 mil milhões ativos, porque um modelo de 1,02 biliões de parâmetros precisa de um cluster e o descarregamento do Kimi K3 são 96 fragmentos e cerca de 1,56 TB.
Qual é o modelo de IA de classe frontier mais barato?
No preço de API por milhão de tokens, o GPT-6 Luna é o modelo fechado de classe fronteira mais barato a $0.10 / $0.50, depois do corte para metade da OpenAI a 22 de setembro de 2026, e a Artificial Analysis pontua-o com 37,3 no seu índice v4.3.2 contra os 34,0 do Gemini 3.6 Flash. Entre os pesos abertos continua a mandar o GLM 5.3 Flash, a nossa escolha de relação preço-desempenho desde agosto, agora no seu preço de tabela simples de $0.15 / $0.50 desde que a promoção de lançamento terminou a 9 de setembro, com 41,8 sob uma licença MIT simples que pode alojar por conta própria. A DeepSeek deteve essa escolha até subir as tarifas cerca de quatro vezes a 16 de agosto, e esteve perto de a recuperar a 10 de setembro, quando o V4.1-Flash substituiu o V4-Flash a $0.15 / $0.60 fora de ponta e $0.30 / $1.20 em ponta: fora de ponta os dois empatam agora na entrada, com o GLM mais barato na saída. A Artificial Analysis continua a separá-los no custo por tarefa do índice, $0.25 para o GLM contra $0.27 para a DeepSeek. O escalão barato da Google melhorou outra vez a 2 de setembro, com o Gemini 3.8 Flash a marcar 40,9 pelo mesmo preço introdutório de $0.75 / $3.75, ainda que essa tarifa duplique a 1 de janeiro de 2027. O MiniMax M3 está a $0.30 por milhão de tokens de entrada com um desconto permanente de 50 %, com o LongCat-2.0 como alternativa MIT sólida. Medido por tarefa do Intelligence Index em vez de por token, o modelo mais barato desta página é o GPT-6 Luna com $0.07, à frente do GPT-5.6 Luna com $0.18 e do MiMo-V2.6-Pro aberto com $0.13.
Que modelos de IA são grátis?
O ChatGPT Free usa agora o GPT-5.6 por predefinição (com o GPT-5.5 ainda disponível) sob limites de utilização. Os utilizadores Free e Go chegam também ao GPT-6 Luna na aplicação de computador do ChatGPT desde 22 de setembro. O Gemini Free faz correr o Gemini 3.6 Flash na aplicação Gemini e no Google AI Studio. O Claude Free faz correr o Claude Sonnet 5 (a nova predefinição) com limites diários. O DeepSeek Chat faz correr o DeepSeek V4 grátis no site da DeepSeek. O Grok tem um plano de consumo gratuito limitado (o X Premium é um extra pago). O Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash, MiMo-V2.6-Pro e o Hy4 Preview da Tencent são open-weight e grátis para auto-alojar, embora as licenças difiram e apenas alguns sejam MIT ou Apache puros. O Qwen 3.7 Max é apenas API sem front-end de chat de consumo, mas a Alibaba inclui agora 200 pedidos de modelo grátis por dia. O Kimi tem um nível básico gratuito na sua aplicação, com a utilização agêntica mais intensa medida.
O que é o Gemini Spark e de que plano precisa?
O Gemini Spark é o primeiro agente de IA da Google residente na cloud 24/7, lançado na Google I/O a 19 de maio de 2026 e já não é exclusivo do Ultra: desde 30 de julho de 2026 chega também ao nível Google AI Pro de $19.99/mês, nos EUA e em mais de 160 outros países, enquanto o Google AI Ultra a $99.99 ou $199.99/mês leva o lançamento global mais amplo. O Google AI Plus, o nível gratuito e as contas de trabalho ou escolares não o incluem. O Spark é construído sobre os modelos base Gemini com o harness Antigravity da Google numa VM da Google Cloud, integra-se com o Gmail, o Google Docs e outras aplicações do Google Workspace, e consegue interagir com o Chrome e o sistema Halo do Android do lado do dispositivo. Vale o gasto para utilizadores que têm fluxos repetíveis de longa duração (triagem da caixa de entrada, sínteses de investigação, tarefas agendadas). Para tarefas pontuais, o Claude Cowork a $20/mês cobre a maioria das necessidades de agente de ambiente de trabalho.
O que é o Fello AI?
O Fello AI é um chatbot de IA para Mac, iPhone e iPad que lhe permite utilizar todos os melhores modelos de IA como o ChatGPT, Claude, Gemini, Grok e DeepSeek numa única aplicação, com modelos atualizados regularmente para que tenha sempre os mais recentes. Custa $9.99/mês com uma avaliação de 4,7 estrelas ao longo de mais de 27 000 críticas.
Com que frequência atualizam esta página?
Atualizamos esta página pelo menos uma vez por mês e no prazo de 24-48 horas após o lançamento de qualquer modelo importante.
Artigos relacionados
Claude vs ChatGPT: qual a IA que é realmente melhor em 2026?

O Claude atingiu o #1 na App Store no início de 2026, empurrando o ChatGPT para fora do primeiro lugar pela primeira vez. O catalisador foi a recusa pública da Anthropic em ceder à exigência do Pentágono de implementar os seus modelos para armas autónomas.

Ler mais →
Grok vs ChatGPT: qual o chatbot de IA que é realmente melhor em 2026?

Os dois chatbots continuam a mexer-se. O ChatGPT corre o GPT-5.6 (níveis Sol, Terra, Luna) e o topo de gama da SpaceXAI é agora o Grok 4.7, a versão de 21 de setembro que pontua 46,3 no Intelligence Index a $2 / $6, embora a aplicação Grok continue a servir o 4.6.

Ler mais →
ChatGPT vs Gemini em 2026: qual a IA que deve realmente utilizar?

O ChatGPT mudou para o GPT-5.6 como modelo de topo, enquanto o Gemini 3.1 Pro continua a ser o modelo de topo pago da Google. Frente a frente em escrita, programação, imagens e preço.

Ler mais →
Quando usar cada IA: escolha o modelo certo

Não existe uma única IA melhor. Associe cada tarefa ao modelo que lidera nela, com uma tabela para programação, escrita, pesquisa e conversa do dia a dia.

Ler mais →
Melhores Agentes de IA em 2026: 30 Ferramentas

Trinta agentes de IA comparados pelo que você quer fazer: programação, pesquisa, trabalho de escritório e automação, com preços e opções gratuitas.

Ler mais →
Gemini Nano Banana Pro vs GPT-Image-1.5: comparação definitiva

A nossa comparação prática original de dezembro de 2025 dos dois principais modelos de geração de imagens, com amostras de saída reais lado a lado.

Ler mais →

Experimente todos os modelos.
Uma aplicação linda.

Todos os modelos deste guia numa aplicação nativa: ChatGPT, Claude, Gemini, Grok e DeepSeek. Grátis para começar.

Fello AI a funcionar no Mac, iPad e iPhone

Avaliação de 4,7·mais de 27 000 críticas·Grátis para começar