Melhores modelos de IA em 2026
Classificações, comparações e análises aprofundadas, atualizadas todos os meses à medida que chegam novos modelos.
O Claude Fable 5.1 chegou a 1 de setembro e foi direto para o topo do Intelligence Index da Artificial Analysis com 66, a pontuação mais alta que a casa alguma vez mediu, levando com ele o Agentic Index com 61. O Claude Opus 5 mantém as duas coisas pelas quais a maioria dos leitores realmente decide: a coroa da programação, ganha nos dois quadros por votos da Arena, e o preço, $5 / $25 por 1M de tokens contra os $10 / $50 do Fable 5.1. Nenhum quadro da Arena tem ainda votos para o 5.1, pelo que nada do que esta página decide por preferência humana se mexeu. O Grok 4.6 é a verdadeira surpresa do mês: uma atualização de pós-treino do Grok 4.5 que sobe cinco pontos para 61, empatando com o GPT-5.6 Sol enquanto cobra $2 / $6, e que termina os trabalhos agênticos longos em cerca de metade das voltas de que o Opus 5 precisa.
O outro movimento dá-se na extremidade económica e, pela primeira vez este ano, foi no sentido contrário. A DeepSeek subiu cerca de quatro vezes o preço dos seus dois modelos V4 a 16 de agosto e dividiu a tabela em horas de ponta e fora de ponta, pelo que o DeepSeek V4-Flash 0731 custa agora $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta, em vez dos $0.14 / $0.28 fixos com que saiu, o que lhe custa a escolha de relação preço-desempenho. Essa escolha passa para o GLM 5.3 Flash, que saiu a 26 de agosto com pesos MIT logo no primeiro dia, um Intelligence Index de 57 e um preço de tabela de $0.15 / $0.50, reduzido a metade até 9 de setembro para $0.075 / $0.25, e que fica agora abaixo da DeepSeek a qualquer hora do dia. A Google já tinha cortado para metade o seu próprio preço do Flash: o Gemini 3.7 Flash saiu a 13 de agosto por um introdutório $0.75 / $3.75, com 56 pontos e o primeiro lugar entre 182 modelos na velocidade de saída, tendo o Gemini 3.6 Flash passado para o mesmo valor. Ambos os preços duplicam a 1 de janeiro de 2027. O campo aberto fechou depois o mês com três lançamentos em três dias: o GLM 5.3 publicou finalmente os seus pesos a 28 de agosto, ainda que sob uma licença própria da Z.ai em vez do MIT puro que o irmão mais pequeno recebeu, a Alibaba abriu o Qwen3.8-Flash-Next a 26 de agosto como o primeiro olhar público sobre a arquitetura Qwen4, e a Tencent libertou o Hy4 Preview a 28 de agosto, 770 mil milhões de parâmetros sob Apache 2.0. Abaixo estão os vencedores por categoria de setembro de 2026. Clique em qualquer cartão para saltar diretamente para a análise completa, ou utilize a navegação fixa para passar de categoria em categoria. As classificações, benchmarks e preços são atualizados no prazo de 48 horas após o lançamento de qualquer modelo importante.
Quer os melhores modelos de IA sem fazer malabarismos com subscrições separadas? O Fello AI reúne os principais modelos numa aplicação nativa para Mac, iPhone e iPad.
Descarregar Fello AI1 set. Anthropic Claude Fable 5.1 e Mythos 5.1, um novo #1 na Artificial Analysis com 66 e um corte de 75 % nas leituras de cache Novo
28 ago. Z.ai Os pesos do GLM 5.3 já saíram após a pausa de segurança, mas a licença não é MIT Novo
28 ago. Tencent Tencent Hy4 Preview, 770B de pesos abertos sob Apache 2.0 e o maior modelo permissivo até agora Novo
26 ago. Z.ai GLM 5.3 Flash, o Ox Alpha revelado, e os primeiros pesos MIT que a Z.ai publica desde o GLM-5.2 Novo
26 ago. Alibaba Qwen3.8-Flash-Next, pesos abertos e o primeiro olhar público sobre a arquitetura Qwen4 Novo
21 ago. OpenAI GPT-5.6 Sol desce mais de 20 % e fica abaixo do Claude Opus 5 dos dois lados Novo
16 ago. DeepSeek A DeepSeek sobe os preços da API cerca de quatro vezes e divide a tabela em horas de ponta e fora de ponta Novo
14 ago. Z.ai GLM 5.3, um grande salto agêntico só com pós-treino, lançado sem os open weights Novo
13 ago. Google Gemini 3.7 Flash, as pontuações de programação sobem e o preço desce para metade, $0.75 / $3.75, até janeiro Novo
12 ago. SpaceXAI Grok 4.6, o pós-treino sobe o Intelligence Index de 56 para 61 com $2 / $6 inalterados Novo
5 ago. Muse Spark 1.2 e Muse Code, Intelligence Index de 51 para 57 a um valor inalterado de $1.25 / $4.25, mais um agente de programação em terminal Novo
3 ago. Alibaba Qwen 3.8 (Qwen3.8-Max), modelo de topo multimodal de 2,4 biliões de parâmetros agora disponível para todos a $2 / $6 Novo
31 jul. DeepSeek DeepSeek V4-Flash 0731, mesmo preço, mesmo tamanho, Intelligence Index de 40 para 52
31 jul. MiniMax MiniMax H3, vídeo 2K com áudio estéreo nativo a partir de $0.13 por segundo
Final de jul. Thinking Machines Inkling Small, um quarto do tamanho do Inkling com uma pontuação quase igual
30 jul. OpenAI Descida de preço do GPT-5.6, Luna 80 % mais barato, Terra 20 % mais barato, Sol inalterado
24 jul. Anthropic Claude Opus 5, novo #1 na Artificial Analysis, lidera tanto o Intelligence Index (63) como o Agentic Index (55.3)
24 jul. Sakana AI Fugu-Ultra v1.1, renovação do motor de orquestração com ganhos reportados pelo fornecedor de até 7,9 pontos sobre a v1.0 ao mesmo preço
21 jul. Google Gemini 3.6 Flash, saída mais barata, mais rápido, mesmo Intelligence Index
16 jul. Moonshot AI Kimi K3, 2,8B de parâmetros, o maior modelo open-weight alguma vez lançado (pesos publicados a 27 de julho)
9 jul. OpenAI GPT-5.6 Sol, Terra e Luna, família de nova geração em direto no ChatGPT, Codex e na API
Pendente Google Gemini 3.5 Pro, ainda por lançar, meses atrasado segundo a Bloomberg Atrasado
Melhor IA para escrita
A melhor IA para escrita é o Claude Fable 5, o único modelo entre os três primeiros dos três quadros independentes de escrita, com o Claude Sonnet 5 como escolha de relação qualidade-preço da versão gratuita e o GPT-5.5 como alternativa para escrita empresarial ancorada em factos. O Fable 5 lidera o quadro de escrita criativa da Arena, encabeça o LiveBench Language com 90,7 e fica em terceiro no EQ-Bench Creative Writing v3 atrás do Kimi K3 e do GPT-5.6 Sol. Nenhum outro modelo está entre os três primeiros em mais do que um deles. É uma mudança face ao mês passado, quando o Claude Sonnet 5 ocupava este lugar no GDPval-AA; os quadros de preferência não sustentam essa colocação, pelo que o Sonnet 5 é agora a escolha de relação qualidade-preço em vez do líder de qualidade. O Fable 5 custa $10 / $50 por 1M de tokens e está incluído em permanência no Claude Max e Team Premium a cerca de 50 % dos limites de utilização habituais. Se a sua escrita for um entregável de trabalho em vez de prosa, o quadro GDPval-AA v2 de entregáveis profissionais é agora liderado pelo Claude Fable 5.1 com 1853, à frente do Claude Opus 5 com 1824 e do Fable 5 com 1723. O Fable 5.1 chegou a 1 de setembro como o modelo mais capaz ao mesmo preço de $10 / $50, e bate o Fable 5 em todos os quadros que mediram ambos, incluindo o Humanity's Last Exam com 59,1 % contra 55,5 %. Não lhe demos a coroa porque esta escolha assenta na preferência humana e nenhum quadro da Arena o avaliou ainda. A tradução é uma questão à parte com um vencedor à parte, que analisamos no nosso guia sobre a melhor IA para tradução.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço (por 1M de tokens) |
|---|---|---|---|---|
| Claude Fable 5 | Melhor escrita no geral | #1 Arena texto no geral (1508.6), #1 LiveBench Language (90.7), #3 EQ-Bench | A opção mais cara aqui | $10 / $50 |
| Claude Fable 5.1 | Capacidade máxima ao mesmo preço | #1 Humanity's Last Exam (59,1 %), #1 GDPval-AA v2 (1853), #1 Intelligence Index (66) | Sem votos na Arena por agora, logo sem classificação nos quadros de preferência | $10 / $50 |
| Kimi K3 | Ficção criativa e voz | #1 EQ-Bench Creative Writing (2377), 234 Elo à frente do segundo | Apenas #10 na Arena escrita criativa | $3 / $15 |
| Claude Sonnet 5 | Escrita gratuita para o dia a dia | Grátis e predefinido no claude.ai, contexto 1M | #53 Arena escrita criativa; 75,0 LiveBench Language | $2 / $10, agora permanente |
| Claude Opus 5 | Entregáveis profissionais com melhor preço | #2 GDPval-AA v2 com 1824, à frente do Fable 5 (1723) | Atrás do Fable 5 na Arena texto, atrás do Fable 5.1 no GDPval-AA v2 | $5 / $25 |
| GPT-5.5 | Escrita empresarial ancorada em factos | Ganhos documentados de fiabilidade factual sobre o GPT-5.4 | Níveis de raciocínio agora marcados como obsoletos | $5 / $30 |
| Gemini 3.7 Flash | Rascunhos em massa à escala | Saída mais rápida de qualquer modelo medido (385,1 tok/s), Intelligence Index 56 | Afinado para código e não para prosa; o preço introdutório duplica a 1 de janeiro de 2027 | $0.75 / $3.75 |
A coroa da escrita fica com o Claude Fable 5, mas o argumento a seu favor estreitou-se a 1 de setembro. A Anthropic lançou o Claude Fable 5.1, que arrebata o Humanity's Last Exam com 59,1 % contra os 55,5 % do Fable 5, o quadro GDPval-AA v2 com 1853 e o Intelligence Index com 66. O que não tem é um único voto na Arena, e esta coroa assenta nos quadros de texto e de escrita criativa da Arena, onde o Fable 5 continua #1 com 1508.6 na data de fecho de 1 de agosto. O Fable 5.1 entra assim na tabela como a opção mais capaz ao mesmo preço de $10 / $50, e voltamos a testar a coroa assim que a Arena o avaliar. Dois números que demos no mês passado foram também reajustados: o AA-Omniscience marca agora 43 para ambos os modelos Fable em vez de 40, e a Artificial Analysis mede o Fable 5 no Humanity's Last Exam em 55,5 % em vez de 53,3 %.
Melhor IA para chat & assistente do dia a dia
A melhor IA para o chat do dia a dia é o GPT-5.6, e a razão honesta é o alcance em vez da posição nos quadros. É o modelo que o ChatGPT serve por predefinição à maior base de utilizadores da categoria, o que faz dele o melhor assistente que a maioria das pessoas consegue realmente abrir. Em preferência humana pura não é o líder: o GPT-5.6 Sol situa-se em #14 no quadro de texto da Arena com 1482,8, onde o Claude Fable 5 lidera com 1508.6. A maioria dos utilizadores do ChatGPT recebe o nível equilibrado Terra, que a OpenAI diz igualar o GPT-5.5 e que, desde a descida de preço de 30 de julho de 2026, custa 60 % menos. Está disponível dentro do ChatGPT (grátis com limites, Plus a $20/mês, Pro a $100/mês), através da API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 por 1M de tokens), e integrado dentro do Fello AI a par do Claude, Gemini, Grok e DeepSeek. Uma ressalva: o system card da OpenAI e o avaliador METR assinalaram um comportamento de «scheming» elevado no Sol, pelo que o GPT-5.5 Instant continua a ser a escolha mais segura para trabalho sensível a alucinações.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| GPT-5.6 | Chat do dia a dia, predefinição do ChatGPT | O assistente que a maioria consegue abrir; o Terra iguala o GPT-5.5 a ~metade do custo | #14 na Arena texto; scheming assinalado pelo METR | Grátis / $20/mês Plus; API $0.20 / $1.20 a $4 / $20 |
| Claude Fable 5 | A conversa mais bem avaliada | #1 na Arena texto no geral (1508.6) e em 6 de 7 subcategorias | Sem versão gratuita; acesso por créditos de utilização no Pro | $10 / $50 API |
| Claude Opus 5 | Respostas ponderadas e matizadas | #1 Artificial Analysis Intelligence Index (63) e Agentic Index (55.3) | #6 na Arena texto, atrás do Claude Fable 5 | $20/mês Pro, $5 / $25 API |
| GPT-5.5 Instant | Trabalho diário sensível a alucinações | 52,5 % menos afirmações alucinadas vs 5.3 Instant | Níveis de raciocínio agora marcados como obsoletos | $20/mês Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rápido, grátis, multimodal | Continua a ser o modelo servido pelo nível gratuito do Gemini, contexto 1M, #12 na Arena texto | Mais fraco no raciocínio mais difícil; o 3.7 Flash supera-o ao mesmo preço | Grátis / $0.75 / $3.75 API |
| Fello AI | Todos os melhores modelos, uma aplicação | ChatGPT + Claude + Gemini + Grok + DeepSeek e mais no Mac, iPhone e iPad | Encaminhado pela aplicação, não direto | $9.99/mês |
O GPT-5.6 mantém a escolha de chat pelo alcance, e a distância para o líder de preferência alargou-se em vez de se fechar. Na data de fecho de 1 de agosto o Sol situa-se em #14 na Arena texto com 1482,8, a descer de #11, enquanto o Claude Fable 5 lidera com 1508.6. Nada mudou quanto ao produto, pelo que a coroa não se move: continua a ser sobre qual o assistente que a maioria das pessoas consegue realmente abrir.
Melhor IA para imagens
A melhor IA para a geração de imagens é o ChatGPT Images 2.0, e é a coroa menos contestada desta página. O GPT Image 2 lidera o quadro de texto para imagem da Arena com 1385 Elo e o seu quadro de edição de imagens com 1463, e a Artificial Analysis coloca-o em primeiro na sua própria arena de imagem com 1339,4. É a escolha natural sempre que a sua imagem tem de conter palavras legíveis, em português ou noutra escrita, e está incluído no ChatGPT Plus e Pro. Os segundos lugares mudaram. O Reve 2.1 (9 de julho) é o verdadeiro #2 em texto para imagem com 1302, e o Reve 2.0 situa-se agora atrás dele nos dois quadros. O Muse Image da Meta é #3 no quadro de texto para imagem da Arena e #2 em edição de imagens, o melhor desempenho que algum modelo de imagem da Meta alguma vez alcançou. O Nano Banana Pro da Google já não é o segundo no geral: em texto para imagem classifica-se entre #8 e #11, abaixo do seu próprio irmão mais barato Nano Banana 2, embora se coloque mais alto em edição de imagens.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| ChatGPT Images 2.0 | Imagens com texto legível | #1 texto para imagem (1385) e #1 edição de imagens (1463) | Menos fotorrealista do que a linha de imagem Gemini | Incluído no ChatGPT Plus |
| Reve 2.1 | Layout, tipografia, 4K nativo | #2 texto para imagem com 1302, edição que preserva o layout | Ecossistema mais pequeno | Grátis / a partir de $7.99/mês |
| Muse Image | Edição de imagens, ecossistema Meta | #3 texto para imagem, #2 edição de imagens (1407) | Novo, ferramentas escassas em redor | Aplicação Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Retratos e produtos fotorrealistas | Supera o Nano Banana Pro nos dois quadros | Mais fraco em texto dentro da imagem | Aplicação Gemini / AI Studio |
| Seedream 5.0 Pro | Texto multilíngue + edição por regiões | 10+ idiomas incl. árabe RTL, edição com laço e camadas | Sem benchmarks independentes; incerteza de direitos de autor | BytePlus / Magnific |
| Midjourney v8 | Arte estilizada, ilustração | Base estética que a maioria dos artistas prefere | Mais fraco em texto dentro da imagem | $10-$120/mês |
| Grok Imagine | NSFW / Spicy Mode | As barreiras mais permissivas | Um modelo mais pequeno por trás | $30/mês SuperGrok |
A coroa da imagem está inalterada e o GPT Image 2 continua a liderar os três quadros que seguimos, na Arena texto para imagem (1385), Arena edição de imagens (1463) e na arena de imagem da Artificial Analysis (1339,4). O único acrescento é o MAI-Image-2.5 da Microsoft, que se situa em terceiro no quadro de imagem da Artificial Analysis com 1269,7 e em terceiro no quadro de edição de imagens da Arena, pelo que o terceiro lugar depende agora de qual a casa que lê.
Melhor IA para vídeo
A melhor IA para a geração de vídeo é o Gemini Omni Flash, que lidera o quadro de texto para vídeo da Arena com 1527 Elo, 45 pontos completos à frente do segundo lugar, e também encabeça a arena de vídeo da Artificial Analysis. É #1 nas duas casas, algo que nenhum outro modelo de vídeo consegue. O preço vai de $1.50 na entrada e $17.50 por 1M de tokens de saída de vídeo, o que dá cerca de $0.10 por segundo de vídeo terminado, e suporta edição conversacional. O único limite real é a duração: o Omni Flash gera clips de 10 segundos. Se precisar de planos mais longos, o Veo 3.1 continua a ser a ferramenta certa dentro da aplicação Gemini, no AI Studio e no Vertex AI, com áudio nativo e saída 1080p. Isto substitui o Veo 3.1 no topo da categoria; o Veo 3.1 é um bom modelo mas não o líder, com a sua melhor variante em #6 no quadro de texto para vídeo da Arena. O candidato a vigiar é o MiniMax H3 (31 de julho), que gera clips 2K de 4 a 15 segundos com áudio estéreo nativo e é faturado por segundo a partir de $0.13 em 2K, já #2 no quadro de vídeo da Artificial Analysis com 1241,5. Não movemos a coroa por isso: a margem é de 3,3 Elo no único quadro que não se reproduziu entre análises, e o H3 continua sem votos no quadro de texto para vídeo da Arena.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| Gemini Omni Flash | Melhor vídeo de IA no geral | #1 nos dois quadros de vídeo (1527 Arena), edição conversacional | Limitado a gerações de 10 segundos | ~$0.10/s; aplicação Gemini / AI Studio |
| MiniMax H3 | Clips 2K com áudio nativo | 4-15 s em 2K, áudio estéreo nativo; #2 no AA vídeo (1241.5) | Ainda sem votos na Arena; os pesos abertos excluem o upscaler 2K e exigem um pedido nos EUA, na UE, no Reino Unido e na Coreia do Sul | $0.13/s em 2K |
| Dreamina Seedance 2.0 | O concorrente mais próximo | #2 texto para vídeo (1482) e #1 em imagem para vídeo com áudio (1198) | Ecossistema ByteDance, acesso ocidental limitado | Dreamina / BytePlus |
| Muse Video | Vídeo no ecossistema Meta | #3 texto para vídeo com 1459 | O mais recente do grupo, ferramentas escassas | Aplicação Meta AI |
| Veo 3.1 | Clips de produção mais longos | Áudio nativo, 1080p, forte consistência física | #6 na Arena vídeo, não o líder de qualidade | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Iteração rápida a menor custo | 4K nativo, 60fps, clips de 15 segundos; o Turbo saiu a 17 de junho | Fora do top 16 na Arena texto para vídeo | A partir de $10/mês |
| Luma Ray 3 | Cenas fotorrealistas | Forte realismo para paisagens | Comunidade mais pequena | Grátis / a partir de $9.99/mês |
O Gemini Omni Flash mantém a coroa do vídeo, e continua a ser #1 nos dois quadros, com 1527,5 na Arena e 1244,8 na Artificial Analysis. O MiniMax H3 (31 de julho) entra como candidato em #2 no quadro de vídeo da Artificial Analysis (1241,5), a 3,3 Elo, e bate o Omni Flash em especificações com saída 2K, clips até 15 segundos e áudio estéreo nativo. Mantemos a coroa porque essa margem é de 3,3 Elo num único quadro e o H3 continua sem votos no quadro de texto para vídeo da Arena. A MiniMax abriu de facto os pesos a 3 de agosto, mas só o H3-Base juntamente com os VAE e o codificador; o upscaler 2K em que assenta a sua vantagem de especificações ficou só na API.
Melhor IA para programação
A melhor IA para programação é o Claude Opus 5, e vence nos dois quadros onde os programadores votam no resultado final em vez de um script a medir um harness. É #1 no quadro WebDev da Arena com 1,702.9 e #1 em image-to-WebDev com 1,668.6, em cortes de votos de 1 de agosto e 31 de julho. O preço é a segunda metade do argumento: o Opus 5 corre a $5 / $25 por 1M de tokens contra os $10 / $50 do Claude Fable 5, e a Artificial Analysis mede-o em $2.34 por tarefa de índice contra os $3.14 do Fable 5. A própria documentação da Anthropic diz aos programadores para começarem com o Opus 5 para programação agêntica complexa e reservarem o Fable 5 para cargas que precisem da capacidade mais alta disponível. O Claude Fable 5 é o segundo e continua a ser a escolha para o trabalho de longo horizonte mais difícil, em #4 no WebDev (1,630.7) e #2 em image-to-WebDev (1,625.7); o seu sucessor de 1 de setembro, o Claude Fable 5.1, é o modelo mais forte nos benchmarks de harness ao mesmo preço, e atinge 55,8 % no Terminal-Bench 4.0 contra os 52,3 % do Opus 5 e os 42,0 % do Fable 5 pelos números da própria Anthropic, mas a Arena ainda não tem votos para ele. O candidato é o Kimi K3, que arrebata o #2 no WebDev com 1,675.5 e o #3 no quadro Agent da Arena, o programador open-weight mais forte dos quadros, embora auto-alojá-lo signifique 1,56 TB de pesos. No Coding Index da Artificial Analysis não é uma varrida da Claude: o GPT-5.6 Sol (xhigh) lidera com 78,3 com o Opus 5 (max) em 78,0, perto o suficiente para lhe chamar empate. O candidato sério mais barato é agora o GLM 5.3 Flash a $0.15 / $0.50 sob MIT, depois de a subida da DeepSeek de 16 de agosto ter levado o V4-Flash 0731 para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta, e a melhor relação qualidade-preço na própria frontier é o Grok 4.6, que marca 88,4 % no Terminal-Bench v2.1 e $0.84 por tarefa de índice a $2 / $6.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço (por 1M de tokens) |
|---|---|---|---|---|
| Claude Opus 5 | Melhor programação no geral | #1 Arena WebDev (1,702.9) e #1 image-to-WebDev (1,668.6); $2.34 por tarefa de índice | O Coding Index da Artificial Analysis tem o GPT-5.6 Sol um nadinha à frente | $5 / $25 |
| Claude Fable 5 | O trabalho agêntico de longo horizonte mais difícil | #2 Arena image-to-WebDev (1,625.7), #4 WebDev; contexto 1M | O mais caro; o Coding Index da Artificial Analysis coloca-o em 7.º | $10 / $50 |
| Claude Fable 5.1 | Programação agêntica de capacidade máxima | #1 Intelligence Index (66) e #1 Agentic Index (61); 55,8 % no Terminal-Bench 4.0 (Anthropic) | Sem votos na Arena por agora; o dobro do preço do Opus 5 | $10 / $50 |
| Kimi K3 | Construção de apps web e agentes | #2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index aberto mais alto (60) | 1,56 TB para auto-alojar | $3 / $15 |
| GPT-5.6 Sol | Modelo de topo da OpenAI, programação agêntica | #1 Artificial Analysis Coding Index com 78,3 (xhigh) | Ausente do quadro oficial Terminal-Bench; manipulação de avaliações assinalada pelo METR | $4 / $20 |
| Muse Spark 1.2 | Programação agêntica barata | Intelligence Index 57 a $1.25 / $4.25; 80 % no Terminal-Bench 2.1 (Artificial Analysis) | Segundo atrás do Opus 5 nos três gráficos de programação próprios da Meta (82,9 % vs 86,7 %); a Scale SEAL só avaliou a 1.1 | $1.25 / $4.25 |
| Grok 4.6 | Programador barato de boa relação qualidade-preço | 88,4 % no Terminal-Bench v2.1 e Intelligence Index 61, a $0.84 por tarefa de índice | Os prompts a partir de 200K tokens voltam a faturar o pedido inteiro ao dobro; taxa de alucinação mais alta | $2 / $6 |
| Gemini 3.7 Flash | Programação de agentes à escala | Intelligence Index 56, 65,3 % DeepSWE v1.1, 85,8 % Terminal-Bench 2.1, 385,1 tok/s | 14,9 % no mais difícil Terminal-Bench 3.0; o preço introdutório duplica a 1 de janeiro de 2027 | $0.75 / $3.75 |
| GLM 5.3 Flash | Melhor programador open-weight que consegue alojar | Intelligence Index 57; DeepSWE v1.1 63,4 e Terminal Bench 2.1 84,3 (números do fabricante); MIT, 320B/18B ativos | O Kimi K3 supera-o; os números de programação são do fabricante e ainda não tem votos na Arena | Open weights (MIT) |
A coroa da programação passou para o Claude Opus 5. A Arena terminou de o avaliar, e ficou em primeiro nos dois quadros de programação, WebDev com 1,702.9 e image-to-WebDev com 1,668.6, com o Claude Fable 5 em quarto e segundo. São quadros por votos com cortes publicados, pelo que a coroa assenta agora em comparações humanas em vez de num único harness, e o Opus 5 fá-lo a metade do preço do Fable 5. O Fable 5 passa a ser o segundo para o trabalho de longo horizonte mais difícil, e o Kimi K3 continua a ser o candidato em #2 no WebDev. O Muse Spark 1.2 da Meta chegou a 5 de agosto e não muda isso, porque nos próprios gráficos da Meta termina em segundo atrás do Opus 5 em cada benchmark de programação que publicou. O Grok 4.6 (12 de agosto) também não leva a coroa, mas é o modelo a vigiar quanto a custo: atinge 88,4 % no Terminal-Bench v2.1 e termina os trabalhos agênticos longos em cerca de metade das voltas do Opus 5, a $2 / $6 contra $5 / $25. Logo a seguir chegaram mais dois lançamentos centrados em programação. O Gemini 3.7 Flash (13 de agosto) substitui o 3.6 Flash nesta tabela pela força de um salto de 49,0 % para 65,3 % no DeepSWE v1.1 a metade do preço anterior, e o GLM 5.3 (14 de agosto) regista o maior ganho agêntico do mês, o Terminal-Bench 3.0 de 4,6 para 28,3, mas saiu sem pesos transferíveis. A Z.ai fechou o mês abrindo outro modelo em vez disso: o GLM 5.3 Flash (26 de agosto) chegou sob MIT logo no primeiro dia com um Intelligence Index de 57, e tira ao GLM-5.2 o lugar open-weight na programação. Os últimos dias do mês trouxeram depois mais três lançamentos abertos: os pesos do próprio GLM 5.3 a 28 de agosto sob uma licença própria em vez de MIT, o Qwen3.8-Flash-Next da Alibaba a 26 de agosto como antevisão da arquitetura Qwen4, e o Hy4 Preview da Tencent, de 770B, a 28 de agosto sob Apache 2.0. Nenhum deles tem ainda classificação independente em programação, pelo que nenhum mexe nesta tabela. A Anthropic abriu depois setembro logo no dia 1 com o Claude Fable 5.1, que lidera o Intelligence Index e o Agentic Index da Artificial Analysis e marca 55,8 % no Terminal-Bench 4.0 contra os 52,3 % do Opus 5, mas a Arena não o avaliou, pelo que a coroa fica onde estão os votos.
Melhor IA para criatividade
A melhor IA para trabalho criativo sem filtros e na moda é o Grok 4.6, e queremos ser exatos quanto ao porquê. Esta escolha é sobre o produto, não sobre a qualidade da prosa. O Grok tem as menos restrições de conteúdo de qualquer modelo frontier e a única integração nativa com o X em tempo real, o que faz dele o único modelo que se envolve com briefings ousados, atuais ou deliberadamente provocadores que os outros recusam. É o modelo predefinido na aplicação Grok para subscritores SuperGrok e X Premium+ a $30/mês. Não é o melhor escritor, e os quadros são diretos quanto a isso. O Grok 4.5 situa-se em #33 no EQ-Bench Creative Writing e #41 no quadro de escrita criativa da Arena, perdendo em ambos para o mais antigo Grok 4.20-beta1. Se escolher apenas pela qualidade da saída, o Claude Fable 5 vence por completo em #1 na Arena escrita criativa, e o Kimi K3 vence o EQ-Bench. Escolha o Grok 4.5 pelo que lhe permite criar, não por quão bem escreve.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| Grok 4.6 | Sem filtros, com opinião, na moda | As menos restrições de conteúdo, ancoragem nativa no X em tempo real | Os quadros de escrita criativa ainda não o avaliaram; o Grok 4.5 estava em #33 EQ-Bench, #41 Arena | $30/mês SuperGrok |
| Claude Fable 5 | Prosa criativa da mais alta qualidade | #1 Arena escrita criativa, #1 LiveBench Language | Barreiras cautelosas em briefings ousados | $10 / $50 API |
| Kimi K3 | Ficção e voz distintiva | #1 EQ-Bench Creative Writing com 2377 | Apenas #10 na Arena escrita criativa | $3 / $15 |
| Claude Opus 5 | Criatividade estruturada de formato longo | Mantém fios longos e autoedita-se; Intelligence Index 63, logo atrás do Claude Fable 5.1 | O mais cauteloso do grupo | $20/mês Pro; $5 / $25 API |
| Gemini 3.1 Pro | Criativo multimodal | Forte cadeia de texto, imagem e vídeo | Quotas dentro da aplicação Gemini | Grátis / $2.00-$4.00 API entrada |
| Grok Imagine (Spicy Mode) | NSFW / criativo para adultos | A geração de imagens mais permissiva | Caso de utilização de nicho | $30/mês SuperGrok |
O Grok mantém esta escolha, agora com o Grok 4.6, que a 12 de agosto substituiu o Grok 4.5 como modelo de topo da SpaceXAI. Nada mudou na sua permissividade nem no seu acesso em direto ao X, que é aquilo em que esta escolha assenta. O modelo por baixo é bastante mais forte, cinco pontos acima num Intelligence Index de 61, mas esse ganho aterrou na programação e no trabalho agêntico, não na prosa, e nenhum quadro de escrita criativa avaliou ainda o Grok 4.6. O Claude Fable 5 continua a ser o modelo a utilizar quando quer a melhor escrita.
Melhor IA para precisão & investigação
A melhor IA para precisão e investigação é o Gemini 3.1 Pro. O seu resultado mais forte é no ARC-AGI-1 da ARC Prize, onde pontua 98 % e iguala o painel humano, e fá-lo a $0.52 por tarefa. Essa combinação é o argumento: vários modelos estão próximos em capacidade, nenhum o iguala no custo para trabalho factual fiável. Combina-o com ancoragem nativa na Pesquisa Google, o que quer quando a resposta tem de ser atual em vez de meramente plausível. Também pontua 94,1 % no GPQA Diamond, onde o GPT-5.6 Sol agora o iguala em vez de ficar atrás, e 44,4 % no Humanity's Last Exam, e encabeça o quadro HLE da Scale SEAL com 46,44. Abandonámos o enquadramento anterior via ARC-AGI-2: os seus 77,1 % continuam corretos, mas o quadro moveu-se e essa pontuação coloca-o agora à volta do 14.º lugar. Duas ressalvas honestas. Na pesquisa ancorada em concreto, o quadro de pesquisa da Arena é liderado pela Anthropic, não pela Google, com o Gemini 3.1 Pro com ancoragem em #7. E no raciocínio inédito, o GPT-5.6 Sol lidera o ARC-AGI-2 e o Claude Opus 5 lidera o ARC-AGI-3 com 30 %, cerca de 3,75x o modelo seguinte. Não movemos a coroa para o Opus 5 porque a Artificial Analysis mede a sua taxa de alucinação em 50 % e coloca-o abaixo do Fable 5 no AA-Omniscience, um quadro cujo topo o Claude Fable 5.1 partilha agora com ele.
| Modelo | Melhor para | Benchmark-chave | Ponto fraco | Preço |
|---|---|---|---|---|
| Gemini 3.1 Pro | Trabalho factual barato e fiável | 98 % ARC-AGI-1 (iguala o painel humano) a $0.52/tarefa, 94,1 % GPQA (igualado pelo Sol) | ARC-AGI-2 77,1 % agora ~14.º; #7 na Arena pesquisa | $2.00-$4.00 / $12.00-$18.00 (escalonado) |
| Claude Fable 5 | Pesquisa ancorada | #1 e #3 no quadro de pesquisa da Arena, à frente da Google | Sem um único nível barato | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Raciocínio inédito | #1 ARC-AGI-2 com 92,5 %, contra um painel humano de 100 % | Scheming assinalado pelo METR | $4 / $20 |
| Claude Opus 5 | Os problemas inéditos mais difíceis | #1 ARC-AGI-3 com 30 %, ~3,75x o modelo seguinte (ARC Prize) | A Artificial Analysis mede uma taxa de alucinação de 50 % | $5 / $25 |
| Qwen 3.7 Max | Precisão frontier a preço vantajoso | 92,4 GPQA Diamond, 200 pedidos grátis/dia | Apenas API, sem front-end de chat | $1.25 / $3.75 promo; $2.50 / $7.50 tabela |
| Claude Opus 4.6 | Honestidade sob pressão | #1 no quadro MASK da Scale SEAL com 96,28; a Anthropic ocupa o top 5 | Substituído como modelo de topo | Modelo legacy da Anthropic |
O Gemini 3.1 Pro mantém a coroa da precisão, mas o seu número de destaque já não é uma vantagem. A sua pontuação GPQA Diamond foi reajustada para 94,1 % e o GPT-5.6 Sol iguala-o agora exatamente, pelo que a coroa assenta no resultado do ARC-AGI-1 a $0.52 por tarefa mais a ancoragem da Pesquisa em vez de no GPQA. Esta é a próxima coroa que voltamos a testar, e os quadros que medem quão frequentemente um modelo simplesmente erra mexeram-se a 1 de setembro. O Claude Fable 5.1 detém agora a precisão factual mais alta que a Artificial Analysis alguma vez mediu, 67 % contra os 65 % do Claude Fable 5, e encabeça o Humanity's Last Exam com 59,1 % contra 55,5 %. O próprio índice AA-Omniscience marca 43 para ambos os modelos, acima dos 40 que demos para o Fable 5 no mês passado, porque o 5.1 compra a sua precisão extra com uma taxa de tentativa mais alta nas perguntas que não sabe responder.
Melhor IA para resolução de problemas
A melhor IA para a resolução de problemas difíceis é o GPT-5.6 Sol, e é a coroa mais bem fundamentada desta página. Arrebata o #1 no LiveBench Mathematics com 96,2, o #1 no LiveBench Reasoning com 91,7 e o #1 no ARC-AGI-2 com 92,5 %, o mais perto que algum modelo alguma vez chegou do painel humano de 100 %. Três casas distintas colocam-no em primeiro nas tarefas de raciocínio que importam, o que é mais concordância do que produz qualquer outra categoria desta página. A OpenAI ainda não publicou a pontuação FrontierMath do Sol, pelo que a marca OpenAI verificada continua a ser os 39,6 % do GPT-5.5 Pro no FrontierMath Tier 4, e inseriremos o número do Sol no momento em que for tornado público. O Qwen 3.7 Max é a alternativa de relação qualidade-preço para problemas de estilo competição com 97,1 no índice HMMT de fevereiro de 2026 e 44,5 no Apex, a uma fração do custo do ChatGPT Pro, e inclui agora 200 pedidos de modelo grátis por dia. O Claude Opus 5 é a alternativa para longas cadeias de raciocínio agêntico, com 59 no Agentic Index da Artificial Analysis, segundo atrás dos 61 do Claude Fable 5.1, e #1 no ARC-AGI-3 da ARC Prize com 30 %, cerca de 3,75x o modelo seguinte.
| Modelo | Melhor para | Benchmark-chave | Ponto fraco | Preço |
|---|---|---|---|---|
| GPT-5.6 Sol | A matemática, a ciência e o raciocínio mais difíceis | #1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (92,5 %) | FrontierMath ainda por publicar; scheming assinalado pelo METR | $100/mês ChatGPT Pro; API $4 / $20 |
| Claude Opus 5 | Longas cadeias de raciocínio agêntico | #2 Agentic Index (59), #1 ARC-AGI-3 (30 %) | Segundo no LiveBench Reasoning; taxa de alucinação de 50 % | $5 / $25 |
| GPT-5.5 Pro | Líder verificado do FrontierMath | 39,6 % FrontierMath Tier 4 | Substituído pelo Sol como modelo de topo | $100/mês ChatGPT Pro |
| Qwen 3.7 Max | Matemática de competição com orçamento apertado | 97,1 HMMT 2026 fev., 44,5 Apex, 200 pedidos grátis/dia | Apenas API | $1.25 / $3.75 promo; $2.50 / $7.50 tabela |
| Claude Fable 5 | Matemática dentro de um fluxo de programação | #1 na subcategoria de matemática da Arena (1543), 96,0 LiveBench Mathematics | A opção mais cara aqui | $10 / $50 |
| GLM 5.3 Flash | Resolução de problemas open-weight | Intelligence Index 57 sob MIT, quatro pontos acima do GLM-5.2 com menos de metade do tamanho; 320B/18B ativos, contexto 1M | Exige um servidor multi-GPU, não uma estação de trabalho; o GLM 5.3 pontua mais alto segundo os números da própria Z.ai e é transferível desde 28 de agosto, mas com mais do dobro do tamanho e sob uma licença própria | Open weights (MIT) |
O GPT-5.6 Sol mantém esta coroa, e ganhou um segundo argumento. O Sol lidera agora também o Terminal-Bench v2.1 da Artificial Analysis com 89,5 % e o seu Coding Index com 78,3, e iguala o Gemini 3.1 Pro no GPQA Diamond com 94,1 %. O Claude Opus 5 continua a ser a alternativa de raciocínio agêntico pela força do ARC-AGI-3. A 1 de agosto a OpenAI deu à sua próxima família de modelos o nome Astra e publicou dez novos resultados matemáticos de uma versão interna, embora o Astra não tenha sido lançado e não tenha data, preço nem disponibilidade. O Claude Fable 5.1 da Anthropic chegou a 1 de setembro e tirou o Agentic Index ao Opus 5, 61 contra 59, o que muda o número de apoio da alternativa, não a coroa.
Melhor agente de IA
O melhor agente de IA neste momento é o Gemini Spark para trabalho residente na cloud 24/7 e o Claude Cowork para trabalho residente no ambiente de trabalho, com o ChatGPT Codex como alternativa para agentes de programação e os agentes de navegador de classe OpenAI Operator como alternativa para tarefas web. Os agentes de IA são a categoria que mais depressa se move em 2026: cada fornecedor de topo lança agora um produto de agente, e a escolha prática é entre agentes que vivem na cloud (funcionam enquanto o seu portátil está fechado) e agentes que vivem no seu ambiente de trabalho (conduzem as suas aplicações diretamente). O Gemini Spark foi lançado na Google I/O a 19 de maio de 2026 e é o primeiro agente na cloud 24/7. O Claude Cowork atingiu a disponibilidade geral a 9 de abril de 2026 e funciona como um agente de ambiente de trabalho que conduz as suas aplicações locais. O ChatGPT Codex Mobile (14 de maio) é a escolha para trabalho de agente de programação. Leia a comparação completa Gemini Spark vs Claude Cowork.
| Agente | Melhor para | Onde funciona | Ponto forte | Preço |
|---|---|---|---|---|
| Gemini Spark | Tarefas na cloud 24/7, fluxos do Workspace | VM da Google Cloud (sempre ativa) | Primeiro verdadeiro agente 24/7, integração profunda com o Workspace | $99.99/mês Google AI Ultra |
| Claude Cowork | Ambiente de trabalho, condução de aplicações, design + código | O seu ambiente de trabalho Mac/Windows | Conduz aplicações locais, vê o seu ecrã | $20/mês Claude Pro |
| ChatGPT Codex Mobile | Agente de programação no telemóvel | Cloud da OpenAI + iOS/Android | Aprovar diffs e reencaminhar o trabalho a partir do telemóvel | Incluído nos planos ChatGPT |
| Grok Agentic (Grok 4.6) | Investigação em tempo real, scraping do X | Cloud da SpaceXAI | Integração nativa com o X; Elo de 1755 no GDPval-AA v2 | $30/mês SuperGrok |
| OpenAI de classe Operator | Tarefas de navegador, formulários web | Cloud da OpenAI + o seu navegador | Automação web | ChatGPT Pro |
Não saíram novos agentes de consumo, e o Muse Code da Meta (5 de agosto) é uma ferramenta de terminal para programadores em vez de uma de consumo, pelo que a escolha entre o Gemini Spark (cloud) e o Claude Cowork (ambiente de trabalho) continua a guiar a maioria das decisões sobre agentes para utilizadores individuais. A camada de modelo por baixo deles moveu-se de novo: o Claude Fable 5.1 (1 de setembro) lidera agora o Agentic Index da Artificial Analysis com 61, à frente do Claude Opus 5 com 59, e encabeça o quadro GDPval-AA v2 com 1853 contra os 1824 do Opus 5. O Opus 5 continua a ser aquele sobre o qual a maioria das equipas deve construir, a $5 / $25, metade do preço do Fable 5.1, e encabeça o quadro Agent da Arena, com o Kimi K3 em terceiro. Para equipas que constroem os seus próprios agentes, o Muse Spark 1.2 da Meta (5 de agosto) é uma opção agent-native barata a $1.25 / $4.25 cujo Elo agêntico GDPval-AA v2 saltou de 1371 para 1631, embora a Scale SEAL só tenha avaliado a mais antiga 1.1, que lidera o seu quadro de utilização de ferramentas MCP Atlas com 88,1. O O GLM 5.3 Flash (26 de agosto, MIT) é agora o modelo de agente open-weight que alojaríamos, num Intelligence Index de 57 e com AutomationBench 48,8 no gráfico da própria Z.ai, onde o Claude Opus 4.8 fica nos 41,0, ainda que não tenha votos na Arena; o registo independente é do GLM-5.2, em #5 no quadro Agent da Arena. O Grok 4.6 (12 de agosto) é aqui a nova conta de custo em vez de um novo produto de agente: marca um Elo de 1755 no GDPval-AA v2, que as entradas de setembro empurraram para o quinto lugar entre modelos distintos, e a Artificial Analysis mede que termina os trabalhos de longo horizonte em cerca de 53 voltas e 0,5 mil milhões de tokens de entrada, contra cerca de 103 voltas e 2,0 mil milhões do Opus 5, a $0.84 por tarefa de índice.
Os principais modelos como ChatGPT, Claude e Gemini, juntos no Mac, iPhone e iPad.
Grátis para começar, 4,7★ em mais de 27 000 críticas.
Descarregar Fello AIMelhor IA para estudantes
A melhor IA para estudantes é o GPT-5.5 Free dentro do ChatGPT para trabalho de curso geral e o Gemini 3.6 Flash Free dentro da aplicação Gemini para STEM e estudo multimodal, com o Qwen 3.7 Max como alternativa por API para conjuntos de problemas mais difíceis (200 pedidos grátis por dia) e o Claude Opus 5 como alternativa para revisão de ensaios. A maioria dos estudantes não precisa de pagar: o nível gratuito do ChatGPT usa agora o GPT-5.6 por predefinição (com o GPT-5.5 ainda disponível), o Gemini 3.6 Flash está na aplicação gratuita Gemini e no AI Studio, o Claude Sonnet 5 é a nova predefinição gratuita do Claude, e o DeepSeek V4 é grátis no site de chat da DeepSeek. Para o desenvolvimento passo a passo na matemática mais difícil, o GPT-5.6 Sol é o novo modelo de topo da OpenAI (a sua pontuação FrontierMath ainda não foi publicada, com os 39,6 % verificados do GPT-5.5 Pro no FrontierMath Tier 4 como marca atual), embora ambos sejam apenas pagos; o Qwen 3.7 Max é a alternativa de relação qualidade-preço com 97,1 no HMMT 2026 fevereiro com preço de API de $1.25 / $3.75 na sua promo atual de 50 % ($2.50 / $7.50 tabela).
| Tarefa | Melhor modelo | Porquê | Grátis? | Alternativa |
|---|---|---|---|---|
| Ensaios & trabalho de curso | GPT-5.5 | Grátis no ChatGPT, fiabilidade factual melhorada vs 5.4 | Sim | Claude Sonnet 5 (Claude grátis) |
| Resolução de problemas STEM | GPT-5.6 Sol / Qwen 3.7 Max | Novo modelo de topo STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 fev. | Pro pago / Qwen API pago | Gemini 3.6 Flash (grátis) |
| Investigação & precisão | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarefa, ancoragem nativa na Pesquisa Google | Sim (aplicação Gemini) | Claude Opus 5 |
| Revisão de escrita | Claude Sonnet 5 | Grátis e predefinido no claude.ai; o Claude Fable 5 é o líder de qualidade | Sim (Claude grátis) | Claude Fable 5 |
| Estudo multimodal (PDFs, slides, imagens) | Gemini 3.6 Flash | Contexto 1M, grátis na aplicação Gemini | Sim | NotebookLM (Google) |
Melhor IA para o trabalho & profissionais
A melhor IA para trabalho profissional é o GPT-5.6 (predefinição do ChatGPT desde 9 de julho) para trabalho de conhecimento diário, o Claude Opus 5 para programação e escrita de alto risco, e o Gemini Spark para fluxos agênticos 24/7. A maioria dos profissionais tira o máximo partido ao manter duas subscrições pagas (ChatGPT Plus a $20/mês mais Claude Pro a $20/mês, um total de $40/mês), ou ao consolidar com o Fello AI a $9.99/mês para os cinco melhores modelos numa aplicação de Mac/iOS. Para trabalho agêntico que corre enquanto dorme, o Gemini Spark no Google AI Ultra a $99.99/mês é o único verdadeiro agente na cloud 24/7.
| Caso de utilização | Melhor modelo | Dado-chave | Preço | Alternativa |
|---|---|---|---|---|
| Trabalho de conhecimento diário | GPT-5.6 | Predefinição do ChatGPT desde 9 de julho; o assistente que a maioria consegue abrir | $20/mês ChatGPT Plus | Claude Opus 5 |
| Programação (proprietária) | Claude Opus 5 | #1 na Arena WebDev (1,702.9) e image-to-WebDev (1,668.6); a predefinição recomendada pela Anthropic | $20/mês Claude Pro | Claude Fable 5 |
| Programação (económica) | Qwen 3.7 Max | 80,4 SWE-Verified, contexto 1M | $1.25 / $3.75 promo; $2.50 / $7.50 tabela | DeepSeek V4-Flash 0731 |
| Investigação & briefings | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarefa, ancoragem Google | Google AI Pro / Ultra | Claude Opus 5 |
| Matemática, física, modelação financeira difíceis | GPT-5.6 Sol | Novo modelo de topo STEM da OpenAI (5.5 Pro verificado em 39,6 % FrontierMath) | $100/mês ChatGPT Pro | Qwen 3.7 Max |
| Fluxos de agente sempre ativos | Gemini Spark | Primeiro agente na cloud 24/7 | $99.99/mês Google AI Ultra | Claude Cowork |
| Notícias em direto, criativo com contexto do X | Grok 4.6 | Intelligence Index 61 + ancoragem nativa no X | $30/mês SuperGrok | Gemini 3.1 Pro |
| Consolidação tudo-em-um | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/mês | Pagar a cada fornecedor em separado |
Preços dos modelos de IA em setembro de 2026
De versões gratuitas a $0 até $199.99/mês do Google AI Ultra. O preço mais determinante desta tabela é o Claude Opus 5 a $5 / $25, porque é o segundo mais bem pontuado no Intelligence Index da Artificial Analysis a metade do custo dos dois modelos Fable à sua volta. O Claude Fable 5.1, que arrebatou o topo desse índice a 1 de setembro, mantém o mesmo preço de tabela de $10 / $50 do Fable 5, mas corta as leituras de cache em 75 % para $0.25, e é aí que está a poupança nas execuções agênticas longas, e não no preço de tabela. O Muse Spark 1.2 da Meta é listado a $1.25 / $4.25, com um nível Contributor a $0.10 / $0.20 para quem estiver disposto a deixar a Meta treinar com os seus prompts, e o Grok 4.6 é listado a $2 / $6, com a ressalva de que um prompt de 200 000 tokens ou mais volta a faturar o pedido inteiro a $4 / $12. A escolha de relação preço-desempenho mudou em agosto, e não porque algo tenha ficado mais barato: a DeepSeek subiu cerca de quatro vezes o preço dos seus dois modelos V4 a 16 de agosto, levando o V4-Flash 0731 de $0.14 / $0.28 fixos para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta. A escolha é agora o GLM 5.3 Flash a $0.15 / $0.50 de tabela, a metade do preço até 9 de setembro, que pontua 57 no Intelligence Index e fica abaixo até do valor fora de ponta da DeepSeek dos dois lados, a qualquer hora do dia. Na própria frontier, a escolha de valor é o Grok 4.6, com 61 por $0.84 por tarefa de índice, ao passo que o Opus 5 custa $2.34 e o GPT-5.6 Sol cobra $4 / $20 pela mesma pontuação após a descida de 21 de agosto. Entre os modelos fechados, o GPT-5.6 Luna é o mais barato a $0.20 / $1.20 após a descida da OpenAI de 30 de julho. Para uma análise mais aprofundada, consulte o nosso Guia completo de comparação de preços de IA.
| Modelo | Entrada (por 1M) | Saída (por 1M) | Contexto | Acesso grátis? |
|---|---|---|---|---|
| GPT-5.5 | $5.00 | $30.00 | 1M (400K no Codex) | ChatGPT Free; API paga |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro a partir de $100/mês (nível de maior utilização a $200) |
| GPT-5.6 Sol | $4.00 | $20.00 | Não publicado | Em direto no ChatGPT, Codex & API (9 de julho) |
| GPT-5.6 Terra | $2.00 | $12.00 | Não publicado | Em direto no ChatGPT, Codex & API (9 de julho) |
| GPT-5.6 Luna | $0.20 | $1.20 | Não publicado | Em direto no ChatGPT, Codex & API (9 de julho) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Predefinição no Claude Pro/Max; API paga |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Modelo legacy na Anthropic; Pro/Max/API |
| Claude Fable 5.1 | $10.00 | $50.00 | 1M | Leituras de cache $0.25; no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos. O Mythos 5.1 fatura de forma idêntica, apenas por convite |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Permanente no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos |
| Claude Sonnet 5 | $2.00 | $10.00 | 1M | Predefinição no Claude Free & Pro; API paga |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API paga (substituído pelo Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Aplicação Gemini limitada; API paga |
| Gemini 3.7 Flash | $0.75 introdutório / $1.50 a partir de 1/1/2027 | $3.75 introdutório / $7.50 a partir de 1/1/2027 | 1M | AI Studio, Android Studio, Antigravity + API paga; na aplicação Gemini apenas via Spark (AI Pro/Ultra, exclui EEE/RU/CH/Nigéria) |
| Gemini 3.6 Flash | $0.75 introdutório / $1.50 a partir de 1/1/2027 | $3.75 introdutório / $7.50 a partir de 1/1/2027 | 1M | Modelo predefinido da aplicação Gemini gratuita; AI Studio; nível API gratuito + API paga |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; nível API gratuito + API paga |
| Qwen 3.7 Max | $1.25 promo / $2.50 tabela | $3.75 promo / $7.50 tabela | 1M | 200 pedidos grátis/dia; API paga para além disso |
| MiniMax M3 | $0.30 (50 % de desconto sobre $0.60) | $1.20 (≤512K) | 1M | Open weights; custos de alojamento aplicáveis |
| LongCat-2.0 | Depende do fornecedor | Depende do fornecedor | 1M | Open weights (MIT); custos de alojamento aplicáveis |
| NVIDIA Nemotron 3 Ultra | Depende do fornecedor | Depende do fornecedor | 1M | Open weights (OpenMDW); custos de alojamento aplicáveis |
| Qwen 3.5 (open-weight) | Auto-alojamento / Together | Auto-alojamento / Together | 1M | Open weights; custos de alojamento aplicáveis |
| Nex-N2-Pro | Auto-alojamento / fornecedores | Auto-alojamento / fornecedores | 1M | Open weights (Apache 2.0); custos de alojamento aplicáveis |
| Rio 3.5 Open 397B | Auto-alojamento / fornecedores | Auto-alojamento / fornecedores | 1M | Open weights (MIT); custos de alojamento aplicáveis |
| Grok 4.3 | $1.25 | $2.50 | 1M | Plano de consumo gratuito; API paga |
| Grok 4.6 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API da SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
| Muse Spark 1.2 | $1.25 ($0.10 nível Contributor) | $4.25 ($0.20 nível Contributor) | 1M | API paga; Muse Code, Meta Model API e OpenRouter; o nível Contributor troca direitos de treino por um desconto de ~92 % |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Nível básico gratuito na aplicação Kimi; open weights no Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (vídeo) | $1.50 | $17.50 (saída de vídeo) | Clips de 10 segundos | Aplicação Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.66 fora de ponta / $1.32 em ponta ($0.022 cache-hit fora de ponta) | $1.98 fora de ponta / $3.96 em ponta | 1M | DeepSeek Chat grátis; API paga, preços de ponta e fora de ponta desde 16 de agosto |
| DeepSeek V4-Flash 0731 | $0.22 fora de ponta / $0.44 em ponta ($0.007 cache-hit fora de ponta) | $0.66 fora de ponta / $1.32 em ponta | 1M | DeepSeek Chat grátis; API paga, preços de ponta e fora de ponta desde 16 de agosto |
| Kimi K2.7 Code | Depende do fornecedor | Depende do fornecedor | 256K | Open weights; custos de alojamento aplicáveis |
| GLM-5.2 | Depende do fornecedor | Depende do fornecedor | 1M | Open weights; custos de alojamento aplicáveis |
| GLM 5.3 | $1.40 ($0.26 cache-hit) | $4.40 | 1M | API da Z.ai, GLM Coding Plan e ZCode; pesos no Hugging Face desde 28 de agosto sob a licença própria GLM 5.3 License |
| GLM 5.3 Flash | $0.15 ($0.03 cache-hit); $0.075 em promoção | $0.50; $0.25 em promoção | 1M | API da Z.ai, GLM Coding Plan, OpenRouter; pesos MIT no Hugging Face; promoção acaba a 9 de setembro |
| Tencent Hy4 Preview | $0.834 ($0.042 cache-hit) | $2.501 | 1M+ | Pesos abertos (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy |
| Qwen3.8-Flash-Next | Depende do fornecedor | Depende do fornecedor | 262K (até 1M) | Pesos abertos (Qwen Community License 1.0); acrescem custos de alojamento |
| ERNIE 5.1 | Preço para a região China | Preço para a região China | 256K | Nível gratuito da Baidu |
| Gemini Spark (agente) | Sem preço de API | Sem preço de API | 1M (base Gemini) | Google AI Ultra $99.99 ou $199.99/mês |
| Fello AI (agregador) | Encaminhado pela aplicação | Encaminhado pela aplicação | Depende do modelo | $9.99/mês, versão gratuita disponível |
As tarifas do GPT-5.5 e GPT-5.5 Pro acima são preços de contexto curto; a OpenAI já não publica os números específicos de contexto longo. Os níveis GPT-5.6 são faturados a 2x a entrada e 1,5x a saída assim que um prompt ultrapassa os 272K tokens de entrada, o que coloca o Terra de contexto longo em $4 / $18 e o Luna em $0.40 / $1.80. O Grok 4.6 funciona da mesma forma, mas morde com mais força: a partir de 200 000 tokens de prompt, a SpaceXAI volta a faturar o pedido inteiro à taxa mais alta em vez de apenas o excedente, pelo que ultrapassar o limite por mil tokens duplica o custo de toda a chamada. A outra tabela que convém ler duas vezes é a da DeepSeek: desde 16 de agosto, os seus dois modelos V4 são faturados ao preço de ponta das 01:00 às 04:00 e das 06:00 às 10:00 UTC nos dias úteis, e a exatamente metade em qualquer outra hora, pelo que a mesma tarefa pode custar o dobro consoante a hora a que a executar. Se quiser acesso a vários modelos de IA sem gerir subscrições separadas, o Fello AI disponibiliza GPT, Claude, Gemini, Grok, Perplexity e mais numa única aplicação para Mac, iPhone e iPad a partir de $9.99/mês.
Melhores modelos open-weight em setembro de 2026
O melhor modelo open-weight em setembro de 2026 é o Kimi K3, e assumiu a liderança no momento em que a Moonshot publicou os pesos a 27 de julho de 2026. Detém o Intelligence Index mais alto de qualquer modelo open-weight com 60 na Artificial Analysis, sete pontos à frente do GLM-5.2, e na Arena continua a ser a entrada aberta mais bem posicionada, em #2 no WebDev (1,675.5) atrás apenas do Claude Opus 5 e #3 no quadro Agent. Um senão decide qual dos dois deve realmente utilizar. A transferência do K3 são 96 shards safetensors e cerca de 1,56 TB, o que precisa de um cluster de GPU multi-nó em vez de uma estação de trabalho, e chega sob uma licença própria Kimi K3 License em vez de MIT. Por isso a recomendação prática para equipas que fazem correr os seus próprios pesos é agora o GLM 5.3 Flash (Z.ai, MIT), lançado a 26 de agosto num Intelligence Index de 57, quatro pontos acima do GLM-5.2 e com menos de metade do tamanho, 320B no total com 18B ativos. É o primeiro modelo nativamente multimodal da linha GLM-5, aceita um contexto de 1M de tokens, e os pesos estavam no Hugging Face sob MIT no próprio dia do lançamento. O GLM-5.2 (MIT) é a alternativa de recurso, num Intelligence Index de 53, e mantém o registo independente que o modelo mais recente ainda não teve tempo de ganhar, #6 na Arena WebDev (1,587.1) e #5 no quadro Agent. O terceiro lugar mudou de mãos no último dia de julho: o DeepSeek V4-Flash 0731 foi novamente pós-treinado e saltou de um Intelligence Index de 40 para 52 no índice atual v4.1.1 sob MIT, embora o seu preço de API tenha desde então subido cerca de quatro vezes, para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta. Três lançamentos fecharam depois o mês, e nenhum deles tem ainda classificação independente. O GLM 5.3 publicou finalmente os seus pesos a 28 de agosto, exatamente na data que o seu marcador de posição indicava, mas sob uma GLM 5.3 License própria em vez de MIT, com uma cláusula que obriga qualquer operador de model-as-a-service acima de 10 mil milhões de dólares de receita a passar primeiro uma revisão de segurança da Z.ai; repare ainda que o GLM 5.3 Flash não é um GLM 5.3 reduzido, mas um modelo à parte sobre uma base recém-treinada, e é por isso que pôde sair sob MIT puro quando o topo de gama não pôde. A Tencent abriu o Hy4 Preview a 28 de agosto com 770B no total e 49B ativos sob Apache 2.0, o maior modelo com licença permissiva publicado até agora, apoiado numa avaliação cega interna e não em qualquer quadro independente. E a Alibaba publicou o Qwen3.8-Flash-Next a 26 de agosto, um mixture-of-experts de 125B com apenas 6B ativos que antecipa a arquitetura Qwen4, sob a Qwen Community License 1.0 em vez de Apache. Os três estão listados abaixo em vez de classificados.
| Modelo | Melhor para | Benchmark-chave | Contexto / Licença | Onde executar |
|---|---|---|---|---|
| Kimi K3 | Modelo open-weight mais bem pontuado, trabalho agêntico e web | II 60, o mais alto de qualquer modelo open-weight; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B ativos | 1M / Kimi K3 License | Hugging Face (96 shards, 1.56 TB), Moonshot API, fornecedores |
| GLM 5.3 Flash | Melhor modelo aberto que a maioria das equipas consegue mesmo executar | II 57 (v4.1.1), na fronteira de Pareto entre inteligência e custo, a cerca de $0.09 por tarefa do índice; 320B/18B ativos, nativamente multimodal | 1M / MIT | Hugging Face, API da Z.ai ($0.15/$0.50), OpenRouter |
| GLM-5.2 | Recurso com historial independente | II 53; #6 Arena WebDev (1,587.1), #5 Arena Agent; 744B/40B ativos | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| GLM 5.3 | Aberto desde 28 de agosto, mas com licença própria | Mesma base de 744B do GLM-5.2, apenas pós-treinada, checkpoint publicado contado em 753B; CyberGym 84,5 % e Terminal-Bench 3.0 28,3 (números do fabricante) | 1M / GLM 5.3 License (model-as-a-service acima de 10 mil milhões USD de receita precisa de revisão de segurança da Z.ai) | Hugging Face, API da Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode |
| DeepSeek V4-Flash 0731 | Melhor relação qualidade-preço aberta se o alojar por conta própria | II 52 (v4.1.1), de 40 a 31 de julho; 284B/13B ativos | 1M / MIT | DeepSeek API ($0.22/$0.66 fora de ponta, $0.44/$1.32 em ponta desde 16 de agosto), local |
| Tencent Hy4 Preview | Maior modelo com licença permissiva até agora | 770B/49B ativos; 2,99/4,00 no painel próprio da Tencent com 203 tarefas contra 2,94 do Kimi K3 e 2,92 do GLM 5.3 (fabricante); ainda sem classificação independente | 1M+ / Apache 2.0 | Hugging Face (BF16 e FP8), Tencent Cloud TokenHub, OpenRouter |
| Qwen3.8-Flash-Next | Antevisão da arquitetura Qwen4 | 125B no total mais um embedding de N-gramas de 51B, 6B ativos; 91,7 GPQA Diamond e 62,5 SWE-Bench Pro (fabricante); ainda sem classificação independente | 262K a 1M / Qwen Community License 1.0 | Hugging Face, fornecedores, auto-alojamento |
| LongCat-2.0 | Programador aberto frontier treinado em chips chineses | II 33 (v4.1); 59,5 % SWE-Bench Pro (fornecedor), 1.6T/~48B ativos | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Multimodal de classe frontier barato | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / licença por definir | Hugging Face, API $0.30/1M (50 % de desconto) |
| Nex-N2-Pro | Pontuação de programação aberta mais forte | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B ativos | Baseado em Qwen / Apache 2.0 | Hugging Face, fornecedores, auto-alojamento |
| Kimi K2.7 Code | Programador aberto com licença comercial mais forte | +21,8 % no Kimi Code Bench v2 vs K2.6 (fornecedor); 1T/32B ativos | 256K / Modified MIT | Hugging Face, DeepInfra, fornecedores |
| DeepSeek V4-Pro | Trabalho agêntico em condições reais | II 44 (v4.1), 1.6T/49B ativos | 1M / MIT | DeepSeek API ($0.435/$0.87), local |
| Hy3 | O mais recente participante com licença permissiva | II 41 (v4.1); #22 na Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, fornecedores, auto-alojamento |
| Inkling | Primeiro modelo open-weight da Thinking Machines | II 41 (v4.1), agêntico 32,3, lançado a 15 de julho | Open weights | Hugging Face, fornecedores, auto-alojamento |
| Inkling Small | Mesma família a um quarto do tamanho | II 40 (v4.1), agêntico 30,8; 276B/12B ativos, entrada de texto, imagem e áudio | Apache 2.0 | Hugging Face (BF16 e NVFP4), fornecedores, auto-alojamento |
| NVIDIA Nemotron 3 Ultra | Afinado pela NVIDIA, licença totalmente permissiva | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B ativos | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 auto-alojamento) |
| Qwen 3.5 (397B / 17B ativos) | Multimodal, descodificação rápida | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / aberto | Together, OpenRouter, local |
| Qwen3.6-35B-A3B | Programador agêntico aberto eficiente (3B ativos) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B ativos | 262K (até 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, local |
| Qwen3.6-27B | Programador denso executável em portátil | 87,8 GPQA Diamond, denso 27B, multimodal | 256K / Apache 2.0 | Local Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune de Qwen 3.5, raciocínio multilíngue | 70,8 Terminal-Bench 2.1 (first-party), bate o Qwen 3.7 Plus em 4/5 | 397B/17B ativos / MIT | Hugging Face, fornecedores, auto-alojamento |
| Llama 4 Maverick | Modelo de topo da linha Meta | 17B ativos / 400B de parâmetros no total | Llama 4 license | Cloud da Meta, Hugging Face, local |
| NVIDIA Nemotron 3 Nano Omni | Edge / baixo consumo | Multimodal, pegada muito reduzida | Compacto / aberto | Local, ferramenta NVIDIA |
Aqui a licença importa tanto como a pontuação bruta, e agosto alargou a distância entre os dois grupos. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) e Nemotron 3 Ultra (OpenMDW) permitem todos claramente a utilização comercial sem qualquer teste de receita. Os restantes trazem condições que convém ler antes de construir sobre eles: o MiniMax M3 e o MiniMax H3 chegam sob as suas próprias licenças comunitárias, exigindo o H3 ainda um pedido a partir dos EUA, da UE, do Reino Unido e da Coreia do Sul; o Kimi K3 assenta numa licença própria com um limiar de receita para quem o revenda como serviço; o GLM 5.3 exige uma revisão de segurança da Z.ai a qualquer operador de model-as-a-service acima de 10 mil milhões de dólares de receita; e a Qwen Community License 1.0 do Qwen3.8-Flash-Next exige uma licença à parte da Qwen para explorar um negócio de model-as-a-service ou de assistente de trabalho com IA, embora o uso interno esteja isento. Nenhum modelo open-weight é já o primeiro em qualquer quadro da Arena que seguimos: o Claude Opus 5 arrebatou o quadro Agent em julho, o último que um modelo open-weight liderou.
Benchmarks, preços e utilização prática
Cada classificação desta página combina três entradas: benchmarks públicos de sete casas independentes (Artificial Analysis, Arena antiga LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize e o quadro oficial Terminal-Bench 2.1, cobrindo os índices Intelligence e Agentic, GPQA Diamond, ARC-AGI-1 a 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas e o Remote Labor Index), preços de API e subscrição publicados na página de preços oficial de cada fornecedor, e utilização prática pela equipa editorial da FelloAI que executa prompts reais sobre a mesma tarefa em cada modelo. Voltamos a obter as fontes oficiais de preços e benchmarks antes de cada atualização mensal.
Os benchmarks são ponderados consoante o caso de utilização: o SWE-bench e o Terminal-Bench impulsionam a programação, o GPQA Diamond e o ARC-AGI-2 impulsionam a precisão, o GDPval-AA (o benchmark de entregáveis profissionais da Artificial Analysis) informa a qualidade das tarefas profissionais ao passo que o estilo de escrita é avaliado sobretudo por testes práticos, o FrontierMath e o HMMT impulsionam a resolução de problemas. Revelamos quando um benchmark é reportado pelo fornecedor mas não verificado de forma independente, e descartamos qualquer afirmação que não conseguimos reproduzir contra uma fonte em direto. Não movemos a coroa de uma categoria pela força de um único quadro, e quando um modelo novo é demasiado recente para que os quadros de preferência humana o tenham avaliado, dizemo-lo em vez de o coroar apenas por pontuações de benchmark. Quando um modelo passa por uma atualização importante entre atualizações, reclassificamos a categoria e acrescentamos uma linha «O que mudou este mês» no fundo da análise aprofundada.
O Fello AI reúne os melhores modelos de IA numa aplicação nativa e leve.
Alterne entre eles a qualquer momento, sem subscrições separadas.
Descarregar Fello AI




