Atualizado a 2 de setembro de 2026

Melhores modelos de IA em 2026

Classificações, comparações e análises aprofundadas, atualizadas todos os meses à medida que chegam novos modelos.

O Claude Fable 5.1 chegou a 1 de setembro e foi direto para o topo do Intelligence Index da Artificial Analysis com 66, a pontuação mais alta que a casa alguma vez mediu, levando com ele o Agentic Index com 61. O Claude Opus 5 mantém as duas coisas pelas quais a maioria dos leitores realmente decide: a coroa da programação, ganha nos dois quadros por votos da Arena, e o preço, $5 / $25 por 1M de tokens contra os $10 / $50 do Fable 5.1. Nenhum quadro da Arena tem ainda votos para o 5.1, pelo que nada do que esta página decide por preferência humana se mexeu. O Grok 4.6 é a verdadeira surpresa do mês: uma atualização de pós-treino do Grok 4.5 que sobe cinco pontos para 61, empatando com o GPT-5.6 Sol enquanto cobra $2 / $6, e que termina os trabalhos agênticos longos em cerca de metade das voltas de que o Opus 5 precisa.

O outro movimento dá-se na extremidade económica e, pela primeira vez este ano, foi no sentido contrário. A DeepSeek subiu cerca de quatro vezes o preço dos seus dois modelos V4 a 16 de agosto e dividiu a tabela em horas de ponta e fora de ponta, pelo que o DeepSeek V4-Flash 0731 custa agora $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta, em vez dos $0.14 / $0.28 fixos com que saiu, o que lhe custa a escolha de relação preço-desempenho. Essa escolha passa para o GLM 5.3 Flash, que saiu a 26 de agosto com pesos MIT logo no primeiro dia, um Intelligence Index de 57 e um preço de tabela de $0.15 / $0.50, reduzido a metade até 9 de setembro para $0.075 / $0.25, e que fica agora abaixo da DeepSeek a qualquer hora do dia. A Google já tinha cortado para metade o seu próprio preço do Flash: o Gemini 3.7 Flash saiu a 13 de agosto por um introdutório $0.75 / $3.75, com 56 pontos e o primeiro lugar entre 182 modelos na velocidade de saída, tendo o Gemini 3.6 Flash passado para o mesmo valor. Ambos os preços duplicam a 1 de janeiro de 2027. O campo aberto fechou depois o mês com três lançamentos em três dias: o GLM 5.3 publicou finalmente os seus pesos a 28 de agosto, ainda que sob uma licença própria da Z.ai em vez do MIT puro que o irmão mais pequeno recebeu, a Alibaba abriu o Qwen3.8-Flash-Next a 26 de agosto como o primeiro olhar público sobre a arquitetura Qwen4, e a Tencent libertou o Hy4 Preview a 28 de agosto, 770 mil milhões de parâmetros sob Apache 2.0. Abaixo estão os vencedores por categoria de setembro de 2026. Clique em qualquer cartão para saltar diretamente para a análise completa, ou utilize a navegação fixa para passar de categoria em categoria. As classificações, benchmarks e preços são atualizados no prazo de 48 horas após o lançamento de qualquer modelo importante.

Vencedores por categoria de setembro de 2026
Escrita
Claude Fable 5
#1 Arena texto (1508.6) e Arena escrita criativa
O único modelo entre os três primeiros dos três quadros independentes de escrita, a $10 / $50.
Análise aprofundada →
Chat & assistente do dia a dia
GPT-5.6
Modelo predefinido do ChatGPT desde 9 de julho
O melhor assistente que a maioria das pessoas consegue realmente abrir, equilibrando capacidade, velocidade e alcance.
Análise aprofundada →
Imagens
ChatGPT Images 2.0
#1 em texto para imagem e em edição de imagens
Lidera os dois quadros independentes de imagem e continua a ser o melhor em texto multilíngue legível.
Análise aprofundada →
Vídeo
Gemini Omni Flash
#1 nos dois quadros de vídeo (1527 Arena)
Lidera os dois quadros independentes de vídeo com edição conversacional a cerca de $0.10 por segundo.
Análise aprofundada →
Programação
Claude Opus 5
#1 Arena WebDev (1,702.9) a $5 / $25
Assume a coroa da programação nos quadros por votos, a metade do preço do Claude Fable 5.
Análise aprofundada →
Criatividade
Grok 4.6
Menos restrições de conteúdo + X nativo em tempo real
A escolha para trabalho ousado e na moda: menos barreiras e integração nativa com o X.
Análise aprofundada →
Precisão & investigação
Gemini 3.1 Pro
98 % no ARC-AGI-1 a $0.52 por tarefa
Iguala o painel humano no ARC-AGI-1 com ancoragem nativa na Pesquisa Google para respostas em direto.
Análise aprofundada →
Resolução de problemas
GPT-5.6 Sol
#1 LiveBench Mathematics, Reasoning e ARC-AGI-2
A coroa mais bem fundamentada desta página para a matemática, a ciência e o raciocínio mais difíceis.
Análise aprofundada →
Agentes de IA
Gemini Spark
Primeiro agente de IA residente na cloud 24/7
Funciona continuamente numa VM da Google Cloud, profundamente integrado com o Gmail, o Docs e o Chrome.
Análise aprofundada →

Quer os melhores modelos de IA sem fazer malabarismos com subscrições separadas? O Fello AI reúne os principais modelos numa aplicação nativa para Mac, iPhone e iPad.

Descarregar Fello AI
Novidades de setembro de 2026
1 set. Anthropic Claude Fable 5.1 e Mythos 5.1, um novo #1 na Artificial Analysis com 66 e um corte de 75 % nas leituras de cache Novo
A Anthropic lançou o Claude Fable 5.1 e o Claude Mythos 5.1 a 1 de setembro de 2026, e são um modelo em duas configurações de salvaguardas, não dois modelos. O Fable 5.1 está disponível para todos; o Mythos 5.1 alivia as restrições em biologia e cibersegurança e é distribuído por convite, sem critérios de elegibilidade publicados. A Artificial Analysis pontua o Fable 5.1 com 66 no seu Intelligence Index v4.1.1 em effort max, a pontuação mais alta que alguma vez mediu, à frente do Claude Opus 5 com 63, do Claude Fable 5 com 62 e do GPT-5.6 Sol e do Grok 4.6 com 61. Arrebata também o Agentic Index com 61 contra os 59 do Opus 5, o quadro GDPval-AA v2 de entregáveis profissionais com 1853 contra 1824, e o Humanity's Last Exam com 59,1 % contra os 55,5 % do Fable 5. A definição de effort pesa aqui mais do que é habitual: o mesmo modelo marca 58 em low, 60 em medium, 62 em high e 65 em xhigh, e essas definições abrangem uma diferença de onze vezes nos tokens de saída, de 13,1 milhões a 143,7 milhões em todo o conjunto. Os preços mantêm-se inalterados em $10 / $50 por 1M de tokens, mas as leituras de cache descem 75 % para $0.25, contra $1.00 no Fable 5, e é aí que está a verdadeira poupança nas execuções agênticas longas. Pelos números da própria Anthropic atinge 52,6 % no Terminal-Bench-Science 0.1 contra os 29,0 % do Opus 5, e o system card de 212 páginas subiu a avaliação de risco de alinhamento da própria empresa de muito baixo para baixo. Duas coisas a pesar antes de mudar: a Anthropic continua a recomendar começar pelo Opus 5 para a maioria das cargas, a metade do preço, e nenhum quadro da Arena tem votos para qualquer um dos modelos, pelo que nada do que nesta página assenta na preferência humana se mexeu. Todos os detalhes na nossa análise do Claude Fable 5.1 e do Mythos 5.1.
28 ago. Z.ai Os pesos do GLM 5.3 já saíram após a pausa de segurança, mas a licença não é MIT Novo
A Z.ai publicou os pesos do GLM 5.3 no Hugging Face a 28 de agosto de 2026, duas semanas depois do lançamento da API e exatamente na data que o marcador de posição indicava, pelo que a avaliação de segurança prometida aconteceu mesmo e a pausa fica fechada em vez de em aberto. O que mudou foi a licença. O GLM 5.3 Flash tinha saído sob MIT puro dois dias antes; o modelo de topo traz um documento próprio intitulado GLM 5.3 License, e o campo de licença da ficha do modelo diz glm-5.3 e não mit. A concessão de direitos segue de perto o MIT, com direito a executar, implementar, afinar, modificar, distribuir e vender, e com os pesos explicitamente incluídos na definição do software, pelo que o uso comercial fica aberto a quase toda a gente. Uma cláusula é realmente nova: um operador de model-as-a-service cuja receita ultrapasse os 10 mil milhões de dólares em quaisquer doze meses consecutivos tem de passar uma revisão de segurança da Z.ai antes de implementar comercialmente, reservando-se a Z.ai o direito de determinar sozinha o âmbito e o método dessa revisão. Repare ainda que o Hugging Face conta o checkpoint publicado em 753B parâmetros, contra a base de 744B que a Z.ai diz partilhar com o GLM-5.2; é o tipo de diferença que uma contagem mecânica de parâmetros produz, não a prova de um modelo diferente. Isto não move a nossa escolha open-weight. O GLM 5.3 Flash continua a ser o modelo que alojaríamos, porque 320B sob MIT puro é bastante mais fácil de operar e de resolver juridicamente do que 753B sob uma licença própria. Todos os detalhes na nossa análise do GLM 5.3.
28 ago. Tencent Tencent Hy4 Preview, 770B de pesos abertos sob Apache 2.0 e o maior modelo permissivo até agora Novo
A Tencent lançou e abriu o Hy4 preview a 28 de agosto de 2026, o novo modelo de topo da sua linha Hunyuan e o maior modelo alguma vez publicado sob Apache 2.0. Corre com 770 mil milhões de parâmetros no total e 49 mil milhões ativos por token numa arquitetura mixture-of-experts, aceita uma janela de contexto que a Tencent descreve como superior a 1M de tokens, e é distribuído com uma build FP8 a par dos pesos em precisão total. O preço da API é $0.834 por 1M de tokens de entrada, $2.501 de saída e $0.042 de entrada em cache, o que é barato para este tamanho. A licença é a verdadeira notícia: o Apache 2.0 é mais permissivo do que o documento próprio do Kimi K3 e do que a licença que a Z.ai juntou ao GLM 5.3 no mesmo dia. Trate a alegação de qualidade com cuidado, porque a única prova até agora é a do fabricante. A Tencent fez uma avaliação cega interna de 203 tarefas de engenharia pontuadas por 163 especialistas, e o Hy4 preview obtém aí 2,99 em 4,00 contra 2,94 do Kimi K3 e 2,92 do GLM 5.3. É o painel da própria Tencent, as margens cabem numa décima de ponto, e nenhuma casa independente publicou ainda um Intelligence Index ou uma classificação da Arena, pelo que o listamos em vez de o classificar. A Tencent afirma ainda que o modelo ajudou a automatizar a otimização do seu próprio processo de treino e elevou o seu próprio débito de inferência em 31,8 % medidos. Está disponível como pesos abertos e através do WorkBuddy, CodeBuddy, Yuanbao e ima, além do Tencent Cloud TokenHub e do OpenRouter, com acesso gratuito no WorkBuddy e no CodeBuddy durante duas semanas a contar do lançamento.
26 ago. Z.ai GLM 5.3 Flash, o Ox Alpha revelado, e os primeiros pesos MIT que a Z.ai publica desde o GLM-5.2 Novo
A Z.ai lançou o GLM 5.3 Flash a 26 de agosto de 2026, e não é o modelo por que o setor esperava. Os pesos retidos a 14 de agosto pertencem ao GLM 5.3; este é um modelo à parte sobre uma base recém-treinada, 320 mil milhões de parâmetros com 18 mil milhões ativos, o primeiro modelo nativamente multimodal da linha GLM-5, e chegou ao Hugging Face sob licença MIT no mesmo dia. É também o modelo furtivo que servia tráfego no OpenRouter com o nome Ox Alpha, executado durante essa pré-visualização inteiramente em chips de IA chineses, o que descreve como foi servido, não como foi treinado. A Artificial Analysis pontua-o com 57 no Intelligence Index v4.1.1, quatro pontos acima do GLM-5.2 com menos de metade do tamanho, e coloca-o na fronteira de Pareto entre inteligência e custo, a cerca de $0.09 por tarefa do índice. O preço de tabela é $0.15 / $0.50 por 1M de tokens, com uma promoção de lançamento de 50 % até às 24:00 de 9 de setembro, e depois da subida da DeepSeek de 16 de agosto esse preço de tabela fica abaixo do DeepSeek V4-Flash 0731 a qualquer hora do dia. Trate os números de programação e agênticos com cuidado: vêm do gráfico da própria Z.ai, que escolhe o Claude Opus 4.8 e o GPT-5.6 Terra como comparação em vez dos líderes atuais, e nele lê-se Terminal Bench 2.1 84,3, DeepSWE v1.1 63,4 contra 46,2 do GLM-5.2 e AutomationBench 48,8. O único número desse gráfico medido pela Artificial Analysis é o GDPval-AA v2, onde o GLM 5.3 Flash atinge 1773 Elo, o mais alto ali representado. Ainda não há votos na Arena. Isto move de facto a nossa escolha open-weight: o GLM 5.3 Flash substitui o GLM-5.2 como o modelo MIT que alojaríamos. Um aviso sobre hardware: 18B ativos não significa 18B para alojar, porque o encaminhamento mixture-of-experts precisa dos 320B de pesos residentes, pelo que se trata de um servidor multi-GPU e não de uma estação de trabalho. Todos os detalhes na nossa análise do GLM 5.3 Flash.
26 ago. Alibaba Qwen3.8-Flash-Next, pesos abertos e o primeiro olhar público sobre a arquitetura Qwen4 Novo
A Alibaba publicou o Qwen3.8-Flash-Next no Hugging Face a 26 de agosto de 2026, e o que aqui conta é mais a arquitetura do que a tabela de pontuações: a Qwen apresenta-o como um olhar antecipado sobre o desenho que a família Qwen4 vai usar, publicado para que a comunidade se possa preparar. É um mixture-of-experts de 125 mil milhões de parâmetros com apenas 6 mil milhões ativos por token, mais um embedding de N-gramas à parte com 51 mil milhões de parâmetros, e aceita texto, imagem e vídeo. O contexto é de 262 144 tokens de forma nativa, extensível até 1M. Entre os números publicados pela Qwen estão 91,7 no GPQA Diamond, 62,5 no SWE-Bench Pro, 58,7 no DeepSWE 1.1, 81,0 no SWE-Bench Multilingual e 84,5 no AndroidWorld vision, todos do fabricante, ainda sem Intelligence Index independente e sem votos na Arena. Convém ler a licença antes de construir sobre ela, porque não é Apache. A Qwen Community License 1.0 permite uso comercial, modificação e alojamento, mas exige mostrar de forma visível o nome do modelo assim que um produto ultrapasse os 100 milhões de utilizadores ativos mensais ou os 20 milhões de dólares de receita mensal, e exige uma licença à parte da Qwen para explorar um negócio de model-as-a-service ou de assistente de trabalho com IA. O uso interno está isento dessa segunda condição.
21 ago. OpenAI GPT-5.6 Sol desce mais de 20 % e fica abaixo do Claude Opus 5 dos dois lados Novo
A OpenAI reduziu o GPT-5.6 Sol de $5 / $30 para $4 / $20 por 1M de tokens a 21 de agosto de 2026, a primeira descida no modelo de topo desde o lançamento da família GPT-5.6 em julho. A taxa é promocional e a OpenAI diz que dura cerca de três meses. Abrange a API e os créditos do Codex e do ChatGPT Work; os preços de subscrição do Plus, Pro e Business não mudam. A $4 / $20, o Sol fica agora abaixo do Claude Opus 5 a $5 / $25 tanto no input como no output, a primeira vez que o modelo de topo da OpenAI é o mais barato dos dois.
16 ago. DeepSeek A DeepSeek sobe os preços da API cerca de quatro vezes e divide a tabela em horas de ponta e fora de ponta Novo
A DeepSeek passou os seus dois modelos V4 para uma nova tabela de preços às 16:00 UTC de 16 de agosto de 2026, e a direção é invulgar neste setor: os preços subiram, cerca de quatro vezes em hora de ponta. O V4-Flash 0731 passou de $0.14 / $0.28 fixos por 1M de tokens para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta, e o V4-Pro 0813 de $0.435 / $0.87 para $0.66 / $1.98 fora de ponta e $1.32 / $3.96 em hora de ponta, com a entrada em cache a $0.007 e $0.022 fora de ponta respetivamente. A hora de ponta vai das 01:00 às 04:00 e das 06:00 às 10:00 UTC, de segunda a sexta, e qualquer outra hora é fora de ponta, a exatamente metade do preço de ponta. A DeepSeek apresentou a mudança como uma repartição mais razoável da capacidade. Nada mudou nos modelos em si, pelo que se trata de um acontecimento puramente económico, mas de peso para esta página: custa ao DeepSeek V4-Flash a escolha de relação preço-desempenho, que passa para o GLM 5.3 Flash a $0.15 / $0.50 de tabela, um preço que fica abaixo até do valor fora de ponta da DeepSeek a qualquer hora do dia. Os pesos continuam sob MIT, pelo que quem o aloja por conta própria não é afetado. Todos os detalhes na nossa análise do DeepSeek V4.
14 ago. Z.ai GLM 5.3, um grande salto agêntico só com pós-treino, lançado sem os open weights Novo
A Z.ai lançou o GLM 5.3 a 14 de agosto de 2026, e o que é notável é o que não mudou: corre sobre a mesma base de 744 mil milhões de parâmetros do GLM-5.2, sem novo pré-treino. Todo o ganho vem de pós-treino à escala, e o agêntico é grande. No próprio gráfico da Z.ai, o Terminal-Bench 3.0 passa de 4,6 para 28,3, o DeepSWE v1.1 de 46,2 para 66,9 e o CyberGym de 77,2 % para 84,5 %, o que, segundo a empresa, supera à tangente o Claude Mythos 5 com 83,8 e o GPT-5.6 Sol com 83,6. Todos estes números são do fabricante, ainda sem auditoria independente, e o gráfico é menos lisonjeiro noutros pontos: no Code Bench interno da Z.ai, o Claude Fable 5 continua a liderar com 39,5 % contra 31,4 % do GLM 5.3, e no ExploitBench os líderes frontier estão nos 78,0 % contra 54,4 %. O senão é a licença, não a pontuação. O GLM-5.2 publicou pesos com licença MIT em poucos dias; o GLM 5.3 saiu sem nenhum, e a Z.ai disse que chegariam após uma avaliação de segurança da capacidade do modelo para descobrir vulnerabilidades, dentro de cerca de duas semanas. Isso resolveu-se a 28 de agosto de 2026, quando a Z.ai publicou os pesos exatamente na data que o marcador de posição indicava, ainda que sob uma GLM 5.3 License própria em vez do MIT puro que o GLM-5.2 e o GLM 5.3 Flash receberam. O preço por token já está publicado, $1.40 / $4.40 por 1M de tokens, a par do GLM Coding Plan e do ZCode. O que chegou a 26 de agosto foi, em vez disso, o GLM 5.3 Flash, um modelo diferente e mais pequeno que publicou mesmo pesos MIT, e é esse lançamento que moveu a nossa escolha open-weight. Todos os detalhes na nossa análise do GLM 5.3.
13 ago. Google Gemini 3.7 Flash, as pontuações de programação sobem e o preço desce para metade, $0.75 / $3.75, até janeiro Novo
A Google lançou o Gemini 3.7 Flash a 13 de agosto de 2026, 23 dias depois do 3.6 Flash e como o seu terceiro lançamento Flash em menos de dois meses, enquanto o Gemini 3.5 Pro continua por sair. Os ganhos em programação são o essencial: o DeepSWE v1.1 sobe de 49,0 % para 65,3 %, o FrontierCode 1.1 Main de 34,4 % para 43,6 %, e o AutomationBench quase duplica, de 17,0 % para 30,4 %. A Artificial Analysis pontua-o com 56 no seu índice v4.1.1 contra 52 do 3.6 Flash, e coloca-o em primeiro entre 182 modelos na velocidade de saída com 385,1 tokens por segundo, o que o coloca na fronteira de Pareto entre inteligência e tempo. A janela de contexto e o limite de saída de 64K mantêm-se face ao 3.6 Flash, pelo que nada foi sacrificado. Duas ressalvas pesam mais do que os benchmarks. O valor de $0.75 / $3.75 é introdutório e expira a 31 de dezembro de 2026, após o que duplica para $1.50 / $7.50, exatamente o que o 3.6 Flash custava no lançamento; a Google passou também o 3.6 Flash para o mesmo valor, pelo que ambos custam agora o mesmo e a atualização é uma decisão puramente de capacidade. E o acesso de consumo passa apenas pelo Spark, que exige Google AI Pro ou Ultra e exclui o Espaço Económico Europeu, o Reino Unido, a Suíça e a Nigéria, pelo que a maioria dos leitores europeus não lhe consegue chegar na aplicação Gemini. O nível gratuito do Gemini continua a receber o 3.6 Flash. O acesso por API não é afetado em lado nenhum. Todos os detalhes na nossa análise do Gemini 3.7 Flash.
12 ago. SpaceXAI Grok 4.6, o pós-treino sobe o Intelligence Index de 56 para 61 com $2 / $6 inalterados Novo
A SpaceXAI lançou o Grok 4.6 a 12 de agosto de 2026, e não é explicitamente um novo modelo base: a empresa manteve a fundação do Grok 4.5 e comprou os ganhos com uma fase de treino suplementar mais longa, trajetórias de afinação regeneradas e aprendizagem por reforço em ambientes agênticos. Não foi publicada qualquer arquitetura nova nem contagem de parâmetros. A Artificial Analysis pontua-o com um Intelligence Index de 61, cinco pontos acima do Grok 4.5, o que o coloca empatado com o GPT-5.6 Sol no terceiro lugar, atrás do Claude Opus 5 com 63 e do Claude Fable 5 com 62, tal como o índice estava nesse mês; o Claude Fable 5.1 passou desde então acima dos três com 66. Os números agênticos são mais fortes do que o índice composto: um Elo de 1753 no GDPval-AA v2 atrás apenas do Opus 5, 88,4 % no Terminal-Bench v2.1 e 50,7 % no tau3-Banking. O verdadeiro argumento é a eficiência, a $0.84 por tarefa de índice e cerca de 53 voltas e 0,5 mil milhões de tokens de entrada em trabalhos longos, contra cerca de 103 voltas e 2,0 mil milhões do Opus 5. Os preços mantêm-se inalterados em $2 / $6 por 1M de tokens com entrada em cache a $0.50, na mesma janela de contexto de 500K tokens, mas há uma armadilha que convém conhecer: assim que um prompt atinge os 200 000 tokens, a SpaceXAI volta a faturar o pedido inteiro a $4 / $12, e não apenas o excedente. Um aviso quanto à cobertura dos benchmarks, porque muita imprensa já a baralhou: o Terminal-Bench v3.0 é um teste diferente e bastante mais difícil do que a v2.1, pelo que 26 % na v3.0 e 88,4 % na v2.1 são ambas afirmações verdadeiras sobre o mesmo modelo. Está disponível desde o primeiro dia na API da SpaceXAI, no Cursor e no Grok Build, e em parceiros como OpenRouter, Vercel e Cloudflare. Todos os detalhes na nossa análise de benchmarks e preços do Grok 4.6.
5 ago. Meta Muse Spark 1.2 e Muse Code, Intelligence Index de 51 para 57 a um valor inalterado de $1.25 / $4.25, mais um agente de programação em terminal Novo
A Meta lançou o Muse Spark 1.2 a 5 de agosto de 2026 a par do Muse Code, o seu primeiro agente de programação em terminal, que funciona em macOS e Linux sem aplicação de ambiente de trabalho e sem subscrição. A Artificial Analysis pontua o modelo com um Intelligence Index de 57 na sua definição de raciocínio mais elevada no seu índice atual v4.1.1, contra 51 para a 1.1 e 43 para a versão de abril, e quase todo esse ganho é agêntico em vez de conhecimento geral; o seu Elo GDPval-AA v2 saltou de 1371 para 1631 enquanto o Terminal-Bench v2.1 passou apenas de 78 % para 80 %. O preço mantém-se inalterado em $1.25 / $4.25 por 1M de tokens sobre uma janela de contexto de 1M de tokens, e a Meta acrescentou um nível Contributor a $0.10 / $0.20, cerca de 92 % mais barato, em troca de permitir que a Meta treine com os seus prompts e completions. A disponibilidade alargou-se do acesso antecipado apenas para os EUA sob o qual a 1.1 foi lançada para um acesso global ampliado através do Muse Code, da Meta Model API e do OpenRouter. Nos próprios gráficos de lançamento da Meta, o modelo termina em segundo atrás do Claude Opus 5 nos três benchmarks de programação que publicou, com 82,9 % contra 86,7 % no Terminal-Bench 2.1.
3 ago. Alibaba Qwen 3.8 (Qwen3.8-Max), modelo de topo multimodal de 2,4 biliões de parâmetros agora disponível para todos a $2 / $6 Novo
A Alibaba disponibilizou o Qwen3.8-Max para todos a 3 de agosto de 2026, duas semanas depois de o apresentar em pré-visualização no WAIC Shanghai, e cada número que faltava na pré-visualização tem agora um valor por trás. Corre 2,4 biliões de parâmetros no total com cerca de 95 mil milhões ativos por token num desenho Mixture-of-Experts esparso, aceita texto, imagens e vídeo, e confirma uma janela de contexto de 1M de tokens com até 128K tokens de saída. O preço da API é de $2 / $6 por 1M de tokens, plano em todo o contexto em vez de escalonado por comprimento do prompt, com leituras em cache a $0.25. A afirmação «apenas atrás do Fable 5» divide-se agora nitidamente em duas: no quadro de visão da Arena é #2 com 1305, apenas atrás do Fable 5, mas no quadro de texto é #5 com 1496, atrás de quatro entradas da Anthropic. Ambas as pontuações da Arena continuam assinaladas como preliminares, e os open weights prometidos não chegaram. Mantemos o Qwen 3.8 fora das escolhas classificadas até os pesos e a licença chegarem de facto.
31 jul. DeepSeek DeepSeek V4-Flash 0731, mesmo preço, mesmo tamanho, Intelligence Index de 40 para 52
A DeepSeek voltou a pós-treinar o V4-Flash e publicou o resultado a 31 de julho de 2026 como DeepSeek-V4-Flash-0731. Nada na forma do modelo mudou: é o mesmo Mixture-of-Experts de 284B no total / 13B ativos, o mesmo contexto de 1M de tokens, a mesma licença MIT e, na altura, os mesmos $0.14 / $0.28 por 1M de tokens na própria tabela de preços da DeepSeek. Este último não sobreviveu ao mês: a DeepSeek subiu cerca de quatro vezes o preço dos seus dois modelos V4 a 16 de agosto e dividiu-os em preços de ponta e fora de ponta. O que se moveu foi a capacidade. A Artificial Analysis pontua-o agora com um Intelligence Index de 52 no seu índice v4.1.1, contra 40 antes do novo pós-treino, com Agentic 45,7 e 78,7 % no Terminal-Bench v2.1, o que o eleva de cerca do décimo terceiro para o terceiro lugar no campo aberto atrás do Kimi K3 e do GLM-5.2. A Artificial Analysis mediu-o em $0.11 por tarefa de índice contra $2.34 do Claude Opus 5, o que lhe valeu na altura a escolha de relação preço-desempenho; a subida de preços de 16 de agosto veio depois tirar-lha. Esse valor é medido no endpoint que a Artificial Analysis testa, mais caro do que a própria tabela de preços da DeepSeek. Uma limitação honesta: a pontuação vem de uma única casa, e o modelo ainda não tem votos em nenhum quadro da Arena.
31 jul. MiniMax MiniMax H3, vídeo 2K com áudio estéreo nativo a partir de $0.13 por segundo
A MiniMax lançou o H3 (Hailuo 3.0) a 31 de julho de 2026 como um modelo de vídeo multimodal de uso geral que aceita texto, imagem, vídeo e áudio como entrada. Produz clips 2K de 4 a 15 segundos com áudio estéreo nativo, suporta transferência de movimento, geração guiada por referência e edição de vídeo generativa, e é faturado por segundo a $0.13 para 2K e $0.09 para 768p. A Artificial Analysis coloca-o em #2 no seu quadro de vídeo com 1241,5, a 3,3 Elo do Gemini Omni Flash. Mantivemos a coroa do vídeo onde está: essa diferença tem um dia e vem do único quadro que não se reproduziu entre análises, e o corte de texto para vídeo da Arena é anterior ao H3 por completo, pelo que este não venceu nada nos votos. A MiniMax publicou os pesos a 3 de agosto de 2026, mas só em parte: o H3-Base juntamente com os VAE e o codificador saíram no Hugging Face sob a MiniMax H3 Community License, que exige um pedido aos utilizadores dos EUA, da UE, do Reino Unido e da Coreia do Sul, enquanto o H3-Context-IR e o upscaler H3-Regenerate-2K ficaram só na API. A saída 2K com que o modelo é vendido não está, portanto, na publicação aberta.
Final de jul. Thinking Machines Inkling Small, um quarto do tamanho do Inkling com uma pontuação quase igual
A Thinking Machines fez seguir o seu primeiro modelo open-weight com o Inkling Small, um Mixture-of-Experts de 276B no total / 12B ativos sob Apache 2.0 que encaminha cada token para 6 de 256 especialistas mais 2 partilhados. Aceita entrada de texto, imagem e áudio e devolve texto, e a Artificial Analysis pontua-o com um Intelligence Index de 40 contra 41 para o Inkling de tamanho completo, com cerca de um quarto dos parâmetros. As fontes não concordam quanto à data exata de publicação, pelo que não imprimimos nenhuma. Os pesos, uma build NVFP4 e as receitas de implementação estão todos no Hugging Face.
30 jul. OpenAI Descida de preço do GPT-5.6, Luna 80 % mais barato, Terra 20 % mais barato, Sol inalterado
A OpenAI reduziu o preço da API dos seus dois níveis GPT-5.6 mais baratos a 30 de julho de 2026, três semanas depois de a família ter atingido a disponibilidade geral. O Luna caiu 80 % para $0.20 / $1.20 por 1M de tokens e o Terra caiu 20 % para $2 / $12, com as leituras de entrada em cache a descerem para $0.02 no Luna e $0.20 no Terra. O modelo de topo Sol manteve-se em $5 / $30, os prompts acima de 272K tokens de entrada continuam a ser faturados a 2x a entrada e 1,5x a saída, e nenhum preço de subscrição do ChatGPT mudou, pelo que Free, Go a $8, Plus a $20, Pro a $100 e $200 e Business a $25-30 por lugar mantêm-se todos inalterados. A descida deixa o Luna num Intelligence Index de 52 no índice v4.1.1 da Artificial Analysis por cerca de $0.05 por tarefa de índice, ao mesmo nível do Gemini 3.6 Flash na pontuação e bem abaixo no custo.
24 jul. Anthropic Claude Opus 5, novo #1 na Artificial Analysis, lidera tanto o Intelligence Index (63) como o Agentic Index (55.3)
A Anthropic lançou o Claude Opus 5 a 24 de julho de 2026, o seu quarto modelo em menos de dois meses depois do Mythos 5, Fable 5 e Sonnet 5. No quadro de classificação da Artificial Analysis é o modelo mais bem classificado no geral, liderando tanto o Intelligence Index com 63 como o Agentic Index com 55,3, à frente do Fable 5 (62 / 52,8) e do GPT-5.6 Sol (61 / 54,0). O preço da API é de $5 / $25 por 1M de tokens, idêntico ao Opus 4.8 e metade do custo do Fable 5, sob a API id claude-opus-5. Acrescenta um modo Fast que corre cerca de 2,5x mais depressa ao dobro do preço base, mais uma definição de effort de low a high e um novo nível max. Também arrebata por completo o quadro GDPval-AA v2 de entregáveis profissionais da Artificial Analysis com 1858, à frente dos 1746 do Fable 5. A Arena classificou-o desde então nos seus quadros, colocando-o em #1 no WebDev, image-to-WebDev, Document e no quadro Agent e em #6 no texto, o que lhe valeu a coroa da programação este mês. É o modelo predefinido no Claude Max e o mais forte no Claude Pro. Note-se que a afirmação de liderança acima foi entretanto ultrapassada: o Claude Fable 5.1 chegou a 1 de setembro de 2026 e arrebatou o Intelligence Index com 66 e o Agentic Index com 61, contra 63 e 59 do Opus 5 na leitura atual, e com eles o quadro GDPval-AA v2, onde o Elo reajustado coloca o Fable 5.1 em 1853 contra os 1824 do Opus 5. O Opus 5 mantém os dois quadros de programação da Arena e custa metade.
24 jul. Sakana AI Fugu-Ultra v1.1, renovação do motor de orquestração com ganhos reportados pelo fornecedor de até 7,9 pontos sobre a v1.0 ao mesmo preço
A Sakana AI entregou o Fugu-Ultra v1.1 a 24 de julho de 2026, uma renovação dos modelos frontier dentro do seu motor de orquestração TRINITY em vez de um novo modelo base. O próprio anúncio da Sakana reivindica ganhos de até 7,9 pontos sobre a v1.0 a preço inalterado, mas não publica as pontuações da v1.0 lado a lado, pelo que trate isso como o número do fornecedor. Todos os números de benchmark vêm do scaffolding próprio da Sakana em vez de testes independentes: nos seus próprios gráficos lidera à frente do Opus 4.8, GPT-5.5 e Gemini 3.1 Pro, com 73,7 % no SWE-Bench Pro, 82,1 % no Terminal-Bench 2.1, 93,2 % no LiveCodeBench e 95,5 no GPQA-Diamond. Ainda assim não varre o campo: os seus 50,0 no Humanity's Last Exam são um empate por arredondamento com os 49,8 do Opus 4.8. O preço é inalterado face à v1.0 em $5 / $30 por 1M de tokens de entrada/saída (mais $0.50 em cache), subindo para $10 / $45 acima da marca de contexto de 272K tokens; a API é compatível com OpenAI com uma janela de contexto de 1M de tokens.
21 jul. Google Gemini 3.6 Flash, saída mais barata, mais rápido, mesmo Intelligence Index
O Gemini 3.6 Flash era o mais recente modelo Flash da Google quando saiu, e continua a ser aquele que a aplicação gratuita Gemini alcança. A saída cai para $7.50 por 1M de tokens desde $9.00 enquanto a entrada se mantém em $1.50, pelo que a redução é apenas na saída. A Google diz que «reduz a utilização de tokens de saída em 17 % face ao 3.5 Flash», e até 65 % em trabalho agêntico de longo horizonte como o DeepSWE, pelo que a poupança real por tarefa é maior do que o preço de tabela. A Artificial Analysis pontuou o 3.6 Flash e o 3.5 Flash de igual modo na v4.1, pelo que no lançamento era mais barato e mais rápido em vez de mais inteligente; no índice atual v4.1.1, o 3.6 Flash está nos 52. Chegou a par do Gemini 3.5 Flash-Lite a $0.30 / $2.50, e está em direto através da Gemini API no Google AI Studio e no Android Studio, na Gemini Enterprise Agent Platform e na aplicação Gemini para todos. Atenção: os preços de lançamento acima já não se aplicam. Quando o Gemini 3.7 Flash chegou a 13 de agosto, a Google passou o 3.6 Flash para o mesmo valor introdutório de $0.75 / $3.75, e continua a ser o modelo servido pelo nível gratuito do Gemini. A Google também anunciou o Gemini 3.5 Flash Cyber, mas esse não saiu: destina-se a governos e parceiros de confiança através do CodeMender como piloto de acesso limitado.
16 jul. Moonshot AI Kimi K3, 2,8B de parâmetros, o maior modelo open-weight alguma vez lançado (pesos publicados a 27 de julho)
A Moonshot AI lançou o Kimi K3 na véspera de 16 de julho de 2026, o seu novo modelo de topo e o sucessor da linha K2, e depois publicou os open weights completos a 27 de julho de 2026. O cartão de modelo no Hugging Face confirma um desenho Mixture-of-Experts de 2,8 biliões de parâmetros com 104 mil milhões de parâmetros ativos por token, uma janela de contexto de 1 048 576 tokens e entrada de texto, imagem e vídeo (sem áudio). O raciocínio está sempre ligado, e o reasoning_effort aceita agora low, high ou max, com max como predefinição. A Artificial Analysis coloca o K3 num Intelligence Index de 60, o mais alto de qualquer modelo open-weight, e na Arena é #3 no quadro Agent e #2 no WebDev atrás do Claude Opus 5. O preço oficial da API é de $3 / $15 por 1M de tokens com entrada em cache a $0.30, mais $0.005 por cada chamada de pesquisa na web bem-sucedida. A transferência são 96 shards safetensors e cerca de 1,56 TB sob uma licença própria Kimi K3 License em vez de MIT, pelo que o auto-alojamento é um trabalho multi-nó; existe um nível de chat básico gratuito na aplicação Kimi, com a utilização agêntica mais intensa medida nos planos pagos.
9 jul. OpenAI GPT-5.6 Sol, Terra e Luna, família de nova geração em direto no ChatGPT, Codex e na API
A OpenAI abriu a sua família GPT-5.6 à disponibilidade geral a 9 de julho de 2026, pondo fim à pré-visualização fechada de duas semanas que começou a 26 de junho por trás de uma revisão de segurança do governo dos EUA. A gama vai do menos ao mais capaz: Luna, um nível rápido e de baixo custo; Terra, um modelo equilibrado para o dia a dia que a OpenAI diz igualar o GPT-5.5 a cerca de metade do custo; e Sol, o modelo de topo, afinado para biologia, química e cibersegurança. O GPT-5.6 está agora a ser implementado no ChatGPT, Codex e na API como predefinição da OpenAI, com preços de API de lançamento de Sol $5 / $30, Terra $2.50 / $15 e Luna $1 / $6 por 1M de tokens; o Terra e o Luna foram reduzidos a 30 de julho de 2026 para $2 / $12 e $0.20 / $1.20, e o próprio Sol foi reduzido para $4 / $20 a 21 de agosto de 2026. Nos poucos benchmarks que a OpenAI publicou, o Sol obtém 88,8 % no Terminal-Bench 2.1 (91,9 % no seu modo «ultra» de maior computação) contra os 88,0 % do GPT-5.5, e 60,5 no HealthBench Professional; a OpenAI reteve notoriamente os habituais números do SWE-bench Verified, GPQA e FrontierMath, e a sua janela de contexto ainda não foi publicada oficialmente. Uma ressalva: o próprio system card da OpenAI e o avaliador externo METR assinalaram um comportamento de «scheming» elevado no Sol, incluindo a manipulação de um teste de engenharia de software à taxa mais alta que o METR alguma vez registou.
Pendente Google Gemini 3.5 Pro, ainda por lançar, meses atrasado segundo a Bloomberg Atrasado
O Gemini 3.5 Pro continua a ser o maior lançamento pendente. A Google anunciou-o na I/O a 19 de maio a par do Gemini 3.5 Flash, mas apenas o Flash saiu, e a meta de junho escorregou. A Bloomberg noticiou a 16 de julho de 2026 que o modelo está meses atrasado e ficou aquém das metas internas da Google, com a empresa ainda a trabalhar para melhorar as suas capacidades, em particular na programação. É este todo o quadro com fontes. A Google nunca confirmou publicamente uma data de lançamento, e a Google não publicou especificações finais como a janela de contexto ou os modos de raciocínio, pelo que trate os números em circulação como não confirmados. Utilize o Gemini 3.7 Flash entretanto se trabalhar através da API, ou o Gemini 3.6 Flash se estiver na aplicação gratuita Gemini, que continua a executá-lo; passaremos o 3.5 Pro para a classificação principal no momento em que entrar em direto.
Escolha de categoria, setembro de 2026

Melhor IA para escrita

1
Claude Fable 5
Melhor escrita no geral
2
Kimi K3
Ficção criativa
3
Claude Sonnet 5
Grátis para o dia a dia

A melhor IA para escrita é o Claude Fable 5, o único modelo entre os três primeiros dos três quadros independentes de escrita, com o Claude Sonnet 5 como escolha de relação qualidade-preço da versão gratuita e o GPT-5.5 como alternativa para escrita empresarial ancorada em factos. O Fable 5 lidera o quadro de escrita criativa da Arena, encabeça o LiveBench Language com 90,7 e fica em terceiro no EQ-Bench Creative Writing v3 atrás do Kimi K3 e do GPT-5.6 Sol. Nenhum outro modelo está entre os três primeiros em mais do que um deles. É uma mudança face ao mês passado, quando o Claude Sonnet 5 ocupava este lugar no GDPval-AA; os quadros de preferência não sustentam essa colocação, pelo que o Sonnet 5 é agora a escolha de relação qualidade-preço em vez do líder de qualidade. O Fable 5 custa $10 / $50 por 1M de tokens e está incluído em permanência no Claude Max e Team Premium a cerca de 50 % dos limites de utilização habituais. Se a sua escrita for um entregável de trabalho em vez de prosa, o quadro GDPval-AA v2 de entregáveis profissionais é agora liderado pelo Claude Fable 5.1 com 1853, à frente do Claude Opus 5 com 1824 e do Fable 5 com 1723. O Fable 5.1 chegou a 1 de setembro como o modelo mais capaz ao mesmo preço de $10 / $50, e bate o Fable 5 em todos os quadros que mediram ambos, incluindo o Humanity's Last Exam com 59,1 % contra 55,5 %. Não lhe demos a coroa porque esta escolha assenta na preferência humana e nenhum quadro da Arena o avaliou ainda. A tradução é uma questão à parte com um vencedor à parte, que analisamos no nosso guia sobre a melhor IA para tradução.

ModeloMelhor paraPonto fortePonto fracoPreço (por 1M de tokens)
Claude Fable 5Melhor escrita no geral#1 Arena texto no geral (1508.6), #1 LiveBench Language (90.7), #3 EQ-BenchA opção mais cara aqui$10 / $50
Claude Fable 5.1Capacidade máxima ao mesmo preço#1 Humanity's Last Exam (59,1 %), #1 GDPval-AA v2 (1853), #1 Intelligence Index (66)Sem votos na Arena por agora, logo sem classificação nos quadros de preferência$10 / $50
Kimi K3Ficção criativa e voz#1 EQ-Bench Creative Writing (2377), 234 Elo à frente do segundoApenas #10 na Arena escrita criativa$3 / $15
Claude Sonnet 5Escrita gratuita para o dia a diaGrátis e predefinido no claude.ai, contexto 1M#53 Arena escrita criativa; 75,0 LiveBench Language$2 / $10, agora permanente
Claude Opus 5Entregáveis profissionais com melhor preço#2 GDPval-AA v2 com 1824, à frente do Fable 5 (1723)Atrás do Fable 5 na Arena texto, atrás do Fable 5.1 no GDPval-AA v2$5 / $25
GPT-5.5Escrita empresarial ancorada em factosGanhos documentados de fiabilidade factual sobre o GPT-5.4Níveis de raciocínio agora marcados como obsoletos$5 / $30
Gemini 3.7 FlashRascunhos em massa à escalaSaída mais rápida de qualquer modelo medido (385,1 tok/s), Intelligence Index 56Afinado para código e não para prosa; o preço introdutório duplica a 1 de janeiro de 2027$0.75 / $3.75
Segundo lugar e alternativas: o Kimi K3 é o segundo para ficção criativa e vence o EQ-Bench por completo, o Claude Sonnet 5 é o segundo em relação qualidade-preço e o que utilizar se não pagar, o Claude Fable 5.1 é a escolha se quiser a capacidade medida mais alta ao mesmo preço do Fable 5, o Claude Opus 5 é a escolha mais barata para entregáveis profissionais, e o Gemini 3.7 Flash é a escolha para a redação de rascunhos em massa, agora o modelo mais rápido medido e ao mesmo preço do 3.6 Flash.
O que mudou este mês

A coroa da escrita fica com o Claude Fable 5, mas o argumento a seu favor estreitou-se a 1 de setembro. A Anthropic lançou o Claude Fable 5.1, que arrebata o Humanity's Last Exam com 59,1 % contra os 55,5 % do Fable 5, o quadro GDPval-AA v2 com 1853 e o Intelligence Index com 66. O que não tem é um único voto na Arena, e esta coroa assenta nos quadros de texto e de escrita criativa da Arena, onde o Fable 5 continua #1 com 1508.6 na data de fecho de 1 de agosto. O Fable 5.1 entra assim na tabela como a opção mais capaz ao mesmo preço de $10 / $50, e voltamos a testar a coroa assim que a Arena o avaliar. Dois números que demos no mês passado foram também reajustados: o AA-Omniscience marca agora 43 para ambos os modelos Fable em vez de 40, e a Artificial Analysis mede o Fable 5 no Humanity's Last Exam em 55,5 % em vez de 53,3 %.

Escolha de categoria, setembro de 2026

Melhor IA para chat & assistente do dia a dia

1
GPT-5.6
Predefinição do ChatGPT
2
Claude Fable 5
O mais bem avaliado
3
Claude Opus 5
Profundidade ponderada

A melhor IA para o chat do dia a dia é o GPT-5.6, e a razão honesta é o alcance em vez da posição nos quadros. É o modelo que o ChatGPT serve por predefinição à maior base de utilizadores da categoria, o que faz dele o melhor assistente que a maioria das pessoas consegue realmente abrir. Em preferência humana pura não é o líder: o GPT-5.6 Sol situa-se em #14 no quadro de texto da Arena com 1482,8, onde o Claude Fable 5 lidera com 1508.6. A maioria dos utilizadores do ChatGPT recebe o nível equilibrado Terra, que a OpenAI diz igualar o GPT-5.5 e que, desde a descida de preço de 30 de julho de 2026, custa 60 % menos. Está disponível dentro do ChatGPT (grátis com limites, Plus a $20/mês, Pro a $100/mês), através da API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 por 1M de tokens), e integrado dentro do Fello AI a par do Claude, Gemini, Grok e DeepSeek. Uma ressalva: o system card da OpenAI e o avaliador METR assinalaram um comportamento de «scheming» elevado no Sol, pelo que o GPT-5.5 Instant continua a ser a escolha mais segura para trabalho sensível a alucinações.

ModeloMelhor paraPonto fortePonto fracoPreço
GPT-5.6Chat do dia a dia, predefinição do ChatGPTO assistente que a maioria consegue abrir; o Terra iguala o GPT-5.5 a ~metade do custo#14 na Arena texto; scheming assinalado pelo METRGrátis / $20/mês Plus; API $0.20 / $1.20 a $4 / $20
Claude Fable 5A conversa mais bem avaliada#1 na Arena texto no geral (1508.6) e em 6 de 7 subcategoriasSem versão gratuita; acesso por créditos de utilização no Pro$10 / $50 API
Claude Opus 5Respostas ponderadas e matizadas#1 Artificial Analysis Intelligence Index (63) e Agentic Index (55.3)#6 na Arena texto, atrás do Claude Fable 5$20/mês Pro, $5 / $25 API
GPT-5.5 InstantTrabalho diário sensível a alucinações52,5 % menos afirmações alucinadas vs 5.3 InstantNíveis de raciocínio agora marcados como obsoletos$20/mês Plus; API $5 / $30
Gemini 3.6 FlashRápido, grátis, multimodalContinua a ser o modelo servido pelo nível gratuito do Gemini, contexto 1M, #12 na Arena textoMais fraco no raciocínio mais difícil; o 3.7 Flash supera-o ao mesmo preçoGrátis / $0.75 / $3.75 API
Fello AITodos os melhores modelos, uma aplicaçãoChatGPT + Claude + Gemini + Grok + DeepSeek e mais no Mac, iPhone e iPadEncaminhado pela aplicação, não direto$9.99/mês
Segundo lugar e alternativas: o Claude Fable 5 é o segundo e o verdadeiro líder de preferência, o Claude Opus 5 é o segundo para uma utilização diária ponderada, o Gemini 3.6 Flash é o segundo para rápido e grátis, e o Grok 4.6 é a escolha de nicho para os dias de notícias em direto. O Fello AI é a escolha natural se quiser os melhores modelos numa aplicação de Mac e iOS por $9.99/mês em vez de fazer malabarismos com subscrições.
O que mudou este mês

O GPT-5.6 mantém a escolha de chat pelo alcance, e a distância para o líder de preferência alargou-se em vez de se fechar. Na data de fecho de 1 de agosto o Sol situa-se em #14 na Arena texto com 1482,8, a descer de #11, enquanto o Claude Fable 5 lidera com 1508.6. Nada mudou quanto ao produto, pelo que a coroa não se move: continua a ser sobre qual o assistente que a maioria das pessoas consegue realmente abrir.

Escolha de categoria, setembro de 2026

Melhor IA para imagens

1
ChatGPT Images 2.0
Texto nas imagens
2
Reve 2.1
Layout & 4K
3
Muse Image
Edição de imagens

A melhor IA para a geração de imagens é o ChatGPT Images 2.0, e é a coroa menos contestada desta página. O GPT Image 2 lidera o quadro de texto para imagem da Arena com 1385 Elo e o seu quadro de edição de imagens com 1463, e a Artificial Analysis coloca-o em primeiro na sua própria arena de imagem com 1339,4. É a escolha natural sempre que a sua imagem tem de conter palavras legíveis, em português ou noutra escrita, e está incluído no ChatGPT Plus e Pro. Os segundos lugares mudaram. O Reve 2.1 (9 de julho) é o verdadeiro #2 em texto para imagem com 1302, e o Reve 2.0 situa-se agora atrás dele nos dois quadros. O Muse Image da Meta é #3 no quadro de texto para imagem da Arena e #2 em edição de imagens, o melhor desempenho que algum modelo de imagem da Meta alguma vez alcançou. O Nano Banana Pro da Google já não é o segundo no geral: em texto para imagem classifica-se entre #8 e #11, abaixo do seu próprio irmão mais barato Nano Banana 2, embora se coloque mais alto em edição de imagens.

ModeloMelhor paraPonto fortePonto fracoPreço
ChatGPT Images 2.0Imagens com texto legível#1 texto para imagem (1385) e #1 edição de imagens (1463)Menos fotorrealista do que a linha de imagem GeminiIncluído no ChatGPT Plus
Reve 2.1Layout, tipografia, 4K nativo#2 texto para imagem com 1302, edição que preserva o layoutEcossistema mais pequenoGrátis / a partir de $7.99/mês
Muse ImageEdição de imagens, ecossistema Meta#3 texto para imagem, #2 edição de imagens (1407)Novo, ferramentas escassas em redorAplicação Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Retratos e produtos fotorrealistasSupera o Nano Banana Pro nos dois quadrosMais fraco em texto dentro da imagemAplicação Gemini / AI Studio
Seedream 5.0 ProTexto multilíngue + edição por regiões10+ idiomas incl. árabe RTL, edição com laço e camadasSem benchmarks independentes; incerteza de direitos de autorBytePlus / Magnific
Midjourney v8Arte estilizada, ilustraçãoBase estética que a maioria dos artistas prefereMais fraco em texto dentro da imagem$10-$120/mês
Grok ImagineNSFW / Spicy ModeAs barreiras mais permissivasUm modelo mais pequeno por trás$30/mês SuperGrok
Segundo lugar e alternativas: o Reve 2.1 é o segundo no geral e a escolha para layout e tipografia, o Muse Image é o segundo para editar uma imagem que já tem, e o Nano Banana 2 é a escolha fotorrealista. O Grok Imagine continua a ser o único modelo frontier que permite conteúdo para adultos em Spicy Mode.
O que mudou este mês

A coroa da imagem está inalterada e o GPT Image 2 continua a liderar os três quadros que seguimos, na Arena texto para imagem (1385), Arena edição de imagens (1463) e na arena de imagem da Artificial Analysis (1339,4). O único acrescento é o MAI-Image-2.5 da Microsoft, que se situa em terceiro no quadro de imagem da Artificial Analysis com 1269,7 e em terceiro no quadro de edição de imagens da Arena, pelo que o terceiro lugar depende agora de qual a casa que lê.

Escolha de categoria, setembro de 2026

Melhor IA para vídeo

1
Gemini Omni Flash
#1 nos dois quadros de vídeo
2
MiniMax H3
2K + áudio nativo
3
Dreamina Seedance 2.0
O concorrente mais próximo

A melhor IA para a geração de vídeo é o Gemini Omni Flash, que lidera o quadro de texto para vídeo da Arena com 1527 Elo, 45 pontos completos à frente do segundo lugar, e também encabeça a arena de vídeo da Artificial Analysis. É #1 nas duas casas, algo que nenhum outro modelo de vídeo consegue. O preço vai de $1.50 na entrada e $17.50 por 1M de tokens de saída de vídeo, o que dá cerca de $0.10 por segundo de vídeo terminado, e suporta edição conversacional. O único limite real é a duração: o Omni Flash gera clips de 10 segundos. Se precisar de planos mais longos, o Veo 3.1 continua a ser a ferramenta certa dentro da aplicação Gemini, no AI Studio e no Vertex AI, com áudio nativo e saída 1080p. Isto substitui o Veo 3.1 no topo da categoria; o Veo 3.1 é um bom modelo mas não o líder, com a sua melhor variante em #6 no quadro de texto para vídeo da Arena. O candidato a vigiar é o MiniMax H3 (31 de julho), que gera clips 2K de 4 a 15 segundos com áudio estéreo nativo e é faturado por segundo a partir de $0.13 em 2K, já #2 no quadro de vídeo da Artificial Analysis com 1241,5. Não movemos a coroa por isso: a margem é de 3,3 Elo no único quadro que não se reproduziu entre análises, e o H3 continua sem votos no quadro de texto para vídeo da Arena.

ModeloMelhor paraPonto fortePonto fracoPreço
Gemini Omni FlashMelhor vídeo de IA no geral#1 nos dois quadros de vídeo (1527 Arena), edição conversacionalLimitado a gerações de 10 segundos~$0.10/s; aplicação Gemini / AI Studio
MiniMax H3Clips 2K com áudio nativo4-15 s em 2K, áudio estéreo nativo; #2 no AA vídeo (1241.5)Ainda sem votos na Arena; os pesos abertos excluem o upscaler 2K e exigem um pedido nos EUA, na UE, no Reino Unido e na Coreia do Sul$0.13/s em 2K
Dreamina Seedance 2.0O concorrente mais próximo#2 texto para vídeo (1482) e #1 em imagem para vídeo com áudio (1198)Ecossistema ByteDance, acesso ocidental limitadoDreamina / BytePlus
Muse VideoVídeo no ecossistema Meta#3 texto para vídeo com 1459O mais recente do grupo, ferramentas escassasAplicação Meta AI
Veo 3.1Clips de produção mais longosÁudio nativo, 1080p, forte consistência física#6 na Arena vídeo, não o líder de qualidadeGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboIteração rápida a menor custo4K nativo, 60fps, clips de 15 segundos; o Turbo saiu a 17 de junhoFora do top 16 na Arena texto para vídeoA partir de $10/mês
Luma Ray 3Cenas fotorrealistasForte realismo para paisagensComunidade mais pequenaGrátis / a partir de $9.99/mês
Segundo lugar e alternativas: o Dreamina Seedance 2.0 é o segundo no geral e bate o Omni Flash em imagem para vídeo com áudio, onde lidera 1198 contra 1191, embora o Omni Flash continue a liderar a variante sem áudio. O Muse Video é o terceiro, e o Veo 3.1 é a escolha quando 10 segundos não bastam. A OpenAI retirou a aplicação de consumo Sora 2 a 26 de abril de 2026 e resta apenas a API para programadores, até 24 de setembro de 2026.
O que mudou este mês

O Gemini Omni Flash mantém a coroa do vídeo, e continua a ser #1 nos dois quadros, com 1527,5 na Arena e 1244,8 na Artificial Analysis. O MiniMax H3 (31 de julho) entra como candidato em #2 no quadro de vídeo da Artificial Analysis (1241,5), a 3,3 Elo, e bate o Omni Flash em especificações com saída 2K, clips até 15 segundos e áudio estéreo nativo. Mantemos a coroa porque essa margem é de 3,3 Elo num único quadro e o H3 continua sem votos no quadro de texto para vídeo da Arena. A MiniMax abriu de facto os pesos a 3 de agosto, mas só o H3-Base juntamente com os VAE e o codificador; o upscaler 2K em que assenta a sua vantagem de especificações ficou só na API.

Escolha de categoria, setembro de 2026

Melhor IA para programação

1
Claude Opus 5
#1 Arena WebDev
2
Claude Fable 5
Longo horizonte mais difícil
3
Kimi K3
Apps web e agentes

A melhor IA para programação é o Claude Opus 5, e vence nos dois quadros onde os programadores votam no resultado final em vez de um script a medir um harness. É #1 no quadro WebDev da Arena com 1,702.9 e #1 em image-to-WebDev com 1,668.6, em cortes de votos de 1 de agosto e 31 de julho. O preço é a segunda metade do argumento: o Opus 5 corre a $5 / $25 por 1M de tokens contra os $10 / $50 do Claude Fable 5, e a Artificial Analysis mede-o em $2.34 por tarefa de índice contra os $3.14 do Fable 5. A própria documentação da Anthropic diz aos programadores para começarem com o Opus 5 para programação agêntica complexa e reservarem o Fable 5 para cargas que precisem da capacidade mais alta disponível. O Claude Fable 5 é o segundo e continua a ser a escolha para o trabalho de longo horizonte mais difícil, em #4 no WebDev (1,630.7) e #2 em image-to-WebDev (1,625.7); o seu sucessor de 1 de setembro, o Claude Fable 5.1, é o modelo mais forte nos benchmarks de harness ao mesmo preço, e atinge 55,8 % no Terminal-Bench 4.0 contra os 52,3 % do Opus 5 e os 42,0 % do Fable 5 pelos números da própria Anthropic, mas a Arena ainda não tem votos para ele. O candidato é o Kimi K3, que arrebata o #2 no WebDev com 1,675.5 e o #3 no quadro Agent da Arena, o programador open-weight mais forte dos quadros, embora auto-alojá-lo signifique 1,56 TB de pesos. No Coding Index da Artificial Analysis não é uma varrida da Claude: o GPT-5.6 Sol (xhigh) lidera com 78,3 com o Opus 5 (max) em 78,0, perto o suficiente para lhe chamar empate. O candidato sério mais barato é agora o GLM 5.3 Flash a $0.15 / $0.50 sob MIT, depois de a subida da DeepSeek de 16 de agosto ter levado o V4-Flash 0731 para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta, e a melhor relação qualidade-preço na própria frontier é o Grok 4.6, que marca 88,4 % no Terminal-Bench v2.1 e $0.84 por tarefa de índice a $2 / $6.

ModeloMelhor paraPonto fortePonto fracoPreço (por 1M de tokens)
Claude Opus 5Melhor programação no geral#1 Arena WebDev (1,702.9) e #1 image-to-WebDev (1,668.6); $2.34 por tarefa de índiceO Coding Index da Artificial Analysis tem o GPT-5.6 Sol um nadinha à frente$5 / $25
Claude Fable 5O trabalho agêntico de longo horizonte mais difícil#2 Arena image-to-WebDev (1,625.7), #4 WebDev; contexto 1MO mais caro; o Coding Index da Artificial Analysis coloca-o em 7.º$10 / $50
Claude Fable 5.1Programação agêntica de capacidade máxima#1 Intelligence Index (66) e #1 Agentic Index (61); 55,8 % no Terminal-Bench 4.0 (Anthropic)Sem votos na Arena por agora; o dobro do preço do Opus 5$10 / $50
Kimi K3Construção de apps web e agentes#2 Arena WebDev (1,675.5), #3 Arena Agent, Intelligence Index aberto mais alto (60)1,56 TB para auto-alojar$3 / $15
GPT-5.6 SolModelo de topo da OpenAI, programação agêntica#1 Artificial Analysis Coding Index com 78,3 (xhigh)Ausente do quadro oficial Terminal-Bench; manipulação de avaliações assinalada pelo METR$4 / $20
Muse Spark 1.2Programação agêntica barataIntelligence Index 57 a $1.25 / $4.25; 80 % no Terminal-Bench 2.1 (Artificial Analysis)Segundo atrás do Opus 5 nos três gráficos de programação próprios da Meta (82,9 % vs 86,7 %); a Scale SEAL só avaliou a 1.1$1.25 / $4.25
Grok 4.6Programador barato de boa relação qualidade-preço88,4 % no Terminal-Bench v2.1 e Intelligence Index 61, a $0.84 por tarefa de índiceOs prompts a partir de 200K tokens voltam a faturar o pedido inteiro ao dobro; taxa de alucinação mais alta$2 / $6
Gemini 3.7 FlashProgramação de agentes à escalaIntelligence Index 56, 65,3 % DeepSWE v1.1, 85,8 % Terminal-Bench 2.1, 385,1 tok/s14,9 % no mais difícil Terminal-Bench 3.0; o preço introdutório duplica a 1 de janeiro de 2027$0.75 / $3.75
GLM 5.3 FlashMelhor programador open-weight que consegue alojarIntelligence Index 57; DeepSWE v1.1 63,4 e Terminal Bench 2.1 84,3 (números do fabricante); MIT, 320B/18B ativosO Kimi K3 supera-o; os números de programação são do fabricante e ainda não tem votos na ArenaOpen weights (MIT)
Segundo lugar e alternativas: o Kimi K3 é o segundo no quadro WebDev da Arena e a escolha se quiser os open weights mais fortes, o Claude Fable 5 é o segundo para o trabalho de longo horizonte mais difícil, sendo o Claude Fable 5.1 a versão mais capaz dessa mesma escolha ao mesmo preço, o GPT-5.6 Sol é o segundo no compósito da Artificial Analysis, e o GLM 5.3 Flash é a escolha open-weight para equipas que o alojam elas próprias, num Intelligence Index de 57 sob MIT puro, e mantém esse lugar agora que os pesos do próprio GLM 5.3 chegaram sob uma licença própria da Z.ai e com mais do dobro do tamanho. Dentro dos IDE, o Cursor com o Claude continua a ser a combinação mais popular e o Claude Code é a escolha natural se vive no terminal.
O que mudou este mês

A coroa da programação passou para o Claude Opus 5. A Arena terminou de o avaliar, e ficou em primeiro nos dois quadros de programação, WebDev com 1,702.9 e image-to-WebDev com 1,668.6, com o Claude Fable 5 em quarto e segundo. São quadros por votos com cortes publicados, pelo que a coroa assenta agora em comparações humanas em vez de num único harness, e o Opus 5 fá-lo a metade do preço do Fable 5. O Fable 5 passa a ser o segundo para o trabalho de longo horizonte mais difícil, e o Kimi K3 continua a ser o candidato em #2 no WebDev. O Muse Spark 1.2 da Meta chegou a 5 de agosto e não muda isso, porque nos próprios gráficos da Meta termina em segundo atrás do Opus 5 em cada benchmark de programação que publicou. O Grok 4.6 (12 de agosto) também não leva a coroa, mas é o modelo a vigiar quanto a custo: atinge 88,4 % no Terminal-Bench v2.1 e termina os trabalhos agênticos longos em cerca de metade das voltas do Opus 5, a $2 / $6 contra $5 / $25. Logo a seguir chegaram mais dois lançamentos centrados em programação. O Gemini 3.7 Flash (13 de agosto) substitui o 3.6 Flash nesta tabela pela força de um salto de 49,0 % para 65,3 % no DeepSWE v1.1 a metade do preço anterior, e o GLM 5.3 (14 de agosto) regista o maior ganho agêntico do mês, o Terminal-Bench 3.0 de 4,6 para 28,3, mas saiu sem pesos transferíveis. A Z.ai fechou o mês abrindo outro modelo em vez disso: o GLM 5.3 Flash (26 de agosto) chegou sob MIT logo no primeiro dia com um Intelligence Index de 57, e tira ao GLM-5.2 o lugar open-weight na programação. Os últimos dias do mês trouxeram depois mais três lançamentos abertos: os pesos do próprio GLM 5.3 a 28 de agosto sob uma licença própria em vez de MIT, o Qwen3.8-Flash-Next da Alibaba a 26 de agosto como antevisão da arquitetura Qwen4, e o Hy4 Preview da Tencent, de 770B, a 28 de agosto sob Apache 2.0. Nenhum deles tem ainda classificação independente em programação, pelo que nenhum mexe nesta tabela. A Anthropic abriu depois setembro logo no dia 1 com o Claude Fable 5.1, que lidera o Intelligence Index e o Agentic Index da Artificial Analysis e marca 55,8 % no Terminal-Bench 4.0 contra os 52,3 % do Opus 5, mas a Arena não o avaliou, pelo que a coroa fica onde estão os votos.

Escolha de categoria, setembro de 2026

Melhor IA para criatividade

1
Grok 4.6
Menos barreiras
2
Claude Fable 5
Prosa da mais alta qualidade
3
Kimi K3
Ficção e voz

A melhor IA para trabalho criativo sem filtros e na moda é o Grok 4.6, e queremos ser exatos quanto ao porquê. Esta escolha é sobre o produto, não sobre a qualidade da prosa. O Grok tem as menos restrições de conteúdo de qualquer modelo frontier e a única integração nativa com o X em tempo real, o que faz dele o único modelo que se envolve com briefings ousados, atuais ou deliberadamente provocadores que os outros recusam. É o modelo predefinido na aplicação Grok para subscritores SuperGrok e X Premium+ a $30/mês. Não é o melhor escritor, e os quadros são diretos quanto a isso. O Grok 4.5 situa-se em #33 no EQ-Bench Creative Writing e #41 no quadro de escrita criativa da Arena, perdendo em ambos para o mais antigo Grok 4.20-beta1. Se escolher apenas pela qualidade da saída, o Claude Fable 5 vence por completo em #1 na Arena escrita criativa, e o Kimi K3 vence o EQ-Bench. Escolha o Grok 4.5 pelo que lhe permite criar, não por quão bem escreve.

ModeloMelhor paraPonto fortePonto fracoPreço
Grok 4.6Sem filtros, com opinião, na modaAs menos restrições de conteúdo, ancoragem nativa no X em tempo realOs quadros de escrita criativa ainda não o avaliaram; o Grok 4.5 estava em #33 EQ-Bench, #41 Arena$30/mês SuperGrok
Claude Fable 5Prosa criativa da mais alta qualidade#1 Arena escrita criativa, #1 LiveBench LanguageBarreiras cautelosas em briefings ousados$10 / $50 API
Kimi K3Ficção e voz distintiva#1 EQ-Bench Creative Writing com 2377Apenas #10 na Arena escrita criativa$3 / $15
Claude Opus 5Criatividade estruturada de formato longoMantém fios longos e autoedita-se; Intelligence Index 63, logo atrás do Claude Fable 5.1O mais cauteloso do grupo$20/mês Pro; $5 / $25 API
Gemini 3.1 ProCriativo multimodalForte cadeia de texto, imagem e vídeoQuotas dentro da aplicação GeminiGrátis / $2.00-$4.00 API entrada
Grok Imagine (Spicy Mode)NSFW / criativo para adultosA geração de imagens mais permissivaCaso de utilização de nicho$30/mês SuperGrok
Segundo lugar e alternativas: o Claude Fable 5 é o segundo e a escolha certa se a qualidade importar mais do que a liberdade, o Kimi K3 é a escolha para ficção, e o Claude Opus 5 é a escolha para projetos criativos que se estendem por muitos turnos. Para trabalho criativo para adultos, o Grok Imagine Spicy Mode continua a ser a única opção de nível frontier.
O que mudou este mês

O Grok mantém esta escolha, agora com o Grok 4.6, que a 12 de agosto substituiu o Grok 4.5 como modelo de topo da SpaceXAI. Nada mudou na sua permissividade nem no seu acesso em direto ao X, que é aquilo em que esta escolha assenta. O modelo por baixo é bastante mais forte, cinco pontos acima num Intelligence Index de 61, mas esse ganho aterrou na programação e no trabalho agêntico, não na prosa, e nenhum quadro de escrita criativa avaliou ainda o Grok 4.6. O Claude Fable 5 continua a ser o modelo a utilizar quando quer a melhor escrita.

Escolha de categoria, setembro de 2026

Melhor IA para precisão & investigação

1
Gemini 3.1 Pro
98 % ARC-AGI-1
2
Claude Fable 5
Pesquisa ancorada
3
GPT-5.6 Sol
Raciocínio inédito

A melhor IA para precisão e investigação é o Gemini 3.1 Pro. O seu resultado mais forte é no ARC-AGI-1 da ARC Prize, onde pontua 98 % e iguala o painel humano, e fá-lo a $0.52 por tarefa. Essa combinação é o argumento: vários modelos estão próximos em capacidade, nenhum o iguala no custo para trabalho factual fiável. Combina-o com ancoragem nativa na Pesquisa Google, o que quer quando a resposta tem de ser atual em vez de meramente plausível. Também pontua 94,1 % no GPQA Diamond, onde o GPT-5.6 Sol agora o iguala em vez de ficar atrás, e 44,4 % no Humanity's Last Exam, e encabeça o quadro HLE da Scale SEAL com 46,44. Abandonámos o enquadramento anterior via ARC-AGI-2: os seus 77,1 % continuam corretos, mas o quadro moveu-se e essa pontuação coloca-o agora à volta do 14.º lugar. Duas ressalvas honestas. Na pesquisa ancorada em concreto, o quadro de pesquisa da Arena é liderado pela Anthropic, não pela Google, com o Gemini 3.1 Pro com ancoragem em #7. E no raciocínio inédito, o GPT-5.6 Sol lidera o ARC-AGI-2 e o Claude Opus 5 lidera o ARC-AGI-3 com 30 %, cerca de 3,75x o modelo seguinte. Não movemos a coroa para o Opus 5 porque a Artificial Analysis mede a sua taxa de alucinação em 50 % e coloca-o abaixo do Fable 5 no AA-Omniscience, um quadro cujo topo o Claude Fable 5.1 partilha agora com ele.

ModeloMelhor paraBenchmark-chavePonto fracoPreço
Gemini 3.1 ProTrabalho factual barato e fiável98 % ARC-AGI-1 (iguala o painel humano) a $0.52/tarefa, 94,1 % GPQA (igualado pelo Sol)ARC-AGI-2 77,1 % agora ~14.º; #7 na Arena pesquisa$2.00-$4.00 / $12.00-$18.00 (escalonado)
Claude Fable 5Pesquisa ancorada#1 e #3 no quadro de pesquisa da Arena, à frente da GoogleSem um único nível barato$10 / $50 (Fable 5)
GPT-5.6 SolRaciocínio inédito#1 ARC-AGI-2 com 92,5 %, contra um painel humano de 100 %Scheming assinalado pelo METR$4 / $20
Claude Opus 5Os problemas inéditos mais difíceis#1 ARC-AGI-3 com 30 %, ~3,75x o modelo seguinte (ARC Prize)A Artificial Analysis mede uma taxa de alucinação de 50 %$5 / $25
Qwen 3.7 MaxPrecisão frontier a preço vantajoso92,4 GPQA Diamond, 200 pedidos grátis/diaApenas API, sem front-end de chat$1.25 / $3.75 promo; $2.50 / $7.50 tabela
Claude Opus 4.6Honestidade sob pressão#1 no quadro MASK da Scale SEAL com 96,28; a Anthropic ocupa o top 5Substituído como modelo de topoModelo legacy da Anthropic
Segundo lugar e alternativas: os modelos da Anthropic são o segundo para pesquisa ancorada e varrem o quadro de honestidade sob pressão, o GPT-5.6 Sol é o segundo para raciocínio inédito, e o Qwen 3.7 Max é a escolha de relação qualidade-preço na fronteira.
O que mudou este mês

O Gemini 3.1 Pro mantém a coroa da precisão, mas o seu número de destaque já não é uma vantagem. A sua pontuação GPQA Diamond foi reajustada para 94,1 % e o GPT-5.6 Sol iguala-o agora exatamente, pelo que a coroa assenta no resultado do ARC-AGI-1 a $0.52 por tarefa mais a ancoragem da Pesquisa em vez de no GPQA. Esta é a próxima coroa que voltamos a testar, e os quadros que medem quão frequentemente um modelo simplesmente erra mexeram-se a 1 de setembro. O Claude Fable 5.1 detém agora a precisão factual mais alta que a Artificial Analysis alguma vez mediu, 67 % contra os 65 % do Claude Fable 5, e encabeça o Humanity's Last Exam com 59,1 % contra 55,5 %. O próprio índice AA-Omniscience marca 43 para ambos os modelos, acima dos 40 que demos para o Fable 5 no mês passado, porque o 5.1 compra a sua precisão extra com uma taxa de tentativa mais alta nas perguntas que não sabe responder.

Escolha de categoria, setembro de 2026

Melhor IA para resolução de problemas

1
GPT-5.6 Sol
Modelo de topo STEM
2
Claude Opus 5
Cadeias agênticas
3
GPT-5.5 Pro
FrontierMath verificado

A melhor IA para a resolução de problemas difíceis é o GPT-5.6 Sol, e é a coroa mais bem fundamentada desta página. Arrebata o #1 no LiveBench Mathematics com 96,2, o #1 no LiveBench Reasoning com 91,7 e o #1 no ARC-AGI-2 com 92,5 %, o mais perto que algum modelo alguma vez chegou do painel humano de 100 %. Três casas distintas colocam-no em primeiro nas tarefas de raciocínio que importam, o que é mais concordância do que produz qualquer outra categoria desta página. A OpenAI ainda não publicou a pontuação FrontierMath do Sol, pelo que a marca OpenAI verificada continua a ser os 39,6 % do GPT-5.5 Pro no FrontierMath Tier 4, e inseriremos o número do Sol no momento em que for tornado público. O Qwen 3.7 Max é a alternativa de relação qualidade-preço para problemas de estilo competição com 97,1 no índice HMMT de fevereiro de 2026 e 44,5 no Apex, a uma fração do custo do ChatGPT Pro, e inclui agora 200 pedidos de modelo grátis por dia. O Claude Opus 5 é a alternativa para longas cadeias de raciocínio agêntico, com 59 no Agentic Index da Artificial Analysis, segundo atrás dos 61 do Claude Fable 5.1, e #1 no ARC-AGI-3 da ARC Prize com 30 %, cerca de 3,75x o modelo seguinte.

ModeloMelhor paraBenchmark-chavePonto fracoPreço
GPT-5.6 SolA matemática, a ciência e o raciocínio mais difíceis#1 LiveBench Mathematics (96.2), #1 LiveBench Reasoning (91.7), #1 ARC-AGI-2 (92,5 %)FrontierMath ainda por publicar; scheming assinalado pelo METR$100/mês ChatGPT Pro; API $4 / $20
Claude Opus 5Longas cadeias de raciocínio agêntico#2 Agentic Index (59), #1 ARC-AGI-3 (30 %)Segundo no LiveBench Reasoning; taxa de alucinação de 50 %$5 / $25
GPT-5.5 ProLíder verificado do FrontierMath39,6 % FrontierMath Tier 4Substituído pelo Sol como modelo de topo$100/mês ChatGPT Pro
Qwen 3.7 MaxMatemática de competição com orçamento apertado97,1 HMMT 2026 fev., 44,5 Apex, 200 pedidos grátis/diaApenas API$1.25 / $3.75 promo; $2.50 / $7.50 tabela
Claude Fable 5Matemática dentro de um fluxo de programação#1 na subcategoria de matemática da Arena (1543), 96,0 LiveBench MathematicsA opção mais cara aqui$10 / $50
GLM 5.3 FlashResolução de problemas open-weightIntelligence Index 57 sob MIT, quatro pontos acima do GLM-5.2 com menos de metade do tamanho; 320B/18B ativos, contexto 1MExige um servidor multi-GPU, não uma estação de trabalho; o GLM 5.3 pontua mais alto segundo os números da própria Z.ai e é transferível desde 28 de agosto, mas com mais do dobro do tamanho e sob uma licença própriaOpen weights (MIT)
Segundo lugar e alternativas: o Claude Opus 5 é o segundo e a escolha natural para raciocínio agêntico de cadeia longa, o Claude Fable 5 é o segundo no quadro de matemática da Arena, o Qwen 3.7 Max é a escolha de relação qualidade-preço, e o GLM 5.3 Flash é a escolha open-weight.
O que mudou este mês

O GPT-5.6 Sol mantém esta coroa, e ganhou um segundo argumento. O Sol lidera agora também o Terminal-Bench v2.1 da Artificial Analysis com 89,5 % e o seu Coding Index com 78,3, e iguala o Gemini 3.1 Pro no GPQA Diamond com 94,1 %. O Claude Opus 5 continua a ser a alternativa de raciocínio agêntico pela força do ARC-AGI-3. A 1 de agosto a OpenAI deu à sua próxima família de modelos o nome Astra e publicou dez novos resultados matemáticos de uma versão interna, embora o Astra não tenha sido lançado e não tenha data, preço nem disponibilidade. O Claude Fable 5.1 da Anthropic chegou a 1 de setembro e tirou o Agentic Index ao Opus 5, 61 contra 59, o que muda o número de apoio da alternativa, não a coroa.

Escolha de categoria, setembro de 2026

Melhor agente de IA

1
Gemini Spark
Cloud 24/7
2
Claude Cowork
IA de ambiente de trabalho
3
ChatGPT Codex
Agente de programação

O melhor agente de IA neste momento é o Gemini Spark para trabalho residente na cloud 24/7 e o Claude Cowork para trabalho residente no ambiente de trabalho, com o ChatGPT Codex como alternativa para agentes de programação e os agentes de navegador de classe OpenAI Operator como alternativa para tarefas web. Os agentes de IA são a categoria que mais depressa se move em 2026: cada fornecedor de topo lança agora um produto de agente, e a escolha prática é entre agentes que vivem na cloud (funcionam enquanto o seu portátil está fechado) e agentes que vivem no seu ambiente de trabalho (conduzem as suas aplicações diretamente). O Gemini Spark foi lançado na Google I/O a 19 de maio de 2026 e é o primeiro agente na cloud 24/7. O Claude Cowork atingiu a disponibilidade geral a 9 de abril de 2026 e funciona como um agente de ambiente de trabalho que conduz as suas aplicações locais. O ChatGPT Codex Mobile (14 de maio) é a escolha para trabalho de agente de programação. Leia a comparação completa Gemini Spark vs Claude Cowork.

AgenteMelhor paraOnde funcionaPonto fortePreço
Gemini SparkTarefas na cloud 24/7, fluxos do WorkspaceVM da Google Cloud (sempre ativa)Primeiro verdadeiro agente 24/7, integração profunda com o Workspace$99.99/mês Google AI Ultra
Claude CoworkAmbiente de trabalho, condução de aplicações, design + códigoO seu ambiente de trabalho Mac/WindowsConduz aplicações locais, vê o seu ecrã$20/mês Claude Pro
ChatGPT Codex MobileAgente de programação no telemóvelCloud da OpenAI + iOS/AndroidAprovar diffs e reencaminhar o trabalho a partir do telemóvelIncluído nos planos ChatGPT
Grok Agentic (Grok 4.6)Investigação em tempo real, scraping do XCloud da SpaceXAIIntegração nativa com o X; Elo de 1755 no GDPval-AA v2$30/mês SuperGrok
OpenAI de classe OperatorTarefas de navegador, formulários webCloud da OpenAI + o seu navegadorAutomação webChatGPT Pro
Segundo lugar e alternativas: o Claude Cowork é o segundo no geral e a escolha natural quando quer o agente na sua máquina a conduzir as suas aplicações. O ChatGPT Codex Mobile é o segundo para agentes de programação. O Grok Agentic é a escolha de nicho para investigação em tempo real.
O que mudou este mês

Não saíram novos agentes de consumo, e o Muse Code da Meta (5 de agosto) é uma ferramenta de terminal para programadores em vez de uma de consumo, pelo que a escolha entre o Gemini Spark (cloud) e o Claude Cowork (ambiente de trabalho) continua a guiar a maioria das decisões sobre agentes para utilizadores individuais. A camada de modelo por baixo deles moveu-se de novo: o Claude Fable 5.1 (1 de setembro) lidera agora o Agentic Index da Artificial Analysis com 61, à frente do Claude Opus 5 com 59, e encabeça o quadro GDPval-AA v2 com 1853 contra os 1824 do Opus 5. O Opus 5 continua a ser aquele sobre o qual a maioria das equipas deve construir, a $5 / $25, metade do preço do Fable 5.1, e encabeça o quadro Agent da Arena, com o Kimi K3 em terceiro. Para equipas que constroem os seus próprios agentes, o Muse Spark 1.2 da Meta (5 de agosto) é uma opção agent-native barata a $1.25 / $4.25 cujo Elo agêntico GDPval-AA v2 saltou de 1371 para 1631, embora a Scale SEAL só tenha avaliado a mais antiga 1.1, que lidera o seu quadro de utilização de ferramentas MCP Atlas com 88,1. O O GLM 5.3 Flash (26 de agosto, MIT) é agora o modelo de agente open-weight que alojaríamos, num Intelligence Index de 57 e com AutomationBench 48,8 no gráfico da própria Z.ai, onde o Claude Opus 4.8 fica nos 41,0, ainda que não tenha votos na Arena; o registo independente é do GLM-5.2, em #5 no quadro Agent da Arena. O Grok 4.6 (12 de agosto) é aqui a nova conta de custo em vez de um novo produto de agente: marca um Elo de 1755 no GDPval-AA v2, que as entradas de setembro empurraram para o quinto lugar entre modelos distintos, e a Artificial Analysis mede que termina os trabalhos de longo horizonte em cerca de 53 voltas e 0,5 mil milhões de tokens de entrada, contra cerca de 103 voltas e 2,0 mil milhões do Opus 5, a $0.84 por tarefa de índice.

Fello AI a funcionar no Mac, iPhone e iPad
Todos os melhores modelos de IA, uma aplicação

Os principais modelos como ChatGPT, Claude e Gemini, juntos no Mac, iPhone e iPad.

Grátis para começar, 4,7★ em mais de 27 000 críticas.

Descarregar Fello AI

Guia de utilização, setembro de 2026

Melhor IA para estudantes

1
GPT-5.5 Free
Ensaios & investigação
2
Gemini 3.6 Flash
STEM + PDFs
3
Claude Sonnet 5
Escrita & revisão

A melhor IA para estudantes é o GPT-5.5 Free dentro do ChatGPT para trabalho de curso geral e o Gemini 3.6 Flash Free dentro da aplicação Gemini para STEM e estudo multimodal, com o Qwen 3.7 Max como alternativa por API para conjuntos de problemas mais difíceis (200 pedidos grátis por dia) e o Claude Opus 5 como alternativa para revisão de ensaios. A maioria dos estudantes não precisa de pagar: o nível gratuito do ChatGPT usa agora o GPT-5.6 por predefinição (com o GPT-5.5 ainda disponível), o Gemini 3.6 Flash está na aplicação gratuita Gemini e no AI Studio, o Claude Sonnet 5 é a nova predefinição gratuita do Claude, e o DeepSeek V4 é grátis no site de chat da DeepSeek. Para o desenvolvimento passo a passo na matemática mais difícil, o GPT-5.6 Sol é o novo modelo de topo da OpenAI (a sua pontuação FrontierMath ainda não foi publicada, com os 39,6 % verificados do GPT-5.5 Pro no FrontierMath Tier 4 como marca atual), embora ambos sejam apenas pagos; o Qwen 3.7 Max é a alternativa de relação qualidade-preço com 97,1 no HMMT 2026 fevereiro com preço de API de $1.25 / $3.75 na sua promo atual de 50 % ($2.50 / $7.50 tabela).

TarefaMelhor modeloPorquêGrátis?Alternativa
Ensaios & trabalho de cursoGPT-5.5Grátis no ChatGPT, fiabilidade factual melhorada vs 5.4SimClaude Sonnet 5 (Claude grátis)
Resolução de problemas STEMGPT-5.6 Sol / Qwen 3.7 MaxNovo modelo de topo STEM (5.5 Pro: 39,6 % FrontierMath) / 97,1 HMMT 2026 fev.Pro pago / Qwen API pagoGemini 3.6 Flash (grátis)
Investigação & precisãoGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarefa, ancoragem nativa na Pesquisa GoogleSim (aplicação Gemini)Claude Opus 5
Revisão de escritaClaude Sonnet 5Grátis e predefinido no claude.ai; o Claude Fable 5 é o líder de qualidadeSim (Claude grátis)Claude Fable 5
Estudo multimodal (PDFs, slides, imagens)Gemini 3.6 FlashContexto 1M, grátis na aplicação GeminiSimNotebookLM (Google)
Segundo lugar e alternativas: o Claude Sonnet 5 (grátis) é o segundo para a escrita e revisão de ensaios. O Gemini 3.6 Flash (grátis) é o segundo para o estudo multimodal e a ingestão de PDF. O DeepSeek V4 é o segundo para a resolução de problemas com um orçamento estritamente de custo zero.
Guia de utilização, setembro de 2026

Melhor IA para o trabalho & profissionais

1
GPT-5.6
Trabalho de conhecimento diário
2
Claude Opus 5
Programação & escrita
3
Gemini 3.1 Pro
Investigação & briefings

A melhor IA para trabalho profissional é o GPT-5.6 (predefinição do ChatGPT desde 9 de julho) para trabalho de conhecimento diário, o Claude Opus 5 para programação e escrita de alto risco, e o Gemini Spark para fluxos agênticos 24/7. A maioria dos profissionais tira o máximo partido ao manter duas subscrições pagas (ChatGPT Plus a $20/mês mais Claude Pro a $20/mês, um total de $40/mês), ou ao consolidar com o Fello AI a $9.99/mês para os cinco melhores modelos numa aplicação de Mac/iOS. Para trabalho agêntico que corre enquanto dorme, o Gemini Spark no Google AI Ultra a $99.99/mês é o único verdadeiro agente na cloud 24/7.

Caso de utilizaçãoMelhor modeloDado-chavePreçoAlternativa
Trabalho de conhecimento diárioGPT-5.6Predefinição do ChatGPT desde 9 de julho; o assistente que a maioria consegue abrir$20/mês ChatGPT PlusClaude Opus 5
Programação (proprietária)Claude Opus 5#1 na Arena WebDev (1,702.9) e image-to-WebDev (1,668.6); a predefinição recomendada pela Anthropic$20/mês Claude ProClaude Fable 5
Programação (económica)Qwen 3.7 Max80,4 SWE-Verified, contexto 1M$1.25 / $3.75 promo; $2.50 / $7.50 tabelaDeepSeek V4-Flash 0731
Investigação & briefingsGemini 3.1 Pro98 % ARC-AGI-1 a $0.52/tarefa, ancoragem GoogleGoogle AI Pro / UltraClaude Opus 5
Matemática, física, modelação financeira difíceisGPT-5.6 SolNovo modelo de topo STEM da OpenAI (5.5 Pro verificado em 39,6 % FrontierMath)$100/mês ChatGPT ProQwen 3.7 Max
Fluxos de agente sempre ativosGemini SparkPrimeiro agente na cloud 24/7$99.99/mês Google AI UltraClaude Cowork
Notícias em direto, criativo com contexto do XGrok 4.6Intelligence Index 61 + ancoragem nativa no X$30/mês SuperGrokGemini 3.1 Pro
Consolidação tudo-em-umFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/mêsPagar a cada fornecedor em separado
Segundo lugar e alternativas: para a maioria das equipas profissionais, o Claude Opus 5 é o segundo atrás do GPT-5.6 para o trabalho diário e agora o líder da programação por completo a $5 / $25, com o Claude Fable 5 como o segundo para o trabalho de longo horizonte mais difícil. O Gemini 3.1 Pro é o segundo para funções com muita investigação, e o Gemini Spark é a escolha única se conseguir pôr um agente na cloud a trabalhar em tarefas longas.
Comparação de preços

Preços dos modelos de IA em setembro de 2026

De versões gratuitas a $0 até $199.99/mês do Google AI Ultra. O preço mais determinante desta tabela é o Claude Opus 5 a $5 / $25, porque é o segundo mais bem pontuado no Intelligence Index da Artificial Analysis a metade do custo dos dois modelos Fable à sua volta. O Claude Fable 5.1, que arrebatou o topo desse índice a 1 de setembro, mantém o mesmo preço de tabela de $10 / $50 do Fable 5, mas corta as leituras de cache em 75 % para $0.25, e é aí que está a poupança nas execuções agênticas longas, e não no preço de tabela. O Muse Spark 1.2 da Meta é listado a $1.25 / $4.25, com um nível Contributor a $0.10 / $0.20 para quem estiver disposto a deixar a Meta treinar com os seus prompts, e o Grok 4.6 é listado a $2 / $6, com a ressalva de que um prompt de 200 000 tokens ou mais volta a faturar o pedido inteiro a $4 / $12. A escolha de relação preço-desempenho mudou em agosto, e não porque algo tenha ficado mais barato: a DeepSeek subiu cerca de quatro vezes o preço dos seus dois modelos V4 a 16 de agosto, levando o V4-Flash 0731 de $0.14 / $0.28 fixos para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta. A escolha é agora o GLM 5.3 Flash a $0.15 / $0.50 de tabela, a metade do preço até 9 de setembro, que pontua 57 no Intelligence Index e fica abaixo até do valor fora de ponta da DeepSeek dos dois lados, a qualquer hora do dia. Na própria frontier, a escolha de valor é o Grok 4.6, com 61 por $0.84 por tarefa de índice, ao passo que o Opus 5 custa $2.34 e o GPT-5.6 Sol cobra $4 / $20 pela mesma pontuação após a descida de 21 de agosto. Entre os modelos fechados, o GPT-5.6 Luna é o mais barato a $0.20 / $1.20 após a descida da OpenAI de 30 de julho. Para uma análise mais aprofundada, consulte o nosso Guia completo de comparação de preços de IA.

ModeloEntrada (por 1M)Saída (por 1M)ContextoAcesso grátis?
GPT-5.5$5.00$30.001M (400K no Codex)ChatGPT Free; API paga
GPT-5.5 Pro$30.00$180.001MChatGPT Pro a partir de $100/mês (nível de maior utilização a $200)
GPT-5.6 Sol$4.00$20.00Não publicadoEm direto no ChatGPT, Codex & API (9 de julho)
GPT-5.6 Terra$2.00$12.00Não publicadoEm direto no ChatGPT, Codex & API (9 de julho)
GPT-5.6 Luna$0.20$1.20Não publicadoEm direto no ChatGPT, Codex & API (9 de julho)
Claude Opus 5$5.00$25.001MPredefinição no Claude Pro/Max; API paga
Claude Opus 4.8$5.00$25.001MModelo legacy na Anthropic; Pro/Max/API
Claude Fable 5.1$10.00$50.001MLeituras de cache $0.25; no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos. O Mythos 5.1 fatura de forma idêntica, apenas por convite
Claude Fable 5$10.00$50.001MPermanente no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos
Claude Sonnet 5$2.00$10.001MPredefinição no Claude Free & Pro; API paga
Claude Sonnet 4.6$3.00$15.001MAPI paga (substituído pelo Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MAplicação Gemini limitada; API paga
Gemini 3.7 Flash$0.75 introdutório / $1.50 a partir de 1/1/2027$3.75 introdutório / $7.50 a partir de 1/1/20271MAI Studio, Android Studio, Antigravity + API paga; na aplicação Gemini apenas via Spark (AI Pro/Ultra, exclui EEE/RU/CH/Nigéria)
Gemini 3.6 Flash$0.75 introdutório / $1.50 a partir de 1/1/2027$3.75 introdutório / $7.50 a partir de 1/1/20271MModelo predefinido da aplicação Gemini gratuita; AI Studio; nível API gratuito + API paga
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; nível API gratuito + API paga
Qwen 3.7 Max$1.25 promo / $2.50 tabela$3.75 promo / $7.50 tabela1M200 pedidos grátis/dia; API paga para além disso
MiniMax M3$0.30 (50 % de desconto sobre $0.60)$1.20 (≤512K)1MOpen weights; custos de alojamento aplicáveis
LongCat-2.0Depende do fornecedorDepende do fornecedor1MOpen weights (MIT); custos de alojamento aplicáveis
NVIDIA Nemotron 3 UltraDepende do fornecedorDepende do fornecedor1MOpen weights (OpenMDW); custos de alojamento aplicáveis
Qwen 3.5 (open-weight)Auto-alojamento / TogetherAuto-alojamento / Together1MOpen weights; custos de alojamento aplicáveis
Nex-N2-ProAuto-alojamento / fornecedoresAuto-alojamento / fornecedores1MOpen weights (Apache 2.0); custos de alojamento aplicáveis
Rio 3.5 Open 397BAuto-alojamento / fornecedoresAuto-alojamento / fornecedores1MOpen weights (MIT); custos de alojamento aplicáveis
Grok 4.3$1.25$2.501MPlano de consumo gratuito; API paga
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI da SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Muse Spark 1.2$1.25 ($0.10 nível Contributor)$4.25 ($0.20 nível Contributor)1MAPI paga; Muse Code, Meta Model API e OpenRouter; o nível Contributor troca direitos de treino por um desconto de ~92 %
Kimi K3$3.00 ($0.30 cache-hit)$15.001MNível básico gratuito na aplicação Kimi; open weights no Hugging Face (Kimi K3 License)
Gemini Omni Flash (vídeo)$1.50$17.50 (saída de vídeo)Clips de 10 segundosAplicação Gemini / Flow; AI Studio + API
DeepSeek V4-Pro$0.66 fora de ponta / $1.32 em ponta ($0.022 cache-hit fora de ponta)$1.98 fora de ponta / $3.96 em ponta1MDeepSeek Chat grátis; API paga, preços de ponta e fora de ponta desde 16 de agosto
DeepSeek V4-Flash 0731$0.22 fora de ponta / $0.44 em ponta ($0.007 cache-hit fora de ponta)$0.66 fora de ponta / $1.32 em ponta1MDeepSeek Chat grátis; API paga, preços de ponta e fora de ponta desde 16 de agosto
Kimi K2.7 CodeDepende do fornecedorDepende do fornecedor256KOpen weights; custos de alojamento aplicáveis
GLM-5.2Depende do fornecedorDepende do fornecedor1MOpen weights; custos de alojamento aplicáveis
GLM 5.3$1.40 ($0.26 cache-hit)$4.401MAPI da Z.ai, GLM Coding Plan e ZCode; pesos no Hugging Face desde 28 de agosto sob a licença própria GLM 5.3 License
GLM 5.3 Flash$0.15 ($0.03 cache-hit); $0.075 em promoção$0.50; $0.25 em promoção1MAPI da Z.ai, GLM Coding Plan, OpenRouter; pesos MIT no Hugging Face; promoção acaba a 9 de setembro
Tencent Hy4 Preview$0.834 ($0.042 cache-hit)$2.5011M+Pesos abertos (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextDepende do fornecedorDepende do fornecedor262K (até 1M)Pesos abertos (Qwen Community License 1.0); acrescem custos de alojamento
ERNIE 5.1Preço para a região ChinaPreço para a região China256KNível gratuito da Baidu
Gemini Spark (agente)Sem preço de APISem preço de API1M (base Gemini)Google AI Ultra $99.99 ou $199.99/mês
Fello AI (agregador)Encaminhado pela aplicaçãoEncaminhado pela aplicaçãoDepende do modelo$9.99/mês, versão gratuita disponível

As tarifas do GPT-5.5 e GPT-5.5 Pro acima são preços de contexto curto; a OpenAI já não publica os números específicos de contexto longo. Os níveis GPT-5.6 são faturados a 2x a entrada e 1,5x a saída assim que um prompt ultrapassa os 272K tokens de entrada, o que coloca o Terra de contexto longo em $4 / $18 e o Luna em $0.40 / $1.80. O Grok 4.6 funciona da mesma forma, mas morde com mais força: a partir de 200 000 tokens de prompt, a SpaceXAI volta a faturar o pedido inteiro à taxa mais alta em vez de apenas o excedente, pelo que ultrapassar o limite por mil tokens duplica o custo de toda a chamada. A outra tabela que convém ler duas vezes é a da DeepSeek: desde 16 de agosto, os seus dois modelos V4 são faturados ao preço de ponta das 01:00 às 04:00 e das 06:00 às 10:00 UTC nos dias úteis, e a exatamente metade em qualquer outra hora, pelo que a mesma tarefa pode custar o dobro consoante a hora a que a executar. Se quiser acesso a vários modelos de IA sem gerir subscrições separadas, o Fello AI disponibiliza GPT, Claude, Gemini, Grok, Perplexity e mais numa única aplicação para Mac, iPhone e iPad a partir de $9.99/mês.

Modelos open-weight

Melhores modelos open-weight em setembro de 2026

O melhor modelo open-weight em setembro de 2026 é o Kimi K3, e assumiu a liderança no momento em que a Moonshot publicou os pesos a 27 de julho de 2026. Detém o Intelligence Index mais alto de qualquer modelo open-weight com 60 na Artificial Analysis, sete pontos à frente do GLM-5.2, e na Arena continua a ser a entrada aberta mais bem posicionada, em #2 no WebDev (1,675.5) atrás apenas do Claude Opus 5 e #3 no quadro Agent. Um senão decide qual dos dois deve realmente utilizar. A transferência do K3 são 96 shards safetensors e cerca de 1,56 TB, o que precisa de um cluster de GPU multi-nó em vez de uma estação de trabalho, e chega sob uma licença própria Kimi K3 License em vez de MIT. Por isso a recomendação prática para equipas que fazem correr os seus próprios pesos é agora o GLM 5.3 Flash (Z.ai, MIT), lançado a 26 de agosto num Intelligence Index de 57, quatro pontos acima do GLM-5.2 e com menos de metade do tamanho, 320B no total com 18B ativos. É o primeiro modelo nativamente multimodal da linha GLM-5, aceita um contexto de 1M de tokens, e os pesos estavam no Hugging Face sob MIT no próprio dia do lançamento. O GLM-5.2 (MIT) é a alternativa de recurso, num Intelligence Index de 53, e mantém o registo independente que o modelo mais recente ainda não teve tempo de ganhar, #6 na Arena WebDev (1,587.1) e #5 no quadro Agent. O terceiro lugar mudou de mãos no último dia de julho: o DeepSeek V4-Flash 0731 foi novamente pós-treinado e saltou de um Intelligence Index de 40 para 52 no índice atual v4.1.1 sob MIT, embora o seu preço de API tenha desde então subido cerca de quatro vezes, para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta. Três lançamentos fecharam depois o mês, e nenhum deles tem ainda classificação independente. O GLM 5.3 publicou finalmente os seus pesos a 28 de agosto, exatamente na data que o seu marcador de posição indicava, mas sob uma GLM 5.3 License própria em vez de MIT, com uma cláusula que obriga qualquer operador de model-as-a-service acima de 10 mil milhões de dólares de receita a passar primeiro uma revisão de segurança da Z.ai; repare ainda que o GLM 5.3 Flash não é um GLM 5.3 reduzido, mas um modelo à parte sobre uma base recém-treinada, e é por isso que pôde sair sob MIT puro quando o topo de gama não pôde. A Tencent abriu o Hy4 Preview a 28 de agosto com 770B no total e 49B ativos sob Apache 2.0, o maior modelo com licença permissiva publicado até agora, apoiado numa avaliação cega interna e não em qualquer quadro independente. E a Alibaba publicou o Qwen3.8-Flash-Next a 26 de agosto, um mixture-of-experts de 125B com apenas 6B ativos que antecipa a arquitetura Qwen4, sob a Qwen Community License 1.0 em vez de Apache. Os três estão listados abaixo em vez de classificados.

ModeloMelhor paraBenchmark-chaveContexto / LicençaOnde executar
Kimi K3Modelo open-weight mais bem pontuado, trabalho agêntico e webII 60, o mais alto de qualquer modelo open-weight; #2 Arena WebDev, #3 Arena Agent; 2.8T/104B ativos1M / Kimi K3 LicenseHugging Face (96 shards, 1.56 TB), Moonshot API, fornecedores
GLM 5.3 FlashMelhor modelo aberto que a maioria das equipas consegue mesmo executarII 57 (v4.1.1), na fronteira de Pareto entre inteligência e custo, a cerca de $0.09 por tarefa do índice; 320B/18B ativos, nativamente multimodal1M / MITHugging Face, API da Z.ai ($0.15/$0.50), OpenRouter
GLM-5.2Recurso com historial independenteII 53; #6 Arena WebDev (1,587.1), #5 Arena Agent; 744B/40B ativos1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Aberto desde 28 de agosto, mas com licença própriaMesma base de 744B do GLM-5.2, apenas pós-treinada, checkpoint publicado contado em 753B; CyberGym 84,5 % e Terminal-Bench 3.0 28,3 (números do fabricante)1M / GLM 5.3 License (model-as-a-service acima de 10 mil milhões USD de receita precisa de revisão de segurança da Z.ai)Hugging Face, API da Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4-Flash 0731Melhor relação qualidade-preço aberta se o alojar por conta própriaII 52 (v4.1.1), de 40 a 31 de julho; 284B/13B ativos1M / MITDeepSeek API ($0.22/$0.66 fora de ponta, $0.44/$1.32 em ponta desde 16 de agosto), local
Tencent Hy4 PreviewMaior modelo com licença permissiva até agora770B/49B ativos; 2,99/4,00 no painel próprio da Tencent com 203 tarefas contra 2,94 do Kimi K3 e 2,92 do GLM 5.3 (fabricante); ainda sem classificação independente1M+ / Apache 2.0Hugging Face (BF16 e FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextAntevisão da arquitetura Qwen4125B no total mais um embedding de N-gramas de 51B, 6B ativos; 91,7 GPQA Diamond e 62,5 SWE-Bench Pro (fabricante); ainda sem classificação independente262K a 1M / Qwen Community License 1.0Hugging Face, fornecedores, auto-alojamento
LongCat-2.0Programador aberto frontier treinado em chips chinesesII 33 (v4.1); 59,5 % SWE-Bench Pro (fornecedor), 1.6T/~48B ativos1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Multimodal de classe frontier baratoII 44 (v4.1), 59 % SWE-Bench Pro, multimodal1M / licença por definirHugging Face, API $0.30/1M (50 % de desconto)
Nex-N2-ProPontuação de programação aberta mais forteII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B ativosBaseado em Qwen / Apache 2.0Hugging Face, fornecedores, auto-alojamento
Kimi K2.7 CodeProgramador aberto com licença comercial mais forte+21,8 % no Kimi Code Bench v2 vs K2.6 (fornecedor); 1T/32B ativos256K / Modified MITHugging Face, DeepInfra, fornecedores
DeepSeek V4-ProTrabalho agêntico em condições reaisII 44 (v4.1), 1.6T/49B ativos1M / MITDeepSeek API ($0.435/$0.87), local
Hy3O mais recente participante com licença permissivaII 41 (v4.1); #22 na Arena WebDev (1,516.4)Apache 2.0Hugging Face, fornecedores, auto-alojamento
InklingPrimeiro modelo open-weight da Thinking MachinesII 41 (v4.1), agêntico 32,3, lançado a 15 de julhoOpen weightsHugging Face, fornecedores, auto-alojamento
Inkling SmallMesma família a um quarto do tamanhoII 40 (v4.1), agêntico 30,8; 276B/12B ativos, entrada de texto, imagem e áudioApache 2.0Hugging Face (BF16 e NVFP4), fornecedores, auto-alojamento
NVIDIA Nemotron 3 UltraAfinado pela NVIDIA, licença totalmente permissivaII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B ativos1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 auto-alojamento)
Qwen 3.5 (397B / 17B ativos)Multimodal, descodificação rápida88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / abertoTogether, OpenRouter, local
Qwen3.6-35B-A3BProgramador agêntico aberto eficiente (3B ativos)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B ativos262K (até 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, local
Qwen3.6-27BProgramador denso executável em portátil87,8 GPQA Diamond, denso 27B, multimodal256K / Apache 2.0Local Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune de Qwen 3.5, raciocínio multilíngue70,8 Terminal-Bench 2.1 (first-party), bate o Qwen 3.7 Plus em 4/5397B/17B ativos / MITHugging Face, fornecedores, auto-alojamento
Llama 4 MaverickModelo de topo da linha Meta17B ativos / 400B de parâmetros no totalLlama 4 licenseCloud da Meta, Hugging Face, local
NVIDIA Nemotron 3 Nano OmniEdge / baixo consumoMultimodal, pegada muito reduzidaCompacto / abertoLocal, ferramenta NVIDIA

Aqui a licença importa tanto como a pontuação bruta, e agosto alargou a distância entre os dois grupos. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) e Nemotron 3 Ultra (OpenMDW) permitem todos claramente a utilização comercial sem qualquer teste de receita. Os restantes trazem condições que convém ler antes de construir sobre eles: o MiniMax M3 e o MiniMax H3 chegam sob as suas próprias licenças comunitárias, exigindo o H3 ainda um pedido a partir dos EUA, da UE, do Reino Unido e da Coreia do Sul; o Kimi K3 assenta numa licença própria com um limiar de receita para quem o revenda como serviço; o GLM 5.3 exige uma revisão de segurança da Z.ai a qualquer operador de model-as-a-service acima de 10 mil milhões de dólares de receita; e a Qwen Community License 1.0 do Qwen3.8-Flash-Next exige uma licença à parte da Qwen para explorar um negócio de model-as-a-service ou de assistente de trabalho com IA, embora o uso interno esteja isento. Nenhum modelo open-weight é já o primeiro em qualquer quadro da Arena que seguimos: o Claude Opus 5 arrebatou o quadro Agent em julho, o último que um modelo open-weight liderou.

Como avaliamos

Benchmarks, preços e utilização prática

Cada classificação desta página combina três entradas: benchmarks públicos de sete casas independentes (Artificial Analysis, Arena antiga LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize e o quadro oficial Terminal-Bench 2.1, cobrindo os índices Intelligence e Agentic, GPQA Diamond, ARC-AGI-1 a 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas e o Remote Labor Index), preços de API e subscrição publicados na página de preços oficial de cada fornecedor, e utilização prática pela equipa editorial da FelloAI que executa prompts reais sobre a mesma tarefa em cada modelo. Voltamos a obter as fontes oficiais de preços e benchmarks antes de cada atualização mensal.

Os benchmarks são ponderados consoante o caso de utilização: o SWE-bench e o Terminal-Bench impulsionam a programação, o GPQA Diamond e o ARC-AGI-2 impulsionam a precisão, o GDPval-AA (o benchmark de entregáveis profissionais da Artificial Analysis) informa a qualidade das tarefas profissionais ao passo que o estilo de escrita é avaliado sobretudo por testes práticos, o FrontierMath e o HMMT impulsionam a resolução de problemas. Revelamos quando um benchmark é reportado pelo fornecedor mas não verificado de forma independente, e descartamos qualquer afirmação que não conseguimos reproduzir contra uma fonte em direto. Não movemos a coroa de uma categoria pela força de um único quadro, e quando um modelo novo é demasiado recente para que os quadros de preferência humana o tenham avaliado, dizemo-lo em vez de o coroar apenas por pontuações de benchmark. Quando um modelo passa por uma atualização importante entre atualizações, reclassificamos a categoria e acrescentamos uma linha «O que mudou este mês» no fundo da análise aprofundada.

Fello AI a funcionar no Mac, iPhone e iPad
Não sabe qual modelo escolher?

O Fello AI reúne os melhores modelos de IA numa aplicação nativa e leve.

Alterne entre eles a qualquer momento, sem subscrições separadas.

Descarregar Fello AI
Perguntas frequentes

Perguntas comuns

Qual é o melhor modelo de IA neste momento em setembro de 2026?
Depende da tarefa. Na pontuação global de benchmark, o Claude Fable 5.1 (1 de setembro) é #1 no Intelligence Index da Artificial Analysis com 66 e o seu Agentic Index com 61, com o Claude Opus 5 em segundo em ambos com 63 e 59; a Arena avaliou o Opus 5 no topo de quatro dos seus quadros, incluindo os dois de programação, e ainda não tem votos para o Fable 5.1. O Grok 4.6 (12 de agosto) é a escolha de valor na frontier, empatado com o GPT-5.6 Sol em 61 por um terço do preço. Para o chat do dia a dia, o GPT-5.6 é a predefinição do ChatGPT desde 9 de julho e o assistente que a maioria das pessoas consegue realmente abrir, embora o Claude Fable 5 lidere o quadro de texto da Arena. Para programação, o Claude Opus 5 é #1 nos quadros WebDev (1,702.9) e image-to-WebDev (1,668.6) da Arena a metade do preço do Fable 5. Para escrita, o Claude Fable 5 é #1 no quadro de texto da Arena (1508.6), com o Fable 5.1 à frente dele no Humanity's Last Exam (59,1 %) e empatado com ele no AA-Omniscience (43). Para precisão, o Gemini 3.1 Pro iguala o painel humano no ARC-AGI-1 com 98 % por $0.52 por tarefa. Para matemática e raciocínio difíceis, o GPT-5.6 Sol é #1 no LiveBench Mathematics, LiveBench Reasoning e ARC-AGI-2. Para imagens, o ChatGPT Images 2.0 lidera os dois quadros, e para vídeo o Gemini Omni Flash lidera os dois. Para agentes, o Gemini Spark é o agente na cloud 24/7 e o Claude Cowork o de ambiente de trabalho.
O que é o Claude Opus 5?
O Claude Opus 5 é o modelo de topo da Anthropic de 24 de julho de 2026, e foi o modelo #1 na Artificial Analysis até o Claude Fable 5.1 chegar a 1 de setembro. Está agora em segundo no Intelligence Index com 63 contra 66, em segundo no Agentic Index com 59 contra 61 e em segundo no quadro GDPval-AA v2 de entregáveis profissionais com 1824 contra 1853, ainda bem à frente dos 1755 do Grok 4.6 e dos 1723 do Claude Fable 5. O preço da API é de $5 / $25 por 1M de tokens, o mesmo que o Opus 4.8 e metade do custo do Fable 5, com uma janela de contexto de 1M de tokens e uma data de corte de conhecimento de maio de 2026. A ARC Prize confirma de forma independente a afirmação de lançamento da Anthropic sobre o ARC-AGI-3, onde o Opus 5 pontua 30 % contra 8 % do modelo seguinte, cerca de 3,75x. A Arena avaliou-o desde então, colocando-o em #1 no WebDev, image-to-WebDev, Document e no quadro Agent e em #6 no texto, e é isso que lhe valeu a coroa da programação. Uma coisa a ter em conta: a Artificial Analysis mede a sua taxa de alucinação em 50 %, razão pela qual não detém nenhuma coroa de precisão nesta página.
O que é o Claude Fable 5.1?
O Claude Fable 5.1 é o lançamento da Anthropic de 1 de setembro de 2026 e o modelo mais bem pontuado que a Artificial Analysis alguma vez mediu, com 66 no seu Intelligence Index em effort max e 61 no seu Agentic Index. Saiu ao lado do Claude Mythos 5.1, que é o mesmo modelo com as salvaguardas em biologia e cibersegurança aliviadas, disponível apenas por convite e sem critérios de elegibilidade publicados. O preço é de $10 / $50 por 1M de tokens, inalterado face ao Fable 5, mas as leituras de cache descem 75 % para $0.25, numa janela de contexto de 1M de tokens e com data de corte de conhecimento de junho de 2026. Está incluído no Claude Max e Team Premium a cerca de 50 % dos limites semanais e é alcançável a partir do Pro através de créditos. A Anthropic continua a recomendar começar pelo Claude Opus 5 para a maioria das cargas, uma vez que custa metade e corre mais depressa. A nossa análise completa do Claude Fable 5.1 e do Mythos 5.1 cobre o system card e a divisão das salvaguardas.
O Claude Fable 5 está de volta?
Sim. A Anthropic voltou a implementar o Claude Fable 5 a 1 de julho de 2026 depois de o governo dos EUA ter levantado a restrição de controlo de exportações que impusera a 12 de junho. Está de novo disponível na Claude API, no Claude.ai, no Claude Code e no Claude Cowork. A Anthropic tornou o Fable 5 permanente nos planos pagos a 20 de julho de 2026. O Max e o Team Premium incluem-no a cerca de 50 % dos limites de utilização habituais; o Pro e o Team Standard alcançam-no através de créditos de utilização com um crédito inicial único de $100. O preço da API é de $10 / $50 por milhão de tokens. O Fable 5 é um modelo de classe Mythos construído para trabalho agêntico de longo horizonte com um contexto de 1M de tokens, e é o segundo para programação atrás do Claude Opus 5, em #2 no quadro image-to-WebDev da Arena (1,625.7) e #4 no WebDev.
O que é o GPT-5.6 e posso utilizá-lo?
Sim, desde 9 de julho de 2026. O GPT-5.6 é a família de modelos de nova geração da OpenAI, e após uma pré-visualização fechada de duas semanas que começou a 26 de junho por trás de uma revisão de segurança do governo dos EUA, atingiu a disponibilidade geral a 9 de julho. Há três níveis, do menos ao mais capaz: Luna, o nível rápido e mais barato ($0.20 / $1.20 por 1M de tokens); Terra, um modelo equilibrado para o dia a dia que a OpenAI diz igualar o GPT-5.5 ($2 / $12); e Sol, o modelo de topo afinado para biologia, química e cibersegurança ($4 / $20). A OpenAI reduziu o Luna em 80 % e o Terra em 20 % a 30 de julho de 2026 e deixou o Sol intacto, e depois reduziu o Sol em mais de 20 % a 21 de agosto de 2026, uma taxa promocional de cerca de três meses. Nenhum preço de subscrição do ChatGPT mudou. Está agora em direto no ChatGPT, Codex e na API como modelo predefinido da OpenAI. Uma ressalva: o system card da OpenAI e o avaliador externo METR assinalaram um comportamento de «scheming» elevado no Sol, pelo que o trate com cuidado para trabalho factual de alto risco até os resultados independentes assentarem.
O Grok 4.6 já saiu?
Sim. A SpaceXAI lançou o Grok 4.6 a 12 de agosto de 2026, substituindo o Grok 4.5 como modelo de topo pouco mais de um mês depois de este ter saído. Não é um novo modelo base: a empresa manteve a fundação do Grok 4.5 e melhorou o modelo com pós-treino adicional, incluindo aprendizagem por reforço em ambientes agênticos, e não publicou qualquer arquitetura nova nem contagem de parâmetros. A Artificial Analysis pontua-o com um Intelligence Index de 61, cinco pontos acima dos 56 do Grok 4.5, o que o coloca empatado com o GPT-5.6 Sol em 61, atrás do Claude Fable 5.1 com 66, do Claude Opus 5 com 63 e do Claude Fable 5 com 62. Os preços mantêm-se inalterados em $2 / $6 por 1M de tokens com uma janela de contexto de 500K tokens, ainda que os prompts de 200 000 tokens ou mais voltem a faturar o pedido inteiro a $4 / $12. Está disponível na API da SpaceXAI, no Cursor, no Grok Build, na OpenRouter, na Vercel e na Cloudflare. O Grok 4.6 é também a nossa escolha para criatividade, por motivos de produto em vez de qualidade da prosa; para a melhor saída escrita, o Claude Fable 5 vence por completo. Todos os números na nossa análise do Grok 4.6.
Qual é a melhor IA para programar?
O Claude Opus 5 é o melhor para programar, e vence os dois quadros onde os programadores votam no resultado em vez de um harness a executar um script: #1 no quadro WebDev da Arena (1,702.9) e #1 em image-to-WebDev (1,668.6), em cortes de votos de 1 de agosto e 31 de julho. Corre a $5 / $25 por 1M de tokens, metade do Claude Fable 5, e a própria documentação da Anthropic diz para começar com o Opus 5 para programação agêntica complexa. O Claude Fable 5 é o segundo para o trabalho de longo horizonte mais difícil em #2 image-to-WebDev e #4 WebDev, e o Kimi K3 é o candidato em #2 no WebDev (1,675.5). Note que o Coding Index da Artificial Analysis não é uma varrida da Claude: o GPT-5.6 Sol (xhigh) lidera-o com 78,3 com o Opus 5 em 78,0, perto o suficiente para lhe chamar empate. O GLM 5.3 Flash (MIT, 26 de agosto) é agora tanto a escolha de relação preço-desempenho, a $0.15 / $0.50, como o melhor programador open-weight que consegue alojar por conta própria, num Intelligence Index de 57; tirou a primeira ao DeepSeek V4-Flash 0731 quando a DeepSeek subiu os preços cerca de quatro vezes a 16 de agosto.
Qual é a melhor IA para escrever?
O Claude Fable 5 é o melhor para escrever, e é o único modelo entre os três primeiros dos três quadros independentes de escrita: #1 na Arena escrita criativa, #1 no LiveBench Language (90.7) e #3 no EQ-Bench Creative Writing v3. Custa $10 / $50 por 1M de tokens. O Claude Sonnet 5 é a escolha de relação qualidade-preço e o que a maioria das pessoas deveria realmente utilizar, uma vez que é grátis e predefinido no claude.ai a $2 / $10, um preço de lançamento que a Anthropic tornou permanente em agosto de 2026, embora se classifique em #53 na Arena escrita criativa. O Kimi K3 vence o EQ-Bench por completo com 2377 se quiser ficção distintiva, o Claude Fable 5.1 encabeça o quadro GDPval-AA v2 de entregáveis profissionais com 1853, com o Claude Opus 5 em segundo com 1824, o GPT-5.5 é a alternativa para escrita empresarial ancorada em factos, e o Gemini 3.6 Flash é a escolha de relação preço-desempenho para conteúdo em massa.
Qual é o melhor modelo de IA open-weight em 2026?
O Kimi K3 é o melhor modelo open-weight neste momento, e é-o desde que a Moonshot publicou os pesos a 27 de julho de 2026. Tem o Intelligence Index mais alto de qualquer modelo open-weight com 60 na Artificial Analysis, e na Arena é #2 no WebDev e #3 no quadro Agent. O senão é que são 96 shards e cerca de 1,56 TB sob uma licença própria Kimi K3 License, pelo que o GLM 5.3 Flash (26 de agosto, MIT) é agora o modelo que a maioria das equipas consegue realmente alojar, num Intelligence Index de 57 e com 320B no total e 18B ativos. O terceiro é o DeepSeek V4-Flash 0731, que saltou de um Intelligence Index de 40 para 52 a 31 de julho sem mudar de tamanho ou licença, mas a DeepSeek subiu depois os preços da API cerca de quatro vezes a 16 de agosto, para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta, o que lhe custou a escolha de relação preço-desempenho. O GLM 5.3, lançado a 14 de agosto, é um modelo diferente e maior cujos pesos chegaram mesmo a 28 de agosto, mas sob uma GLM 5.3 License própria em vez de MIT. Mais dois modelos abertos fecharam o mês, ainda sem classificação independente: o Hy4 Preview da Tencent a 28 de agosto, 770B sob Apache 2.0 e o maior modelo com licença permissiva até agora, e o Qwen3.8-Flash-Next da Alibaba a 26 de agosto, uma antevisão da arquitetura Qwen4 sob a Qwen Community License 1.0. Vale a pena saber, com honestidade, que nenhum modelo open-weight é já o primeiro em qualquer quadro da Arena que seguimos.
Qual é o modelo de IA de classe frontier mais barato?
No preço de API por milhão de tokens, o GPT-5.6 Luna é agora o modelo fechado de classe frontier mais barato a $0.20 / $1.20, depois de a OpenAI o ter reduzido em 80 % a 30 de julho de 2026, e a Artificial Analysis pontua-o com um Intelligence Index de 52 no seu índice v4.1.1, ao mesmo nível do Gemini 3.6 Flash. Ainda mais barato, o GLM 5.3 Flash é a nossa escolha de relação preço-desempenho desde agosto, a $0.15 / $0.50 de tabela e a metade disso até 9 de setembro, com 57 no Intelligence Index e sob uma licença MIT pura que consegue auto-alojar. O DeepSeek V4-Flash 0731 manteve essa escolha até a DeepSeek subir os preços cerca de quatro vezes a 16 de agosto, para $0.22 / $0.66 fora de ponta e $0.44 / $1.32 em hora de ponta. O nível barato da própria Google ganhou muito valor em agosto: o Gemini 3.7 Flash pontua 56 por um introdutório $0.75 / $3.75, embora esse valor duplique a 1 de janeiro de 2027. O MiniMax M3 é agora listado a $0.30 por milhão de tokens de entrada com um desconto permanente de 50 %, com o LongCat-2.0 como forte alternativa MIT. O Qwen 3.7 Max a $1.25 / $3.75 na sua promo atual é a escolha de relação qualidade-preço num Intelligence Index de 46, embora o Luna o supere agora tanto no preço como na pontuação.
Que modelos de IA são grátis?
O ChatGPT Free usa agora o GPT-5.6 por predefinição (com o GPT-5.5 ainda disponível) sob limites de utilização. O Gemini Free faz correr o Gemini 3.6 Flash na aplicação Gemini e no Google AI Studio. O Claude Free faz correr o Claude Sonnet 5 (a nova predefinição) com limites diários. O DeepSeek Chat faz correr o DeepSeek V4 grátis no site da DeepSeek. O Grok tem um plano de consumo gratuito limitado (o X Premium é um extra pago). O Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash e o Hy4 Preview da Tencent são open-weight e grátis para auto-alojar, embora as licenças difiram e apenas alguns sejam MIT ou Apache puros. O Qwen 3.7 Max é apenas API sem front-end de chat de consumo, mas a Alibaba inclui agora 200 pedidos de modelo grátis por dia. O Kimi tem um nível básico gratuito na sua aplicação, com a utilização agêntica mais intensa medida.
O que é o Gemini Spark e vale $99.99/mês?
O Gemini Spark é o primeiro agente de IA da Google residente na cloud 24/7, lançado na Google I/O a 19 de maio de 2026 e exclusivo do plano Google AI Ultra, que a Google reestruturou para incluir um nível de entrada a $99.99/mês e um nível de topo a $199.99/mês. O Spark é construído sobre os modelos base Gemini com o harness Antigravity da Google numa VM da Google Cloud, integra-se com o Gmail, o Google Docs e outras aplicações do Google Workspace, e consegue interagir com o Chrome e o sistema Halo do Android do lado do dispositivo. Vale o gasto para utilizadores que têm fluxos repetíveis de longa duração (triagem da caixa de entrada, sínteses de investigação, tarefas agendadas). Para tarefas pontuais, o Claude Cowork a $20/mês cobre a maioria das necessidades de agente de ambiente de trabalho.
O que é o Fello AI?
O Fello AI é um chatbot de IA para Mac, iPhone e iPad que lhe permite utilizar todos os melhores modelos de IA como o ChatGPT, Claude, Gemini, Grok e DeepSeek numa única aplicação, com modelos atualizados regularmente para que tenha sempre os mais recentes. Custa $9.99/mês com uma avaliação de 4,7 estrelas ao longo de mais de 27 000 críticas.
Com que frequência atualizam esta página?
Atualizamos esta página pelo menos uma vez por mês e no prazo de 24-48 horas após o lançamento de qualquer modelo importante.
Artigos relacionados
Claude vs ChatGPT: qual a IA que é realmente melhor em 2026?

O Claude atingiu o #1 na App Store no início de 2026, empurrando o ChatGPT para fora do primeiro lugar pela primeira vez. O catalisador foi a recusa pública da Anthropic em ceder à exigência do Pentágono de implementar os seus modelos para armas autónomas.

Ler mais →
Grok vs ChatGPT: qual o chatbot de IA que é realmente melhor em 2026?

Ambos os chatbots acabaram de mudar para novos modelos de topo. O ChatGPT corre agora o GPT-5.6 (níveis Sol, Terra, Luna) e o Grok é alimentado pelo Grok 4.6, a versão da SpaceXAI de 12 de agosto que empata com o Sol no Intelligence Index por um terço do preço.

Ler mais →
ChatGPT vs Gemini em 2026: qual a IA que deve realmente utilizar?

O ChatGPT mudou para o GPT-5.6 como modelo de topo, enquanto o Gemini 3.1 Pro continua a ser o modelo de topo pago da Google. Frente a frente em escrita, programação, imagens e preço.

Ler mais →
Quando usar cada IA: escolha o modelo certo

Não existe uma única IA melhor. Associe cada tarefa ao modelo que lidera nela, com uma tabela para programação, escrita, pesquisa e conversa do dia a dia.

Ler mais →
Melhores Agentes de IA em 2026: 30 Ferramentas

Trinta agentes de IA comparados pelo que você quer fazer: programação, pesquisa, trabalho de escritório e automação, com preços e opções gratuitas.

Ler mais →
Gemini Nano Banana Pro vs GPT-Image-1.5: comparação definitiva

A nossa comparação prática original de dezembro de 2025 dos dois principais modelos de geração de imagens, com amostras de saída reais lado a lado.

Ler mais →

Experimente todos os modelos.
Uma aplicação linda.

Todos os modelos deste guia numa aplicação nativa: ChatGPT, Claude, Gemini, Grok e DeepSeek. Grátis para começar.

Fello AI a funcionar no Mac, iPad e iPhone

Avaliação de 4,7·mais de 27 000 críticas·Grátis para começar