Melhores modelos de IA em 2026
Classificações, comparações e análises aprofundadas, atualizadas todos os meses à medida que chegam novos modelos.
A Anthropic lançou o Claude Opus 5.5 a 22 de setembro e ele fica com a coroa da programação. A Artificial Analysis mede-o em 57,6 no Intelligence Index v4.3.2, a pontuação mais alta que alguma vez publicou e 4,3 pontos à frente do Claude Fable 5.1, e leva com ele o GDPval-AA v2.1, o AA-Briefcase v1.1 e o Humanity's Last Exam. Consegue-o a $4 / $20 por 1M de tokens, abaixo do Claude Opus 5 a $5 / $25, por isso o melhor modelo é agora também o mais barato.
A OpenAI respondeu cerca de noventa minutos depois com o GPT-6 Sol e o GPT-6 Luna e com eles cortou para metade os preços da sua API: o Sol fica a $2 / $10 por 1M de tokens e o Luna a $0,10 / $0,50, e nenhum deles está ainda na janela de chat do ChatGPT. O GPT-6 Astra mantém os dois quadros de programação da Arena, porque o Opus 5.5 ainda não tem votos lá, e o Claude Fable 5.1 mantém escrita e precisão nos quadros que decidem essas categorias. Esta página ordena por pontuações medidas, por isso uma coroa muda assim que um modelo supera o detentor, sem esperar pelos quadros baseados em votos. O nosso guia de benchmarks de IA explica como esse índice é construído e porque o seu número de versão importa.
A SpaceXAI lançou o Grok 4.7 a 21 de setembro sobre um modelo base novo e maior, e fica acima do Astra nos dois quadros agênticos que a Artificial Analysis publica. O Intelligence Index marca 46,3 contra os 44,3 do Grok 4.6 e o preço por tokens não se mexe, $2 / $6, mas uma tarefa do índice custa $2,73 contra $1,86, porque o 4.7 emite cerca do dobro da saída. Arrancou na API, no Cursor e no Grok Build; a aplicação Grok continua a servir o 4.6.
O campo aberto também tem novo líder: o MiMo-V2.6-Pro da Xiaomi, publicado a 21 de setembro sob MIT simples, pontua 46,3 e resolve uma tarefa do índice por $0,13, o mais barato entre os modelos abertos desta página. Abaixo estão os vencedores por categoria de setembro de 2026. Clique num cartão para ir direto à análise completa, ou use a navegação fixa para saltar entre categorias. Classificações, benchmarks e preços são atualizados no prazo de 48 horas após qualquer lançamento importante.
Quer os melhores modelos de IA sem fazer malabarismos com subscrições separadas? O Fello AI reúne os principais modelos numa aplicação nativa para Mac, iPhone e iPad.
Descarregar Fello AI22 set. OpenAI O GPT-6 Sol e o GPT-6 Luna cortam para metade os preços da API da OpenAI e chegam a todo o lado menos ao chat do ChatGPT Novo
22 set. Anthropic O Claude Opus 5.5 leva o Intelligence Index com 57,6 e fica abaixo do preço do Opus 5 Novo
21 set. SpaceXAI O Grok 4.7 chega sobre um modelo base maior aos mesmos $2 / $6 e custa mais 47 % por tarefa Novo
21 set. Xiaomi O MiMo-V2.6-Pro da Xiaomi é o modelo aberto com a maior pontuação alguma vez medida, a $0,13 por tarefa do índice sob MIT Novo
15 set. TypeSafe A TypeSafe sai do modo furtivo com o Jev, um modelo que devolve decisões tipadas em vez de texto, a $0.042 por 1M de tokens Novo
10 set. DeepSeek A DeepSeek retira o V4-Flash, substitui-o pelo V4.1-Flash e corta a tarifa Flash em cerca de um terço Novo
3 set. OpenAI O GPT-6 Astra sai a $10 / $50 e, num dia, está no Plus e no Pro e lidera os quadros de programação Novo
2 set. Alibaba Qwen3.8-Max-0902 tira ao Claude Opus 5 o quadro WebDev da Arena por três pontos, a $2 / $6 Novo
2 set. Muse Spark 1.3, Intelligence Index de 57 para 61 a um valor inalterado de $1.25 / $4.25, ganha na programação e perde todas as linhas de agente Novo
2 set. Google Gemini 3.8 Flash, mais três pontos no Intelligence Index pelo mesmo $0.75 / $3.75 Novo
1 set. Anthropic Claude Fable 5.1 e Mythos 5.1, um novo #1 na Artificial Analysis com 66 e um corte de 75 % nas leituras de cache Novo
28 ago. Z.ai Os pesos do GLM 5.3 já saíram após a pausa de segurança, mas a licença não é MIT Novo
28 ago. Tencent Tencent Hy4 Preview, 770B de pesos abertos sob Apache 2.0 e o maior modelo permissivo até agora Novo
26 ago. Z.ai GLM 5.3 Flash, o Ox Alpha revelado, e os primeiros pesos MIT que a Z.ai publica desde o GLM-5.2 Novo
26 ago. Alibaba Qwen3.8-Flash-Next, pesos abertos e o primeiro olhar público sobre a arquitetura Qwen4 Novo
21 ago. OpenAI GPT-5.6 Sol desce mais de 20 % e fica abaixo do Claude Opus 5 dos dois lados Novo
16 ago. DeepSeek A DeepSeek sobe os preços da API cerca de quatro vezes e divide a tabela em horas de ponta e fora de ponta Novo
14 ago. Z.ai GLM 5.3, um grande salto agêntico só com pós-treino, lançado sem os open weights Novo
13 ago. Google Gemini 3.7 Flash, as pontuações de programação sobem e o preço desce para metade, $0.75 / $3.75, até janeiro Novo
12 ago. SpaceXAI Grok 4.6, o pós-treino sobe o Intelligence Index de 56 para 61 com $2 / $6 inalterados Novo
5 ago. Muse Spark 1.2 e Muse Code, Intelligence Index de 51 para 57 a um valor inalterado de $1.25 / $4.25, mais um agente de programação em terminal Novo
3 ago. Alibaba Qwen 3.8 (Qwen3.8-Max), modelo de topo multimodal de 2,4 biliões de parâmetros agora disponível para todos a $2 / $6 Novo
Pendente Google Gemini 3.5 Pro, ainda por lançar, meses atrasado segundo a Bloomberg Atrasado
Melhor IA para escrita
A melhor IA para escrever é o Claude Fable 5.1, e o argumento a seu favor é a consistência, não um primeiro lugar isolado. É o único modelo entre os seis primeiros dos três quadros de prosa: segundo no EQ-Bench Creative Writing v3 com 2152,7, segundo no LiveBench Language com 89,5 e sexto no quadro de escrita criativa da Arena. Mais nenhum consegue isso. O GPT-6 Astra lidera o EQ-Bench com 2163,9 mas está em 25.º na escrita criativa da Arena; o Claude Fable 5 lidera os quadros de texto e de escrita criativa da Arena e encabeça o LiveBench Language com 90,7, mas caiu para oitavo no EQ-Bench. O Claude Opus 5.5, que a 22 de setembro tirou ao Fable 5.1 o Intelligence Index e o Humanity's Last Exam, não está avaliado no EQ-Bench nem na Arena e é oitavo no LiveBench Language, por isso ainda não tem qualquer argumento nos quadros de escrita e a coroa não passa para ele. Se a sua escrita é um entregável de trabalho e não prosa, isso é outra questão, e o quadro de entregáveis profissionais GDPval-AA v2.1 é liderado pelo Claude Opus 5.5 com 1846 à frente do Claude Fable 5.1 com 1735 e do Claude Opus 5 com 1708. O Claude Sonnet 5 continua a ser a melhor relação no escalão gratuito e o Claude Fable 5 a escolha se der mais peso aos votos humanos da Arena do que às pontuações de harness; o Fable 5 custa $10 / $50 por 1M de tokens e está incluído em permanência no Claude Max e no Team Premium com cerca de 50 % dos limites de uso habituais. A tradução é uma questão à parte com um vencedor à parte, que tratamos no nosso guia da melhor IA para traduzir.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço (por 1M de tokens) |
|---|---|---|---|---|
| Claude Fable 5.1 | Melhor escrita no geral | #2 EQ-Bench Creative Writing (2152,7), #2 LiveBench Language (89,5) e #6 escrita criativa da Arena, a melhor colocação combinada de todos | Não lidera nenhum dos três de forma isolada; o Claude Opus 5.5 levou o Intelligence Index e o Humanity's Last Exam a 22 de setembro | $10 / $50 |
| Claude Fable 5 | Lidera os quadros de votos humanos da Arena | #1 Arena texto no geral (1505,7), #1 LiveBench Language (90.7), #8 EQ-Bench | A opção mais cara aqui | $10 / $50 |
| Kimi K3 | Ficção criativa e voz | #4 EQ-Bench Creative Writing (2070.6) | Apenas #27 na Arena escrita criativa | $3 / $15 |
| Claude Sonnet 5 | Escrita gratuita para o dia a dia | Grátis e predefinido no claude.ai, contexto 1M | #53 Arena escrita criativa; 75,0 LiveBench Language | $2 / $10, agora permanente |
| Claude Opus 5 | Entregáveis profissionais com melhor preço | #2 GDPval-AA v2.1 com 1708, à frente do Fable 5 (1632) | Atrás do Fable 5 na Arena texto, atrás do Fable 5.1 no GDPval-AA v2.1 | $5 / $25 |
| GPT-5.5 | Escrita empresarial ancorada em factos | Ganhos documentados de fiabilidade factual sobre o GPT-5.4 | Níveis de raciocínio agora marcados como obsoletos | $5 / $30 |
| Gemini 3.8 Flash | Rascunhos em massa à escala | Intelligence Index 40,9, 308,4 tok/s de saída, contexto 1M | Afinado para agentes e não para prosa; o preço introdutório duplica a 1 de janeiro de 2027 | $0.75 / $3.75 |
A coroa da escrita fica com o Claude Fable 5.1, mas o seu fundamento mudou. O Claude Opus 5.5 tirou-lhe o Intelligence Index e o Humanity's Last Exam a 22 de setembro, que era precisamente o que este cartão citava, por isso voltámos a assentar a escolha nos quadros que medem mesmo prosa. Neles, o Fable 5.1 é o único modelo entre os seis primeiros dos três: segundo no EQ-Bench Creative Writing, segundo no LiveBench Language e sexto no quadro de escrita criativa da Arena. O Opus 5.5 não está avaliado em dois dos três e é oitavo no outro, por isso ainda não tem argumento na escrita. A Arena já avaliou o Fable 5.1, o que elimina a ressalva que trazíamos do mês passado de que os quadros de preferência humana ainda não se tinham pronunciado: é quinto no quadro de texto com 1498,5, onde o Claude Fable 5 continua a liderar com 1505,7. O GDPval-AA v2.1 foi novamente reancorado e marca agora 1846 para o Opus 5.5, 1735 para o Fable 5.1 e 1708 para o Opus 5, por isso os números deste bloco ficam bem abaixo dos que citávamos em agosto.
Melhor IA para chat & assistente do dia a dia
A melhor IA para o chat do dia a dia é o GPT-5.6, e a razão honesta é o alcance em vez da posição nos quadros. É o modelo que o ChatGPT serve por predefinição à maior base de utilizadores da categoria, o que faz dele o melhor assistente que a maioria das pessoas consegue realmente abrir. Em preferência humana pura não é o líder: o GPT-5.6 Sol situa-se em #18 no quadro de texto da Arena com 1483,5, onde o Claude Fable 5 lidera com 1505,7. A maioria dos utilizadores do ChatGPT recebe o nível equilibrado Terra, que a OpenAI diz igualar o GPT-5.5 e que, desde a descida de preço de 30 de julho de 2026, custa 60 % menos. Está disponível dentro do ChatGPT (grátis com limites, Plus a $20/mês, Pro a $100/mês), através da API (os níveis da 5.6: Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 por 1M de tokens), e integrado dentro do Fello AI a par do Claude, Gemini, Grok e DeepSeek. Uma ressalva: o system card da OpenAI e o avaliador METR assinalaram um comportamento de «scheming» elevado no Sol, pelo que o GPT-5.5 Instant continua a ser a escolha mais segura para trabalho sensível a alucinações.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| GPT-5.6 | Chat do dia a dia, predefinição do ChatGPT | O assistente que a maioria consegue abrir; o Terra iguala o GPT-5.5 a ~metade do custo | #14 na Arena texto; scheming assinalado pelo METR | Grátis / $20/mês Plus; API $0.20 / $1.20 a $4 / $20 |
| Claude Fable 5 | A conversa mais bem avaliada | #1 no Arena texto geral (1505,7) e em quatro das suas oito subcategorias | Sem versão gratuita; acesso por créditos de utilização no Pro | $10 / $50 API |
| Claude Opus 5 | Respostas ponderadas e matizadas | Terceiro no Intelligence Index da Artificial Analysis (50,8), atrás do Claude Fable 5.1 e do GPT-6 Astra | #10 na Arena texto, atrás do Claude Fable 5 | $20/mês Pro, $5 / $25 API |
| GPT-5.5 Instant | Trabalho diário sensível a alucinações | 52,5 % menos afirmações alucinadas vs 5.3 Instant | Níveis de raciocínio agora marcados como obsoletos | $20/mês Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rápido, grátis, multimodal | Continua a ser o modelo servido pelo nível gratuito do Gemini, contexto 1M, #12 na Arena texto | Mais fraco no raciocínio mais difícil; o 3.8 Flash supera-o ao mesmo preço | Grátis / $0.75 / $3.75 API |
| Fello AI | Todos os melhores modelos, uma aplicação | ChatGPT + Claude + Gemini + Grok + DeepSeek e mais no Mac, iPhone e iPad | Encaminhado pela aplicação, não direto | $9.99/mês |
O GPT-5.6 mantém a escolha para conversa pelo alcance, e a distância para o líder de preferência voltou a alargar. O Sol está agora em 18.º no quadro de texto da Arena com 1483,5, descendo do 14.º, enquanto o Claude Fable 5 lidera com 1505,7. Nada mudou no produto, por isso a coroa não se mexe: continua a ser sobre que assistente mais gente consegue mesmo abrir. Dois lançamentos que de outro modo seriam candidatos não o são: o GPT-6 Astra chegou ao ChatGPT Business, Pro e Plus no início de setembro mas a OpenAI nada anunciou para o escalão gratuito, e o Claude Opus 5.5, que levou o Intelligence Index a 22 de setembro, é um modelo para a API e para os planos Claude, não um assistente por omissão para mil milhões de pessoas. A OpenAI lançou o GPT-6 Sol e o GPT-6 Luna a 22 de setembro e colocou-os no ChatGPT Work e no Codex, dizendo sem rodeios que ainda não estão no Chat, por isso a janela onde a maioria escreve continua a correr GPT-5.6.
Melhor IA para imagens
A melhor IA para gerar imagens é o ChatGPT Images 2.5, que a OpenAI tornou predefinição em todos os planos ChatGPT a 8 de setembro e que lidera agora os quatro quadros de imagem que acompanhamos. Os seus dois modelos ficam em primeiro e segundo em cada um: o GPT-Image-2.5 Sunburst, feito para precisão, lidera o Arena texto para imagem com 1423,2 e o Arena edição de imagens com 1526,0, e lidera também o Elo de qualidade da Artificial Analysis com 1196,8 e o seu quadro de edição com 1221,3, com o mais rápido GPT-Image-2.5 Flare em segundo nos quatro. É uma mudança face ao mês passado, quando a Artificial Analysis não tinha avaliado nenhum dos dois e os seus quadros contradiziam os da Arena. Ainda assim, leia a distância entre o Sunburst e o Flare como provisória, porque essas colocações na Arena assentam em alguns milhares de votos cada contra os 83 000 e 259 000 do GPT Image 2, e em texto para imagem os dois partilham a mesma banda de posição. O segundo é o MAI-Image-2.6, terceiro no quadro de edição da Artificial Analysis com 1191,6 e quarto no de texto para imagem da Arena com 1334,0, com o Muse Image da Meta em terceiro. O Reve 2.1 mantém o seu argumento de paginação, tipografia e 4K nativo mas saiu do pódio: é sexto no Arena texto para imagem e décimo quarto no Arena edição de imagens. A nossa análise completa do que saiu está em ChatGPT Images 2.5.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| ChatGPT Images 2.5 | Imagens com texto legível | #1 e #2 nos quatro quadros: Arena texto para imagem (1423,2 / 1401,3), Arena edição (1526,0 / 1481,8), qualidade da Artificial Analysis (1196,8 / 1190,4) e edição (1221,3 / 1207,0) | As colocações na Arena assentam em alguns milhares de votos | Predefinição em todos os planos ChatGPT |
| MAI-Image-2.6 | Editar uma imagem que já tem | #3 na edição de imagens da Artificial Analysis (1191,6) e #4 no Arena texto para imagem (1334,0) | Pré-visualização pública, ainda não no Copilot nem no Bing; perdeu a liderança da edição da Artificial Analysis para o ChatGPT Images 2.5 | MAI Playground / Microsoft Foundry |
| Muse Image | Edição de imagens, ecossistema Meta | #5 na edição de imagens da Artificial Analysis (1171,3) e #7 no seu Elo de qualidade | Novo, com poucas ferramentas à volta | Aplicação Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Retratos e produtos fotorrealistas | #4 em texto para imagem da Artificial Analysis, à frente do Nano Banana Pro no da Arena | Na edição de imagens da Arena, o Nano Banana Pro está à frente | Aplicação Gemini / AI Studio |
| Seedream 5.0 Pro | Texto multilíngue + edição por regiões | 10+ idiomas incl. árabe RTL, edição com laço e camadas | Por volta do décimo lugar nos quadros independentes; incerteza de direitos de autor | BytePlus / Magnific |
| Midjourney v8 | Arte estilizada, ilustração | Base estética que a maioria dos artistas prefere | Mais fraco em texto dentro da imagem | $10-$120/mês |
| Grok Imagine | NSFW / modo Spicy | As barreiras mais permissivas; a Arena coloca o seu modelo Image 2.0 em #5 no texto para imagem e em #4 na edição, e a Artificial Analysis tem-no agora em #4 no Elo de qualidade | Nada no registo de lançamentos mostra que o Image 2.0 tenha saído como produto | $30 por mês SuperGrok |
O ChatGPT Images 2.5 mantém a coroa da imagem e o seu argumento ficou mais forte. No mês passado a Artificial Analysis não tinha avaliado nenhum dos seus dois modelos de API, por isso os quadros que acompanhamos contradiziam-se: a Arena tinha o Sunburst e o Flare em primeiro e segundo enquanto a Artificial Analysis mantinha o GPT Image 2 à frente do texto para imagem e o MAI-Image-2.6 da Microsoft à frente da edição. A Artificial Analysis já avaliou os dois, e também aí ficam em primeiro e segundo, 1196,8 e 1190,4 no Elo de qualidade e 1221,3 e 1207,0 na edição de imagens. Isso faz dele #1 e #2 nos quatro quadros. O MAI-Image-2.6 continua em segundo mas desce para terceiro no quadro de edição que liderava, e o Grok Imagine Image 2.0 é agora quarto no Elo de qualidade da Artificial Analysis e quarto no quadro de edição da Arena, melhor colocação do que o terceiro lugar do pódio; continuamos a reportá-lo em vez de o coroar, porque nada no registo de lançamentos mostra que tenha saído como produto.
Melhor IA para vídeo
A melhor IA para gerar vídeo é o Gemini Omni 1.1 Flash, que a Google lançou a 27 de agosto e que lidera o quadro de texto para vídeo da Arena com 1516, mesmo à frente do seu próprio antecessor Gemini Omni Flash com 1513. Leia isso como um empate: os dois caem dentro dos intervalos de confiança um do outro e a própria Arena dá ao 1.1 Flash uma banda de posição de um a quatro. O que desempata é a ficha técnica, onde o 1.1 Flash é claramente o modelo mais capaz: extensão de cena em blocos de 10 segundos até 40 segundos acumulados, controlo do primeiro e do último fotograma, referências de vídeo, rascunhos em 360p e saída em 1080p ou 4K, a cerca de $0,03 por segundo em 360p, $0,10 em 720p, $0,15 em 1080p e $0,30 em 4K. O Gemini Omni Flash continua a ser a opção mais barata, à volta de $0,10 por segundo, mas fica-se por clipes de 10 segundos. Dois limites a conhecer. A Artificial Analysis não avaliou de todo o 1.1 Flash; no seu quadro de texto para vídeo lidera o mais antigo Omni Flash com 1512,8 à frente do Wan 3.0 da Alibaba com 1431,4 e do MiniMax H3 com 1407,7. E no quadro de imagem para vídeo da Arena o 1.1 Flash é segundo com 1488,5 atrás do MiniMax H3 com 1495,4, por isso a coroa assenta no texto para vídeo e na ficha técnica, não numa varredura. Se precisa de planos mais longos dentro das ferramentas da Google, o Veo 3.1 continua a correr na aplicação Gemini, no AI Studio e no Vertex AI com áudio nativo e saída em 1080p. O MiniMax H3 (31 de julho) continua a ser o rival na ficha técnica, com clipes em 2K de 4 a 15 segundos e áudio estéreo nativo desde $0,13 por segundo.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash | Melhor vídeo com IA no geral | #1 Arena texto para vídeo (1516); extensão de cena até 40 segundos, saída em 4K | Não avaliado pela Artificial Analysis; segundo atrás do MiniMax H3 no Arena imagem para vídeo | $0,03-$0,30/s; Gemini API / AI Studio / Flow |
| Gemini Omni Flash | Clipes de dez segundos mais baratos | #2 Arena texto para vídeo (1511), #2 vídeo da AA (1238); edição conversacional | Fica-se por gerações de dez segundos | ~$0.10/s; aplicação Gemini / AI Studio |
| Wan 3.0 | Vídeo a partir de documentos e diapositivos | #1 no quadro de vídeo da Artificial Analysis (1239); 2-30 s, até 1080p, entrada Omni-Reference | Apenas API, sem pesos publicados; #3 na Arena | $0.05-$0.20/s |
| MiniMax H3 | Clipes 2K com áudio nativo | 4-15 s em 2K, áudio estéreo nativo; #8 Arena texto para vídeo (1462) | #4 no vídeo da AA (1227); os pesos abertos excluem o upscaler 2K e exigem candidatura nos EUA, na UE, no Reino Unido e na Coreia do Sul | $0.13/s em 2K |
| Dreamina Seedance 2.5 | Rival da ByteDance | #6 Arena texto para vídeo (1482); lidera imagem para vídeo com áudio | Ecossistema ByteDance, acesso ocidental limitado | Dreamina / BytePlus |
| Muse Video | Vídeo no ecossistema Meta | #3 texto para vídeo com 1459 | O mais recente do grupo, ferramentas escassas | Aplicação Meta AI |
| Veo 3.1 | Clips de produção mais longos | Áudio nativo, 1080p, forte consistência física | #6 na Arena vídeo, não o líder de qualidade | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Iteração rápida a menor custo | 4K nativo, 60fps, clips de 15 segundos; o Turbo saiu a 17 de junho | Fora do top 16 na Arena texto para vídeo | A partir de $10/mês |
| Luma Ray 3 | Cenas fotorrealistas | Forte realismo para paisagens | Comunidade mais pequena | Grátis / a partir de $9.99/mês |
O Gemini Omni 1.1 Flash mantém a coroa do vídeo, mas o quadro à sua volta está mais confuso do que a entrada do mês passado sugeria. Continua a liderar o quadro de texto para vídeo da Arena, 1516 contra os 1513 do Gemini Omni Flash, e a Arena dá-lhe uma banda de posição de um a quatro, por isso continua a ser um empate desempatado pela ficha técnica. Duas coisas que reportámos em agosto mudaram. A Artificial Analysis reancorou o seu Elo de vídeo e o antigo trio 1239 / 1238 / 1235 já não existe: o Gemini Omni Flash lidera agora esse quadro com 1512,8 à frente do Wan 3.0 com 1431,4 e do MiniMax H3 com 1407,7, e a Artificial Analysis continua a não avaliar de todo o 1.1 Flash. E o MiniMax H3 assumiu o topo do quadro de imagem para vídeo da Arena com 1495,4, empurrando o 1.1 Flash para segundo com 1488,5, o primeiro quadro que esta coroa perdeu.
Melhor IA para programação
A melhor IA para programar é o Claude Opus 5.5, que a Anthropic lançou a 22 de setembro e que lidera todos os harnesses de programação que acompanhamos: a própria campanha de Terminal-Bench 4.0 da Artificial Analysis com 59,6 % contra os 59,1 % do GPT-6 Astra, o LiveBench Coding com 89,3 contra 80,4 e o LiveBench Agentic Coding com 71,7 contra 57,3. Consegue-o a $4 / $20 por 1M de tokens, menos de metade do preço de tabela dos dois modelos que lideravam este quadro no mês passado, com leituras de cache a $0,20, e segundo os testes da própria Anthropic uma carga de trabalho típica custa 40 % menos do que no Claude Opus 5. A campanha interna de Terminal-Bench 4.0 da Anthropic alarga ainda mais a distância, 66,4 % contra os 57,9 % que a OpenAI reporta para o Astra, a par de 54,4 % no FrontierCode v1.1 e 57,8 % no CursorBench 4.0. O GPT-6 Astra mantém os dois quadros de programação da Arena, WebDev com 1793 e imagem para WebDev com 1733, porque o Opus 5.5 ainda não tem um único voto na Arena, e essa é a divisão honesta aqui: a OpenAI lidera na preferência humana, a Anthropic em todos os harnesses medidos. Leia com cuidado a margem de meio ponto no Terminal-Bench, porque a própria Anthropic reporta um erro padrão de cerca de 2,6 pontos nesse benchmark, por isso trate os dois como iguais aí e deixe os quadros do LiveBench e o preço decidir. O Claude Fable 5.1 é segundo nos dois quadros da Arena e terceiro nos harnesses. O Qwen3.8-Max-0902 da Alibaba segurou o quadro WebDev da Arena cerca de três dias no início de setembro e está agora em quinto com 1662. Entre os pesos abertos o panorama mudou a 21 de setembro: o MiMo-V2.6-Pro da Xiaomi faz 34,8 % no Terminal-Bench 4.0 sob MIT simples a $0,13 por tarefa do índice, enquanto o GLM-5.3 continua a ser o modelo aberto mais forte nesse harness com 41,9 % e o Kimi K3 é o modelo aberto mais bem colocado no Arena WebDev, sétimo com 1658, com apenas 12,6 % no harness. A Artificial Analysis retirou tanto o seu Coding Index como o Coding Agent Index, por isso as duas classificações compostas de programação que esta página citava já não existem.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço (por 1M de tokens) |
|---|---|---|---|---|
| Claude Opus 5.5 | Melhor programação no geral | #1 Terminal-Bench 4.0 (59,6 %), #1 Intelligence Index (57,6, v4.3.2) e #1 LiveBench Coding (89,3) | Ainda sem votos na Arena, por isso o Astra mantém os seus dois quadros de programação | $4 / $20 |
| GPT-6 Astra | Topo dos dois quadros de programação da Arena | #1 Arena WebDev (1793) e #1 imagem para WebDev (1733); 59,1 % Terminal-Bench 4.0 | 2,5 vezes o preço do Opus 5.5 e atrás dele em todos os harnesses | $10 / $50 |
| Claude Fable 5.1 | Maior pontuação composta antes do Opus 5.5 | #2 nos dois quadros de programação da Arena; Intelligence Index 53,4; AA-Briefcase 1678 | 52,0 % Terminal-Bench 4.0; 2,5 vezes o preço do Opus 5.5 | $10 / $50 |
| Claude Opus 5 | Substituído pelo Opus 5.5 | 49,0 % Terminal-Bench 4.0 e #3 nos dois quadros de programação da Arena | Custa mais por token do que o Opus 5.5 e pontua sete pontos abaixo | $5 / $25 |
| Claude Fable 5 | Trabalho agêntico mais duro e de horizonte longo | Intelligence Index 49,6; 42,4 % Terminal-Bench 4.0; contexto de 1M | O mais caro por tarefa do índice neste quadro, $8,75; #6 no Arena imagem para WebDev | $10 / $50 |
| Qwen3.8-Max-0902 | Detentor breve do quadro WebDev da Arena | #5 Code Arena: WebDev (1662); Intelligence Index 45,4; 2,4 biliões de parâmetros, contexto de 1M | Apenas API da QwenCloud, sem interface para consumidores; perdeu a liderança do WebDev em dias | $2 / $6 |
| Kimi K3 | Modelo aberto mais bem colocado na Arena | #7 Arena WebDev (1658), a melhor colocação aberta nesse quadro; 2,8 biliões/104 mil milhões ativos | Apenas 12,6 % no Terminal-Bench 4.0; 1,56 TB para alojar | $3 / $15 |
| GPT-5.6 Sol | O topo de gama mais barato da OpenAI | Intelligence Index 47,0; 39,9 % Terminal-Bench 4.0 | Substituído pelo GPT-6 Sol, que pontua mais alto por metade do preço; a METR assinalou manipulação de avaliações | $4 / $20 |
| GPT-6 Sol | Programação GPT-6 barata no Codex | Intelligence Index 47,5 (v4.3.2) e 43,9 % no Terminal-Bench 4.0, ambos acima do GPT-5.6 Sol e por metade do preço | Sem votos na Arena; apenas no Codex e no ChatGPT Work, não no Chat | $2 / $10 |
| Muse Spark 1.3 | Programação agêntica barata | Intelligence Index 48,1 a $1,25 / $4,25 e $1,60 por tarefa do índice | 33,3 % no Terminal-Bench 4.0; as vitórias em programação vêm do gráfico da própria Meta, medido numa variante max só para parceiros | $1,25 / $4,25 |
| Grok 4.7 | Programador barato com boa relação | 46,3 % CursorBench 4.0 e 71,0 % DeepSWE v1.1 pelos números da própria SpaceXAI; Intelligence Index 46,3 | 24,7 % no Terminal-Bench 4.0; prompts de 200K tokens ou mais refaturam o pedido inteiro ao dobro | $2 / $6 |
| Gemini 3.8 Flash | Programação agêntica em escala | Intelligence Index 40,9; 308,4 tokens de saída por segundo | 19,7 % no Terminal-Bench 4.0; o preço de lançamento duplica a 1 de janeiro de 2027 | $0,75 / $3,75 |
| GLM 5.3 Flash | O programador sério mais barato que consegue alojar | 32,8 % Terminal-Bench 4.0 a $0,25 por tarefa do índice; MIT, 320 mil milhões/18 mil milhões ativos | O GLM-5.3 chega a 41,9 % no mesmo harness; sem produto para consumidores | Pesos abertos (MIT) |
| MiMo-V2.6-Pro | O maior Intelligence Index aberto | 46,3 na v4.3.2 e 34,8 % Terminal-Bench 4.0 a $0,13 por tarefa do índice; MIT, 1,02 biliões/42 mil milhões ativos | Publicado a 21 de setembro, por isso ainda sem votos na Arena nem histórico independente | $0,435 / $0,87 |
A coroa da programação passou para o Claude Opus 5.5, quatro dias depois de ter passado para o GPT-6 Astra. A Anthropic lançou-o a 22 de setembro e ele lidera todos os harnesses de programação que acompanhamos: 59,6 % contra os 59,1 % do Astra na própria campanha de Terminal-Bench 4.0 da Artificial Analysis, 89,3 contra 80,4 no LiveBench Coding e 71,7 contra 57,3 no LiveBench Agentic Coding, a $4 / $20 contra $10 / $50. O Astra mantém os dois quadros de programação da Arena porque o Opus 5.5 ainda não tem votos lá, por isso isto é uma divisão e não uma varredura. A margem no Terminal-Bench é de meio ponto contra um erro padrão que a Anthropic situa à volta de 2,6, por isso o que decide mesmo são os quadros do LiveBench e o preço. O Claude Opus 5 sai do pódio: o Opus 5.5 custa menos por token, gasta menos tokens e pontua sete pontos acima no Intelligence Index, o que torna o velho argumento de valor do Opus 5 não apenas mais fraco mas obsoleto. O MiMo-V2.6-Pro da Xiaomi e o Grok 4.7 da SpaceXAI entram ambos no quadro, e todos os números de índice desta página passaram para a v4.3.2, o que os deixa ligeiramente abaixo dos do mês passado. O GPT-6 Sol entra na tabela no mesmo dia a $2 / $10: a Artificial Analysis mede-o em 47,5 no índice e em 43,9 % no Terminal-Bench 4.0, acima do GPT-5.6 Sol em ambos e por metade do preço, mas muito atrás do Opus 5.5, e chega aos programadores pelo Codex e não pela janela de chat.
Melhor IA para criatividade
A melhor IA para trabalho criativo sem filtros e na moda é o Grok 4.7, e queremos ser exatos quanto ao motivo. Esta escolha é sobre a linha de produto, não sobre a qualidade da prosa. O Grok tem as menores restrições de conteúdo de qualquer modelo de fronteira e a única integração nativa com o X em tempo real, o que faz dele o único modelo que pega em encargos ousados, atuais ou deliberadamente provocadores que os outros recusam. Leia a disponibilidade com atenção: a SpaceXAI lançou o Grok 4.7 a 21 de setembro na API do Grok, no Cursor, no Grok Build, em harnesses de terceiros e em routers na nuvem, e o seu anúncio nada diz sobre a aplicação para consumidores, que continua a servir o Grok 4.6 aos assinantes SuperGrok e X Premium+ por $30 por mês. Não é o melhor a escrever. A Arena já avaliou o Grok 4.6, que está em 32.º no quadro de escrita criativa, à frente do Grok 4.5 em 36.º mas atrás do mais antigo Grok 4.20-beta1 em 23.º. O EQ-Bench não avaliou nem o 4.6 nem o 4.7, e nesse quadro o Grok 4.5 está em 46.º com 1576,0, agora mesmo à frente do Grok 4.20-beta em vez de atrás. Como a SpaceXAI orientou ambos os lançamentos para programação e trabalho agêntico e não para prosa, não assumimos que o 4.7 tenha mudado alguma coisa aqui. Se escolher só pela qualidade do resultado, o Claude Fable 5 continua a liderar o quadro de escrita criativa da Arena, enquanto o EQ-Bench coloca o GPT-6 Astra em primeiro com 2163,9, o Claude Fable 5.1 em segundo e o Kimi K3 em quarto. Escolha o Grok pelo que ele o deixará fazer, não por como escreve.
| Modelo | Melhor para | Ponto forte | Ponto fraco | Preço |
|---|---|---|---|---|
| Grok 4.7 | Sem filtros, com opinião, na moda | Menos restrições de conteúdo, ancoragem nativa no X em tempo real | Nenhum quadro de escrita criativa o avaliou; o Grok 4.6 está em #32 na escrita criativa da Arena | $2 / $6 API; app SuperGrok de $30 por mês, ainda no 4.6 |
| Claude Fable 5 | Prosa criativa da mais alta qualidade | #1 Arena escrita criativa, #1 LiveBench Language | Barreiras cautelosas em briefings ousados | $10 / $50 API |
| Kimi K3 | Ficção e voz própria | #4 EQ-Bench Creative Writing com 2070,6 | Apenas #27 na escrita criativa da Arena | $3 / $15 |
| Claude Opus 5 | Criatividade estruturada de formato longo | Mantém fios longos e autoedita-se; Intelligence Index 50,8, atrás do Claude Fable 5.1 e do GPT-6 Astra | O mais cauteloso do grupo | $20/mês Pro; $5 / $25 API |
| Gemini 3.1 Pro | Criativo multimodal | Forte cadeia de texto, imagem e vídeo | Quotas dentro da aplicação Gemini | Grátis / $2.00-$4.00 API entrada |
| Grok Imagine (Spicy Mode) | NSFW / criativo para adultos | A geração de imagens mais permissiva | Caso de utilização de nicho | $30/mês SuperGrok |
O Grok mantém esta escolha, agora com o Grok 4.7, que a SpaceXAI lançou a 21 de setembro sobre um modelo base novo e maior. Nada mudou na permissividade do produto nem no seu acesso em direto ao X, que é aquilo em que a escolha assenta. O modelo por baixo é outra vez mais forte, 46,3 no Intelligence Index contra os 44,3 do Grok 4.6, mas esse ganho caiu na programação e no trabalho agêntico e não na prosa, e nenhum quadro de escrita criativa avaliou o 4.7. Uma correção à entrada do mês passado: a Arena já avaliou o Grok 4.6, que está em 32.º no seu quadro de escrita criativa, por isso a frase de que nenhum dos quadros o tinha avaliado já não se sustenta. Repare também na disponibilidade dividida, porque para esta categoria importa: o 4.7 está na API, no Cursor e no Grok Build, enquanto a aplicação Grok de $30 por mês, de que o argumento da permissividade realmente trata, continua a servir o 4.6. O Claude Fable 5 continua a ser o modelo a usar quando quer a melhor escrita.
Melhor IA para precisão & investigação
A melhor IA para precisão e investigação é o Claude Fable 5.1, que detém a maior precisão factual que a Artificial Analysis mediu, 67 % no AA-Omniscience. É exatamente a coluna pela qual esta categoria se decide, e passou um teste duro a 22 de setembro: o Claude Opus 5.5 bateu o Fable 5.1 em quase tudo o resto, incluindo o Humanity's Last Exam com 61,4 % contra 59,1 % e o índice AA-Omniscience penalizado por alucinações com 46,4 contra 43,5, mas na precisão factual em bruto marca 66 % contra os 67 % do Fable 5.1. Trate essa diferença de um ponto por si só como um empate e leia os dois em conjunto: o Opus 5.5 é a melhor aposta quando uma resposta errada é pior do que nenhuma, e o Fable 5.1 quando quer o maior número de factos certos. A escolha por valor é o Gemini 3.1 Pro, e continua a ser aquilo a que recorreríamos quando o custo conta. O seu melhor resultado é no ARC-AGI-1 da ARC Prize, onde faz 98 % e iguala o painel humano, a $0,52 por tarefa, embora o Claude Fable 5 e o GPT-6 Astra já tenham passado o painel com 98,5 %. Junta a isso ancoragem nativa no Google Search, que é o que quer quando a resposta tem de ser atual e não apenas plausível. Faz também 94,1 % no GPQA Diamond, onde o GPT-5.6 Sol agora o iguala em vez de ficar atrás, e 44,4 % no Humanity's Last Exam, e 46,44 no quadro HLE da Scale SEAL, que o Claude Fable 5 agora lidera com 55,5 %. Duas ressalvas honestas. Na pesquisa ancorada em concreto, o quadro de pesquisa da Arena é liderado pela OpenAI e não pela Google nem pela Anthropic: o GPT-5.6 Sol encabeça com 1257, com o Claude Fable 5 em quinto e o Gemini 3.1 Pro com ancoragem em nono. E no raciocínio inédito a coroa está noutro lado por completo, com o GPT-6 Astra a liderar tanto o ARC-AGI-2 como o ARC-AGI-3. Não passámos esta coroa para o Claude Opus 5 porque a Artificial Analysis mede a sua taxa de alucinação em 50 % e o coloca bem abaixo dos dois modelos Fable no AA-Omniscience.
| Modelo | Melhor para | Benchmark-chave | Ponto fraco | Preço |
|---|---|---|---|---|
| Claude Fable 5.1 | Maior precisão factual medida | 67 % de precisão factual no AA-Omniscience, a maior que a Artificial Analysis mediu, um ponto acima do Claude Opus 5.5 | Sem escalão barato; não avaliado no quadro de pesquisa da Arena; o Opus 5.5 lidera o Humanity's Last Exam e o índice AA-Omniscience | $10 / $50 |
| Gemini 3.1 Pro | Melhor valor, trabalho factual barato | 98 % ARC-AGI-1 (iguala o painel humano) a $0.52/tarefa, 94,1 % GPQA (igualado pelo Sol) | ARC-AGI-2 77,1 % agora ~14.º; #9 na Arena pesquisa | $2.00-$4.00 / $12.00-$18.00 (escalonado) |
| Claude Fable 5 | Pesquisa ancorada | #5 no quadro de pesquisa da Arena, atrás do GPT-5.6 Sol | Sem um único nível barato | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Raciocínio inédito | #3 ARC-AGI-2 com 92,5 %, atrás do GPT-6 Astra (95 %) e do Claude Opus 5.5 (93,3 %) | Scheming assinalado pelo METR | $4 / $20 |
| Claude Opus 5 | Os problemas inéditos mais difíceis | #1 ARC-AGI-3 com 30 %, ~3,75x o modelo seguinte (ARC Prize) | A Artificial Analysis mede uma taxa de alucinação de 50 % | $5 / $25 |
| Qwen 3.7 Max | Precisão frontier a preço vantajoso | 92,4 GPQA Diamond, 200 pedidos grátis/dia | Apenas API, sem front-end de chat | $1.25 / $3.75 promo; $2.50 / $7.50 tabela |
| Claude Opus 4.6 | Honestidade sob pressão | #1 no quadro MASK da Scale SEAL com 96,28; a Anthropic ocupa o top 5 | Substituído como modelo de topo | Modelo legacy da Anthropic |
A coroa da precisão fica com o Claude Fable 5.1, e foi testada a sério. O Claude Opus 5.5 chegou a 22 de setembro e levou o Humanity's Last Exam com 61,4 % contra 59,1 % e o índice AA-Omniscience penalizado por alucinações com 46,4 contra 43,5, mas esta categoria decide-se pela coluna de precisão factual em bruto e aí o Fable 5.1 continua a marcar 67 % contra os 66 % do Opus 5.5. É um ponto de diferença, por isso o bloco diz agora sem rodeios que os dois se repartem em vez de fingir que o Fable 5.1 varre tudo: use o Opus 5.5 quando uma resposta errada é pior do que nenhuma, e o Fable 5.1 quando quer o maior número de factos certos. E ainda duas correções à entrada do mês passado. Dizia que o GPT-5.6 Sol liderava o ARC-AGI-2 e que o Claude Opus 5 liderava o ARC-AGI-3; o GPT-6 Astra lidera os dois desde o lançamento a 3 de setembro, como o bloco de resolução de problemas já dizia, e essa contradição desapareceu. E o ARC-AGI-1 passou à frente do painel humano: o Claude Fable 5 e o GPT-6 Astra fazem ambos 98,5 % onde o painel de 2025 faz 98 %, por isso os 98 % do Gemini 3.1 Pro a $0,52 por tarefa continuam verdadeiros e continuam a ser o argumento de valor, mas já não são o topo desse quadro. O outro movimento do mês na precisão é o GPT-6 Sol, e acontece abaixo da coroa: a Artificial Analysis mede a sua taxa de alucinação em 60 % contra os 92 % do GPT-5.6 Sol, enquanto a precisão factual pura desce de 59 % para 55 %, o que sobe o seu índice AA-Omniscience de 22,0 para 27,1.
Melhor IA para resolução de problemas
A melhor IA para resolução de problemas difíceis é o GPT-6 Astra, que tirou ao GPT-5.6 Sol os quadros de raciocínio poucos dias depois de ser lançado. Lidera o LiveBench Reasoning com 92,65 e o ARC-AGI-2 com 95 %, a pontuação mais alta alguma vez obtida contra o painel humano de 100 % desse quadro, e é terceiro no LiveBench Mathematics com 96,81 atrás dos 97,08 do Claude Opus 5.5 e dos 97,01 do Claude Fable 5.1. Reporta também 97,6 % no FrontierMath Tier 4 v2, um número a ler juntamente com a divulgação da Epoch AI de que a OpenAI financiou o benchmark e detém acesso exclusivo a parte dele. O senão é o preço e o alcance: $10 / $50 por 1M de tokens contra os $4 / $20 do Sol, e exige um plano pago do ChatGPT. O GPT-5.6 Sol é a alternativa de valor, terceiro em ambos os quadros LiveBench com 96,20 e 91,65 e terceiro no ARC-AGI-2 desde que o Claude Opus 5.5 marcou 93,3 %. O GPT-6 Sol custa metade, $2 / $10, e supera-o no índice da Artificial Analysis, mas nenhum quadro de raciocínio o avaliou ainda. O Qwen 3.7 Max é a escolha económica para problemas de competição com 97,1 no índice HMMT de fevereiro de 2026 e 44,5 no Apex, com 200 pedidos gratuitos por dia. O Claude Opus 5 continua a ser a alternativa para longas cadeias de raciocínio agêntico, embora o Astra também lhe tenha tirado o ARC-AGI-3.
| Modelo | Melhor para | Benchmark-chave | Ponto fraco | Preço |
|---|---|---|---|---|
| GPT-6 Astra | Matemática, ciência e raciocínio mais difíceis | #1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3 | Exige um plano pago do ChatGPT; 2,5x o preço do Sol | $10 / $50 |
| Claude Opus 5 | Longas cadeias de raciocínio agêntico | #2 AA-Briefcase (1673) e #2 GDPval-AA v2.1 (1708); 30,2 % ARC-AGI-3 | O Astra lidera agora o ARC-AGI-3; 50 % de taxa de alucinação | $5 / $25 |
| GPT-5.6 Sol | Topo de gama STEM acessível | #3 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) e Reasoning (91,65) | FrontierMath ainda não publicado; METR sinalizou comportamento manipulador | $100/mês ChatGPT Pro; API $4 / $20 |
| GPT-6 Sol | O mesmo nível por metade do preço | Intelligence Index 47,5 (v4.3.2) contra os 47,0 do GPT-5.6 Sol, a $1,06 por tarefa do índice contra $1,99 | Nem o LiveBench nem a ARC Prize o avaliaram, por isso não detém aqui nenhum quadro | $2 / $10 |
| Qwen 3.7 Max | Matemática de competição com orçamento apertado | 97,1 HMMT 2026 fev., 44,5 Apex, 200 pedidos grátis/dia | Apenas API | $1.25 / $3.75 promo; $2.50 / $7.50 tabela |
| Claude Fable 5 | Matemática dentro de um fluxo de programação | #1 na subcategoria de matemática da Arena (1543), 96,0 LiveBench Mathematics | A opção mais cara aqui | $10 / $50 |
| GLM 5.3 Flash | Resolução de problemas open-weight | Intelligence Index 41,8 sob MIT, quase oito pontos acima do GLM-5.2 com menos de metade do tamanho; 320B/18B ativos, contexto 1M | Exige um servidor multi-GPU, não uma estação de trabalho; o GLM 5.3 pontua mais alto segundo os números da própria Z.ai e é transferível desde 28 de agosto, mas com mais do dobro do tamanho e sob uma licença própria | Open weights (MIT) |
A coroa da resolução de problemas passou para o GPT-6 Astra, que levou os quadros pelos quais esta categoria se decide poucos dias após o lançamento a 3 de setembro. Lidera o LiveBench Reasoning com 92,65 contra os 91,65 do GPT-5.6 Sol, leva o ARC-AGI-2 com 95 % contra os 92,5 % do Sol e destronou o Claude Opus 5 no ARC-AGI-3, onde os seus 62,7 % no harness padrão batem os 30,2 % do Opus 5. Leia os números do ARC-AGI-3 com atenção: esse quadro mede eficiência de ação ao nível humano em ambientes inéditos, não problemas resolvidos, e os 98,6 % tão citados vêm de um harness com adaptador do fornecedor, não do padrão. O Sol desce ao terceiro lugar em ambos os quadros LiveBench mas continua a ser a alternativa de valor a $4 / $20 contra os $10 / $50 do Astra, e o LiveBench Mathematics mudou de mãos duas vezes desde então, para o Claude Fable 5.1 com 97,01 e a 22 de setembro para o Claude Opus 5.5 com 97,08. Depois disso mexeram-se duas coisas. A ARC Prize pontuou o Claude Opus 5.5 com 93,3 % no ARC-AGI-2, o que faz o GPT-5.6 Sol descer para terceiro nesse quadro, e a 22 de setembro chegou o GPT-6 Sol a $2 / $10, metade do que custa o nível 5.6, com um Intelligence Index mais alto mas ainda sem nota própria no LiveBench nem na ARC Prize.
Melhor agente de IA
O melhor agente de IA é o Gemini Spark se quiser o agente na cloud e o Claude Cowork se o quiser no seu computador. São escolhas conjuntas e não um primeiro e um segundo: o Spark corre numa VM da Google Cloud, pelo que continua a trabalhar com o portátil fechado, ligado ao Gmail, ao Docs e, desde o início de setembro, ao Google Fotos; o Cowork corre no seu Mac ou Windows e comanda as suas aplicações locais e o seu ecrã. Nenhum quadro independente mede os dois produtos um contra o outro, pelo que a escolha é sobre onde o trabalho tem de acontecer e não sobre quem pontua mais. O preço também já não desempata: o Spark chega agora ao nível Google AI Pro de $19.99/mês nos EUA e em mais de 160 outros países, e o Cowork está incluído sem custo adicional em todos os planos pagos do Claude a partir de $20/mês. O ChatGPT Codex Mobile (14 de maio) é a alternativa para trabalho de agente de programação, e os agentes de navegador da classe OpenAI Operator para tarefas web. Leia a comparação completa entre Gemini Spark e Claude Cowork.
| Agente | Melhor para | Onde funciona | Ponto forte | Preço |
|---|---|---|---|---|
| Gemini Spark | Tarefas na cloud 24/7, fluxos do Workspace | VM da Google Cloud (sempre ativa) | Primeiro verdadeiro agente 24/7, integração profunda com o Workspace | Desde $19.99/mês Google AI Pro |
| Claude Cowork | Ambiente de trabalho, condução de aplicações, design + código | O seu ambiente de trabalho Mac/Windows | Conduz aplicações locais, vê o seu ecrã | $20/mês Claude Pro |
| ChatGPT Codex Mobile | Agente de programação no telemóvel | Cloud da OpenAI + iOS/Android | Aprovar diffs e reencaminhar o trabalho a partir do telemóvel | Incluído nos planos ChatGPT |
| Grok Agentic (Grok 4.7) | Investigação em tempo real, recolha do X | Nuvem da SpaceXAI | Integração nativa com o X; Elo 1695 no GDPval-AA v2.1, quarto entre modelos distintos | $30 por mês SuperGrok, ainda no 4.6 |
| OpenAI de classe Operator | Tarefas de navegador, formulários web | Cloud da OpenAI + o seu navegador | Automação web | ChatGPT Pro |
Não saiu nenhum produto de agente para consumidores novo, por isso as coroas não se mexem: o Gemini Spark (nuvem) e o Claude Cowork (computador) continuam a ser escolhas conjuntas separadas por onde o agente corre. O Spark expandiu-se ainda assim, chegou ao plano Google AI Pro de $19,99 por mês e ganhou o Google Fotos, onde consegue pesquisar, editar, organizar e correr fluxos agendados. A camada de modelos por baixo mexeu-se bastante, e quase tudo foi a 22 de setembro. O Claude Opus 5.5 lidera agora os dois quadros agênticos que a Artificial Analysis publica: o AA-Briefcase v1.1 com 1822 contra os 1678 do Claude Fable 5.1 e os 1673 do Claude Opus 5, e o GDPval-AA v2.1 com 1846 contra 1735 e 1708. Iguala ainda o GPT-6 Astra no Terminal-Bench 4.0 a $4 / $20 contra $10 / $50, o que faz dele o modelo sobre o qual a maioria das equipas deve agora construir, em vez da recomendação do Opus 5 que este bloco trazia. A Agent Arena da Arena não o avaliou, e aí continua a liderar o Claude Fable 5.1 na conclusão de tarefas com 19,8 %, com o GPT-6 Astra em segundo com 17,7 %, o DeepSeek V4.1-Flash em terceiro e o Claude Opus 5 em quarto. O outro movimento é o Grok 4.7 da SpaceXAI (21 de setembro): 1695 no GDPval-AA v2.1 e 1657 no AA-Briefcase colocam-no em quarto e sétimo, acima do GPT-6 Astra nos dois, ainda que chegue à API, ao Cursor e ao Grok Build e não a um produto de agente para consumidores. O Muse Spark 1.3 da Meta fica em quinto entre modelos distintos no GDPval-AA v2.1 com 1674, abaixo do Grok 4.7 e não acima como reportámos no mês passado, e a Scale SEAL continua a ter avaliado apenas o mais antigo 1.1, que lidera o seu quadro de uso de ferramentas MCP Atlas com 88,1. O GLM 5.3 Flash (26 de agosto, MIT) continua a ser o modelo agêntico aberto que alojaríamos, com AutomationBench 48,8 no gráfico da própria Z.ai onde o Claude Opus 4.8 faz 41,0; no sinal de conclusão de tarefas da Agent Arena o GLM-5.2 está em décimo sétimo e o Kimi K3 em quinto, sendo o modelo aberto mais bem colocado o DeepSeek V4.1-Flash em terceiro.
Os principais modelos como ChatGPT, Claude e Gemini, juntos no Mac, iPhone e iPad.
Grátis para começar, 4,7★ em mais de 27 000 críticas.
Descarregar Fello AIMelhor IA para estudantes
A melhor IA para estudantes é o GPT-5.6 Luna dentro do ChatGPT para trabalho de curso geral e o Gemini 3.6 Flash dentro da aplicação Gemini para STEM e estudo multimodal, com o Qwen 3.7 Max como alternativa por API para conjuntos de problemas mais difíceis (200 pedidos grátis por dia) e o Claude Opus 5 como alternativa para revisão de ensaios. A maioria dos estudantes não precisa de pagar, e o nível gratuito melhorou a 6 de agosto: o GPT-5.6 Luna passou a ser o modelo por omissão do ChatGPT Free e Go, com conversas de texto ilimitadas e um botão Think para perguntas mais difíceis, embora os carregamentos de ficheiros e as ferramentas de imagem continuem limitados. A 22 de setembro a OpenAI acrescentou o GPT-6 Luna para os utilizadores Free e Go na aplicação de computador do ChatGPT, um modelo da geração atual no nível gratuito logo no primeiro dia, embora no índice da Artificial Analysis faça os mesmos 37,3 que o GPT-5.6 Luna. O Gemini 3.6 Flash continua a ser o que a aplicação Gemini gratuita serve, o Claude Sonnet 5 é o Claude gratuito por omissão, e o DeepSeek V4 é grátis no site de conversa da DeepSeek. O Luna é o membro mais barato da família GPT-5.6 e não o mais forte, por isso recorra ao botão Think ou mude para o GPT-5.5 quando um ensaio exigir mais cuidado. Para trabalhar passo a passo a matemática mais dura, o GPT-5.6 Sol é o carro-chefe pago da OpenAI e o GPT-6 Astra reporta agora 97,6 % no FrontierMath Tier 4 v2 contra os 39,6 % verificados do GPT-5.5 Pro, embora o Astra ainda não está no nível gratuito do ChatGPT; o Qwen 3.7 Max é a alternativa de valor com 97,1 no índice HMMT de fevereiro de 2026 e preços de API de $1,25 / $3,75 na sua promoção atual de 50 % ($2,50 / $7,50 de tabela).
| Tarefa | Melhor modelo | Porquê | Grátis? | Alternativa |
|---|---|---|---|---|
| Ensaios & trabalho de curso | GPT-5.6 Luna | Por omissão e grátis no ChatGPT desde 6 de agosto; conversas de texto ilimitadas, e GPT-6 Luna na aplicação de computador desde 22 de setembro | Sim | Claude Sonnet 5 (Claude grátis) |
| Resolução de problemas STEM | GPT-5.6 Sol / Qwen 3.7 Max | Carro-chefe STEM pago; o Astra reporta 97,6 % no FrontierMath Tier 4 v2 / 97,1 HMMT fev 2026 | Pro pago / Qwen API pago | Gemini 3.6 Flash (grátis) |
| Investigação & precisão | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarefa, ancoragem nativa na Pesquisa Google | Sim (aplicação Gemini) | Claude Opus 5 |
| Revisão de escrita | Claude Sonnet 5 | Grátis e predefinido no claude.ai; o Claude Fable 5 é o líder de qualidade | Sim (Claude grátis) | Claude Fable 5 |
| Estudo multimodal (PDFs, slides, imagens) | Gemini 3.6 Flash | Contexto 1M, grátis na aplicação Gemini | Sim | NotebookLM (Google) |
O nível gratuito é o que se moveu neste guia. A 6 de agosto a OpenAI tornou o GPT-5.6 Luna o modelo por omissão do ChatGPT Free e Go e deu a ambos conversas de texto ilimitadas mais um botão Think para perguntas mais difíceis, pelo que a escolha gratuita é agora o Luna em vez do GPT-5.5, que continua selecionável quando um ensaio exige mais cuidado. Os carregamentos de ficheiros, as imagens e outras ferramentas continuam limitados. Do lado da Google nada se moveu: o Gemini 3.8 Flash saiu a 2 de setembro mas chega aos utilizadores gratuitos apenas através do AI Studio e da API, pelo que a aplicação Gemini gratuita continua a servir o 3.6 Flash e este mantém a linha multimodal. O GPT-6 Astra (3 de setembro) é o modelo a vigiar para conjuntos de problemas difíceis, com 97,6 % reportados no FrontierMath Tier 4 v2 contra os 39,6 % verificados do GPT-5.5 Pro, mas exige um plano pago do ChatGPT e nenhum nível gratuito o inclui. O nível gratuito voltou a mexer-se a 22 de setembro: os utilizadores Free e Go chegam agora ao GPT-6 Luna na aplicação de computador do ChatGPT. Leia-o como mais barato e não como mais inteligente, porque a Artificial Analysis dá-lhe 37,3, ao nível da versão 5.6, e a ARC Prize separa os dois por duas décimas de ponto no ARC-AGI-2.
Melhor IA para o trabalho & profissionais
A melhor IA para trabalho profissional é o GPT-5.6 (predefinição do ChatGPT desde 9 de julho) para trabalho de conhecimento diário, o Claude Opus 5 para programação e escrita de alto risco, e o Gemini Spark para fluxos agênticos 24/7. A maioria dos profissionais tira o máximo partido ao manter duas subscrições pagas (ChatGPT Plus a $20/mês mais Claude Pro a $20/mês, um total de $40/mês), ou ao consolidar com o Fello AI a $9.99/mês para os cinco melhores modelos numa aplicação de Mac/iOS. Para trabalho agêntico que corre enquanto dorme, o Gemini Spark é o único verdadeiro agente na cloud 24/7 e, desde 30 de julho, chega ao nível Google AI Pro de $19.99/mês além do Google AI Ultra.
| Caso de utilização | Melhor modelo | Dado-chave | Preço | Alternativa |
|---|---|---|---|---|
| Trabalho de conhecimento diário | GPT-5.6 | Predefinição do ChatGPT desde 9 de julho; o assistente que a maioria consegue abrir | $20/mês ChatGPT Plus | Claude Opus 5 |
| ChatGPT Work e Codex | GPT-6 Sol | No ChatGPT Work e no Codex para Plus, Pro, Business, Enterprise e Edu desde 22 de setembro, a $2 / $10 na API | $20/mês ChatGPT Plus | GPT-6 Luna para trabalho de volume |
| Programação (proprietária) | Claude Opus 5.5 | #1 Terminal-Bench 4.0 (59,6 %) e #1 nos dois quadros de programação do LiveBench, a $4 / $20 | $20 por mês Claude Pro | GPT-6 Astra, que mantém os dois quadros de programação da Arena |
| Programação (económica) | Qwen3.8-Max-0902 | #5 Code Arena: WebDev (1662), atrás do GPT-6 Astra, do Claude Fable 5.1, do Claude Opus 5 e do anterior Qwen3.8-Max; apenas API na QwenCloud | $2 / $6 | Qwen 3.7 Max; DeepSeek V4.1-Flash |
| Investigação & briefings | Gemini 3.1 Pro | 98 % ARC-AGI-1 a $0.52/tarefa, ancoragem Google | Google AI Pro / Ultra | Claude Opus 5 |
| Matemática difícil, física, modelação financeira | GPT-6 Astra | #1 LiveBench Reasoning e ARC-AGI-2 (95 %); reporta 97,6 % no FrontierMath Tier 4 v2 | $100/mês ChatGPT Pro | GPT-5.6 Sol; Qwen 3.7 Max |
| Fluxos de agente sempre ativos | Gemini Spark | Primeiro agente na cloud 24/7 | Desde $19.99/mês Google AI Pro | Claude Cowork |
| Notícias em direto, criativo com contexto do X | Grok 4.7 | Intelligence Index 46,3 + ancoragem nativa no X; a aplicação Grok continua a servir o 4.6 | $30 por mês SuperGrok | Gemini 3.1 Pro |
| Consolidação tudo-em-um | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/mês | Pagar a cada fornecedor em separado |
Três lançamentos caíram nos primeiros três dias de setembro e um quarto a 22 de setembro, e é este último que muda o argumento de preço em que este bloco assenta. O Claude Opus 5.5 encabeça o Intelligence Index da Artificial Analysis com 57,6 na v4.3.2 e os seus dois quadros agênticos, e fá-lo a $4 / $20 contra os $5 / $25 do Claude Opus 5. O raciocínio que este bloco trazia, de que as equipas deviam começar pelo Opus 5 por custar metade dos modelos melhores, já não se aplica: o Opus 5.5 é ao mesmo tempo melhor e mais barato, por isso fica com a linha da programação proprietária e é o modelo sobre o qual construiríamos o trabalho diário. O GPT-5.6 mantém ainda assim a linha do assistente diário, porque essa linha é sobre alcance e não sobre pontuação, e nem o Opus 5.5 nem o GPT-6 Astra são a opção por omissão de centenas de milhões de pessoas. O Qwen3.8-Max-0902 da Alibaba (2 de setembro) mantém a linha da programação económica a $2 / $6, ainda que só exista na API da QwenCloud sem interface para consumidores. O GPT-6 Sol e o GPT-6 Luna aterraram a 22 de setembro exatamente na superfície de que trata este bloco: o ChatGPT Work e o Codex, para Plus, Pro, Business, Enterprise e Edu, a $2 / $10 e $0,10 / $0,50 na API, e não na janela de chat comum.
Preços dos modelos de IA em setembro de 2026
De escalões gratuitos a $0 até ao Google AI Ultra a $199,99 por mês. O preço mais consequente deste quadro é o Claude Opus 5.5 a $4 / $20, porque a 22 de setembro a Anthropic lançou o modelo com a pontuação mais alta que qualquer avaliador independente já mediu por um preço de tabela inferior ao do modelo que substitui: o Claude Opus 5 custa $5 / $25, e as leituras de cache descem 60 % para $0,20, com o número da própria Anthropic a colocar uma carga de trabalho típica 40 % mais barata do que no Opus 5. Isso inverte a forma que esta secção teve todo o ano, em que o melhor modelo era também o mais caro. O Claude Fable 5.1 e o GPT-6 Astra estão ambos a $10 / $50 e ambos pontuam agora abaixo. O Muse Spark 1.3 da Meta custa $1,25 / $4,25, sem alterações ao longo de três saltos de capacidade desde julho, com um escalão Contributor a $0,10 / $0,20 para quem aceitar que a Meta treine com os seus prompts, e tanto o Grok 4.6 como o Grok 4.7 estão a $2 / $6, com a ressalva de que um prompt de 200 000 tokens ou mais refatura o pedido inteiro a $4 / $12. O Grok 4.7 é o caso mais claro desta página de um preço que não se mexeu enquanto o custo se mexeu: os tokens custam o mesmo e uma tarefa do Intelligence Index custa $2,73 contra os $1,86 do Grok 4.6, porque o 4.7 emite cerca do dobro da saída para lá chegar. A ponta barata mexeu-se duas vezes. A DeepSeek subiu os dois modelos V4 cerca de quatro vezes a 16 de agosto, o que custou ao V4-Flash a escolha de relação preço-desempenho, e reverteu a maior parte a 10 de setembro: o V4-Flash foi retirado e o V4.1-Flash tomou o seu lugar a $0,15 / $0,60 fora de pico e $0,30 / $1,20 em pico. Entre os modelos que se compram ao token a escolha continua a ser o GLM 5.3 Flash, agora no seu preço de tabela simples de $0,15 / $0,50 desde que a promoção de lançamento expirou a 9 de setembro, porque a Artificial Analysis mede-o em $0,25 por tarefa do Intelligence Index com uma pontuação de 41,8 contra os $0,27 da DeepSeek com 39,5. Fora de pico os dois estão iguais na entrada e o GLM é mais barato na saída; em pico o GLM ganha nas duas. Um modelo aberto bate-os aos dois no custo por tarefa e tem quatro dias: o MiMo-V2.6-Pro da Xiaomi resolve uma tarefa do índice por $0,13 com uma pontuação de 46,3 sob MIT simples, mas é preciso alojar 1,02 biliões de parâmetros para isso. Na fronteira a escolha por valor é o Muse Spark 1.3 da Meta, a $1,60 por tarefa do índice com 48,1. Entre os modelos fechados o GPT-6 Luna ficou com esse título a 22 de setembro, a $0,10 / $0,50 ao token e $0,07 por tarefa do índice, o mais barato por tarefa de toda esta página; o GPT-6 Sol desceu da mesma forma, de $4 / $20 para $2 / $10, exatamente sobre o tarifário do Claude Sonnet 5, e a OpenAI diz que os dois cortes são permanentes e não promocionais. Para uma análise mais aprofundada, veja o nosso guia completo de comparação de preços de IA.
| Modelo | Entrada (por 1M) | Saída (por 1M) | Contexto | Acesso grátis? |
|---|---|---|---|---|
| GPT-6 Astra | $10.00 | $50.00 | 1 050 000 (entrada máx. 922 000) | No Chat em Pro, Business e Enterprise desde 4 de setembro; o Plus tem-no no ChatGPT Work e no Codex, não no Chat; sem plano gratuito; ativo na API |
| GPT-6 Sol | $2.00 | $10.00 | 1 050 000 (entrada máx. 922 000) | ChatGPT Work e Codex em Plus, Pro, Business, Enterprise e Edu desde 22 de setembro; API; não no Chat |
| GPT-6 Luna | $0.10 | $0.50 | 1 050 000 (entrada máx. 922 000) | Free e Go na aplicação de computador do ChatGPT; ChatGPT Work e Codex nos planos pagos; API; não no Chat |
| GPT-5.5 | $5.00 | $30.00 | 1M (400K no Codex) | ChatGPT Free; API paga |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro a partir de $100/mês (nível de maior utilização a $200) |
| GPT-5.6 Sol | $4.00 | $20.00 | Não publicado | Em direto no ChatGPT, Codex & API (9 de julho); tarifa promocional pelo menos até 21 de novembro de 2026 |
| GPT-5.6 Terra | $2.00 | $12.00 | Não publicado | Em direto no ChatGPT, Codex & API (9 de julho) |
| GPT-5.6 Luna | $0.20 | $1.20 | Não publicado | Em direto no ChatGPT, Codex & API (9 de julho) |
| Claude Opus 5.5 | $4.00 | $20.00 | 1M | Claude Pro/Max/Team; API paga; leituras de cache $0,20 |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Predefinição no Claude Pro/Max; API paga |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Modelo legacy na Anthropic; Pro/Max/API |
| Claude Fable 5.1 | $10.00 | $50.00 | 1M | Leituras de cache $0.25; no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos. O Mythos 5.1 fatura de forma idêntica, apenas por convite |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Permanente no Max/Team Premium (~50 % dos limites de utilização); Pro/Team Standard via créditos |
| Claude Sonnet 5 | $2.00 | $10.00 | 1M | Predefinição no Claude Free & Pro; API paga |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API paga (substituído pelo Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Aplicação Gemini limitada; API paga |
| Gemini 3.8 Flash | $0.75 introdutório / $1.50 a partir de 1/1/2027 | $3.75 introdutório / $7.50 a partir de 1/1/2027 | 1M | AI Studio, Antigravity, Gemini Enterprise + API paga; na aplicação Gemini reportado para AI Pro/Ultra |
| Gemini 3.7 Flash | $0.75 introdutório / $1.50 a partir de 1/1/2027 | $3.75 introdutório / $7.50 a partir de 1/1/2027 | 1M | AI Studio, Android Studio, Antigravity + API paga; na aplicação Gemini apenas via Spark (AI Pro/Ultra, exclui EEE/RU/CH/Nigéria) |
| Gemini 3.6 Flash | $0.75 introdutório / $1.50 a partir de 1/1/2027 | $3.75 introdutório / $7.50 a partir de 1/1/2027 | 1M | Modelo predefinido da aplicação Gemini gratuita; AI Studio; nível API gratuito + API paga |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; nível API gratuito + API paga |
| Qwen3.8-Max-0902 | $2.00 ($0.17 cache hit explícito, $0.25 implícito) | $6.00 | 1M (saída de 128K) | Apenas API na QwenCloud; sem chat de consumo, sem pesos abertos |
| Qwen 3.7 Max | $1.25 promo / $2.50 tabela | $3.75 promo / $7.50 tabela | 1M | 200 pedidos grátis/dia; API paga para além disso |
| MiniMax M3 | $0.30 (50 % de desconto sobre $0.60) | $1.20 (≤512K) | 1M | Open weights; custos de alojamento aplicáveis |
| LongCat-2.0 | Depende do fornecedor | Depende do fornecedor | 1M | Open weights (MIT); custos de alojamento aplicáveis |
| NVIDIA Nemotron 3 Ultra | Depende do fornecedor | Depende do fornecedor | 1M | Open weights (OpenMDW); custos de alojamento aplicáveis |
| Qwen 3.5 (open-weight) | Auto-alojamento / Together | Auto-alojamento / Together | 1M | Open weights; custos de alojamento aplicáveis |
| Nex-N2-Pro | Auto-alojamento / fornecedores | Auto-alojamento / fornecedores | 1M | Open weights (Apache 2.0); custos de alojamento aplicáveis |
| Rio 3.5 Open 397B | Auto-alojamento / fornecedores | Auto-alojamento / fornecedores | 1M | Open weights (MIT); custos de alojamento aplicáveis |
| Grok 4.3 | $1.25 | $2.50 | 1M | Plano de consumo gratuito; API paga |
| Grok 4.6 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API da SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
| Grok 4.7 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API da SpaceXAI, Cursor, Grok Build, harnesses e routers na nuvem; não na aplicação Grok |
| Muse Spark 1.3 | $1.25 ($0.10 nível Contributor) | $4.25 ($0.20 nível Contributor) | 1M | API paga; Muse Code, Meta Model API e OpenRouter; o nível Contributor troca direitos de treino por um desconto de ~92 % |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Nível básico gratuito na aplicação Kimi; open weights no Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (vídeo) | $1.50 | $17.50 (saída de vídeo) | Clips de 10 segundos | Aplicação Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.66 fora de ponta / $1.32 em ponta ($0.022 cache-hit fora de ponta) | $1.98 fora de ponta / $3.96 em ponta | 1M | DeepSeek Chat grátis; API paga, preços de ponta e fora de ponta desde 16 de agosto |
| DeepSeek V4.1-Flash | $0.15 fora de ponta / $0.30 em ponta ($0.003 acerto de cache fora de ponta) | $0.60 fora de ponta / $1.20 em ponta | 1M | DeepSeek Chat gratuito; API paga, tarifas fora de ponta e em ponta; substituiu o V4-Flash a 10 de setembro |
| Kimi K2.7 Code | Depende do fornecedor | Depende do fornecedor | 256K | Open weights; custos de alojamento aplicáveis |
| GLM-5.2 | Depende do fornecedor | Depende do fornecedor | 1M | Open weights; custos de alojamento aplicáveis |
| GLM 5.3 | $1.40 ($0.26 cache-hit) | $4.40 | 1M | API da Z.ai, GLM Coding Plan e ZCode; pesos no Hugging Face desde 28 de agosto sob a licença própria GLM 5.3 License |
| GLM 5.3 Flash | $0.15 ($0.03 cache-hit); $0.075 em promoção | $0.50; $0.25 em promoção | 1M | API da Z.ai, GLM Coding Plan, OpenRouter; pesos MIT no Hugging Face; promoção acaba a 9 de setembro |
| Tencent Hy4 Preview | $0.834 ($0.042 cache-hit) | $2.501 | 1M+ | Pesos abertos (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy |
| Qwen3.8-Flash-Next | Depende do fornecedor | Depende do fornecedor | 262K (até 1M) | Pesos abertos (Qwen Community License 1.0); acrescem custos de alojamento |
| MiMo-V2.6-Pro | $0.435 | $0.87 | 1M | Pesos abertos (MIT); os custos de alojamento aplicam-se |
| ERNIE 5.1 | Preço para a região China | Preço para a região China | 256K | Nível gratuito da Baidu |
| Gemini Spark (agente) | Sem preço de API | Sem preço de API | 1M (base Gemini) | Google AI Pro $19.99, AI Ultra $99.99 ou $199.99/mês |
| Fello AI (agregador) | Encaminhado pela aplicação | Encaminhado pela aplicação | Depende do modelo | $9.99/mês, versão gratuita disponível |
As tarifas do GPT-5.5 e GPT-5.5 Pro acima são preços de contexto curto; a OpenAI já não publica os números específicos de contexto longo. Os níveis GPT-5.6 são faturados a 2x a entrada e 1,5x a saída assim que um prompt ultrapassa os 272K tokens de entrada, o que coloca o Terra de contexto longo em $4 / $18 e o Luna em $0.40 / $1.80. Para os níveis GPT-6 a OpenAI não publica sobretaxa de contexto longo, e as suas leituras de cache ficam 90 % mais baratas: $1.00 no Astra, $0.20 no Sol e $0.01 no Luna. O Grok 4.6 funciona da mesma forma, mas morde com mais força: a partir de 200 000 tokens de prompt, a SpaceXAI volta a faturar o pedido inteiro à taxa mais alta em vez de apenas o excedente, pelo que ultrapassar o limite por mil tokens duplica o custo de toda a chamada. A outra tabela que convém ler duas vezes é a da DeepSeek: desde 16 de agosto, os seus dois modelos V4 são faturados ao preço de ponta das 01:00 às 04:00 e das 06:00 às 10:00 UTC nos dias úteis, e a exatamente metade em qualquer outra hora, pelo que a mesma tarefa pode custar o dobro consoante a hora a que a executar. Se quiser acesso a vários modelos de IA sem gerir subscrições separadas, o Fello AI disponibiliza GPT, Claude, Gemini, Grok, Perplexity e mais numa única aplicação para Mac, iPhone e iPad a partir de $9.99/mês.
Melhores modelos open-weight em setembro de 2026
O melhor modelo de pesos abertos em setembro de 2026 é o MiMo-V2.6-Pro, que a Xiaomi publicou a 21 de setembro sob MIT simples: 1,02 biliões de parâmetros com 42 mil milhões ativos, contexto de 1M de tokens e os pesos no Hugging Face no próprio dia. A Artificial Analysis mede-o em 46,3 no Intelligence Index v4.3.2, a maior pontuação aberta que alguma vez publicou, acima do GLM-5.3 com 44,8 e do Kimi K3 com 43,6, e fá-lo a $0,13 por tarefa do Intelligence Index, mais barato do que qualquer outro modelo aberto desta página. Consegue também 34,8 % no Terminal-Bench 4.0 e 1673 no GDPval-AA v2.1, o que o coloca acima do Kimi K3 nos dois. Dois limites honestos: nenhum quadro da Arena o avaliou, por isso não há qualquer prova de preferência humana sobre ele, e foi publicado há quatro dias, pelo que não tem histórico independente. O Kimi K3 continua a ser o modelo aberto mais bem colocado na Arena, sétimo no WebDev com 1658 e quinto no sinal de conclusão de tarefas da Agent Arena, e o GLM-5.3 continua a ser o modelo aberto mais forte no Terminal-Bench 4.0 da Artificial Analysis com 41,9 % contra os 34,8 % do MiMo, sob uma licença própria da Z.ai e não MIT. A recomendação prática para equipas que alojam os seus próprios pesos continua a ser o GLM 5.3 Flash (Z.ai, MIT), lançado a 26 de agosto e com 41,8 na v4.3.2, 320 mil milhões no total com 18 mil milhões ativos, porque um modelo de 1,02 biliões de parâmetros não é coisa para uma estação de trabalho e o descarregamento do K3 são 96 fragmentos safetensors e cerca de 1,56 TB. O patamar aberto barato mudou outra vez a 10 de setembro: a DeepSeek retirou o V4-Flash 0731 e substituiu-o pelo DeepSeek-V4.1-Flash, 552 mil milhões com 8 mil milhões ativos no prefill e 16 mil milhões na descodificação, nativamente multimodal, sob MIT no próprio dia, com 39,5 na v4.3.2 contra 34,3 da versão que substitui, e com o preço de volta a $0,15 / $0,60 fora de pico. É também terceiro no sinal de conclusão de tarefas da Agent Arena, o modelo aberto mais bem colocado ali. Dos três lançamentos que fecharam agosto, o GLM 5.3 publicou os seus pesos a 28 de agosto sob uma licença própria com uma cláusula que obriga qualquer operador de model-as-a-service acima de 10 mil milhões de dólares de receita a passar primeiro uma revisão de segurança da Z.ai; o Qwen3.8-Flash-Next da Alibaba, uma mistura de especialistas de 125 mil milhões com apenas 6 mil milhões ativos que antecipa a arquitetura Qwen4, pontua 39,8 e é nono no quadro WebDev da Arena; e o Hy4 Preview da Tencent, 770 mil milhões no total e 49 mil milhões ativos sob Apache 2.0, não tem avaliação da Artificial Analysis mas está em 11.º no Arena WebDev com 1624. Note também que o GLM 5.3 Flash não é um GLM 5.3 reduzido mas um modelo separado sobre uma base treinada de novo, e foi por isso que pôde sair sob MIT simples enquanto o topo de gama não pôde.
| Modelo | Melhor para | Benchmark-chave | Contexto / Licença | Onde executar |
|---|---|---|---|---|
| MiMo-V2.6-Pro | O maior Intelligence Index aberto alguma vez medido | II 46,3 (v4.3.2), acima do GLM-5.3 e do Kimi K3, a $0,13 por tarefa do índice; 34,8 % Terminal-Bench 4.0; GDPval-AA v2.1 1673; 1,02 biliões/42 mil milhões ativos | 1M / MIT | Hugging Face (XiaomiMiMo), fornecedores, alojamento próprio |
| Kimi K3 | Modelo aberto mais bem colocado na Arena | II 43,6 (v4.3.2); #5 Arena WebDev, a melhor posição aberta; #5 Agent Arena; 2.8T/104B ativos | 1M / Kimi K3 License | Hugging Face (96 shards, 1.56 TB), Moonshot API, fornecedores |
| GLM 5.3 Flash | Melhor modelo aberto que a maioria das equipas consegue mesmo executar | II 41,8 (v4.3.2), na fronteira de Pareto entre inteligência e custo, a cerca de $0.25 por tarefa do índice; 320B/18B ativos, nativamente multimodal | 1M / MIT | Hugging Face, API da Z.ai ($0.15/$0.50), OpenRouter |
| GLM-5.2 | Recurso com historial independente | II 33,7 (v4.3.2); #19 Arena WebDev (1,591.8), #17 Agent Arena; 744B/40B ativos | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| GLM 5.3 | Aberto desde 28 de agosto, mas com licença própria | II 44,8 (v4.3.2), a pontuação aberta mais alta que encontrámos; mesma base de 744B do GLM-5.2, apenas pós-treinada, checkpoint publicado contado em 753B; CyberGym 84,5 % e Terminal-Bench 3.0 28,3 (números do fabricante) | 1M / GLM 5.3 License (model-as-a-service acima de 10 mil milhões USD de receita precisa de revisão de segurança da Z.ai) | Hugging Face, API da Z.ai ($1.40/$4.40), GLM Coding Plan, ZCode |
| DeepSeek V4.1-Flash | Melhor relação qualidade-preço aberta se o alojar por conta própria | II 39,5 (v4.3.2) contra 34,3 da versão V4-Flash 0731 que substitui; 552B, 8B ativos no prefill e 16B na descodificação | 1M / MIT | DeepSeek API ($0.15/$0.60 fora de ponta, $0.30/$1.20 em ponta desde 10 de setembro), local |
| Tencent Hy4 Preview | Maior modelo com licença permissiva até agora | 770B/49B ativos; 2,99/4,00 no painel próprio da Tencent com 203 tarefas contra 2,94 do Kimi K3 e 2,92 do GLM 5.3 (fabricante); sem classificação da Artificial Analysis; #11 Arena WebDev (1624) | 1M+ / Apache 2.0 | Hugging Face (BF16 e FP8), Tencent Cloud TokenHub, OpenRouter |
| Qwen3.8-Flash-Next | Antevisão da arquitetura Qwen4 | 125B no total mais um embedding de N-gramas de 51B, 6B ativos; 91,7 GPQA Diamond e 62,5 SWE-Bench Pro (fabricante); II 39,8 (v4.3.2); #9 Arena WebDev (1635) | 262K a 1M / Qwen Community License 1.0 | Hugging Face, fornecedores, auto-alojamento |
| LongCat-2.0 | Programador aberto frontier treinado em chips chineses | II 33 (v4.1); 59,5 % SWE-Bench Pro (fornecedor), 1.6T/~48B ativos | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Multimodal de classe frontier barato | II 44 (v4.1), 59 % SWE-Bench Pro, multimodal | 1M / licença por definir | Hugging Face, API $0.30/1M (50 % de desconto) |
| Nex-N2-Pro | Pontuação de programação aberta mais forte | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B ativos | Baseado em Qwen / Apache 2.0 | Hugging Face, fornecedores, auto-alojamento |
| Kimi K2.7 Code | Programador aberto com licença comercial mais forte | +21,8 % no Kimi Code Bench v2 vs K2.6 (fornecedor); 1T/32B ativos | 256K / Modified MIT | Hugging Face, DeepInfra, fornecedores |
| DeepSeek V4-Pro | Trabalho agêntico em condições reais | II 44 (v4.1), 1.6T/49B ativos | 1M / MIT | DeepSeek API ($0.66/$1.98 fora de pico, $1.32/$3.96 em pico desde 16 de agosto), local |
| Hy3 | O mais recente participante com licença permissiva | II 41 (v4.1); #22 na Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, fornecedores, auto-alojamento |
| Inkling | Primeiro modelo open-weight da Thinking Machines | II 41 (v4.1), agêntico 32,3, lançado a 15 de julho | Open weights | Hugging Face, fornecedores, auto-alojamento |
| Inkling Small | Mesma família a um quarto do tamanho | II 40 (v4.1), agêntico 30,8; 276B/12B ativos, entrada de texto, imagem e áudio | Apache 2.0 | Hugging Face (BF16 e NVFP4), fornecedores, auto-alojamento |
| NVIDIA Nemotron 3 Ultra | Afinado pela NVIDIA, licença totalmente permissiva | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B ativos | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 auto-alojamento) |
| Qwen 3.5 (397B / 17B ativos) | Multimodal, descodificação rápida | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / aberto | Together, OpenRouter, local |
| Qwen3.6-35B-A3B | Programador agêntico aberto eficiente (3B ativos) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B ativos | 262K (até 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, local |
| Qwen3.6-27B | Programador denso executável em portátil | 87,8 GPQA Diamond, denso 27B, multimodal | 256K / Apache 2.0 | Local Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune de Qwen 3.5, raciocínio multilíngue | 70,8 Terminal-Bench 2.1 (first-party), bate o Qwen 3.7 Plus em 4/5 | 397B/17B ativos / MIT | Hugging Face, fornecedores, auto-alojamento |
| Llama 4 Maverick | Modelo de topo da linha Meta | 17B ativos / 400B de parâmetros no total | Llama 4 license | Cloud da Meta, Hugging Face, local |
| NVIDIA Nemotron 3 Nano Omni | Edge / baixo consumo | Multimodal, pegada muito reduzida | Compacto / aberto | Local, ferramenta NVIDIA |
Aqui a licença importa tanto como a pontuação bruta, e agosto alargou a distância entre os dois grupos. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) e Nemotron 3 Ultra (OpenMDW) permitem todos claramente a utilização comercial sem qualquer teste de receita. Os restantes trazem condições que convém ler antes de construir sobre eles: o MiniMax M3 e o MiniMax H3 chegam sob as suas próprias licenças comunitárias, exigindo o H3 ainda um pedido a partir dos EUA, da UE, do Reino Unido e da Coreia do Sul; o Kimi K3 assenta numa licença própria com um limiar de receita para quem o revenda como serviço; o GLM 5.3 exige uma revisão de segurança da Z.ai a qualquer operador de model-as-a-service acima de 10 mil milhões de dólares de receita; e a Qwen Community License 1.0 do Qwen3.8-Flash-Next exige uma licença à parte da Qwen para explorar um negócio de model-as-a-service ou de assistente de trabalho com IA, embora o uso interno esteja isento. Nenhum modelo open-weight é já o primeiro em qualquer quadro da Arena que seguimos: o Claude Opus 5 arrebatou o quadro Agent em julho, o último que um modelo open-weight liderou.
Benchmarks, preços e utilização prática
Cada classificação desta página combina três entradas: benchmarks públicos de sete casas independentes (Artificial Analysis, Arena antiga LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize e o quadro oficial Terminal-Bench 4.0, cobrindo o Intelligence Index, GPQA Diamond, ARC-AGI-1 a 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas e o Remote Labor Index), preços de API e subscrição publicados na página de preços oficial de cada fornecedor, e utilização prática pela equipa editorial da FelloAI que executa prompts reais sobre a mesma tarefa em cada modelo. Voltamos a obter as fontes oficiais de preços e benchmarks antes de cada atualização mensal.
Os benchmarks são ponderados consoante o caso de utilização: o SWE-bench e o Terminal-Bench impulsionam a programação, o GPQA Diamond e o ARC-AGI-2 impulsionam a precisão, o GDPval-AA (o benchmark de entregáveis profissionais da Artificial Analysis) informa a qualidade das tarefas profissionais ao passo que o estilo de escrita é avaliado sobretudo por testes práticos, o FrontierMath e o HMMT impulsionam a resolução de problemas. Revelamos quando um benchmark é reportado pelo fornecedor mas não verificado de forma independente, e descartamos qualquer afirmação que não conseguimos reproduzir contra uma fonte em direto. Classificamos por pontuações medidas: a coroa de uma categoria muda assim que um modelo supera o detentor nos quadros que definem essa categoria, sem esperar pelos quadros baseados em votos, e um modelo que ainda não está amplamente disponível é assinalado no seu cartão em vez de ficar sem ele. Reverificamos as posições tanto como os números, porque uma pontuação pode continuar correta enquanto o quadro à sua volta se move. Quando um modelo passa por uma atualização importante entre atualizações, reclassificamos a categoria e acrescentamos uma linha «O que mudou este mês» no fundo da análise aprofundada.
O Fello AI reúne os melhores modelos de IA numa aplicação nativa e leve.
Alterne entre eles a qualquer momento, sem subscrições separadas.
Descarregar Fello AI




