Os melhores modelos de IA open source voltaram a mudar de líder em setembro. A Xiaomi publicou os pesos do MiMo-V2.6-Pro a 21 de setembro de 2026 sob uma licença MIT simples, e a Artificial Analysis dá-lhe agora 46,3 no seu Intelligence Index v4.3.2, o valor mais alto de qualquer modelo de open weights e ao nível do Grok 4.7. O melhor modelo fechado, o Claude Opus 5.5, está nos 57,6. O Kimi K3 continua a ser o maior modelo aberto e o modelo aberto que os votantes da Arena colocam mais acima, o GLM 5.3 Flash é a melhor escolha com licença MIT para a maioria das pessoas, e o Gemma 4 continua a correr num portátil. A nossa comparação completa DeepSeek vs Claude coloca um laboratório aberto e um fechado lado a lado.
Este guia classifica os modelos de IA open source que valem o seu tempo em 2026, aquilo em que cada um é genuinamente melhor, e como realmente corrê-los sem uma bancada de GPU. Classificámos as escolhas com base em dados de benchmark independentes, nos termos de licença e na acessibilidade real, porque a maioria das listas de «melhor IA open source» é escrita por empresas que lhe vendem o hardware para os correr. Vendemos uma aplicação, não GPU, por isso esta classificação não tem interesse nessa corrida. Para um olhar mais atento sobre como um modelo aberto se compara aos modelos de topo pagos, veja o confronto direto do GLM com os modelos de topo fechados.
Se o próprio rótulo «open source» lhe parece impreciso, o nosso explicador sobre o que significa realmente IA open source detalha os pesos abertos, o licenciamento, e porque «aberto» nem sempre significa o que pensa.
Os pontos-chave
- O MiMo-V2.6-Pro é o modelo aberto com melhor pontuação no Artificial Analysis Intelligence Index, com 46,3, um modelo de 1,02 biliões de parâmetros com licença MIT que custa cerca de 0,13 $ por tarefa do índice. O Kimi K3 (43,6) continua a ser o maior modelo aberto, com 2,78 biliões de parâmetros, e o melhor modelo aberto nas tabelas de votação humana da Arena, onde o MiMo ainda não foi avaliado.
- O GLM 5.3 Flash é a escolha certa para a maioria das pessoas: 41,8 no índice, um contexto de 1 milhão de tokens, entrada nativa de imagem e vídeo, e uma licença MIT limpa num modelo de 321 mil milhões para o qual consegue realmente alugar hardware. O GLM 5.2, mais antigo, fica nos 33,7 e a Artificial Analysis já o lista como descontinuado.
- O DeepSeek V4.1 Flash (39,5, MIT) substituiu o V4-Pro como o modelo aberto mais forte da DeepSeek a 10 de setembro, e é o modelo mais rápido desta classificação, com cerca de 233 tokens por segundo.
- A maioria dos modelos «open source» são na verdade de open weights, os pesos são gratuitos mas os dados de treino continuam privados. A IA verdadeiramente open source é mais rara do que o rótulo sugere, e vários dos modelos mais fortes desta lista usam licenças próprias em vez de MIT ou Apache 2.0.
- Não precisa de uma quinta de GPU para a maior parte desta lista. Gemma 4 12B corre num portátil moderno, o Qwen 3.8 27B cabe num Mac bem equipado, e há aplicações que encaminham os maiores modelos para o seu Mac ou iPhone sem hardware local nenhum.
O que conta como um modelo de IA open source
Um modelo de IA open source publica os seus pesos, e idealmente o seu código e dados de treino, para que qualquer pessoa possa descarregar, correr, modificar e redistribuir. Essa é a promessa. A realidade é mais nuançada, e importa saber isso antes de escolher um.
A maioria dos modelos a que toda a gente chama «open source» são na verdade de open weights. Recebe os pesos treinados de graça, mas os dados de treino e a receita completa ficam trancados. A definição oficial da Open Source Initiative exige muito mais transparência do que isso, e é por isso que quase nenhum modelo de fronteira se qualifica como totalmente aberto. Assinalamos essa distinção ao longo do artigo, porque uma licença «MIT Modificada» ou uma licença comunitária personalizada pode trazer condições comerciais que uma licença MIT ou Apache 2.0 verdadeira não tem.
A conclusão prática é simples. Os pesos abertos significam que pode correr o modelo em privado, ajustá-lo, e evitar taxas de API por token. Nem sempre significam uso comercial sem restrições, por isso a coluna da licença na nossa tabela abaixo é tão importante como as pontuações de benchmark.
Melhores modelos de IA open source 2026 de relance
Aqui está a classificação completa. Escolhemos estes dez com base no desempenho em benchmarks independentes, na atualidade, na liberdade da licença e em quão realista é usá-los de facto. A coluna do índice é o Artificial Analysis Intelligence Index v4.3.2, lido a 25 de setembro de 2026. As pontuações marcadas com «est.» são estimativas da própria tabela e não execuções completas, e as pontuações de versões anteriores do índice não são comparáveis com estas, por isso um «57» antigo para o Kimi K3 é o mesmo modelo medido com outra régua. Os laboratórios chineses ocupam os cinco primeiros lugares. O Inkling, da Thinking Machines, a família mais forte construída nos EUA, tem a sua própria secção mais abaixo.
| Modelo | Melhor para | Parâmetros (total / ativos) | Contexto | Licença | AA Index v4.3.2 |
|---|---|---|---|---|---|
| MiMo-V2.6-Pro | Pontuação medida mais alta | 1,02T / 42B | 1M | MIT | 46,3 |
| Kimi K3 | Maior modelo aberto, líder na Arena | 2,78T / 104B | 1M | Kimi K3 (personalizada) | 43,6 |
| GLM 5.3 Flash | Melhor para a maioria | 321B / 18B | 1M | MIT | 41,8 |
| DeepSeek V4.1 Flash | Velocidade e custo-benefício | 552B / 16B | 1M | MIT | 39,5 |
| Qwen 3.8 27B | Melhor modelo para correr num Mac | 27,8B denso | 262K | Apache 2.0 | 33,7 |
| Kimi K2.7 Code | Programação agêntica com menos hardware | 1T / 32B | 256K | Modified MIT | 25,8 |
| Muse Glimmer | Modelo aberto da Meta para agentes locais | 30B denso | 131K | Apache 2.0 | 17,5 |
| Gemma 4 31B | Leve + local | 31B denso | 256K | Apache 2.0 | 19,0 (est.) |
| Nex-N2-Pro | Agêntico totalmente permissivo | 397B / 17B | 262K | Apache 2.0 | 28,2 (est.) |
| MiniMax M3 | Eficiência em hardware leve | 427B / 23B | 1M | MiniMax Community | 29,2 |
Os melhores modelos de IA open source, classificados
Eis cada escolha em detalhe, por ordem, com aquilo em que é genuinamente melhor, os benchmarks que lhe valeram o lugar e a licença que realmente recebe. Começamos pelos modelos mais completos e descemos até aos mais eficientes e aos mais fáceis de correr localmente.
1. MiMo-V2.6-Pro, o modelo aberto com melhor pontuação
O MiMo-V2.6-Pro da Xiaomi chegou ao topo do campo aberto a 21 de setembro de 2026, o dia em que os seus pesos apareceram no Hugging Face. O cartão do modelo da Xiaomi descreve um design Mixture-of-Experts esparso com 1,02 biliões de parâmetros no total e 42 mil milhões ativos, um contexto de 1 milhão de tokens e entrada nativa de texto, imagem, vídeo e áudio num só modelo. A licença é uma MIT simples, sem limiar de receitas nem cláusula de atribuição, algo que nenhum dos dois modelos abertos mais próximos dele no índice pode dizer.
São os números independentes que o colocam em primeiro. A Artificial Analysis dá-lhe 46,3 no Intelligence Index v4.3.2, à frente do GLM-5.3 com 44,8 e do Kimi K3 com 43,6, e ao nível do Grok 4.7, o modelo fechado da xAI, com 46,4. É também o modelo mais barato perto do topo dessa tabela, com cerca de 0,13 $ por tarefa do índice contra 2,00 $ para o Kimi K3. A ressalva é que ainda ninguém votou nele: o MiMo-V2.6-Pro não tem entrada nas tabelas de texto nem de WebDev da Arena, por isso o retrato da preferência humana continua a ser do K3. O nosso explicador sobre o Xiaomi MiMo cobre a família inteira, os preços da API e o V2.6 Flash, mais pequeno.
2. Kimi K3, o maior modelo aberto e o favorito aberto da Arena
O Kimi K3 da Moonshot AI passou a poder ser descarregado a 27 de julho de 2026, e continua a ser o maior modelo aberto disponível. O Hugging Face indica 2,78 biliões de parâmetros, um design Mixture-of-Experts que ativa 104 mil milhões por token, trata nativamente texto, imagem e vídeo, e traz uma janela de contexto de 1 milhão de tokens. O rival mais próximo em tamanho é o modelo de topo Qwen 3.8 da Alibaba, com 2,45 biliões.
As tabelas independentes dividem-se agora quanto a ele. A Artificial Analysis dá ao K3 43,6 no Intelligence Index v4.3.2, o terceiro lugar entre os modelos de open weights, atrás do MiMo-V2.6-Pro e do GLM-5.3. Os votantes da Arena continuam a pô-lo em primeiro no campo aberto: está em nono lugar geral no WebDev com 1.659,6, apenas com modelos fechados acima, e em 17.º na tabela de texto, também aí a entrada aberta mais alta. A tabela de lançamento da própria Moonshot acrescenta 88,3 no Terminal-Bench 2.1 e 81,2 no FrontierSWE, e esses dois são números do próprio fabricante, não independentes.
Há duas coisas a saber antes de planear em torno dele. Os pesos são disponibilizados sob a Kimi K3 License própria da Moonshot, que é permissiva para quase toda a gente. Só se aplica se revender acesso ao modelo acima de 20 milhões de $ em receitas, o que exige um acordo separado, ou se ultrapassar 100 milhões de utilizadores mensais, o que exige uma menção destacada a «Kimi K3». O outro senão é o hardware, porque 2,78 biliões de parâmetros chegam em 96 fragmentos de pesos, por isso este é um modelo de servidor e não de portátil. A nossa análise ao Kimi K3 tem a tabela completa de benchmarks.
3. GLM 5.3 Flash, o melhor modelo open source para a maioria das pessoas
O GLM 5.3 Flash é o modelo aberto que a maioria das equipas deveria realmente usar. Lançado pela Z.ai a 26 de agosto de 2026, é um modelo Mixture-of-Experts de 321 mil milhões de parâmetros que ativa cerca de 18 mil milhões por token, lê um contexto de 1 milhão de tokens, aceita imagem e vídeo além de texto, e é disponibilizado sob uma licença MIT limpa. Obtém 41,8 no índice da Artificial Analysis a cerca de 0,25 $ por tarefa, ficando a menos de cinco pontos do topo do campo aberto com bem menos de metade dos parâmetros de qualquer modelo acima dele.
Substitui o GLM 5.2, que ocupou este lugar até setembro. O GLM 5.2 fica agora nos 33,7, a Artificial Analysis marca-o como descontinuado, e a Z.ai cobra por ele os mesmos 1,40 $ / 4,40 $ por milhão de tokens que cobra pelo GLM 5.3 completo, que obtém 44,8. O GLM 5.3 é o modelo mais forte e os seus pesos estão no Hugging Face, mas sob uma licença própria e não MIT, e é por isso que a recomendação vai para o modelo Flash. O resto da família GLM da Zhipu está coberto no nosso explicador, e há rumores de que o GLM 5.5 chegue ainda em 2026.
4. DeepSeek V4.1 Flash, o melhor em velocidade e custo-benefício
O DeepSeek V4.1 Flash substituiu o V4-Flash a 10 de setembro de 2026 e é agora o modelo aberto mais forte da DeepSeek. O cartão do modelo descreve um modelo Mixture-of-Experts multimodal com 552 mil milhões de parâmetros de base que ativa apenas 8 mil milhões por token ao ler a entrada e 16 mil milhões ao escrever, com entrada nativa de imagem, um contexto de 1 milhão de tokens e uma licença MIT. O LongCat-2.0, que a Meituan tornou open source, é outra opção de 1 milhão de tokens, pensada especificamente para programação agêntica.
Obtém 39,5 no índice da Artificial Analysis a cerca de 0,27 $ por tarefa, e com cerca de 233 tokens por segundo é o modelo mais rápido desta classificação. O V4-Pro, maior (1,6 biliões no total, 49 mil milhões ativos), é agora o mais fraco dos dois, com 36,0, e não aceita imagens, por isso as suas pontuações de lançamento de abril, 80,6 no SWE-Bench Verified e 93,5 no LiveCodeBench, descrevem um modelo que a própria DeepSeek já ultrapassou. Leia a análise completa ao DeepSeek V4 para ambos os modelos e para os preços atuais da API em horas de ponta e fora de ponta.
5. Qwen 3.8 27B, o melhor modelo aberto para correr num Mac
O Qwen 3.8 27B da Alibaba é o modelo mais forte desta lista que cabe numa única máquina bem equipada. É um modelo denso de 27,8 mil milhões de parâmetros sob uma licença Apache 2.0 limpa, publicado no Hugging Face em agosto de 2026, com compreensão nativa de imagem e vídeo e um contexto de 262K tokens que, segundo a Alibaba, se estende até 1 milhão. Obtém 33,7 no índice da Artificial Analysis, exatamente ao nível do GLM 5.2, um modelo 27 vezes maior. O modelo de topo Qwen 3.8, com 2,45 biliões de parâmetros, também tem pesos públicos e obtém 39,9, mas usa uma licença própria da Alibaba, tal como o Qwen3.8-Flash-Next de 180 mil milhões (39,8), o segundo modelo aberto mais bem colocado na tabela WebDev da Arena.
Os modelos Qwen 3.6 anteriores continuam disponíveis para descarregar, e o 35B-A3B continua a ser a opção mais leve para hardware modesto, mas o 27B evoluiu. O modelo mais forte da Alibaba no geral, o Qwen3.8 Max, obtém 45,4 e está disponível apenas por API, com pesos fechados, por isso fica fora desta classificação open source. Para um modelo aberto que faz um pouco de tudo no hardware que já tem, o Qwen 3.8 27B é a aposta mais segura. Se o correr por conta própria, o laboratório de Praga BottleCap AI publica afinações ThinkingCap que reduzem os seus tokens de raciocínio entre 37% e 46% com menos de um ponto de perda de precisão.
6. Kimi K2.7 Code, o melhor para programação agêntica com menos hardware
O K3 é o modelo de topo, mas o Kimi K2.7 Code é o Kimi que a maioria das equipas consegue realisticamente implementar, porque tem menos de dois quintos do tamanho do K3. É um modelo de 1 bilião de parâmetros que ativa 32 mil milhões por token, com uma janela de contexto de 256K tokens sob uma licença Modified MIT, lançado a 12 de junho de 2026 e feito de raiz para agentes que escrevem, executam e depuram ao longo de muitos passos. Pode ver quanto custam os modelos alojados da Moonshot no nosso guia de preços do Kimi.
Uma ressalva honesta. A maior parte do que a Moonshot publicou, incluindo um 62,0 no seu próprio Kimi Code Bench v2 e 81,1 no MCP Mark Verified, vem de benchmarks internos. A primeira leitura independente é menos lisonjeira: a Artificial Analysis dá-lhe 25,8 no seu índice geral, bem abaixo dos modelos acima dele, embora esse índice não seja um teste apenas de programação. Trate-o como um especialista e não como um modelo para tudo. A nossa análise ao Kimi K2.7 Code tem os detalhes e os alertas sobre os dados em falta.
7. Muse Glimmer, o modelo aberto da Meta para agentes locais
O lançamento de open weights da Meta este ano é o Muse Glimmer, publicado a 10 de agosto de 2026 sob uma licença Apache 2.0 totalmente permissiva. É um modelo denso de 30B (cerca de 29,8 mil milhões de parâmetros, incluindo o codificador de visão) destilado do Muse Spark fechado da Meta, com uma janela de contexto de 131K e entrada de imagem, e a Meta construiu-o para agentes que usam ferramentas e recuperam dos próprios erros, não para conversa. Não existe nenhum Llama 5. A última geração Llama da Meta foi o Llama 4, em abril de 2025, e os seus modelos de 2026 saem com o nome Muse, com o modelo de topo Muse Spark mantido fechado. A Meta também prometeu pesos abertos para o Muse Spark, uma promessa que repetiu quando o Muse Spark 1.3 foi lançado a 2 de setembro de 2026, ainda sem data.
O que torna o Glimmer notável é que a própria Meta o testou em Macs. A sua versão de 4 bits reduz o modelo de linguagem para menos de 20 GB, a quantização oficial mais pequena destina-se a máquinas de 24 GB, e segundo os números da própria Meta corre a 37,8 tokens por segundo num M4 Max e a 50,2 num M5 Max com a descodificação especulativa DFlash ligada. O Ollama disponibiliza uma versão para Apple Silicon que pode obter com ollama run muse-glimmer:30b-mlx. O retrato independente é modesto, 17,5 no índice da Artificial Analysis, e a tabela da própria Meta é mista: bate claramente o Gemma 4 31B no MCP Atlas (75,5 contra 54,2) e no SWE-Bench Pro (51,2 contra 36,9), mas perde para o Qwen 3.6 27B no OSWorld-Verified e no Terminal-Bench 2.1. É um bom modelo de agente local, não uma melhoria direta sobre tudo o que existe na sua classe de tamanho.
8. Gemma 4, o melhor modelo leve para uso local
Se quer correr IA na sua própria máquina com o mínimo de complicação, o Gemma 4 da Google DeepMind é a resposta. A família vai de pequenos modelos de edge (E2B, E4B) e de um modelo 12B até um modelo de topo 31B denso e uma variante MoE de 26B, todos sob Apache 2.0, lançados a 2 de abril de 2026.
Apesar do tamanho reduzido, tem muita força nas tabelas em que as pessoas votam. O Gemma 4 31B está nos 1.451 na tabela de texto da Arena, acima do MiniMax M3, do Inkling e do Qwen 3.8 27B, embora a Artificial Analysis o estime em apenas 19,0 no seu índice mais exigente. Os números da própria Google são 85,2% no MMLU-Pro, 89,2% no AIME 2026 e 80,0% no LiveCodeBench v6, enquanto o escalão 12B corre sem esforço num portátil moderno. É o melhor ponto de partida se for novo na IA local, e o cartão oficial do modelo Gemma 4 da Google lista as especificações exatas de cada tamanho.
9. Nex-N2-Pro, o melhor modelo agêntico totalmente permissivo
O Nex-N2-Pro da Nex AGI ganha o seu lugar pela liberdade da licença aliada a capacidade real. É um modelo MoE de 397 mil milhões de parâmetros (17 mil milhões ativos), construído sobre o maior modelo aberto do Qwen 3.5, com um contexto de 262K, disponibilizado sob a licença Apache 2.0 totalmente permissiva e afinado especificamente para trabalho agêntico, como chamadas de ferramentas e tarefas longas de vários passos.
A Nex AGI reporta 80,8 no SWE-Bench Verified e 75,3 no Terminal-Bench 2.1, e a Artificial Analysis estima-o em 28,2 no seu índice, na mesma faixa do MiniMax M3, sem qualquer restrição comercial. Veja a nossa análise ao Nex-N2-Pro para saber como se compara aos melhores modelos fechados.
10. MiniMax M3, o melhor em eficiência
O MiniMax M3 fecha a lista para quem está atento ao custo do hardware. Lançado a 1 de junho de 2026, tem 427 mil milhões de parâmetros no total com apenas 23 mil milhões ativos, e o seu design MiniMax Sparse Attention descodifica cerca de 15 vezes mais depressa com o contexto completo do que o M2. A MiniMax reporta 59,0% no SWE-Bench Pro, a Artificial Analysis dá-lhe 29,2 a cerca de 0,51 $ por tarefa, e serve cerca de 153 tokens por segundo, com um contexto completo de 1 milhão de tokens e multimodalidade nativa.
A licença mudou com esta versão. O M3 é disponibilizado sob a MiniMax Community License, gratuita para alojamento próprio, mas pedindo aos utilizadores comerciais maiores que estabeleçam um acordo separado, um passo atrás face aos termos Modified MIT das versões anteriores. Continua a ser uma escolha inteligente quando quer programação rápida perto da fronteira com um orçamento de hardware mais contido. A nossa análise aos modelos MiniMax cobre a linhagem e as ressalvas dos benchmarks.
Inkling, o modelo de open weights mais forte dos EUA
O Inkling é o primeiro modelo da Thinking Machines, o laboratório fundado pela antiga CTO da OpenAI Mira Murati, e chegou a 15 de julho de 2026. É um transformer Mixture-of-Experts com 975 mil milhões de parâmetros no total e 41 mil milhões ativos por token, uma janela de contexto de até 1 milhão de tokens e raciocínio nativo sobre texto, imagem e áudio. Os pesos são disponibilizados sob uma licença Apache 2.0 simples, o que o coloca no escalão mais permissivo desta página, ao lado do Qwen 3.8 27B, do Gemma 4, do Muse Glimmer e do Nex-N2-Pro.
O destaque é mais nacional do que global. No Artificial Analysis Intelligence Index v4.3.2, o Inkling obtém 25,0, à frente do Nemotron 3 Ultra da NVIDIA com 22,9, do Muse Glimmer com 17,5 e do gpt-oss-120b com 11,6, o que mantém a família no topo do campo aberto dos EUA. Fica também mais de 20 pontos atrás do MiMo-V2.6-Pro, por isso a história é que o melhor modelo aberto americano lidera o campo americano, não o mundo. Na sua própria avaliação, o Inkling regista 77,6% no SWE-bench Verified e 73,5% no MMMU Pro.
Onde merece atenção é na velocidade e no custo. A Artificial Analysis mede o Inkling a cerca de 167 tokens por segundo e 0,61 $ por tarefa do índice, mais barato por tarefa do que o Kimi K3 ou o GLM-5.3 e cerca de três a cinco vezes mais rápido do que qualquer um deles, embora o MiMo-V2.6-Pro e o GLM 5.3 Flash obtenham agora pontuações muito mais altas por menos dinheiro.
O lançamento mais interessante é o pequeno. O Inkling-Small disponibilizou os pesos completos a 30 de julho de 2026, com 276 mil milhões de parâmetros no total e 12 mil milhões ativos, menos de um terço do modelo principal, e a Artificial Analysis estima-o em 27,8, acima do modelo de topo. Também supera ligeiramente o modelo maior no Humanity’s Last Exam (33% contra 32%) e no GPQA Diamond (89% contra 87%) e serve cerca de 205 tokens por segundo. Se quer um modelo construído nos EUA em hardware que possa realisticamente alugar, o Inkling-Small é a metade mais prática deste par.
Deixámos o Inkling fora da classificação numerada acima porque, só pela capacidade, ficaria perto do fundo, enquanto na liberdade da licença iguala os melhores desta página. Trate-o como a escolha por defeito quando quer especificamente um modelo construído nos EUA sob uma licença totalmente permissiva. O Hy4 Preview de 770B da Tencent chegou sob Apache 2.0 a 28 de agosto de 2026 e fica aqui listado em vez de classificado, porque nenhuma tabela independente o avaliou ainda.
Como escolhemos estes modelos de IA open source
Classificámos com base em quatro critérios, por esta ordem. Desempenho em benchmarks independentes, liderado pelo Artificial Analysis Intelligence Index e pelas tabelas de votação humana da Arena, com testes reportados pelos laboratórios (SWE-Bench Verified, GPQA Diamond, MMLU-Pro, LiveCodeBench) como prova complementar. Atualidade, todos os modelos aqui foram lançados ou atualizados em 2026. Liberdade da licença, com uma preferência clara por MIT e Apache 2.0 em vez de licenças comunitárias próprias. E acessibilidade, porque um modelo que não consegue realisticamente correr não lhe serve de nada. O nosso guia de benchmarks de IA explica o que cada um desses testes mede realmente.
Também demos peso à verificação independente. Onde as pontuações vêm apenas do laboratório que construiu o modelo, como em partes da tabela do K3 da Moonshot e na maioria dos números da Nex AGI, dizemo-lo, e onde a Artificial Analysis apenas estima uma pontuação, assinalamo-la. Os benchmarks autorreportados são um problema real na IA aberta neste momento, e deve descontá-los até que terceiros confirmem os números.
Não precisa de uma quinta de GPU para usar estes modelos
O maior mito sobre a IA open source é que corrê-la exige hardware de servidor. Depende inteiramente do modelo. Os gigantes de biliões de parâmetros como o Kimi K3 e o MiMo-V2.6-Pro precisam de facto de configurações multi-GPU para inferência em precisão total, mas muitos modelos abertos fortes correm em equipamento de consumo.
O Gemma 4 12B, os escalões mais pequenos do Qwen e o Muse Glimmer da Meta correm num portátil moderno ou num Mac com ferramentas como o Ollama ou o LM Studio, e pode obter os pesos diretamente no Hugging Face. E se quer os maiores modelos sem ter hardware nenhum, uma aplicação como o Fello AI encaminha os principais modelos diretamente para o seu Mac ou iPhone, sem instalação local. Correr um modelo por conta própria também evita por completo as falhas dos fornecedores, uma preocupação real dadas as repetidas falhas do Claude em 2026. Há mais três sistemas que vale a pena conhecer, embora não estejam classificados aqui. O Seed 2.1 Pro da ByteDance é uma pré-visualização não lançada que chegou ao 8.º lugar no Code Arena: Frontend em junho. O Fugu da Sakana AI orquestra um conjunto de outros modelos em vez de competir como um único conjunto de pesos, e a sua atualização Fugu-Ultra v1.1 alargou essa vantagem em benchmarks de programação e de terminal. As versões quantizadas também reduzem drasticamente as necessidades de memória, muitas vezes com uma perda mínima de qualidade.
Se a programação é o seu principal caso de uso, o nosso balanço da melhor IA gratuita para programação compara estes modelos abertos frente a frente em tarefas de desenvolvimento específicas.
Conclusão
O MiMo-V2.6-Pro é agora o modelo de IA open source com melhor pontuação que pode descarregar, e tem uma licença MIT simples. O Kimi K3 é o maior e o modelo aberto que os votantes humanos colocam mais acima. Para a maioria das pessoas, o GLM 5.3 Flash é a melhor escolha, com a combinação mais forte de raciocínio, liberdade de licença e um contexto de 1 milhão de tokens em hardware que consegue realmente alugar. Se quer velocidade e custo-benefício, opte pelo DeepSeek V4.1 Flash. Se quer correr IA no seu próprio Mac, comece pelo Qwen 3.8 27B ou, em hardware mais leve, pelo Gemma 4. Se quer um modelo construído nos EUA sob uma licença Apache 2.0 limpa, o Inkling-Small é neste momento a melhor relação qualidade-preço nesse nicho. E se preferir evitar a configuração por completo, os mesmos modelos abertos de topo estão disponíveis através dos melhores modelos de IA em aplicações como o Fello AI.
A distância entre o melhor modelo aberto e o melhor fechado é de 11,3 pontos no Artificial Analysis Intelligence Index v4.3.2, 46,3 para o MiMo-V2.6-Pro contra 57,6 para o Claude Opus 5.5. No topo absoluto é uma diferença real, mas os líderes abertos estão agora ao nível de modelos fechados como o Grok 4.7 por uma fração do preço, por isso «grátis» é muitas vezes a escolha mais inteligente. Escolha pelo seu caso de uso, verifique a licença, e não vai sentir falta da subscrição. Verifique também os termos de lançamento, porque o GLM 5.3 e os seus pesos por fases mostram que uma linha aberta pode lançar o seu melhor modelo sob termos mais restritivos do que o anterior.
FAQ
Qual é o melhor modelo de IA open source neste momento?
O MiMo-V2.6-Pro é o modelo aberto com melhor pontuação a 25 de setembro de 2026, com 46,3 no Artificial Analysis Intelligence Index v4.3.2 e pesos com licença MIT publicados a 21 de setembro. O Kimi K3 é o maior modelo aberto e a entrada aberta mais alta nas tabelas de votação humana da Arena. O GLM 5.3 Flash é a melhor escolha para a maioria das pessoas, com licença MIT e uma fração do custo de hardware. Entre os modelos abertos construídos nos EUA, lidera a família Inkling da Thinking Machines.
Qual é a diferença entre IA open source e IA open weight?
Open weight significa que os pesos treinados são gratuitos para descarregar e correr, mas os dados de treino e a receita completa continuam privados. A verdadeira IA open source, pela definição da Open Source Initiative, também disponibiliza os dados e o código. A maioria dos modelos «open source» são, tecnicamente, open weight.
Posso correr modelos de IA open source sem GPU?
Sim. Modelos pequenos como o Gemma 4 12B correm num portátil moderno, o Qwen 3.8 27B e o Muse Glimmer correm num Mac bem equipado, e aplicações como o Fello AI permitem-lhe usar os maiores modelos abertos a partir de um Mac ou iPhone sem hardware local. Só os maiores modelos de biliões de parâmetros precisam de configurações multi-GPU.
Os modelos de IA open source são gratuitos para uso comercial?
Normalmente sim, mas verifique a licença. Os modelos MIT e Apache 2.0 (MiMo-V2.6-Pro, GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen 3.8 27B, Gemma 4, Muse Glimmer, Nex-N2-Pro, Inkling e Inkling-Small) são totalmente permissivos. Licenças próprias como a Kimi K3 License, a licença do GLM 5.3, a licença da Alibaba para o modelo de topo Qwen 3.8 ou a MiniMax Community License acrescentam condições, como limiares de receitas, limites de utilização ou requisitos de atribuição.
Os modelos open source são tão bons como o ChatGPT ou o Claude?
Estão perto, mas não ao mesmo nível no topo. O MiMo-V2.6-Pro obtém 46,3 no Artificial Analysis Intelligence Index v4.3.2 contra 57,6 para o Claude Opus 5.5, o melhor modelo fechado nessa tabela, e o GPT-6 Sol fica logo acima do líder aberto, com 47,5. Em muitas tarefas do dia a dia de programação, matemática e contexto longo a diferença é pequena, mas a fronteira absoluta continua a pertencer aos laboratórios fechados.