A 1 de junho de 2026, a MiniMax lançou oficialmente o M3, o próximo modelo de linguagem de topo do laboratório de Xangai, e foi lançado exatamente como prometido. O modelo que passou semanas como teaser de arquitetura está agora disponível, e o que foi anunciado revelou-se real: codificação ao nível frontier, uma janela de contexto de 1 milhão de tokens e multimodalidade nativa, tudo num único modelo de pesos abertos. A MiniMax afirma ser o primeiro e único modelo de pesos abertos a reunir as três capacidades.
Os pesos abertos estão no coração da IA open source, a categoria de modelos que pode descarregar e executar localmente em vez de alugar acesso através de uma API fechada.
A história da arquitetura que cobrimos antes do lançamento confirmou-se. O M3 é construído sobre o novo design MiniMax Sparse Attention (MSA), a mesma atenção esparsa que a empresa tinha abandonado na geração M2 e reintroduzido no M3. Pode utilizá-lo agora mesmo através do MiniMax Code, planos de tokens e a API, com pesos abertos e um relatório técnico completo prometidos em cerca de dez dias. Abaixo ficam o que está confirmado no lançamento, o que dizem os benchmarks, o que custa e quanto disso se deve confiar hoje.
Pontos-chave
- Lançado e disponível agora. O M3 foi lançado a 1 de junho de 2026, acessível através do MiniMax Code, subscrições de plano de tokens e a API padrão. Os pesos abertos e um relatório técnico estão previstos para Hugging Face e GitHub em cerca de dez dias.
- Três capacidades frontier num único modelo. A MiniMax posiciona o M3 como o primeiro modelo de pesos abertos a combinar codificação frontier, uma janela de contexto de 1M de tokens e compreensão nativa de imagem e vídeo.
- Atenção esparsa concretizada. A arquitetura MSA reduz o cálculo por token a 1M de contexto para um vigésimo da geração anterior, com um prefill mais de 9 vezes mais rápido e uma descodificação mais de 15 vezes mais rápida.
- Benchmarks fortes, com ressalvas. O M3 pontua 59,0% no SWE-Bench Pro, superando o GPT-5.5 e o Gemini 3.1 Pro e aproximando-se do Claude Opus 4.7. Vários resultados foram executados na própria infraestrutura da MiniMax com scaffolding de agente, pelo que a verificação independente ainda está pendente.
- Agressivamente barato. O preço de entrada na API é cerca de $0.30 por milhão de tokens, com um custo combinado tão baixo quanto $0.06 por milhão com otimização de cache.
Como utilizar o MiniMax M3 agora mesmo
O M3 está disponível desde o momento do lançamento através de três canais. Pode chamá-lo via API padrão, subscrever um plano de tokens MiniMax ou utilizá-lo dentro do MiniMax Code, o produto de agente da empresa. Os pesos abertos e o relatório técnico não estão disponíveis no primeiro dia; a MiniMax diz que publicará ambos no Hugging Face e GitHub nos próximos dez dias aproximadamente.
Este prazo importa. Os programadores podem testar o modelo alojado imediatamente, mas a afirmação de pesos abertos não está completamente provada até os pesos e o relatório serem de facto públicos. Quando chegarem, o repositório a acompanhar é huggingface.co/MiniMaxAI para um model card intitulado MiniMax-M3.
Dentro do MiniMax Sparse Attention (MSA)
A mudança principal é arquitetural, e é a mesma que a MiniMax antecipou antes do lançamento. O M3 regressa à atenção esparsa depois de a empresa ter passado toda a geração M2, incluindo M2, M2.1, M2.5 e M2.7, com atenção completa em toda a janela de contexto.
Em termos simples, a atenção completa significa que cada token no contexto pode observar todos os outros tokens. Isso é preciso mas dispendioso, e o custo explode à medida que o contexto cresce. A atenção esparsa permite que o modelo ignore a maioria dessas ligações e se concentre apenas nos tokens relevantes. O design do M3 utiliza um ramo de índice ligeiro para analisar os tokens recebidos e escolher quais blocos de tokens anteriores merecem atenção, executando depois a atenção apenas nesses blocos de chave-valor relevantes.
A base é a Grouped Query Attention (GQA), não a Multi-head Latent Attention, com seleção a nível de bloco executada nos chave-valores reais e não comprimidos em vez de uma representação comprimida. Esse é o detalhe fundamental. O M3 mantém a precisão do cálculo de atenção real enquanto o executa apenas onde importa, o que é como a MiniMax afirma obter os ganhos de eficiência sem sacrificar a qualidade.

Por que razão a MiniMax abandonou a atenção esparsa no M2 e a reintroduziu
Esta é a parte que torna o lançamento interessante, porque é uma autocorreção pública. No blogue de engenharia da MiniMax que explica a arquitetura M2, a equipa escreveu que «a infraestrutura para atenção linear e esparsa é muito menos madura» do que a atenção completa, e que «a atenção eficiente ainda tem caminho a percorrer antes de poder definitivamente superar a atenção completa.»
Isso foi publicado há cerca de um ano. Com o M3, a mesma equipa lançou atenção esparsa pronta para produção com acelerações de uma ordem de grandeza. A aposta é que a infraestrutura se nivelou, e o MSA é a prova que colocam à frente dos programadores.
Qual a rapidez do MiniMax M3?
Os números de eficiência são a parte mais clara do lançamento. Todos os valores são medidos num comprimento de contexto de 1 milhão de tokens em relação à geração anterior.
| Métrica | MiniMax M3 |
|---|---|
| Cálculo por token a 1M de contexto | 1/20 da geração anterior |
| Prefill (processar a entrada) | Mais de 9 vezes mais rápido |
| Descodificação (gerar saída) | Mais de 15 vezes mais rápida |
| Velocidade de saída | ~100 tokens/seg, ~3 vezes mais rápido que o Opus |
| Janela de contexto | Até 1M de tokens (mínimo garantido de 512K) |
Este é o verdadeiro argumento de negócio. O contexto longo parece impressionante, mas a maioria das equipas não precisa de colocar um repositório inteiro e um ano de tickets num único prompt. O que precisam é de um modelo que mantenha contexto suficiente para trabalhar ao longo do tempo sem tornar a latência e o custo de inferência dolorosos. Ao reduzir o cálculo por token a 1M de contexto para um vigésimo, o MSA foi construído para tornar os agentes de contexto longo economicamente viáveis para fluxos de trabalho de programadores comuns, não apenas para demonstrações.
Resultados de benchmark do MiniMax M3
Estes são os dados que o artigo pré-lançamento não podia mostrar, porque ainda não existiam benchmarks de precisão. Agora existem. Em tarefas de codificação e agente, o M3 publica números que o colocam em boa companhia no nível frontier.
| Benchmark | MiniMax M3 | O que mede |
|---|---|---|
| SWE-Bench Pro | 59,0% | Correções de software do mundo real |
| Terminal-Bench 2.1 | 66,0% | Tarefas de agente em linha de comandos |
| SWE-fficiency | 34,8% | Alterações de código eficientes |
| KernelBench Hard | 28,8% | Otimização de kernel de baixo nível |
| MCP Atlas | 74,2% | Uso de ferramentas via MCP |
| BrowseComp | 83,5 | Pesquisa e navegação na web |
As afirmações mais notáveis: no SWE-Bench Pro, o M3 supera o GPT-5.5 e o Gemini 3.1 Pro e aproxima-se do Claude Opus 4.7. No BrowseComp, o seu 83,5 supera o 79,3 do Opus 4.7. No lado multimodal, o M3 pontua acima do Gemini 3.1 Pro no OmniDocBench, ocupa o primeiro lugar no Claw-Eval (um benchmark de agente autónomo de ponta a ponta) e supera o Opus 4.7 no SVG-Bench.
Trate estes dados com o ceticismo adequado. A MiniMax divulga que vários resultados foram executados na sua própria infraestrutura, frequentemente com scaffolding de agente como o Claude Code, Mini-SWE-Agent ou Terminus. Isso não torna os números inúteis, mas significa que um modelo com bom desempenho num leaderboard pode comportar-se de forma diferente num repositório interno desordenado. O M3 também não está ainda no quadro DeepSWE, onde são acompanhadas tarefas de software de longo horizonte, pelo que uma comparação limpa com as versões mais recentes do Claude ainda tem de aguardar. Os compradores devem esperar por execuções independentes antes de tomar decisões de aquisição.

Quanto custa o MiniMax M3?
O preço é onde o M3 faz o seu argumento mais forte, e o nosso guia completo de preços MiniMax compara-o com todos os outros planos. A API cobra cerca de $0.30 por milhão de tokens de entrada, e com otimização de cache o custo combinado desce para cerca de $0.06 por milhão. Uma taxa padrão aplica-se a pedidos até 512K tokens de entrada, com uma taxa mais elevada acima desse valor para cenários de contexto longo, e ambos os níveis de serviço padrão e prioritário estão disponíveis.
Para utilizadores mais intensivos, a MiniMax vende planos mensais de tokens que saem mais baratos por token.
| Plano | Preço / mês | Alocação de tokens |
|---|---|---|
| Plus | $20 | ~1,7 mil milhões de tokens |
| Max | $50 | ~5,1 mil milhões de tokens |
| Ultra | $120 | ~9,8 mil milhões de tokens |
Para comparação, o Claude Opus 4.7 custa cerca de $5 por milhão de tokens de entrada e $25 por milhão de saída. Se o M3 se mantiver na qualidade, é mais de 15 vezes mais barato na entrada e com pesos abertos por cima.
O que o MiniMax M3 consegue fazer na prática
A MiniMax apoiou o lançamento com três demonstrações de tarefas de longo horizonte destinadas a mostrar o M3 a trabalhar durante muitas horas, não apenas a responder a prompts.
- Reprodução de artigo científico. O M3 reproduziu autonomamente um artigo do ICLR 2025 em 12 horas, produzindo 18 commits e 23 figuras.
- Otimização de kernel CUDA. Numa execução de 24 horas, o M3 aumentou a utilização de hardware FP8 de 7,6% para 71,3%, uma aceleração de 9,4 vezes, em 147 submissões de benchmark.
- Treino autónomo de modelos. O M3 obteve 0,37 no PostTrainBench, uma tarefa que pede ao modelo que treine outro modelo de ponta a ponta.
Estas demonstrações ligam-se ao MiniMax Code, o produto de agente construído em torno do modelo. Divide trabalho complexo em fluxos de trabalho com múltiplas etapas usando uma estrutura de Agent Team, executa um ciclo adversarial de produtor e verificador para detetar os seus próprios erros, e suporta uso de computador através das capacidades multimodais nativas do M3. Construído em parte sobre os projetos open source OpenCode e Pi, coloca a MiniMax na mesma faixa que o Claude Code da Anthropic, os agentes de codificação da OpenAI e as ferramentas Gemini da Google. O produto já não é apenas o modelo — é o modelo mais o sistema que o rodeia.
MiniMax M3 vs M2.7 vs M2.5
Aqui fica como o M3 se posiciona face aos recentes M-series da MiniMax e a um ponto de referência ocidental importante, agora que a coluna M3 pode ser preenchida com dados reais.
| MiniMax M3 | MiniMax M2.7 | MiniMax M2.5 | Claude Opus 4.7 (referência) | |
|---|---|---|---|---|
| Estado | Lançado a 1 jun 2026 | Lançado a 18 mar 2026 | Lançado a 12 fev 2026 | Lançado |
| Atenção | Esparsa (MSA) | Completa | Completa | Proprietária |
| Janela de contexto | 1M de tokens | Mais curta, lenta a 1M | Mais curta | Longa |
| Multimodal | Nativa (imagem + vídeo) | Focado em texto | Focado em texto | Sim |
| SWE-Bench Pro | 59,0% | Competitivo | Mais baixo | Mais elevado |
| Peso aberto | Sim (pesos em ~10 dias) | Sim, não comercial | Sim | Não |
| Preço de entrada | ~$0.30 / M tokens | ~$0.30 / M tokens | Comparável | $5 / M tokens |
O M2.7 continua a ser o modelo que a maioria dos utilizadores atuais da MiniMax executa, e não vai ser descontinuado. A diferença é que o M3 finalmente torna o contexto de 1M de tokens prático em vez de dolorosamente lento, e acrescenta multimodalidade nativa que o M2.7 nunca teve. Para contexto sobre como a série M chegou aqui, veja o nosso artigo sobre o MiniMax M2.5. O M3 é um de vários lançamentos de junho; dias depois, a Microsoft apresentou os seus próprios modelos MAI no Build.
Como se compara o MiniMax M3 ao Claude, GPT-5.5, Gemini e DeepSeek?
Com os benchmarks agora públicos, a comparação é mais nítida do que estava na fase de teaser, embora a verificação independente continue a ser a peça em falta.
Face ao Claude Opus 4.7. O Claude provavelmente ainda supera o M3 na qualidade bruta de raciocínio, e lidera nos testes de codificação de longo horizonte mais recentes. Mas o M3 tem pesos abertos, é mais de 15 vezes mais barato na entrada, e na realidade supera o Opus 4.7 na pesquisa web do BrowseComp. A diferença que importou durante anos reduziu-se a uma margem fina em tarefas específicas.
Face ao GPT-5.5 e Gemini 3.1 Pro. Os próprios números do M3 colocam-no à frente de ambos no SWE-Bench Pro. A afirmação mais difícil é a arquitetural: o M3 diz ter tornado a inferência barata de 1M de tokens funcional em produção, algo que os laboratórios fechados não se comprometeram publicamente nos mesmos termos.
Face ao DeepSeek V4 e Qwen3.7-Max. Esta é a competição mais próxima. O DeepSeek V4 e o Qwen3.7-Max são o conjunto competitivo real do M3, todos chineses, todos com pesos abertos, todos a perseguir os mesmos casos de uso de agente. Um novo participante nesse mesmo grupo de pesos abertos é o Nex-N2-Pro, um modelo MoE de 397B construído para codificação agêntica. O diferenciador do M3 nesta faixa é a combinação: é o único a reunir codificação frontier, contexto de 1M e multimodalidade em simultâneo.
Para uma leitura mais abrangente sobre como a corrida de modelos entre os EUA e a China está a moldar os preços e o licenciamento, veja o nosso artigo Anthropic vs OpenAI.
O MiniMax M3 é open source?
É de pesos abertos, com os pesos e um relatório técnico previstos para o Hugging Face e GitHub em cerca de dez dias após o lançamento. Se conta como totalmente open source depende da licença, que não estava publicada no lançamento.
A distinção importa. Pesos abertos significa que pode descarregar os ficheiros do modelo e executá-los localmente. Open source, em sentido estrito, também implica que a licença permite uso comercial irrestrito. O MiniMax-M2 foi lançado sob uma licença MIT modificada, mas a mais recente licença M2.7 restringe o uso comercial do modelo ou derivados sem autorização prévia por escrito. Se o M3 seguir esse precedente, espere pesos descarregáveis com um uso não comercial por defeito e licenciamento empresarial disponível através de vendas diretas. O relatório técnico resolverá esta questão.
Quem está a criar o MiniMax M3?
A MiniMax é um laboratório de IA sediado em Xangai, fundado em 2021. Fora da China é mais conhecida pelo seu modelo de vídeo Hailuo, abordado na nossa análise do Hailuo 02, e pela série M de modelos de linguagem. A empresa lançou o M1 em meados de 2025 (456 mil milhões de parâmetros) antes de mudar para a família M2 mais pequena, densa e orientada para agentes, e agora o M3.
O contexto comercial acrescenta peso a este lançamento. A MiniMax listou-se na Bolsa de Valores de Hong Kong a 9 de janeiro de 2026, pelo que é agora uma empresa cotada que tenta provar que consegue vender acesso ao modelo, fazer crescer a adoção por programadores e ainda alimentar o ecossistema open source. É um equilíbrio difícil: os pesos abertos constroem confiança e distribuição, mas as APIs alojadas e as subscrições de agente são onde vive a receita recorrente. A face pública do trabalho M3 tem sido Skyler Miao (@SkylerMiao7), responsável de Engenharia da MiniMax, cujas publicações no X anteciparam a arquitetura antes do lançamento.
O que o MiniMax M3 significa para a corrida global de IA
Duas mudanças ficam em foco agora que o M3 foi lançado.
Primeiro, a atenção esparsa está de volta à mesa para sistemas de produção de contexto longo. A MiniMax considerou-a não-pronta em 2025. Liderá-la agora sinaliza que o campo mais alargado tem trabalho a fazer. A Anthropic, a Google DeepMind e a OpenAI têm todas investigação em atenção eficiente em curso, mas nenhuma lançou um modelo de topo com este tipo de compromisso público de eficiência.
Segundo, os laboratórios chineses de pesos abertos continuam a alargar a vantagem de custo. A DeepSeek abriu esta frente, a Qwen manteve a pressão, e o M3 eleva-a novamente: barato de executar, aberto para descarregar, e agora genuinamente competitivo em codificação, contexto e trabalho multimodal em simultâneo. O prémio de preço dos laboratórios dos EUA torna-se mais difícil de defender a cada lançamento. Para o panorama mais recente de onde cada modelo de topo se situa, consulte o nosso ranking dos Melhores Modelos de IA.
Deve mudar para o MiniMax M3?
Se a sua carga de trabalho precisa de contexto de 1M de tokens, coisas como análise de base de código completa, agentes de investigação em múltiplos documentos ou memória de sessão de longa duração, o M3 é o modelo óbvio a testar primeiro. É exatamente o caso para o qual foi construído, e os ganhos de eficiência são o que torna essas cargas de trabalho acessíveis.
Se executar pipelines padrão de agente ou codificação, vale a pena testar o M3 face ao seu modelo atual, mas aguarde benchmarks independentes e o relatório técnico antes de apostar a produção nos números do lançamento. A jogada inteligente é testar o modelo alojado agora e reavaliar quando os pesos forem públicos.
Se apenas quiser testar vários modelos de topo chineses e ocidentais sem gerir chaves de API separadas, a aplicação Fello AI para Mac e iOS encaminha entre Claude, ChatGPT, Gemini, Grok e DeepSeek através de uma única interface. O M3 chegou ao Fello AI com a atualização 6.7.0, pelo que agora está na mesma interface que esses modelos.
O que acompanhar a seguir
As próximas semanas decidem quanto do lançamento sobrevive fora dos testes. Três coisas a acompanhar: os pesos abertos e o relatório técnico a chegar ao Hugging Face dentro dos dez dias prometidos, as primeiras execuções de benchmark independentes que eliminam o scaffolding próprio da MiniMax, e a eventual aparição do M3 em quadros neutros como o DeepSWE. Se isso acontecer de forma limpa, a MiniMax terá feito mais do que lançar mais um modelo capaz. Terá tornado a corrida frontier mais difícil para todos os laboratórios que vendem agentes de codificação. Manteremos este artigo atualizado à medida que os dados verificados chegarem.
FAQ
O MiniMax M3 já foi lançado?
Sim. A MiniMax lançou oficialmente o M3 a 1 de junho de 2026. Está disponível agora através da API, planos mensais de tokens e o produto de agente MiniMax Code. Os pesos abertos e um relatório técnico são esperados no Hugging Face e GitHub em cerca de dez dias.
O MiniMax M3 é open source?
É de pesos abertos, com pesos e um relatório técnico prometidos em cerca de dez dias após o lançamento. Se é totalmente open source depende da licença. Se o M3 seguir o precedente do M2.7, os pesos serão descarregáveis mas o uso comercial poderá requerer autorização por escrito da MiniMax.
Qual a rapidez do MiniMax M3?
Com um contexto de 1 milhão de tokens, a MiniMax afirma que a arquitetura MSA do M3 usa um vigésimo do cálculo por token da geração anterior, com prefill mais de 9 vezes mais rápido e descodificação mais de 15 vezes mais rápida. A saída corre a cerca de 100 tokens por segundo.
Qual é o nível do MiniMax M3 em codificação?
A MiniMax reporta 59,0% no SWE-Bench Pro, superando o GPT-5.5 e o Gemini 3.1 Pro e aproximando-se do Claude Opus 4.7. Vários resultados foram executados na própria infraestrutura da MiniMax com scaffolding de agente, pelo que aguarde a verificação independente antes de os tratar como definitivos.
Quanto custa o MiniMax M3?
O preço de entrada na API começa em cerca de $0.30 por milhão de tokens, descendo para um combinado de ~$0.06 por milhão com otimização de cache. Os planos mensais de tokens custam $20 (Plus), $50 (Max) e $120 (Ultra). Isso torna o M3 mais de 15 vezes mais barato na entrada do que o Claude Opus 4.7.