Le 1er juin 2026, MiniMax a officiellement lancé M3, le prochain modèle de langage phare du laboratoire shanghaïen, et il a tenu toutes ses promesses. Le modèle qui avait passé des semaines comme teaser architectural est désormais disponible, et les annonces se sont avérées exactes : code de niveau frontier, une fenêtre de contexte d'un million de tokens et une multimodalité native, le tout dans un seul modèle open-weight. MiniMax affirme que c'est le premier et unique modèle open-weight à réunir ces trois capacités.

Les poids ouverts sont au cœur de l'IA open source, la catégorie de modèles que vous pouvez télécharger et exécuter vous-même plutôt que de louer un accès via une API fermée.

L'histoire architecturale que nous avions couverte avant le lancement s'est confirmée. M3 repose sur la nouvelle conception MiniMax Sparse Attention (MSA), le même mécanisme d'attention creuse que la société avait abandonné dans sa génération M2 et réintroduit pour M3. Vous pouvez l'utiliser dès maintenant via MiniMax Code, les forfaits tokens et l'API, avec les poids ouverts et un rapport technique complet promis dans une dizaine de jours environ. Voici ce qui est confirmé au lancement, ce que disent les benchmarks, le coût, et dans quelle mesure vous pouvez leur faire confiance aujourd'hui.

Points essentiels

  • Disponible maintenant. M3 a été lancé le 1er juin 2026 et est accessible via MiniMax Code, les abonnements aux forfaits tokens et l'API standard. Les poids ouverts et un rapport technique sont attendus dans une dizaine de jours environ sur Hugging Face et GitHub.
  • Trois capacités frontier en un seul modèle. MiniMax positionne M3 comme le premier modèle open-weight à combiner du code frontier, une fenêtre de contexte d'un million de tokens et la compréhension native d'images et de vidéos.
  • L'attention creuse tient ses promesses. L'architecture MSA réduit le calcul par token à un contexte d'un million de tokens à un vingtième de la génération précédente, avec un prefill plus de 9× plus rapide et un décodage plus de 15× plus rapide.
  • Benchmarks solides, avec des réserves. M3 obtient 59,0 % sur SWE-Bench Pro, surpassant GPT-5.5 et Gemini 3.1 Pro et se rapprochant de Claude Opus 4.7. Plusieurs résultats ont été obtenus sur l'infrastructure de MiniMax elle-même avec un scaffolding d'agent, la vérification indépendante reste donc en attente.
  • Tarification agressive. Les prix d'entrée commencent à environ $0.30 par million de tokens, avec un coût mixte aussi bas que $0.06 par million avec l'optimisation du cache.

Où utiliser MiniMax M3 dès maintenant

De l'éditeur

Tous les modèles d'IA dans une seule app

Fello AI réunit GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 et plus dans une seule app native pour Mac et iPhone.

Téléchargez maintenant !

M3 est disponible depuis son lancement via trois canaux. Vous pouvez l'appeler via l'API standard, souscrire un forfait tokens MiniMax, ou l'utiliser dans MiniMax Code, le produit agent de la société. Les poids ouverts et le rapport technique ne sont pas disponibles dès le premier jour ; MiniMax indique qu'ils publieront les deux sur Hugging Face et GitHub dans une dizaine de jours environ.

Ce calendrier a son importance. Les développeurs peuvent tester le modèle hébergé immédiatement, mais la promesse open-weight n'est pas entièrement tenue tant que les poids et le rapport ne sont pas réellement publics. Quand ils seront disponibles, le dépôt à surveiller est huggingface.co/MiniMaxAI pour une fiche de modèle intitulée MiniMax-M3.

Dans les coulisses de MiniMax Sparse Attention (MSA)

Le changement phare est architectural, et c'est le même que MiniMax avait annoncé avant le lancement. M3 revient à l'attention creuse après que la société a passé toute la génération M2, y compris M2, M2.1, M2.5 et M2.7, sur l'attention complète sur la fenêtre de contexte.

En termes simples, l'attention complète signifie que chaque token dans le contexte peut regarder chaque autre token. C'est précis mais coûteux, et le coût explose à mesure que le contexte grandit. L'attention creuse permet au modèle de sauter la plupart de ces connexions et de se concentrer uniquement sur les tokens qui comptent. La conception de M3 utilise une branche d'index légère pour analyser les tokens entrants et choisir quels blocs de tokens passés méritent l'attention, puis n'exécute l'attention que sur ces blocs clé-valeur pertinents.

La base est le Grouped Query Attention (GQA), non pas le Multi-head Latent Attention, avec une sélection au niveau des blocs effectuée sur les clés-valeurs réelles, non compressées plutôt que sur une représentation compressée. C'est le détail clé. M3 conserve la précision du calcul d'attention réel tout en ne l'exécutant que là où cela compte, ce qui explique comment MiniMax affirme obtenir des gains d'efficacité sans sacrifier la qualité.

Schéma expliquant la technologie Sparse Attention [source]

Pourquoi MiniMax a abandonné l'attention creuse dans M2 et l'a réintroduite

C'est la partie qui rend ce lancement intéressant, car il s'agit d'une autocorrection publique. Dans le blog d'ingénierie de MiniMax expliquant l'architecture M2, l'équipe a écrit que « l'infrastructure pour l'attention linéaire et creuse est bien moins mature » que l'attention complète, et que « l'attention efficace a encore du chemin à faire avant de pouvoir définitivement surpasser l'attention complète. »

C'était publié il y a environ un an. Avec M3, la même équipe a livré une attention creuse prête pour la production avec des gains de vitesse d'un ordre de grandeur. Le pari est que l'infrastructure a rattrapé son retard, et MSA est la preuve qu'ils mettent devant les développeurs.

Quelle est la rapidité de MiniMax M3 ?

Les chiffres d'efficacité sont la partie la plus claire du lancement. Tous les chiffres sont mesurés à une longueur de contexte d'un million de tokens par rapport à la génération précédente.

MétriqueMiniMax M3
Calcul par token à un contexte d'un million1/20 de la génération précédente
Prefill (traitement de l'entrée)Plus de 9× plus rapide
Décodage (génération de la sortie)Plus de 15× plus rapide
Vitesse de sortie~100 tokens/s, ~3× plus rapide qu'Opus
Fenêtre de contexteJusqu'à 1 million de tokens (minimum garanti 512K)

C'est là le véritable argument commercial. Un long contexte semble impressionnant, mais la plupart des équipes n'ont pas besoin de déverser un dépôt entier et une année de tickets dans un seul prompt. Ce dont elles ont besoin, c'est d'un modèle qui conserve suffisamment d'état pour travailler dans le temps sans que la latence et le coût d'inférence deviennent pénibles. En réduisant le calcul par token à un contexte d'un million de tokens à un vingtième, MSA est conçu pour rendre les agents à long contexte économiques pour les workflows ordinaires des développeurs, pas seulement pour les démonstrations.

Résultats des benchmarks de MiniMax M3

Voici les données que l'article d'avant-lancement ne pouvait pas montrer, car aucun benchmark de précision n'existait encore. Maintenant ils existent. Sur les tâches de codage et agentiques, M3 affiche des chiffres qui le placent dans les modèles frontier.

BenchmarkMiniMax M3Ce qu'il mesure
SWE-Bench Pro59,0 %Corrections logicielles en conditions réelles
Terminal-Bench 2.166,0 %Tâches d'agent en ligne de commande
SWE-fficiency34,8 %Modifications de code efficaces
KernelBench Hard28,8 %Optimisation de noyau bas niveau
MCP Atlas74,2 %Utilisation d'outils via MCP
BrowseComp83,5Recherche et navigation web

Les affirmations remarquables : sur SWE-Bench Pro, M3 surpasse GPT-5.5 et Gemini 3.1 Pro et se rapproche de Claude Opus 4.7. Sur BrowseComp, son score de 83,5 dépasse le 79,3 d'Opus 4.7. Côté multimodal, M3 se classe au-dessus de Gemini 3.1 Pro sur OmniDocBench, prend la première place sur Claw-Eval (un benchmark d'agent autonome de bout en bout), et dépasse Opus 4.7 sur SVG-Bench.

Traitez-les avec la prudence qui s'impose. MiniMax indique que plusieurs résultats ont été obtenus sur sa propre infrastructure, souvent avec un scaffolding d'agent tel que Claude Code, Mini-SWE-Agent ou Terminus. Cela ne rend pas les chiffres inutiles, mais cela signifie qu'un modèle qui semble fort sur un classement peut se comporter différemment dans un dépôt interne complexe. M3 n'est pas encore sur le tableau DeepSWE, où les tâches logicielles à long horizon sont suivies, donc une comparaison claire avec les toutes dernières versions de Claude doit encore attendre. Les acheteurs devraient attendre des exécutions indépendantes avant de prendre des décisions d'acquisition.

Comparaison de Minimax M3 avec d'autres modèles [source]

Combien coûte MiniMax M3 ?

La tarification est l'argument le plus fort de M3, et notre guide complet sur les tarifs MiniMax la compare à chaque autre offre. L'API facture environ $0.30 par million de tokens en entrée, et avec l'optimisation du cache le coût mixte tombe à environ $0.06 par million. Un tarif standard s'applique aux requêtes jusqu'à 512K tokens en entrée, avec un tarif plus élevé au-delà pour les scénarios à long contexte, et des niveaux de service standard et prioritaire sont disponibles.

Pour les utilisateurs intensifs, MiniMax propose des forfaits tokens mensuels qui reviennent moins cher par token.

ForfaitPrix / moisAllocation de tokens
Plus$20~1,7 milliard de tokens
Max$50~5,1 milliards de tokens
Ultra$120~9,8 milliards de tokens

À titre de comparaison, Claude Opus 4.7 coûte environ $5 par million de tokens en entrée et $25 par million en sortie. Si M3 tient sur la qualité, il est plus de 15× moins cher en entrée et open-weight en plus.

Ce que MiniMax M3 peut réellement faire

MiniMax a accompagné le lancement de trois démonstrations de tâches à long horizon destinées à montrer M3 en action sur de nombreuses heures, et pas seulement en train de répondre à des prompts.

  • Reproduction d'article. M3 a reproduit de manière autonome un article de l'ICLR 2025 en 12 heures, produisant 18 commits et 23 figures.
  • Optimisation de noyau CUDA. Sur une exécution de 24 heures, M3 a fait passer l'utilisation matérielle FP8 de 7,6 % à 71,3 %, soit une accélération de 9,4×, à travers 147 soumissions de benchmark.
  • Entraînement de modèle autonome. M3 a obtenu un score de 0,37 sur PostTrainBench, une tâche qui demande au modèle d'entraîner un autre modèle de bout en bout.

Ces capacités s'articulent avec MiniMax Code, le produit agent construit autour du modèle. Il décompose les travaux complexes en workflows multi-étapes grâce à un cadre Agent Team, exécute une boucle adversariale producteur-vérificateur pour détecter ses propres erreurs, et prend en charge l'utilisation de l'ordinateur grâce aux capacités multimodales natives de M3. Construit en partie sur les projets open source OpenCode et Pi, il place MiniMax dans le même segment que Claude Code d'Anthropic, les agents de codage d'OpenAI et les outils Gemini de Google. Le produit n'est plus seulement le modèle, c'est le modèle plus l'infrastructure qui l'entoure.

MiniMax M3 vs M2.7 vs M2.5

Voici comment M3 se situe par rapport aux récentes générations M de MiniMax et à un point de référence occidental majeur, maintenant que la colonne M3 peut être remplie avec des données réelles.

MiniMax M3MiniMax M2.7MiniMax M2.5Claude Opus 4.7 (référence)
StatutLancé le 1er juin 2026Lancé le 18 mars 2026Lancé le 12 février 2026Lancé
AttentionCreuse (MSA)ComplèteComplètePropriétaire
Fenêtre de contexte1 million de tokensPlus courte, lente à 1 millionPlus courteLongue
MultimodalNatif (image + vidéo)Axé sur le texteAxé sur le texteOui
SWE-Bench Pro59,0 %CompétitifPlus basPlus élevé
Open-weightOui (poids dans ~10 jours)Oui, non commercialOuiNon
Tarif d'entrée~$0.30 / million de tokens~$0.30 / million de tokensComparable$5 / million de tokens

M2.7 reste le modèle que la plupart des utilisateurs actuels de MiniMax utilisent, et il n'est pas déprécié. La différence est que M3 rend enfin le contexte d'un million de tokens pratique plutôt que douloureusement lent, et ajoute la multimodalité native que M2.7 n'avait jamais. Pour comprendre comment la série M en est arrivée là, consultez notre analyse de MiniMax M2.5. M3 est l'un des nombreux lancements de juin ; quelques jours plus tard, Microsoft a dévoilé ses propres modèles MAI lors de Build.

Comment MiniMax M3 se compare-t-il à Claude, GPT-5.5, Gemini et DeepSeek ?

Avec les benchmarks maintenant publics, la comparaison est plus précise qu'au stade du teaser, même si la vérification indépendante reste la pièce manquante.

Face à Claude Opus 4.7. Claude devance probablement encore M3 sur la qualité brute du raisonnement, et il est en tête sur les tests de codage à long horizon les plus récents. Mais M3 est open-weight, plus de 15× moins cher en entrée, et surpasse réellement Opus 4.7 sur la recherche web BrowseComp. L'écart qui comptait depuis des années s'est réduit à une mince marge sur des tâches spécifiques.

Face à GPT-5.5 et Gemini 3.1 Pro. Les propres chiffres de M3 le placent devant les deux sur SWE-Bench Pro. La revendication plus ambitieuse est architecturale : M3 affirme avoir rendu économique l'inférence à un million de tokens en production, quelque chose que les labs fermés n'ont pas publiquement assumé dans les mêmes termes.

Face à DeepSeek V4 et Qwen3.7-Max. C'est le combat le plus serré. DeepSeek V4 et Qwen3.7-Max sont les vrais concurrents de M3, tous chinois, tous open-weight, tous à la poursuite des mêmes cas d'usage agentiques. Un nouvel entrant dans ce même groupe open-weight est Nex-N2-Pro, un modèle MoE de 397 milliards de paramètres conçu pour le codage agentique. L'avantage différenciant de M3 dans ce segment est la combinaison : c'est le seul à réunir du code frontier, un contexte d'un million de tokens et la multimodalité à la fois.

Pour une lecture plus large de la façon dont la course aux modèles entre les États-Unis et la Chine façonne les prix et les licences, consultez notre analyse Anthropic vs OpenAI.

MiniMax M3 est-il open source ?

Il est open-weight, avec les poids et un rapport technique attendus sur Hugging Face et GitHub dans une dizaine de jours environ après le lancement. La question de savoir s'il compte comme entièrement open source dépend de la licence, qui n'était pas publiée au lancement.

La distinction est importante. Open-weight signifie que vous pouvez télécharger les fichiers du modèle et les exécuter localement. L'open source, au sens strict, signifie également que la licence autorise une utilisation commerciale sans restriction. MiniMax-M2 était livré sous une licence MIT modifiée, mais la licence du plus récent M2.7 restreint l'utilisation commerciale du modèle ou de ses dérivés sans autorisation écrite préalable. Si M3 suit ce précédent, attendez-vous à des poids téléchargeables avec une option non commerciale par défaut et une licence entreprise disponible via la vente directe. Le rapport technique réglera la question.

Qui fabrique MiniMax M3 ?

MiniMax est un laboratoire d'IA basé à Shanghai, fondé en 2021. En dehors de la Chine, il est surtout connu pour son modèle vidéo Hailuo, présenté dans notre revue de Hailuo 02, et pour la série M de modèles de langage. La société a lancé M1 mi-2025 (456 milliards de paramètres) avant de pivoter vers la famille M2, plus compacte, plus dense et plus agentique, et maintenant M3.

Le contexte commercial renforce l'importance de ce lancement. MiniMax s'est introduit en bourse à la Bourse de Hong Kong le 9 janvier 2026, c'est donc désormais une société cotée qui cherche à prouver qu'elle peut vendre de l'accès aux modèles, développer l'adoption par les développeurs, et continuer à alimenter l'écosystème open source. C'est un équilibre difficile : les poids ouverts construisent la confiance et la distribution, mais les API hébergées et les abonnements aux agents sont là où vivent les revenus récurrents. La figure publique du travail M3 est Skyler Miao (@SkylerMiao7), directeur de l'ingénierie de MiniMax, dont les publications sur X avaient préviewé l'architecture avant le lancement.

Ce que MiniMax M3 signifie pour la course mondiale à l'IA

Deux évolutions se précisent maintenant que M3 est sorti.

Premièrement, l'attention creuse est de retour sur la table pour les systèmes de production à long contexte. MiniMax la jugeait pas encore prête en 2025. La mettre en avant maintenant signale que le reste du secteur a du retard à combler. Anthropic, Google DeepMind et OpenAI ont tous des recherches sur l'attention efficace en cours, mais aucun n'a livré un modèle phare avec ce type d'engagement public sur l'efficacité.

Deuxièmement, les labs open-weight chinois continuent de creuser l'avantage de coût. DeepSeek a ouvert ce front, Qwen a maintenu la pression, et M3 la renforce encore : peu coûteux à exécuter, ouvert au téléchargement, et désormais véritablement compétitif sur le codage, le contexte et le travail multimodal en même temps. La prime tarifaire des labs américains est de plus en plus difficile à défendre à chaque lancement. Pour le dernier état des lieux de chaque modèle phare, consultez notre classement des meilleurs modèles d'IA.

Devriez-vous passer à MiniMax M3 ?

Si votre charge de travail nécessite un contexte d'un million de tokens, comme l'analyse de bases de code entières, les agents de recherche multi-documents ou la mémoire de session longue durée, M3 est le modèle évident à tester en premier. C'est exactement le cas d'usage pour lequel il a été conçu, et les gains d'efficacité sont ce qui rend ces charges de travail abordables.

Si vous exécutez des pipelines d'agent ou de codage standard, il vaut la peine de piloter M3 face à votre modèle actuel, mais attendez les benchmarks indépendants et le rapport technique avant de miser la production sur les chiffres du lancement. Le mouvement intelligent est de tester le modèle hébergé maintenant et de réévaluer une fois les poids publics.

Si vous voulez simplement tester plusieurs modèles phares chinois et occidentaux sans gérer des clés API séparées, l'application Fello AI pour Mac et iOS route entre Claude, ChatGPT, Gemini, Grok et DeepSeek via une seule interface. M3 a été intégré à Fello AI avec la mise à jour 6.7.0, il est donc désormais dans la même interface que ces modèles.

À surveiller ensuite

Les prochaines semaines décideront de la solidité du lancement au-delà des tests. Trois choses à surveiller : les poids ouverts et le rapport technique arrivant sur Hugging Face dans les dix jours promis, les premières exécutions de benchmarks indépendants qui éliminent le scaffolding de MiniMax, et l'éventuelle apparition de M3 sur des tableaux neutres comme DeepSWE. Si tout cela se déroule sans encombre, MiniMax aura fait plus que lancer un autre modèle capable. Il aura rendu la course frontier plus difficile pour tous les labs qui vendent des agents de codage. Nous garderons cet article à jour au fil des données vérifiées.

FAQ

MiniMax M3 est-il déjà disponible ?

Oui. MiniMax a officiellement lancé M3 le 1er juin 2026. Il est disponible maintenant via l'API, les forfaits tokens mensuels et le produit agent MiniMax Code. Les poids ouverts et un rapport technique sont attendus sur Hugging Face et GitHub dans une dizaine de jours environ.

MiniMax M3 est-il open source ?

Il est open-weight, avec les poids et un rapport technique promis dans une dizaine de jours environ après le lancement. Sa classification comme entièrement open source dépend de la licence. Si M3 suit le précédent de M2.7, les poids seront téléchargeables mais l'utilisation commerciale pourra nécessiter une autorisation écrite de MiniMax.

Quelle est la rapidité de MiniMax M3 ?

À un contexte d'un million de tokens, MiniMax indique que l'architecture MSA de M3 utilise un vingtième du calcul par token de la génération précédente, avec un prefill plus de 9× plus rapide et un décodage plus de 15× plus rapide. La sortie tourne autour de 100 tokens par seconde.

Quelle est la qualité de MiniMax M3 en codage ?

MiniMax rapporte 59,0 % sur SWE-Bench Pro, surpassant GPT-5.5 et Gemini 3.1 Pro et se rapprochant de Claude Opus 4.7. Plusieurs résultats ont été obtenus sur la propre infrastructure de MiniMax avec un scaffolding d'agent, attendez donc la vérification indépendante avant de les considérer comme définitifs.

Combien coûte MiniMax M3 ?

Les prix d'entrée de l'API commencent à environ $0.30 par million de tokens, tombant à environ $0.06 par million mixte avec l'optimisation du cache. Les forfaits tokens mensuels sont à $20 (Plus), $50 (Max) et $120 (Ultra). Cela rend M3 plus de 15× moins cher en entrée que Claude Opus 4.7.