Le 4 juin 2026, NVIDIA a publié Nemotron 3 Ultra, un modèle de raisonnement entièrement open source à 550 milliards de paramètres, conçu spécifiquement pour les agents à longue durée d'exécution. Selon la plateforme de benchmark Artificial Analysis, c'est désormais le modèle open source le plus capable sorti d'un laboratoire américain, avec un score de 48 sur l'Artificial Analysis Intelligence Index. Cela le place nettement devant tous les autres modèles open source américains et le positionne dans ce qu'Artificial Analysis appelle le quadrant le plus attractif de son graphique, combinant une intelligence élevée et une vitesse de génération rapide. Microsoft s'était lancé dans la course aux modèles maison quelques jours plus tôt avec sa gamme MAI lors du Build.
Nemotron 3 Ultra est un exemple phare d'IA open source issue d'un laboratoire américain, avec des poids entièrement publiés et téléchargeables depuis Hugging Face.
Ce qui distingue Nemotron 3 Ultra, c'est son objectif de conception. NVIDIA ne l'a pas construit pour remporter des comparaisons de chatbot à tour unique. Selon le blog NVIDIA, il a été conçu pour orchestrer des agents qui planifient, appellent des outils, délèguent à des sous-agents, lisent des observations et se remettent d'erreurs sur des centaines de tours, tout en consommant moins de tokens que les modèles open source comparables. NVIDIA revendique jusqu'à 5 fois plus de débit et jusqu'à 30 % de coût en moins pour accomplir des tâches agentiques que les autres modèles open source de sa catégorie.
Dans cet article, nous examinons ce qu'est réellement le modèle, les innovations architecturales qui le sous-tendent, le tableau complet des benchmarks, la nouvelle méthode d'entraînement utilisée par NVIDIA, la pile agent qui l'entoure, la disponibilité et la tarification concrètes, ainsi que sa comparaison avec les modèles open source les plus solides de Chine et la frontière fermée.
Ce qu'est réellement Nemotron 3 Ultra
Nemotron 3 Ultra est un modèle Mixture of Experts à 550 milliards de paramètres, avec environ 55 milliards de paramètres actifs par token. Ce ratio est l'élément central. Il porte la capacité de connaissance d'un très grand modèle tout en ne payant que le coût d'inférence d'un modèle bien plus petit, ce qui lui permet de fonctionner rapidement et à moindre coût par rapport aux modèles denses ou aux architectures MoE plus denses.
Le modèle est conçu pour le raisonnement de frontière et l'orchestration. Dans tout flux de travail agent réel, la plupart des appels sont routiniers, mais un petit sous-ensemble critique exige un raisonnement plus profond. NVIDIA a conçu Ultra pour traiter ces appels difficiles : ceux qui maintiennent des décisions architecturales sur de longues sessions de codage, synthétisent des preuves contradictoires issues de centaines de sources de recherche, ou vérifient des conceptions de puces par rapport à des milliers de contraintes. Le travail quotidien à grand volume, les appels d'outils, la validation et l'exécution simple, peut être délégué aux modèles plus petits Nemotron 3 Super et Nano, Ultra agissant comme orchestrateur.
Il est aussi entièrement open source dans le sens le plus important. NVIDIA a publié les poids, le pipeline de données d'entraînement et les recettes, tous sous la licence permissive OpenMDW-1.1 de la Linux Foundation. Il existe un modèle de base, le modèle instruct post-entraîné, et une variante quantifiée NVFP4 qui réduit l'empreinte mémoire.
Le raisonnement est configurable. Le modèle prend en charge un mode de réflexion complète, un mode d'effort moyen et un mode de raisonnement désactivé, tous activés via le modèle de chat. Il prend aussi en charge un budget de raisonnement strict, où vous fixez un plafond de tokens sur la trace de réflexion afin que le modèle arrête de délibérer et réponde une fois ce plafond atteint. Pour les développeurs d'agents surveillant leurs dépenses en tokens, ce contrôle est une fonctionnalité pratique, pas un gadget.
Brève histoire de Nemotron
Nemotron est la famille de modèles open source de NVIDIA, qui construit silencieusement sa crédibilité depuis quelques années plutôt que de courir après les titres de chatbot.
Les premières versions de Nemotron se positionnaient comme des modèles d'entreprise personnalisables, distribués via le framework NeMo de NVIDIA et destinés aux entreprises souhaitant affiner et auto-héberger plutôt que d'appeler une API fermée. L'argument était toujours le même : poids ouverts, données ouvertes dans la mesure du possible, et outillage pour adapter le modèle à un domaine spécifique.
La génération Nemotron 3 est celle où la famille est devenue véritablement compétitive. NVIDIA l'a déployée sous forme de gamme étagée. Nano est le niveau compact, pour les appareils et la périphérie. Super est le modèle polyvalent de niveau intermédiaire pour l'exécution à grand volume. Ultra, le modèle présenté ici, occupe le sommet comme niveau de raisonnement de frontière et d'orchestration. Les trois sont conçus pour être utilisés ensemble, le modèle le plus grand enseignant et coordonnant les plus petits.
La logique stratégique derrière la famille est l'économie des tokens. L'argument de NVIDIA, repris par les partenaires qui développent sur ces modèles, est qu'un seul modèle de frontière exécutant chaque tâche est inefficace. Un système de modèles, où un orchestrateur puissant confie le travail routinier à des exécuteurs efficaces, accomplit le même flux de travail avec bien moins de tokens. Ultra est le meilleur enseignant et planificateur de ce système, et parce qu'il est open source sous licence permissive, ses sorties peuvent légalement être utilisées pour post-entraîner les modèles plus petits Super et Nano, ce que les conditions de licence de la plupart des modèles de frontière fermés interdisent.
L'architecture
Nemotron 3 Ultra n'est pas un transformer standard. NVIDIA a combiné plusieurs idées architecturales pour améliorer le compromis entre efficacité et précision.
Transformer hybride Mamba. Le modèle alterne des couches Mamba-2 avec des couches d'attention. Les couches Mamba traitent les longues séquences bien plus efficacement que l'attention, ce qui rend la fenêtre de contexte d'un million de tokens praticable. Les couches d'attention transformer sont conservées là où elles importent, préservant un rappel précis pour que le modèle puisse récupérer des faits spécifiques dans une très grande fenêtre de contexte. Cet hybride est au cœur de la raison pour laquelle Ultra peut gérer des charges de travail agents à long contexte sans que le coût n'explose.
LatentMoE. Au lieu de router les tokens vers des experts dans la dimension cachée complète, Ultra les projette d'abord dans une dimension latente plus petite, puis les route. Cela rend le routage des experts plus efficace et permet à un seul modèle de gérer un mélange de raisonnement, de génération de code, d'appels d'outils et de logique spécifique au domaine sans la surcharge de routage qu'un MoE conventionnel imposerait.
Prédiction multi-token. La MTP permet au modèle de prédire plusieurs tokens futurs en un seul passage en avant en utilisant des têtes de prédiction à poids partagés. Cela accélère directement la génération et donne au modèle un décodage spéculatif natif, permettant aux déploiements de prévoir à l'avance et de vérifier, réduisant la latence sur les longues sorties et les flux de travail multi-tours.
Précision NVFP4. C'est l'un des détails pratiques les plus intéressants. Le même checkpoint NVFP4 fonctionne sur les GPU NVIDIA Hopper, Blackwell et Ampere, ce qui signifie que les développeurs utilisent un seul checkpoint partout plutôt que de maintenir des compilations distinctes par architecture. NVIDIA affirme que NVFP4 offre jusqu'à 5 fois plus de débit par GPU à la même interactivité par rapport au BF16 sur Blackwell. Le modèle a été pré-entraîné avec une approche sensible à la quantification afin que le checkpoint basse précision conserve la précision.
En matière de matériel, un déploiement sur un seul nœud nécessite 8 GPU B200 avec environ 1,5 To de mémoire agrégée. Les configurations multi-nœuds fonctionnent sur 8 GPU ou plus H100, H200, GB200 ou GB300. Le modèle est livré avec des recettes de déploiement pour vLLM, SGLang et TensorRT-LLM, TensorRT-LLM étant actuellement limité à Blackwell.
Résultats des benchmarks
NVIDIA a publié une comparaison directe avec trois des modèles open source les plus solides disponibles : GLM 5.1 (744B, désormais remplacé par GLM 5.2), Kimi K2.6 (1T) et Qwen3.5 (397B). Le schéma montre que Nemotron 3 Ultra domine sur la productivité agent, le suivi d'instructions et le long contexte, tout en étant en retrait sur le codage brut et la planification à longue portée. Cette même base Qwen3.5-397B propulse également Nex-N2-Pro, un modèle open-weight séparé affiné spécifiquement pour le codage agentique. Moonshot a depuis publié Kimi K2.7 Code, le successeur du modèle K2.6 utilisé dans cette comparaison.
| Benchmark | Nemotron 3 Ultra (550B) | GLM 5.1 (744B) | Kimi K2.6 (1T) | Qwen3.5 (397B) |
|---|---|---|---|---|
| Productivité agent (PinchBench) | 91 % | 84 % | 91 % | 89 % |
| Planification à longue portée (EnterpriseOps-Gym) | 33 % | 40 % | 29 % | 30 % |
| Codage (Terminal-Bench 2.0) | 54 % | 64 % | 67 % | 53 % |
| Suivi d'instructions (IFBench) | 82 % | 77 % | 74 % | 78 % |
| Travail de connaissance (GDPVal-AA) | 1 448 | 1 594 | 1 508 | 1 192 |
| Travail professionnel (ProfBench Search) | 56 % | 46 % | 56 % | 53 % |
| Long contexte (Ruler @1M) | 95 % | N/A (max 256K) | N/A (max 256K) | 90 % |
Le résultat remarquable est le long contexte. Ultra maintient 95 % sur Ruler à un million de tokens, tandis que GLM 5.1 et Kimi K2.6 plafonnent à 256K de contexte et ne peuvent pas exécuter le test du tout. Pour les charges de travail agents qui doivent maintenir une grande base de code, un long corpus de recherche ou un historique de conversation étendu en contexte, c'est un avantage structurel réel.
La fiche du modèle ajoute un ensemble de benchmarks plus approfondi tiré des évaluations propres de NVIDIA :
- SWE-Bench Verified : 71,9, avec des scores constants entre 65 et 70,4 sur les bancs d'essai Pi, OpenHands, Hermes, OpenCode et Mini SWE Agent
- SWE-Bench Multilingual : 67,7
- Terminal Bench 2.1 : 56,4
- BrowseComp : 44,4
- LiveCodeBench v6 : 89,0
- IOI 2025 : 570,0
- IMOAnswerBench : 88,6 sans outils, 92,3 avec outils
- MMLU-Pro : 86,8
- RULER à 1M : 94,7
- LongBench v2 : 61,9
- MMLU-ProX sur 10 langues : 83,0
La cohérence des résultats sur SWE-Bench mérite d'être soulignée. Un modèle qui obtient entre 65 et 70,4 quel que soit le banc d'essai agent utilisé est plus fiable en production qu'un modèle qui n'excelle que dans une configuration finement réglée. Pour les développeurs d'agents, un comportement prévisible sur différents bancs d'essai compte autant qu'un score de pointe.
Sur l'Artificial Analysis Intelligence Index plus large, Nemotron 3 Ultra obtient 48. Cela en fait le modèle open source américain le plus capable, devant Gemma 4 31B (39), Nemotron 3 Super (36) et gpt-oss-120b (33). Il ne rattrape pas le modèle open source le plus puissant de Chine, Kimi K2.6, qui se situe à 54, et le leader de la frontière fermée Opus 4.8 est encore plus loin avec 61.
Vitesse et efficacité des coûts
La précision n'est que la moitié de l'argumentaire. L'autre moitié est le débit et le coût, et c'est là que Nemotron 3 Ultra présente sa proposition la plus convaincante.
NVIDIA revendique un débit 5 fois supérieur aux autres modèles open source de sa catégorie, et les chiffres indépendants confirment cette direction. Sur le fournisseur DeepInfra, Artificial Analysis a mesuré Nemotron 3 Ultra délivrant plus de 300 tokens par seconde, tandis que les modèles de taille comparable de DeepSeek ou Moonshot gèrent actuellement seulement 50 à 100. C'est un écart important, qui découle de la combinaison du faible nombre de paramètres actifs, de la précision NVFP4, de l'hybride Mamba et de la prédiction multi-token fonctionnant conjointement.
Sur les coûts, NVIDIA a fait passer le modèle par SWE-Bench et Terminal Bench 2.0 et a constaté qu'il accomplissait les benchmarks en utilisant moins de tokens au total et moins de tokens par tour que les modèles comparables, réduisant le coût d'accomplissement des tâches jusqu'à 30 %. Pour les agents à longue durée d'exécution qui appellent le modèle des milliers de fois pour terminer un seul flux de travail, une réduction de 30 % des tokens se traduit par une différence de facture significative.
Ce cadrage d'efficacité est la raison d'être entière du modèle. À mesure que les flux de travail agents s'allongent, les comptages de tokens augmentent rapidement, car chaque plan, appel d'outil, invocation de sous-agent et étape de raisonnement est renvoyé dans le modèle. Le pari de NVIDIA est que les laboratoires et les entreprises gérant ces flux de travail se soucient davantage du coût par tâche accomplie que d'un score de benchmark unique, et Ultra est optimisé pour cette métrique.

Distillation multi-enseignants sur politique
La pièce la plus novatrice du pipeline d'entraînement est une méthode que NVIDIA appelle Multi Teacher On Policy Distillation, ou MOPD.
Dans MOPD, le modèle Ultra apprend de plus de 10 modèles enseignants spécialisés tout en générant ses propres tentatives pendant l'entraînement. Chaque enseignant est entraîné avec son propre pipeline spécifique au domaine, couvrant des domaines comme le codage, les mathématiques, la recherche, le travail de bureau et les appels d'outils. Lorsque le modèle étudiant génère des rollouts dans ces domaines, l'enseignant correspondant le note dans son domaine d'expertise et renvoie un signal de récompense dense. Ainsi, un rollout de codage est noté par l'enseignant en codage, un rollout de mathématiques par l'enseignant en mathématiques, et ainsi de suite.
Deux choix de conception rendent cela efficace. Premièrement, toute la boucle s'exécute de manière asynchrone, avec la génération de rollouts par l'étudiant, la notation par les enseignants et l'optimisation de l'étudiant entièrement pipelinées afin qu'aucune étape n'attende l'autre. Deuxièmement, le processus est itératif. Après avoir produit un checkpoint entraîné par MOPD, NVIDIA initialise de nouveaux cycles d'entraînement des enseignants à partir de l'étudiant mis à jour, puis fusionne ces améliorations dans la prochaine étape MOPD. L'étudiant et les enseignants co-évoluent, ce qui permet aux capacités de continuer à progresser dans tous les domaines plutôt que de plafonner.
La liste des enseignants est elle-même notable, car la fiche du modèle indique quels modèles ont contribué. Elle inclut des variantes de Qwen3, DeepSeek V3, R1 et V4-Pro, GPT-OSS-120B, GLM-5 et GLM-4.7, des variantes Mistral et phi-4. Autrement dit, NVIDIA a distillé à partir d'un large ensemble de modèles open source solides, ce qui n'est légalement viable qu'parce qu'Ultra est lui-même un modèle open source sous licence permissive et que ces enseignants le permettent.
Les étapes antérieures sont plus conventionnelles. Le pré-entraînement porte sur environ 20 000 milliards de tokens avec une date de coupure de septembre 2025 en utilisant Megatron-LM. L'ajustement fin supervisé, avec une date de coupure de mai 2026, se concentre sur le code, les mathématiques, la science, les appels d'outils et le suivi d'instructions. L'apprentissage par renforcement utilise GRPO asynchrone sur des environnements de mathématiques, de code, de science et d'utilisation d'outils en plusieurs étapes, construit sur NeMo RL et NeMo Gym. MOPD se place au sommet comme raffinement final, et NVIDIA a publié la recette MOPD via NeMo-RL afin que d'autres puissent la reproduire.
Données d'entraînement et transparence
NVIDIA mise fortement sur la transparence des données comme argument de vente, ce qui importe précisément pour les acheteurs d'IA d'entreprise et souveraine qui ont besoin de savoir d'où proviennent les données d'entraînement.
En s'appuyant sur ses fondations de pré-entraînement existantes, Nemotron 3 Ultra a ajouté 212 milliards de nouveaux tokens ciblant trois lacunes de domaines spécifiques :
- 4 milliards de tokens de données juridiques synthétiques, qui ont porté la moyenne LegalBench proxy de 64,6 % à 74,7 %
- 35 milliards de tokens de données synthétisées basées sur Wikipédia, qui ont amélioré le SimpleQA proxy de 40,2 % à 50,2 %
- 173 milliards de tokens GitHub actualisés jusqu'au 30 septembre 2025
Du côté du post-entraînement, ce lancement a publié 10 millions de nouveaux échantillons d'ajustement fin supervisé, 1 million de nouvelles tâches d'apprentissage par renforcement sur plusieurs domaines, et 15 nouveaux environnements d'apprentissage par renforcement nets. Cela porte les totaux cumulatifs ouverts de Nemotron à 50 millions d'échantillons SFT, 2 millions de tâches RL et 55 environnements RL. Le corpus d'entraînement complet rapporté par la fiche du modèle représente environ 14 800 milliards de tokens répartis sur 226 ensembles de données, un mélange de sources publiques, de données web et de code crawlées, et de données synthétiques générées par des modèles enseignants.
La publication des environnements RL et des données SFT est ce qui distingue ce lancement d'un simple dépôt de poids ouverts classique. Tout le monde peut affiner Ultra pour son propre domaine en utilisant LoRA, SFT complet ou apprentissage par renforcement via les bibliothèques NeMo, et NVIDIA fournit des recettes pour chacun, y compris des configurations spécifiques H100 et GB200.
La pile agent autour du modèle
Nemotron 3 Ultra n'est pas livré comme un modèle nu. NVIDIA l'a publié avec une pile de référence pour exécuter des agents autonomes de façon plus sûre.
Hermes Agent et OpenClaw sont les bancs d'essai agents, fournissant les boucles d'orchestration, la mémoire et les outils pour les flux de travail multi-tours. Hermes Agent est désormais officiellement pris en charge avec Nemotron. NVIDIA OpenShell, en préversion anticipée dans le cadre du NVIDIA Agent Toolkit, est le runtime sécurisé où les agents autonomes et le code qu'ils génèrent s'exécutent réellement. NVIDIA NemoClaw est le plan open source qui relie tout cela, installant le runtime OpenShell avec une seule commande afin que des agents comme Hermes puissent s'exécuter aux côtés de modèles open source dans un environnement bac à sable.
L'adoption se manifeste déjà chez les partenaires. L'entreprise d'IA d'entreprise Glean a ajouté Nemotron 3 Ultra à sa plateforme, citant le modèle qui offre 91 % de la complétude des LLM de frontière au profil de coût d'un modèle open source, et le positionnant comme l'option rentable pour le travail quotidien d'entreprise dans sa gamme de plus de 30 modèles. Le propre modèle de recherche agentique de Glean, Waldo, est post-entraîné sur le Nemotron 3 Nano plus petit et fonctionne apparemment avec 50 % de latence en moins et 25 % de tokens en moins, ce qui correspond exactement au modèle de système de modèles que NVIDIA promeut.
Aible, un éditeur d'agents d'entreprise, a organisé un hackathon conjoint avec l'équipe NemoClaw de NVIDIA comparant Nemotron 3 Ultra à un autre modèle de raisonnement de pointe sur une tâche OpenClaw identique dans OpenShell. La tâche exigeait que l'agent trouve le bon sous-agent, identifie le bon ensemble de données, exécute l'analyse, publie le résultat sur Slack et sauvegarde le plan pour réutilisation. Aible a rapporté qu'Ultra avait planifié plus directement, avait moins reculé sur ses pas, avait été le premier à publier sur Slack, avait suivi chaque partie de l'instruction du premier coup et avait sauvegardé avec succès le plan exécuté pour une réutilisation déterministe, tandis que le modèle de comparaison avait raté une instruction et échoué à son premier appel Slack. Les benchmarks de fournisseurs méritent toujours une certaine prudence, mais le résultat est cohérent avec les forts scores PinchBench et IFBench du modèle.
Si vous souhaitez comparer Nemotron 3 Ultra à la frontière fermée sans déployer d'infrastructure GPU, Fello AI vous donne accès à Claude, GPT, Gemini, DeepSeek, Perplexity et bien plus encore dans une seule application native pour Mac, iPhone et iPad. Un abonnement, chaque modèle de frontière, sans jongler entre des comptes séparés.
Deux autres modèles dans ce lancement
NVIDIA a livré deux modèles Nemotron supplémentaires aux côtés d'Ultra, tous deux visant à rendre les systèmes agents plus sûrs et plus capables.
Nemotron 3.5 Content Safety est un modèle de garde-fou open source à 4 milliards de paramètres pour classifier les contenus dangereux, interdits ou violant les politiques sur du texte, des images et des entrées combinées. Il couvre 23 catégories de sécurité et 12 langues, et peut fonctionner comme garde-fou au moment de l'inférence, comme juge pour les tests de sécurité LLM, ou comme base pour post-entraîner des modèles plus sûrs en utilisant son ensemble de données associé. Il prend en charge les politiques personnalisées et produit des traces de raisonnement, ce qui permet aux entreprises d'auditer pourquoi une classification donnée a été effectuée et d'adapter les règles à leur propre domaine.
Nemotron 3.5 ASR est un modèle de reconnaissance vocale pour les agents natifs de la voix. Il utilise une architecture de streaming avec cache pour traiter les deltas audio instantanément, atteignant une latence inférieure à 100 millisecondes pour la voix en temps réel. NVIDIA note que le prédécesseur en anglais alimente déjà la fonctionnalité d'entrée vocale de Microsoft GitHub Copilot CLI, utilisé par plus de 20 millions de développeurs, et qu'un benchmark indépendant de plus de 50 configurations ASR sur appareil a identifié ce prédécesseur comme le meilleur candidat pour le streaming anglais en temps réel sur du matériel contraint. La version 3.5 étend cette même architecture à plus de 40 langues dans un seul checkpoint.
Là où Nemotron 3 Ultra est en retrait
Les benchmarks rendent les lacunes claires, et NVIDIA ne les dissimule pas.
Codage brut. Sur Terminal-Bench 2.0, Ultra obtient 54 %, bien en deçà de GLM 5.1 avec 64 % et Kimi K2.6 avec 67 %. Ses scores SWE-Bench Verified sont solides et constants, mais sur le benchmark de codage terminal plus difficile, c'est le modèle le plus faible de ce groupe. Pour la génération de code pure à grand volume, les modèles open source chinois plus grands ont actuellement l'avantage.
Planification à longue portée. Sur EnterpriseOps-Gym, Ultra obtient 33 %, derrière GLM 5.1 avec 40 %. Pour les tâches de planification en plusieurs étapes les plus longues et les plus complexes, ce n'est pas le modèle open source de pointe. C'est une nuance notable étant donné que le modèle est commercialisé pour les agents à longue durée d'exécution, bien qu'il convienne de noter que ces scores sont faibles dans l'ensemble, ce qui en dit plus sur la difficulté du benchmark que sur un seul modèle.
Plafond du travail de connaissance. Sur GDPVal-AA, Ultra obtient 1 448 contre 1 594 pour GLM 5.1 et 1 508 pour Kimi K2.6. Sur le travail de connaissance large, il est en retrait par rapport aux modèles plus grands, ce qui est le compromis attendu pour un modèle avec bien moins de paramètres totaux et actifs.
Pas la frontière absolue. Avec 48 sur l'Artificial Analysis Intelligence Index, Ultra est le meilleur modèle open source américain, mais Kimi K2.6 à 54 et le Opus 4.8 fermé à 61 sont clairement en avance sur l'intelligence brute. L'argumentaire est la valeur et l'efficacité, pas la tête du classement.
Le bilan honnête : Nemotron 3 Ultra gagne sur les axes que NVIDIA a optimisés, la productivité agent, le suivi d'instructions, le long contexte, la vitesse et le coût, et est en retrait sur les axes qu'il a sacrifiés, le codage brut, la planification profonde et le pic de connaissance.
Comparaison
| Capacité | Nemotron 3 Ultra | Kimi K2.6 | GLM 5.1 | Opus 4.8 |
|---|---|---|---|---|
| Paramètres totaux | 550B | 1T | 744B | fermé |
| Paramètres actifs | 55B | plus grand | plus grand | fermé |
| AA Intelligence Index | 48 | 54 | non listé | 61 |
| Productivité agent (PinchBench) | 91 % | 91 % | 84 % | non listé |
| Suivi d'instructions (IFBench) | 82 % | 74 % | 77 % | non listé |
| Codage (Terminal-Bench 2.0) | 54 % | 67 % | 64 % | non listé |
| Long contexte | 1M tokens (95 % Ruler) | 256K max | 256K max | grand |
| Vitesse de génération | 300+ tok/s | 50 à 100 tok/s | variable | fermé |
| Poids ouverts | oui, OpenMDW-1.1 | oui | oui | non |
Le schéma de la comparaison est cohérent. Face à Kimi K2.6 et GLM 5.1, Nemotron 3 Ultra est le modèle plus petit, plus rapide, moins coûteux qui égale ou surpasse sur la productivité agent, le suivi d'instructions et le long contexte, tout en cédant sur le codage brut et l'intelligence de pointe. Il représente environ la moitié du nombre de paramètres de GLM 5.1 et bien moins de la moitié de Kimi K2.6, et pourtant il égale le Kimi à un billion de paramètres sur PinchBench et fonctionne trois à six fois plus vite en débit.
Face à la frontière fermée, l'écart est réel mais la proposition de valeur est différente. Opus 4.8 à 61 sur l'index d'intelligence est le raisonneur plus puissant, mais c'est une API fermée que vous ne pouvez pas auto-héberger, affiner librement ou utiliser pour entraîner vos propres modèles plus petits. Le cadrage de Glean, 91 % de la complétude de frontière au coût d'un modèle open source, capture la décision réelle que la plupart des entreprises affrontent. Pour les 9 % critiques de tâches à router vers la frontière, pour les 91 % routiniers, on exécute un modèle open source comme Ultra et on économise les dépenses.
Pour les charges de travail en langue chinoise et de codage pur, les modèles open source chinois plus grands conservent encore un avantage. Pour les flux de travail agents en anglais où le coût, la vitesse et la fiabilité des appels d'outils dominent, Ultra est le choix le plus pratique.
Disponibilité et tarification
Nemotron 3 Ultra est disponible dès maintenant via un large ensemble de canaux, ce qui représente une portée inhabituelle pour un modèle open source le jour du lancement.
Vous pouvez l'essayer sur Perplexity avec un abonnement Pro ou via leur API, et y accéder via OpenRouter, Anaconda, ou build.nvidia.com. Les poids sont téléchargeables depuis Hugging Face, en variantes BF16 et NVFP4, et le modèle est conditionné en tant que microservice NVIDIA NIM pour un auto-hébergement optimisé.
La liste des fournisseurs cloud et d'inférence est longue : AWS JumpStart, Amazon EKS, Baseten, Bitdeer AI, CoreWeave, Crusoe, DeepInfra, Dell Enterprise Hub, DigitalOcean, Eigen AI, fal, Fireworks AI, FriendliAI, GMI Cloud, Google Cloud, Lightning AI, Microsoft Foundry, Modal, Nebius Token Factory, Prime Intellect, Simplismart, Together AI et Vultr. Les intégrations de bancs d'essai agent couvrent BlackBox AI, Cline, CrewAI, Factory AI, Hermes Agent, Kilo Code, LangChain Deep Agents, OpenClaw, OpenCode, OpenHands et Pi.
NVIDIA n'a pas publié de prix officiel par token, car le modèle est open source et la tarification est fixée par chaque fournisseur d'inférence. Le signal concurrentiel est le débit. À plus de 300 tokens par seconde sur DeepInfra contre 50 à 100 pour des modèles de taille comparable, le coût effectif par tâche est bien inférieur aux modèles open source comparables, même avant la réduction de 30 % des tokens citée par NVIDIA.
Le changement de licence fait partie de l'histoire. Les publications de Nemotron utilisent désormais OpenMDW-1.1, la licence permissive de la Linux Foundation conçue spécifiquement pour les distributions de modèles IA open source. Elle couvre l'ensemble complet des matériaux du modèle, l'architecture, les paramètres, la documentation, les logiciels et les artefacts connexes, sous un seul cadre, ce qui supprime une grande partie de l'ambiguïté de licence qui ralentit l'évaluation des modèles open source par les entreprises.
Pourquoi ce lancement est important
Trois éléments se démarquent dans ce lancement.
Premièrement, la frontière open source américaine vient de faire un vrai bond en avant. Pendant la majeure partie de l'année écoulée, les modèles open source les plus puissants provenaient de laboratoires chinois, les publications américaines étant en retrait. Nemotron 3 Ultra avec 48 sur l'index d'intelligence est désormais clairement le meilleur modèle open source américain, devant gpt-oss-120b et Gemma 4. Il ne rattrape toujours pas Kimi K2.6, donc la Chine conserve la couronne open source, mais l'écart s'est réduit et NVIDIA est maintenant un acteur sérieux de l'open source, pas seulement un fabricant de puces publiant des modèles de référence.
Deuxièmement, c'est un pari sur la thèse du système de modèles plutôt que sur la thèse du modèle de frontière unique. NVIDIA, Glean et Aible avancent tous le même argument : faire tourner un seul grand modèle pour chaque tâche est inefficace, et l'avenir est un orchestrateur open source puissant confiant le travail routinier à des exécuteurs efficaces et bon marché. Ultra est explicitement conçu comme le meilleur enseignant et planificateur au sommet de cette pile, avec une licence permissive précisément pour que ses sorties puissent entraîner les modèles plus petits en dessous. Si ce modèle s'impose, la valeur se déplace de la possession du meilleur modèle unique vers la possession du système de modèles le plus efficace. Sakana AI vend déjà ce système comme un produit, et notre analyse de Fugu-Ultra v1.1 de Sakana couvre ses scores et son coût.
Troisièmement, l'efficacité est désormais un axe concurrentiel de premier ordre. Nemotron 3 Ultra domine son groupe de pairs non pas parce qu'il est le modèle le plus intelligent dans la pièce, mais parce qu'il accomplit les mêmes tâches agents 5 fois plus vite et 30 % moins cher. À mesure que les flux de travail agents s'allongent et que les factures de tokens augmentent, le coût par tâche accomplie devient le chiffre que les entreprises optimisent réellement, et un modèle optimisé pour cette métrique peut remporter des déploiements même quand il perd les titres de benchmarks.
Pour ceux qui veulent mettre Nemotron 3 Ultra côte à côte avec Claude, GPT, Gemini, DeepSeek et Perplexity sans gérer des GPU ou des abonnements séparés, Fello AI rassemble chaque modèle de frontière dans une seule application native pour Mac, iPhone et iPad. Testez le même prompt sur plusieurs modèles, voyez lequel gère le mieux votre travail, et changez instantanément. Nemotron 3 Ultra est le signe le plus clair à ce jour que les modèles open source se rapprochent de la frontière fermée, et le moyen le plus rapide de ressentir ce progrès est de les comparer vous-même.