El 4 de junio de 2026, NVIDIA lanzó Nemotron 3 Ultra, un modelo de razonamiento open source con 550.000 millones de parámetros diseñado específicamente para agentes de larga duración. Según la plataforma de benchmarks Artificial Analysis, es ahora el modelo open source más capaz salido de un laboratorio estadounidense, con una puntuación de 48 en el Artificial Analysis Intelligence Index. Eso lo sitúa muy por delante de todos los demás modelos open source americanos y lo coloca en lo que Artificial Analysis denomina el cuadrante más atractivo de su gráfico, combinando alta inteligencia con gran velocidad de salida. Microsoft entró en la carrera de modelos propios días antes con su línea MAI en Build.

Nemotron 3 Ultra es un ejemplo destacado de open source AI de un laboratorio estadounidense, con pesos completamente publicados que cualquiera puede descargar desde Hugging Face.

Lo que diferencia a Nemotron 3 Ultra es su objetivo de diseño. NVIDIA no lo construyó para ganar comparaciones de chatbot en un solo turno. Según el blog de NVIDIA, lo creó para orquestar agentes que planifican, llaman a herramientas, delegan en subagentes, leen observaciones y se recuperan de errores a lo largo de cientos de turnos, consumiendo menos tokens que modelos open source comparables. NVIDIA afirma hasta 5 veces mayor rendimiento y hasta un 30 % menor coste en tareas agénticas frente a otros modelos open source de su categoría.

En este artículo repasamos qué es el modelo, las innovaciones arquitectónicas que lo sustentan, el panorama completo de benchmarks, el nuevo método de entrenamiento que usó NVIDIA, la pila de agentes que lo rodea, la disponibilidad real y los precios, y cómo se compara con los modelos open source más potentes de China y la frontera cerrada.

Qué es realmente Nemotron 3 Ultra

Nemotron 3 Ultra es un modelo Mixture of Experts de 550.000 millones de parámetros con aproximadamente 55.000 millones de parámetros activos por token. Esa proporción es la clave. Lleva la capacidad de conocimiento de un modelo muy grande mientras solo paga el coste de inferencia de uno mucho más pequeño, lo que le permite funcionar de forma rápida y económica en comparación con modelos densos o diseños MoE más densos.

El modelo está diseñado para el razonamiento de frontera y la orquestación. En cualquier flujo de trabajo agéntico real, la mayoría de las llamadas son rutinarias, pero un pequeño subconjunto crítico exige un razonamiento más profundo. NVIDIA diseñó Ultra para gestionar esas llamadas difíciles: las que sostienen decisiones arquitectónicas a lo largo de largas sesiones de codificación, sintetizan evidencias contradictorias en cientos de fuentes de investigación o verifican diseños de chips frente a miles de restricciones. El trabajo cotidiano de alto volumen, llamadas a herramientas, validación y ejecución simple, puede delegarse en los modelos más pequeños Nemotron 3 Super y Nano, con Ultra actuando como orquestador.

También es completamente open source en el sentido que más importa. NVIDIA publicó los pesos, el pipeline de datos de entrenamiento y las recetas, todo bajo la permisiva licencia OpenMDW-1.1 de la Linux Foundation. Hay un modelo base, el modelo instruct post-entrenado y una variante cuantizada NVFP4 que reduce el uso de memoria.

El razonamiento es configurable. El modelo admite un modo de pensamiento completo, un modo de esfuerzo medio y un modo sin razonamiento, todos activados a través de la plantilla de chat. También admite un presupuesto de razonamiento estricto, donde estableces un límite de tokens en la traza de pensamiento para que el modelo deje de deliberar y responda una vez alcanzado el límite. Para los desarrolladores de agentes que controlan el gasto en tokens, ese control es una funcionalidad práctica, no un adorno.

Breve historia de Nemotron

Del editor

Todos los modelos de IA en una sola app

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 y más en una sola app nativa para Mac y iPhone.

¡Descárgala ahora!

Nemotron es la familia de modelos open source de NVIDIA, y lleva un par de años construyendo credibilidad en silencio en lugar de perseguir titulares de chatbot.

Los primeros lanzamientos de Nemotron se posicionaron como modelos empresariales personalizables, distribuidos a través del framework NeMo de NVIDIA y dirigidos a empresas que querían hacer fine-tuning y autoalojarse en lugar de llamar a una API cerrada. El argumento siempre fue el mismo: pesos abiertos, datos abiertos cuando era posible, y herramientas para adaptar el modelo a un dominio específico.

La generación Nemotron 3 es donde la familia se volvió genuinamente competitiva. NVIDIA la lanzó como una línea escalonada. Nano es el nivel pequeño, para dispositivos y entornos edge. Super es el caballo de batalla de nivel medio para ejecución de alto volumen. Ultra, el modelo que se trata aquí, ocupa la cima como nivel de razonamiento de frontera y orquestación. Los tres están diseñados para usarse juntos, con el modelo mayor enseñando y coordinando a los más pequeños.

La lógica estratégica detrás de la familia es la economía de tokens. El argumento de NVIDIA, compartido por los socios que construyen sobre los modelos, es que un único modelo de frontera ejecutando cada tarea es un desperdicio. Un sistema de modelos en el que un orquestador potente delega el trabajo rutinario en ejecutores eficientes completa el mismo flujo de trabajo con muchos menos tokens. Ultra es el profesor y planificador más potente de ese sistema y, al ser open source con una licencia permisiva, sus salidas pueden usarse legalmente para post-entrenar los modelos más pequeños Super y Nano, algo que los términos de licencia de la mayoría de los modelos de frontera cerrados prohíben.

La arquitectura

Nemotron 3 Ultra no es un transformer estándar. NVIDIA combinó varias ideas arquitectónicas para mejorar el equilibrio entre eficiencia y precisión a su favor.

Transformer híbrido Mamba. El modelo intercala capas Mamba-2 con capas de atención. Las capas Mamba procesan secuencias largas con mucha más eficiencia que la atención, lo que hace que la ventana de contexto de 1 millón de tokens sea práctica. Las capas de atención del transformer se mantienen donde importan, preservando la recuperación precisa para que el modelo pueda extraer hechos específicos de una ventana de contexto muy grande. Este híbrido es la clave de por qué Ultra puede ejecutar cargas de trabajo de agentes en contextos largos sin que el coste se dispare.

LatentMoE. En lugar de enrutar tokens a expertos en la dimensión oculta completa, Ultra proyecta primero los tokens en una dimensión latente más pequeña y luego los enruta. Esto hace que el enrutamiento de expertos sea más eficiente y permite que un único modelo gestione una mezcla de razonamiento, generación de código, llamadas a herramientas y lógica específica de dominio sin la sobrecarga de enrutamiento que incurriría un MoE convencional.

Predicción multitóken. MTP permite al modelo predecir varios tokens futuros en un único pase hacia adelante usando cabezas de predicción de pesos compartidos. Esto acelera la generación directamente y le da al modelo decodificación especulativa nativa, para que los despliegues puedan adelantarse y verificar, reduciendo la latencia en salidas largas y flujos de trabajo de múltiples turnos.

Precisión NVFP4. Este es uno de los detalles prácticos más interesantes. El mismo checkpoint NVFP4 funciona en las GPU NVIDIA Hopper, Blackwell y Ampere, por lo que los desarrolladores usan un único checkpoint en lugar de mantener compilaciones separadas por arquitectura. NVIDIA afirma que NVFP4 entrega hasta 5 veces mayor rendimiento por GPU con la misma interactividad en comparación con BF16 en Blackwell. El modelo se pre-entrenó con un enfoque consciente de la cuantización, por lo que el checkpoint de baja precisión mantiene la exactitud.

En cuanto al hardware, un despliegue en un solo nodo necesita 8 GPU B200 con aproximadamente 1,5 TB de memoria agregada. Las configuraciones multinodo funcionan con 8 o más GPU H100, H200, GB200 o GB300. El modelo incluye recetas de despliegue para vLLM, SGLang y TensorRT-LLM, aunque TensorRT-LLM está actualmente limitado a Blackwell.

Resultados en benchmarks

NVIDIA publicó una comparación directa con tres de los modelos open source más potentes disponibles: GLM 5.1 (744B, ahora sucedido por GLM 5.2), Kimi K2.6 (1T) y Qwen3.5 (397B). El patrón es que Nemotron 3 Ultra lidera en productividad agéntica, seguimiento de instrucciones y contexto largo, mientras queda por detrás en codificación pura y planificación a largo plazo. Ese mismo modelo base Qwen3.5-397B también impulsa Nex-N2-Pro, un modelo open-weight independiente ajustado específicamente para codificación agéntica. Moonshot ha lanzado desde entonces Kimi K2.7 Code, el sucesor del modelo K2.6 de esa comparación.

BenchmarkNemotron 3 Ultra (550B)GLM 5.1 (744B)Kimi K2.6 (1T)Qwen3.5 (397B)
Agent Productivity (PinchBench)91%84%91%89%
Long horizon Planning (EnterpriseOps-Gym)33%40%29%30%
Coding (Terminal-Bench 2.0)54%64%67%53%
Instruction Following (IFBench)82%77%74%78%
Knowledge Work (GDPVal-AA)1,4481,5941,5081,192
Professional Work (ProfBench Search)56%46%56%53%
Long Context (Ruler @1M)95%N/A (max 256K)N/A (max 256K)90%

El punto destacado es el contexto largo. Ultra mantiene un 95 % en Ruler con 1 millón de tokens, mientras que GLM 5.1 y Kimi K2.6 tienen un límite de 256K y no pueden ejecutar la prueba. Para cargas de trabajo agénticas que necesitan mantener en contexto una base de código amplia, un largo corpus de investigación o un historial de conversación extenso, esto es una ventaja estructural real.

La tarjeta del modelo añade un conjunto de benchmarks más completo de las evaluaciones propias de NVIDIA:

  • SWE-Bench Verified: 71,9, con puntuaciones consistentes de entre 65 y 70,4 en los frameworks Pi, OpenHands, Hermes, OpenCode y Mini SWE Agent
  • SWE-Bench Multilingual: 67,7
  • Terminal Bench 2.1: 56,4
  • BrowseComp: 44,4
  • LiveCodeBench v6: 89,0
  • IOI 2025: 570,0
  • IMOAnswerBench: 88,6 sin herramientas, 92,3 con herramientas
  • MMLU-Pro: 86,8
  • RULER at 1M: 94,7
  • LongBench v2: 61,9
  • MMLU-ProX en 10 idiomas: 83,0

La consistencia de los frameworks en SWE-Bench merece destacarse. Un modelo que puntúa entre 65 y 70,4 independientemente de qué framework agéntico lo ejecute es más fiable en producción que uno que solo destaca en una única configuración ajustada. Para los desarrolladores de agentes, el comportamiento predecible entre frameworks importa tanto como una puntuación máxima.

En el Artificial Analysis Intelligence Index más amplio, Nemotron 3 Ultra obtiene 48. Eso lo convierte en el modelo open source americano más capaz, por delante de Gemma 4 31B (39), Nemotron 3 Super (36) y gpt-oss-120b (33). No alcanza al modelo open source más potente de China, Kimi K2.6, que se sitúa en 54, y el líder de la frontera cerrada Opus 4.8 está aún más adelante con 61.

Velocidad y eficiencia de costes

La precisión es solo la mitad del argumento. La otra mitad es el rendimiento y el coste, y aquí es donde Nemotron 3 Ultra presenta su caso más sólido.

NVIDIA afirma un rendimiento 5 veces superior al de otros modelos open source de su categoría, y los números independientes respaldan esa dirección. En el proveedor DeepInfra, Artificial Analysis midió que Nemotron 3 Ultra entrega más de 300 tokens por segundo, mientras que modelos de tamaño comparable de DeepSeek o Moonshot actualmente gestionan solo 50 a 100. Es una brecha considerable, y proviene de la combinación del bajo recuento de parámetros activos, la precisión NVFP4, el híbrido Mamba y la predicción multitóken trabajando juntos.

En cuanto al coste, NVIDIA ejecutó el modelo en SWE-Bench y Terminal Bench 2.0 y comprobó que completaba los benchmarks usando menos tokens totales y menos tokens por turno que los modelos comparables, reduciendo el coste por tarea completada hasta en un 30 %. Para agentes de larga duración que llaman al modelo miles de veces para terminar un flujo de trabajo, una reducción del 30 % en tokens se traduce en una diferencia de factura significativa.

Este enfoque en la eficiencia es la razón de ser del modelo. A medida que los flujos de trabajo agénticos se alargan, el recuento de tokens crece rápidamente, porque cada plan, llamada a herramienta, invocación de subagente y paso de razonamiento vuelve a introducirse en el modelo. La apuesta de NVIDIA es que los laboratorios y empresas que ejecutan estos flujos de trabajo se preocupan más por el coste por tarea completada que por un único número de benchmark, y Ultra está ajustado para esa métrica.

Estadísticas de Nemotron según Artificialanalysis.ai

Destilación Multi-Teacher On-Policy (MOPD)

La pieza más novedosa del pipeline de entrenamiento es un método que NVIDIA denomina Multi Teacher On Policy Distillation, o MOPD.

En MOPD, el modelo Ultra aprende de más de 10 modelos maestros especializados mientras genera sus propios intentos durante el entrenamiento. Cada maestro se entrena con su propio pipeline específico de dominio, cubriendo áreas como codificación, matemáticas, búsqueda, trabajo de oficina y llamadas a herramientas. A medida que el modelo estudiante genera rollouts en estos dominios, el maestro correspondiente lo evalúa en su área de especialización y devuelve una señal de recompensa densa. Así, un rollout de codificación es calificado por el maestro de codificación, un rollout de matemáticas por el maestro de matemáticas, y así sucesivamente.

Dos decisiones de diseño hacen esto eficiente. En primer lugar, todo el bucle se ejecuta de forma asíncrona, con la generación de rollouts del estudiante, la evaluación por los maestros y la optimización del estudiante completamente canalizadas para que ninguna etapa espere a otra. En segundo lugar, el proceso es iterativo. Tras producir un checkpoint entrenado con MOPD, NVIDIA inicializa nuevas rondas de entrenamiento de maestros desde el estudiante actualizado y luego fusiona esas mejoras en la siguiente etapa de MOPD. El estudiante y los maestros coevolucionan, lo que permite que la capacidad siga creciendo en todos los dominios en lugar de estancarse.

La lista de maestros es en sí misma notable, porque la tarjeta del modelo indica qué modelos contribuyeron. Incluye variantes de Qwen3, DeepSeek V3, R1 y V4-Pro, GPT-OSS-120B, GLM-5 y GLM-4.7, variantes de Mistral y phi-4. En otras palabras, NVIDIA destiló a partir de un amplio conjunto de modelos open source potentes, lo cual es legalmente correcto porque Ultra es en sí un modelo open source con licencia permisiva y esos maestros lo permiten.

Las etapas anteriores son más convencionales. El pre-entrenamiento se ejecuta sobre aproximadamente 20 billones de tokens con un corte de septiembre de 2025 usando Megatron-LM. El ajuste fino supervisado, con un corte de mayo de 2026, se centra en código, matemáticas, ciencia, llamadas a herramientas y seguimiento de instrucciones. El aprendizaje por refuerzo usa GRPO asíncrono en entornos de matemáticas, código, ciencia y uso de herramientas en múltiples pasos, construido sobre NeMo RL y NeMo Gym. MOPD se sitúa encima como refinamiento final, y NVIDIA ha publicado la receta MOPD a través de NeMo-RL para que otros puedan reproducirla.

Datos de entrenamiento y transparencia

NVIDIA apuesta fuerte por la transparencia de datos como punto de venta, algo que importa especialmente para compradores empresariales y de IA soberana que necesitan saber de dónde provienen los datos de entrenamiento.

Sobre su base de pre-entrenamiento existente, Nemotron 3 Ultra añadió 212.000 millones de nuevos tokens dirigidos a tres brechas de dominio específicas:

  • 4.000 millones de tokens de datos legales sintéticos, que elevaron el promedio proxy de LegalBench del 64,6 % al 74,7 %
  • 35.000 millones de tokens de datos sintetizados basados en Wikipedia, que impulsaron el proxy SimpleQA del 40,2 % al 50,2 %
  • 173.000 millones de tokens de GitHub actualizados hasta el 30 de septiembre de 2025

En el lado del post-entrenamiento, este lanzamiento publicó 10 millones de nuevas muestras de ajuste fino supervisado, 1 millón de nuevas tareas de RL en múltiples dominios y 15 nuevos entornos de RL. Eso eleva los totales acumulados de Nemotron open source a 50 millones de muestras SFT, 2 millones de tareas de RL y 55 entornos de RL. El corpus de entrenamiento completo que reporta la tarjeta del modelo es de aproximadamente 14,8 billones de tokens en 226 conjuntos de datos, una mezcla de fuentes públicas, datos web y de código rastreados, y datos sintéticos generados por modelos maestros.

Publicar los entornos de RL y los datos SFT es lo que separa esto de una publicación típica de pesos abiertos. Cualquiera puede hacer fine-tuning de Ultra para su propio dominio usando LoRA, SFT completo o aprendizaje por refuerzo a través de las librerías NeMo, y NVIDIA incluye recetas para cada uno, incluyendo configuraciones específicas para H100 y GB200.

La pila de agentes alrededor del modelo

Nemotron 3 Ultra no se lanza como un modelo desnudo. NVIDIA lo publicó junto a una pila de referencia para ejecutar agentes autónomos de forma más segura.

Hermes Agent y OpenClaw son los frameworks de agentes, que proporcionan los bucles de orquestación, la memoria y las herramientas para flujos de trabajo de múltiples turnos. Hermes Agent cuenta ahora con soporte oficial para Nemotron. NVIDIA OpenShell, en vista previa anticipada como parte del NVIDIA Agent Toolkit, es el entorno de ejecución seguro donde los agentes autónomos y su código generado se ejecutan realmente. NVIDIA NemoClaw es el plano open source que lo une todo, instalando el entorno de ejecución OpenShell con un solo comando para que agentes como Hermes puedan ejecutarse junto a modelos open source en un entorno aislado.

La adopción ya se refleja en los socios. La empresa de IA empresarial Glean añadió Nemotron 3 Ultra a su plataforma, citando que el modelo ofrece el 91 % de la completitud de los LLM de frontera al perfil de coste de un modelo open source, y posicionándolo como la opción rentable para el trabajo empresarial cotidiano en su línea de más de 30 modelos. El propio modelo de búsqueda agéntica de Glean, Waldo, está post-entrenado en el Nemotron 3 Nano más pequeño y reporta una latencia un 50 % menor y un 25 % menos de tokens, que es exactamente el patrón de sistema de modelos que NVIDIA promueve.

Aible, un proveedor de agentes empresariales, realizó un hackathon conjunto con el equipo NemoClaw de NVIDIA comparando Nemotron 3 Ultra con otro modelo de razonamiento líder en una tarea idéntica de OpenClaw dentro de OpenShell. La tarea requería que el agente encontrara el subagente correcto, identificara el conjunto de datos adecuado, ejecutara el análisis, publicara el resultado en Slack y guardara el plan para reutilizarlo. Aible informó de que Ultra planificó de forma más directa, retrocedió menos, fue el primero en publicar en Slack, siguió cada parte de la instrucción en el primer intento y guardó con éxito el plan ejecutado para su reutilización determinista, mientras que el modelo de comparación omitió una instrucción y falló en su primera llamada a Slack. Los benchmarks de los proveedores siempre merecen cierta cautela, pero el resultado es coherente con las sólidas puntuaciones del modelo en PinchBench e IFBench.

Si quieres comparar Nemotron 3 Ultra con la frontera cerrada sin necesidad de gestionar infraestructura de GPU, Fello AI te ofrece Claude, GPT, Gemini, DeepSeek, Perplexity y más en una sola app nativa para Mac, iPhone e iPad. Una suscripción, todos los modelos de frontera, sin malabarismos entre cuentas separadas.

Dos modelos más en el lanzamiento

NVIDIA lanzó dos modelos Nemotron adicionales junto a Ultra, ambos orientados a hacer que los sistemas de agentes sean más seguros y capaces.

Nemotron 3.5 Content Safety es un modelo de guardarraíl open source de 4.000 millones de parámetros para clasificar contenido no seguro, no permitido o que viola políticas en texto, imágenes y entradas combinadas. Cubre 23 categorías de seguridad y 12 idiomas, y puede funcionar como guardarraíl en tiempo de inferencia, como juez para pruebas de seguridad de LLM o como base para post-entrenar modelos más seguros usando su conjunto de datos adjunto. Admite políticas personalizadas y produce trazas de razonamiento, para que las empresas puedan auditar por qué se tomó una clasificación determinada y adaptar las reglas a su propio dominio.

Nemotron 3.5 ASR es un modelo de reconocimiento de voz para agentes nativos de voz. Usa una arquitectura de transmisión consciente de la caché para procesar deltas de audio al instante, alcanzando una latencia inferior a 100 milisegundos para voz en tiempo real. NVIDIA señala que el predecesor en inglés ya impulsa la función de entrada de voz en Microsoft GitHub Copilot CLI, usado por más de 20 millones de desarrolladores, y un benchmark independiente de más de 50 configuraciones de ASR en dispositivo identificó este modelo como el candidato más sólido para transmisión de inglés en tiempo real en hardware con restricciones. La versión 3.5 extiende esa misma arquitectura a más de 40 idiomas en un único checkpoint.

Dónde Nemotron 3 Ultra se queda corto

Los benchmarks dejan claras las brechas, y NVIDIA no las oculta.

Codificación pura. En Terminal-Bench 2.0, Ultra obtiene un 54 %, muy por detrás de GLM 5.1 con un 64 % y Kimi K2.6 con un 67 %. Sus cifras en SWE-Bench Verified son sólidas y consistentes, pero en el benchmark de codificación en terminal más exigente es el modelo más débil del grupo. Para el rendimiento puro de generación de código, los modelos open source chinos más grandes lideran actualmente.

Planificación a largo plazo. En EnterpriseOps-Gym, Ultra obtiene un 33 %, por detrás de GLM 5.1 con un 40 %. Para las tareas de planificación en múltiples pasos más largas y complejas, no es el modelo open source líder. Esta es una advertencia notable dado que el modelo se comercializa para agentes de larga duración, aunque vale la pena señalar que estas puntuaciones son bajas en todos los modelos, lo que dice más sobre la dificultad del benchmark que sobre cualquier modelo en particular.

Techo en trabajo de conocimiento. En GDPVal-AA, Ultra obtiene 1.448 frente a GLM 5.1 con 1.594 y Kimi K2.6 con 1.508. En trabajo de conocimiento amplio queda por detrás de los modelos más grandes, que es el intercambio esperado para un modelo con muchos menos parámetros totales y activos.

No es la frontera absoluta. Con 48 en el Artificial Analysis Intelligence Index, Ultra es el mejor modelo open source americano, pero Kimi K2.6 con 54 y el cerrado Opus 4.8 con 61 van claramente por delante en inteligencia bruta. El argumento es el valor y la eficiencia, no encabezar el ranking.

Una lectura honesta: Nemotron 3 Ultra gana en los ejes que NVIDIA optimizó (productividad agéntica, seguimiento de instrucciones, contexto largo, velocidad y coste) y queda por detrás en los que sacrificó (codificación pura, planificación profunda y conocimiento máximo).

Cómo se compara

CapacidadNemotron 3 UltraKimi K2.6GLM 5.1Opus 4.8
Total parameters550B1T744Bclosed
Active parameters55Blargerlargerclosed
AA Intelligence Index4854not listed61
Agent productivity (PinchBench)91%91%84%not listed
Instruction following (IFBench)82%74%77%not listed
Coding (Terminal-Bench 2.0)54%67%64%not listed
Long context1M tokens (95% Ruler)256K max256K maxlarge
Output speed300+ tok/s50 to 100 tok/svariesclosed
Open weightsyes, OpenMDW-1.1yesyesno

El perfil de la comparación es consistente. Frente a Kimi K2.6 y GLM 5.1, Nemotron 3 Ultra es el modelo más pequeño, rápido y económico que iguala o supera en productividad agéntica, seguimiento de instrucciones y contexto largo, mientras cede en codificación pura e inteligencia máxima. Tiene aproximadamente la mitad de parámetros que GLM 5.1 y bastante menos de la mitad que Kimi K2.6, sin embargo empata con el Kimi de un billón de parámetros en PinchBench y es de tres a seis veces más rápido en rendimiento.

Frente a la frontera cerrada, la brecha es real pero la propuesta de valor es diferente. Opus 4.8 con 61 en el índice de inteligencia es el razonador más potente, pero es una API cerrada que no puedes autoalojar, ajustar libremente ni usar para entrenar tus propios modelos más pequeños. La descripción de Glean, el 91 % de la completitud de la frontera al coste de un modelo open source, captura la decisión real a la que se enfrentan la mayoría de las empresas. Para el 9 % crítico de tareas lo enrutas a la frontera; para el rutinario 91 % ejecutas un modelo open source como Ultra y ahorras el gasto.

Para cargas de trabajo en chino y codificación pura, los modelos open source chinos más grandes siguen teniendo ventaja. Para flujos de trabajo agénticos en inglés donde dominan el coste, la velocidad y la fiabilidad del uso de herramientas, Ultra es la opción más práctica.

Disponibilidad y precios

Nemotron 3 Ultra está disponible ahora mismo a través de un amplio conjunto de canales, una cobertura inusual para un modelo open source en el día de su lanzamiento.

Puedes probarlo en Perplexity con una suscripción Pro o a través de su API, y acceder a él mediante OpenRouter, Anaconda o build.nvidia.com. Los pesos se pueden descargar desde Hugging Face, tanto en variantes BF16 como NVFP4, y el modelo está disponible como microservicio NVIDIA NIM para autoalojamiento optimizado.

La lista de proveedores de nube e inferencia es larga: AWS JumpStart, Amazon EKS, Baseten, Bitdeer AI, CoreWeave, Crusoe, DeepInfra, Dell Enterprise Hub, DigitalOcean, Eigen AI, fal, Fireworks AI, FriendliAI, GMI Cloud, Google Cloud, Lightning AI, Microsoft Foundry, Modal, Nebius Token Factory, Prime Intellect, Simplismart, Together AI y Vultr. Las integraciones con frameworks de agentes incluyen BlackBox AI, Cline, CrewAI, Factory AI, Hermes Agent, Kilo Code, LangChain Deep Agents, OpenClaw, OpenCode, OpenHands y Pi.

NVIDIA no ha publicado un precio oficial por token, ya que el modelo es open source y los precios los establece cada proveedor de inferencia. La señal competitiva es el rendimiento. Con más de 300 tokens por segundo en DeepInfra frente a 50-100 en modelos de tamaño similar, el coste efectivo por tarea queda muy por debajo de los modelos open source comparables, incluso antes de la reducción del 30 % en tokens que cita NVIDIA.

El cambio de licencia forma parte de la historia. Las publicaciones de Nemotron ahora se distribuyen bajo OpenMDW-1.1, la licencia permisiva de la Linux Foundation construida específicamente para distribuciones de modelos de IA abiertos. Cubre el conjunto completo de materiales del modelo (arquitectura, parámetros, documentación, software y artefactos relacionados) bajo un único marco, lo que elimina gran parte de la ambigüedad de licencias que ralentiza la evaluación empresarial de los modelos open source.

Por qué importa este lanzamiento

Tres cosas destacan de este lanzamiento.

Primero, la frontera open source estadounidense acaba de dar un paso real hacia adelante. Durante la mayor parte del último año, los modelos open source más potentes provenían de laboratorios chinos, con las publicaciones open source americanas rezagadas. Nemotron 3 Ultra con 48 en el índice de inteligencia es ahora claramente el mejor modelo open source americano, por delante de gpt-oss-120b y Gemma 4. Sigue sin alcanzar a Kimi K2.6, por lo que China mantiene la corona open source, pero la brecha se ha reducido y NVIDIA es ahora un jugador serio en modelos open source, no solo un fabricante de chips que publica modelos de referencia.

Segundo, esta es una apuesta por la tesis del sistema de modelos frente a la del único modelo de frontera. NVIDIA, Glean y Aible hacen el mismo argumento: ejecutar un único modelo gigante para cada tarea es un desperdicio, y el futuro es un orquestador open source potente que delega el trabajo rutinario en ejecutores eficientes y económicos. Ultra está diseñado explícitamente como el profesor y planificador en lo alto de esa pila, con una licencia permisiva precisamente para que sus salidas puedan entrenar a los modelos más pequeños por debajo. Si ese patrón gana, el valor se desplaza de poseer el mejor modelo único a poseer el sistema de modelos más eficiente. Sakana AI ya vende ese sistema como producto, y nuestro análisis de Sakana's Fugu-Ultra v1.1 detalla su puntuación y coste.

Tercero, la eficiencia es ahora un eje competitivo de primer nivel. Nemotron 3 Ultra lidera su grupo de referencia no por ser el modelo más inteligente, sino por completar las mismas tareas agénticas 5 veces más rápido y un 30 % más barato. A medida que los flujos de trabajo agénticos se alargan y las facturas de tokens crecen, el coste por tarea completada se convierte en el número que las empresas optimizan realmente, y un modelo ajustado para esa métrica puede ganar despliegues aunque pierda titulares de benchmarks.

Para quien quiera comparar Nemotron 3 Ultra con Claude, GPT, Gemini, DeepSeek y Perplexity sin gestionar GPU ni suscripciones separadas, Fello AI reúne todos los modelos de frontera en una sola app nativa para Mac, iPhone e iPad. Prueba el mismo prompt en varios modelos, descubre cuál gestiona mejor tu trabajo y cambia al instante. Nemotron 3 Ultra es la señal más clara hasta ahora de que los modelos open source se están acercando a la frontera cerrada, y la forma más rápida de sentir ese progreso es compararlos tú mismo.