A 4 de junho de 2026, a NVIDIA lançou o Nemotron 3 Ultra, um modelo de raciocínio totalmente aberto com 550 mil milhões de parâmetros, construído especificamente para agentes de longa duração. Segundo a plataforma de benchmarks Artificial Analysis, é agora o modelo aberto mais capaz a sair de um laboratório dos EUA, com uma pontuação de 48 no Artificial Analysis Intelligence Index. Isso coloca-o muito à frente de todos os outros modelos americanos abertos e insere-o no que a Artificial Analysis chama o quadrante mais atrativo do seu gráfico, combinando alta inteligência com velocidade de saída rápida. A Microsoft entrou na corrida de modelos internos dias antes com a sua linha MAI no Build.

O Nemotron 3 Ultra é um exemplo emblemático de IA open source de um laboratório dos EUA, com pesos totalmente publicados que qualquer pessoa pode descarregar do Hugging Face.

O que torna o Nemotron 3 Ultra diferente é o objetivo de design. A NVIDIA não o construiu para vencer comparações de chatbot de turno único. Segundo o blogue da NVIDIA, construiu-o para orquestrar agentes que planeiam, chamam ferramentas, delegam a sub-agentes, leem observações e recuperam de erros ao longo de centenas de turnos, consumindo menos tokens do que modelos abertos comparáveis. A NVIDIA afirma até 5 vezes mais throughput e até 30% menos custo para completar tarefas agênticas do que outros modelos abertos da sua classe.

Neste artigo percorremos o que o modelo realmente é, as inovações de arquitetura por trás dele, o quadro completo de benchmarks, o novo método de treino utilizado pela NVIDIA, o stack de agente que o rodeia, a disponibilidade real e os preços, e como se compara com os modelos abertos mais fortes da China e com a fronteira fechada.

O Que o Nemotron 3 Ultra Realmente É

O Nemotron 3 Ultra é um modelo Mixture of Experts com 550 mil milhões de parâmetros e cerca de 55 mil milhões de parâmetros ativos por token. Esse rácio é o destaque. Transporta a capacidade de conhecimento de um modelo muito grande enquanto paga apenas o custo de inferência de um muito menor, o que lhe permite correr rápido e barato em comparação com modelos densos ou designs MoE mais densos.

O modelo foi construído para raciocínio frontier e orquestração. Dentro de qualquer fluxo de trabalho de agente real, a maioria das chamadas é de rotina, mas um subconjunto crítico pequeno exige raciocínio mais aprofundado. A NVIDIA concebeu o Ultra para lidar com essas chamadas difíceis, as que sustentam decisões arquiteturais ao longo de longas sessões de codificação, sintetizam evidências contraditórias de centenas de fontes de investigação, ou verificam designs de chips contra milhares de restrições. O trabalho quotidiano de alto volume, chamadas de ferramentas, validação, execução simples, pode ser delegado a modelos Nemotron 3 Super e Nano menores, com o Ultra a agir como orquestrador.

É também totalmente aberto da forma que mais importa. A NVIDIA lançou os pesos, o pipeline de dados de treino e as receitas, todos sob a licença permissiva OpenMDW-1.1 da Linux Foundation. Há um modelo base, o modelo instruct pós-treinado, e uma variante quantizada NVFP4 que reduz a pegada de memória.

O raciocínio é configurável. O modelo suporta um modo de raciocínio completo, um modo de esforço médio e um modo sem raciocínio, todos alternados através do template de conversa. Suporta também um orçamento de raciocínio rígido, onde define um teto de tokens no traço de pensamento para que o modelo pare de deliberar e responda ao atingir o limite. Para construtores de agentes atentos ao gasto em tokens, esse controlo é uma funcionalidade prática, não um artifício.

Uma Breve História do Nemotron

Do editor

Todos os modelos de IA numa só aplicação

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 e mais numa só aplicação nativa para Mac e iPhone.

Descarregue já!

O Nemotron é a família de modelos abertos da NVIDIA, e tem vindo a construir credibilidade silenciosamente há alguns anos, em vez de perseguir manchetes de chatbot.

Os primeiros lançamentos do Nemotron foram posicionados como modelos empresariais personalizáveis, distribuídos através do framework NeMo da NVIDIA e direcionados a empresas que queriam fazer ajuste fino e alojar em servidor próprio em vez de chamar uma API fechada. O argumento era sempre o mesmo: pesos abertos, dados abertos onde possível, e ferramentas para adaptar o modelo a um domínio específico.

A geração Nemotron 3 é onde a família se tornou genuinamente competitiva. A NVIDIA lançou-a como uma linha em camadas. O Nano é o nível pequeno, para dispositivo e extremidade. O Super é o motor de nível médio para execução de alto volume. O Ultra, o modelo abordado aqui, situa-se no topo como nível de raciocínio frontier e orquestração. Os três foram concebidos para serem usados em conjunto, com o modelo maior a ensinar e coordenar os menores.

A lógica estratégica por trás da família é a economia de tokens. O argumento da NVIDIA, ecoado por parceiros que constroem sobre os modelos, é que um único modelo frontier a executar todas as tarefas é desperdiçador. Um sistema de modelos, onde um orquestrador forte delega trabalho de rotina a executores eficientes, completa o mesmo fluxo de trabalho com muito menos tokens. O Ultra é o professor e planeador mais forte nesse sistema, e como é aberto com uma licença permissiva, as suas saídas podem legalmente ser usadas para pós-treinar os modelos Super e Nano menores, algo que os termos de licença da maioria dos modelos frontier fechados proibem.

A Arquitetura

O Nemotron 3 Ultra não é um transformer padrão. A NVIDIA combinou várias ideias arquiteturais para empurrar o equilíbrio eficiência-precisão a seu favor.

Transformer Mamba híbrido. O modelo intercala camadas Mamba-2 com camadas de atenção. As camadas Mamba processam sequências longas muito mais eficientemente do que a atenção, o que torna a janela de contexto de 1 milhão de tokens prática. As camadas de atenção do transformer são mantidas onde importam, preservando a recuperação precisa para que o modelo possa recuperar factos específicos de uma janela de contexto muito grande. Este híbrido é o núcleo de por que o Ultra consegue executar cargas de trabalho de agente de contexto longo sem que o custo exploda.

LatentMoE. Em vez de encaminhar tokens para especialistas na dimensão escondida completa, o Ultra projeta os tokens numa dimensão latente menor primeiro, depois encaminha. Isso torna o encaminhamento de especialistas mais eficiente e permite que um único modelo lide com uma mistura de raciocínio, geração de código, chamadas de ferramentas e lógica específica de domínio sem a sobrecarga de encaminhamento que um MoE convencional incorreria.

Previsão multi-token. A MTP permite que o modelo preveja vários tokens futuros num único passo forward usando cabeças de previsão de peso partilhado. Isso acelera diretamente a geração e dá ao modelo descodificação especulativa nativa, para que as implementações possam fazer rascunho antecipado e verificar, reduzindo a latência em saídas longas e fluxos de trabalho de múltiplos turnos.

Precisão NVFP4. Este é um dos detalhes práticos mais interessantes. O mesmo checkpoint NVFP4 corre em GPUs NVIDIA Hopper, Blackwell e Ampere, pelo que os programadores usam um checkpoint em todo o lado em vez de manter builds separados por arquitetura. A NVIDIA diz que o NVFP4 oferece até 5 vezes mais throughput por GPU com a mesma interatividade em comparação com BF16 no Blackwell. O modelo foi pré-treinado com uma abordagem consciente de quantização para que o checkpoint de baixa precisão mantenha a precisão.

Em hardware, uma implementação de nó único necessita de 8 GPUs B200 com cerca de 1,5 TB de memória agregada. Configurações multi-nó correm em 8 ou mais GPUs H100, H200, GB200 ou GB300. O modelo é fornecido com receitas de implementação para vLLM, SGLang e TensorRT-LLM, estando o TensorRT-LLM atualmente limitado ao Blackwell.

Resultados de Benchmark

A NVIDIA publicou uma comparação direta com três dos modelos abertos mais fortes disponíveis: GLM 5.1 (744B, agora sucedido pelo GLM 5.2), Kimi K2.6 (1T) e Qwen3.5 (397B). O padrão é que o Nemotron 3 Ultra lidera em produtividade de agente, seguimento de instruções e contexto longo, enquanto fica atrás em codificação bruta e planeamento de longo horizonte. Essa mesma base Qwen3.5-397B também alimenta o Nex-N2-Pro, um modelo de pesos abertos separado ajustado especificamente para codificação agêntica. A Moonshot desde então lançou o Kimi K2.7 Code, o sucessor do modelo K2.6 nessa comparação.

BenchmarkNemotron 3 Ultra (550B)GLM 5.1 (744B)Kimi K2.6 (1T)Qwen3.5 (397B)
Produtividade de Agente (PinchBench)91%84%91%89%
Planeamento de longo horizonte (EnterpriseOps-Gym)33%40%29%30%
Codificação (Terminal-Bench 2.0)54%64%67%53%
Seguimento de instruções (IFBench)82%77%74%78%
Trabalho de conhecimento (GDPVal-AA)1.4481.5941.5081.192
Trabalho profissional (ProfBench Search)56%46%56%53%
Contexto longo (Ruler @1M)95%N/A (máx 256K)N/A (máx 256K)90%

O destaque é o contexto longo. O Ultra mantém 95% no Ruler a 1 milhão de tokens, enquanto o GLM 5.1 e o Kimi K2.6 ficam pelos 256K de contexto e não conseguem executar o teste de todo. Para cargas de trabalho de agente que precisam de manter uma grande base de código, um longo corpus de investigação ou um extenso histórico de conversa em contexto, esta é uma vantagem estrutural real.

O model card acrescenta um conjunto de benchmarks mais aprofundado das próprias avaliações da NVIDIA:

  • SWE-Bench Verified: 71,9, com pontuações consistentes de 65 a 70,4 nos harnesses Pi, OpenHands, Hermes, OpenCode e Mini SWE Agent
  • SWE-Bench Multilingual: 67,7
  • Terminal Bench 2.1: 56,4
  • BrowseComp: 44,4
  • LiveCodeBench v6: 89,0
  • IOI 2025: 570,0
  • IMOAnswerBench: 88,6 sem ferramentas, 92,3 com ferramentas
  • MMLU-Pro: 86,8
  • RULER a 1M: 94,7
  • LongBench v2: 61,9
  • MMLU-ProX em 10 línguas: 83,0

A consistência entre frameworks no SWE-Bench merece nota. Um modelo que pontua entre 65 e 70,4 independentemente do harness de agente que o executa é mais fiável em produção do que um que apenas se destaca num único setup ajustado. Para construtores de agentes, o comportamento previsível entre harnesses importa tanto quanto uma pontuação de pico.

No Artificial Analysis Intelligence Index mais abrangente, o Nemotron 3 Ultra pontua 48. Isso torna-o o modelo aberto dos EUA mais capaz, à frente do Gemma 4 31B (39), Nemotron 3 Super (36) e gpt-oss-120b (33). Não alcança o modelo aberto mais forte da China, o Kimi K2.6 com 54, e o líder frontier fechado Opus 4.8 está mais à frente com 61.

Velocidade e Eficiência de Custo

A precisão é apenas metade do argumento. A outra metade é o throughput e o custo, e é aqui que o Nemotron 3 Ultra apresenta o seu argumento mais forte.

A NVIDIA afirma 5 vezes mais throughput do que outros modelos abertos da sua classe, e os números independentes apoiam a direção. No fornecedor DeepInfra, a Artificial Analysis mediu o Nemotron 3 Ultra a entregar mais de 300 tokens por segundo, enquanto modelos de tamanho comparável do DeepSeek ou Moonshot gerem atualmente apenas 50 a 100. Isso é uma diferença grande, e resulta da combinação da contagem baixa de parâmetros ativos, precisão NVFP4, o híbrido Mamba e a previsão multi-token a trabalharem em conjunto.

No custo, a NVIDIA executou o modelo no SWE-Bench e Terminal Bench 2.0 e concluiu que completou os benchmarks usando menos tokens totais e menos tokens por turno do que modelos comparáveis, reduzindo o custo de conclusão de tarefas em até 30%. Para agentes de longa duração que chamam o modelo milhares de vezes para terminar um fluxo de trabalho, uma redução de 30% nos tokens traduz-se numa diferença de fatura significativa.

Este enquadramento de eficiência é a razão de ser do modelo. À medida que os fluxos de trabalho de agente ficam mais longos, as contagens de tokens crescem rapidamente, porque cada plano, chamada de ferramenta, invocação de sub-agente e passo de raciocínio é passado de volta para o modelo. A aposta da NVIDIA é que os laboratórios e empresas que executam estes fluxos de trabalho se preocupam mais com o custo por tarefa concluída do que com um número de benchmark único, e o Ultra é ajustado para essa métrica.

Estatísticas do Nemotron segundo Artificialanalysis.ai

Destilação On-Policy Multi-Professor

A peça mais nova do pipeline de treino é um método que a NVIDIA chama Multi Teacher On Policy Distillation, ou MOPD.

No MOPD, o modelo Ultra aprende com mais de 10 modelos professores especializados enquanto gera as suas próprias tentativas durante o treino. Cada professor é treinado com o seu próprio pipeline específico de domínio, cobrindo áreas como codificação, matemática, pesquisa, trabalho de escritório e chamadas de ferramentas. À medida que o modelo estudante gera rollouts nesses domínios, o professor correspondente avalia-o na sua área de especialidade e fornece um sinal de recompensa denso. Assim, um rollout de codificação é avaliado pelo professor de codificação, um rollout de matemática pelo professor de matemática, e assim por diante.

Duas escolhas de design tornam isto eficiente. Primeiro, todo o ciclo corre de forma assíncrona, com geração de rollout do estudante, avaliação do professor e otimização do estudante totalmente em pipeline para que nenhuma fase fique à espera de outra. Segundo, o processo é iterativo. Depois de produzir um checkpoint treinado com MOPD, a NVIDIA inicializa novas rondas de treino de professores a partir do estudante atualizado, depois funde essas melhorias na próxima etapa MOPD. Estudante e professores co-evoluem, o que permite que a capacidade continue a crescer em domínios em vez de atingir um platô.

A linha de professores é em si notável, porque o model card lista quais modelos contribuíram. Inclui variantes do Qwen3, DeepSeek V3, R1 e V4-Pro, GPT-OSS-120B, GLM-5 e GLM-4.7, variantes do Mistral e phi-4. Por outras palavras, a NVIDIA destiou de um amplo conjunto de modelos abertos fortes, o que só é legalmente correto porque o Ultra é em si mesmo um modelo aberto com licença permissiva e esses professores o permitem.

As fases anteriores são mais convencionais. O pré-treino corre em cerca de 20 biliões de tokens com um corte de setembro de 2025 usando o Megatron-LM. O ajuste fino supervisionado, com um corte de maio de 2026, foca-se em código, matemática, ciência, chamadas de ferramentas e seguimento de instruções. A aprendizagem por reforço usa GRPO assíncrono em ambientes de matemática, código, ciência e uso de ferramentas em múltiplas etapas, construído sobre NeMo RL e NeMo Gym. O MOPD situa-se no topo como o refinamento final, e a NVIDIA lançou a receita MOPD através do NeMo-RL para que outros possam reproduzi-la.

Dados de Treino e Transparência

A NVIDIA aposta fortemente na transparência dos dados como ponto de venda, o que importa especificamente para compradores empresariais e de IA soberana que precisam de saber de onde vieram os dados de treino.

Construindo sobre a sua base de pré-treino existente, o Nemotron 3 Ultra adicionou 212 mil milhões de novos tokens direcionados a três lacunas específicas de domínio:

  • 4 mil milhões de tokens de dados jurídicos sintéticos, que elevaram a média proxy do LegalBench de 64,6% para 74,7%
  • 35 mil milhões de tokens de dados sintéticos baseados na Wiki, que aumentaram o SimpleQA proxy de 40,2% para 50,2%
  • 173 mil milhões de tokens GitHub atualizados até 30 de setembro de 2025

No lado do pós-treino, este lançamento disponibilizou 10 milhões de novas amostras de ajuste fino supervisionado, 1 milhão de novas tarefas de RL em múltiplos domínios, e 15 novos ambientes de RL. Isso eleva os totais acumulados abertos do Nemotron para 50 milhões de amostras SFT, 2 milhões de tarefas RL e 55 ambientes RL. O corpus de treino completo que o model card reporta é de cerca de 14,8 biliões de tokens em 226 conjuntos de dados, uma mistura de fontes públicas, dados web e de código rastreados, e dados sintéticos gerados por modelos professores.

Lançar os ambientes RL e os dados SFT é a parte que separa isto de um lançamento típico de pesos abertos. Qualquer pessoa pode fazer ajuste fino do Ultra para o seu próprio domínio usando LoRA, SFT completo ou aprendizagem por reforço através das bibliotecas NeMo, e a NVIDIA fornece receitas para cada um, incluindo configurações específicas para H100 e GB200.

O Stack de Agente em Torno do Modelo

O Nemotron 3 Ultra não é lançado como um modelo isolado. A NVIDIA lançou-o juntamente com um stack de referência para executar agentes autónomos de forma mais segura.

Hermes Agent e OpenClaw são os harnesses de agente, fornecendo os ciclos de orquestração, memória e ferramentas para fluxos de trabalho de múltiplos turnos. O Hermes Agent é agora oficialmente suportado com o Nemotron. O NVIDIA OpenShell, em pré-visualização antecipada como parte do NVIDIA Agent Toolkit, é o runtime seguro onde os agentes autónomos e o código que geram realmente executam. O NVIDIA NemoClaw é o projeto open source que une tudo, instalando o runtime OpenShell com um único comando para que agentes como o Hermes possam executar ao lado de modelos abertos num ambiente isolado.

A adoção já está a aparecer de parceiros. A empresa de IA empresarial Glean adicionou o Nemotron 3 Ultra à sua plataforma, citando que o modelo oferece 91% da completude dos LLM frontier ao perfil de custo de um modelo aberto, e posicionando-o como a opção económica para trabalho empresarial quotidiano em toda a sua linha de mais de 30 modelos. O próprio modelo de pesquisa agêntica da Glean, Waldo, é pós-treinado no Nemotron 3 Nano menor e reportadamente corre com 50% menos latência e 25% menos tokens, que é exatamente o padrão de sistema de modelos que a NVIDIA está a promover.

A Aible, um fornecedor de agentes empresariais, realizou um hackathon conjunto com a equipa NemoClaw da NVIDIA comparando o Nemotron 3 Ultra com outro modelo de raciocínio líder numa tarefa OpenClaw idêntica dentro do OpenShell. A tarefa exigia que o agente encontrasse o sub-agente certo, identificasse o conjunto de dados correto, executasse a análise, publicasse o resultado no Slack e guardasse o plano para reutilização. A Aible reportou que o Ultra planeou de forma mais direta, retrocedeu menos, foi o primeiro a publicar no Slack, seguiu todas as partes da instrução na primeira tentativa, e guardou com sucesso o plano executado para reutilização determinística, enquanto o modelo de comparação falhou uma instrução e falhou a sua primeira chamada ao Slack. Os benchmarks de fornecedores merecem sempre algum ceticismo, mas o resultado é consistente com as fortes pontuações PinchBench e IFBench do modelo.

Se quiser comparar o Nemotron 3 Ultra com a fronteira fechada sem instalar infraestrutura de GPU, o Fello AI dá-lhe acesso ao Claude, GPT, Gemini, DeepSeek, Perplexity e mais numa única aplicação nativa para Mac, iPhone e iPad. Uma subscrição, todos os modelos frontier, sem gerir contas separadas.

Mais Dois Modelos no Lançamento

A NVIDIA lançou dois modelos Nemotron adicionais juntamente com o Ultra, ambos destinados a tornar os sistemas de agente mais seguros e mais capazes.

O Nemotron 3.5 Content Safety é um modelo de guarda-rail aberto com 4 mil milhões de parâmetros para classificar conteúdo inseguro, não permitido ou que viola políticas em texto, imagens e inputs combinados. Cobre 23 categorias de segurança e 12 línguas, e pode funcionar como guarda-rail em tempo de inferência, como juiz para testes de segurança de LLM, ou como base para pós-treinar modelos mais seguros usando o conjunto de dados que o acompanha. Suporta políticas personalizadas e produz traços de raciocínio, para que as empresas possam auditar por que razão uma dada classificação foi feita e adaptar as regras ao seu próprio domínio.

O Nemotron 3.5 ASR é um modelo de reconhecimento de fala para agentes nativos de voz. Usa uma arquitetura de streaming consciente de cache para processar deltas de áudio instantaneamente, atingindo latência abaixo de 100 milissegundos para voz em tempo real. A NVIDIA nota que o predecessor inglês já alimenta a funcionalidade de entrada de voz no Microsoft GitHub Copilot CLI, usado por mais de 20 milhões de programadores, e um benchmark independente de mais de 50 configurações ASR no dispositivo identificou-o como o candidato mais forte para streaming inglês em tempo real em hardware restrito. A versão 3.5 estende essa mesma arquitetura a mais de 40 línguas num único checkpoint.

Onde o Nemotron 3 Ultra Fica Aquém

Os benchmarks tornam as lacunas claras, e a NVIDIA não as oculta.

Codificação bruta. No Terminal-Bench 2.0, o Ultra pontua 54%, bem atrás do GLM 5.1 com 64% e do Kimi K2.6 com 67%. Os seus números no SWE-Bench Verified são fortes e consistentes, mas no benchmark de codificação em terminal mais difícil é o modelo mais fraco neste grupo. Para throughput puro de geração de código, os modelos abertos chineses mais volumosos lideram atualmente.

Planeamento de longo horizonte. No EnterpriseOps-Gym, o Ultra pontua 33%, atrás do GLM 5.1 com 40%. Para as tarefas de planeamento em múltiplas etapas mais longas e complexas, não é o modelo aberto de topo. Esta é uma ressalva notável dado que o modelo é comercializado para agentes de longa duração, embora valha a pena notar que estas pontuações são baixas em geral, o que diz mais sobre a dificuldade do benchmark do que sobre qualquer modelo em particular.

Teto de trabalho de conhecimento. No GDPVal-AA, o Ultra pontua 1.448 contra 1.594 do GLM 5.1 e 1.508 do Kimi K2.6. No trabalho de conhecimento amplo fica atrás dos modelos maiores, que é o equilíbrio esperado para um modelo com muito menos parâmetros totais e ativos.

Não é a fronteira absoluta. Com 48 no Artificial Analysis Intelligence Index, o Ultra é o melhor modelo aberto dos EUA, mas o Kimi K2.6 com 54 e o Opus 4.8 fechado com 61 estão claramente à frente em inteligência bruta. O argumento é valor e eficiência, não encabeçar o leaderboard.

A leitura honesta é que o Nemotron 3 Ultra vence nos eixos que a NVIDIA otimizou, produtividade de agente, seguimento de instruções, contexto longo, velocidade e custo, e fica atrás nos eixos que sacrificou, codificação bruta, planeamento aprofundado e conhecimento de pico.

Como Se Compara

CapacidadeNemotron 3 UltraKimi K2.6GLM 5.1Opus 4.8
Parâmetros totais550B1T744Bfechado
Parâmetros ativos55Bmaiormaiorfechado
AA Intelligence Index4854não listado61
Produtividade de agente (PinchBench)91%91%84%não listado
Seguimento de instruções (IFBench)82%74%77%não listado
Codificação (Terminal-Bench 2.0)54%67%64%não listado
Contexto longo1M tokens (95% Ruler)máx 256Kmáx 256Klongo
Velocidade de saída300+ tok/s50 a 100 tok/svariafechado
Pesos abertossim, OpenMDW-1.1simsimnão

A forma da comparação é consistente. Face ao Kimi K2.6 e ao GLM 5.1, o Nemotron 3 Ultra é o modelo menor, mais rápido e mais barato que os iguala ou supera em produtividade de agente, seguimento de instruções e contexto longo, enquanto cede em codificação bruta e inteligência de pico. Tem aproximadamente metade da contagem de parâmetros do GLM 5.1 e bem abaixo de metade do Kimi K2.6, mas empata com o Kimi de um bilião de parâmetros no PinchBench e corre três a seis vezes mais rápido em throughput.

Face à fronteira fechada, a diferença é real mas a proposta de valor é diferente. O Opus 4.8 com 61 no índice de inteligência é o raciocínio mais forte, mas é uma API fechada que não pode alojar em servidor próprio, ajustar livremente, ou usar para ensinar os seus modelos menores. O enquadramento da Glean, 91% de completude frontier ao custo de modelo aberto, captura a decisão real que a maioria das empresas enfrenta. Para os 9% críticos de tarefas que encaminha para a fronteira, para os 91% de rotina executa um modelo aberto como o Ultra e poupa o gasto.

Para cargas de trabalho em língua chinesa e de codificação pura, os modelos abertos chineses mais volumosos ainda têm vantagem. Para fluxos de trabalho de agente em inglês onde o custo, a velocidade e a fiabilidade de uso de ferramentas dominam, o Ultra é a escolha mais prática.

Disponibilidade e Preços

O Nemotron 3 Ultra está disponível agora mesmo através de um amplo conjunto de canais, o que é uma abrangência invulgar para um modelo aberto no dia do lançamento.

Pode experimentá-lo na Perplexity com uma subscrição Pro ou através da API, e aceder através do OpenRouter, Anaconda ou build.nvidia.com. Os pesos são descarregáveis do Hugging Face, nas variantes BF16 e NVFP4, e o modelo está embalado como um microserviço NVIDIA NIM para alojamento próprio otimizado.

A lista de fornecedores de nuvem e inferência é longa: AWS JumpStart, Amazon EKS, Baseten, Bitdeer AI, CoreWeave, Crusoe, DeepInfra, Dell Enterprise Hub, DigitalOcean, Eigen AI, fal, Fireworks AI, FriendliAI, GMI Cloud, Google Cloud, Lightning AI, Microsoft Foundry, Modal, Nebius Token Factory, Prime Intellect, Simplismart, Together AI e Vultr. As integrações de harnesses de agente cobrem BlackBox AI, Cline, CrewAI, Factory AI, Hermes Agent, Kilo Code, LangChain Deep Agents, OpenClaw, OpenCode, OpenHands e Pi.

A NVIDIA não publicou um preço oficial por token único, uma vez que o modelo é aberto e os preços são definidos por cada fornecedor de inferência. O sinal competitivo é o throughput. A 300 mais tokens por segundo no DeepInfra contra 50 a 100 para modelos de tamanho semelhante, o custo efetivo por tarefa fica bem abaixo de modelos abertos comparáveis mesmo antes da redução de 30% em tokens que a NVIDIA cita.

A mudança de licenciamento faz parte da história. Os lançamentos do Nemotron passam agora a usar a OpenMDW-1.1, a licença permissiva da Linux Foundation construída especificamente para distribuições de modelos de IA abertos. Cobre o conjunto completo de materiais do modelo, arquitetura, parâmetros, documentação, software e artefactos relacionados, sob um único framework, o que remove grande parte da ambiguidade de licenciamento que atrasa a avaliação empresarial de modelos abertos.

Por Que Este Lançamento Importa

Três coisas se destacam neste lançamento.

Primeiro, a fronteira aberta dos EUA deu um passo real em frente. Durante a maior parte do último ano, os modelos abertos mais fortes vieram de laboratórios chineses, com os lançamentos abertos dos EUA a ficar para trás. O Nemotron 3 Ultra com 48 no índice de inteligência é agora claramente o melhor modelo americano aberto, à frente do gpt-oss-120b e do Gemma 4. Ainda não alcança o Kimi K2.6, pelo que a China mantém a coroa aberta, mas a diferença reduziu-se e a NVIDIA é agora um jogador sério de modelos abertos, não apenas um fornecedor de chips que lança modelos de referência.

Segundo, esta é uma aposta na tese do sistema de modelos em vez da tese do modelo frontier único. A NVIDIA, a Glean e a Aible estão todas a fazer o mesmo argumento: executar um modelo gigante único para cada tarefa é desperdiçador, e o futuro é um orquestrador aberto forte a delegar trabalho de rotina a executores eficientes e baratos. O Ultra é explicitamente concebido como o professor e planeador no topo desse stack, com uma licença permissiva precisamente para que as suas saídas possam treinar os modelos menores abaixo dele. Se esse padrão vencer, o valor desloca-se de possuir o único melhor modelo para possuir o sistema de modelos mais eficiente. A Sakana AI já vende esse sistema como produto, e o nosso artigo sobre o Fugu-Ultra v1.1 da Sakana cobre as suas pontuações e custos.

Terceiro, a eficiência é agora um eixo competitivo de primeira classe. O Nemotron 3 Ultra lidera o seu grupo de pares não por ser o modelo mais inteligente da sala, mas por completar as mesmas tarefas de agente 5 vezes mais rápido e 30% mais barato. À medida que os fluxos de trabalho de agente ficam mais longos e as faturas de tokens crescem, o custo por tarefa concluída torna-se o número que as empresas realmente otimizam, e um modelo ajustado para essa métrica pode ganhar implementações mesmo quando perde manchetes de benchmarks.

Para quem quiser colocar o Nemotron 3 Ultra ao lado do Claude, GPT, Gemini, DeepSeek e Perplexity sem gerir GPUs ou subscrições separadas, o Fello AI reúne todos os modelos frontier numa única aplicação nativa para Mac, iPhone e iPad. Teste o mesmo prompt em vários modelos, veja qual lida melhor com o seu trabalho e mude instantaneamente. O Nemotron 3 Ultra é o sinal mais claro ainda de que os modelos abertos estão a aproximar-se da fronteira fechada, e a forma mais rápida de sentir esse progresso é compará-los por si mesmo.