A 8 de maio de 2026, a Baidu lançou o ERNIE 5.1, um novo modelo de topo que já está a abalar as tabelas classificativas. O ERNIE 5.1 alcançou o 4.º lugar mundial na LMArena Search Arena, com uma pontuação de 1223, tornando-se o único modelo chinês no top 10 mundial em desempenho de pesquisa. A Alibaba seguiu-se semanas depois com o seu modelo de topo Qwen3.7-Max, o modelo chinês mais bem colocado no Artificial Analysis Intelligence Index. Também alcançou o 14.º lugar mundial na tabela de texto da LMArena, a posição mais alta que um laboratório chinês já ocupou nessa categoria.

O mais surpreendente é a forma como o ERNIE 5.1 foi construído. Comprime o total de parâmetros para cerca de um terço do ERNIE 5.0, corta os parâmetros ativos para metade, e usa apenas cerca de 6% da computação de pré-treino gasta em modelos de fronteira comparáveis. A Baidu apresenta-o abertamente como uma aposta na eficiência de parâmetros, e não num aumento de escala.

Neste artigo, analisamos o que mudou, os benchmarks, a nova infraestrutura de treino por trás do modelo, o desempenho real em escrita, matemática, pesquisa, folhas de cálculo e programação, e a comparação com o DeepSeek V4 Pro, o Claude Opus 4.6 e o Gemini 3.1 Pro.

O Que é Realmente o ERNIE 5.1

O ERNIE 5.1 não é um modelo treinado do zero. É a sub-rede com melhor desempenho, extraída da matriz elástica de submodelos que a Baidu treinou ao construir o ERNIE 5.0 (um modelo de fundação multimodal unificado com 2,4 biliões de parâmetros). Em vez de realizar uma nova campanha de pré-treino completa, a Baidu reutilizou essa matriz existente, escolheu uma fatia ótima e continuou o treino a partir daí.

O resultado é um modelo com cerca de 800 mil milhões de parâmetros totais, cerca de um terço do ERNIE 5.0, e aproximadamente metade dos parâmetros ativos no momento da inferência. Apesar de ser substancialmente mais pequeno do que o seu antecessor, o ERNIE 5.1 supera o ERNIE 5.0 na maioria dos benchmarks e aproxima-se dos modelos de código fechado mais fortes em vários eixos.

O momento do lançamento também é notável. O ERNIE 5.0 foi lançado no final de janeiro de 2026. O ERNIE 5.1 chega cerca de três meses depois, um ritmo de lançamento mais próximo do da OpenAI e da Anthropic do que do calendário típico dos laboratórios chineses.

Uma Breve História do ERNIE

Do editor

Todos os modelos de IA numa só aplicação

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 e mais numa só aplicação nativa para Mac e iPhone.

Descarregue já!

O ERNIE existe há mais tempo do que a maioria dos nomes de fronteira atuais. A Baidu iniciou a linha ERNIE em 2019, como um projeto de investigação em PLN (o nome significa Enhanced Representation through Knowledge Integration), e antecede em vários anos a onda moderna de chatbots para consumidores. Vale a pena compreender esta trajetória, porque os pontos fortes e fracos visíveis na versão 5.1 não são novos, têm estado presentes ao longo de todo o histórico de lançamentos.

O ERNIE Bot (março de 2023) foi a resposta da Baidu ao ChatGPT e a primeira versão do ERNIE que a maioria das pessoas fora da China conheceu. O evento de lançamento foi amplamente considerado dececionante. A Baidu mostrou demonstrações pré-gravadas em vez de um modelo ao vivo, e as primeiras análises práticas assinalaram que o modelo ficava visivelmente atrás do GPT-3.5 em raciocínio e em tarefas de língua inglesa. Foi, no entanto, o primeiro grande LLM em língua chinesa com acesso público generalizado, e conquistou utilizadores rapidamente dentro da China.

Captura de ecrã de uma versão inicial da aplicação ERNIE Bot

O ERNIE 4.0 (17 de outubro de 2023) foi a primeira versão em que as afirmações da Baidu começaram a fazer sentido. O CEO Robin Li anunciou-o na Baidu World 2023, alegando paridade com o GPT-4. Testes independentes mostraram que o ERNIE 4.0 era genuinamente forte em tarefas de língua chinesa e atualidade, e mais fraco do que o GPT-4 em programação e raciocínio complexo. A reação dos analistas foi mista. O modelo conquistou utilizadores rapidamente dentro da China, atingindo cerca de 45 milhões de utilizadores nos primeiros meses e 70 milhões no final de 2023, face aos 150 milhões do ChatGPT na mesma altura.

O ERNIE 4.5 (30 de junho de 2025) foi um ponto de viragem. A Baidu tornou open source toda a família 4.5 sob a licença Apache 2.0, lançando dez variantes, desde um modelo denso de 0,3 mil milhões até um MoE de 424 mil milhões de parâmetros com 47 mil milhões ativos. No CMMLU, estabeleceu um novo estado da arte para a compreensão da língua chinesa, e no MMLU igualou o desempenho da classe GPT-4. As pontuações multimodais ultrapassaram ligeiramente o GPT-4o nos benchmarks reportados pela Baidu (79,6 vs. 79,14 em texto combinado). A receção na comunidade open source foi forte, e o ERNIE 4.5 tornou-se rapidamente um dos modelos de pesos abertos mais amplamente implementados dentro da China. A variante de raciocínio X1, lançada em simultâneo, foi a primeira entrada séria da Baidu na categoria de raciocínio deliberado, com um preço de cerca de 1% do GPT-4.5.

O ERNIE 5.0 (22 de janeiro de 2026) foi o salto arquitetónico. Um MoE de 2,4 biliões de parâmetros com processamento multimodal nativo para texto, imagens, áudio e vídeo, ativando menos de 3% dos parâmetros por inferência. O ERNIE 5.0 tornou-se o primeiro modelo chinês a entrar no top 10 mundial da LMArena, com 1460 pontos e o 8.º lugar na tabela de texto. Ficou em 2.º lugar mundial em matemática, atrás apenas do GPT-5.2 (High), e a versão de visão 5.0-Preview-1220 alcançou o 8.º lugar mundial na tabela de visão, o único modelo chinês nesse top 10. A receção foi forte quanto à capacidade bruta, mas mista quanto à fiabilidade em produção, com vários programadores a assinalar ciclos de chamadas de ferramentas e arestas por polir em fluxos de trabalho agênticos. O ERNIE Assistant, voltado para consumidores da Baidu, ultrapassou os 200 milhões de utilizadores ativos mensais praticamente na mesma altura do lançamento.

O ERNIE 5.1 (8 de maio de 2026) é a versão que estamos a analisar aqui. Não procura aumentar ainda mais o número de parâmetros. Em vez disso, procura a eficiência de parâmetros, extraindo uma sub-rede ótima do 5.0 e continuando o treino a partir daí.

O padrão ao longo da linha é consistente. O ERNIE tem sido historicamente mais forte em tarefas de língua chinesa, consultas fundamentadas em pesquisa e raciocínio estruturado, e historicamente mais fraco em programação, conhecimento geral do mundo em inglês e execução agêntica de várias etapas. O ERNIE 5.1 fecha algumas dessas lacunas, mas não as elimina.

Resultados dos Benchmarks

A Baidu publicou comparações diretas entre o ERNIE 5.1, o DeepSeek V4 Pro, o Claude Opus 4.6 e o Gemini 3.1 Pro, em categorias agênticas, de conhecimento, de raciocínio e de seguimento de instruções.

Os números em destaque são:

  • AIME26 (raciocínio matemático com ferramentas): 99,6, atrás apenas do Gemini 3.1 Pro
  • τ³-bench (uso de ferramentas em várias interações): supera o DeepSeek V4 Pro, fica atrás do Claude Opus 4.6
  • SpreadsheetBench-Verified: supera o DeepSeek V4 Pro, fica muito atrás do Claude Opus 4.6 e do Gemini 3.1 Pro
  • GPQA (ciência de nível de pós-graduação): em segundo lugar, atrás do Gemini 3.1 Pro, à frente do DeepSeek V4 Pro e do Claude Opus 4.6
  • MMLU-Pro (conhecimento geral): fica em último lugar entre os quatro, com uma diferença visível para os líderes
  • AdvanceIF (seguimento de instruções complexas): em segundo lugar, atrás do Gemini 3.1 Pro, à frente dos restantes

O padrão é consistente. O ERNIE 5.1 é altamente competitivo em matemática assistida por ferramentas, raciocínio estruturado e seguimento de instruções, mas perde terreno em testes de conhecimento geral do mundo, tarefas de agentes de pesquisa aprofundada e nos cenários mais difíceis de automação de folhas de cálculo.

Nas avaliações internas da Baidu, a qualidade de escrita criativa do ERNIE 5.1 é descrita como próxima da do Gemini 3.1 Pro, atualmente considerado o modelo de escrita mais forte da área.

Desempenho em Pesquisa e o Resultado na LMArena

O resultado mais surpreendente é na pesquisa. O ERNIE 5.1 ficou em 4.º lugar mundial na tabela da LMArena Search Arena, com uma pontuação de 1223, o único modelo chinês no top 10 mundial. Isto coloca a Baidu entre os três principais laboratórios mundiais em desempenho de pesquisa, ao lado dos principais intervenientes ocidentais de fronteira.

Este não é um resultado acidental. A Baidu tem sido o motor de pesquisa dominante na China há duas décadas, e a fundamentação em pesquisa está integrada na pilha de implementação do ERNIE. O ERNIE 5.1 herda acesso direto a pesquisa em tempo real e a recuperação estruturada, e a Baidu otimizou claramente o modelo para usar bem essa recuperação, incluindo classificação, síntese de fontes e comportamento de citação.

Para os utilizadores chineses, esta combinação é importante. Um modelo que recolhe nativamente de fontes em língua chinesa e as classifica corretamente é um diferenciador significativo face a modelos treinados sobretudo com dados da web em inglês.

Resultados do ERNIE-5.1 na LM Search Arena [fonte]

Pré-Treino Elástico Multidimensional

A alegação de 6% do custo de pré-treino assenta numa técnica que a Baidu designa por treino elástico Once-for-All, aplicada em múltiplas dimensões durante o treino do ERNIE 5.0.

Num pipeline de treino normal, escolhe-se uma arquitetura-alvo (profundidade, largura, esparsidade, número de especialistas) e treina-se um único modelo. Para obter uma variante mais pequena, é necessário treiná-la novamente do zero ou destilá-la a partir do modelo maior. Isto é dispendioso.

A abordagem elástica da Baidu treina uma única super-rede que, através de amostragem dinâmica durante o pré-treino, otimiza simultaneamente uma vasta matriz de sub-redes em:

  • Profundidade elástica: número variável de camadas do Transformer
  • Largura elástica: capacidade variável de especialistas dentro do MoE
  • Esparsidade elástica: encaminhamento Top-k variável durante as passagens diretas

Quando o pré-treino termina, é possível extrair qualquer sub-rede da matriz e obter um modelo utilizável. O ERNIE 5.1 é a mais forte dessa matriz na sua gama-alvo de parâmetros.

Como a computação subjacente já tinha sido gasta no ERNIE 5.0, alargar e refinar o ERNIE 5.1 exige apenas uma fração do custo de um novo pré-treino, daí o valor de 6%. A Baidu não especificou o modelo de comparação exato por trás desse número, pelo que o valor deve ser lido como uma indicação direcional de eficiência, e não como um benchmark auditado com precisão.

A implicação energética é real de qualquer forma. As estimativas do setor situam o treino de um modelo de classe GPT-4 em cerca de 240 milhões de kWh de eletricidade. O custo de treino equivalente do ERNIE 5.1 ficaria mais próximo dos 6 milhões de kWh.

RL Totalmente Assíncrono e Desacoplado

O pós-treino do ERNIE 5.1 foi executado numa nova infraestrutura que a Baidu construiu especificamente para aprendizagem por reforço agêntica de longo horizonte.

Numa pilha de pós-treino de RL padrão, quatro componentes estão fortemente acoplados: o treinador, o motor de inferência, o modelo de recompensa e o ciclo do agente. Quando um abranda, tudo bloqueia. Para RL agêntico, onde os rollouts podem ser longos e envolvem uso de ferramentas, esse acoplamento é um estrangulamento sério.

A Baidu desacoplou totalmente estes componentes. O treinador, o motor de rollout, o cálculo de recompensa e o ciclo do agente funcionam agora de forma independente, cada um com o seu próprio perfil de escalabilidade. Se os rollouts se tornarem o estrangulamento, apenas essa fase escala, e o fluxo de controlo está separado do fluxo de dados, permitindo que as fases do pipeline se sobreponham.

Dois detalhes de implementação destacam-se:

  • Paridade de treino e inferência em FP8. A equipa unificou os operadores de baixa precisão entre o treino e o rollout, combinando isto com uma repetição otimizada do router de rollout. O resultado é uma redução de 50% na divergência KL entre as distribuições de treino e de inferência, praticamente sem tempo real adicional. Para modelos MoE, isto é importante porque a deriva do router entre treino e inferência é um problema de estabilidade conhecido.
  • Agrupamento heterogéneo de CPU. Os núcleos de CPU inativos em todo o cluster são agrupados e usados para sandboxes de código, verificadores e outras cargas de trabalho que não usam GPU. É um pequeno detalhe, mas aumenta materialmente a utilização do cluster durante rollouts agênticos longos.

O efeito combinado é uma iteração mais rápida nas capacidades agênticas, o que se reflete no bom desempenho do ERNIE 5.1 no τ³-bench e na matemática assistida por ferramentas.

O Pipeline de Pós-Treino em Quatro Fases

A maioria dos laboratórios faz o pós-treino como uma longa cadeia sequencial. O ERNIE 5.1 divide o trabalho em quatro fases distintas, com paralelismo dentro dos passos mais pesados.

  1. SFT unificado. Uma primeira passagem de ajuste fino supervisionado sobre dados de instrução amplos e multidomínio. Isto fixa a base de seguimento de instruções e chamadas de ferramentas.
  2. Treino paralelo de especialistas de domínio. São treinados modelos especialistas separados para código, raciocínio, comportamento agêntico e outros domínios. Cada um usa o seu próprio sinal de recompensa e algoritmo, sem interferência entre domínios. As colisões de capacidades, em que melhorar a matemática prejudica a qualidade do diálogo, são evitadas nesta fase.
  3. On-Policy Distillation (OPD). O modelo de SFT unificado torna-se o aluno. Este faz amostragem de rollouts sob a sua própria política e usa alinhamento KL ao nível do token para absorver conhecimento de cada professor especialista em paralelo. É assim que a Baidu funde vários especialistas num único modelo implementável.
  4. RL online geral. Para tarefas de alta entropia, como conversação aberta, escrita criativa e alinhamento com preferências humanas, a destilação tende a achatar os resultados. Essas tarefas são ignoradas na fase 3 e tratadas com uma ronda final de RL online que preserva a diversidade.

A divisão é a parte importante. As capacidades determinísticas (código, matemática, raciocínio estruturado) são fundidas por destilação. As capacidades abertas (escrita, diálogo) são tratadas com RL. Ao manter os dois caminhos separados, o ERNIE 5.1 evita o modo de falha comum em que a qualidade da matemática sobe enquanto a qualidade da escrita desce.

Capacidades no Mundo Real

Testes práticos independentes de meios de comunicação tecnológicos chineses oferecem uma leitura útil do que os benchmarks realmente significam.

Escrita criativa. O ERNIE 5.1 lida com esquemas de contos, ficção de suspense e microficção de ficção científica com uma qualidade estrutural sólida. A variante de pensamento produz resultados visivelmente melhores do que a variante rápida em tom emocional e consistência narrativa. A variante rápida, por vezes, baralhava os papéis das personagens em textos mais longos, o que não aconteceu com a variante de pensamento. O estilo é competente, mas a construção do enredo pode parecer formulaica para leitores habituados a ficção de género.

Raciocínio matemático. Perante um problema de probabilidade de um exame nacional chinês de 2025, o modelo produziu soluções passo a passo totalmente corretas, incluindo validação cruzada entre dois métodos diferentes. Isto é consistente com a pontuação no AIME26.

Síntese de informação. Perante uma pergunta aberta sobre como escolher entre o DeepSeek V4 Pro e o Claude Opus 4.6 para um utilizador não técnico, o modelo dividiu autonomamente a tarefa em várias dimensões, produziu tabelas comparativas, segmentou recomendações por tipo de utilizador e assinalou ressalvas ocultas. Este tipo de síntese não estruturada é uma das suas áreas mais fortes.

Operações em folhas de cálculo. Perante um conjunto de dados de desempenho de vendas, a variante rápida precisou de várias rondas de esclarecimento antes de produzir uma tabela unificada e limpa. A variante de pensamento acertou à primeira tentativa. Funcional, mas a diferença entre as duas variantes é maior aqui do que noutras categorias.

Programação. Esta é a área mais fraca. Ao pedir-se um jogo de luta em 3D num único ficheiro HTML (cerca de 700 linhas de código gerado), o modelo produziu código executável, mas com bugs de renderização e controlos de combate avariados. Um pedido mais simples de um endless runner (cerca de 600 linhas) produziu código que não funcionava de todo. A programação prática está claramente atrás do Claude Opus 4.6 e do Gemini 3.1 Pro.

Para quem quiser experimentar o ERNIE 5.1 ao lado do Claude Opus 4.7, do GPT-5.5, do Gemini 3.1 Pro, do DeepSeek V4 e do Perplexity num só lugar, todos estão acessíveis no Fello AI, no Mac, no iPhone e no iPad. Uma única subscrição, todos os modelos de fronteira, sem ter de gerir aplicações ou contas separadas.

Onde o ERNIE 5.1 Fica Aquém

Uma leitura honesta dos benchmarks revela três lacunas reais.

Conhecimento geral do mundo. O MMLU-Pro é a fraqueza mais evidente, com uma diferença visível para os líderes. Para quem usa um modelo como um oráculo de conhecimento geral sem recuperação, o ERNIE 5.1 vai parecer mais limitado do que os principais concorrentes de código fechado.

Tarefas de agentes de pesquisa aprofundada. Apesar da forte classificação na Search Arena, o ERNIE 5.1 fica atrás nos benchmarks de agentes de pesquisa aprofundada com várias etapas, em que o modelo tem de planear, navegar e sintetizar de forma autónoma entre muitas fontes. A pesquisa de uma única interação é excelente. Os fluxos de trabalho de investigação com várias etapas continuam atrasados.

Programação prática. A geração pode produzir centenas de linhas de código plausível, mas avariado. O modelo sabe qual deve ser o aspeto do código, mas a sua capacidade de manter estado global ao longo de programas longos fica muito atrás dos modelos de programação de fronteira. Para fluxos de trabalho no estilo Claude Code, esta é a lacuna mais importante a ter em conta.

Automação de folhas de cálculo à escala. Os resultados do SpreadsheetBench-Verified ficam bem atrás do Claude Opus 4.6 e do Gemini 3.1 Pro. Para casos de uso de automação de escritório em que o critério é a execução fiável e ponta a ponta em pastas de trabalho reais, a diferença é suficientemente grande para importar.

Como Se Compara

CapacidadeERNIE 5.1DeepSeek V4 ProClaude Opus 4.6Gemini 3.1 Pro
Matemática com ferramentas (AIME26)99,6, #23.º4.º#1
Uso de ferramentas em várias interações (τ³)2.º4.º#13.º
Folhas de cálculo3.º4.º#12.º
Ciência de pós-graduação (GPQA)2.º4.º3.º#1
Conhecimento geral (MMLU-Pro)4.º3.º2.º#1
Seguimento de instruções (AdvanceIF)2.º3.º4.º#1
Search Arena#4 mundialsem classificação no toposem classificação no toponível de topo
Programação práticafracoforteo mais forteforte
Escrita criativaquase no topomédiofortetopo
Pesos abertosfamília ERNIE abertaabertofechadofechado

A forma do perfil do ERNIE 5.1 está mais próxima do Gemini 3.1 Pro do que de qualquer outro modelo. Ambos se destacam em raciocínio assistido por ferramentas, pesquisa e seguimento de instruções. O Gemini continua a liderar em conhecimento bruto e programação, mas o ERNIE 5.1 é competitivo com uma fração do investimento em treino.

Face ao DeepSeek V4 Pro, a comparação é mais equilibrada. O DeepSeek lidera em programação prática e numa maior maturidade da API. O ERNIE 5.1 lidera no uso agêntico de ferramentas, na pesquisa e no seguimento de instruções. Especificamente em tarefas de língua chinesa, o ERNIE 5.1 tem uma vantagem clara.

Face ao Claude Opus 4.6, a Anthropic continua a liderar no uso de ferramentas em várias interações, nas folhas de cálculo e na programação. O ERNIE 5.1 recupera terreno em matemática, pesquisa e seguimento de instruções. A família Claude continua a ser a escolha mais fiável para cargas de trabalho agênticas de produção em inglês.

Disponibilidade e Preços

O ERNIE 5.1 está disponível já através de três canais:

  • A interface de conversação para consumidores em yiyan.baidu.com (também acessível através de ernie.baidu.com)
  • O Baidu AI Studio Model Playground para programadores
  • Acesso por API através da plataforma Qianfan da Baidu

Estão disponíveis tanto uma variante rápida como uma variante de pensamento. A variante de pensamento é a melhor predefinição para tarefas não triviais, incluindo escrita, análise estruturada e qualquer trabalho com folhas de cálculo. A variante rápida é suficiente para consultas rápidas e conversação simples.

A Baidu não publicou preços oficiais de API para o ERNIE 5.1 no lançamento. Os modelos da família ERNIE 4.5 tinham preços agressivos face ao DeepSeek e ao nível do GPT-4, e espera-se a mesma direção aqui, assim que as páginas de preços forem atualizadas.

O ERNIE 5.1 também está a ser implementado em mais de 10 plataformas criativas parceiras dentro do ecossistema da Baidu, incluindo a ISEKAI ZERO, a Mulan AI e a Storymaster.

Porque Este Lançamento é Importante

Três coisas se destacam.

Primeiro, o ERNIE 5.1 é o sinal mais forte até agora de que o desempenho de nível de fronteira não exige computação de nível de fronteira. A alegação de 6% do custo de pré-treino assenta numa inovação arquitetónica não trivial (treino elástico multidimensional) e é sustentada por resultados de benchmark reais, e não apenas por marketing. Se outros laboratórios adotarem métodos semelhantes de pré-treino elástico, a curva de custos das novas gerações de modelos poderá inclinar-se de forma significativa.

Segundo, o lançamento reduz ainda mais a diferença entre os laboratórios chineses e ocidentais no topo. Há seis meses, o modelo chinês mais forte na LMArena estava fora do top 20 mundial. O ERNIE 5.1 está agora em #14 na tabela de texto e em #4 na Pesquisa. A fronteira chinesa já não está uma ou duas gerações de modelos atrás. É contemporânea.

Terceiro, a pesquisa é agora uma dimensão de capacidade real em que os modelos de fronteira competem. O 4.º lugar do ERNIE 5.1 na Search Arena não é uma métrica secundária. À medida que mais fluxos de trabalho se orientam para respostas fundamentadas em recuperação, os laboratórios que possuem um índice de pesquisa real, como a Baidu e a Google, têm uma vantagem estrutural que os laboratórios de modelos de linguagem pura não têm.

Para quem quer comparar o ERNIE 5.1 com o resto da fronteira sem gerir várias subscrições, o Fello AI disponibiliza o Claude 4.6, o GPT-5.5, o Gemini 3.1 Pro, o DeepSeek V4, o Perplexity e muito mais numa única aplicação nativa para Mac, iPhone e iPad. Um único lugar para testar prompts lado a lado, ver qual o modelo que trata melhor cada trabalho e mudar instantaneamente.

O ERNIE 5.1 é o segundo grande lançamento de fronteira chinês de 2026, depois do DeepSeek V4. A próxima geração do ERNIE é esperada ainda este ano, e com base na abordagem de pré-treino elástico, é razoável esperar que as futuras versões do ERNIE continuem a extrair valor da super-rede 5.0 existente, em vez de começarem do zero. Trata-se de um plano de jogo competitivo diferente do resto da área, e vale a pena acompanhar.