A corrida da IA open source ficou ainda mais interessante. A startup chinesa DeepSeek apresentou o DeepSeek-V3.1, a sua maior atualização até agora, com raciocínio mais afinado, capacidades de programação mais fortes e novo suporte para chamada de ferramentas e fluxos de trabalho de agentes.

Ao contrário do lançamento anterior, que parecia experimental, o V3.1 chega como um concorrente sério. Com uma janela de contexto de 128K, modos de raciocínio híbridos e uma API drasticamente mais barata do que as suas rivais ocidentais, o modelo foi concebido para aproximar a IA aberta do desempenho do GPT-5, do Grok 4, do Claude Opus e do Gemini 2.5 Pro. Consulte o nosso guia de preços do DeepSeek para conhecer todos os custos da API e os detalhes da versão gratuita. Também o comparamos diretamente com o Grok em termos de custo e limites na nossa comparação entre o DeepSeek e o Grok. Atualização, 26 de setembro de 2026: esse conjunto de comparação é o panorama de agosto de 2025. O GPT-5, o Grok 4, o Claude Opus 4.1 e o Gemini 2.5 Pro já foram substituídos várias vezes, e a própria linha do DeepSeek avançou para o V4 e o V4.1-Flash. Tudo o que se segue é o registo daquilo contra o qual o V3.1 foi medido no lançamento.

Os primeiros benchmarks mostram que o V3.1 não se limita a aproximar-se, mas compete de igual para igual em tarefas de programação e de raciocínio, o que sinaliza que a linha entre os sistemas comerciais fechados e os modelos abertos está a estreitar-se mais rapidamente do que o esperado.

O que muda no DeepSeek V3.1

Quando o DeepSeek-V3 foi lançado, destacou-se como um dos primeiros modelos open source capazes de rivalizar com sistemas comerciais. No entanto, a sua popularidade crescente também expôs fragilidades, sobretudo lentidão na API e uma chamada de ferramentas pouco fiável.

O V3.1 enfrenta estes problemas diretamente, ao mesmo tempo que acrescenta novas capacidades:

  • Modos híbridos: alterne entre o modo de «pensamento», para um raciocínio passo a passo, e o modo «sem pensamento», para respostas mais rápidas.
  • Chamada de ferramentas mais forte: suporte estruturado para APIs, execução de código e agentes de pesquisa.
  • Janela de contexto de 128K: um salto importante para lidar com conversas mais longas ou bases de código maiores.
  • Compatibilidade com a API da Claude: integração mais fácil para programadores que já usam o ecossistema da Anthropic.
  • Design MoE eficiente: 671 mil milhões de parâmetros, mas apenas 37 mil milhões ativos por token, equilibrando escala e custo.

Estas atualizações tornam o V3.1 um modelo mais fiável e versátil, transformando-o de um lançamento experimental numa opção prática para programação, investigação e fluxos de trabalho de agentes.

Modo híbrido de «pensamento»

Uma funcionalidade de destaque do DeepSeek-V3.1 é o novo sistema de inferência híbrida. Os utilizadores podem agora alternar entre dois modos:

  1. Modo de pensamento: raciocínio passo a passo para maior precisão em matemática, programação e lógica.
  2. Modo sem pensamento: respostas mais rápidas e diretas, com custo mais baixo mas ligeiramente menos precisas.

Esta flexibilidade permite aos programadores escolher entre velocidade e precisão, dependendo da tarefa. Os benchmarks mostram claramente o impacto: 88,4% no AIME 2025 no modo de pensamento, superando ligeiramente o R1, e 74,8% no LiveCodeBench, novamente acima do seu antecessor.

Ao oferecer os dois modos, o V3.1 dá aos utilizadores controlo sobre se precisam de uma resposta rápida ou de uma resposta mais cuidada e fundamentada, algo raramente visto em modelos open source.

Comparação técnica

Do editor

Todos os modelos de IA numa só aplicação

Fello AI reúne GPT-6, Claude 5.5, Gemini 3.8, Grok 4.7 e mais numa só aplicação nativa para Mac e iPhone.

Descarregue já!

Nesta secção vamos analisar o desempenho no papel dos principais modelos de IA atuais, incluindo o DeepSeek-V3.1, o GPT-5, o Grok 4, o Claude Opus 4.1 e o Gemini 2.5 Pro. Embora os números de benchmark, as janelas de contexto e o suporte a modalidades ofereçam uma base sólida para comparar capacidades, é importante lembrar que a usabilidade no mundo real pode variar dependendo da latência, da fiabilidade e da integração no ecossistema.

Resultados de benchmark

O DeepSeek-V3.1 mostra um progresso forte em tarefas de programação e de raciocínio, especialmente em comparação com as suas versões anteriores. No SWE-bench Verified, obtém 66,0, significativamente acima do DeepSeek-R1 (44,6) e perto dos 74,5% do Claude Opus 4.1. No AIME 2025, o seu modo de «pensamento» atinge 88,4%, próximo dos impressionantes 94,6% do GPT-5 e dos 93% do Grok 4.

No LiveCodeBench, um benchmark de programação, o V3.1 atinge 74,8%, novamente competitivo com os quase perfeitos 98% de HumanEval do Grok 4, mas acima dos 63,8% intermédios do Gemini 2.5 Pro. No GPQA Diamond, concebido para raciocínio de nível de pós-graduação, o DeepSeek-V3.1 (80,1%) fica atrás do GPT-5 (88,4%) e do Grok 4 (88%), mas supera o Gemini 2.5 Pro (84%) e o Claude Opus 4.1 (80,9%).

Desempenho do DeepSeek V3.1 [fonte]

Contexto e modalidades

O DeepSeek-V3.1 suporta 128K tokens, o que o coloca atrás da incomparável janela de contexto de 1M do Gemini, dos 400K do GPT-5 e dos 256K do Grok, mas ainda assim acima de muitos concorrentes open source. Ao contrário das suas rivais ocidentais, o DeepSeek mantém-se focado em texto, com chamada de ferramentas estruturada e suporte para agentes, sem geração nativa de imagem ou vídeo.

Data de corte do conhecimento

O DeepSeek-V3.1 foi lançado em agosto de 2025, o que lhe dá um dos horizontes de treino mais recentes, logo atrás do Claude Opus 4.1 (julho de 2025). O GPT-5 fica atrás, com uma data de corte de setembro de 2024, enquanto o Grok 4 (novembro de 2024) e o Gemini 2.5 Pro (janeiro de 2025) ficam a meio.

ModeloAIME 2025GPQASWE-benchÍndice de inteligênciaJanela de contextoData de corteModalidades de entradaModalidades de saída
GPT-594,6%88,4%74,9%69400k tokens (~600 pág.)set. 2024Texto, imagens, ficheirosTexto, imagens, ficheiros
Grok 493%88%N/A68256k tokens (~384 pág.)nov. 2024Texto, imagens, ficheirosTexto, imagens, vídeo
Claude Opus 4.178%80,9%74,5%49200k tokens (~300 pág.)jul. 2025Texto, imagens, ficheirosTexto, ficheiros
Gemini 2.5 Pro88%84%63,8%651M tokens (~1.500 pág.)jan. 2025Texto, imagens, vídeo, áudio, ficheirosTexto, voz
DeepSeek-V3.188,4%80,1%66,0~55-60*128k tokens (~200 pág.)ago. 2025Texto (chamada de ferramentas, agentes de código, pesquisa)Texto

Casos de uso reais

Os primeiros testes mostram que o DeepSeek-V3.1 traz melhorias notáveis nos fluxos de trabalho de programação do dia a dia, em comparação com o seu antecessor.

  • Navegação em bases de código: o V3.1 consegue localizar e editar os ficheiros certos sem que lhe seja indicado explicitamente onde devem ocorrer as alterações. Isto torna-o mais útil em projetos maiores, onde as estruturas de ficheiros são complexas.
  • Correções de erros complexas: além de simples edições de texto, o modelo lida com problemas mais complicados, como erros de validação e tratamento de datas, produzindo correções mais limpas e menos diffs quebrados do que o V3.
  • Comportamento semelhante ao de um agente: em algumas experiências, o modelo chegou a tentar analisar prompts guardados numa base de dados e propor otimizações, um comportamento que sugere os primeiros passos para um raciocínio mais autónomo.

Ao mesmo tempo, continuam a existir desafios. Os programadores notaram a inserção aleatória de caracteres chineses no código, uma inconsistência que surge de forma imprevisível em diferentes tarefas e temperaturas. Mesmo quando instruído a manter-se em inglês, o problema ainda pode ocorrer. Outra fragilidade está na precisão da chamada de ferramentas: embora o V3.1 estruture corretamente as chamadas de função, as suas taxas de recall e precisão continuam abaixo de líderes proprietários como o GPT-5 ou o Claude Sonnet.

No geral, o V3.1 demonstra que os modelos open source estão a tornar-se rapidamente ferramentas práticas para fluxos de trabalho reais de programação e de agentes, mas as suas peculiaridades mostram que ainda não está ao mesmo nível de fiabilidade dos melhores sistemas comerciais.

Conclusão

O DeepSeek-V3.1 mostra como a IA open source está a aproximar-se rapidamente. Reduz a distância em relação aos melhores sistemas proprietários em programação e raciocínio, provando que o desempenho avançado já não está reservado aos modelos fechados. Embora o GPT-5 continue a liderar em matemática e o Grok domine os benchmarks de programação, a combinação do V3.1 de resultados fortes, baixo custo e disponibilidade aberta torna-o uma das escolhas mais práticas para programadores e investigadores.

Para equipas dispostas a trocar um pouco de polimento por flexibilidade e preço, o V3.1 representa uma alternativa séria, e um sinal de que a próxima vaga de modelos abertos pode desafiar os melhores do setor.