A corrida da IA open source ficou ainda mais interessante. A startup chinesa DeepSeek apresentou o DeepSeek-V3.1, a sua maior atualização até agora, com raciocínio mais afinado, capacidades de programação mais fortes e novo suporte para chamada de ferramentas e fluxos de trabalho de agentes.
Ao contrário do lançamento anterior, que parecia experimental, o V3.1 chega como um concorrente sério. Com uma janela de contexto de 128K, modos de raciocínio híbridos e uma API drasticamente mais barata do que as suas rivais ocidentais, o modelo foi concebido para aproximar a IA aberta do desempenho do GPT-5, do Grok 4, do Claude Opus e do Gemini 2.5 Pro. Consulte o nosso guia de preços do DeepSeek para conhecer todos os custos da API e os detalhes da versão gratuita. Também o comparamos diretamente com o Grok em termos de custo e limites na nossa comparação entre o DeepSeek e o Grok. Atualização, 26 de setembro de 2026: esse conjunto de comparação é o panorama de agosto de 2025. O GPT-5, o Grok 4, o Claude Opus 4.1 e o Gemini 2.5 Pro já foram substituídos várias vezes, e a própria linha do DeepSeek avançou para o V4 e o V4.1-Flash. Tudo o que se segue é o registo daquilo contra o qual o V3.1 foi medido no lançamento.
Os primeiros benchmarks mostram que o V3.1 não se limita a aproximar-se, mas compete de igual para igual em tarefas de programação e de raciocínio, o que sinaliza que a linha entre os sistemas comerciais fechados e os modelos abertos está a estreitar-se mais rapidamente do que o esperado.
O que muda no DeepSeek V3.1
Quando o DeepSeek-V3 foi lançado, destacou-se como um dos primeiros modelos open source capazes de rivalizar com sistemas comerciais. No entanto, a sua popularidade crescente também expôs fragilidades, sobretudo lentidão na API e uma chamada de ferramentas pouco fiável.
O V3.1 enfrenta estes problemas diretamente, ao mesmo tempo que acrescenta novas capacidades:
- Modos híbridos: alterne entre o modo de «pensamento», para um raciocínio passo a passo, e o modo «sem pensamento», para respostas mais rápidas.
- Chamada de ferramentas mais forte: suporte estruturado para APIs, execução de código e agentes de pesquisa.
- Janela de contexto de 128K: um salto importante para lidar com conversas mais longas ou bases de código maiores.
- Compatibilidade com a API da Claude: integração mais fácil para programadores que já usam o ecossistema da Anthropic.
- Design MoE eficiente: 671 mil milhões de parâmetros, mas apenas 37 mil milhões ativos por token, equilibrando escala e custo.
Estas atualizações tornam o V3.1 um modelo mais fiável e versátil, transformando-o de um lançamento experimental numa opção prática para programação, investigação e fluxos de trabalho de agentes.
Modo híbrido de «pensamento»
Uma funcionalidade de destaque do DeepSeek-V3.1 é o novo sistema de inferência híbrida. Os utilizadores podem agora alternar entre dois modos:
- Modo de pensamento: raciocínio passo a passo para maior precisão em matemática, programação e lógica.
- Modo sem pensamento: respostas mais rápidas e diretas, com custo mais baixo mas ligeiramente menos precisas.
Esta flexibilidade permite aos programadores escolher entre velocidade e precisão, dependendo da tarefa. Os benchmarks mostram claramente o impacto: 88,4% no AIME 2025 no modo de pensamento, superando ligeiramente o R1, e 74,8% no LiveCodeBench, novamente acima do seu antecessor.
Ao oferecer os dois modos, o V3.1 dá aos utilizadores controlo sobre se precisam de uma resposta rápida ou de uma resposta mais cuidada e fundamentada, algo raramente visto em modelos open source.
Comparação técnica
Nesta secção vamos analisar o desempenho no papel dos principais modelos de IA atuais, incluindo o DeepSeek-V3.1, o GPT-5, o Grok 4, o Claude Opus 4.1 e o Gemini 2.5 Pro. Embora os números de benchmark, as janelas de contexto e o suporte a modalidades ofereçam uma base sólida para comparar capacidades, é importante lembrar que a usabilidade no mundo real pode variar dependendo da latência, da fiabilidade e da integração no ecossistema.
Resultados de benchmark
O DeepSeek-V3.1 mostra um progresso forte em tarefas de programação e de raciocínio, especialmente em comparação com as suas versões anteriores. No SWE-bench Verified, obtém 66,0, significativamente acima do DeepSeek-R1 (44,6) e perto dos 74,5% do Claude Opus 4.1. No AIME 2025, o seu modo de «pensamento» atinge 88,4%, próximo dos impressionantes 94,6% do GPT-5 e dos 93% do Grok 4.
No LiveCodeBench, um benchmark de programação, o V3.1 atinge 74,8%, novamente competitivo com os quase perfeitos 98% de HumanEval do Grok 4, mas acima dos 63,8% intermédios do Gemini 2.5 Pro. No GPQA Diamond, concebido para raciocínio de nível de pós-graduação, o DeepSeek-V3.1 (80,1%) fica atrás do GPT-5 (88,4%) e do Grok 4 (88%), mas supera o Gemini 2.5 Pro (84%) e o Claude Opus 4.1 (80,9%).

Contexto e modalidades
O DeepSeek-V3.1 suporta 128K tokens, o que o coloca atrás da incomparável janela de contexto de 1M do Gemini, dos 400K do GPT-5 e dos 256K do Grok, mas ainda assim acima de muitos concorrentes open source. Ao contrário das suas rivais ocidentais, o DeepSeek mantém-se focado em texto, com chamada de ferramentas estruturada e suporte para agentes, sem geração nativa de imagem ou vídeo.
Data de corte do conhecimento
O DeepSeek-V3.1 foi lançado em agosto de 2025, o que lhe dá um dos horizontes de treino mais recentes, logo atrás do Claude Opus 4.1 (julho de 2025). O GPT-5 fica atrás, com uma data de corte de setembro de 2024, enquanto o Grok 4 (novembro de 2024) e o Gemini 2.5 Pro (janeiro de 2025) ficam a meio.
| Modelo | AIME 2025 | GPQA | SWE-bench | Índice de inteligência | Janela de contexto | Data de corte | Modalidades de entrada | Modalidades de saída |
|---|---|---|---|---|---|---|---|---|
| GPT-5 | 94,6% | 88,4% | 74,9% | 69 | 400k tokens (~600 pág.) | set. 2024 | Texto, imagens, ficheiros | Texto, imagens, ficheiros |
| Grok 4 | 93% | 88% | N/A | 68 | 256k tokens (~384 pág.) | nov. 2024 | Texto, imagens, ficheiros | Texto, imagens, vídeo |
| Claude Opus 4.1 | 78% | 80,9% | 74,5% | 49 | 200k tokens (~300 pág.) | jul. 2025 | Texto, imagens, ficheiros | Texto, ficheiros |
| Gemini 2.5 Pro | 88% | 84% | 63,8% | 65 | 1M tokens (~1.500 pág.) | jan. 2025 | Texto, imagens, vídeo, áudio, ficheiros | Texto, voz |
| DeepSeek-V3.1 | 88,4% | 80,1% | 66,0 | ~55-60* | 128k tokens (~200 pág.) | ago. 2025 | Texto (chamada de ferramentas, agentes de código, pesquisa) | Texto |
Casos de uso reais
Os primeiros testes mostram que o DeepSeek-V3.1 traz melhorias notáveis nos fluxos de trabalho de programação do dia a dia, em comparação com o seu antecessor.
- Navegação em bases de código: o V3.1 consegue localizar e editar os ficheiros certos sem que lhe seja indicado explicitamente onde devem ocorrer as alterações. Isto torna-o mais útil em projetos maiores, onde as estruturas de ficheiros são complexas.
- Correções de erros complexas: além de simples edições de texto, o modelo lida com problemas mais complicados, como erros de validação e tratamento de datas, produzindo correções mais limpas e menos diffs quebrados do que o V3.
- Comportamento semelhante ao de um agente: em algumas experiências, o modelo chegou a tentar analisar prompts guardados numa base de dados e propor otimizações, um comportamento que sugere os primeiros passos para um raciocínio mais autónomo.
Ao mesmo tempo, continuam a existir desafios. Os programadores notaram a inserção aleatória de caracteres chineses no código, uma inconsistência que surge de forma imprevisível em diferentes tarefas e temperaturas. Mesmo quando instruído a manter-se em inglês, o problema ainda pode ocorrer. Outra fragilidade está na precisão da chamada de ferramentas: embora o V3.1 estruture corretamente as chamadas de função, as suas taxas de recall e precisão continuam abaixo de líderes proprietários como o GPT-5 ou o Claude Sonnet.
No geral, o V3.1 demonstra que os modelos open source estão a tornar-se rapidamente ferramentas práticas para fluxos de trabalho reais de programação e de agentes, mas as suas peculiaridades mostram que ainda não está ao mesmo nível de fiabilidade dos melhores sistemas comerciais.
Conclusão
O DeepSeek-V3.1 mostra como a IA open source está a aproximar-se rapidamente. Reduz a distância em relação aos melhores sistemas proprietários em programação e raciocínio, provando que o desempenho avançado já não está reservado aos modelos fechados. Embora o GPT-5 continue a liderar em matemática e o Grok domine os benchmarks de programação, a combinação do V3.1 de resultados fortes, baixo custo e disponibilidade aberta torna-o uma das escolhas mais práticas para programadores e investigadores.
Para equipas dispostas a trocar um pouco de polimento por flexibilidade e preço, o V3.1 representa uma alternativa séria, e um sinal de que a próxima vaga de modelos abertos pode desafiar os melhores do setor.