A 31 de julho de 2026 a DeepSeek lançou o DeepSeek-V4-Flash-0731, o lançamento oficial do V4-Flash que substitui a pré-visualização de abril. É a mesma arquitetura, e foi lançado ao mesmo preço, embora esse preço tenha subido entretanto: a DeepSeek passou a tarifas de pico e fora de pico a 16 de agosto de 2026. O salto de capacidade é grande: o próprio cartão do modelo da DeepSeek coloca-o em 82,7 no Terminal Bench 2.1, uma subida face aos 61,8 da pré-visualização, e acima da muito maior pré-visualização do V4-Pro, com 72,1. O Artificial Analysis subiu-o de 40 para 50 no seu Intelligence Index, o terceiro no campo aberto.

A série V4 chegou pela primeira vez a 24 de abril de 2026 como pré-visualizações, uma família Mixture-of-Experts de código aberto com uma janela de contexto nativa de um milhão de tokens. O DeepSeek-V4-Pro tem 1,6 biliões de parâmetros totais com 49 mil milhões ativados por token. O DeepSeek-V4-Flash tem 284 mil milhões no total com 13 mil milhões ativados. Ambos estão disponíveis no Hugging Face sob a Licença MIT, através da API da DeepSeek e via chat.deepseek.com. Este guia aborda a arquitetura, o histórico de benchmarks e o que a versão 0731 altera.

A DeepSeek é um dos nomes de destaque na IA open source, a categoria de modelos cujos pesos qualquer pessoa pode descarregar, correr e ajustar gratuitamente.

A grande promessa é a eficiência a um comprimento de contexto extremo. A um milhão de tokens, o V4-Pro usa apenas 27% dos FLOPs de inferência por token único e 10% do tamanho da cache KV do DeepSeek V3.2. O V4-Flash leva isso ainda mais longe, para 10% dos FLOPs e 7% da cache. No Codeforces, o V4-Pro atinge uma pontuação de 3.206, ficando em 23.º lugar entre concorrentes humanos, e nos benchmarks padrão de raciocínio e agênticos situa-se entre o GPT-5.2 e o GPT-5.4. O GPT-5.5 da OpenAI, lançado um dia antes do V4, a 23 de abril, empurra a fronteira fechada ainda mais longe.

O DeepSeek V4 está perto do topo do nosso guia aos melhores modelos de IA open source. No Artificial Analysis, a ordem no campo aberto é agora Kimi K3 com 57, GLM-5.2 com 51 e V4-Flash-0731 com 50, com o V4-Pro mais atrás, com 44. O GLM 5.2 é o porta-estandarte da família GLM da Zhipu. O V4 mantém uma clara vantagem em contexto longo, onde mais nenhum modelo aberto corre um milhão de tokens tão barato.

Para quem usa a Fello AI no Mac, iPhone ou iPad, o DeepSeek V4 fica lado a lado com o ChatGPT, o Claude, o Gemini, o Kimi e o Perplexity numa única aplicação por $9.99/mês, com mais de 25.000 avaliações de cinco estrelas e sem subscrições extra por modelo.

Os Pontos Principais

  • O DeepSeek-V4-Flash-0731 foi lançado a 31 de julho de 2026 e substituiu a pré-visualização de abril. Mesma arquitetura 284B/13B, mesmo preço, desempenho agêntico muito mais forte.
  • O Terminal Bench 2.1 passou de 61,8 para 82,7 no próprio harness da DeepSeek, ultrapassando a pré-visualização do V4-Pro, com 72,1. O Artificial Analysis, a correr o seu próprio harness, atribui-lhe uma pontuação mais baixa, de 78,7.
  • $0.22 / $0.66 por milhão de tokens fora de pico, duplicando para $0.44 / $1.32 em pico. A antiga tarifa fixa de $0.14 / $0.28 foi retirada a 16 de agosto de 2026, pelo que qualquer valor de custo por tarefa de índice publicado antes dessa data já não se aplica.
  • Ambos os modelos têm licença MIT, com um contexto nativo de 1M tokens e até 384K tokens de saída. O V4-Pro continua a ser uma pré-visualização.
  • O módulo de descodificação especulativa DSpark vem agora incluído no checkpoint, ativável com uma única flag no vLLM ou no SGLang.

O que é o DeepSeek V4

Do editor

Todos os modelos de IA numa só aplicação

Fello AI reúne GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 e mais numa só aplicação nativa para Mac e iPhone.

Descarregue já!

O DeepSeek V4 é a família de modelos porta-estandarte de quarta geração da DeepSeek, o laboratório de IA sediado em Hangzhou que abalou os mercados globais em janeiro de 2025 com o modelo de raciocínio de baixo custo R1. O V4 substituiu o DeepSeek V3 e o V3.2, retirados após 24 de julho de 2026. Para o próximo modelo de raciocínio da DeepSeek, o R2, acompanhamos os rumores e o calendário de lançamento em separado.

O V4-Flash já não é uma pré-visualização. A versão 0731 é o lançamento oficial, e a DeepSeek descreve-a como tendo «capacidades agênticas substancialmente melhoradas» em relação à pré-visualização que substitui. O V4-Pro continua classificado como pré-visualização. A DeepSeek descreve o V4 como a primeira família de modelos abertos construída de raiz em torno de contextos de um milhão de tokens como predefinição, em vez de uma funcionalidade acrescentada. O relatório técnico enquadra isto como a quebra da «barreira de eficiência do processamento de contexto ultralongo» e posiciona o contexto longo como o próximo eixo de escala em tempo de teste, depois da onda de modelos de raciocínio que o R1, o o1 e os seus sucessores abriram.

Ambos os modelos V4 são open source, publicados na coleção DeepSeek no Hugging Face. Os programadores podem descarregar os pesos, corrê-los localmente e ajustá-los. A API já está ativa em api-docs.deepseek.com, e suporta tanto o formato OpenAI ChatCompletions como o formato Anthropic API.

Desempenho em benchmarks do DeepSeek-V4-Pro-Max e dos seus equivalentes.

Dois modelos na série V4

O DeepSeek V4 é lançado em dois tamanhos, ambos Mixture-of-Experts.

ModeloParâmetros TotaisParâmetros AtivosCamadasDimensão OcultaExperts EncaminhadosExperts AtivosTokens de Treino
DeepSeek-V4-Flash284B13B434.096256632T
DeepSeek-V4-Pro1.6T49B617.168384633T

Cada modelo tem um expert partilhado, além dos experts encaminhados listados acima. As primeiras três camadas MoE usam encaminhamento Hash, que atribui experts através de um hash fixo do ID do token, enquanto as restantes usam o encaminhamento aprendido padrão do DeepSeekMoE. Ambos os modelos têm a Multi-Token Prediction ativada com profundidade 1, a mesma estratégia MTP usada no V3.

O V4-Flash é posicionado como a opção predefinida e económica para a maioria das implementações. O V4-Pro é o modelo de fronteira, direcionado para tarefas em que a inteligência máxima importa mais do que o preço por token. Ambos suportam o mesmo contexto de 1M e as mesmas capacidades agênticas, e ambos oferecem os modos Thinking e Non-Thinking.

A grande aposta arquitetónica

A maior mudança no V4 é a pilha de atenção. A equipa da DeepSeek argumenta que o custo quadrático da atenção padrão é agora a restrição limitadora para mais progresso, sobretudo à medida que os modelos correm ciclos agênticos mais longos e processam conjuntos de documentos maiores. O V4 remodela a atenção para atacar esse custo.

Três mudanças arquitetónicas sustentam este lançamento:

  1. Um mecanismo de atenção híbrido que combina Compressed Sparse Attention (CSA) e Heavily Compressed Attention (HCA).
  2. Manifold-Constrained Hyper-Connections (mHC), uma melhoria das ligações residuais concebida para estabilidade numérica em pilhas profundas.
  3. Uma mudança para o otimizador Muon (a partir do AdamW, para a maioria dos parâmetros), que a DeepSeek reporta proporcionar uma convergência mais rápida e um treino mais estável à escala de biliões de parâmetros.

Outros detalhes herdados do V3 incluem o DeepSeekMoE com experts encaminhados e partilhados de granularidade fina, precisão FP8 para a maioria dos pesos, Multi-Token Prediction, e o tokenizador com vocabulário de 128K. Os pesos dos experts encaminhados são agora armazenados em FP4, o que reduz a memória para metade face ao FP8 e abre caminho a novos ganhos de eficiência em hardware que ofereça cálculo FP4 mais rápido.

Atenção híbrida CSA e HCA

A atenção padrão dos transformers olha para todos os tokens anteriores em cada novo token. A um milhão de tokens, isto é insustentável, tanto em FLOPs como no tamanho da cache KV. O V4 divide o problema em duas passagens complementares.

A Compressed Sparse Attention (CSA) começa por comprimir as caches KV ao longo da dimensão da sequência (com uma taxa de compressão de 4 no V4), aplicando depois a DeepSeek Sparse Attention, introduzida no V3.2. Um indexador lightning escolhe as k entradas KV comprimidas mais relevantes para cada consulta. O V4-Pro seleciona as 1.024 melhores, o V4-Flash seleciona as 512 melhores. É acrescentada, à parte, uma pequena janela deslizante de 128 tokens para que o contexto local nunca seja perdido.

A Heavily Compressed Attention (HCA) aplica uma taxa de compressão muito mais agressiva, de 128, mas depois realiza atenção densa sobre essa representação comprimida. Isto dá ao modelo uma visão global e barata de tokens distantes em cada camada.

As camadas CSA e HCA são intercaladas ao longo da rede. As duas primeiras camadas do V4-Flash usam atenção de janela deslizante pura, enquanto o V4-Pro começa com camadas HCA. O resultado é que o modelo pode alternar entre consultas esparsas precisas (CSA) e contexto comprimido amplo (HCA) em cada profundidade, em vez de escolher uma estratégia à partida.

Dados de treino, computação e otimizador

O V4-Flash foi pré-treinado com 32 biliões de tokens. O V4-Pro foi pré-treinado com 33 biliões. Ambos usaram um plano de tamanho de lote que sobe até um máximo de 75,5 milhões de tokens para o Flash e 94,4 milhões de tokens para o Pro, mantendo-se depois nesse valor durante a maior parte do treino.

O comprimento da sequência de treino foi alargado em fases: 4K, depois 16K, 64K e, por fim, 1M. A atenção densa correu durante o primeiro bilião de tokens (mais tempo para o Pro), após o que a atenção esparsa foi introduzida a um comprimento de sequência de 64K e mantida durante o resto do treino. O indexador lightning foi aquecido numa breve fase intermédia antes de arrancar o treino CSA completo.

A equipa mudou para o Muon na maioria dos parâmetros, mantendo o AdamW apenas para os embeddings, a cabeça de previsão e os pesos de RMSNorm. A taxa de aprendizagem de pico foi de 2,7e-4 para o Flash e 2,0e-4 para o Pro, decaindo segundo um plano cosseno na reta final.

O treino com reconhecimento de quantização FP4 foi aplicado aos pesos dos experts MoE e ao percurso QK do indexador. A DeepSeek reporta também duas novas técnicas de estabilidade que reduzem substancialmente os picos de perda à escala de biliões de parâmetros:

  • O Anticipatory Routing desacopla as atualizações do backbone e do router, usando os pesos atuais para as features mas pesos históricos para os índices de encaminhamento, ativando-se automaticamente quando é detetado um pico.
  • O SwiGLU Clamping limita as componentes linear e de gate do SwiGLU para estabilizar as ativações.

Pós-treino com On-Policy Distillation

O pipeline de pós-treino é onde o V4 mais claramente diverge do V3. Em vez de correr uma única fase grande e mista de Reinforcement Learning sobre um modelo generalista, a DeepSeek treina um expert especialista separado para cada domínio (matemática, programação, tarefas de agente, seguimento de instruções, e assim por diante). Cada expert passa por Supervised Fine-Tuning com dados de domínio de alta qualidade, seguido de RL com Group Relative Policy Optimization (GRPO) e modelos de recompensa específicos do domínio.

O modelo final unificado é depois treinado por On-Policy Distillation (OPD), em que atua como estudante a otimizar a perda KL inversa face ao conjunto de professores especialistas. É este o passo que reúne toda a especialização de domínio num único modelo coerente. É a mesma receita para a qual o Kimi K2.6 e vários outros modelos abertos recentes convergiram, e é uma das razões pelas quais os modelos abertos reduziram a distância face aos sistemas de fronteira fechados em benchmarks especializados.

A DeepSeek construiu também uma infraestrutura de sandbox para RL agêntico, um serviço de rollout tolerante a falhas e preemptível, e uma framework de RL escalada capaz de correr episódios em contextos de milhões de tokens. São o tipo de investimentos invisíveis nas tabelas de benchmarks, mas que determinam se o trabalho de agente de longo horizonte é realmente treinável à escala.

Resultados de benchmarks

O relatório técnico da DeepSeek publica números diretos entre o DeepSeek-V4-Pro-Max e o Claude Opus 4.6-Max, o GPT-5.4-xHigh, o Gemini-3.1-Pro-High, e os modelos abertos líderes Kimi K2.6-Thinking e GLM-5.1-Thinking, entretanto atualizado pelo GLM 5.2. A tabela abaixo reúne o conjunto completo de linhas. A nossa comparação completa DeepSeek vs Claude coloca os dois lado a lado.

BenchmarkOpus 4.6 MaxGPT-5.4 xHighGemini 3.1 Pro HighKimi K2.6GLM-5.1DeepSeek V4-Pro-Max
MMLU-Pro89,187,591,087,186,087,5
SimpleQA-Verified46,245,375,636,938,157,9
Chinese-SimpleQA76,476,885,975,975,084,4
GPQA Diamond91,393,094,390,586,290,1
HLE (sem ferramentas)40,039,844,436,434,737,7
LiveCodeBench88,891,789,693,5
Codeforces (pontuação)3.1683.0523.206
HMMT fev. 202696,297,794,792,789,495,2
IMOAnswerBench75,391,481,086,083,889,8
Apex34,554,160,924,011,538,3
Apex Shortlist85,978,189,175,572,490,2
MRCR 1M92,976,383,5
CorpusQA 1M71,753,862,0
Terminal Bench 2.065,475,168,566,763,567,9
SWE Verified80,880,680,280,6
SWE Pro57,357,754,258,658,455,4
SWE Multilingual77,576,773,376,2
BrowseComp83,782,785,983,279,383,4
HLE com ferramentas53,152,051,654,050,448,2
GDPval-AA (Elo)1.6191.6741.3141.4821.5351.554
MCPAtlas Public73,867,269,266,671,873,6
Toolathlon47,254,648,850,040,751,8

Há alguns aspetos que se destacam.

O V4-Pro-Max estabelece um novo estado da arte para modelos abertos no SimpleQA-Verified, com 57,9%, uma subida de 20 pontos face ao melhor modelo aberto anterior. Vence de forma clara no LiveCodeBench (93,5%), na pontuação do Codeforces (3.206), no Apex Shortlist (90,2%) e no Toolathlon (51,8%). No Codeforces em particular, 3.206 coloca o modelo em 23.º lugar entre concorrentes humanos, a primeira vez que um modelo aberto iguala um modelo de fronteira fechado em programação competitiva.

A distância face aos modelos de fronteira proprietários reduziu-se, mas não se fechou. O Gemini 3.1 Pro continua a liderar em conhecimento geral (MMLU-Pro, SimpleQA, GPQA Diamond, HLE, Chinese-SimpleQA), o GPT-5.4 lidera em programação agêntica (Terminal Bench 2.0 com 75,1% contra 67,9% do V4-Pro), e o Claude Opus 4.6 lidera na recuperação de contexto longo (MRCR 1M com 92,9% contra 83,5%) e na classificação Elo do GDPval para trabalho economicamente valioso.

A DeepSeek descreve este posicionamento diretamente no paper: o V4-Pro-Max fica «ligeiramente aquém do GPT-5.4 e do Gemini-3.1-Pro» em raciocínio, o que o coloca cerca de três a seis meses atrás da fronteira. Para um modelo open-weight disponível para descarregamento gratuito, é uma mudança significativa face ao ponto em que o R1 deixou as coisas há um ano.

Como o V4-Pro-Max se compara com o Opus 4.6, o GPT-5.4 e o Gemini 3.1 Pro

Ao ler a tabela de benchmarks na horizontal, destacam-se três padrões.

Contra o Claude Opus 4.6, o V4-Pro-Max vence no LiveCodeBench (93,5 contra 88,8), no Codeforces (3.206 contra não testado), no IMOAnswerBench (89,8 contra 75,3), no Apex Shortlist (90,2 contra 85,9) e no Toolathlon (51,8 contra 47,2). O Opus lidera em conhecimento (MMLU-Pro, GPQA Diamond, HLE), na recuperação de contexto longo do MRCR e do CorpusQA, no SWE Multilingual e no GDPval-AA. A leitura é que o V4 é a escolha mais forte para programação competitiva e uso de ferramentas, enquanto o Opus 4.6 continua a ser a escolha mais forte para trabalho de conhecimento e documentos muito longos. Note-se que, entretanto, a Anthropic lançou o Opus 4.7 e o restrito Claude Mythos Preview, ambos acima do Opus 4.6 nestes benchmarks.

Contra o GPT-5.4, o V4-Pro-Max fica ligeiramente à frente no LiveCodeBench, no Codeforces, no Apex Shortlist, no MCPAtlas e no Toolathlon. O GPT-5.4 vence no HMMT, no Apex, no GDPval-AA e no Terminal Bench 2.0 por uma margem larga (75,1 contra 67,9). Entretanto, a OpenAI lançou o GPT-5.5, com 82,7% no Terminal Bench 2.0, o que volta a abrir a distância em programação agêntica.

Contra o Gemini 3.1 Pro, o V4-Pro-Max vence no LiveCodeBench, no Codeforces, no IMOAnswerBench, no Apex Shortlist, no CorpusQA 1M e no Toolathlon, e fica quase empatado na maioria dos restantes. O Gemini mantém as suas vantagens mais claras em conhecimento geral do mundo (SimpleQA-Verified com 75,6, MMLU-Pro com 91,0, GPQA Diamond com 94,3).

Programação agêntica e uso de ferramentas

A DeepSeek apostou fortemente na programação agêntica como narrativa de implementação. A equipa nota explicitamente que o V4 está «perfeitamente integrado com agentes de IA líderes como o Claude Code, o OpenClaw e o OpenCode», e afirma que o V4 já está a alimentar a sua própria programação agêntica interna. A Alibaba seguiu o mesmo guião em maio com o Qwen3.7-Max, que suporta nativamente o protocolo Anthropic API e demonstrou, no lançamento, uma sessão de programação autónoma de 35 horas. Um PDF de amostra no anúncio foi gerado do início ao fim pelo V4-Pro.

Em benchmarks agênticos, o V4-Pro-Max regista 80,6% no SWE-Bench Verified, 55,4% no SWE-Bench Pro, 76,2% no SWE Multilingual, 67,9% no Terminal Bench 2.0, 73,6% no MCPAtlas e 51,8% no Toolathlon. Os números do MCPAtlas e do Toolathlon são importantes porque estes benchmarks avaliam um leque alargado de ferramentas externas e serviços MCP, pelo que uma pontuação forte indica que o modelo generaliza para além do harness de agente interno que a DeepSeek usou durante o RL.

Esses valores são da pré-visualização de abril, e a versão 0731 inverteu essa conclusão. Na pré-visualização, o V4-Flash-Max era claramente o agente mais fraco, descendo dos 67,9% do V4-Pro para 56,9% no Terminal Bench 2.0. No lançamento oficial, o próprio cartão da DeepSeek coloca o V4-Flash-0731 em 82,7 no Terminal Bench 2.1, contra os 72,1 da pré-visualização do V4-Pro, com ganhos equivalentes no NL2Repo (54,2 contra 38,5), no Cybergym (76,7 contra 52,7) e no DeepSWE (54,4 contra 12,8). A DeepSeek enquadra isto como superar o Pro «apesar da sua contagem de parâmetros ativados muito menor».

Por isso, o conselho prático inverteu-se. Comece com o V4-Flash para trabalho de agente, não só para chat, e recorra ao V4-Pro apenas quando a profundidade de conhecimento em bruto for o que importa. Uma ressalva sobre estes números: vêm do próprio harness da DeepSeek, com o esforço de raciocínio máximo. O Artificial Analysis, a correr o seu próprio harness, atribui ao V4-Flash-0731 78,7 no mesmo benchmark. Ambos são resultados reais de configurações diferentes, por isso trate o 82,7 como o valor do fornecedor, não como um valor neutro.

A DeepSeek reporta que, em avaliação interna, o V4-Pro-Max «supera o Claude Sonnet 4.5 e aproxima-se do nível do Opus 4.5» em tarefas de agente. As diferenças em benchmarks públicos face aos modelos fechados mais recentes mantêm-se, mas o número interno sugere que a distância em cargas de trabalho reais é menor do que as pontuações de destaque sugerem.

Raciocínio matemático

A matemática formal é uma área em que o V4 claramente se destaca da concorrência. No Putnam-200 Pass@8 com ferramentas mínimas (a configuração introduzida pelo Seed-Prover), o V4-Flash-Max pontua 81,0, contra 35,5 do Seed-2.0-Pro, 26,5 do Gemini-3-Pro e 26,5 do Seed-1.5-Prover.

Na configuração de fronteira Putnam-2025, que combina raciocínio informal com verificação formal e mais computação, o V4 atinge um 120/120 perfeito em provas, empatando com o Axiom e à frente do Aristotle (100/120) e do Seed-1.5-Prover (110/120).

Em benchmarks de matemática de competição, o HMMT de fevereiro de 2026 com 95,2 e o IMOAnswerBench com 89,8 colocam o V4-Pro-Max ao alcance do GPT-5.4 (97,7 e 91,4) e à frente do Gemini 3.1 Pro no IMOAnswerBench.

O contexto de um milhão de tokens na prática

Ambos os modelos V4 suportam nativamente um contexto de 1M tokens. Isto é a predefinição, não um nível especial de contexto longo, e não acarreta qualquer sobretaxa de preço por contexto longo.

No MRCR, um benchmark de recuperação em contexto, o V4-Pro mantém uma precisão de recuperação de 94% até 128K tokens e de 82% a 512K tokens, ficando ainda em 66% a 1M tokens. A DeepSeek reporta que o V4-Pro «supera o Gemini-3.1-Pro na tarefa MRCR» (83,5 contra 76,3), mas «continua atrás do Claude Opus 4.6» (92,9).

No CorpusQA, um benchmark mais próximo do uso real de documentos longos, o V4-Pro atinge 62,0% a 1M tokens, superando o Gemini 3.1 Pro, com 53,8%. A conclusão é que, para perguntas e respostas sobre documentos longos, o V4-Pro é genuinamente competitivo com os líderes fechados em contexto longo, e claramente à frente do campo open source anterior.

O relatório técnico enquadra o contexto longo como o próximo eixo de escala, abrindo caminho a sessões agênticas mais longas, análises entre documentos mais elaboradas e paradigmas exploratórios como a aprendizagem online. Nada disto é possível se a inferência a 1M tokens for demasiado cara para correr, e é aí que entram os ganhos de eficiência arquitetónica.

Eficiência e poupanças na cache KV

Os números de eficiência de destaque, tal como reportados no relatório técnico, a um contexto de 1M tokens:

ModeloFLOPs vs V3.2Cache KV vs V3.2
DeepSeek-V4-Pro27% (3,7x menos)10% (9,5x mais pequena)
DeepSeek-V4-Flash10% (9,8x menos)7% (13,7x mais pequena)

São estes números que tornam os contextos de 1M economicamente viáveis. Uma cache KV 10x mais pequena significa que uma única GPU pode servir aproximadamente 10x mais sessões concorrentes de contexto longo, o que muda diretamente a tabela de preços para cargas de trabalho agênticas e de investigação.

Os ganhos vêm de três fontes: a atenção esparsa via CSA, a compressão pesada via HCA, e o armazenamento em FP4 dos pesos dos experts MoE. Em hardware futuro que ofereça cálculo FP4 mais rápido, a DeepSeek estima mais um terço de eficiência acima dos números atuais.

Modos de esforço de raciocínio

Cada modelo V4 expõe três níveis de esforço de raciocínio: Non-Think, High e Max. O Max usa contextos mais longos e penalizações de comprimento reduzidas no RL, e é o modo que deve ser usado para as tarefas de raciocínio mais difíceis.

BenchmarkFlash Non-ThinkFlash HighFlash MaxPro Non-ThinkPro HighPro Max
MMLU-Pro83,086,486,282,987,187,5
SimpleQA-Verified23,128,934,145,046,257,9
GPQA Diamond71,287,488,172,989,190,1
HLE8,129,434,87,734,537,7
LiveCodeBench55,288,491,656,889,893,5
HMMT fev. 202640,891,994,831,794,095,2
Terminal Bench 2.049,156,656,959,163,367,9
SWE Verified73,778,679,073,679,480,6
MRCR 1M37,576,978,744,783,383,5

Duas observações. Primeira, os modos de raciocínio importam muito mais do que a dimensão em bruto para tarefas de raciocínio difíceis: o HLE passa de 7,7 (Pro Non-Think) para 37,7 (Pro Max), um salto de quase 5x. Segunda, o Flash Max fica surpreendentemente perto do Pro nos benchmarks de raciocínio quando lhe é dado orçamento de pensamento suficiente, razão pela qual a DeepSeek chama ao Flash «uma arquitetura altamente económica para tarefas de raciocínio complexas». Para tarefas de conhecimento em que a contagem de parâmetros importa, o Pro mantém uma clara vantagem.

Suporte Huawei Ascend e hardware chinês

A par do lançamento do V4, a Huawei anunciou que o seu supernó Ascend, alimentado pelos novos chips de IA Ascend 950, vai suportar totalmente o DeepSeek V4 desde o início. Este é um sinal notável, porque significa que o V4 é imediatamente implementável, à escala, em hardware de IA doméstico chinês, sem dependência de GPUs fabricadas nos EUA sujeitas a restrições de exportação.

Esta combinação reflete um esforço mais amplo da infraestrutura de IA chinesa para construir uma pilha autocontida: pesos chineses, chips chineses, software de inferência chinês. Para empresas e grupos de investigação a operar na China continental, isto provavelmente importa mais do que qualquer número isolado de benchmark.

Preços e API

O DeepSeek V4 está disponível na API da DeepSeek desde 24 de abril de 2026. Os utilizadores da API não precisam de alterar o seu base_url, apenas o parâmetro model, e deepseek-v4-flash serve agora a versão 0731 sem qualquer alteração no local da chamada:

  • deepseek-v4-pro para o V4-Pro
  • deepseek-v4-flash para o V4-Flash

Ambos os modelos suportam o formato OpenAI ChatCompletions e o formato Anthropic API. Ambos expõem um contexto de 1M e os modos duplos Thinking e Non-Thinking, configuráveis através do parâmetro de modo de pensamento.

Os preços finais já estão publicados, e dependem do horário. O V4-Flash custa $0.22 por milhão de tokens de entrada fora de pico num cache miss e $0.44 em pico, com acertos de cache a $0.007 e $0.014, e saída a $0.66 e $1.32. O V4-Pro custa $0.66 / $0.022 / $1.98 fora de pico e $1.32 / $0.044 / $3.96 em pico, nas mesmas três linhas. Ambos mantêm o contexto completo de 1M sem sobretaxa e limitam a saída a 384K tokens. O Flash permite 2.500 pedidos concorrentes, contra os 500 do Pro.

🔴 Os antigos endpoints desapareceram. deepseek-chat e deepseek-reasoner foram retirados após 24 de julho de 2026, 15:59 UTC, e a documentação da DeepSeek lista agora exatamente dois IDs de modelo. Se alguma dessas strings ainda estiver num ficheiro de configuração algures, essas chamadas falham. A DeepSeek também já disse que vai mudar para preços de pico e fora de pico, a 2x a tarifa normal nas horas de pico, mas ainda não anunciou uma data.

Isso mantém intacto o argumento comercial a favor da DeepSeek. Contra modelos fechados de topo a $5/$30 e $5/$25 por milhão de tokens, o V4-Flash é aproximadamente 36x mais barato na entrada. A distância é muito menor face aos níveis mais baratos, onde o corte de preços da OpenAI de julho de 2026 baixou o seu modelo de entrada para $0.20/$1.20. Para uma análise completa entre níveis da API, acesso gratuito e a aplicação de consumo, veja o nosso guia de preços do DeepSeek.

Disponibilidade e migração a partir do V3

O V4 está disponível hoje de três formas.

chat.deepseek.com. O chatbot web expõe o V4 através de dois interruptores, o Modo Especialista e o Modo Instantâneo, que correspondem ao V4-Pro-Max e a respostas rápidas ao estilo V4-Flash. Não é preciso uma conta nova se já usar o DeepSeek Chat.

API da DeepSeek. Disponível através de deepseek-v4-pro e deepseek-v4-flash. Ambos os modelos usam por predefinição um contexto de 1M. Os modos Thinking e Non-Thinking são selecionáveis por pedido.

Hugging Face. Os pesos abertos são publicados em huggingface.co/collections/deepseek-ai/deepseek-v4. O relatório técnico completo está disponível em PDF no repositório do V4-Pro. A inferência exige hardware sério para o V4-Pro (dezenas de GPUs para qualquer throughput razoável), mas o V4-Flash, com 13B de parâmetros ativos, está bem ao alcance de uma implementação num único servidor bem equipado.

A migração a partir do V3 é, em grande medida, direta. O tokenizador é compatível (mantém o vocabulário de 128K, os mesmos tokens especiais mais alguns novos para a construção de contexto). A superfície da API para o modo de pensamento não mudou. A principal mudança é o novo contexto predefinido de 1M e os novos IDs de modelo.

Limitações

A DeepSeek é invulgarmente franca no relatório técnico sobre as limitações que restam ao V4.

Complexidade da arquitetura. Para minimizar o risco nas maiores mudanças arquitetónicas (mHC, CSA e HCA híbridos, Muon, FP4), o V4 manteve muitos componentes do V3 já validados. A DeepSeek descreve a arquitetura resultante como «relativamente complexa» e diz que as versões futuras vão tentar «destilar a arquitetura até aos seus desenhos mais essenciais».

Estabilidade do treino. O Anticipatory Routing e o SwiGLU Clamping funcionaram na prática, mas a equipa admite que os seus «princípios subjacentes continuam insuficientemente compreendidos» e aponta a estabilidade do treino como uma área ativa de investigação fundamental.

Distância de conhecimento. O V4-Pro-Max fica atrás do Gemini 3.1 Pro na maioria dos benchmarks intensivos em conhecimento (MMLU-Pro, SimpleQA, GPQA Diamond, HLE). A distância reduziu-se substancialmente, mas não se fechou.

Teto de recuperação em contexto longo. Acima de 128K tokens, a precisão de recuperação começa a degradar-se, descendo para 66% no MRCR a 1M tokens. Isto continua a ser melhor do que a maioria dos modelos abertos e do que o Gemini 3.1 Pro, mas não é a recuperação quase perfeita que alguns benchmarks reportaram para o Claude Opus 4.6.

Tarefas de agente de fronteira. Nos números da pré-visualização de abril, o V4-Pro-Max ficava atrás da fronteira fechada no Terminal Bench 2.0 (67,9) e no SWE Pro (55,4). A versão 0731 reduziu isso consideravelmente do lado do agente, mas os atuais porta-estandartes fechados continuam a liderar no trabalho de programação agêntica mais difícil. Ambos avançaram desde que esta tabela foi publicada, para a linha GPT-5.6 da OpenAI e para o Claude Opus 5.

Multimodal. O V4 é apenas texto. A DeepSeek diz que está «a trabalhar para incorporar capacidades multimodais nos nossos modelos», mas o lançamento atual não aceita imagens, áudio ou vídeo.

O que isto significa para si

Para programadores. O V4-Flash é a predefinição para implementações de grande volume, agora que deepseek-chat e deepseek-reasoner foram retirados. Com 13B de parâmetros ativos, um contexto de um milhão de tokens e os ganhos agênticos da versão 0731, continua a ser uma das formas mais baratas de comprar uma dada quantidade de capacidade medida, embora a subida de preços de agosto de 2026 tenha reduzido bastante essa vantagem. Vale a pena saber antes de o adotar como predefinição: essa pontuação é de uma tabela já desatualizada, e o V4-Flash ainda não tem votos de preferência humana em nenhuma classificação da Arena. O V4-Pro vale uma substituição direta do Claude Opus em programação competitiva, fluxos de agente intensivos em ferramentas, e qualquer tarefa que beneficie de contexto longo.

Para implementações open source e autoalojadas. O V4 é hoje a família de modelos abertos mais forte em programação competitiva e matemática formal, e o primeiro modelo aberto a igualar os sistemas de fronteira fechados no Codeforces. É também o primeiro modelo aberto amplamente implementável construído nativamente para contextos de milhões de tokens. Para qualquer equipa a montar a sua própria pilha de LLM, o V4 redefine substancialmente o cálculo entre construir e comprar.

Para quem constrói agentes. São os ganhos de eficiência do CSA/HCA que transformam ciclos agênticos de 1M tokens de demonstrações de investigação em cargas de trabalho viáveis em produção. A eficiência de tokens em contexto longo traduz-se diretamente num custo mais baixo por tarefa e em sessões de agente mais longas por dólar.

Para utilizadores comuns. Se só quer usar todos os modelos de fronteira sem ter de gerir várias subscrições, a Fello AI reúne o DeepSeek com o ChatGPT, o Claude, o Gemini, o Grok e o Perplexity numa única aplicação nativa para Mac, iPhone e iPad por $9.99/mês, com mais de 25.000 avaliações de cinco estrelas.

O V4 é a prova mais clara até agora de que os modelos abertos fecharam a maior parte da distância face à fronteira de código fechado, ao mesmo tempo que impõem uma vantagem arquitetónica real em eficiência de contexto longo. A próxima pergunta já não é se os modelos abertos conseguem competir na fronteira. É o que se torna possível quando contextos de milhões de tokens forem rotina, e o V4 é o primeiro lançamento construído para responder a isso. A Tencent reforçou esse argumento a 28 de agosto de 2026, ao abrir o Hy4 Preview, com 770 mil milhões de parâmetros, sob Apache 2.0.

FAQ

O que é o DeepSeek-V4-Flash-0731?

É o lançamento oficial do DeepSeek V4-Flash, publicado a 31 de julho de 2026, que substitui a pré-visualização de abril. Mantém a mesma arquitetura de 284B total / 13B ativos e o mesmo contexto de 1M, e acrescenta o que a DeepSeek chama de capacidades agênticas substancialmente melhoradas. Foi lançado com o mesmo preço fixo que a pré-visualização usava, que a DeepSeek substituiu por tarifas de pico e fora de pico a 16 de agosto de 2026. Chamar deepseek-v4-flash dá-lhe automaticamente a versão 0731.

O DeepSeek V4 é gratuito?

Os pesos são. Ambos os modelos V4 são publicados no Hugging Face sob a Licença MIT, pelo que os pode descarregar, correr e ajustar sem custo, desde que tenha o hardware. O chat em chat.deepseek.com é gratuito para utilizadores individuais, e a API é paga por token. Consulte o nosso guia de preços do DeepSeek para a análise completa.

O V4-Flash ou o V4-Pro é melhor para trabalho de agente?

O V4-Flash, desde a versão 0731. O próprio cartão do modelo da DeepSeek coloca o V4-Flash-0731 em 82,7 no Terminal Bench 2.1, contra os 72,1 da pré-visualização do V4-Pro, e também vence no NL2Repo, no Cybergym e no DeepSWE, a cerca de um terço do preço do Pro. O V4-Pro continua a liderar em trabalho intensivo em conhecimento.

Quanto custa a API do DeepSeek V4?

O V4-Flash custa $0.22 por milhão de tokens de entrada num cache miss fora de pico e $0.44 em pico, $0.007 a $0.014 num acerto de cache, e $0.66 a $1.32 por milhão de tokens de saída. O V4-Pro custa $0.66 / $0.022 / $1.98 fora de pico e $1.32 / $0.044 / $3.96 em pico. O contexto completo de 1M não acarreta qualquer sobretaxa de preço em nenhum dos dois modelos.

O DeepSeek V4 consegue lidar com imagens ou áudio?

Não. O V4 é apenas texto. A DeepSeek diz que está «a trabalhar para incorporar capacidades multimodais nos nossos modelos», mas nem o V4-Flash nem o V4-Pro aceitam hoje imagens, áudio ou vídeo.