Dne 31. července 2026 DeepSeek vydal DeepSeek-V4-Flash-0731, oficiální verzi V4-Flash, která nahrazuje dubnový preview. Architektura i ceny zůstávají stejné ($0.14 za vstup / $0.28 za výstup na milion tokenů), ale skok ve výkonu je výrazný: vlastní model card DeepSeeku uvádí 82,7 bodů v Terminal Bench 2.1, oproti 61,8 u preview a dokonce nad výsledkem 72,1 pro výrazně větší V4-Pro preview. Artificial Analysis ho posunul z 40 na 50 bodů ve svém Intelligence Index, čímž se V4-Flash-0731 řadí na třetí místo v kategorii open-weight modelů.
Řada V4 se poprvé objevila 24. dubna 2026 jako preview: open source rodina Mixture-of-Experts s nativním kontextovým oknem na jeden milion tokenů. DeepSeek-V4-Pro má 1,6 bilionu celkových parametrů s 49 miliardami aktivovanými na jeden token. DeepSeek-V4-Flash má celkem 284 miliard parametrů s 13 miliardami aktivovanými. Oba modely jsou dostupné na Hugging Face pod MIT licencí, prostřednictvím DeepSeek API a na chat.deepseek.com. Tento průvodce pokrývá architekturu, benchmarkové výsledky a změny přinesené sestavením 0731.
DeepSeek patří mezi přední jména v oblasti open source AI, tedy kategorie modelů, jejichž váhy si kdokoli může stáhnout, spustit a doladit zdarma.
Hlavní příslib modelu je efektivita při extrémně dlouhých kontextech. Na milionu tokenů spotřebuje V4-Pro jen 27 % FLOPs single-tokenové inference a 10 % velikosti KV cache oproti DeepSeek V3.2. V4-Flash to tlačí ještě dál na 10 % FLOPs a 7 % cache. Na Codeforces dosahuje V4-Pro ratingu 3 206 a řadí se na 23. místo mezi lidskými soutěžícími. Na standardních benchmarcích pro uvažování a agentické úlohy se pohybuje mezi GPT-5.2 a GPT-5.4. OpenAI's GPT-5.5, vydaný den před V4 dne 23. dubna, posunul uzavřenou hranici ještě dál.
DeepSeek V4 patří na přední místa našeho průvodce nejlepšími open source AI modely. Na Artificial Analysis aktuálně vedou open-weight modely v pořadí Kimi K3 s 57, GLM-5.2 s 51 a V4-Flash-0731 s 50 body, přičemž V4-Pro dosahuje 44 bodů. GLM 5.2 je vlajkový model Zhipuovy rodiny GLM. V4 si jasně vede na poli dlouhých kontextů, kde žádný jiný open model nezvládá milion tokenů za takovou cenu.
Pro uživatele Fello AI na Macu, iPhonu nebo iPadu je DeepSeek V4 dostupný vedle ChatGPT, Claude, Gemini, Kimi a Perplexity v jediné aplikaci za $9.99/měsíc, s více než 25 000 pětihvězdičkovými recenzemi a bez dalších předplatných za jednotlivé modely.
Klíčové závěry
- DeepSeek-V4-Flash-0731 byl vydán 31. července 2026 a nahradil dubnový preview. Stejná architektura 284B/13B, stejná cena, výrazně lepší agentický výkon.
- Terminal Bench 2.1 vzrostl z 61,8 na 82,7 bodů na vlastním testovacím prostředí DeepSeeku, čímž překonal i V4-Pro preview s 72,1. Artificial Analysis na svém testovacím prostředí dosáhlo nižšího skóre 78,7.
- $0.14 / $0.28 na milion tokenů, což odpovídá $0.03 za úlohu Intelligence Index a je to nejnižší číslo v celém přehledu Artificial Analysis. Gemini 3.6 Flash dosahuje stejného skóre 50 a stojí $0.56.
- Oba modely mají MIT licenci, nativní kontext 1 M tokenů a výstup až 384 K tokenů. V4-Pro je stále ve stavu preview.
- Modul spekulativního dekódování DSpark je nyní součástí checkpointu a aktivuje se jedním přepínačem ve vLLM nebo SGLang.
Co je DeepSeek V4
DeepSeek V4 je rodina modelů čtvrté generace od DeepSeeku, hangzhouské AI laboratoře, která v lednu 2025 otřásla globálními trhy svým nízkopříjmovým modelem pro uvažování R1. V4 nahradil modely DeepSeek V3 a V3.2, které byly vyřazeny po 24. červenci 2026. Příštímu modelu uvažování DeepSeeku, R2, sledujeme zvěsti a termín vydání zvlášť.
V4-Flash již není preview. Sestavení 0731 je oficiálním vydáním a DeepSeek ho popisuje jako model s „výrazně vylepšenými agentickými schopnostmi" oproti nahrazovanému preview. V4-Pro je stále označen jako preview. DeepSeek představuje V4 jako první open source rodinu modelů postavenou od základu kolem kontextů o délce milionu tokenů jako výchozího standardu, nikoli jako přidané funkce. Technická zpráva toto definuje jako překonání „bariéry efektivity při zpracování ultra-dlouhých kontextů" a long context staví jako další osu škálování v době inference, po vlně modelů pro uvažování, kterou otevřely R1, o1 a jejich nástupci.
Oba modely V4 jsou open source, zveřejněné pod kolekcí DeepSeek na Hugging Face. Vývojáři si mohou stáhnout váhy, spustit je lokálně a doladit je. API je dnes k dispozici na api-docs.deepseek.com a podporuje jak formát OpenAI ChatCompletions, tak formát Anthropic API.

Dva modely v řadě V4
DeepSeek V4 se dodává ve dvou velikostech, oba jako Mixture-of-Experts.
| Model | Celkové parametry | Aktivní parametry | Vrstvy | Velikost skryté vrstvy | Routed experti | Aktivní experti | Trénovací tokeny |
|---|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash | 284B | 13B | 43 | 4,096 | 256 | 6 | 32T |
| DeepSeek-V4-Pro | 1.6T | 49B | 61 | 7,168 | 384 | 6 | 33T |
Každý model má jednoho sdíleného experta a výše uvedené routed experty. První tři MoE vrstvy používají hash routing, který přiděluje experty podle pevného hashe ID tokenu, zbývající vrstvy pak standardní naučený routing DeepSeekMoE. Oba modely mají aktivován Multi-Token Prediction s hloubkou 1, stejnou strategii MTP jako V3.
V4-Flash je určen jako výchozí cenově efektivní volba pro většinu nasazení. V4-Pro je frontový model cílený na úlohy, kde maximální inteligence převažuje nad cenou za token. Oba podporují stejný kontext 1 M tokenů a stejné agentické schopnosti a oba nabízejí režimy Thinking a Non-Thinking.
Velká architektonická sázka
Největší změnou ve V4 je zásobník pozornosti. Tým DeepSeeku argumentuje, že kvadratické náklady standardní pozornosti jsou nyní hlavní překážkou dalšího pokroku, zejména když modely procházejí delšími agentickými smyčkami a zpracovávají větší sady dokumentů. V4 přetváří mechanismus pozornosti tak, aby tyto náklady snížil.
Vydání stojí na třech architektonických změnách:
- Hybridní mechanismus pozornosti kombinující Compressed Sparse Attention (CSA) a Heavily Compressed Attention (HCA).
- Manifold-Constrained Hyper-Connections (mHC), vylepšení reziduálních spojení navržené pro numerickou stabilitu v hlubokých zásobnících.
- Přechod na optimizer Muon (od AdamW pro většinu parametrů), který dle DeepSeeku přináší rychlejší konvergenci a stabilnější trénink na úrovni bilionů parametrů.
Další detaily převzaté z V3 zahrnují DeepSeekMoE s jemnozrnnými routed a sdílenými experty, přesnost FP8 pro většinu vah, Multi-Token Prediction a tokenizátor se slovníkem 128 K. Váhy routed expertů jsou nyní uloženy ve formátu FP4, který v porovnání s FP8 snižuje paměťové nároky na polovinu a otevírá cestu k dalším úsporám efektivity na hardwaru, který nabízí rychlejší matematiku ve FP4.
Hybridní pozornost CSA a HCA
Standardní transformerová pozornost se dívá na každý předchozí token pro každý nový token. Na milionu tokenů je to neúnosné, a to jak z hlediska FLOPs, tak velikosti KV cache. V4 rozděluje problém do dvou komplementárních průchodů.
Compressed Sparse Attention (CSA) nejprve komprimuje KV cache podél sekvenční dimenze (s kompresním poměrem 4 ve V4), poté aplikuje DeepSeek Sparse Attention, která byla představena ve V3.2. Rychlý indexer vybírá top-k nejrelevantnějších komprimovaných KV záznamů pro každý dotaz. V4-Pro vybírá top 1 024, V4-Flash top 512. Kratší posuvné okno 128 tokenů je přidáno jako doplněk, aby nikdy nebyl přehlédnut místní kontext.
Heavily Compressed Attention (HCA) používá výrazně agresivnější kompresní poměr 128 a poté provádí hustou pozornost nad touto komprimovanou reprezentací. Díky tomu má model v každé vrstvě levný globální přehled o vzdálených tokenech.
Vrstvy CSA a HCA se v síti střídají. První dvě vrstvy V4-Flash používají čistou pozornost posuvného okna, zatímco V4-Pro začíná vrstvami HCA. Výsledkem je, že model může v každé hloubce přepínat mezi přesnými řídkými vyhledáváními (CSA) a širokým komprimovaným kontextem (HCA), místo aby si dopředu vybral jednu strategii.
Trénovací data, výpočetní zdroje a optimizer
V4-Flash byl předtrénován na 32 bilionech tokenů, V4-Pro na 33 bilionech. Oba využívaly rozvrh velikosti dávky, který stoupá až na maximum 75,5 milionu tokenů pro Flash a 94,4 milionu pro Pro a poté tuto hodnotu drží po většinu tréninku.
Délka trénovací sekvence byla postupně rozšiřována: 4 K, poté 16 K, 64 K a nakonec 1 M tokenů. Hustá pozornost běžela pro první 1 T tokenů (déle pro Pro), poté byla zavedena řídká pozornost na délce sekvence 64 K a využívána po zbytek tréninku. Rychlý indexer byl zahřán v krátkém mezidobí, než byl spuštěn plný trénink CSA.
Tým přešel na Muon pro většinu parametrů, přičemž AdamW byl ponechán pouze pro embeddingy, predikční hlavu a váhy RMSNorm. Maximální rychlost učení byla 2,7e-4 pro Flash a 2,0e-4 pro Pro, s poklesem podle kosinového rozvrhu v závěrečné části.
Trénink s kvantizací FP4 byl aplikován na váhy expertů MoE a cestu indexer QK. DeepSeek také reportuje dvě nové techniky pro stabilizaci, které výrazně snižují výkyvy loss na úrovni bilionů parametrů:
- Anticipatory Routing odděluje aktualizace páteře a routeru, přičemž pro rysy používá aktuální váhy, ale pro indexy routování historické váhy; aktivuje se automaticky při detekci výkyvu.
- SwiGLU Clamping ohraničuje lineární a gate komponenty SwiGLU pro stabilizaci aktivací.
Post-trénink s on-policy distilací
Post-tréninková pipeline je místem, kde se V4 nejvýrazněji odlišuje od V3. Místo spuštění jedné velké smíšené fáze zpětnovazebního učení nad generalistickým modelem trénuje DeepSeek pro každou doménu (matematika, programování, agentické úlohy, plnění instrukcí a další) samostatného odborného experta. Každý expert prochází doladěním pod dohledem (Supervised Fine-Tuning) na vysoce kvalitních doménových datech, po němž následuje reinforcement learning metodou Group Relative Policy Optimization (GRPO) s doménově specifickými modely odměn.
Výsledný jednotný model je pak trénován metodou On-Policy Distillation (OPD), kde funguje jako student optimalizující inverzní KL ztrátu vůči sadě odborných učitelů. Tento krok přenáší veškerou doménovou odbornost do jednoho koherentního modelu. Jde o stejný recept, na který konvergovaly Kimi K2.6 a řada dalších nedávných open modelů, a právě to je jeden z důvodů, proč open modely zúžily mezeru vůči uzavřeným frontovým systémům na odborných benchmarcích.
DeepSeek také vybudoval sandboxovou infrastrukturu pro agentické RL, přerušitelnou a odolnou vůči chybám službu pro rollout a škálovaný RL framework schopný spouštět epizody na kontextech o délce milionu tokenů. Jde o investice, které v tabulkách benchmarků nejsou vidět, ale které rozhodují o tom, zda je práce s dlouhými agentickými sekvencemi vůbec trénovatelná ve větším měřítku.
Výsledky benchmarků
Technická zpráva DeepSeeku zveřejňuje přímá srovnání DeepSeek-V4-Pro-Max s Claude Opus 4.6-Max, GPT-5.4-xHigh, Gemini-3.1-Pro-High a předními open modely Kimi K2.6-Thinking a GLM-5.1-Thinking, který byl od té doby aktualizován na GLM 5.2. Níže je kompletní přehled výsledků.
| Benchmark | Opus 4.6 Max | GPT-5.4 xHigh | Gemini 3.1 Pro High | Kimi K2.6 | GLM-5.1 | DeepSeek V4-Pro-Max |
|---|---|---|---|---|---|---|
| MMLU-Pro | 89.1 | 87.5 | 91.0 | 87.1 | 86.0 | 87.5 |
| SimpleQA-Verified | 46.2 | 45.3 | 75.6 | 36.9 | 38.1 | 57.9 |
| Chinese-SimpleQA | 76.4 | 76.8 | 85.9 | 75.9 | 75.0 | 84.4 |
| GPQA Diamond | 91.3 | 93.0 | 94.3 | 90.5 | 86.2 | 90.1 |
| HLE (no tools) | 40.0 | 39.8 | 44.4 | 36.4 | 34.7 | 37.7 |
| LiveCodeBench | 88.8 | – | 91.7 | 89.6 | – | 93.5 |
| Codeforces (rating) | – | 3,168 | 3,052 | – | – | 3,206 |
| HMMT 2026 Feb | 96.2 | 97.7 | 94.7 | 92.7 | 89.4 | 95.2 |
| IMOAnswerBench | 75.3 | 91.4 | 81.0 | 86.0 | 83.8 | 89.8 |
| Apex | 34.5 | 54.1 | 60.9 | 24.0 | 11.5 | 38.3 |
| Apex Shortlist | 85.9 | 78.1 | 89.1 | 75.5 | 72.4 | 90.2 |
| MRCR 1M | 92.9 | – | 76.3 | – | – | 83.5 |
| CorpusQA 1M | 71.7 | – | 53.8 | – | – | 62.0 |
| Terminal Bench 2.0 | 65.4 | 75.1 | 68.5 | 66.7 | 63.5 | 67.9 |
| SWE Verified | 80.8 | – | 80.6 | 80.2 | – | 80.6 |
| SWE Pro | 57.3 | 57.7 | 54.2 | 58.6 | 58.4 | 55.4 |
| SWE Multilingual | 77.5 | – | – | 76.7 | 73.3 | 76.2 |
| BrowseComp | 83.7 | 82.7 | 85.9 | 83.2 | 79.3 | 83.4 |
| HLE with tools | 53.1 | 52.0 | 51.6 | 54.0 | 50.4 | 48.2 |
| GDPval-AA (Elo) | 1,619 | 1,674 | 1,314 | 1,482 | 1,535 | 1,554 |
| MCPAtlas Public | 73.8 | 67.2 | 69.2 | 66.6 | 71.8 | 73.6 |
| Toolathlon | 47.2 | 54.6 | 48.8 | 50.0 | 40.7 | 51.8 |
Hned několik věcí upoutá pozornost.
V4-Pro-Max nastavuje nový rekord open modelů na SimpleQA-Verified s 57,9 %, což je skok o 20 bodů oproti nejlepšímu předchozímu open modelu. Vítězí také na LiveCodeBench (93,5 %), v ratingu Codeforces (3 206), Apex Shortlist (90,2 %) a Toolathlon (51,8 %). Výsledek 3 206 na Codeforces znamená 23. místo mezi lidskými soutěžícími a je to poprvé, co open model srovnal výkon s uzavřeným frontovým modelem v soutěžním programování.
Mezera vůči proprietárním frontovým modelům se zúžila, ale nezavřela. Gemini 3.1 Pro stále vede ve všeobecných znalostech (MMLU-Pro, SimpleQA, GPQA Diamond, HLE, Chinese-SimpleQA), GPT-5.4 vede v agentickém programování (Terminal Bench 2.0 s 75,1 % vs V4-Pro s 67,9 %) a Claude Opus 4.6 vede ve vyhledávání v dlouhém kontextu (MRCR 1M s 92,9 % vs 83,5 %) a v žebříčku GDPval Elo pro ekonomicky hodnotnou práci.
DeepSeek toto postavení popisuje přímo v technické zprávě: V4-Pro-Max je „těsně pod GPT-5.4 a Gemini-3.1-Pro" v uvažování, tedy přibližně tři až šest měsíců za hranicí. Pro open-weight model dostupný ke stažení zdarma je to výrazný posun oproti tomu, kde R1 věci zanechal před rokem.
Jak si V4-Pro-Max stojí vůči Opus 4.6, GPT-5.4 a Gemini 3.1 Pro
Při čtení srovnávací tabulky vynikají tři vzory.
Oproti Claude Opus 4.6 vítězí V4-Pro-Max na LiveCodeBench (93,5 vs 88,8), Codeforces (3 206 vs netestováno), IMOAnswerBench (89,8 vs 75,3), Apex Shortlist (90,2 vs 85,9) a Toolathlon (51,8 vs 47,2). Opus vede ve znalostech (MMLU-Pro, GPQA Diamond, HLE), ve vyhledávání v dlouhém kontextu na MRCR a CorpusQA, na SWE Multilingual a v GDPval-AA. Závěr je, že V4 je silnější volbou pro soutěžní programování a práci s nástroji, zatímco Opus 4.6 stále převyšuje v práci se znalostmi a velmi dlouhými dokumenty. Anthropic od té doby vydal Opus 4.7 a restricted Claude Mythos Preview, oba nad Opus 4.6 v těchto benchmarcích.
Oproti GPT-5.4 se V4-Pro-Max prosazuje na LiveCodeBench, Codeforces, Apex Shortlist, MCPAtlas a Toolathlon. GPT-5.4 vítězí na HMMT, Apex, GDPval-AA a Terminal Bench 2.0 s výrazným náskokem (75,1 vs 67,9). OpenAI od té doby vydal GPT-5.5 s výsledkem 82,7 % na Terminal Bench 2.0, čímž znovu rozevřel mezeru v agentickém programování.
Oproti Gemini 3.1 Pro vítězí V4-Pro-Max na LiveCodeBench, Codeforces, IMOAnswerBench, Apex Shortlist, CorpusQA 1M a Toolathlon a na většině ostatních benchmarků se přiblíží na dosah. Gemini si drží největší výhodu ve všeobecných znalostech (SimpleQA-Verified 75,6, MMLU-Pro 91,0, GPQA Diamond 94,3).
Agentické programování a práce s nástroji
DeepSeek se výrazně zaměřil na agentické programování jako svůj deployment příběh. Tým výslovně uvádí, že V4 je „bezproblémově integrován s předními AI agenty jako Claude Code, OpenClaw a OpenCode" a říká, že V4 již pohání vlastní interní agentické programování DeepSeeku. Alibaba šel v květnu stejnou cestou s Qwen3.7-Max, který nativně podporuje protokol Anthropic API a při svém spuštění předvedl 35hodinový autonomní coding run. Ukázkové PDF v oznámení bylo od začátku do konce vygenerováno modelem V4-Pro.
Na agentických benchmarcích dosahuje V4-Pro-Max 80,6 % na SWE-Bench Verified, 55,4 % na SWE-Bench Pro, 76,2 % na SWE Multilingual, 67,9 % na Terminal Bench 2.0, 73,6 % na MCPAtlas a 51,8 % na Toolathlon. Výsledky MCPAtlas a Toolathlon jsou důležité, protože tyto benchmarky hodnotí širokou škálu externích nástrojů a MCP služeb, takže vysoké skóre naznačuje, že model generalizuje i za hranice toho, jaký interní agentický harness DeepSeek použil při RL.
Tato čísla pocházejí z dubnového preview a sestavení 0731 tento závěr obrátilo. V preview byl V4-Flash-Max jasně slabším agentem, jehož výsledek klesl z 67,9 % V4-Pro na 56,9 % na Terminal Bench 2.0. V oficiálním vydání vlastní model card DeepSeeku uvádí V4-Flash-0731 na 82,7 bodech Terminal Bench 2.1 oproti 72,1 pro V4-Pro preview, se srovnatelnými zisky na NL2Repo (54,2 vs 38,5), Cybergym (76,7 vs 52,7) a DeepSWE (54,4 vs 12,8). DeepSeek to hodnotí jako porážku Pro „i přes výrazně menší počet aktivovaných parametrů".
Praktické doporučení se tedy obrátilo. Pro agentickou práci začněte s V4-Flash, nejen pro chat, a po V4-Pro sáhněte jen tehdy, kde záleží na hloubce znalostí. Jedna výhrada k těmto číslům: pocházejí z vlastního testovacího prostředí DeepSeeku při maximálním reasoning effortu. Artificial Analysis na svém testovacím prostředí hodnotí V4-Flash-0731 na 78,7 bodech na stejném benchmarku. Oba jsou skutečnými výsledky z různých nastavení, takže číslo 82,7 berte jako číslo od výrobce, nikoli jako neutrální hodnotu.
DeepSeek uvádí, že v interním hodnocení V4-Pro-Max „předčí Claude Sonnet 4.5 a blíží se úrovni Opus 4.5" v agentických úlohách. Mezery v veřejných benchmarcích vůči novějším uzavřeným modelům přetrvávají, ale interní číslo naznačuje, že mezera na reálných pracovních zátěžích je menší, než napovídají headline výsledky.
Matematické uvažování
Formální matematika je oblastí, kde V4 ostatní modely jasně překonává. Na Putnam-200 Pass@8 s minimálními nástroji (nastavení zavedené Seed-Proverem) dosahuje V4-Flash-Max skóre 81,0 oproti 35,5 pro Seed-2.0-Pro, 26,5 pro Gemini-3-Pro a 26,5 pro Seed-1.5-Prover.
Na frontovém nastavení Putnam-2025, které kombinuje neformální uvažování s formální verifikací a větším výpočetním výkonem, dosahuje V4 dokonalého výsledku 120/120, čímž se rovná Axiomu a předčí Aristotle (100/120) a Seed-1.5-Prover (110/120).
Na soutěžních matematických benchmarcích staví HMMT 2026 February s výsledkem 95,2 a IMOAnswerBench s 89,8 model V4-Pro-Max do blízkosti GPT-5.4 (97,7 a 91,4) a nad Gemini 3.1 Pro v IMOAnswerBench.
Kontext milionu tokenů v praxi
Oba modely V4 nativně podporují kontext 1 M tokenů. Jde o výchozí nastavení, nikoli o speciální úroveň pro dlouhé kontexty, a nepřichází s příplatkem za dlouhý kontext.
Na MRCR, benchmarku pro vyhledávání v kontextu, dosahuje V4-Pro přesnosti vyhledávání 94 % až do 128 K tokenů a 82 % při 512 K tokenech, přičemž na 1 M tokenech klesne na 66 %. DeepSeek uvádí, že V4-Pro „překonává Gemini-3.1-Pro v testu MRCR" (83,5 vs 76,3), ale „zůstává za Claude Opus 4.6" (92,9).
Na CorpusQA, benchmarku bližšímu reálnému zpracování dlouhých dokumentů, dosahuje V4-Pro 62,0 % na 1 M tokenech, čímž předčí Gemini 3.1 Pro s 53,8 %. Závěr: pro QA nad dlouhými dokumenty je V4-Pro skutečně konkurenceschopný vůči uzavřeným lídrům v dlouhých kontextech a jasně vedoucí vůči předchozímu poli open source modelů.
Technická zpráva rámuje dlouhý kontext jako příští osu škálování, která otevírá cestu k delším agentickým smyčkám, komplexnější analýze dokumentů a průzkumným paradigmatům jako online learning. Nic z toho není možné, pokud je inference na 1 M tokenech příliš drahá na provoz, a právě zde hrají roli architektonické úspory efektivity.
Efektivita a úspory KV cache
Headline čísla efektivity dle technické zprávy na kontextu 1 M tokenů:
| Model | FLOPs vs V3.2 | KV Cache vs V3.2 |
|---|---|---|
| DeepSeek-V4-Pro | 27% (3,7x méně) | 10% (9,5x menší) |
| DeepSeek-V4-Flash | 10% (9,8x méně) | 7% (13,7x menší) |
Tato čísla jsou tím, co činí kontexty o délce 1 M tokenů ekonomicky rentabilními. Desetkrát menší KV cache znamená, že jediná GPU může obsluhovat přibližně desetkrát více souběžných dlouhých kontextových relací, což přímo mění cenník pro agentické a výzkumné pracovní zátěže.
Zisky pocházejí ze tří zdrojů: řídká pozornost přes CSA, silná komprese přes HCA a úložiště FP4 pro váhy expertů MoE. Na budoucím hardwaru, který nabídne rychlejší matematiku ve FP4, DeepSeek odhaduje další třetinu efektivity nad dnešní čísla.
Režimy reasoning effortu
Každý model V4 nabízí tři úrovně reasoning effortu: Non-Think, High a Max. Max používá delší kontexty a snížené penalizace délky v RL a je to režim, který by měl být použit pro nejtěžší reasoning úlohy.
| Benchmark | Flash Non-Think | Flash High | Flash Max | Pro Non-Think | Pro High | Pro Max |
|---|---|---|---|---|---|---|
| MMLU-Pro | 83.0 | 86.4 | 86.2 | 82.9 | 87.1 | 87.5 |
| SimpleQA-Verified | 23.1 | 28.9 | 34.1 | 45.0 | 46.2 | 57.9 |
| GPQA Diamond | 71.2 | 87.4 | 88.1 | 72.9 | 89.1 | 90.1 |
| HLE | 8.1 | 29.4 | 34.8 | 7.7 | 34.5 | 37.7 |
| LiveCodeBench | 55.2 | 88.4 | 91.6 | 56.8 | 89.8 | 93.5 |
| HMMT 2026 Feb | 40.8 | 91.9 | 94.8 | 31.7 | 94.0 | 95.2 |
| Terminal Bench 2.0 | 49.1 | 56.6 | 56.9 | 59.1 | 63.3 | 67.9 |
| SWE Verified | 73.7 | 78.6 | 79.0 | 73.6 | 79.4 | 80.6 |
| MRCR 1M | 37.5 | 76.9 | 78.7 | 44.7 | 83.3 | 83.5 |
Dvě pozorování. Za prvé, režimy uvažování mají výrazně větší vliv než samotná velikost modelu u náročných reasoning úloh: HLE skočí z 7,7 (Pro Non-Think) na 37,7 (Pro Max), tedy téměř 5násobně. Za druhé, Flash Max je u reasoning benchmarků překvapivě blízko Pro, pokud dostane dostatečný myšlenkový rozpočet, a právě proto DeepSeek označuje Flash za „vysoce nákladově efektivní architekturu pro komplexní reasoning úlohy". U znalostních úloh, kde záleží na počtu parametrů, si Pro udržuje jasný náskok.
Podpora Huawei Ascend a čínský hardware
Spolu s vydáním V4 Huawei oznámil, že jeho Ascend supernode, poháněný novými čipy Ascend 950 AI, bude plně podporovat DeepSeek V4 hned po vybalení z krabice. Jde o výrazný signál, protože to znamená, že V4 je okamžitě nasaditelný na čínském domácím AI hardwaru ve velkém měřítku, bez závislosti na GPU vyráběných v USA, na které se vztahují exportní omezení.
Toto partnerství odráží širší snahu čínské AI infrastruktury vybudovat soběstačný zásobník: čínské váhy, čínské čipy, čínský inference software. Pro podniky a výzkumné skupiny působící na čínské pevnině to pravděpodobně znamená více než jakékoli jednotlivé číslo z benchmarku.
Ceny a API
DeepSeek V4 je na DeepSeek API od 24. dubna 2026. Uživatelé API nemusejí měnit base_url, pouze parametr model, a deepseek-v4-flash nyní obsluhuje sestavení 0731 bez jakékoli změny na straně volání:
deepseek-v4-propro V4-Prodeepseek-v4-flashpro V4-Flash
Oba modely podporují formát OpenAI ChatCompletions i formát Anthropic API. Oba zpřístupňují kontext 1 M tokenů a duální režimy Thinking a Non-Thinking, konfigurované přes parametr režimu myšlení.
Finální ceny jsou zveřejněny. V4-Flash stojí $0.14 za milion vstupních tokenů při cache miss, $0.0028 při cache hit a $0.28 za milion výstupních tokenů. V4-Pro stojí $0.435 / $0.003625 / $0.87 na stejných třech řádcích. Oba zahrnují plný kontext 1 M tokenů bez příplatku a maximální výstup je 384 K tokenů. Flash umožňuje 2 500 souběžných požadavků oproti 500 u Pro.
🔴 Staré endpointy jsou pryč. deepseek-chat a deepseek-reasoner byly vyřazeny po 24. červenci 2026, 15:59 UTC a dokumentace DeepSeeku nyní uvádí přesně dva ID modelů. Pokud je některý z těchto řetězců stále v konfiguračním souboru, tato volání selžou. DeepSeek také oznámil, že zavede špičkové a mimošpičkové ceny na 2x vyšší sazbu během špičkových hodin, ale datum ještě nebylo oznámeno.
Komerční argument pro DeepSeek tak zůstává silný. Oproti špičkovým uzavřeným modelům za $5/$30 a $5/$25 na milion tokenů je V4-Flash přibližně 36x levnější na vstupu. Mezera je výrazně menší vůči levným tierům, kde červencová 2026 redukce OpenAI dostala jeho vstupní model na $0.20/$1.20. Pro podrobný přehled napříč API tiery, bezplatným přístupem a spotřebitelskou aplikací viz náš průvodce cenami DeepSeeku.
Dostupnost a migrace z V3
V4 je dnes dostupný třemi způsoby.
chat.deepseek.com. Webový chatbot zpřístupňuje V4 prostřednictvím dvou přepínačů: Expert Mode a Instant Mode, které odpovídají V4-Pro-Max a rychlým odpovědím ve stylu V4-Flash. Pokud již DeepSeek Chat používáte, není třeba nový účet.
DeepSeek API. Dostupné přes deepseek-v4-pro a deepseek-v4-flash. Oba modely mají výchozí kontext 1 M tokenů. Režimy Thinking a Non-Thinking lze volit pro každý požadavek zvlášť.
Hugging Face. Otevřené váhy jsou zveřejněny na huggingface.co/collections/deepseek-ai/deepseek-v4. Kompletní technická zpráva je k dispozici jako PDF v repozitáři V4-Pro. Inference vyžaduje pro V4-Pro výkonný hardware (desítky GPU pro jakýkoli rozumný průput), ale V4-Flash se 13 B aktivními parametry je dobře dosažitelný pro nasazení na dobře vybaveném jednom serveru.
Migrace z V3 je do velké míry přímočará. Tokenizátor je kompatibilní (stále 128 K slovník, stejné speciální tokeny plus několik nových pro konstrukci kontextu). Povrch API pro thinking mode zůstal nezměněn. Hlavní změnou je nový výchozí kontext 1 M tokenů a nové ID modelů.
Omezení
DeepSeek je v technické zprávě neobvykle otevřený ohledně zbývajících omezení V4.
Architektonická složitost. Aby minimalizoval riziko při největších architektonických změnách (mHC, hybridní CSA a HCA, Muon, FP4), zachoval V4 mnoho dříve ověřených komponent z V3. DeepSeek popisuje výslednou architekturu jako „relativně složitou" a říká, že budoucí verze se pokusí „zredukovat architekturu na její nejzásadnější návrhy".
Stabilita tréninku. Anticipatory Routing a SwiGLU Clamping v praxi fungovaly, ale tým přiznává, že jejich „základní principy zůstávají nedostatečně pochopeny", a označuje stabilitu tréninku za aktivní oblast základního výzkumu.
Znalostní mezera. V4-Pro-Max zaostává za Gemini 3.1 Pro na většině znalostně náročných benchmarků (MMLU-Pro, SimpleQA, GPQA Diamond, HLE). Mezera se výrazně zúžila, ale nezavřela.
Strop vyhledávání v dlouhém kontextu. Nad 128 K tokenů začíná přesnost vyhledávání klesat, na 1 M tokenech klesá na 66 % v MRCR. To je stále lepší než většina open modelů a Gemini 3.1 Pro, ale není to téměř dokonalé vybavení, které někteří benchmarky reportují pro Claude Opus 4.6.
Frontové agentické úlohy. Na číslech z dubnového preview zaostal V4-Pro-Max za uzavřenou hranicí na Terminal Bench 2.0 (67,9) a SWE Pro (55,4). Sestavení 0731 tento rozdíl na straně agentů výrazně zmenšilo, ale aktuální uzavřené flagship modely stále vedou v nejtěžší agentické programování práci. Oba se od zveřejnění této tabulky posunuly dál, k řadě GPT-5.6 od OpenAI a Claude Opus 5.
Multimodalita. V4 zpracovává pouze text. DeepSeek říká, že „pracuje na začlenění multimodálních schopností do svých modelů", ale aktuální vydání nepřijímá obrázky, audio ani video.
Co to znamená pro vás
Pro vývojáře. V4-Flash je nyní výchozí volbou pro vysokoobjemové nasazení, protože deepseek-chat a deepseek-reasoner byly vyřazeny. S 13 B aktivními parametry, kontextem milionu tokenů a agentickými zisky z 0731 je to nejlevnější způsob, jak si koupit danou míru naměřené schopnosti kdekoli na nástěnce Artificial Analysis, za $0.03 za úlohu indexu. Před tím, než to standardizujete: toto skóre je z jediné nástěnky a V4-Flash ještě nemá hlasy o lidských preferencích na žádném Arena leaderboardu. V4-Pro stojí za přímou výměnu za Claude Opus na soutěžním programování, agentických pracovních postupech náročných na nástroje a jakékoli úloze, která těží z dlouhého kontextu.
Pro open source a vlastní hostování. V4 je dnes nejsilnější rodina open source modelů v soutěžním programování a formální matematice a první open model, který dosáhl výkonu frontových uzavřených systémů na Codeforces. Je to také první široce nasaditelný open model nativně vybudovaný pro kontexty milionu tokenů. Pro jakýkoli tým, který staví vlastní LLM zásobník, V4 zásadně resetuje kalkulaci stavět vs. kupovat.
Pro stavitele agentů. Úspory efektivity CSA/HCA jsou tím, co přetváří agentické smyčky s 1 M tokeny z výzkumných dem na produkčně životaschopné pracovní zátěže. Efektivita tokenů při dlouhém kontextu se přímo promítá do nižší ceny za úlohu a delší agentické smyčky za dolar.
Pro běžné uživatele. Pokud chcete jednoduše používat všechny frontové modely bez přehršle předplatných, Fello AI sdružuje DeepSeek s ChatGPT, Claude, Gemini, Grok a Perplexity v jedné nativní aplikaci pro Mac, iPhone a iPad za $9.99/měsíc, s více než 25 000 pětihvězdičkovými recenzemi.
V4 je dosud nejjasnějším důkazem, že open modely uzavřely většinu mezery vůči uzavřenému frontovému poli, přičemž si udržují skutečný architektonický náskok v efektivitě dlouhého kontextu. Příští otázka již není, zda open modely mohou na hranici konkurovat. Jde o to, co se stane možným, jakmile se kontexty milionu tokenů stanou rutinou, a V4 je prvním vydáním postaveným na zodpovězení právě této otázky.
FAQ
Co je DeepSeek-V4-Flash-0731?
Jde o oficiální vydání DeepSeek V4-Flash, zveřejněné 31. července 2026, které nahrazuje dubnový preview. Zachovává stejnou architekturu 284B celkových / 13B aktivních parametrů, stejný kontext 1 M tokenů a stejnou cenu $0.14/$0.28 a přidává to, co DeepSeek nazývá výrazně vylepšenými agentickými schopnostmi. Volání deepseek-v4-flash vám automaticky dá sestavení 0731.
Je DeepSeek V4 zdarma?
Váhy ano. Oba modely V4 jsou zveřejněny na Hugging Face pod MIT licencí, takže si je můžete stáhnout, spustit a doladit zdarma, pokud máte hardware. Chat na chat.deepseek.com je pro jednotlivce zdarma a API je placeno za token. Kompletní přehled najdete v našem průvodci cenami DeepSeeku.
Je V4-Flash nebo V4-Pro lepší pro agentickou práci?
V4-Flash, od sestavení 0731. Vlastní model card DeepSeeku hodnotí V4-Flash-0731 na 82,7 bodech Terminal Bench 2.1 oproti 72,1 pro V4-Pro preview a vítězí také na NL2Repo, Cybergym a DeepSWE, za přibližně třetinu ceny Pro. V4-Pro stále vede v práci náročné na znalosti.
Kolik stojí DeepSeek V4 API?
V4-Flash stojí $0.14 za milion vstupních tokenů při cache miss, $0.0028 při cache hit a $0.28 za milion výstupních tokenů. V4-Pro stojí $0.435 / $0.003625 / $0.87. Plný kontext 1 M tokenů není u žádného modelu zpoplatněn příplatkem.
Zvládne DeepSeek V4 obrázky nebo audio?
Ne. V4 zpracovává pouze text. DeepSeek říká, že „pracuje na začlenění multimodálních schopností do svých modelů", ale ani V4-Flash ani V4-Pro dnes nepřijímá obrázky, audio ani video.