Závod open source AI se právě stal zajímavějším. Čínský startup DeepSeek představil DeepSeek-V3.1, svůj dosud největší upgrade, který přináší ostřejší uvažování, silnější schopnosti v oblasti kódování a novou podporu pro volání nástrojů a agentní pracovní postupy.
Na rozdíl od dřívějšího vydání, které působilo experimentálně, přichází V3.1 jako vážný kandidát. S 128K kontextovým oknem, hybridními režimy uvažování a API, které je výrazně levnější než jeho západní konkurenti, je model navržen tak, aby přiblížil otevřené AI výkonu GPT-5, Grok 4, Claude Opus a Gemini 2.5 Pro. Podrobné náklady API a informace o bezplatné verzi najdete v našem průvodci cenami DeepSeek.
Rané benchmarky ukazují, že V3.1 nejen dohání ostatní, ale přímo soupeří v úkolech zaměřených na kódování a uvažování, což naznačuje, že hranice mezi uzavřenými komerčními systémy a otevřenými modely se zužuje rychleji, než se očekávalo.
Co se mění v DeepSeek V3.1
Když byl spuštěn DeepSeek-V3, vynikal jako jeden z prvních open source modelů, který dokázal soupeřit s komerčními systémy. Jeho rostoucí popularita ale také odhalila slabiny, především zpomalení API a nespolehlivé volání nástrojů.
V3.1 tyto problémy řeší přímo a zároveň přidává nové možnosti:
- Hybridní režimy: Přepínání mezi „myšlením" pro postupné uvažování a „nemyšlením" pro rychlejší odpovědi.
- Silnější volání nástrojů: Strukturovaná podpora pro API, spouštění kódu a vyhledávací agenty.
- 128K kontextové okno: Výrazný posun pro práci s delšími konverzacemi nebo kódovými základnami.
- Kompatibilita s Claude API: Snazší integrace pro vývojáře, kteří již používají ekosystém Anthropic.
- Efektivní MoE design: 671 miliard parametrů, přičemž na každý token je aktivních jen 37 miliard, což vyvažuje výkon a náklady.
Tyto aktualizace dělají z V3.1 spolehlivější a univerzálnější model a posouvají ho od experimentálního vydání k praktické volbě pro kódování, výzkum a agentní pracovní postupy.
Hybridní režim „myšlení"
Výraznou funkcí DeepSeek-V3.1 je nový systém hybridního odvozování. Nově lze přepínat mezi dvěma režimy:
- Režim myšlení: postupné uvažování pro vyšší přesnost v matematice, kódování a logice.
- Režim bez myšlení: rychlejší a přímější odpovědi s nižšími náklady, ale o něco menší přesností.
Tato flexibilita umožňuje vývojářům volit mezi rychlostí a přesností podle povahy úkolu. Benchmarky dopad jasně ukazují: 88,4 % na AIME 2025 v režimu myšlení, čímž překonává R1, a 74,8 % na LiveCodeBench, opět lepší výsledek než u předchůdce.
Díky oběma režimům dává V3.1 uživatelům kontrolu nad tím, zda potřebují rychlou odpověď, nebo pečlivější, promyšlenější reakci, což je v open source modelech jen zřídka k vidění.
Technické srovnání
V této části se podíváme na výkon na papíře dnešních předních AI modelů, včetně DeepSeek-V3.1, GPT-5, Grok 4, Claude Opus 4.1 a Gemini 2.5 Pro. Čísla z benchmarků, kontextová okna a podpora modalit poskytují dobrý základ pro porovnání schopností, je však důležité mít na paměti, že skutečná použitelnost se může lišit v závislosti na latenci, spolehlivosti a integraci do ekosystému.
Výsledky benchmarků
DeepSeek-V3.1 vykazuje výrazný pokrok v úkolech zaměřených na kódování a uvažování, zejména ve srovnání se svými dřívějšími verzemi. Na SWE-bench Verified dosahuje skóre 66,0, výrazně více než DeepSeek-R1 (44,6) a blíží se výsledku Claude Opus 4.1 (74,5 %). Na AIME 2025 dosahuje jeho režim „myšlení" hodnoty 88,4 %, blízko špičkovým 94,6 % GPT-5 a 93 % Grok 4.
Na LiveCodeBench, benchmarku zaměřeném na kódování, dosahuje V3.1 hodnoty 74,8 %, což je opět konkurenceschopné vůči téměř dokonalým 98 % HumanEval Grok 4, ale lepší než středový výsledek 63,8 % Gemini 2.5 Pro. Na GPQA Diamond, navrženém pro uvažování na úrovni postgraduálního studia, zaostává DeepSeek-V3.1 (80,1 %) za GPT-5 (88,4 %) a Grok 4 (88 %), ale překonává Gemini 2.5 Pro (84 %) a Claude Opus 4.1 (80,9 %).

Kontext a modality
DeepSeek-V3.1 podporuje 128 000 tokenů, čímž zaostává za bezkonkurenčním 1M kontextovým oknem Gemini, 400K GPT-5 a 256K Grok, ale stále předčí mnoho open source alternativ. Na rozdíl od svých západních konkurentů zůstává DeepSeek primárně textový se strukturovaným voláním nástrojů a podporou agentů, nativní generování obrázků ani videa není k dispozici.
Znalostní cutoff
DeepSeek-V3.1 byl vydán v srpnu 2025, takže má jeden z nejnovějších tréninkových horizontů, těsně za Claude Opus 4.1 (červenec 2025). GPT-5 zaostává se znalostním cutoffem v září 2024, přičemž Grok 4 (listopad 2024) a Gemini 2.5 Pro (leden 2025) jsou někde uprostřed.
| Model | AIME 2025 | GPQA | SWE-bench | Intelligence Index | Context Window | Knowledge Cutoff | Input Modalities | Output Modalities |
|---|---|---|---|---|---|---|---|---|
| GPT-5 | 94.6% | 88.4% | 74.9% | 69 | 400k tokens (~600 pgs) | Sept 2024 | Text, images, files | Text, images, files |
| Grok 4 | 93% | 88% | N/A | 68 | 256k tokens (~384 pgs) | Nov 2024 | Text, images, files | Text, images, video |
| Claude Opus 4.1 | 78% | 80.9% | 74.5% | 49 | 200k tokens (~300 pgs) | July 2025 | Text, images, files | Text, files |
| Gemini 2.5 Pro | 88% | 84% | 63.8% | 65 | 1M tokens (~1,500 pgs) | Jan 2025 | Text, images, video, audio, files | Text, voice |
| DeepSeek-V3.1 | 88.4% | 80.1% | 66.0 | ~55–60* | 128k tokens (~200 pgs) | Aug 2025 | Text (tool calling, code agents, search) | Text |
Využití v praxi
Rané testy ukazují, že DeepSeek-V3.1 přináší v každodenních pracovních postupech při kódování znatelná zlepšení oproti svému předchůdci.
- Orientace v kódových základnách: V3.1 dokáže najít a upravit správné soubory, aniž by mu bylo explicitně řečeno, kde mají změny proběhnout. To ho činí užitečnějším ve větších projektech se složitou strukturou souborů.
- Oprava složitých chyb: Model se neomezuje na jednoduché textové úpravy, ale zvládá složitější problémy, jako jsou chyby validace nebo práce s daty, a produkuje čistší opravy s menším počtem poškozených diffů než V3.
- Chování podobné agentovi: V některých experimentech se model dokonce pokusil analyzovat uložené prompty v databázi a navrhnout optimalizace, což naznačuje první kroky směrem k autonomnějšímu uvažování.
Zároveň přetrvávají výzvy. Vývojáři zaznamenali náhodné vkládání čínských znaků do kódu, nekonzistenci, která se nepředvídatelně objevuje napříč úkoly a teplotami. Problém může nastat i tehdy, když je model vyzván, aby se držel angličtiny. Další slabinou je přesnost volání nástrojů: přestože V3.1 správně strukturuje volání funkcí, jeho míry recall a precision zůstávají pod úrovní proprietárních lídrů, jako jsou GPT-5 nebo Claude Sonnet.
Celkově V3.1 dokazuje, že open source modely se rychle stávají praktickými nástroji pro skutečné kódování a agentní pracovní postupy, ale drobné nedostatky ukazují, že ještě nedosahují stejné spolehlivosti jako špičkové komerční systémy.
Závěr
DeepSeek-V3.1 ukazuje, jak rychle open source AI dohání ostatní. Zužuje mezeru vůči špičkovým proprietárním systémům v kódování a uvažování a dokazuje, že pokročilý výkon již není výsadou uzavřených modelů. GPT-5 stále vede v matematice a Grok dominuje v benchmarcích kódování, ale kombinace silných výsledků, nízkých nákladů a otevřené dostupnosti V3.1 z něj dělá jednu z nejpraktičtějších voleb pro vývojáře a výzkumníky.
Pro týmy, které jsou ochotny obětovat trochu lesku výměnou za flexibilitu a cenu, představuje V3.1 vážnou alternativu a signál, že příští vlna otevřených modelů může výzvou pro ty nejlepší v oboru.