Závod open source AI se právě stal zajímavějším. Čínský startup DeepSeek představil DeepSeek-V3.1, svůj dosud největší upgrade, který přináší ostřejší uvažování, silnější schopnosti v oblasti kódování a novou podporu pro volání nástrojů a agentní pracovní postupy.

Na rozdíl od dřívějšího vydání, které působilo experimentálně, přichází V3.1 jako vážný kandidát. S 128K kontextovým oknem, hybridními režimy uvažování a API, které je výrazně levnější než jeho západní konkurenti, je model navržen tak, aby přiblížil otevřené AI výkonu GPT-5, Grok 4, Claude Opus a Gemini 2.5 Pro. Podrobné náklady API a informace o bezplatné verzi najdete v našem průvodci cenami DeepSeek.

Rané benchmarky ukazují, že V3.1 nejen dohání ostatní, ale přímo soupeří v úkolech zaměřených na kódování a uvažování, což naznačuje, že hranice mezi uzavřenými komerčními systémy a otevřenými modely se zužuje rychleji, než se očekávalo.

Co se mění v DeepSeek V3.1

Když byl spuštěn DeepSeek-V3, vynikal jako jeden z prvních open source modelů, který dokázal soupeřit s komerčními systémy. Jeho rostoucí popularita ale také odhalila slabiny, především zpomalení API a nespolehlivé volání nástrojů.

V3.1 tyto problémy řeší přímo a zároveň přidává nové možnosti:

  • Hybridní režimy: Přepínání mezi „myšlením" pro postupné uvažování a „nemyšlením" pro rychlejší odpovědi.
  • Silnější volání nástrojů: Strukturovaná podpora pro API, spouštění kódu a vyhledávací agenty.
  • 128K kontextové okno: Výrazný posun pro práci s delšími konverzacemi nebo kódovými základnami.
  • Kompatibilita s Claude API: Snazší integrace pro vývojáře, kteří již používají ekosystém Anthropic.
  • Efektivní MoE design: 671 miliard parametrů, přičemž na každý token je aktivních jen 37 miliard, což vyvažuje výkon a náklady.

Tyto aktualizace dělají z V3.1 spolehlivější a univerzálnější model a posouvají ho od experimentálního vydání k praktické volbě pro kódování, výzkum a agentní pracovní postupy.

Hybridní režim „myšlení"

Výraznou funkcí DeepSeek-V3.1 je nový systém hybridního odvozování. Nově lze přepínat mezi dvěma režimy:

  1. Režim myšlení: postupné uvažování pro vyšší přesnost v matematice, kódování a logice.
  2. Režim bez myšlení: rychlejší a přímější odpovědi s nižšími náklady, ale o něco menší přesností.

Tato flexibilita umožňuje vývojářům volit mezi rychlostí a přesností podle povahy úkolu. Benchmarky dopad jasně ukazují: 88,4 % na AIME 2025 v režimu myšlení, čímž překonává R1, a 74,8 % na LiveCodeBench, opět lepší výsledek než u předchůdce.

Díky oběma režimům dává V3.1 uživatelům kontrolu nad tím, zda potřebují rychlou odpověď, nebo pečlivější, promyšlenější reakci, což je v open source modelech jen zřídka k vidění.

Technické srovnání

Od vydavatele

Každý AI model v jedné aplikaci

Fello AI přináší GPT-5.6, Claude 5, Gemini 3.6, Grok 4.5 a další v jedné nativní aplikaci pro Mac a iPhone.

Stáhnout hned!

V této části se podíváme na výkon na papíře dnešních předních AI modelů, včetně DeepSeek-V3.1, GPT-5, Grok 4, Claude Opus 4.1 a Gemini 2.5 Pro. Čísla z benchmarků, kontextová okna a podpora modalit poskytují dobrý základ pro porovnání schopností, je však důležité mít na paměti, že skutečná použitelnost se může lišit v závislosti na latenci, spolehlivosti a integraci do ekosystému.

Výsledky benchmarků

DeepSeek-V3.1 vykazuje výrazný pokrok v úkolech zaměřených na kódování a uvažování, zejména ve srovnání se svými dřívějšími verzemi. Na SWE-bench Verified dosahuje skóre 66,0, výrazně více než DeepSeek-R1 (44,6) a blíží se výsledku Claude Opus 4.1 (74,5 %). Na AIME 2025 dosahuje jeho režim „myšlení" hodnoty 88,4 %, blízko špičkovým 94,6 % GPT-5 a 93 % Grok 4.

Na LiveCodeBench, benchmarku zaměřeném na kódování, dosahuje V3.1 hodnoty 74,8 %, což je opět konkurenceschopné vůči téměř dokonalým 98 % HumanEval Grok 4, ale lepší než středový výsledek 63,8 % Gemini 2.5 Pro. Na GPQA Diamond, navrženém pro uvažování na úrovni postgraduálního studia, zaostává DeepSeek-V3.1 (80,1 %) za GPT-5 (88,4 %) a Grok 4 (88 %), ale překonává Gemini 2.5 Pro (84 %) a Claude Opus 4.1 (80,9 %).

DeepSeek V3.1 Performance [source]

Kontext a modality

DeepSeek-V3.1 podporuje 128 000 tokenů, čímž zaostává za bezkonkurenčním 1M kontextovým oknem Gemini, 400K GPT-5 a 256K Grok, ale stále předčí mnoho open source alternativ. Na rozdíl od svých západních konkurentů zůstává DeepSeek primárně textový se strukturovaným voláním nástrojů a podporou agentů, nativní generování obrázků ani videa není k dispozici.

Znalostní cutoff

DeepSeek-V3.1 byl vydán v srpnu 2025, takže má jeden z nejnovějších tréninkových horizontů, těsně za Claude Opus 4.1 (červenec 2025). GPT-5 zaostává se znalostním cutoffem v září 2024, přičemž Grok 4 (listopad 2024) a Gemini 2.5 Pro (leden 2025) jsou někde uprostřed.

ModelAIME 2025GPQASWE-benchIntelligence IndexContext WindowKnowledge CutoffInput ModalitiesOutput Modalities
GPT-594.6%88.4%74.9%69400k tokens (~600 pgs)Sept 2024Text, images, filesText, images, files
Grok 493%88%N/A68256k tokens (~384 pgs)Nov 2024Text, images, filesText, images, video
Claude Opus 4.178%80.9%74.5%49200k tokens (~300 pgs)July 2025Text, images, filesText, files
Gemini 2.5 Pro88%84%63.8%651M tokens (~1,500 pgs)Jan 2025Text, images, video, audio, filesText, voice
DeepSeek-V3.188.4%80.1%66.0~55–60*128k tokens (~200 pgs)Aug 2025Text (tool calling, code agents, search)Text

Využití v praxi

Rané testy ukazují, že DeepSeek-V3.1 přináší v každodenních pracovních postupech při kódování znatelná zlepšení oproti svému předchůdci.

  • Orientace v kódových základnách: V3.1 dokáže najít a upravit správné soubory, aniž by mu bylo explicitně řečeno, kde mají změny proběhnout. To ho činí užitečnějším ve větších projektech se složitou strukturou souborů.
  • Oprava složitých chyb: Model se neomezuje na jednoduché textové úpravy, ale zvládá složitější problémy, jako jsou chyby validace nebo práce s daty, a produkuje čistší opravy s menším počtem poškozených diffů než V3.
  • Chování podobné agentovi: V některých experimentech se model dokonce pokusil analyzovat uložené prompty v databázi a navrhnout optimalizace, což naznačuje první kroky směrem k autonomnějšímu uvažování.

Zároveň přetrvávají výzvy. Vývojáři zaznamenali náhodné vkládání čínských znaků do kódu, nekonzistenci, která se nepředvídatelně objevuje napříč úkoly a teplotami. Problém může nastat i tehdy, když je model vyzván, aby se držel angličtiny. Další slabinou je přesnost volání nástrojů: přestože V3.1 správně strukturuje volání funkcí, jeho míry recall a precision zůstávají pod úrovní proprietárních lídrů, jako jsou GPT-5 nebo Claude Sonnet.

Celkově V3.1 dokazuje, že open source modely se rychle stávají praktickými nástroji pro skutečné kódování a agentní pracovní postupy, ale drobné nedostatky ukazují, že ještě nedosahují stejné spolehlivosti jako špičkové komerční systémy.

Závěr

DeepSeek-V3.1 ukazuje, jak rychle open source AI dohání ostatní. Zužuje mezeru vůči špičkovým proprietárním systémům v kódování a uvažování a dokazuje, že pokročilý výkon již není výsadou uzavřených modelů. GPT-5 stále vede v matematice a Grok dominuje v benchmarcích kódování, ale kombinace silných výsledků, nízkých nákladů a otevřené dostupnosti V3.1 z něj dělá jednu z nejpraktičtějších voleb pro vývojáře a výzkumníky.

Pro týmy, které jsou ochotny obětovat trochu lesku výměnou za flexibilitu a cenu, představuje V3.1 vážnou alternativu a signál, že příští vlna otevřených modelů může výzvou pro ty nejlepší v oboru.