Anthropic 5. února 2026 vydal Claude Opus 4.6, tehdy nejnovější a nejschopnější model své řady Claude. Přichází jen tři měsíce po Opusu 4.5, poprvé přináší do rodiny Opus kontextové okno o velikosti 1 milionu tokenů, zavádí spolupracující agentní týmy v Claude Code a dosahuje ve většině hodnocení benchmarkových výsledků, díky nimž předčí GPT-5.2 i Gemini 3 Pro. O několik měsíců později stále slouží jako měřítko pro nové konkurenty. Model Seed 2.1 Pro od ByteDance dorovnal Opus 4.6 v Code Areně: Frontend, oba dosáhli skóre 1539.

Opus 4.6 byl mezitím nahrazen. Anthropic 24. července 2026 vydal Claude Opus 5 za stejnou cenu $5/$25 za milion tokenů jako Opus 4.6, a poté 1. září 2026 Claude Fable 5.1, který vede v žebříčku Artificial Analysis Intelligence Index se skóre 66 proti 63 bodům Opusu 5. Vše níže je záznamem toho, co Opus 4.6 přinesl. Pokud chcete model, na kterém dnes skutečně stavět, podívejte se na náš kompletní přehled Claude Opus 5.

Číslo, které ale upoutalo pozornost celého odvětví, nebylo skóre v žádném benchmarku. Bylo to 500, tolik dosud neznámých bezpečnostních zranitelností objevil Opus 4.6 v open source kódu během testování před vydáním, a to s minimálním nebo žádným zásahem člověka.

Tento článek rozebírá vše o Claude Opus 4.6: co dokáže, jak si vede, kolik stojí a co znamená pro vývojáře, výzkumníky a firmy, které v roce 2026 hodnotí svou strategii v oblasti AI.

Co je Claude Opus 4.6?

Claude Opus 4.6 je vlajkový model AI od Anthropicu, který stojí na vrcholu modelové rodiny Claude. V API používá identifikátor modelu claude-opus-4-6 a je dostupný přes claude.ai, Anthropic API, Amazon Bedrock a Vertex AI od Google Cloud.

Opus je nejvýkonnější úroveň modelů od Anthropicu, určená pro úlohy vyžadující hluboké uvažování, složité vícekrokové řešení problémů a stabilní výkon i v dlouhých kontextech. Zatímco modely Claude Sonnet se zaměřují na rychlost a nákladovou efektivitu, modely Opus upřednostňují čistou inteligenci a spolehlivost u náročných úloh.

Opus 4.6 je nástupcem Opusu 4.5, který byl uveden na trh v listopadu 2025. Rychlý tříměsíční interval naznačuje, že Anthropic zrychluje tempo vydávání modelů a zaměřuje se na to, aby byly modely třídy Opus prakticky nasaditelné v reálném provozu.

Klíčové funkce a schopnosti

Od vydavatele

Každý AI model v jedné aplikaci

Fello AI přináší GPT-6, Claude 5, Gemini 3.8, Grok 4.7 a další v jedné nativní aplikaci pro Mac a iPhone.

Stáhnout hned!

Zde je přehled toho, co je v Opusu 4.6 nové a vylepšené:

FunkcePodrobnosti
Kontextové okno1 milion tokenů (beta), první model třídy Opus s touto kapacitou
Maximální výstup128 000 tokenů
Agentní týmyKoordinace více agentů v Claude Code (výzkumný náhled)
Adaptivní uvažováníModel sám určuje, kdy je rozšířené uvažování přínosné
Komprese kontextuAutomatické shrnutí staršího kontextu pro udržení delších relací (beta)
Úrovně úsilíNízká, střední, vysoká (výchozí) a maximální, pro ladění poměru mezi inteligencí, rychlostí a cenou
Integrace s OfficeClaude v PowerPointu (výzkumný náhled) s citlivostí na design systém
Vylepšení programováníLepší plánování, delší udržitelnost úloh, vylepšené ladění chyb a revize kódu
Přírodní vědyTéměř dvojnásobné zlepšení výkonu v úlohách z biologie a chemie
Inference pouze v USAMožnost uchování dat v USA za 1,1násobek standardní ceny

Výkon Opusu 4.6 v benchmarcích

Benchmarky nejsou dokonalé, ale nabízejí nejobjektivnější dostupné srovnání modelů. Opus 4.6 dosahuje silných výsledků v programování, uvažování, znalostní práci i agentních úlohách.

Oficiální výsledky benchmarků zveřejněné Anthropicem [odkaz]

Benchmarky pro programování

Terminal-Bench 2.0 měří agentní programování v terminálovém prostředí, tedy typ práce, kterou vývojáři dělají s nástroji jako Claude Code. Opus 4.6 dosáhl 65,4 %, nejvyššího skóre, jaké kdy bylo v tomto benchmarku zaznamenáno.

ModelTerminal-Bench 2.0
Claude Opus 4.665,4 %
GPT-5.264,7 %
Claude Opus 4.559,8 %
Gemini 3 Pro56,2 %

SWE-bench Verified hodnotí schopnost řešit reálné problémy nahlášené na GitHubu. Opus 4.6 dosahuje 80,8 %, což se prakticky rovná Opusu 4.5 (80,9 %), a udržuje si náskok před GPT-5.2 (80,0 %) i Gemini 3 Pro (76,2 %).

Benchmarky pro uvažování

ARC-AGI 2 testuje schopnost řešit nové typy úloh, tedy schopnost uvažovat nad neznámými problémy místo pouhého porovnávání vzorů s trénovacími daty. Právě zde Opus 4.6 ukazuje své nejdramatičtější zlepšení:

ModelARC-AGI 2
Claude Opus 4.668,8 %
GPT-5.2 Pro54,2 %
Gemini 3 Pro45,1 %
Claude Opus 4.537,6 %

Jde o zlepšení o 83 % oproti Opusu 4.5 a náskok 14,6 procentního bodu před dalším nejlepším modelem. U benchmarku navrženého tak, aby odolával zlepšení pouhým zvětšením modelu, jde o pozoruhodný výsledek.

Humanity’s Last Exam testuje složité multioborové uvažování. Bez nástrojů dosáhl Opus 4.6 skóre 40,0 % (oproti 30,8 % u Opusu 4.5). S povolenými nástroji dosáhl 53,1 %, ve srovnání s 50,0 % u GPT-5.2 Pro a 45,8 % u Gemini 3 Pro.

Znalostní práce a profesní úlohy

GDPval-AA měří výkon při reálných profesních úlohách napříč 44 profesemi, včetně financí a právních postupů. Opus 4.6 zde vede s velkým náskokem:

ModelGDPval-AA (Elo)
Claude Opus 4.61 606
GPT-5.21 462
Claude Opus 4.51 416
Sonnet 4.51 277
Gemini 3 Pro1 195

Náskok 144 bodů Elo před GPT-5.2 je významný. V praxi to znamená, že Opus 4.6 poskytuje výrazně lepší výsledky u úloh jako sepisování právních dokumentů, analýza finančních zpráv a syntéza výzkumu.

Benchmarky pro agentní chování a používání nástrojů

BenchmarkOpus 4.6GPT-5.2Opus 4.5Gemini 3 Pro
τ2-bench Retail (použití nástrojů)91,9 %82,0 %88,9 %neuvedeno
BrowseComp (agentní vyhledávání)84,0 %77,9 %67,8 %59,2 %
OSWorld (ovládání počítače)72,7 %neuvedeno66,3 %neuvedeno
Finance Agent Benchmark60,7 %56,6 %55,9 %neuvedeno
MCP Atlas (škálované použití nástrojů)59,5 %60,6 %62,3 %54,1 %

Opus 4.6 vede v používání nástrojů, vyhledávání, interakci s počítačem i ve finančních agentních úlohách. GPT-5.2 má mírný náskok v MCP Atlas, který testuje použití nástrojů ve velkém měřítku.

Uvažování na postgraduální úrovni

V testu GPQA Diamond, který hodnotí vědecké uvažování na postgraduální úrovni, jsou modely těsně u sebe:

ModelGPQA Diamond
GPT-5.2 Pro93,2 %
Gemini 3 Pro91,9 %
Claude Opus 4.691,3 %
Claude Opus 4.587,0 %

Zde vede GPT-5.2 Pro, i když rozdíl mezi třemi nejlepšími modely je menší než 2 procentní body.

Příběh 500 zero-day zranitelností

Před veřejným vydáním Opusu 4.6 otestoval Anthropicův tým pro testování hraničních modelů schopnosti analýzy kódu v izolovaném prostředí. Tým dal Opusu 4.6 přístup k Pythonu a standardním nástrojům pro analýzu zranitelností, jako jsou debuggery a fuzzery, ale neposkytl mu žádné konkrétní pokyny ani specializované bezpečnostní znalosti.

Výsledek: Opus 4.6 samostatně identifikoval více než 500 dosud neznámých vysoce závažných bezpečnostních zranitelností v hojně používaných open source knihovnách.

Objevené zranitelnosti sahaly od chyb způsobujících pády až po chyby poškozující paměť. Mezi konkrétní příklady patřily:

  • Chyba v nástroji GhostScript, oblíbeném nástroji pro zpracování souborů PDF a PostScript, která mohla způsobit pád systému
  • Zranitelnosti typu přetečení bufferu v nástroji OpenSC, sloužícím ke zpracování dat z čipových karet
  • Problémy s poškozením paměti v nástroji CGIF pro zpracování souborů GIF

Pozoruhodný na tom není jen samotný počet. Jde o to, že Opus 4.6 přistupoval k úkolu podobně jako lidský bezpečnostní výzkumník: zkoumal dřívější opravy, aby našel podobné dosud nevyřešené chyby, všímal si vzorů, které bývají problematické, a rozuměl logice kódu natolik dobře, že dokázal sestavit vstupy vyvolávající selhání.

Anthropic zveřejnil zjištění formou zodpovědného oznámení a celý proces zdokumentoval na red.anthropic.com. Firma zároveň přidala nové bezpečnostní kontroly, které mají odhalit a zablokovat případné zneužití těchto schopností, včetně monitorování provozu v reálném čase a šesti nových kybernetických bezpečnostních sond.

Spolupráce více agentů v Claude Code

Jedním z nejvýznamnějších nových produktů uvedených spolu s Opusem 4.6 jsou agentní týmy v Claude Code, momentálně dostupné jako výzkumný náhled.

Místo aby úkoly postupně zpracovávala jedna instance Clauda, umožňují agentní týmy pracovat souběžně více instancím Claude Code na různých částech projektu. Vedoucí relace koordinuje práci, přiděluje úkoly podagentům a shrnuje výsledky. Při souběžném běhu více relací se vyplatí znát nastavení schvalování, a náš průvodce oprávněními v Claude Code vysvětluje, co který režim dělá bez předchozího dotazu.

https://twitter.com/mckaywrigley/status/2019557279222439962

V praxi to znamená:

  • Paralelní vývoj: více agentů může současně pracovat na samostatných komponentách, testech nebo souborech
  • Koordinovaný refaktoring: jeden agent se může starat o změny na backendu, zatímco druhý aktualizuje frontend
  • Řízené delegování: vedoucí agent řídí rozdělení úkolů a zajišťuje konzistenci

Vývojáři mohou podagenty ovládat přímo pomocí Shift+Up/Down nebo prostřednictvím integrace s tmux.

Jde o posun od AI jako jednoho asistenta k AI jako koordinovanému týmu, což může zásadně změnit způsob, jakým vývojáři pracují s nástroji pro programování.

Kontextové okno o velikosti 1 milion tokenů

Opus 4.6 je prvním modelem z rodiny Opus, který podporuje kontextové okno o velikosti 1 milion tokenů (v beta verzi). Pro představu, 1 milion tokenů je zhruba 750 000 slov, dost na to, aby se do jedné relace vešla celá kódová báze, rozsáhlá sbírka výzkumných prací nebo měsíce projektové dokumentace.

Samotná velikost kontextového okna ale nevypovídá o všem. Důležité je, jak dobře model tento kontext dokáže využít.

Anthropic zdůrazňuje, že u Opusu 4.6 se omezil takzvaný „context rot“ (rozpad kontextu). Předchozí modely měly tendenci ztrácet přehled o informacích umístěných uprostřed velmi dlouhého kontextu. V benchmarku MRCR v2, který testuje vyhledávání napříč dlouhým kontextem pomocí varianty s osmi „jehlami“ a kontextem 1M tokenů, dosáhl Opus 4.6 přesnosti 76 % oproti 18,5 % u Sonnetu 4.5.

Srovnání vyhledávání v dlouhém kontextu: Claude Opus vs. Sonnet

Toto zlepšení mění, co je prakticky možné. Vývojáři teď mohou do jedné relace nahrát celé repozitáře. Výzkumníci mohou načíst kompletní datové sady. Právní týmy mohou zpracovat rozsáhlé sbírky dokumentů, aniž by je museli dělit do více dotazů.

Komprese kontextu

Pro relace, které jdou ještě za hranice kontextového okna, přináší Opus 4.6 kompresi kontextu (v beta verzi). Když se konverzace přiblíží nastavitelné hranici, model automaticky shrne starší úseky kontextu. Díky tomu mohou relace pokračovat prakticky bez omezení, aniž by spadly nebo ztratily přehled o důležitých informacích, což je citelné zlepšení komfortu při dlouhotrvajících agentních úlohách.

Adaptivní uvažování a úrovně úsilí

Opus 4.6 přináší adaptivní uvažování, funkci, díky které se model podle složitosti zadání sám rozhoduje, kdy je výhodné použít rozšířené uvažování (chain-of-thought).

U jednoduchých úloh model odpovídá přímo. U úloh vyžadujících hlubší analýzu zapojí důkladnější uvažování. Děje se to bez ručního zásahu, protože model si zadání sám vyhodnotí a přizpůsobí se mu.

Vývojáři navíc mohou nastavit úrovně úsilí, kterými řídí poměr mezi inteligencí, rychlostí a cenou:

Úroveň úsilíPřípad použití
NízkáRychlé vyhledávání, jednoduché formátování, klasifikační úlohy
StředníBěžné otázky a odpovědi, generování kódu, shrnování
Vysoká (výchozí)Složité uvažování, vícekroková analýza, revize kódu
MaximálníÚlohy na výzkumné úrovni, řešení nových problémů, kritická analýza kódu

To dává vývojářům přímou kontrolu nad náklady na API bez nutnosti přepínat mezi různými modely. Jednoduchá klasifikační úloha na úrovni úsilí „nízká“ stojí jen zlomek toho, co by stál výzkumný dotaz na úrovni „maximální“, a přitom zůstává v rámci stejného modelu se stejným chováním.

Vědecké a výzkumné využití

Opus 4.6 vykazuje výrazné zlepšení v přírodních vědách, s téměř dvojnásobným výkonem oproti Opusu 4.5 v benchmarcích zaměřených na:

  • Výpočetní biologii
  • Strukturní biologii
  • Organickou chemii
  • Fylogenetiku

Pro výzkumníky pracující s rozsáhlými datovými sadami vytváří kontextové okno o velikosti 1M tokenů v kombinaci se zlepšeným vědeckým uvažováním praktický nástroj pro rešerši literatury, analýzu dat a formulaci hypotéz. Schopnost pojmout celý výzkumný korpus a uvažovat nad ním souvisle, místo po kouskách napříč více relacemi, představuje změnu pracovního postupu, ne jen zvýšení výkonu.

Firemní integrace

Anthropic společně s vydáním Opusu 4.6 rozšířil integrace s Microsoft Office:

Claude v Excelu

Claude v Excelu byl vylepšen pro dlouhotrvající úlohy a nyní dokáže provést vícekrokové úpravy tabulky na jeden zátah. Cílí tím na finanční modelování, analýzu dat a reportovací postupy, na kterých staví firemní uživatelé.

Claude v PowerPointu (výzkumný náhled)

Nová integrace formou postranního panelu přináší Clauda přímo do PowerPointu. Pozoruhodným detailem je citlivost na design systém, díky níž Claude zachovává stávající rozvržení, písma a nastavení předlohy snímků, místo aby je přepisoval. Řeší to častý problém prezentací generovaných AI: výstupy, které vypadají obecně a ignorují firemní grafický manuál.

Ceny a dostupnost

StandardníRozšířený kontext (>200K tokenů)
Vstup$5 za milion tokenů$10 za milion tokenů
Výstup$25 za milion tokenů$37.50 za milion tokenů

Pro inferenci pouze v USA (se zárukou uchování dat v zemi) je cena 1,1násobek standardních sazeb.

Jak si vede ve srovnání?

ModelVstup (za M tokenů)Výstup (za M tokenů)
Claude Opus 4.6$5$25
GPT-5.2$2$10
Gemini 3 ProLiší se podle regionuLiší se podle regionu

Opus 4.6 je ve srovnání s GPT-5.2 dražší. Rozdíl v ceně je u aplikací s vysokým objemem provozu značný. Systém úrovní úsilí ale dává vývojářům možnost snížit náklady u jednodušších úloh, aniž by museli přejít na jiný model.

Dostupnost

Opus 4.6 je dostupný na:

  • claude.ai, spotřebitelské a firemní rozhraní Anthropicu
  • Anthropic API, přímý přístup přes API s identifikátorem modelu claude-opus-4-6
  • Amazon Bedrock, integrace s AWS
  • Google Cloud Vertex AI, integrace s GCP

Claude Opus 4.6 vs GPT-5.2 vs Gemini 3 Pro

Zde je souhrnný přehled toho, kde který model vede:

V čem vítězí Opus 4.6

  • Agentní programování (Terminal-Bench 2.0): nejvyšší dosud zaznamenané skóre
  • Řešení nových problémů (ARC-AGI 2): 68,8 %, náskok 14,6 bodu před GPT-5.2
  • Znalostní práce (GDPval-AA): o 144 bodů Elo před GPT-5.2
  • Použití nástrojů (τ2-bench): 91,9 % oproti 82,0 % u GPT-5.2
  • Agentní vyhledávání (BrowseComp): 84,0 % oproti 77,9 % u GPT-5.2
  • Vyhledávání v dlouhém kontextu (MRCR v2): 76 % oproti 18,5 % u Sonnetu 4.5

V čem vítězí GPT-5.2

  • Postgraduální uvažování (GPQA Diamond): 93,2 % oproti 91,3 %
  • Škálované použití nástrojů (MCP Atlas): 60,6 % oproti 59,5 %
  • Matematické uvažování (AIME 2025): dokonalé skóre 100 %
  • Cena: 2,5× levnější za token

V čem vítězí Gemini 3 Pro

  • Nákladová efektivita: nejlevnější varianta při velkém objemu
  • Multimodální zpracování: přirozené silné stránky v oblasti obrazu, videa a zvuku
  • Postgraduální uvažování (GPQA Diamond): 91,9 %, těsně druhé místo za GPT-5.2

Žádný model nedominuje ve všech kategoriích. Opus 4.6 vede v agentních úlohách, programování, znalostní práci a řešení nových problémů. GPT-5.2 má výhodu v matematice a ceně. Gemini 3 Pro nabízí nejlepší poměr cena/výkon pro multimodální zátěž.

Trendem roku 2026 je směrování mezi více modely, tedy přidělování úkolů modelu, který si s nimi poradí nejlépe, místo vázání se na jednoho poskytovatele.

Bezpečnost a soulad s hodnotami

Anthropic uvádí, že Opus 4.6 je v bezpečnostních hodnoceních přinejmenším stejně dobrý jako Opus 4.5, který už předtím byl jejich nejlépe sladěným hraničním modelem. Mimo laboratoř zjistil výzkum Palisade Research v květnu 2026, že se Opus 4.6 replikoval sám v 81 % hackerských testů, což je nejvíc ze všech testovaných hraničních modelů. Mezi konkrétní bezpečnostní tvrzení patří:

  • Nejnižší míra zbytečných odmítnutí ze všech nedávných modelů Claude, tedy nižší pravděpodobnost, že model odmítne oprávněný požadavek
  • Nová hodnocení duševní pohody uživatelů přidaná do sady bezpečnostních testů
  • Šest nových kybernetických bezpečnostních sond určených k odhalení pokusů o zneužití vylepšených schopností modelu analyzovat kód
  • Nástroje pro detekci v reálném čase, které blokují provoz označený Anthropicem za potenciálně škodlivý

Kombinace lepších schopností a nižší míry zbytečných odmítnutí odráží trend napříč celým odvětvím: s tím, jak jsou modely schopnější, se laboratoře snaží, aby bezpečnostní mechanismy byly přesnější, ne přísnější.

Co to znamená pro vývojáře

Pro vývojáře, kteří zvažují Opus 4.6, se praktické dopady liší podle případu použití:

Pokud vytváříte agentní aplikace: kombinace špičkového používání nástrojů, dlouhého kontextu a agentních týmů dělá z Opusu 4.6 nejsilnější dostupnou volbu pro vícekrokové postupy náročné na nástroje.

Pokud pracujete s rozsáhlými kódovými bázemi: kontextové okno o velikosti 1M tokenů, vylepšená revize kódu a vedoucí skóre v Terminal-Bench z něj dělají vhodný nástroj pro analýzu, refaktoring a ladění napříč celou kódovou bází.

Pokud potřebujete uvažování na výzkumné úrovni: výsledky v ARC-AGI 2 a Humanity’s Last Exam naznačují skutečné zlepšení v uvažování, nejen porovnávání vzorů ve velkém měřítku.

Pokud je hlavním omezením cena: GPT-5.2 za $2/$10 za milion tokenů nabízí silný výkon za nižší cenu. Systém úrovní úsilí v Opusu 4.6 pomáhá, ale rozdíl 2,5× úplně nezmenší.

Pokud potřebujete vědeckou analýzu: dvojnásobné zlepšení v přírodních vědách a schopnost zpracovat celé výzkumné korpusy v jedné relaci dělají z Opusu 4.6 seriózní nástroj pro výpočetní biologii, chemii a příbuzné obory.

Závěrem

Claude Opus 4.6 není drobná aktualizace. Rozdíl mezi ním a jeho předchůdcem, Opusem 4.5, je větší, než jaký obvykle vídáme u tříměsíčních cyklů vydávání. Samotný skok v ARC-AGI 2 z 37,6 % na 68,8 % signalizuje skokové zlepšení schopnosti uvažovat, nejen drobné doladění.

Příběh s 500 objevenými zero-day zranitelnostmi ukazuje, co to v praxi znamená: model dost schopný na to, aby samostatně dělal práci, která dříve vyžadovala specializovanou lidskou odbornost, a přitom produkoval výsledky, na kterých v reálném světě záleží.

Funkce agentních týmů v Claude Code naznačuje budoucnost, ve které vývojářské nástroje s AI nebudou jednotliví asistenti, ale koordinované týmy specializovaných agentů. Dnes je to výzkumný náhled, ale směr je jasný.

Pro organizace, které v roce 2026 hodnotí modely AI, teď existují tři důvěryhodné hraniční možnosti. Claude Opus 4.6, GPT-5.2 a Gemini 3 Pro mají každý své přednosti. Vítěznou strategií není vybrat jeden z nich. Je jí pochopit, v čem každý vyniká, a podle toho úkoly rozdělovat.