Aktualizováno 19. září 2026

Nejlepší AI modely v roce 2026

Žebříčky, srovnání a podrobné analýzy, každý měsíc aktualizované, jakmile vyjdou nové modely.

OpenAI 3. září spustila GPT-6 Astra, největší uvedení měsíce a o šest desetin bodu stále ne nejvyšší skóre. Artificial Analysis mu nyní na Intelligence Index v4.3 naměřila 52,8, o 5,7 bodu před GPT-5.6 Sol a o 0,6 bodu za Claude Fable 5.1, a to za $10 / $50 za 1M tokenů proti $4 / $20 u Sol. Kde se posouvá, je programování: vede vlastní běh Terminal-Bench 4.0 od Artificial Analysis s 60 % proti 55 % u Claude Fable 5.1, oba při úsilí xhigh, a dosáhne toho zhruba na 17 000 výstupních tokenech na úlohu proti 55 000 u Fable 5.1. Je to první model, který OpenAI označila za kritický z hlediska kybernetické bezpečnosti, takže nejdřív ho dostali prověření obránci z programu Daybreak; ChatGPT Business a Pro následovaly 4. září a Plus o pár hodin později, zatímco API, AWS, Azure a bezplatný tarif teprve přijdou. Tato stránka řadí podle naměřených skóre, takže model získává korunu, jakmile překoná držitele na žebříčcích, které kategorii definují, aniž by se čekalo na žebříčky založené na hlasování. Model, který zatím nikdo nemůže použít, je na kartě označen, nikoli o kartu připraven.

Claude Fable 5.1 dorazil 1. září a rovnou se postavil na vrchol Intelligence Index od Artificial Analysis, kde na verzi v4.3 stále vede se skóre 53,4, a vede i AA-Briefcase s 1646. Claude Opus 5 se stává volbou s nejlepším poměrem v tom, podle čeho se čtenáři skutečně rozhodují, v ceně, $5 / $25 za 1M tokenů proti $10 / $50 u Fable 5.1. Žebříčky založené na hlasování mezitím připadly OpenAI: GPT-6 Astra vede Code Arena: WebDev s 1800 a image-to-WebDev s 1733, Fable 5.1 je na obou druhý a Claude Opus 5 třetí, zatímco Qwen3.8-Max-0902 od Alibaby, který 2. září debutoval na #1 ve WebDev, klesl na čtvrté místo. Fable 5.1 má nyní v Areně tisíce hlasů, takže žebříčky lidských preferencí se už vyjádřily. Grok 4.6 je skutečným překvapením měsíce: dotrénování Grok 4.5 na stejném základu, které získalo pět bodů, 44,4 proti 39,1, a to za $2 / $6, a dlouhé agentické úlohy dokončí zhruba na polovinu tahů, které potřebuje Opus 5. Meta stoupá rychleji než kdokoli jiný: Muse Spark 1.3 dorazil 2. září se skóre 48,2 na témže indexu, za Claude Opus 5 a Claude Fable 5, i když vyšel nejdřív pro vývojáře, v Muse Code a Meta Model API, přičemž Meta uvedla, že nasazení do Facebooku, Instagramu a aplikace Meta AI bude následovat. Náš průvodce AI benchmarky vysvětluje, jak se tento index staví a proč záleží na jeho verzi.

Druhý pohyb je na levném konci a tento měsíc šel oběma směry. DeepSeek 16. srpna zdražil oba modely V4 zhruba čtyřnásobně a rozdělil ceník na špičku a mimo špičku, což stálo DeepSeek V4-Flash 0731 volbu s nejlepším poměrem cena/výkon; 10. září většinu toho otočil, V4-Flash ukončil a nahradil jej modelem DeepSeek-V4.1-Flash za $0.15 / $0.60 mimo špičku a $0.30 / $1.20 ve špičce, s vahami pod MIT hned první den. Volba zůstává u GLM 5.3 Flash, který dorazil 26. srpna s vahami pod MIT první den a dnes se prodává za prostý ceník $0.15 / $0.50 poté, co 9. září skončila uváděcí sleva: Artificial Analysis mu měří $0.25 na úlohu Intelligence Indexu při skóre 41,9 proti $0.27 a 39,5 u DeepSeeku. Mimo špičku jsou oba na vstupu shodní a GLM je levnější na výstupu; ve špičce vyhrává GLM na obou stranách. Google svou sazbu Flash snížil na polovinu už dřív: Gemini 3.7 Flash vyšel 13. srpna za uváděcích $0.75 / $3.75, na stejnou sazbu přešel i Gemini 3.6 Flash, a Gemini 3.8 Flash následoval 2. září přesně za tuto cenu se skóre 41,2 na indexu v4.3 od Artificial Analysis proti 39,4 u 3.7 Flash. Všechny tři ceny se 1. ledna 2027 zdvojnásobí.

Otevřené pole pak měsíc uzavřelo třemi vydáními během tří dnů: GLM 5.3 konečně 28. srpna zveřejnil své váhy, byť pod vlastní licencí Z.ai místo čisté MIT, kterou dostal jeho menší sourozenec, Alibaba 26. srpna otevřela Qwen3.8-Flash-Next jako první veřejný pohled na architekturu Qwen4 a Tencent 28. srpna uvolnil Hy4 Preview, 770 miliard parametrů pod Apache 2.0. Níže jsou vítězové kategorií pro září 2026. Klikněte na kteroukoli kartu a přejdete rovnou k úplnému rozboru, nebo použijte pevnou navigaci k přeskakování mezi kategoriemi. Žebříčky, benchmarky a ceny aktualizujeme do 48 hodin od každého většího uvedení modelu.

Vítězové kategorií za září 2026
Psaní
Claude Fable 5.1
#1 Intelligence Index (53,4) a #1 Humanity's Last Exam (59 %)
Poráží Claude Fable 5 na každém žebříčku, který změřil oba, za stejných $10 / $50. Nejlepší poměr: Claude Sonnet 5, zdarma na claude.ai.
Podrobná analýza →
Chat & každodenní asistent
GPT-5.6
Výchozí model ChatGPT od 9. července
Nejlepší asistent, kterého většina lidí skutečně otevře, s vyvážením schopností, rychlosti a dosahu.
Podrobná analýza →
Obrázky
ChatGPT Images 2.5
#1 a #2 na obou obrázkových žebříčcích Areny
Jeho dva modely obsadily generování obrázků z textu i úpravy obrázků do jednoho dne od spuštění a je výchozí ve všech tarifech ChatGPT včetně bezplatného. Nejlepší poměr: Flare, rychlejší z dvojice, za stejnou cenu za tokeny jako GPT Image 2.
Podrobná analýza →
Video
Gemini Omni 1.1 Flash
#1 Arena text-to-video (1515), 40sekundové scény
Nejnovější videomodel Googlu: prodloužení scény až na 40 sekund, výstup ve 4K, od $0.03 za sekundu.
Podrobná analýza →
Programování
GPT-6 Astra
60 % Terminal-Bench 4.0 a #1 na obou programátorských žebříčcích Areny
Vede vlastní Terminal-Bench 4.0 od Artificial Analysis i oba programátorské žebříčky Areny, za $10 / $50. Nejlepší poměr: Claude Opus 5 za $5 / $25.
Podrobná analýza →
Kreativita
Grok 4.6
Nejméně obsahových omezení + nativní X v reálném čase
Volba pro odvážnou, trendovou práci: nejméně mantinelů a nativní integrace X.
Podrobná analýza →
Přesnost & výzkum
Claude Fable 5.1
Nejvyšší faktická přesnost, jakou Artificial Analysis změřila (67 %)
Vede žebříčky, které měří, jak často se model prostě mýlí. Nejlepší poměr: Gemini 3.1 Pro za $0,52 na úlohu s ukotvením ve Vyhledávání Google.
Podrobná analýza →
Řešení problémů
GPT-6 Astra
#1 LiveBench Reasoning (92,65) a #1 ARC-AGI-2 (95 %)
Nejtěžší žebříčky uvažování sebral GPT-5.6 Sol pár dní po startu. Nejlepší poměr: GPT-5.6 Sol za $4 / $20, stále druhý na ARC-AGI-2.
Podrobná analýza →
AI agenti
Gemini Spark
První AI agent běžící v cloudu 24/7
Běží nepřetržitě v Google Cloud VM, hluboce integrovaný s Gmailem, Docs a Chromem.
Podrobná analýza →

Chcete špičkové AI modely bez žonglování se samostatnými předplatnými? Fello AI spojuje přední modely v jedné nativní aplikaci pro Mac, iPhone a iPad.

Stáhnout Fello AI
Co je nového v září 2026
15. zář. TypeSafe TypeSafe vychází z utajení s modelem Jev, který místo textu vrací typovaná rozhodnutí, za $0.042 za 1M tokenů Nové
TypeSafe AI vyšla 15. září 2026 po dvou letech v utajení se 40 miliony dolarů v seed kole vedeném DCVC a s modelem, který vůbec negeneruje text. Jev je první z toho, čemu firma říká modely System One: pošlete mu blok stavu a pevně danou sadu typovaných otázek a on na všechny odpoví v jednom paralelním průchodu, přičemž místo věty vrátí volbu, skóre nebo pravděpodobnost ano-ne. Protože je prostor odpovědí definovaný před voláním, nemůže vrátit poškozený výsledek, a odtud pochází věta z oznámení, že Jev nemůže halucinovat. Špatnou možnost vybrat stále může a vlastní dokumentace TypeSafe uvádí, že kalibrace nezaručuje správnost jednotlivé odpovědi. Cena je $42 za miliardu vstupních tokenů, tedy $0.042 za 1M, výstup zdarma, kontext 64k a pouze textový vstup. Výkonnostní tvrzení je potřeba číst opatrně, protože firma jich za tři dny zveřejnila čtyři různá: od méně než 100 milisekund a až 100x rychleji v tiskové zprávě po 193.6x rychleji a 444.6x levněji na hlavní stránce, pokaždé proti jinému soupeři, přičemž vlastní poznámka pod čarou označuje velká čísla za horní hranici reálných zisků. Její vlastní hodnocení pracovních postupů se poměřuje s průměrem GPT-6 Astra a Fable 5.1, nikoli se skutečnou pravdou, a veřejná benchmarková skóre firma záměrně nezveřejňuje. Dva nezávislé testy z 18. září naměřily zhruba 6x nižší cenu a 8x vyšší rychlost proti levnému modelu s vypnutým uvažováním a kalibrace obstála. Nic z toho nemění volbu na této stránce: Jev nemá spotřebitelské rozhraní a je v předběžném přístupu na čekací listině. Podrobnosti v našem vysvětlení modelů System One.
10. zář. DeepSeek DeepSeek ukončuje V4-Flash, nahrazuje jej V4.1-Flash a snižuje sazbu Flash zhruba o třetinu Nové
DeepSeek 10. září 2026 ukončil DeepSeek-V4-Flash a na jeho místo postavil DeepSeek-V4.1-Flash. Název modelu je nyní deepseek-flash; starší názvy deepseek-v4-flash a deepseek-v4-flash-vision-exp stále fungují, ale modely za nimi byly ukončeny a požadavky obsluhuje V4.1-Flash za sazbu Flash. Ta je zhruba o třetinu nižší: $0.15 / $0.60 za 1M tokenů mimo špičku a $0.30 / $1.20 ve špičce proti $0.22 / $0.66 a $0.44 / $1.32 u nahrazované verze, s cache hit za $0.003 mimo špičku. Špičková okna se nemění, 01:00 až 04:00 a 06:00 až 10:00 UTC ve všední dny, každá další hodina je za polovinu. V4-Pro zůstává beze změny na $0.66 / $1.98 mimo špičku a DeepSeek uvedl, že jej bude provozovat i po datu ukončení 14. září. Nový model je mixture-of-experts s 552 miliardami parametrů na architektuře causal encoder-decoder, která aktivuje 8 miliard parametrů při prefillu a 16 miliard při dekódování, zvládá kontext 1M tokenů, nativně čte obrázky a týž den se objevil na Hugging Face pod MIT. Artificial Analysis mu dává 39,5 na Intelligence Index v4.3 proti 34,5 u nahrazované verze V4-Flash 0731, za $0.27 na jednu úlohu indexu. Volbu s nejlepším poměrem cena/výkon zpět nebere: GLM 5.3 Flash má 41,9 za $0.25 na úlohu. Podrobnosti v našem průvodci cenami DeepSeeku.
3. zář. OpenAI GPT-6 Astra vychází za $10 / $50 a během jediného dne je na Plus i Pro a vede programátorské žebříčky Nové
OpenAI spustila GPT-6 Astra 3. září 2026 a uzavřela tím spor, který se táhl celý rok: je to GPT-6, ne další dílčí vydání v řadě GPT-5. Prezident společnosti Greg Brockman na tiskovém brífinku řekl „Vítejte v éře AGI.“ Nezávislá čísla jsou střízlivější než ten rámec. Artificial Analysis dává Astře 61 na Intelligence Index v4.1.1 při nastavení max, přesně na úrovni GPT-5.6 Sol, o pět bodů za Claude Fable 5.1 se 66 a o dva za Claude Opus 5 se 63, a účtuje si $10 / $50 za 1M tokenů proti $4 / $20 u Sol, což vychází o 75 % dráž na jednu úlohu indexu než u modelu, který nahrazuje. Silnější výsledek má na Coding Agent Index, kde Astra v prostředí Codex získává 67, na úrovni Claude Opus 5 a Claude Fable 5 v Claude Code a za 70 u Claude Fable 5.1, a dostane se tam na třetině tokenů oproti Sol a pětině oproti Opus 5, což ji staví na hranici nákladové efektivity. Na AA-Omniscience také snižuje halucinace na polovinu, z 92 % na 51 % při nastavení max, a přitom získává čtyři body přesnosti, přidává zhruba 80 Elo na AA-Briefcase a šest bodů na Humanity's Last Exam. Proti tomu ztrácí asi 80 Elo na GDPval-AA v2 a propadá o dva až tři body v zákaznické podpoře, na SciCode a v uvažování nad dlouhým kontextem. S čísly z uvedení jdou dvě výhrady: 98,6 % na ARC-AGI-3 není podíl vyřešených úloh, ale skóre efektivity akcí proti lidské referenci, měřené na sestavě, u které sama OpenAI ukázala, že dokáže výsledek ztrojnásobit, a Epoch AI přiznává, že OpenAI financovala FrontierMath a má výhradní přístup k jeho části. Skutečným omezením je dostupnost. Astra je první model, který OpenAI ve svém Preparedness Frameworku označila za kritický z hlediska kybernetické bezpečnosti, takže ho nejdřív dostali prověření obránci z programu Daybreak. ChatGPT Business a Pro následovaly 4. září a Plus o pár hodin později, zatímco API, AWS, Azure a bezplatný tarif stále chybí. Artificial Analysis mezitím Coding Agent Index zrušila a ve vlastním běhu Terminal-Bench 4.0 nyní Astra vede jednoznačně, 60 % proti 55 % u Claude Fable 5.1, což je důvod, proč programátorská koruna na této stránce přešla na Astru. Podrobnosti najdete v našem rozboru GPT-6 Astra.
2. zář. Alibaba Qwen3.8-Max-0902 bere žebříček WebDev Areny Claude Opus 5 o tři body, za $2 / $6 Nové
Alibaba 2. září 2026 vydala Qwen3.8-Max-0902 a jako první je potřeba správně pochopit název: jde o post-tréninkové osvěžení modelu Qwen3.8-Max, který vyšel 3. srpna, nikoli o novou verzi, se stejnými 2,4 bilionu parametrů a stejným kontextovým oknem 1M tokenů. Qwen uvádí, že model prošel dalším post-tréninkem na programování a práci typu Cowork. Důležitý je ale žebříček, kterým pohnul. Arena téhož dne oznámila, že Qwen3.8-Max-0902 debutoval celkově na #1 v Code Arena: WebDev se skóre 1691 bodů, tři body před Claude Opus 5 (Max), sedmnáct před Kimi K3 (Max) a dvacet dva před předchozím Qwen3.8-Max, a k tomu bere #1 v kategoriích Data & Analytics a Consumer Product. Je to poprvé letos, kdy byl model od Anthropicu sesazen z vrcholu hlasovacího programátorského žebříčku. Ceny jsou $2 / $6 za 1M tokenů s cache hity za $0.17 explicitní a $0.25 implicitní, což Arena počítá jako smíšených $5 za milion a nejlepší pozici na své Pareto frontě. Čtěte to se třemi výhradami. Tři body jsou na hlasovacím žebříčku v pásmu šumu, Artificial Analysis tehdy pro snímek 0902 nezveřejnila žádný Intelligence Index a od té doby mu dala 45,4 na v4.3 a jde o hostovaný model na QwenCloud bez spotřebitelského chatového rozhraní: otevřené váhy, které Alibaba pro Qwen3.8-Max slíbila v srpnu, stále nedorazily, takže se tím naše volba mezi open-weight modely nemění. Arena uvádí, že skóre z Agent Areny teprve přijdou. Qwen3.8-Max-0902 mezitím na WebDev klesl na čtvrté místo, za GPT-6 Astra, Claude Fable 5.1 a Claude Opus 5, a programátorská kategorie přešla na Astru. Podrobný rozbor najdete v našem rozboru Qwen 3.8.
2. zář. Meta Muse Spark 1.3, Intelligence Index z 57 na 61 při nezměněných $1.25 / $4.25, vítězí v programování a prohrává každý agentický řádek Nové
Meta vydala Muse Spark 1.3 dne 2. září 2026, svůj čtvrtý model Muse Spark za pět měsíců, v Muse Code a Meta Model API. Artificial Analysis jej hodnotí 61 na Intelligence Index v4.1.1, oproti 57 u 1.2 a 53 u 1.1, což je osm bodů za dva měsíce a nejrychlejší vzestup, jaký na této stránce kdokoli předvádí. Ceny se vůbec nepohnuly: $1.25 / $4.25 za 1M tokenů při kontextovém okně 1M tokenů, s úrovní Contributor stále za $0.10 / $0.20 výměnou za to, že Meta smí trénovat na vašich promptech a completions. Dvě věci na tomto uvedení je třeba číst pozorně. Na vlastním hodnocení Mety model vyhrává každý programátorský řádek, DeepSWE v1.1 se skóre 75,4 proti 74,0 u Claude Opus 5 a SWEAtlas CodeBase QnA se skóre 59,4, remizuje s GPT-5.6 Sol na Terminal-Bench 2.1 na 88,8 a s velkým odstupem bere obě dlouhokontextová pásma MRCR, 98,1 v pásmu 512K až 1M proti 55,5 u 1.2. Zároveň prohrává všech šest řádků, které Meta řadí pod Agent, čtyři s Opus 5 a dva s GPT-5.6 Sol, a tato polovina grafu zůstala téměř nezmíněna. Druhý háček je v tom, který model se vlastně měřil: sloupec v benchmarku je Muse Spark 1.3 (max), omezený náhled pro partnery Mety se skóre 62, zatímco verze, kterou dnes může volat kdokoli, je xhigh se skóre 61, a srovnávací sloupec 1.2 Meta spustila na xhigh, nikoli na max. Meta jej nejdřív vydala pro vývojáře, v Muse Code a Meta Model API, a uvedla, že nasazení do Facebooku, Instagramu a aplikace Meta AI bude následovat během několika dní, a slib otevřených vah se opět odsunul: srpnový závazek zveřejnit váhy Muse Spark 1.2 se změnil na nedatovanou zmínku o otevřených vahách, které přijdou brzy. Podrobnosti v našem rozboru Muse Spark 1.3.
2. zář. Google Gemini 3.8 Flash, o tři body výš na Intelligence Index za stejných $0.75 / $3.75 Nové
Google zpřístupnil Gemini 3.8 Flash 2. září 2026, tři týdny po 3.7 Flash a jako své třetí vydání Flash za 43 dní. Všechny specifikace zůstávají beze změny: 1M vstupního kontextu, limit 64K na výstupu, znalostní uzávěrka březen 2026, stejný seznam modalit a stejných úvodních $0.75 / $3.75 za 1M tokenů, které se 1. ledna 2027 zdvojnásobí na $1.50 / $7.50. Pohnula se jen skóre, a to na každém zveřejněném řádku. DeepSWE v1.1 stoupá z 65,3 % na 73,7 %, Terminal-bench 2.1 z 85,8 % na 89,4 %, Terminal-bench 4.0 z 11,2 % na 19,1 % a BioMysteryBench Human Difficult ze 43,5 % na 56,5 %. Artificial Analysis mu dává 59 na Intelligence Index v4.1.1 proti 56 u 3.7 Flash a měří 304,6 výstupních tokenů za sekundu proti 279,4, s pomalou dobou do prvního tokenu 13,39 sekundy, což z něj dělá model pro dávky a agenty spíš než pro interaktivní chat. Výhry čtěte spolu s prohrami: vlastní srovnávací tabulka Googlu dává 3.8 Flash 8 ze 14 řádků a Claude Opus 5 stále bere Terminal-bench 4.0 v poměru 51,8 % ku 19,1 %, OSWorld-2.0 75,4 % ku 59,0 % a GDPVal-AA v2 1824 ku 1545 na Elo. Číslo z DeepSWE, které převzala většina článků o uvedení, 71,0 %, není to, které stojí v PDF od Googlu; tam je 73,7 % proti 74,0 % u Opus 5. Vývojářský přístup byl živý už při oznámení, přes Gemini API, AI Studio, Antigravity a Gemini Enterprise Agent Platform. Spotřebitelský přístup je hlášen pro předplatitele Google AI Pro a Ultra, ale poznámky k vydání aplikací Gemini o něm zatím nemají žádný záznam a bezplatný tarif Gemini stále běží na 3.6 Flash. Podrobnosti v našem rozboru Gemini 3.8 Flash.
1. zář. Anthropic Claude Fable 5.1 a Mythos 5.1, nová #1 na Artificial Analysis se skóre 66 a snížení ceny čtení z cache o 75 % Nové
Anthropic vydal Claude Fable 5.1 a Claude Mythos 5.1 dne 1. září 2026 a jde o jeden model ve dvou konfiguracích bezpečnostních pojistek, nikoli o dva modely. Fable 5.1 je obecně dostupný; Mythos 5.1 uvolňuje omezení v biologii a kybernetické bezpečnosti a rozdává se na pozvání, bez zveřejněných kritérií způsobilosti. Artificial Analysis hodnotí Fable 5.1 na 66 na svém Intelligence Index v4.1.1 při nastavení max effort, což je nejvyšší skóre, jaké kdy naměřil, před Claude Opus 5 se skóre 63, Claude Fable 5 se skóre 62 a GPT-5.6 Sol a Grok 4.6 se skóre 61. Vzal si tehdy také Agentic Index se skóre 61 proti 59 u Opus 5, žebříček GDPval-AA v2 pro profesionální výstupy se skóre 1853 proti 1824 a Humanity's Last Exam se skóre 59,1 % proti 55,5 % u Fable 5. Nastavení effort zde hraje větší roli než obvykle: tentýž model čte 58 při low, 60 při medium, 62 při high a 65 při xhigh a tato nastavení pokrývají jedenáctinásobný rozdíl ve výstupních tokenech, od 13,1 milionu do 143,7 milionu napříč celou sadou. Ceny zůstávají nezměněné na $10 / $50 za 1M tokenů, ale čtení z cache klesá o 75 % na $0.25 z $1.00 u Fable 5, a právě tam u dlouhých agentických běhů leží skutečná úspora. Na vlastních číslech Anthropicu dosahuje 52,6 % na Terminal-Bench-Science 0.1 proti 29,0 % u Opus 5 a 212stránková systémová karta zvýšila vlastní hodnocení rizika sladění společnosti z velmi nízkého na nízké. Dvě věci zvažte, než přejdete: Anthropic stále doporučuje začít s Opus 5 pro většinu zátěží za poloviční cenu a v době uvedení neměl žádný žebříček Areny hlasy ani pro jeden z těchto modelů. Fable 5.1 už hodnocení má: na obou programátorských žebříčcích Areny je druhý a na textovém pátý. Úplné podrobnosti najdete v našem rozboru Claude Fable 5.1 a Mythos 5.1.
28. srp. Z.ai Váhy GLM 5.3 jsou venku po bezpečnostní pauze, ale licence není MIT Nové
Z.ai zveřejnilo váhy GLM 5.3 na Hugging Face 28. srpna 2026, dva týdny po spuštění API a přesně k datu, které neslo zástupné místo, takže slíbené bezpečnostní vyhodnocení skutečně proběhlo a pauza je uzavřená, ne otevřená. Co se změnilo, je licence. GLM 5.3 Flash vyšel o dva dny dříve pod čistou MIT; vlajková loď nese vlastní dokument nazvaný GLM 5.3 License a pole licence v kartě modelu uvádí glm-5.3, nikoli mit. Samotné udělení práv MIT těsně sleduje, s právem model provozovat, nasazovat, dotrénovat, upravovat, šířit i prodávat a s váhami výslovně zahrnutými do definice softwaru, takže komerční užití je otevřené téměř všem. Jedna klauzule je skutečně nová: provozovatel model-as-a-service, jehož tržby přesáhnou 10 miliard dolarů za jakýchkoli dvanáct po sobě jdoucích měsíců, musí před komerčním nasazením projít bezpečnostní revizí Z.ai, přičemž rozsah a metodu té revize si Z.ai vyhrazuje určit samo. Všimněte si také, že Hugging Face počítá zveřejněný checkpoint na 753B parametrů proti základu 744B, který podle Z.ai sdílí s GLM-5.2; to je typ rozdílu, jaký vzniká mechanickým počítáním parametrů, nikoli doklad jiného modelu. Naši open-weight volbu to neposouvá. GLM 5.3 Flash zůstává modelem, který bychom hostovali, protože 320B pod čistou MIT se provozuje i právně ošetřuje výrazně snáz než 753B pod vlastní licencí. Podrobnosti v našem rozboru GLM 5.3.
28. srp. Tencent Tencent Hy4 Preview, 770B otevřených vah pod Apache 2.0 a zatím největší permisivně licencovaný model Nové
Tencent vydal a uvolnil Hy4 preview 28. srpna 2026, novou vlajkovou loď řady Hunyuan a největší model, jaký kdy kdo zveřejnil pod Apache 2.0. Běží na 770 miliardách parametrů celkem se 49 miliardami aktivních na token v architektuře mixture-of-experts, přijímá kontextové okno, které Tencent popisuje jako přesahující 1M tokenů, a vedle plné přesnosti vychází i ve variantě FP8. Ceny API jsou $0.834 za 1M vstupních tokenů, $2.501 za výstupní a $0.042 za kešovaný vstup, což je na tuto velikost levné. Skutečnou zprávou je licence: Apache 2.0 je permisivnější než vlastní dokument u Kimi K3 i než licence, kterou Z.ai téhož dne připojilo ke GLM 5.3. S tvrzením o kvalitě zacházejte opatrně, protože jediným dosavadním důkazem je dodavatelův vlastní. Tencent provedl interní slepé hodnocení 203 inženýrských úloh, které bodovalo 163 expertů, a Hy4 preview v něm získává 2,99 ze 4,00 proti 2,94 u Kimi K3 a 2,92 u GLM 5.3. To je vlastní panel Tencentu, rozdíly se vejdou do jedné desetiny bodu a žádná nezávislá firma pro model tehdy nezveřejnila Intelligence Index ani hodnocení Areny. Arena jej mezitím zařadila na jedenácté místo ve WebDev se skóre 1624, Intelligence Index od Artificial Analysis stále chybí, takže jej uvádíme, nikoli řadíme. Tencent rovněž tvrdí, že model pomohl automatizovat optimalizaci vlastního trénovacího procesu a zvýšil vlastní propustnost inference o naměřených 31,8 %. Je dostupný jako otevřené váhy a přes WorkBuddy, CodeBuddy, Yuanbao a ima, dále přes Tencent Cloud TokenHub a OpenRouter, s bezplatným přístupem na WorkBuddy a CodeBuddy po dobu dvou týdnů od uvedení. Podrobný rozbor najdete v našem rozboru Tencent Hy4 Preview.
26. srp. Z.ai GLM 5.3 Flash, odhalení Ox Alpha a první váhy pod MIT, které Z.ai vydalo od GLM-5.2 Nové
Z.ai vydalo GLM 5.3 Flash 26. srpna 2026 a není to model, na který se čekalo. Váhy zadržené 14. srpna patří GLM 5.3; tohle je samostatný model na nově natrénovaném základu, 320 miliard parametrů s 18 miliardami aktivních, první nativně multimodální model řady GLM-5, a na Hugging Face pod licencí MIT se objevil týž den. Je to zároveň onen utajený model, který obsluhoval provoz na OpenRouteru pod jménem Ox Alpha a během té ukázky běžel výhradně na čínských AI čipech, což popisuje způsob provozu, nikoli způsob trénování. Artificial Analysis mu dává 57 bodů na Intelligence Index v4.1.1, o čtyři body více než GLM-5.2 při méně než poloviční velikosti, a řadí jej na Paretovu hranici poměru inteligence a ceny. Na dnešním indexu v4.3 má 41,9 proti 34,0 u GLM-5.2, za $0.25 na jednu úlohu indexu. Ceníková sazba je $0.15 / $0.50 za 1M tokenů; padesátiprocentní uváděcí sleva běžela do 24:00 dne 9. září a skončila. Náhrada V4.1-Flash od DeepSeeku z 10. září většinu rozdílu smazala: mimo špičku jsou teď oba na vstupu shodně na $0.15, GLM je levnější na výstupu, $0.50 proti $0.60, a ve špičce GLM podbízí na obou stranách. S čísly pro programování a agentní práci zacházejte opatrně: pocházejí z vlastního grafu Z.ai, který si jako srovnání bere Claude Opus 4.8 a GPT-5.6 Terra místo současných lídrů, a stojí v něm Terminal Bench 2.1 84,3, DeepSWE v1.1 63,4 proti 46,2 u GLM-5.2 a AutomationBench 48,8. Jediné číslo v tom grafu, které měřila Artificial Analysis, je GDPval-AA v2, kde GLM 5.3 Flash dosahuje 1773 Elo, nejvíce ze všech vynesených modelů. Arena jej mezitím ohodnotila, sedmnáctý ve WebDev a desátý v image-to-WebDev. Naši open-weight volbu to mění: GLM 5.3 Flash nahrazuje GLM-5.2 jako model pod MIT, který bychom hostovali. Jedna výstraha k hardwaru: 18B aktivních neznamená 18B k hostování, protože směrování mixture-of-experts potřebuje mít všech 320B vah v paměti, takže jde o multi-GPU server, ne o pracovní stanici. Podrobnosti v našem rozboru GLM 5.3 Flash.
26. srp. Alibaba Qwen3.8-Flash-Next, otevřené váhy a první veřejný pohled na architekturu Qwen4 Nové
Alibaba zveřejnila Qwen3.8-Flash-Next na Hugging Face 26. srpna 2026 a jde v něm spíš o architekturu než o žebříčky: Qwen uvádí, že je to raný pohled na návrh, který použije rodina Qwen4, vydaný proto, aby se na něj komunita mohla připravit. Je to mixture-of-experts se 125 miliardami parametrů a pouhými 6 miliardami aktivních na token, plus samostatné N-gramové embedding s 51 miliardami parametrů, a přijímá text, obraz i video. Kontext je nativně 262 144 tokenů s rozšířením na 1M. Mezi zveřejněnými čísly Qwenu je 91,7 na GPQA Diamond, 62,5 na SWE-Bench Pro, 58,7 na DeepSWE 1.1, 81,0 na SWE-Bench Multilingual a 84,5 na AndroidWorld vision, vše dodavatelovo a tehdy zcela bez nezávislého hodnocení. Artificial Analysis mu od té doby dala 39,9 na Intelligence Index v4.3 a Arena jej řadí devátý ve WebDev se skóre 1635. Licenci je třeba si přečíst dřív, než na ní začnete stavět, protože to není Apache. Qwen Community License 1.0 povoluje komerční užití, úpravy i hostování, ale vyžaduje viditelné uvedení názvu modelu, jakmile produkt překročí 100 milionů měsíčních aktivních uživatelů nebo 20 milionů dolarů měsíčních tržeb, a vyžaduje samostatnou licenci od Qwenu pro provozování model-as-a-service nebo produktu typu AI pracovní asistent. Interní použití je z této druhé podmínky vyňato.
21. srp. OpenAI GPT-5.6 Sol zlevnil o více než 20 %, nyní je pod Claude Opus 5 na obou stranách Nové
OpenAI dne 21. srpna 2026 snížil cenu GPT-5.6 Sol z $5 / $30 na $4 / $20 za 1M tokenů, což je první zlevnění vlajkového modelu od červencového uvedení rodiny GPT-5.6. Sazba je propagační a podle OpenAI potrvá zhruba tři měsíce. Týká se API a kreditů pro Codex a ChatGPT Work; ceny předplatného Plus, Pro a Business se nemění. Za $4 / $20 nyní Sol podráží Claude Opus 5 za $5 / $25 ve vstupu i výstupu, poprvé je tedy vlajkový model OpenAI z těch dvou levnější.
16. srp. DeepSeek DeepSeek zdražuje API zhruba čtyřnásobně a dělí ceník na špičku a mimo špičku Nové
DeepSeek převedl oba modely V4 na nový ceník v 16:00 UTC dne 16. srpna 2026 a směr je pro tento obor nezvyklý: ceny šly nahoru, ve špičce zhruba čtyřnásobně. V4-Flash 0731 šel z rovných $0.14 / $0.28 za 1M tokenů na $0.22 / $0.66 mimo špičku a $0.44 / $1.32 ve špičce a V4-Pro 0813 z $0.435 / $0.87 na $0.66 / $1.98 mimo špičku a $1.32 / $3.96 ve špičce, s kešovaným vstupem na $0.007, respektive $0.022 mimo špičku. Špička je od 01:00 do 04:00 a od 06:00 do 10:00 UTC od pondělí do pátku a každá jiná hodina je mimo špičku, přesně za polovinu špičkové sazby. DeepSeek to podal jako rozumnější rozdělení kapacity. Na samotných modelech se nic nezměnilo, takže jde čistě o ekonomickou událost, ale pro tuto stránku o zásadní: stálo DeepSeek V4-Flash volbu s nejlepším poměrem cena/výkon, která přešla na GLM 5.3 Flash s ceníkovými $0.15 / $0.50. DeepSeek většinu zdražení 10. září otočil, V4-Flash ukončil a nahradil jej V4.1-Flash za $0.15 / $0.60 mimo špičku, takže na vstupu jsou mimo špičku znovu na stejné úrovni. Váhy zůstávají pod MIT, takže kdo si model hostí sám, se změny nedotkne. Podrobnosti v našem rozboru DeepSeek V4.
14. srp. Z.ai GLM 5.3, velký agentický skok jen z dotrénování, vyšel bez open weights Nové
Z.ai vydalo GLM 5.3 dne 14. srpna 2026 a pozoruhodné je to, co se nezměnilo: běží na stejném základu se 744 miliardami parametrů jako GLM-5.2, bez nového předtrénování. Veškerý nárůst pochází ze škálovaného dotrénování a ten agentický je velký. Na vlastním grafu Z.ai jde Terminal-Bench 3.0 z 4,6 na 28,3, DeepSWE v1.1 ze 46,2 na 66,9 a CyberGym ze 77,2 % na 84,5 %, o čemž firma tvrdí, že těsně předčí Claude Mythos 5 s 83,8 a GPT-5.6 Sol s 83,6. Všechna tato čísla jsou dodavatelova, zatím bez nezávislého auditu, a graf je jinde méně lichotivý: na interním Code Bench od Z.ai stále vede Claude Fable 5 s 39,5 % proti 31,4 % u GLM 5.3 a na ExploitBench jsou lídři frontier na 78,0 % proti 54,4 %. Háček je v licenci, nikoli ve skóre. GLM-5.2 vydal váhy pod MIT během několika dnů; GLM 5.3 nevyšel s žádnými a Z.ai uvedlo, že budou následovat po bezpečnostním vyhodnocení schopnosti modelu vyhledávat zranitelnosti, zhruba za dva týdny. To se vyřešilo 28. srpna 2026, kdy Z.ai zveřejnilo váhy přesně k datu, které zástupná stránka nesla, byť pod vlastní licencí GLM 5.3 License místo čisté MIT, kterou dostaly GLM-5.2 i GLM 5.3 Flash. Sazba za token je nyní zveřejněná, $1.40 / $4.40 za 1M tokenů, vedle GLM Coding Planu a ZCode. To, co dorazilo 26. srpna, byl místo toho GLM 5.3 Flash, jiný a menší model, který váhy pod MIT vydal, a právě to je vydání, které posunulo naši open-weight volbu. Podrobnosti v našem rozboru GLM 5.3.
13. srp. Google Gemini 3.7 Flash, programátorské skóre roste a cena klesá na polovinu na $0.75 / $3.75, do ledna Nové
Google vydal Gemini 3.7 Flash 13. srpna 2026, 23 dní po 3.6 Flash a jako třetí vydání Flash za necelé dva měsíce, zatímco Gemini 3.5 Pro stále nevyšel. Podstatou jsou programátorské zisky: DeepSWE v1.1 stoupá ze 49,0 % na 65,3 %, FrontierCode 1.1 Main z 34,4 % na 43,6 % a AutomationBench se téměř zdvojnásobuje ze 17,0 % na 30,4 %. Artificial Analysis jej hodnotí na 56 na svém indexu v4.1.1 proti 52 u 3.6 Flash a řadí jej na první místo ze 182 modelů v rychlosti výstupu s 385,1 tokenu za sekundu, což jej staví na Paretovu hranici inteligence versus čas. Kontextové okno a limit výstupu 64K jsou proti 3.6 Flash nezměněné, takže se nic neobětovalo. Dvě výhrady váží víc než benchmarky. Sazba $0.75 / $3.75 je úvodní a vyprší 31. prosince 2026, poté se zdvojnásobí na $1.50 / $7.50, přesně na to, co stál 3.6 Flash při uvedení; Google zároveň převedl 3.6 Flash na stejnou sazbu, takže oba nyní stojí stejně a upgrade je čistě rozhodnutí o schopnostech. A spotřebitelský přístup vede jen přes Spark, který vyžaduje Google AI Pro nebo Ultra a vylučuje Evropský hospodářský prostor, Spojené království, Švýcarsko a Nigérii, takže většina evropských čtenářů se k němu v aplikaci Gemini vůbec nedostane. Bezplatná úroveň Gemini stále dostává 3.6 Flash. Přístup přes API je všude nedotčen. Podrobnosti v našem rozboru Gemini 3.7 Flash.
12. srp. SpaceXAI Grok 4.6, dotrénování zvedá Intelligence Index z 56 na 61 při nezměněných $2 / $6 Nové
SpaceXAI vydala Grok 4.6 dne 12. srpna 2026 a výslovně nejde o nový základový model: společnost ponechala základ z Grok 4.5 a zlepšení koupila delším doplňkovým tréninkem, přegenerovanými trajektoriemi pro doladění a posilovaným učením v agentických prostředích. Žádná nová architektura ani počet parametrů zveřejněny nebyly. Artificial Analysis jej řadí na Intelligence Index 61, pět bodů nad Grok 4.5, což jej staví na sdílené třetí místo s GPT-5.6 Sol, za Claude Opus 5 se skóre 63 a Claude Fable 5 se skóre 62, jak index vypadal v tom měsíci; Claude Fable 5.1 se od té doby dostal nad všechny tři se skóre 66. Agentické hodnoty jsou silnější než souhrnný index: Elo 1753 na GDPval-AA v2 hned za Opus 5, 88,4 % na Terminal-Bench v2.1 a 50,7 % na tau3-Banking. Tehdejším argumentem byla efektivita, $0.84 na indexovou úlohu a zhruba 53 tahů a 0,5 miliardy vstupních tokenů u dlouhých úloh proti přibližně 103 tahům a 2,0 miliardám u Opus 5. Na dnešních číslech v4.3 od Artificial Analysis tento argument slábne: Grok 4.6 stojí $1.86 na indexovou úlohu, tedy více než $1.61 u Muse Spark 1.3 při vyšším skóre. Ceny zůstávají nezměněné na $2 / $6 za 1M tokenů s cache input za $0.50, na stejném kontextovém okně 500K tokenů, ale je tu past, kterou je dobré znát: jakmile prompt dosáhne 200 000 tokenů, SpaceXAI přeúčtuje celý požadavek sazbou $4 / $12, nikoli jen to, co limit přesahuje. Jedno varování k benchmarkům, protože řada článků to už popletla: Terminal-Bench v3.0 je jiný a mnohem těžší test než v2.1, takže 26 % na v3.0 a 88,4 % na v2.1 jsou obě pravdivá tvrzení o tomtéž modelu. Od prvního dne běží v API SpaceXAI, v Cursoru a Grok Build a u partnerů OpenRouter, Vercel a Cloudflare. Úplné podrobnosti najdete v našem rozboru benchmarků a cen Grok 4.6.
5. srp. Meta Muse Spark 1.2 a Muse Code, Intelligence Index z 51 na 57 při nezměněných $1.25 / $4.25, plus terminálový programátorský agent Nové
Meta vydala Muse Spark 1.2 dne 5. srpna 2026 spolu s Muse Code, svým prvním terminálovým programátorským agentem, který běží na macOS a Linuxu bez desktopové aplikace a bez předplatného. Artificial Analysis hodnotí model na Intelligence Index 57 při nejvyšším nastavení uvažování na svém aktuálním indexu v4.1.1, oproti 51 u verze 1.1 a 43 u dubnového vydání, a téměř celý tento nárůst je agentický, nikoli obecné znalosti; jeho GDPval-AA v2 Elo skočilo z 1371 na 1631, zatímco Terminal-Bench v2.1 se posunul jen z 78 % na 80 %. Ceny zůstávají nezměněny na $1.25 / $4.25 za 1M tokenů při kontextovém okně 1M tokenů a Meta přidala úroveň Contributor za $0.10 / $0.20, zhruba o 92 % levněji, výměnou za to, že Meta smí trénovat na vašich promptech a completions. Dostupnost se rozšířila z náhledu pouze pro USA, pod nímž vyšla verze 1.1, na rozšířený globální přístup přes Muse Code, Meta Model API a OpenRouter. Na vlastních uváděcích grafech Mety končí model druhý za Claude Opus 5 na všech třech zveřejněných programátorských benchmarcích, se skóre 82,9 % proti 86,7 % na Terminal-Bench 2.1.
3. srp. Alibaba Qwen 3.8 (Qwen3.8-Max), multimodální vlajkový model s 2,4 biliony parametrů nyní obecně dostupný za $2 / $6 Nové
Alibaba zpřístupnila Qwen3.8-Max obecně dne 3. srpna 2026, dva týdny po náhledu na WAIC Shanghai, a každé číslo, které při náhledu chybělo, má nyní hodnotu. Běží s 2,4 biliony celkových parametrů a zhruba 95 miliardami aktivních na token na řídkém návrhu Mixture-of-Experts, přijímá text, obrázky a video a potvrzuje kontextové okno 1M tokenů s až 128K výstupními tokeny. Ceny API jsou $2 / $6 za 1M tokenů, ploché napříč celým kontextem místo odstupňování podle délky promptu, s cache reads za $0.25. Tvrzení „druhý hned za Fable 5“ se nyní čistě rozpadá na dvě části: na žebříčku vision Areny je #2 se skóre 1305, hned za Fable 5, ale na textovém žebříčku je #5 se skóre 1496, za čtyřmi záznamy Anthropicu. Obě skóre Areny jsou stále označena jako předběžná a slíbené open weights nevyšly. Qwen 3.8 držíme mimo hodnocené volby, dokud váhy a licence skutečně nedorazí.
Čeká se Google Gemini 3.5 Pro, stále nevydaný, měsíce za plánem podle Bloombergu Zpožděno
Gemini 3.5 Pro zůstává největším čekajícím uvedením. Google jej oznámil na I/O dne 19. května spolu s Gemini 3.5 Flash, ale vyšel jen Flash a červnový cíl padl. Bloomberg 16. července 2026 informoval, že model je měsíce za plánem a nedosáhl interních cílů Googlu, přičemž společnost stále pracuje na zlepšení jeho schopností zejména v programování. To je celý podložený obraz. Google nikdy veřejně nepotvrdil datum uvedení a Google nezveřejnil finální specifikace jako kontextové okno nebo režimy uvažování, takže kolující čísla berte jako nepotvrzená. Mezitím používejte Gemini 3.8 Flash, pokud pracujete přes API, nebo Gemini 3.6 Flash, pokud jste na bezplatné aplikaci Gemini, která jej stále používá; 3.5 Pro přesuneme do hlavního žebříčku ve chvíli, kdy vyjde.
Volba kategorie, září 2026

Nejlepší AI na psaní

1
Claude Fable 5.1
Nejlepší psaní celkově
2
Kimi K3
Tvůrčí beletrie
3
Claude Sonnet 5
Zdarma na každý den

Nejlepší AI na psaní je Claude Fable 5.1, který poráží Claude Fable 5 na každém žebříčku, jenž změřil oba, za stejných $10 / $50, s Claude Sonnet 5 jako volbou s nejlepším poměrem cena/výkon v bezplatné verzi a Claude Fable 5 jako volbou, pokud vážíte lidské hlasy Areny výše než skóre z benchmarků. Fable 5 vede žebříček tvůrčího psaní Areny a kraluje LiveBench Language se skóre 90,7, na EQ-Bench Creative Writing v3 ale klesl na osmé místo. Tomu žebříčku nyní vévodí GPT-6 Astra se skóre 2163.9 a druhý je Claude Fable 5.1 se skóre 2152.7. Je to změna oproti minulému měsíci, kdy tuto pozici držel Claude Sonnet 5 na GDPval-AA; preferenční žebříčky toto umístění nepodporují, takže Sonnet 5 je nyní volba s nejlepším poměrem cena/výkon, nikoli lídr kvality. Fable 5 stojí $10 / $50 za 1M tokenů a je trvale zahrnutý v Claude Max a Team Premium zhruba na 50 % běžných limitů použití. Pokud je vaše psaní pracovní výstup, a ne próza, žebříčku GDPval-AA v2 pro profesionální výstupy nyní vládne Claude Fable 5.1 se skóre 1853, před Claude Opus 5 se skóre 1824 a Fable 5 se skóre 1723. Fable 5.1 dorazil 1. září jako schopnější model za stejných $10 / $50 a poráží Fable 5 na každém žebříčku, který změřil oba, včetně Humanity's Last Exam se skóre 59,1 % proti 55,5 %. Korunu jsme na něj přesunuli, protože tato stránka řadí podle naměřených skóre; Arena jej zatím neohodnotila, a proto Fable 5 zůstává v tabulce jako volba podle lidské preference. Překlad je samostatná otázka se samostatným vítězem, které se věnujeme v průvodci nejlepší AI na překlad.

ModelNejlepší proSilná stránkaSlabinaCena (za 1M tokenů)
Claude Fable 5.1Nejlepší psaní celkově#1 Humanity's Last Exam (59 %), #1 Intelligence Index (53,4, v4.3), #1 přesnost AA-Omniscience (67 %)Pátý na textovém žebříčku Areny, za Claude Fable 5$10 / $50
Claude Fable 5Vede žebříčky lidských hlasů Areny#1 Arena text celkově (1508.6), #1 LiveBench Language (90.7), #8 EQ-BenchNejdražší volba zde$10 / $50
Kimi K3Tvůrčí beletrie a hlas#4 EQ-Bench Creative Writing (2070.6)Jen #10 na Arena tvůrčí psaní$3 / $15
Claude Sonnet 5Bezplatné psaní na každý denZdarma a výchozí na claude.ai, 1M kontext#53 Arena tvůrčí psaní; 75,0 LiveBench Language$2 / $10, nyní trvale
Claude Opus 5Profesionální výstupy s ohledem na cenu#2 GDPval-AA v2 se skóre 1824, před Fable 5 (1723)Za Fable 5 na Arena text, za Fable 5.1 na GDPval-AA v2$5 / $25
GPT-5.5Faktograficky ukotvené obchodní psaníDoložené zlepšení faktografické spolehlivosti oproti GPT-5.4Úrovně uvažování nyní označeny jako zastaralé$5 / $30
Gemini 3.8 FlashHromadné koncepty ve velkémIntelligence Index 41,2, 304,6 tok/s na výstupu, 1M kontextLaděný spíše na agenty než na prózu; úvodní cena se 1. ledna 2027 zdvojnásobí$0.75 / $3.75
Druhé místo a alternativy: Claude Fable 5 je druhý a je volbou, pokud vážíte lidské hlasy Areny, Kimi K3 je volbou pro výraznou fikci, i když je nyní na EQ-Bench čtvrtý, Claude Sonnet 5 je volbou s nejlepším poměrem a tou, kterou použít, pokud neplatíte, Claude Opus 5 je levnější volbou pro profesionální výstupy a Gemini 3.8 Flash je volbou pro hromadné psaní konceptů.
Co se tento měsíc změnilo

Koruna za psaní přešla na Claude Fable 5.1 a spolu s ní se posunulo i pravidlo této stránky: řadíme nyní podle naměřených skóre, místo abychom čekali na lidské hlasy Areny. Fable 5.1 poráží Fable 5 na každém žebříčku, který změřil oba, s Humanity's Last Exam 59,1 % proti 55,5 %, GDPval-AA v2 1724 proti 1632 a Intelligence Indexem 53,4 proti 49,7 na v4.3, to vše za stejných $10 / $50. Claude Fable 5 si drží textový a tvůrčí žebříček Areny, kde je stále #1 s 1508,6 k datu 1. srpna, takže zůstává v tabulce pro každého, kdo váží lidskou preferenci výše než skóre z benchmarků, a Claude Sonnet 5 zůstává bezplatnou volbou s nejlepším poměrem. Dvě čísla, která jsme minulý měsíc uváděli, byla také přepočtena: AA-Omniscience nyní ukazuje 43 pro oba modely Fable místo 40 a Fable 5 na Humanity's Last Exam má 55,5 % místo 53,3 %.

Volba kategorie, září 2026

Nejlepší AI pro chat & každodenního asistenta

1
GPT-5.6
Výchozí model ChatGPT
2
Claude Fable 5
Nejlépe hodnocený
3
Claude Opus 5
Promyšlená hloubka

Nejlepší AI pro každodenní chat je GPT-5.6 a upřímným důvodem je dosah, ne pozice na žebříčku. Je to model, který ChatGPT ve výchozím nastavení nabízí největší uživatelské základně v kategorii, což z něj dělá nejlepšího asistenta, kterého většina lidí skutečně otevře. V čisté lidské preferenci lídrem není: GPT-5.6 Sol sedí na #14 na textovém žebříčku Areny se skóre 1482,8, kde Claude Fable 5 vede se skóre 1508.6. Většina uživatelů ChatGPT dostane vyváženou úroveň Terra, o níž OpenAI říká, že se vyrovná GPT-5.5, a od snížení cen 30. července 2026 stojí o 60 % méně. Je dostupný v ChatGPT (zdarma s limity, Plus za $20/měsíc, Pro za $100/měsíc), přes API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 za 1M tokenů) a zabalený uvnitř Fello AI vedle Claude, Gemini, Grok a DeepSeek. Jedna výhrada: system card OpenAI a hodnotitel METR upozornili na zvýšené chování „scheming“ u Sol, takže GPT-5.5 Instant zůstává bezpečnější volbou pro práci citlivou na halucinace.

ModelNejlepší proSilná stránkaSlabinaCena
GPT-5.6Každodenní chat, výchozí model ChatGPTAsistent, kterého většina otevře; Terra se vyrovná GPT-5.5 za ~poloviční cenu#14 na Arena text; scheming označen METRZdarma / $20/měs. Plus; API $0.20 / $1.20 až $4 / $20
Claude Fable 5Nejlépe hodnocená konverzace#1 na Arena text celkově (1508.6) a v 6 ze 7 podkategoriíŽádná bezplatná verze; přístup přes kredity použití na Pro$10 / $50 API
Claude Opus 5Promyšlené, jemné odpovědiTřetí na Intelligence Index od Artificial Analysis (50,7), za Claude Fable 5.1 a GPT-6 Astra#10 na Arena text, za Claude Fable 5$20/měs. Pro, $5 / $25 API
GPT-5.5 InstantKaždodenní práce citlivá na halucinaceO 52,5 % méně halucinovaných tvrzení vs. 5.3 InstantÚrovně uvažování nyní označeny jako zastaralé$20/měs. Plus; API $5 / $30
Gemini 3.6 FlashRychlý, zdarma, multimodálníStále model, který dostává bezplatná úroveň Gemini, 1M kontext, #12 na Arena textSlabší v nejtěžším uvažování; 3.8 Flash jej předčí za stejnou cenuZdarma / $0.75 / $3.75 API
Fello AIVšechny top modely, jedna aplikaceChatGPT + Claude + Gemini + Grok + DeepSeek a další na Macu, iPhonu a iPaduSměrováno přes aplikaci, ne přímo$9.99/měs.
Druhé místo a alternativy: Claude Fable 5 je druhý a skutečný lídr preferencí, Claude Opus 5 je druhý pro promyšlené každodenní použití, Gemini 3.6 Flash je druhý pro rychlý a zdarma a Grok 4.6 je nika pro dny s živými zprávami. Fello AI je přirozená volba, pokud chcete top modely v jedné aplikaci pro Mac a iOS za $9.99/měsíc místo žonglování s předplatnými.
Co se tento měsíc změnilo

GPT-5.6 si drží volbu pro chat díky dosahu a odstup od lídra preferencí se spíše zvětšil, než uzavřel. K datu 1. srpna sedí Sol na #14 na Arena text se skóre 1482,8, dolů z #11, zatímco Claude Fable 5 vede se skóre 1508.6. Na produktu se nic nezměnilo, takže se koruna nehýbe: stále jde o to, kterého asistenta většina lidí skutečně otevře. GPT-6 Astra od OpenAI vyšla 3. září a do ChatGPT Business a Pro dorazila 4. září a do Plus o pár hodin později, ale volba zůstává u GPT-5.6 kvůli dosahu: Astra šla nejdřív k prověřeným obráncům z programu Daybreak a pro bezplatný tarif OpenAI neoznámila nic.

Volba kategorie, září 2026

Nejlepší AI na obrázky

1
ChatGPT Images 2.5
Text v obrázcích
2
MAI-Image-2.6
#1 úpravy obrázků AA
3
Muse Image
Ekosystém Meta AI

Nejlepší AI na generování obrázků je ChatGPT Images 2.5, kterou OpenAI 8. září nastavila jako výchozí ve všech tarifech ChatGPT a která do jednoho dne obsadila oba obrázkové žebříčky Areny. Její dva modely skončily na každém z nich první a druhý: GPT-Image-2.5 Sunburst, stavěný na přesnost, vede generování obrázků z textu se skóre 1420,7 Elo a úpravy obrázků se skóre 1520,4, rychlejší GPT-Image-2.5 Flare je druhý se skóre 1399,0 a 1490,6 a GPT Image 2 z minulého měsíce je na obou odsunutý na třetí místo. Tato umístění stojí na několika tisících hlasů proti 79 000 a 236 000 u GPT Image 2 a v generování obrázků z textu ta dvojice sdílí stejné pásmo pořadí, takže rozestup mezi Sunburstem a Flare berte jako předběžný. Artificial Analysis nehodnotila ani jeden z těch modelů a její dva žebříčky se s Arenou už neshodují: GPT Image 2 tam stále vede generování obrázků z textu se skóre 1178,1, ale úpravy obrázků převzal MAI-Image-2.6 od Microsoftu se skóre 1122,5. Tím se MAI-Image-2.6 stává druhým celkově, je nejvýše postaveným modelem mimo OpenAI na žebříčku generování obrázků z textu Areny a je první nebo druhý na obou žebříčcích Artificial Analysis, a třetí je Muse Image od Mety. Reve 2.1 opouští stupně vítězů: na žebříčku generování obrázků z textu Artificial Analysis je stále třetí, ale na tom od Areny spadl na šesté místo a na dvou žebříčcích úprav obrázků na dvanácté a čtrnácté. Náš úplný rozbor toho, co přibylo, najdete v článku ChatGPT Images 2.5.

ModelNejlepší proSilná stránkaSlabinaCena
ChatGPT Images 2.5Obrázky s čitelným textem#1 a #2 v Arena generování obrázků z textu (1420,7 / 1399,0) a úpravách obrázků (1520,4 / 1490,6)Zatím nehodnoceno Artificial AnalysisVýchozí ve všech tarifech ChatGPT
MAI-Image-2.6Úprava obrázku, který již máte#1 v úpravách obrázků Artificial Analysis (1122,5) a #2 na jejím žebříčku generování obrázků z textu (1149,4)Veřejná preview, zatím ne v Copilotu ani v BinguMAI Playground / Microsoft Foundry
Muse ImageÚpravy obrázků, ekosystém Meta#3 v úpravách obrázků Artificial Analysis (1105,1), #5 na jejím žebříčku generování obrázků z textuNové, tenké nástroje kolemAplikace Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Fotorealistické portréty a produkty#4 v generování obrázků z textu Artificial Analysis, před Nano Banana Pro na žebříčku ArenyV úpravách obrázků Areny je Nano Banana Pro výšeAplikace Gemini / AI Studio
Seedream 5.0 ProVícejazyčný text + úpravy oblastí10+ jazyků včetně arabštiny RTL, laso a vrstvové úpravyKolem desátého místa na nezávislých žebříčcích; nejistota kolem autorských právBytePlus / Magnific
Midjourney v8Stylizované umění, ilustraceEstetický základ, který většina umělců preferujeSlabší v textu v obrázku$10-$120/měs.
Grok ImagineNSFW / Spicy ModeNejvolnější mantinely; Arena řadí jeho model Image 2.0 na #5 v generování obrázků z textu a #4 v úpravách obrázkůImage 2.0 na žebříčcích Artificial Analysis chybí$30/měs. SuperGrok
Druhé místo a alternativy: MAI-Image-2.6 je druhý celkově a volba pro úpravu obrázku, který již máte, Muse Image je třetí a volba uvnitř aplikací Mety a Nano Banana 2 je stále fotorealistická volba. Reve 2.1 zůstává volbou pro rozvržení, typografii a nativní 4K, i když opustil stupně vítězů. Grok Imagine je stále jediný frontier model, který umožňuje obsah pro dospělé v režimu Spicy Mode, a Arena nyní řadí jeho model Image 2.0 na páté místo v generování obrázků z textu a na čtvrté v úpravách obrázků.
Co se tento měsíc změnilo

Obrázková koruna se změnila. OpenAI 8. září vydala ChatGPT Images 2.5 a její dva API modely na obou žebříčcích Areny rovnou předběhly GPT Image 2: Sunburst je první v generování obrázků z textu se skóre 1420,7 a v úpravách obrázků se skóre 1520,4, Flare je druhý se skóre 1399,0 a 1490,6 a GPT Image 2 je na obou třetí. Tři žebříčky, které sledujeme, se už neshodují. Artificial Analysis modely 2.5 vůbec nehodnotila, stále má GPT Image 2 první v generování obrázků z textu se skóre 1178,1 a na jejím žebříčku úprav obrázků převzal první místo MAI-Image-2.6 od Microsoftu se skóre 1122,5. MAI-Image-2.6 nahrazuje Reve 2.1 na druhém místě a Reve 2.1 po pádu na šesté místo v generování obrázků z textu Areny opouští stupně vítězů úplně.

Volba kategorie, září 2026

Nejlepší AI na video

1
Gemini Omni 1.1 Flash
#1 Arena text-to-video
2
MiniMax H3
2K + nativní zvuk
3
Dreamina Seedance 2.0
Nejbližší vyzyvatel

Nejlepší AI na generování videa je Gemini Omni 1.1 Flash, který Google vydal 27. srpna a který nyní vede žebříček text-to-video Areny se skóre 1515, těsně před vlastním předchůdcem Gemini Omni Flash s 1511. Je to i schopnější model podle specifikace: prodlužování scény po desetisekundových krocích až na souhrnných 40 sekund, řízení prvního a posledního snímku, videoreference, náhledy v 360p a výstup v 1080p nebo 4K, s cenou zhruba $0.03 za sekundu v 360p, $0.10 v 720p, $0.15 v 1080p a $0.30 ve 4K. Gemini Omni Flash zůstává levnější volbou kolem $0.10 za sekundu a na Areně je statisticky nerozhodně, ale končí u desetisekundových klipů. Žebříčku videa od Artificial Analysis už nevede ani jeden: Wan 3.0 od Alibaby, model dostupný jen přes API vydaný 24. srpna, který staví video z dokumentů, tabulek a prezentací, mu vévodí se skóre 1239, Omni Flash má 1238 a MiniMax H3 Max 1235. Pokud potřebujete delší záběry v nástrojích Googlu, Veo 3.1 stále běží v aplikaci Gemini, AI Studiu a Vertex AI s nativním zvukem a výstupem v 1080p. MiniMax H3 (31. července) zůstává vyzyvatelem podle specifikace, s 2K klipy o délce 4 až 15 sekund a nativním stereo zvukem od $0.13 za sekundu.

ModelNejlepší proSilná stránkaSlabinaCena
Gemini Omni 1.1 FlashNejlepší AI video celkově#1 Arena text-to-video (1515); prodloužení scény na 40 s, výstup ve 4KNa žebříčku Artificial Analysis druhý za Wan 3.0$0.03-$0.30/s; Gemini API / AI Studio / Flow
Gemini Omni FlashLevnější desetisekundové klipy#2 Arena text-to-video (1511), #2 AA video (1238); konverzační úpravyKončí u desetisekundových generací~$0.10/s; aplikace Gemini / AI Studio
Wan 3.0Video z dokumentů a prezentací#1 na žebříčku videa od Artificial Analysis (1239); 2-30 s, až 1080p, vstup Omni-ReferenceJen přes API, bez zveřejněných vah; #3 na Areně$0.05-$0.20/s
MiniMax H32K klipy s nativním zvukem4-15 s ve 2K, nativní stereo zvuk; #8 Arena text-to-video (1462)#4 na AA videu (1227); otevřené váhy neobsahují 2K upscaler a vyžadují žádost v USA, EU, Británii a Jižní Koreji$0.13/s ve 2K
Dreamina Seedance 2.5Vyzyvatel od ByteDance#6 Arena text-to-video (1482); vede image-to-video se zvukemEkosystém ByteDance, omezený přístup na ZápaděDreamina / BytePlus
Muse VideoVideo v ekosystému Meta#3 generování videa z textu se skóre 1459Nejnovější ze skupiny, tenké nástrojeAplikace Meta AI
Veo 3.1Delší produkční klipyNativní zvuk, 1080p, silná fyzikální konzistence#6 na Arena video, ne lídr kvalityGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboRychlá iterace za nižší cenuNativní 4K, 60fps, 15sekundové klipy; Turbo vyšel 17. červnaMimo top 16 na Arena generování videa z textuOd $10/měs.
Luma Ray 3Fotorealistické scénySilný realismus pro krajinyMenší komunitaZdarma / od $9.99/měs.
Druhé místo a alternativy: Dreamina Seedance 2.0 je druhá celkově a Omni Flash poráží v generování videa z obrázku se zvukem, kde vede 1198 proti 1191, ačkoli Omni Flash stále vede variantu bez zvuku. Muse Video je třetí a Veo 3.1 je volba, když 10 sekund nestačí. OpenAI 26. dubna 2026 zrušil spotřebitelskou aplikaci Sora 2 a zůstává jen vývojářské API, do 24. září 2026. Termíny ukončení starších modelů u všech poskytovatelů sledujeme v samostatném průběžném seznamu.
Co se tento měsíc změnilo

Koruna za video přešla na Gemini Omni 1.1 Flash, který Google vydal 27. srpna a který nyní vede žebříček text-to-video Areny se skóre 1515 proti 1511 u Gemini Omni Flash. Oba jsou uvnitř intervalů spolehlivosti toho druhého, berte to tedy jako remízu rozhodnutou schopnostmi, nikoli jako jasné vítězství: 1.1 Flash prodlužuje scény na souhrnných 40 sekund a dává výstup ve 4K, zatímco Omni Flash končí na deseti sekundách. Větší změnou je, že žebříčku videa od Artificial Analysis už nevede ani jeden. Wan 3.0 od Alibaby jej převzal 24. srpna se skóre 1239 před 1238 u Omni Flash a 1235 u MiniMax H3 Max a přijímá na vstupu dokumenty, tabulky i prezentace. Wan 3.0 je dostupný jen přes API a bez zveřejněných vah, takže naše open-weight volby nemění. MiniMax H3 letos v měsíci také získal hlasy na Areně a na žebříčku text-to-video vstoupil na #8 se skóre 1462.

Volba kategorie, září 2026

Nejlepší AI na programování

1
GPT-6 Astra
Vede všechny programátorské žebříčky
2
Claude Fable 5.1
Nejvyšší skóre v benchmarcích
3
Claude Opus 5
Nejlepší poměr, $5 / $25

Nejlepší AI na programování je GPT-6 Astra, která vede vlastní Terminal-Bench 4.0 od Artificial Analysis s 60 % proti 55 % u Claude Fable 5.1 a je první na obou programátorských žebříčcích Areny, ve WebDev s 1800 a v image-to-WebDev s 1733. Claude Fable 5.1 je druhý a drží si souhrnná měřítka: vede Intelligence Index se skóre 53,4 na v4.3 a AA-Briefcase s 1646 proti 1562 u Astry, tedy agentický žebříček, který nahradil zrušený Agentic Index. Claude Opus 5 je volba s nejlepším poměrem, za $5 / $25 za 1M tokenů proti $10 / $50 u obou modelů nad ním, na Terminal-Bench 4.0 má 49 % a na obou programátorských žebříčcích Areny je třetí, a vlastní dokumentace Anthropicu stále doporučuje začínat u Opus 5 pro složitou agentickou práci. Cenový argument čtěte pozorně, protože jde o tokeny, nikoli o úlohy: Opus 5 stojí polovinu ceníkové ceny Astry, ale na jednu úlohu Intelligence Indexu vyjde dráž, $5.86 proti $3.26, protože k výsledku spotřebuje více tokenů. Qwen3.8-Max-0902 od Alibaby držel žebříček WebDev v Areně zhruba tři dny na začátku září a dnes je čtvrtý s 1681. U otevřených vah se důkazy rozcházejí: GLM-5.3 je na testovací sadě nejsilnější s 42 % na Terminal-Bench 4.0, zatímco Kimi K3 je nejvýše postavený otevřený model ve WebDev Areny, pátý s 1674, ale na téže sadě zvládne jen 13 % a hostování vlastními silami znamená 1,56 TB vah. Artificial Analysis zrušila jak Coding Index, tak Coding Agent Index, takže dvě souhrnná programátorská pořadí, která tato stránka dříve uváděla, už neexistují. Nejlevnějším vážným kandidátem je GLM 5.3 Flash za $0.15 / $0.50 pod MIT, který má na Terminal-Bench 4.0 33 % za dva centy na úlohu, a DeepSeek V4.1-Flash je s ním od 10. září na vstupu mimo špičku na stejné úrovni.

ModelNejlepší proSilná stránkaSlabinaCena (za 1M tokenů)
GPT-6 AstraNejlepší na programování celkově60 % Terminal-Bench 4.0 (xhigh), #1 Arena WebDev (1800) a #1 image-to-WebDev (1733)Dvojnásobek ceny Opus 5; za Claude Fable 5.1 na Intelligence Indexu i AA-Briefcase$10 / $50
Claude Fable 5.1Nejvyšší souhrnná skóre#1 Intelligence Index (53,4, v4.3) a #1 AA-Briefcase (1646); 55 % Terminal-Bench 4.0Za Astrou na všech třech programátorských žebříčcích; dvojnásobek ceny Opus 5$10 / $50
Claude Opus 5Nejlepší poměr za poloviční cenu49 % Terminal-Bench 4.0 a třetí na obou programátorských žebříčcích Areny; dokumentace Anthropicu stále doporučuje začít zdeNa jednu úlohu indexu vyjde dráž než Astra, $5.86 proti $3.26$5 / $25
Qwen3.8-Max-0902Krátkodobý držitel žebříčku WebDev#4 Code Arena: WebDev (1681); Intelligence Index 45,4; 2,4 bilionu parametrů, kontext 1MPouze API na QwenCloud bez spotřebitelského rozhraní; vedení ve WebDev ztratil během několika dní$2 / $6
Claude Fable 5Nejtěžší dlouhé agentické úlohyIntelligence Index 49,7; 42 % Terminal-Bench 4.0; kontext 1MNejdražší na úlohu indexu v této tabulce, $8.75; šestý v Areně image-to-WebDev$10 / $50
Kimi K3Nejvýše postavený otevřený model v Areně#5 Arena WebDev (1674), nejlepší umístění otevřeného modelu na tomto žebříčku; 2,8T/104B aktivníchNa Terminal-Bench 4.0 jen 13 %; 1,56 TB pro vlastní hostování$3 / $15
GPT-5.6 SolLevnější vlajková loď OpenAIIntelligence Index 47,1; 40 % Terminal-Bench 4.0Výrazně za Astrou na všech programátorských žebříčcích; METR upozornil na optimalizaci na testy$4 / $20
Muse Spark 1.3Levné agentické programováníIntelligence Index 48,2 za $1.25 / $4.25 a $1.61 na úlohu indexu33 % na Terminal-Bench 4.0; programátorská vítězství pocházejí z vlastního grafu Mety, měřená na variantě max jen pro partnery$1.25 / $4.25
Grok 4.6Levný poměr cena/výkon88,4 % na Terminal-Bench v2.1; Intelligence Index 44,421 % na Terminal-Bench 4.0; prompty od 200K tokenů přeúčtují celý požadavek dvojnásobně$2 / $6
Gemini 3.8 FlashAgentické programování ve velkémIntelligence Index 41,2; 304,6 výstupních tokenů za sekundu20 % na Terminal-Bench 4.0; uváděcí cena se 1. ledna 2027 zdvojnásobí$0.75 / $3.75
GLM 5.3 FlashNejlevnější vážný programátor, kterého si zahostíte33 % Terminal-Bench 4.0 za dva centy na úlohu; MIT, 320B/18B aktivníchGLM-5.3 má na téže sadě 42 %; žádný spotřebitelský produktOtevřené váhy (MIT)
Druhý v pořadí a alternativy: Claude Fable 5.1 je druhý a stále vede Intelligence Index i AA-Briefcase, Claude Opus 5 je volbou s nejlepším poměrem za poloviční ceníkovou cenu obou modelů nad ním, Kimi K3 je nejvýše postavený otevřený model v žebříčku WebDev Areny, zatímco GLM-5.3 je nejsilnější otevřený model na Terminal-Bench 4.0 od Artificial Analysis, a GLM 5.3 Flash je volba pro týmy, které si model hostí samy, za dva centy na úlohu pod čistým MIT. V editorech zůstává nejoblíbenější kombinací Cursor s Claudem a Claude Code je přirozená volba, pokud žijete v terminálu.
Co se tento měsíc změnilo

Programátorská koruna přešla na GPT-6 Astra. Artificial Analysis zrušila Coding Index i Coding Agent Index, tedy právě to, kde mělo Claude Fable 5.1 náskok, a na zbývajících žebříčcích je Astra napřed na všech třech: 60 % proti 55 % na vlastním Terminal-Bench 4.0 od Artificial Analysis, 1800 proti 1758 v žebříčku WebDev Areny a 1733 proti 1710 v image-to-WebDev. Claude Fable 5.1 si drží souhrnná měřítka, Intelligence Index se skóre 53,4 a AA-Briefcase s 1646 proti 1562 u Astry, a stává se druhým v pořadí. Claude Opus 5 zůstává volbou s nejlepším poměrem za $5 / $25, i když ten argument teď stojí na ceně za tokeny, nikoli na ceně za úlohu: jedna úloha Intelligence Indexu u něj stojí $5.86 proti $3.26 u Astry. Qwen3.8-Max-0902 od Alibaby držel WebDev zhruba tři dny a je nyní čtvrtý. U otevřených vah se důkazy rozdělily, Kimi K3 je nejvýš v Areně a GLM-5.3 má výrazný náskok na testovací sadě, 42 % proti 13 %.

Volba kategorie, září 2026

Nejlepší AI na kreativitu

1
Grok 4.6
Nejméně mantinelů
2
Claude Fable 5
Próza nejvyšší kvality
3
Kimi K3
Beletrie a hlas

Nejlepší AI na nefiltrovanou, trendovou tvůrčí práci je Grok 4.6 a chceme být přesní, proč. Tato volba je o produktu, ne o kvalitě prózy. Grok nese nejméně obsahových omezení ze všech frontier modelů a jako jediný nativní integraci X v reálném čase, což z něj dělá jediný model, který se pustí do odvážných, aktuálních nebo záměrně provokativních zadání, jež ostatní odmítají. Je výchozím modelem v aplikaci Grok pro předplatitele SuperGrok a X Premium+ za $30/měsíc. Není to nejlepší pisatel a žebříčky to říkají bez obalu. Grok 4.5 sedí na #33 na EQ-Bench Creative Writing a #41 na žebříčku tvůrčího psaní Areny a prohrává na obou se starším Grok 4.20-beta1. Pokud vybíráte podle samotné kvality výstupu, Claude Fable 5 stále vede Arena tvůrčí psaní, zatímco na EQ-Bench je nyní první GPT-6 Astra se skóre 2163.9, druhý Claude Fable 5.1 a čtvrtý Kimi K3. Grok 4.5 volte pro to, co vám dovolí vytvořit, ne pro to, jak dobře píše.

ModelNejlepší proSilná stránkaSlabinaCena
Grok 4.6Nefiltrovaný, vyhraněný, trendovýNejméně obsahových omezení, nativní ukotvení v X v reálném časeŽebříčky tvůrčího psaní jej zatím nehodnotily; Grok 4.5 byl #33 EQ-Bench, #41 Arena$30/měs. SuperGrok
Claude Fable 5Tvůrčí próza nejvyšší kvality#1 Arena tvůrčí psaní, #1 LiveBench LanguageOpatrné mantinely u odvážných zadání$10 / $50 API
Kimi K3Beletrie a osobitý hlas#4 EQ-Bench Creative Writing se skóre 2070.6Jen #10 na Arena tvůrčí psaní$3 / $15
Claude Opus 5Strukturovaná dlouhá tvůrčí práceDrží dlouhá vlákna a sám se edituje; Intelligence Index 50,7, za Claude Fable 5.1 a GPT-6 AstraNejopatrnější ze skupiny$20/měs. Pro; $5 / $25 API
Gemini 3.1 ProMultimodální tvůrčí práceSilný řetězec textu, obrázku a videaKvóty v aplikaci GeminiZdarma / $2.00-$4.00 API vstup
Grok Imagine (Spicy Mode)NSFW / tvůrčí práce pro dospěléNejvolnější generování obrázkůNika$30/měs. SuperGrok
Druhé místo a alternativy: Claude Fable 5 je druhý a správná volba, pokud kvalita znamená víc než volnost, Kimi K3 je volba pro beletrii a Claude Opus 5 je volba pro tvůrčí projekty, které se táhnou přes mnoho kol. Pro tvůrčí práci pro dospělé je Grok Imagine Spicy Mode stále jedinou možností na úrovni frontier.
Co se tento měsíc změnilo

Grok si drží tuto volbu, nyní s Grok 4.6, který 12. srpna nahradil Grok 4.5 jako vlajkový model SpaceXAI. Na volnosti ani na živém přístupu k X, na čemž tato volba stojí, se nic nezměnilo. Model pod tím je citelně silnější, o pět bodů výš na Intelligence Indexu, 44,4 proti 39,1 u Grok 4.5 na v4.3, jenže tento zisk přistál v programování a agentické práci, ne v próze, a žádný žebříček tvůrčího psaní zatím Grok 4.6 nehodnotil. Claude Fable 5 zůstává modelem, který použít, když chcete lepší psaní.

Volba kategorie, září 2026

Nejlepší AI na přesnost & výzkum

1
Claude Fable 5.1
Nejvyšší faktická přesnost
2
Gemini 3.1 Pro
Nejlepší poměr, $0,52/úloha
3
GPT-5.6 Sol
Nové uvažování

Nejlepší AI na přesnost a výzkum je Claude Fable 5.1, který drží nejvyšší faktickou přesnost, jakou kdy Artificial Analysis změřila, 67 % na AA-Omniscience, a vede Humanity's Last Exam s 59,1 %. Volbou s nejlepším poměrem je Gemini 3.1 Pro a stále je to to, po čem bychom sáhli, když záleží na ceně. Jeho nejsilnější výsledek je na ARC-AGI-1 od ARC Prize, kde dosahuje 98 % a vyrovnává lidský panel, a to za $0.52 na úlohu. Tato kombinace je argument: několik modelů je schopnostmi blízko, žádný jej nedosahuje v ceně za spolehlivou faktografickou práci. Kombinuje to s nativním ukotvením ve vyhledávání Google, což chcete, když odpověď musí být aktuální, ne jen věrohodná. Dosahuje také 94,1 % na GPQA Diamond, kde se s ním GPT-5.6 Sol nyní vyrovnává, místo aby zaostával, a 44,4 % na Humanity's Last Exam a dosahuje 46,44 na žebříčku HLE od Scale SEAL, kterému nyní vévodí Claude Fable 5 se skóre 55,5 %. Zrušili jsme předchozí rámování přes ARC-AGI-2: jeho 77,1 % je stále správných, ale žebříček se pohnul a toto skóre jej nyní řadí kolem 14. místa. Dvě upřímné výhrady. Konkrétně u ukotveného vyhledávání vede žebříček vyhledávání Areny OpenAI, nikoli Google či Anthropic: GPT-5.6 Sol je první se skóre 1257, Claude Fable 5 pátý a Gemini 3.1 Pro s ukotvením devátý. A v novém uvažování vede GPT-5.6 Sol ARC-AGI-2 a Claude Opus 5 vede ARC-AGI-3 se skóre 30 %, zhruba 3,75násobek dalšího nejlepšího modelu. Korunu jsme na Opus 5 nepřesunuli, protože Artificial Analysis měří jeho míru halucinací na 50 % a řadí jej pod Fable 5 na AA-Omniscience, na jehož vrcholu nyní Claude Fable 5.1 stojí spolu s ním.

ModelNejlepší proKlíčový benchmarkSlabinaCena
Claude Fable 5.1Nejvyšší naměřená faktická přesnost67 % faktické přesnosti na AA-Omniscience, nejvíc, co kdy Artificial Analysis změřila; #1 Humanity's Last Exam (59,1 %)Žádná levná úroveň a bez hodnocení na vyhledávacím žebříčku Areny$10 / $50
Gemini 3.1 ProNejlepší poměr, levná faktická práce98 % ARC-AGI-1 (vyrovnává lidský panel) za $0.52/úlohu, 94,1 % GPQA (vyrovnáno Sol)ARC-AGI-2 77,1 % nyní ~14.; #7 na Arena vyhledávání$2.00-$4.00 / $12.00-$18.00 (odstupňováno)
Claude Fable 5Ukotvené vyhledávání#5 na žebříčku vyhledávání Areny, za GPT-5.6 SolŽádná jediná levná úroveň$10 / $50 (Fable 5)
GPT-5.6 SolNové uvažování#1 ARC-AGI-2 se skóre 92,5 %, proti 100% lidskému paneluScheming označen METR$4 / $20
Claude Opus 5Nejtěžší neviděné problémy#1 ARC-AGI-3 se skóre 30 %, ~3,75násobek dalšího modelu (ARC Prize)Artificial Analysis měří míru halucinací 50 %$5 / $25
Qwen 3.7 MaxFrontier přesnost za výhodnou cenu92,4 GPQA Diamond, 200 dotazů zdarma/denJen API, žádné chatovací rozhraní$1.25 / $3.75 promo; $2.50 / $7.50 ceníková
Claude Opus 4.6Poctivost pod tlakem#1 na žebříčku MASK od Scale SEAL se skóre 96,28; Anthropic drží top 5Nahrazen jako vlajkový modelStarší model Anthropicu
Druhé místo a alternativy: Gemini 3.1 Pro je druhý a volbou s nejlepším poměrem za $0,52 na úlohu s ukotvením ve Vyhledávání Google, GPT-5.6 Sol je druhý pro nové uvažování, Claude Opus 4.6 vede žebříček poctivosti pod tlakem a Qwen 3.7 Max je hodnotnou volbou na špici.
Co se tento měsíc změnilo

Koruna za přesnost přešla na Claude Fable 5.1, který drží nejvyšší faktickou přesnost, jakou kdy Artificial Analysis změřila, 67 % na AA-Omniscience proti 65 % u Claude Fable 5, a vede Humanity's Last Exam s 59,1 % proti 55,5 %. Samotný index AA-Omniscience ukazuje 43 pro oba modely, oproti 40, které jsme uváděli minulý měsíc, protože 5.1 si svou přesnost navíc kupuje vyšší mírou pokusů u otázek, které neumí zodpovědět. Gemini 3.1 Pro se stává volbou s nejlepším poměrem a je stále tím, po čem bychom sáhli kvůli ceně: 98 % na ARC-AGI-1 za $0,52 na úlohu, což vyrovnává lidský panel, plus nativní ukotvení ve Vyhledávání Google, ačkoli jeho GPQA Diamond bylo přepočteno na 94,1 % a GPT-5.6 Sol jej nyní přesně vyrovnává. GPT-6 Astra (3. září) je zde spíše vydáním, které sledovat, než novou korunou: Artificial Analysis měří pokles jeho míry halucinací z 92 % u Sol na 51 % při maximálním úsilí, zatímco přesnost roste o čtyři body, což je největší zlepšení poctivosti, jaké letos kdo zveřejnil, ale ztrácí zhruba 80 Elo na GDPval-AA v2 a není v bezplatném tarifu ChatGPT.

Volba kategorie, září 2026

Nejlepší AI na řešení problémů

1
GPT-6 Astra
Lídr v uvažování
2
Claude Opus 5
Agentické řetězce
3
GPT-5.6 Sol
Cenově výhodný STEM model

Nejlepší AI na těžké řešení problémů je GPT-6 Astra, která sebrala žebříčky uvažování GPT-5.6 Sol během několika dní od startu. Vede LiveBench Reasoning se skóre 92,65 a ARC-AGI-2 s 95 %, nejvíc, co kdo proti stoprocentnímu lidskému panelu tohoto žebříčku zvládl, a na LiveBench Mathematics je druhá se skóre 96,81 za 97,01 u Claude Fable 5.1. Uvádí také 97,6 % na FrontierMath Tier 4 v2, číslo, které je třeba brát spolu s informací Epoch AI, že OpenAI benchmark financovala a k části z něj má výhradní přístup. Háček je v ceně a dosahu: $10 / $50 za 1M tokenů proti $4 / $20 u Sol a vyžaduje placený tarif ChatGPT. GPT-5.6 Sol je cenově výhodnou alternativou, na obou žebříčcích LiveBench třetí se skóre 96,20 a 91,65 a druhý na ARC-AGI-2. Qwen 3.7 Max je rozpočtovou volbou pro soutěžní úlohy se skóre 97,1 na únorovém indexu HMMT 2026 a 44,5 na Apexu, s 200 bezplatnými dotazy denně. Claude Opus 5 zůstává alternativou pro dlouhé agentické řetězce uvažování, i když mu Astra sebrala i ARC-AGI-3.

ModelNejlepší proKlíčový benchmarkSlabinaCena
GPT-6 AstraNejtěžší matematika, věda a uvažování#1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3Vyžaduje placený tarif ChatGPT; 2,5x cena Sol$10 / $50
Claude Opus 5Dlouhé agentické řetězce uvažování#2 AA-Briefcase (1645) a #2 GDPval-AA v2 (1737); 30,2 % ARC-AGI-3ARC-AGI-3 nyní vede Astra; 50% míra halucinací$5 / $25
GPT-5.6 SolCenově výhodný STEM model#2 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) a Reasoning (91,65)FrontierMath stále nezveřejněn; METR označil manipulaci$100/měs. ChatGPT Pro; API $4 / $20
Qwen 3.7 MaxSoutěžní matematika na rozpočet97,1 HMMT 2026 únor, 44,5 Apex, 200 dotazů zdarma/denJen API$1.25 / $3.75 promo; $2.50 / $7.50 ceníková
Claude Fable 5Matematika uvnitř programátorského workflow#1 na matematické podkategorii Areny (1543), 96,0 LiveBench MathematicsNejdražší volba zde$10 / $50
GLM 5.3 FlashOpen-weight řešení problémůIntelligence Index 41,9 pod MIT, o téměř osm bodů více než GLM-5.2 při méně než poloviční velikosti; 320B/18B aktivních, 1M kontextPotřebuje multi-GPU server, ne pracovní stanici; GLM 5.3 skóruje výš podle vlastních čísel Z.ai a od 28. srpna jej lze stáhnout, ale ve více než dvojnásobné velikosti a pod vlastní licencíOpen weights (MIT)
Druhé místo a alternativy: GPT-5.6 Sol je druhý a cenově výhodná volba za $4 / $20, Claude Opus 5 je přirozená volba pro dlouhé řetězce agentického uvažování, Qwen 3.7 Max je rozpočtová volba a GLM 5.3 Flash je open-weight volba. Náš samostatný průvodce nejlepší AI na matematiku rozebírá rozdělení podle úloh i bezplatné možnosti.
Co se tento měsíc změnilo

Koruna za řešení problémů přešla na GPT-6 Astra, která během několika dní od startu 3. září sebrala žebříčky, podle nichž se tato kategorie rozhoduje. Vede LiveBench Reasoning se skóre 92,65 proti 91,65 u GPT-5.6 Sol, bere ARC-AGI-2 s 95 % proti 92,5 % u Sol a vytlačila Claude Opus 5 z ARC-AGI-3, kde jejích 62,7 % na standardním harnessu překonává 30,2 % u Opus 5. Čísla z ARC-AGI-3 čtěte pozorně: tento žebříček měří efektivitu akcí na úrovni člověka v neznámých prostředích, nikoli počet vyřešených úloh, a široce citovaných 98,6 % pochází z harnessu s adaptérem poskytovatele, ne ze standardního. Sol klesl na obou žebříčcích LiveBench na třetí místo, ale zůstává cenově výhodnou alternativou za $4 / $20 proti $10 / $50 u Astry, a Claude Fable 5.1 nenápadně převzal LiveBench Mathematics se skóre 97,01.

Volba kategorie, září 2026

Nejlepší AI agent

1
Gemini Spark
Žije v cloudu
2
Claude Cowork
Žije na počítači
3
ChatGPT Codex
Programátorský agent

Nejlepší AI agent je Gemini Spark, pokud chcete agenta v cloudu, a Claude Cowork, pokud ho chcete na svém počítači. Jde o společné volby, nikoli o první a druhé místo: Spark běží ve virtuálním stroji Google Cloud, takže pracuje dál i se zavřeným notebookem, a je propojený s Gmailem, Dokumenty a od začátku září i s Fotkami Google; Cowork běží na vašem Macu nebo Windows a ovládá vaše místní aplikace i obrazovku. Žádný nezávislý žebříček tyto dva produkty proti sobě neměří, takže rozhodující je, kde má práce probíhat, ne kdo má vyšší skóre. Ani cena už jazýčkem na vahách není: Spark je nyní dostupný na tarifu Google AI Pro za $19.99/měsíc v USA a ve více než 160 dalších zemích a Cowork je bez příplatku součástí každého placeného tarifu Claude od $20/měsíc. ChatGPT Codex Mobile (14. května) je alternativou pro práci s programovacím agentem a prohlížečoví agenti třídy OpenAI Operator pro webové úlohy. Přečtěte si celé srovnání Gemini Spark vs Claude Cowork.

AgentNejlepší proKde běžíSilná stránkaCena
Gemini Spark24/7 cloudové úlohy, workflow WorkspaceGoogle Cloud VM (vždy zapnuto)První skutečný agent 24/7, hluboká integrace WorkspaceOd $19.99/měs. Google AI Pro
Claude CoworkDesktop, řízení aplikací, design + kódVáš desktop Mac/WindowsŘídí lokální aplikace, vidí vaši obrazovku$20/měs. Claude Pro
ChatGPT Codex MobileProgramátorský agent v telefonuCloud OpenAI + iOS/AndroidSchvalování diffů a přesměrování práce z telefonuZahrnuto v plánech ChatGPT
Grok Agentic (Grok 4.6)Výzkum v reálném čase, scraping XCloud SpaceXAINativní integrace X; Elo 1663 na GDPval-AA v2$30/měs. SuperGrok
OpenAI třídy OperatorÚlohy v prohlížeči, webové formulářeCloud OpenAI + váš prohlížečWebová automatizaceChatGPT Pro
Druhé místo a alternativy: Gemini Spark a Claude Cowork jsou společné volby rozdělené podle toho, kde agent běží, nikoli první a druhé místo. ChatGPT Codex Mobile je volba pro programovací agenty a Grok Agentic je specializovaná volba pro výzkum v reálném čase. Google AI Ultra za $99.99 nebo $199.99 měsíčně dnes u Sparku kupuje vyšší limity využití, nikoli přístup, ten začíná na tarifu Pro za $19.99.
Co se tento měsíc změnilo

Žádný nový spotřebitelský agentní produkt nevyšel, i když Gemini Spark se rozšířil: dostal se do tarifu Google AI Pro za $19.99 měsíčně a přibyly mu Fotky Google, kde umí vyhledávat, upravovat, kurátorovat a spouštět plánované postupy. Muse Code od Mety (5. srpna) je terminálový nástroj pro vývojáře, nikoli spotřebitelský, takže volbu mezi Sparkem (cloud) a Cowork (desktop) řídí i nadále to, kde má agent běžet. Modelová vrstva pod tím se ale posunula výrazně. Claude Fable 5.1 (1. září) vede Agent Arenu od Areny v dokončování úloh s 19,8 %, GPT-6 Astra je druhá se 17,7 % a Claude Opus 5 čtvrtý, a vede i AA-Briefcase od Artificial Analysis s 1646 proti 1633 u Opus 5. Na GDPval-AA v2 se oba sblížily: Fable 5.1 vede při úsilí xhigh s 1745, ale při úsilí max je 1735 u Opus 5 nyní před 1724 u Fable 5.1 a intervaly spolehlivosti se překrývají, takže to berte jako remízu. Dvě poznámky k údržbě: Artificial Analysis zrušila samostatný Agentic Index spolu s Intelligence Index v4.2 dne 4. září a agentickou práci nyní měří přes AA-Briefcase a GDPval-AA v2, a zároveň znovu ukotvila škálu Elo u GDPval-AA v2, proto tato čísla leží výrazně níž než ta, která jsme uváděli v srpnu. Opus 5 je stále ten, na kterém by většina týmů měla stavět, za $5 / $25, tedy poloviční cenu Fable 5.1. Muse Spark 1.3 od Mety (2. září) si zaslouží spravedlivější posouzení, než mu dává vlastní graf z uvedení: Meta řadí šest benchmarků pod Agent a 1.3 všech šest prohrává, ale na nezávislém žebříčku GDPval-AA v2 od Artificial Analysis je třetí mezi odlišnými modely s 1703, před GLM 5.3, Grok 4.6 a Claude Fable 5, a to za $1.25 / $4.25. Vyhrává také dlouhý kontext, 98,1 na pásmu 512K až 1M v MRCR proti 55,5 u verze 1.2. Scale SEAL zatím ohodnotil jen starší 1.1, která vede jeho žebříček MCP Atlas pro práci s nástroji s 88,1. GLM 5.3 Flash (26. srpna, MIT) je agentní model s otevřenými vahami, který bychom hostovali, s AutomationBench 48,8 na vlastním grafu Z.ai, kde Claude Opus 4.8 má 41,0; v signálu dokončování úloh na Agent Areně je GLM-5.2 nyní sedmnáctý a Kimi K3 pátý, přičemž DeepSeek V4.1-Flash je celkově třetí a nejvýše postavený model s otevřenými vahami v tomto signálu. Grok 4.6 zůstává příběhem o ceně, nikoli novým agentním produktem: Elo 1663 na GDPval-AA v2, páté místo mezi odlišnými modely, přičemž dlouhé úlohy dokončí zhruba na 53 tazích a 0,5 miliardy vstupních tokenů proti přibližně 103 tahům a 2,0 miliardám u Opus 5. GPT-6 Astra (3. září) mluví spíš pro Codex než pro nový agentní produkt: vede Terminal-Bench 4.0 od Artificial Analysis a na Agent Areně je druhá, ale AA-Briefcase si drží Fable 5.1 poměrem 1646 ku 1562.

Fello AI běžící na Macu, iPhonu a iPadu
Všechny špičkové AI modely, jedna aplikace

Přední modely jako ChatGPT, Claude a Gemini pohromadě na Macu, iPhonu a iPadu.

Začněte zdarma, hodnocení 4,7★ napříč 27 000+ recenzemi.

Stáhnout Fello AI

Průvodce použitím, září 2026

Nejlepší AI pro studenty

1
GPT-5.6 Luna
Eseje & výzkum
2
Gemini 3.6 Flash
STEM + PDF
3
Claude Sonnet 5
Psaní & úpravy

Nejlepší AI pro studenty je GPT-5.6 Luna uvnitř ChatGPT pro obecnou práci na kurzech a Gemini 3.6 Flash uvnitř aplikace Gemini pro STEM a multimodální studium, s Qwen 3.7 Max jako API alternativou pro těžší sady úloh (200 dotazů zdarma denně) a Claude Opus 5 jako alternativou pro úpravy esejí. Většina studentů nemusí platit a bezplatný tarif se 6. srpna zlepšil: GPT-5.6 Luna se stal výchozím modelem pro ChatGPT Free a Go, s neomezenými textovými chaty a tlačítkem Think pro těžší otázky, i když nahrávání souborů a obrazové nástroje zůstávají omezené. Gemini 3.6 Flash je stále to, co nabízí bezplatná aplikace Gemini, Claude Sonnet 5 je výchozí bezplatný Claude a DeepSeek V4 je zdarma na chatovacím webu DeepSeeku. Luna je nejlevnější, nikoli nejsilnější člen rodiny GPT-5.6, takže když esej vyžaduje větší péči, sáhněte po tlačítku Think nebo přepněte na GPT-5.5. Pro krok za krokem řešení nejtěžší matematiky je GPT-5.6 Sol placenou vlajkovou lodí OpenAI a GPT-6 Astra nyní uvádí 97,6 % na FrontierMath Tier 4 v2 proti ověřeným 39,6 % u GPT-5.5 Pro, i když Astra zatím není v bezplatném tarifu ChatGPT; Qwen 3.7 Max je hodnotnou alternativou s 97,1 na HMMT únor 2026 a API cenou $1,25 / $3,75 v současné 50% akci ($2,50 / $7,50 ceníkově).

ÚlohaNejlepší modelPročZdarma?Alternativa
Eseje & práce na kurzechGPT-5.6 LunaVýchozí zdarma v ChatGPT od 6. srpna; neomezené textové chatyAnoClaude Sonnet 5 (Claude zdarma)
Řešení STEM úlohGPT-5.6 Sol / Qwen 3.7 MaxPlacená STEM vlajková loď; Astra uvádí 97,6 % FrontierMath Tier 4 v2 / 97,1 HMMT únor 2026Pro placené / Qwen API placenéGemini 3.6 Flash (zdarma)
Výzkum & přesnostGemini 3.1 Pro98 % ARC-AGI-1 za $0.52/úlohu, nativní ukotvení ve vyhledávání GoogleAno (aplikace Gemini)Claude Opus 5
Úpravy textuClaude Sonnet 5Zdarma a výchozí na claude.ai; Claude Fable 5 je lídr kvalityAno (Claude zdarma)Claude Fable 5
Multimodální studium (PDF, snímky, obrázky)Gemini 3.6 Flash1M kontext, zdarma v aplikaci GeminiAnoNotebookLM (Google)
Druhé místo a alternativy: Claude Sonnet 5 (zdarma) je druhý pro psaní a úpravy esejí. Gemini 3.6 Flash (zdarma) je druhý pro multimodální studium a příjem PDF. DeepSeek V4 je druhý pro řešení problémů na přísně nulovém rozpočtu.
Co se tento měsíc změnilo

Bezplatný tarif je to, co se v tomto průvodci posunulo. OpenAI 6. srpna udělalo z GPT-5.6 Luna výchozí model pro ChatGPT Free a Go a oběma dalo neomezené textové chaty plus tlačítko Think pro těžší otázky, takže bezplatnou volbou je nyní Luna místo GPT-5.5, který zůstává volitelný, když esej vyžaduje větší péči. Nahrávání souborů, obrázky a další nástroje jsou stále omezené. Na straně Googlu se nic nezměnilo: Gemini 3.8 Flash vyšel 2. září, ale k bezplatným uživatelům se dostane jen přes AI Studio a API, takže bezplatná aplikace Gemini stále nabízí 3.6 Flash a ten si drží multimodální řádek. GPT-6 Astra (3. září) je ta, kterou u těžkých sad úloh sledovat, s uváděnými 97,6 % na FrontierMath Tier 4 v2 proti ověřeným 39,6 % u GPT-5.5 Pro, ale vyžaduje placený tarif ChatGPT a žádný bezplatný tarif ji nezahrnuje.

Průvodce použitím, září 2026

Nejlepší AI pro práci & profesionály

1
GPT-5.6
Každodenní znalostní práce
2
Claude Opus 5
Programování & psaní
3
Gemini 3.1 Pro
Výzkum & podklady

Nejlepší AI pro profesionální práci je GPT-5.6 (výchozí model ChatGPT od 9. července) pro každodenní znalostní práci, Claude Opus 5 pro programování a psaní s vysokou mírou odpovědnosti a Gemini Spark pro agentické workflow 24/7. Většina profesionálů vytěží nejvíc, když provozuje dvě placená předplatná (ChatGPT Plus za $20/měsíc plus Claude Pro za $20/měsíc, celkem $40/měsíc), nebo konsoliduje s Fello AI za $9.99/měsíc pro všech pět top modelů v jedné aplikaci pro Mac/iOS. Pro agentickou práci, která běží, když spíte, je Gemini Spark jediným skutečným cloudovým agentem 24/7 a od 30. července je dostupný nejen na Google AI Ultra, ale i na tarifu Google AI Pro za $19.99/měsíc.

Případ použitíNejlepší modelKlíčový údajCenaAlternativa
Každodenní znalostní práceGPT-5.6Výchozí model ChatGPT od 9. července; asistent, kterého většina otevře$20/měs. ChatGPT PlusClaude Opus 5
Programování (proprietární)Claude Opus 5#1 na Arena image-to-WebDev (1,668.6) a #2 ve WebDev (1688); doporučený výchozí model Anthropicu$20/měs. Claude ProClaude Fable 5
Programování (cenově výhodné)Qwen3.8-Max-0902#4 Code Arena: WebDev (1681), za GPT-6 Astra, Claude Fable 5.1 a Claude Opus 5; jen API na QwenCloud$2 / $6Qwen 3.7 Max; DeepSeek V4.1-Flash
Výzkum & podkladyGemini 3.1 Pro98 % ARC-AGI-1 za $0.52/úlohu, ukotvení GoogleGoogle AI Pro / UltraClaude Opus 5
Těžká matematika, fyzika, finanční modelováníGPT-6 Astra#1 LiveBench Reasoning a ARC-AGI-2 (95 %); uvádí 97,6 % FrontierMath Tier 4 v2$100/měs ChatGPT ProGPT-5.6 Sol; Qwen 3.7 Max
Nepřetržité agentické workflowGemini SparkPrvní cloudový agent 24/7Od $19.99/měs. Google AI ProClaude Cowork
Živé zprávy, tvůrčí práce s kontextem XGrok 4.6Intelligence Index 44,4 + nativní ukotvení v X$30/měs. SuperGrokGemini 3.1 Pro
Konsolidace vše v jednomFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/měs.Platit každému dodavateli zvlášť
Druhé místo a alternativy: pro většinu profesionálních týmů je Claude Opus 5 druhý za GPT-5.6 pro každodenní práci a nyní programátorský lídr na image-to-WebDev a v ceně za $5 / $25, s Claude Fable 5 druhým pro nejtěžší dlouhodobé úlohy. Gemini 3.1 Pro je druhý pro role náročné na výzkum a Gemini Spark je jedinečná volba, pokud dokážete nasadit cloudového agenta na dlouhé úlohy.
Co se tento měsíc změnilo

V prvních třech zářijových dnech přišla tři vydání a žádné z nich neposouvá volbu pro každodenní práci. Claude Fable 5.1 (1. září) vede Intelligence Index Artificial Analysis s 53,4 na v4.3 a její žebříček AA-Briefcase s 1646, ale Claude Opus 5 tu zůstává doporučením za $5 / $25, poloviční cenu oproti Fable 5.1, a vlastní dokumentace Anthropicu týmům stále říká, ať začnou s Opus 5. Qwen3.8-Max-0902 od Alibaby (2. září) sebral Opus 5 žebříček Arena WebDev o tři body a přebírá řádek cenově výhodného programování za $2 / $6, i když jde jen o API na QwenCloud bez spotřebitelského rozhraní. GPT-6 Astra (3. září) je vydání, které by řádkem každodenní práce pohnout mohlo, a zatím nepohnulo: Astra se na místa Business a Pro dostala 4. září a na Plus o pár hodin později, ale při $10 / $50 proti $4 / $20 u Sol je dražším výchozím modelem, takže si řádek drží GPT-5.6.

Srovnání cen

Ceny AI modelů v září 2026

Od bezplatných tarifů za $0 až po Google AI Ultra za $199.99 měsíčně. Nejdůležitější cenou v této tabulce je Claude Opus 5 za $5 / $25, protože je třetí nejvyšší na Intelligence Index od Artificial Analysis za poloviční ceníkovou cenu obou modelů Fable kolem něj. Claude Fable 5.1, který se 1. září dostal na vrchol tohoto indexu a s 53,4 na v4.3 si jej stále drží, má stejnou ceníkovou cenu $10 / $50 jako Fable 5, ale snižuje čtení z cache o 75 % na $0.25, a právě tam u dlouhých agentických běhů úspora skutečně leží, nikoli na cenovce. Muse Spark 1.3 od Mety má ceník $1.25 / $4.25, nezměněný přes tři skoky ve schopnostech od července, s tarifem Contributor za $0.10 / $0.20 pro každého, kdo nechá Metu trénovat na svých promptech, a Grok 4.6 stojí $2 / $6 s tím, že prompt od 200 000 tokenů přeúčtuje celý požadavek za $4 / $12. Levný konec se pohnul dvakrát. DeepSeek 16. srpna zdražil oba modely V4 zhruba čtyřnásobně, což stálo V4-Flash volbu s nejlepším poměrem cena/výkon, a 10. září většinu toho otočil: V4-Flash ukončil a jeho místo zaujal V4.1-Flash za $0.15 / $0.60 mimo špičku a $0.30 / $1.20 ve špičce. Volba přesto zůstává u GLM 5.3 Flash, nyní za prostý ceník $0.15 / $0.50 poté, co 9. září skončila uváděcí sleva, protože Artificial Analysis mu měří $0.25 na úlohu Intelligence Indexu při skóre 41,9 proti $0.27 a 39,5 u DeepSeeku. Mimo špičku jsou oba na vstupu na stejné úrovni a GLM je levnější na výstupu; ve špičce vyhrává GLM na obou stranách. Na špici je volbou s nejlepším poměrem Muse Spark 1.3 od Mety, za $1.61 na úlohu indexu při skóre 48,2, tedy lépe než Grok 4.6 v obou ohledech s $1.86 a 44,4. Mezi uzavřenými modely je nejlevnější GPT-5.6 Luna za $0.20 / $1.20 po zlevnění OpenAI z 30. července, a s $0.18 je zároveň nejlevnější na úlohu indexu ze všech modelů na této stránce. Podrobnější rozbor najdete v našem průvodci cenami AI. Nová vlajková loď měsíce tento tvar spíš potvrzuje, než mění: GPT-6 Astra dorazila 3. září za $10 / $50, stejnou ceníkovou cenu jako Claude Fable 5.1 a 2,5násobek GPT-5.6 Sol, s cache vstupem za $1 a zápisem do cache za $12.50, a Artificial Analysis ji měří o 64 % dráž na úlohu indexu než Sol, za o 5,7 bodu vyšší skóre.

ModelVstup (za 1M)Výstup (za 1M)KontextPřístup zdarma?
GPT-6 Astra$10.00$50.001 050 000 (max. vstup 922 000)ChatGPT Business/Pro od 4. září, Plus o pár hodin později; bez bezplatného tarifu. API, AWS a Azure teprve přijdou
GPT-5.5$5.00$30.001M (400K v Codex)ChatGPT Free; API placené
GPT-5.5 Pro$30.00$180.001MChatGPT Pro od $100/měs. (úroveň s vyšším použitím $200)
GPT-5.6 Sol$4.00$20.00NezveřejněnoŽivé v ChatGPT, Codex & API (9. července)
GPT-5.6 Terra$2.00$12.00NezveřejněnoŽivé v ChatGPT, Codex & API (9. července)
GPT-5.6 Luna$0.20$1.20NezveřejněnoŽivé v ChatGPT, Codex & API (9. července)
Claude Opus 5$5.00$25.001MVýchozí v Claude Pro/Max; API placené
Claude Opus 4.8$5.00$25.001MStarší model u Anthropicu; Pro/Max/API
Claude Fable 5.1$10.00$50.001MČtení z cache $0.25; v Max/Team Premium (~50 % limitů použití); Pro/Team Standard přes kredity. Mythos 5.1 se účtuje stejně, jen na pozvání
Claude Fable 5$10.00$50.001MTrvale v Max/Team Premium (~50 % limitů použití); Pro/Team Standard přes kredity
Claude Sonnet 5$2.00$10.001MVýchozí v Claude Free & Pro; API placené
Claude Sonnet 4.6$3.00$15.001MAPI placené (nahrazeno Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MOmezená aplikace Gemini; API placené
Gemini 3.8 Flash$0.75 úvodní / $1.50 od 1. 1. 2027$3.75 úvodní / $7.50 od 1. 1. 20271MAI Studio, Antigravity, Gemini Enterprise + placené API; v aplikaci Gemini hlášeno pro AI Pro/Ultra
Gemini 3.7 Flash$0.75 úvodní / $1.50 od 1. 1. 2027$3.75 úvodní / $7.50 od 1. 1. 20271MAI Studio, Android Studio, Antigravity + placené API; v aplikaci Gemini jen přes Spark (AI Pro/Ultra, mimo EHP/UK/CH/Nigérii)
Gemini 3.6 Flash$0.75 úvodní / $1.50 od 1. 1. 2027$3.75 úvodní / $7.50 od 1. 1. 20271MVýchozí model bezplatné aplikace Gemini; AI Studio; bezplatná úroveň API + placené API
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; bezplatná úroveň API + placené API
Qwen3.8-Max-0902$2.00 ($0.17 explicitní cache hit, $0.25 implicitní)$6.001M (výstup 128K)Pouze API na QwenCloud; bez spotřebitelského chatu, bez otevřených vah
Qwen 3.7 Max$1.25 promo / $2.50 ceníková$3.75 promo / $7.50 ceníková1M200 dotazů zdarma/den; API placené nad rámec
MiniMax M3$0.30 (50 % z $0.60)$1.20 (≤512K)1MOpen weights; náklady na hosting
LongCat-2.0Závisí na poskytovateliZávisí na poskytovateli1MOpen weights (MIT); náklady na hosting
NVIDIA Nemotron 3 UltraZávisí na poskytovateliZávisí na poskytovateli1MOpen weights (OpenMDW); náklady na hosting
Qwen 3.5 (open-weight)Self-host / TogetherSelf-host / Together1MOpen weights; náklady na hosting
Nex-N2-ProSelf-host / poskytovateléSelf-host / poskytovatelé1MOpen weights (Apache 2.0); náklady na hosting
Rio 3.5 Open 397BSelf-host / poskytovateléSelf-host / poskytovatelé1MOpen weights (MIT); náklady na hosting
Grok 4.3$1.25$2.501MBezplatný spotřebitelský plán; API placené
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Muse Spark 1.3$1.25 ($0.10 úroveň Contributor)$4.25 ($0.20 úroveň Contributor)1MPlacené API; Muse Code, Meta Model API a OpenRouter; úroveň Contributor mění práva k trénování za ~92% slevu
Kimi K3$3.00 ($0.30 cache-hit)$15.001MBezplatná základní úroveň v aplikaci Kimi; open weights na Hugging Face (Kimi K3 License)
Gemini Omni Flash (video)$1.50$17.50 (video výstup)10sekundové klipyAplikace Gemini / Flow; AI Studio + API
DeepSeek V4-Pro$0.66 mimo špičku / $1.32 ve špičce ($0.022 cache-hit mimo špičku)$1.98 mimo špičku / $3.96 ve špičce1MDeepSeek Chat zdarma; API placené, špičkové a mimošpičkové sazby od 16. srpna
DeepSeek V4.1-Flash$0.15 mimo špičku / $0.30 ve špičce ($0.003 cache hit mimo špičku)$0.60 mimo špičku / $1.20 ve špičce1MDeepSeek Chat zdarma; API placené, tarify mimo špičku a ve špičce; nahradil V4-Flash 10. září
Kimi K2.7 CodeZávisí na poskytovateliZávisí na poskytovateli256KOpen weights; náklady na hosting
GLM-5.2Závisí na poskytovateliZávisí na poskytovateli1MOpen weights; náklady na hosting
GLM 5.3$1.40 ($0.26 cache-hit)$4.401MZ.ai API, GLM Coding Plan a ZCode; váhy na Hugging Face od 28. srpna pod vlastní licencí GLM 5.3 License
GLM 5.3 Flash$0.15 ($0.03 cache-hit); $0.075 v akci$0.50; $0.25 v akci1MZ.ai API, GLM Coding Plan, OpenRouter; váhy pod MIT na Hugging Face; akce končí 9. září
Tencent Hy4 Preview$0.834 ($0.042 cache-hit)$2.5011M+Otevřené váhy (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextPodle poskytovatelePodle poskytovatele262K (do 1M)Otevřené váhy (Qwen Community License 1.0); náklady na hosting se připočítávají
ERNIE 5.1Ceny pro region ČínaCeny pro region Čína256KBezplatná úroveň Baidu
Gemini Spark (agent)Bez ceny APIBez ceny API1M (základ Gemini)Google AI Pro $19.99, AI Ultra $99.99 nebo $199.99/měs.
Fello AI (agregátor)Směrováno přes aplikaciSměrováno přes aplikaciZávisí na modelu$9.99/měs., bezplatná verze dostupná

Výše uvedené sazby pro GPT-5.5 a GPT-5.5 Pro jsou ceny pro krátký kontext; OpenAI již specifické údaje pro dlouhý kontext nezveřejňuje. Úrovně GPT-5.6 se účtují za 2násobek vstupu a 1,5násobek výstupu, jakmile prompt přesáhne 272K vstupních tokenů, což dává long-context Terra na $4 / $18 a Luna na $0.40 / $1.80. Grok 4.6 funguje stejně, ale tvrději: od 200 000 tokenů v promptu výše přeúčtuje SpaceXAI celý požadavek vyšší sazbou, nikoli jen to, co limit přesahuje, takže překročení o tisíc tokenů zdvojnásobí cenu celého volání. Druhým ceníkem, který je třeba číst dvakrát, je DeepSeek: od 16. srpna se oba modely V4 účtují špičkovou sazbou od 01:00 do 04:00 a od 06:00 do 10:00 UTC ve všední dny a přesně poloviční v každou jinou hodinu, takže stejná úloha může stát dvojnásobek podle toho, kdy ji spustíte. Pokud chcete přístup k více AI modelům bez správy samostatných předplatných, Fello AI poskytuje GPT, Claude, Gemini, Grok, Perplexity a další v jediné aplikaci pro Mac, iPhone a iPad od $9.99/měsíc.

Open-weight modely

Nejlepší open-weight modely v září 2026

Nejlepším modelem s otevřenými vahami je v září 2026 Kimi K3, i když argumentů pro něj ubylo. Stále je to nejvýše postavený otevřený model v Areně, pátý ve WebDev s 1674 a pátý v signálu dokončování úloh na Agent Areně, ale už nedrží nejvyšší Intelligence Index mezi otevřenými modely: na indexu v4.3 od Artificial Analysis má GLM-5.3 skóre 44,9 proti 43,8 u Kimi K3, a GLM-5.3 jej vede i na AA-Briefcase, 1504 ku 1488, a na Terminal-Bench 4.0 s velkým odstupem, 42 % proti 13 %. Žádný otevřený model nevyhrává všude, takže Kimi K3 ponecháváme na základě jeho umístění v Areně a otevřeně říkáme, že naměřené žebříčky dnes ukazují na GLM-5.3, jehož licence je vlastní dokument Z.ai, nikoli MIT. O tom, který si vybrat, rozhoduje jeden háček. Stažení K3 je 96 safetensors shardů a zhruba 1,56 TB, což vyžaduje víceuzlový GPU cluster, nikoli pracovní stanici. Praktickým doporučením pro týmy, které si váhy provozují samy, tak zůstává GLM 5.3 Flash (Z.ai, MIT), vydaný 26. srpna se skóre 41,9 na v4.3, o téměř osm bodů výš než GLM-5.2 při méně než poloviční velikosti, 320B celkem a 18B aktivních. Je to první nativně multimodální model v řadě GLM-5, zvládá kontext 1M tokenů a váhy byly na Hugging Face pod MIT v den uvedení. Levný otevřený segment se 10. září změnil znovu: DeepSeek ukončil V4-Flash 0731 a nahradil jej modelem DeepSeek-V4.1-Flash, 552B s 8B aktivními při prefillu a 16B při dekódování, nativně multimodálním, pod MIT hned první den, se skóre 39,5 na v4.3 proti 34,5 u nahrazované verze a s cenou sraženou zpět na $0.15 / $0.60 mimo špičku. Je také třetí v signálu dokončování úloh na Agent Areně, tedy nejvýše postavený otevřený model v tomto signálu. Dvě ze tří vydání, která uzavřela srpen, už mají nezávislé hodnocení: GLM 5.3 zveřejnil váhy 28. srpna pod vlastní licencí s klauzulí, podle níž musí každý provozovatel model-as-a-service s obratem nad 10 miliard dolarů nejprve projít bezpečnostní revizí Z.ai, a Artificial Analysis mu dává 44,9; Qwen3.8-Flash-Next od Alibaby, mixture-of-experts se 125B a jen 6B aktivními, který předznamenává architekturu Qwen4, má 39,9 a je devátý v žebříčku WebDev Areny. Hy4 Preview od Tencentu, 770B celkem a 49B aktivních pod Apache 2.0 a stále největší permisivně licencovaný publikovaný model, nemá hodnocení od Artificial Analysis, ale je nyní jedenáctý ve WebDev Areny s 1624. Pozor také na to, že GLM 5.3 Flash není osekaný GLM 5.3, ale samostatný model na nově natrénovaném základu, a právě proto mohl vyjít pod čistým MIT, zatímco vlajková loď nikoli.

ModelNejlepší proKlíčový benchmarkKontext / LicenceKde spustit
Kimi K3Nejlépe hodnocený open-weight model, agentická a webová práceII 43,8 (v4.3); #5 Arena WebDev, nejlepší umístění otevřeného modelu; #5 Agent Arena; 2.8T/104B aktivních1M / Kimi K3 LicenseHugging Face (96 shardů, 1.56 TB), Moonshot API, poskytovatelé
GLM 5.3 FlashNejlepší otevřený model, který si většina týmů skutečně dokáže provozovatII 41,9 (v4.3), na Paretově hranici poměru inteligence a ceny, zhruba $0.25 za úlohu indexu; 320B/18B aktivních, nativně multimodální1M / MITHugging Face, Z.ai API ($0.15/$0.50), OpenRouter
GLM-5.2Záložní volba s nezávislým záznamemII 34,0 (v4.3); #19 Arena WebDev (1,591.8), #17 Agent Arena; 744B/40B aktivních1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Otevřený od 28. srpna, ale pod vlastní licencíII 44,9 (v4.3), nejvyšší otevřené skóre, které jsme našli; stejný základ 744B jako GLM-5.2, jen dotrénovaný, zveřejněný checkpoint počítán na 753B; CyberGym 84,5 % a Terminal-Bench 3.0 28,3 (údaje dodavatele)1M / GLM 5.3 License (model-as-a-service nad 10 mld. USD tržeb potřebuje bezpečnostní revizi Z.ai)Hugging Face, Z.ai API ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4.1-FlashNejlepší otevřená hodnota, pokud si jej hostíte samiII 39,5 (v4.3) proti 34,5 u nahrazované verze V4-Flash 0731; 552B, 8B aktivních při prefillu a 16B při dekódování1M / MITDeepSeek API ($0.15/$0.60 mimo špičku, $0.30/$1.20 ve špičce od 10. září), lokálně
Tencent Hy4 PreviewZatím největší permisivně licencovaný model770B/49B aktivních; 2,99/4,00 na vlastním panelu Tencentu se 203 úlohami proti 2,94 u Kimi K3 a 2,92 u GLM 5.3 (dodavatel); bez hodnocení Artificial Analysis; #11 Arena WebDev (1624)1M+ / Apache 2.0Hugging Face (BF16 a FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextUkázka architektury Qwen4125B celkem plus N-gramové embedding s 51B, 6B aktivních; 91,7 GPQA Diamond a 62,5 SWE-Bench Pro (dodavatel); II 39,9 (v4.3); #9 Arena WebDev (1635)262K až 1M / Qwen Community License 1.0Hugging Face, poskytovatelé, self-host
LongCat-2.0Frontier otevřený kodér trénovaný na čínských čipechII 33 (v4.1); 59,5 % SWE-Bench Pro (dodavatel), 1.6T/~48B aktivních1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Levný multimodální model třídy frontierII 44 (v4.1), 59 % SWE-Bench Pro, multimodální1M / licence TBDHugging Face, API $0.30/1M (50 % sleva)
Nex-N2-ProNejsilnější otevřené programátorské skóreII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktivníchZaloženo na Qwen / Apache 2.0Hugging Face, poskytovatelé, self-host
Kimi K2.7 CodeNejsilnější komerčně licencovaný otevřený kodér+21,8 % na Kimi Code Bench v2 vs. K2.6 (dodavatel); 1T/32B aktivních256K / Modified MITHugging Face, DeepInfra, poskytovatelé
DeepSeek V4-ProAgentická práce v reálném světěII 44 (v4.1), 1.6T/49B aktivních1M / MITDeepSeek API ($0.66/$1.98 mimo špičku, $1.32/$3.96 ve špičce od 16. srpna), lokálně
Hy3Nejnovější účastník s permisivní licencíII 41 (v4.1); #22 na Arena WebDev (1,516.4)Apache 2.0Hugging Face, poskytovatelé, self-host
InklingPrvní open-weight model Thinking MachinesII 41 (v4.1), agentický 32,3, vydán 15. červenceOpen weightsHugging Face, poskytovatelé, self-host
Inkling SmallStejná rodina při čtvrtině velikostiII 40 (v4.1), agentický 30,8; 276B/12B aktivních, vstup text, obrázek a zvukApache 2.0Hugging Face (BF16 a NVFP4), poskytovatelé, self-host
NVIDIA Nemotron 3 UltraLaděno NVIDIA, plně permisivní licenceII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktivních1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 self-host)
Qwen 3.5 (397B / 17B aktivních)Multimodální, rychlé dekódování88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / otevřenéTogether, OpenRouter, lokálně
Qwen3.6-35B-A3BEfektivní otevřený agentický kodér (3B aktivních)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktivních262K (do 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, lokálně
Qwen3.6-27BHustý kodér spustitelný na laptopu87,8 GPQA Diamond, hustý 27B, multimodální256K / Apache 2.0Lokálně Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune Qwen 3.5, vícejazyčné uvažování70,8 Terminal-Bench 2.1 (first-party), poráží Qwen 3.7 Plus na 4/5397B/17B aktivních / MITHugging Face, poskytovatelé, self-host
Llama 4 MaverickVlajkový model řady Meta17B aktivních / 400B celkových parametrůLlama 4 licenseCloud Meta, Hugging Face, lokálně
NVIDIA Nemotron 3 Nano OmniEdge / nízký výkonMultimodální, velmi malá stopaKompaktní / otevřenéLokálně, nástroj NVIDIA

Licencování zde záleží stejně jako holé skóre a srpen rozdíl mezi oběma skupinami ještě prohloubil. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) a Nemotron 3 Ultra (OpenMDW) všechny jasně umožňují komerční použití bez zkoumání tržeb. Zbytek nese podmínky, které je vhodné si přečíst dřív, než na nich začnete stavět: MiniMax M3 a MiniMax H3 vycházejí pod vlastními komunitními licencemi, přičemž H3 navíc vyžaduje žádost z USA, EU, Spojeného království a Jižní Koreje; Kimi K3 sedí na vlastní licenci s prahem tržeb pro každého, kdo jej přeprodává jako službu; GLM 5.3 vyžaduje bezpečnostní revizi Z.ai u každého provozovatele model-as-a-service s tržbami nad 10 miliard dolarů; a Qwen Community License 1.0 u Qwen3.8-Flash-Next vyžaduje samostatnou licenci od Qwenu pro provozování model-as-a-service nebo produktu typu AI pracovní asistent, byť interní použití je vyňato. Žádný open-weight model už není první na žádném žebříčku Areny, který sledujeme: Claude Opus 5 vzal žebříček Agent v červenci, poslední, který open-weight model vedl.

Jak hodnotíme

Benchmarky, ceny a praktické používání

Každé hodnocení na této stránce kombinuje tři vstupy: veřejné benchmarky od sedmi nezávislých firem (Artificial Analysis, Arena dříve LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize a oficiální žebříček Terminal-Bench 2.1, pokrývající indexy Intelligence a Agentic, GPQA Diamond, ARC-AGI-1 až 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas a Remote Labor Index), zveřejněné ceny API a předplatného z oficiální cenové stránky každého dodavatele a praktické používání redakčním týmem FelloAI, který spouští reálné prompty na téže úloze na každém modelu. Oficiální zdroje cen a benchmarků znovu načítáme před každou měsíční aktualizací.

Benchmarky jsou váženy podle případu použití: SWE-bench a Terminal-Bench pohánějí programování, GPQA Diamond a ARC-AGI-2 pohánějí přesnost, GDPval-AA (benchmark profesionálních výstupů od Artificial Analysis) informuje kvalitu profesionálních úloh, zatímco styl psaní se posuzuje primárně praktickým testováním, FrontierMath a HMMT pohánějí řešení problémů. Zveřejňujeme, když je benchmark hlášen dodavatelem, ale nezávisle neověřen, a vyřazujeme každé tvrzení, které nedokážeme reprodukovat proti živému zdroji. Řadíme podle naměřených skóre: koruna kategorie se posune, jakmile model překoná držitele na žebříčcích, které danou kategorii definují, aniž bychom čekali na žebříčky založené na hlasování, a model, který zatím není široce dostupný, je na kartě označen, nikoli o kartu připraven. Znovu ověřujeme pořadí, nejen čísla, protože skóre může zůstat správné, zatímco se žebříček kolem něj pohne. Když model mezi aktualizacemi projde velkým upgradem, kategorii přehodnotíme a přidáme řádek „Co se tento měsíc změnilo“ na konec podrobné analýzy.

Fello AI běžící na Macu, iPhonu a iPadu
Nevíte, který model zvolit?

Fello AI spojuje špičkové AI modely v jedné odlehčené nativní aplikaci.

Přepínejte mezi nimi kdykoli, žádná samostatná předplatná.

Stáhnout Fello AI
Často kladené dotazy

Časté dotazy

Jaký je nejlepší AI model právě teď v září 2026?
Záleží na úloze. V celkovém skóre benchmarků je Claude Fable 5.1 (1. září) první na Intelligence Index od Artificial Analysis s 53,4 na v4.3 a první na AA-Briefcase s 1646, GPT-6 Astra je na indexu druhá s 52,8 a Claude Opus 5 třetí s 50,7. Arena už Fable 5.1 ohodnotila: je druhý na obou programátorských žebříčcích a pátý v textu. Volbou s nejlepším poměrem na špici je Muse Spark 1.3 od Mety, za $1.61 na úlohu indexu při skóre 48,2, tedy lépe než Grok 4.6 v obou ohledech. Pro každodenní chat je GPT-5.6 výchozím modelem ChatGPT od 9. července a je to asistent, kterého většina lidí skutečně otevře, i když textový žebříček Areny vede Claude Fable 5. Pro programování vede GPT-6 Astra Terminal-Bench 4.0 od Artificial Analysis s 60 % i oba programátorské žebříčky Areny, přičemž Claude Opus 5 je volbou s nejlepším poměrem za poloviční ceníkovou cenu. Pro psaní je Claude Fable 5 první na textovém žebříčku Areny, zatímco Fable 5.1 jej předčí na Humanity's Last Exam (59 %) a v přesnosti AA-Omniscience (67 %). Pro přesnost se Gemini 3.1 Pro vyrovná lidskému panelu na ARC-AGI-1 s 98 % za $0.52 na úlohu. Pro těžkou matematiku a uvažování vede GPT-6 Astra LiveBench Reasoning a ARC-AGI-2, zatímco Claude Fable 5.1 je první na LiveBench Mathematics. U obrázků vede ChatGPT Images 2.5 oba žebříčky Areny a u videa vede Gemini Omni 1.1 Flash text-to-video. U agentů je Gemini Spark nepřetržitý cloudový agent a Claude Cowork ten desktopový.
Je GPT-6 venku a je to teď nejlepší model?
GPT-6 je venku. OpenAI ho 3. září 2026 uvedla jako GPT-6 Astra, čímž se uzavřela celoroční otázka, jestli Astra vyjde jako GPT-6, nebo jako další dílčí vydání GPT-5. Není to nejlepší model na každém nezávislém žebříčku. Artificial Analysis mu dává 52,8 na Intelligence Index v4.3, o 5,7 bodu před GPT-5.6 Sol, o 0,6 za Claude Fable 5.1 s 53,4 a o 2,1 před Claude Opus 5 s 50,7, a přitom si účtuje $10 / $50 za 1M tokenů proti $4 / $20 u Sol. Silnější je v programování: Artificial Analysis mezitím Coding Agent Index zrušila a ve vlastním běhu Terminal-Bench 4.0 vede Astra jednoznačně, 60 % proti 55 % u Fable 5.1, a to zhruba na třetině výstupních tokenů oproti Sol. Na AA-Omniscience také zhruba půlí halucinace, z 92 % na 51 % při nastavení max. Potřebujete placený tarif: Astra je první model, který OpenAI označila za kritický z hlediska kybernetické bezpečnosti, takže ho nejdřív dostali prověření obránci z programu Daybreak, ChatGPT Business a Pro následovaly 4. září a Plus o pár hodin později. API, AWS a Azure se stále nasazují a pro bezplatný tarif nebylo oznámeno nic. Náš úplný rozbor GPT-6 Astra pokrývá benchmarky i výhrady.
Co je Claude Opus 5?
Claude Opus 5 je vlajkový model Anthropicu z 24. července 2026 a byl #1 modelem na Artificial Analysis, dokud 1. září nedorazil Claude Fable 5.1. Nyní je třetí na Intelligence Index se skóre 50,7 proti 53,4 u Claude Fable 5.1 a 52,8 u GPT-6 Astra, druhý na AA-Briefcase s 1633 proti 1646 a při úsilí max dokonce vede žebříček GDPval-AA v2 pro profesionální výstupy s 1735 proti 1724 u Fable 5.1, s překrývajícími se intervaly spolehlivosti, stále výrazně před 1663 od Grok 4.6 a 1632 od Claude Fable 5. Ceny API jsou $5 / $25 za 1M tokenů, stejné jako Opus 4.8 a poloviční oproti Fable 5, s kontextovým oknem 1M tokenů a znalostním cutoff z května 2026. ARC Prize nezávisle potvrzuje uváděcí tvrzení Anthropicu k ARC-AGI-3, kde Opus 5 dosahuje 30 % proti 8 % u dalšího nejlepšího modelu, zhruba 3,75násobek. Arena jej nyní řadí třetí na obou programátorských žebříčcích, za GPT-6 Astra a Claude Fable 5.1, první v Document, čtvrtý v signálu dokončování úloh na Agent Areně a desátý v textu. Jedna věc, kterou mít na paměti: Artificial Analysis měří jeho míru halucinací na 50 %, což je důvod, proč na této stránce nedrží žádnou korunu za přesnost.
Co je Claude Fable 5.1?
Claude Fable 5.1 je vydání Anthropicu z 1. září 2026 a nejvýše hodnocený model, jaký kdy Artificial Analysis naměřil, se skóre 53,4 na Intelligence Index v4.3 při nastavení max effort a s prvním místem na AA-Briefcase s 1646. Vyšel spolu s Claude Mythos 5.1, což je tentýž model s uvolněnými pojistkami v biologii a kybernetické bezpečnosti, dostupný jen na pozvání a bez zveřejněných kritérií způsobilosti. Ceny jsou $10 / $50 za 1M tokenů, stejné jako u Fable 5, ale čtení z cache klesá o 75 % na $0.25, s kontextovým oknem 1M tokenů a znalostním cutoff z června 2026. Je zahrnutý v Claude Max a Team Premium zhruba na 50 % týdenních limitů a z Pro je dosažitelný přes kredity. Anthropic stále doporučuje začít pro většinu zátěží s Claude Opus 5, protože stojí polovinu a běží rychleji. Náš úplný rozbor Claude Fable 5.1 a Mythos 5.1 pokrývá systémovou kartu i rozdělení pojistek.
Je Claude Fable 5 zpět?
Ano. Anthropic znovu nasadil Claude Fable 5 dne 1. července 2026 poté, co vláda USA zrušila exportní omezení, které uvalila 12. června. Je opět dostupný na Claude API, Claude.ai, Claude Code a Claude Cowork. Anthropic učinil Fable 5 v placených plánech trvalým 20. července 2026. Max a Team Premium jej zahrnují zhruba na 50 % běžných limitů použití; Pro a Team Standard k němu dosáhnou přes kredity použití s jednorázovým startovním kreditem $100. Ceny API jsou $10 / $50 za milion tokenů. Fable 5 je model třídy Mythos postavený pro dlouhodobou agentickou práci s kontextem 1M tokenů a je druhý pro programování za Claude Opus 5, na #2 na žebříčku image-to-WebDev Areny (1,625.7) a #4 ve WebDev.
Co je GPT-5.6 a mohu jej používat?
Ano, od 9. července 2026. GPT-5.6 je rodina modelů OpenAI nové generace a po dvoutýdenním uzavřeném náhledu, který začal 26. června za bezpečnostní prověrkou vlády USA, dosáhla obecné dostupnosti 9. července. Existují tři úrovně, od nejméně po nejschopnější: Luna, rychlá, nejlevnější úroveň ($0.20 / $1.20 za 1M tokenů); Terra, vyvážený každodenní model, o němž OpenAI říká, že se vyrovná GPT-5.5 ($2 / $12); a Sol, vlajkový model laděný pro biologii, chemii a kyberbezpečnost ($4 / $20). OpenAI snížil Lunu o 80 % a Terru o 20 % dne 30. července 2026 a Sol nechal beze změny, poté 21. srpna 2026 snížil Sol o více než 20 % jako propagační sazbu zhruba na tři měsíce. Žádná cena předplatného ChatGPT se nezměnila. Nyní je živý napříč ChatGPT, Codex a API jako výchozí model OpenAI. Jedna výhrada: system card OpenAI a externí hodnotitel METR upozornili na zvýšené chování „scheming“ u Sol, takže s ním u faktografické práce s vysokou odpovědností zacházejte opatrně, dokud se nezávislé výsledky neustálí.
Je už Grok 4.6 venku?
Ano. SpaceXAI vydala Grok 4.6 dne 12. srpna 2026 a nahradila jím Grok 4.5 jako vlajkový model necelý měsíc a půl po jeho uvedení. Nejde o nový základový model: společnost ponechala základ z Grok 4.5 a model zlepšila dalším dotrénováním, včetně posilovaného učení v agentických prostředích, a nezveřejnila žádnou novou architekturu ani počet parametrů. Artificial Analysis jej hodnotí na 44,4 na Intelligence Index v4.3, o pět bodů výš než Grok 4.5 se skóre 39,1, za GPT-5.6 Sol se 47,1, Claude Fable 5.1 s 53,4, GPT-6 Astra s 52,8, Claude Opus 5 s 50,7 a Claude Fable 5 s 49,7. Ceny zůstávají nezměněné na $2 / $6 za 1M tokenů s kontextovým oknem 500K tokenů, i když prompty od 200 000 tokenů výše se přeúčtují celé sazbou $4 / $12. Model je živý v API SpaceXAI, v Cursoru, Grok Build, na OpenRouter, Vercelu a Cloudflare. Grok 4.6 je také naší volbou pro kreativitu, z produktových důvodů, ne kvůli kvalitě prózy; pro nejlépe napsaný výstup vyhrává Claude Fable 5 naprosto. Úplná čísla najdete v našem rozboru Grok 4.6.
Která AI je nejlepší na programování?
Na programování je nejlepší GPT-6 Astra. Vede vlastní Terminal-Bench 4.0 od Artificial Analysis s 60 % proti 55 % u Claude Fable 5.1 a je první na obou programátorských žebříčcích Areny, ve WebDev s 1800 a v image-to-WebDev s 1733. Claude Fable 5.1 je druhý a drží si souhrnná měřítka, Intelligence Index s 53,4 a AA-Briefcase s 1646. Claude Opus 5 je volbou s nejlepším poměrem za $5 / $25 za 1M tokenů, tedy poloviční ceníkovou cenu obou, se 49 % na Terminal-Bench 4.0 a třetím místem na obou programátorských žebříčcích Areny, a vlastní dokumentace Anthropicu stále doporučuje začínat u Opus 5 pro složitou agentickou práci. Pozor, Artificial Analysis zrušila Coding Index i Coding Agent Index, takže souhrnná programátorská pořadí, která tato stránka dříve uváděla, už neexistují. Qwen3.8-Max-0902 od Alibaby držel žebříček WebDev v Areně zhruba tři dny na začátku září a dnes je čtvrtý. GLM 5.3 Flash (MIT, 26. srpna) je volbou s nejlepším poměrem cena/výkon za $0.15 / $0.50 a nejlevnějším vážným programátorem, kterého si zahostíte, s 33 % na Terminal-Bench 4.0 za dva centy na úlohu, i když GLM-5.3 má na téže sadě 42 %.
Která AI je nejlepší na psaní?
Claude Fable 5.1 je nejlepší na psaní, kraluje Humanity's Last Exam se skóre 59,1 % a žebříčku profesionálních výstupů GDPval-AA v2. Claude Fable 5 je volbou, pokud vážíte lidské hlasy: stále vede Arena tvůrčí psaní a LiveBench Language (90.7), na EQ-Bench Creative Writing v3 je ale nyní #8. Stojí $10 / $50 za 1M tokenů. Claude Sonnet 5 je volba s nejlepším poměrem cena/výkon a to, co by většina lidí měla skutečně použít, protože je zdarma a výchozí na claude.ai za $2 / $10, úvodní sazbu, kterou Anthropic v srpnu 2026 učinil trvalou, ačkoli se řadí na #53 na Arena tvůrčí psaní. Kimi K3 je na EQ-Bench čtvrtý se skóre 2070.6, pokud chcete osobitou beletrii, Claude Fable 5.1 kraluje žebříčku GDPval-AA v2 pro profesionální výstupy se skóre 1853 s Claude Opus 5 druhým se skóre 1824, GPT-5.5 je alternativa pro faktograficky ukotvené obchodní psaní a Gemini 3.8 Flash je volba s nejlepším poměrem cena/výkon pro hromadný obsah.
Jaký je nejlepší open-weight AI model v roce 2026?
Kimi K3 zůstává naší volbou mezi modely s otevřenými vahami, ale argumentů ubylo. Je to nejvýše postavený otevřený model v Areně, pátý ve WebDev s 1674 a pátý v signálu dokončování úloh na Agent Areně, jenže už nedrží nejvyšší otevřený Intelligence Index: GLM-5.3 má na indexu v4.3 od Artificial Analysis 44,9 proti 43,8 u Kimi K3 a vede jej i na AA-Briefcase, 1504 ku 1488, a na Terminal-Bench 4.0, 42 % proti 13 %. Žádný otevřený model nevyhrává všechno, takže Kimi K3 ponecháváme na základě jeho umístění v Areně a otevřeně říkáme, že naměřené žebříčky ukazují na GLM-5.3, jehož licence je vlastní dokument Z.ai, nikoli MIT. Praktickým háčkem je velikost: K3 je 96 shardů a zhruba 1,56 TB pod vlastní licencí Kimi K3, takže GLM 5.3 Flash (26. srpna, MIT) je model, který si většina týmů opravdu zahostí, s Intelligence Indexem 41,9 a 320B celkem a 18B aktivními parametry. Levný segment se změnil 10. září, kdy DeepSeek ukončil V4-Flash 0731 a nahradil jej modelem DeepSeek-V4.1-Flash: 552B s 8B aktivními při prefillu a 16B při dekódování, pod MIT, nativně multimodální, se skóre 39,5 na v4.3 proti 34,5 u nahrazované verze a s cenou zpět na $0.15 / $0.60 mimo špičku. Dvě z vydání, která uzavřela srpen, už také mají hodnocení: Qwen3.8-Flash-Next s 39,9 a Hy4 Preview od Tencentu, který Artificial Analysis stále nehodnotila, ale je jedenáctý v žebříčku WebDev Areny. Upřímně řečeno, žádný otevřený model dnes není první na žádném žebříčku Areny, který sledujeme.
Jaký je nejlevnější AI model třídy frontier?
V cenách API za milion tokenů je nejlevnějším uzavřeným modelem špičkové třídy GPT-5.6 Luna za $0.20 / $1.20 poté, co jej OpenAI 30. července 2026 zlevnila o 80 %, a Artificial Analysis mu na indexu v4.3 dává 37,5 proti 34,3 u Gemini 3.6 Flash. Ještě levnější je GLM 5.3 Flash, naše volba s nejlepším poměrem cena/výkon od srpna, nyní za prostý ceník $0.15 / $0.50 poté, co 9. září skončila uváděcí sleva, se skóre 41,9 pod čistou licencí MIT, kterou si můžete hostovat sami. DeepSeek tuto volbu držel, dokud 16. srpna nezdražil zhruba čtyřnásobně, a 10. září ji málem získal zpět, když V4.1-Flash nahradil V4-Flash za $0.15 / $0.60 mimo špičku a $0.30 / $1.20 ve špičce: mimo špičku jsou teď oba na vstupu shodní a GLM je levnější na výstupu. Artificial Analysis je stále rozlišuje v ceně na úlohu indexu, $0.25 u GLM proti $0.27 u DeepSeeku. Levný segment Googlu se znovu zlepšil 2. září, kdy Gemini 3.8 Flash dosáhl 41,2 za tutéž uváděcí cenu $0.75 / $3.75, i když se tato sazba 1. ledna 2027 zdvojnásobí. MiniMax M3 má ceník $0.30 za milion vstupních tokenů na trvalé padesátiprocentní slevě a silnou alternativou pod MIT je LongCat-2.0. Měřeno na úlohu Intelligence Indexu, nikoli na token, je nejlevnějším modelem na této stránce GPT-5.6 Luna s $0.18.
Které AI modely jsou zdarma?
ChatGPT Free nyní ve výchozím nastavení používá GPT-5.6 (s GPT-5.5 stále dostupným) v rámci limitů použití. Gemini Free spouští Gemini 3.6 Flash v aplikaci Gemini a Google AI Studio. Claude Free spouští Claude Sonnet 5 (nový výchozí) s denními limity. DeepSeek Chat spouští DeepSeek V4 zdarma na webu DeepSeeku. Grok má omezený bezplatný spotřebitelský plán (X Premium je placený doplněk). Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash a Hy4 Preview od Tencentu jsou open-weight a zdarma k self-hostingu, licence se však liší a jen část z nich je čistá MIT nebo Apache. Qwen 3.7 Max je jen API bez spotřebitelského chatovacího rozhraní, ale Alibaba nyní zahrnuje 200 dotazů na model zdarma denně. Kimi má bezplatnou základní úroveň ve své aplikaci, s měřeným náročnějším agentickým použitím.
Co je Gemini Spark a jaký tarif potřebujete?
Gemini Spark je první AI agent Googlu běžící v cloudu 24/7, uvedený na Google I/O dne 19. května 2026 a už není exkluzivní pro Ultra: od 30. července 2026 je dostupný i na tarifu Google AI Pro za $19.99/měsíc, v USA a ve více než 160 dalších zemích, zatímco Google AI Ultra za $99.99 nebo $199.99/měsíc nese širší globální nasazení. Google AI Plus, bezplatný tarif ani pracovní či školní účty jej nezahrnují. Spark je postaven na základních modelech Gemini s harnessem Antigravity od Googlu na Google Cloud VM, integruje se s Gmailem, Google Docs a dalšími aplikacemi Google Workspace a na straně zařízení dokáže interagovat s Chromem a systémem Halo pro Android. Za tu výdaji stojí pro uživatele, kteří mají opakovatelné dlouhoběžící workflow (třídění schránky, souhrny výzkumu, plánované úlohy). Pro jednorázové úlohy pokryje Claude Cowork za $20/měsíc většinu potřeb desktopového agenta.
Co je Fello AI?
Fello AI je AI chatbot pro Mac, iPhone a iPad, který vám umožní používat všechny top AI modely jako ChatGPT, Claude, Gemini, Grok a DeepSeek v jedné aplikaci, s modely pravidelně aktualizovanými, takže máte vždy ty nejnovější. Stojí $9.99/měsíc s hodnocením 4,7 hvězdičky napříč 27 000+ recenzemi.
Jak často tuto stránku aktualizujete?
Tuto stránku aktualizujeme minimálně měsíčně a do 24-48 hodin od každého většího uvedení modelu.
Související články
Claude vs. ChatGPT: která AI je v roce 2026 opravdu lepší?

Claude se počátkem roku 2026 dostal na #1 v App Store a poprvé vytlačil ChatGPT ze špičky. Spouštěčem bylo veřejné odmítnutí Anthropicu vyhovět požadavku Pentagonu nasadit jeho modely pro autonomní zbraně.

Číst dál →
Grok vs. ChatGPT: který AI chatbot je v roce 2026 opravdu lepší?

Oba chatboti právě přešli na nové vlajkové modely. ChatGPT nyní běží na GPT-5.6 (úrovně Sol, Terra, Luna) a Grok pohání Grok 4.6, vydání SpaceXAI z 12. srpna, které se na Intelligence Index dělí o skóre se Sol za třetinovou cenu.

Číst dál →
ChatGPT vs. Gemini v roce 2026: kterou AI byste měli opravdu používat?

ChatGPT přešel na GPT-5.6 jako svůj vlajkový model, zatímco Gemini 3.1 Pro zůstává placeným vlajkovým modelem Googlu. Přímé srovnání napříč psaním, programováním, obrázky a cenou.

Číst dál →
Kdy použít kterou AI: vyberte správný model

Žádná jediná AI není nejlepší na všechno. Přiřaďte úkol modelu, který v něm vede, podle tabulky pro kódování, psaní, rešerše i běžný chat.

Číst dál →
Nejlepší AI agenti v roce 2026: 30 nástrojů otestováno

Třicet AI agentů srovnaných podle toho, co s nimi chcete dělat: kódování, rešerše, kancelářská práce a automatizace, včetně cen a bezplatných možností.

Číst dál →
Gemini Nano Banana Pro vs. GPT-Image-1.5: dokonalé srovnání

Naše původní praktické srovnání z prosince 2025 dvou vedoucích modelů pro generování obrázků, se skutečnými ukázkami výstupů vedle sebe.

Číst dál →

Vyzkoušejte každý model.
Jedna krásná aplikace.

Každý model z tohoto průvodce v jedné nativní aplikaci: ChatGPT, Claude, Gemini, Grok a DeepSeek. Začněte zdarma.

Fello AI běžící na Macu, iPadu a iPhonu

Hodnocení 4,7·27 000+ recenzí·Začněte zdarma