Aktualizováno 23. září 2026

Nejlepší AI modely v roce 2026

Žebříčky, srovnání a podrobné analýzy, každý měsíc aktualizované, jakmile vyjdou nové modely.

Anthropic vydal 22. září Claude Opus 5.5 a bere programátorskou korunu. Artificial Analysis ho měří na 57,6 na Intelligence Index v4.3.2, nejvýš, co kdy zveřejnila, a o 4,3 bodu před Claude Fable 5.1, a spolu s tím vede GDPval-AA v2.1, AA-Briefcase v1.1 i Humanity's Last Exam. Dělá to za $4 / $20 za 1M tokenů, tedy pod Claude Opus 5 za $5 / $25, takže nejlepší model je nově i ten levnější.

OpenAI odpověděla zhruba o devadesát minut později modely GPT-6 Sol a GPT-6 Luna a s nimi snížila ceny svého API na polovinu: Sol stojí $2 / $10 za 1M tokenů a Luna $0,10 / $0,50, a ani jeden zatím není v chatovacím okně ChatGPT. GPT-6 Astra si drží oba programátorské žebříčky Areny, protože Opus 5.5 tam zatím nemá hlasy, a Claude Fable 5.1 si drží psaní a přesnost na žebříčcích, podle kterých se tyto kategorie rozhodují. Tato stránka řadí podle naměřených skóre, takže koruna přechází, jakmile model předčí držitele, a nečeká se na žebříčky založené na hlasování. Náš průvodce AI benchmarky vysvětluje, jak se ten index staví a proč na jeho čísle verze záleží.

SpaceXAI vydala 21. září Grok 4.7 na novém a větším základním modelu a stojí nad Astrou na obou agentních žebříčcích, které Artificial Analysis publikuje. Intelligence Index ukazuje 46,3 proti 44,3 u Groku 4.6 a cena za tokeny se nehýbe, $2 / $6, jenže úloha indexu stojí $2,73 proti $1,86, protože 4.7 vypíše zhruba dvojnásobek výstupu. Spustil se v API, v Cursoru a v Grok Buildu; aplikace Grok stále běží na 4.6.

Nového lídra má i otevřené pole: MiMo-V2.6-Pro od Xiaomi, zveřejněný 21. září pod čistou licencí MIT, má skóre 46,3 a úlohu indexu zvládne za $0,13, nejlevněji z otevřených modelů na této stránce. Níže najdete vítěze kategorií pro září 2026. Klepnutím na kartu přejdete rovnou na celý rozbor, nebo použijte lepivou navigaci a přeskakujte mezi kategoriemi. Žebříčky, benchmarky a ceny aktualizujeme do 48 hodin od každého významného uvedení modelu.

Vítězové kategorií za září 2026
Psaní
Claude Fable 5.1
#2 EQ-Bench Creative Writing a #2 LiveBench Language
Jediný model, který je v nejlepší šestce na všech třech žebříčcích psaného textu. Nejlepší poměr: Claude Sonnet 5, zdarma na claude.ai.
Podrobná analýza →
Chat & každodenní asistent
GPT-5.6
Výchozí model ChatGPT od 9. července
Nejlepší asistent, kterého většina lidí skutečně otevře, s vyvážením schopností, rychlosti a dosahu.
Podrobná analýza →
Obrázky
ChatGPT Images 2.5
#1 a #2 na všech čtyřech obrázkových žebříčcích, které sledujeme
Jeho dva modely drží první dvě místa na každém obrázkovém žebříčku, který sledujeme, u Areny i u Artificial Analysis, a je výchozí ve všech tarifech ChatGPT včetně bezplatného. Nejlepší poměr: Flare, rychlejší z dvojice, za stejnou cenu za tokeny jako GPT Image 2.
Podrobná analýza →
Video
Gemini Omni 1.1 Flash
#1 Arena text-to-video (1516), 40sekundové scény
Nejnovější videomodel Googlu: prodloužení scény až na 40 sekund, výstup ve 4K, od $0.03 za sekundu.
Podrobná analýza →
Programování
Claude Opus 5.5
#1 Terminal-Bench 4.0 (59,6 %) a #1 Intelligence Index (57,6)
Vlajkový model Anthropicu z 22. září vede Terminal-Bench 4.0 od Artificial Analysis i oba programátorské žebříčky LiveBench, za $4 / $20 proti $10 / $50 u GPT-6 Astra. Astra si drží oba programátorské žebříčky Areny, kde Opus 5.5 zatím nemá hlasy.
Podrobná analýza →
Kreativita
Grok 4.7
Nejméně obsahových omezení + nativní X v reálném čase
Volba pro odvážnou, trendovou práci: nejméně mantinelů a nativní integrace X. Grok 4.7 je v API, v Cursoru a v Grok Buildu; aplikace Grok za $30 měsíčně stále běží na 4.6.
Podrobná analýza →
Přesnost & výzkum
Claude Fable 5.1
Nejvyšší faktická přesnost, jakou Artificial Analysis změřila (67 %)
Vede žebříčky, které měří, jak často se model prostě mýlí. Nejlepší poměr: Gemini 3.1 Pro za $0,52 na úlohu s ukotvením ve Vyhledávání Google.
Podrobná analýza →
Řešení problémů
GPT-6 Astra
#1 LiveBench Reasoning (92,65) a #1 ARC-AGI-2 (95 %)
Nejtěžší žebříčky uvažování sebral GPT-5.6 Sol pár dní po startu. Nejlepší poměr: GPT-6 Sol za $2 / $10, který na Intelligence Indexu předčí GPT-5.6 Sol za poloviční cenu.
Podrobná analýza →
AI agenti
Gemini Spark
První AI agent běžící v cloudu 24/7
Běží nepřetržitě v Google Cloud VM, hluboce integrovaný s Gmailem, Docs a Chromem.
Podrobná analýza →

Chcete špičkové AI modely bez žonglování se samostatnými předplatnými? Fello AI spojuje přední modely v jedné nativní aplikaci pro Mac, iPhone a iPad.

Stáhnout Fello AI
Co je nového v září 2026
22. zář. OpenAI GPT-6 Sol a GPT-6 Luna půlí ceny API OpenAI a přistávají všude kromě chatu v ChatGPT Nové
OpenAI vydala 22. září 2026 modely GPT-6 Sol a GPT-6 Luna, zhruba devadesát minut po tom, co Anthropic uvedl Claude Opus 5.5, a celé uvedení je argumentem o ceně za úlohu, ne o špičce žebříčku. Sol klesá ze $4 / $20 na $2 / $10 za 1M tokenů a Luna z $0,20 / $1,20 na $0,10 / $0,50, se čtením z cache levnějším o 90 %, tedy na $0,20 a $0,01. OpenAI označuje obě snížení za 50%, jenže výstup Luny klesá o 58,3 % a srovnává se s promo cenami GPT-5.6, ne s ceníkem. Dva mluvčí i Tibo Sottiaux z OpenAI shodně říkají, že nové sazby jsou trvalé. Kde je lze použít, je ta část, kterou každé shrnutí smazalo: modely jsou v ChatGPT Work a v Codexu pro plány Plus, Pro, Business, Enterprise a Edu, uživatelé Free a Go se k Luně dostanou v desktopové aplikaci a OpenAI výslovně píše, že jsou „not yet available in Chat“. Nezávisle na tom měří Artificial Analysis Solu 47,5 na Intelligence Index v4.3.2 při maximálním úsilí proti 47,0 u GPT-5.6 Sol, za $1,06 na úlohu indexu proti $1,99, s 43,9 % na Terminal-Bench 4.0 proti 39,9 % a s mírou halucinací dolů z 92 % na 60 %. Luna je s 37,3 na stejné úrovni jako GPT-5.6 Luna, ale úlohu indexu zvládne za $0,07 proti $0,18, což z ní dělá nejlevnější model na úlohu indexu na této stránce. ARC Prize ohodnotila Lunu, 59,3 % na ARC-AGI-2 proti 59,5 % u verze 5.6, a k Solu nezveřejnila nic. Vlastní evaluace OpenAI jsou samé argumenty o ceně: na AutomationBench 1.0.6 bere Sol při úsilí xhigh 33,2 % za $0,27 na úlohu a nejbližší konkurenční řádek je Claude Fable 5.1 se záložním Opusem 5 na 31,4 %, takže skutečný náskok je 1,8 bodu, ne 6,3, jak napovídá řádek s Claude Opus 5. OpenAI uvádí, že Sol dělá zhruba poloviční počet chyb než GPT-5.6 Sol a „approaching Astra-level reliability at much lower cost“, a opakuje, že nejlepším modelem napříč obory zůstává Astra. Žádná koruna na této stránce se tím nehýbe: Sol a Luna jsou levnější, ne lepší. GPT-6 Terra neexistuje a OpenAI neřekla, zda se s ní počítá. Podrobnosti v našem rozboru GPT-6 Sol a Luna.
22. zář. Anthropic Claude Opus 5.5 bere Intelligence Index s 57,6 a podbízí cenu Opusu 5 Nové
Anthropic vydal Claude Opus 5.5 dne 22. září 2026 jako první model nové rodiny Claude 5.5 a je to největší jednodenní posun, jaký tato stránka zaznamenala. Artificial Analysis ho měří na 57,6 na Intelligence Index v4.3.2, o 4,3 bodu nad Claude Fable 5.1 a nejvýš, co kdy u kteréhokoli modelu zveřejnila, a spolu s tím bere GDPval-AA v2.1 s 1846 proti 1735 u Fable 5.1, AA-Briefcase v1.1 s 1822 proti 1678, Humanity's Last Exam s 61,4 % proti 59,1 % a vlastní běh Terminal-Bench 4.0 od Artificial Analysis s 59,6 % proti 59,1 % u GPT-6 Astra. Cena jde dolů, ne nahoru: $4 / $20 za 1M tokenů proti $5 / $25 u Opusu 5, čtení z cache o 60 % levnější za $0,20 a zápis do cache za $5, přičemž podle vlastního testování Anthropicu je běžná zátěž o 40 % levnější než na Opusu 5 a výstup o více než 30 % rychlejší. Rychlý režim v Claude Code a na platformě Claude zdvojnásobuje cenu za až 2,5násobnou rychlost. Na vlastním harnessu Anthropicu je programátorský odstup ještě větší, 66,4 % na Terminal-Bench 4.0 proti 57,9 %, které pro Astru uvádí OpenAI, plus 54,4 % na FrontierCode v1.1 a 57,8 % na CursorBench 4.0. Dvě věci nevyhrává: AutomationBench od Zapieru, kde má Astra 41,4 % proti jeho 40,0 %, a Terminal-Bench-Science 0.1, kde má Astra 64,6 % proti jeho 58,7 %. Odstupy čtěte s výhradou, kterou Anthropic tiskne sám, tedy že model „performs at the level of Claude Fable 5.1 on most work“ a že „benchmark margins have become a less reliable guide to real-world differences“. Je běžně dostupný na platformě Claude jako claude-opus-5-5 a na AWS, Google Cloudu a Microsoft Azure, pětihodinové limity rostou na tarifech Pro, Max a Team a Claude Sonnet 5.5 a Claude Haiku 5.5 mají následovat v nejbližších týdnech. Protože se v biologii a kybernetické bezpečnosti vyrovná Claude Mythos 5.1, vychází s ochrannými opatřeními Fable 5.1 a s novým programem Life Sciences Verification Program pro prověřené laboratoře. Žádný žebříček Areny ho zatím neohodnotil. Celý rozbor najdete v našem rozboru Claude Opus 5.5.
21. zář. SpaceXAI Grok 4.7 přichází na větším základním modelu za nezměněných $2 / $6 a stojí o 47 % víc na úlohu Nové
SpaceXAI vydala Grok 4.7 dne 21. září 2026 jako svůj nejschopnější model na programování a znalostní práci. Stojí na novém a větším základním modelu než Grok 4.6, s delším během posilovaného učení váženým k úlohám, které trvají mnoho hodin, a byl trénován tak, aby nativně rozuměl harnessu Grok Bot. Počet parametrů firma nezveřejňuje. Podle vlastních čísel má 46,3 % na CursorBench 4.0 proti 40,4 % u Groku 4.6 a 41,7 % u GPT-5.6 Sol, 71,0 % na DeepSWE v1.1 při vysokém úsilí, 64,0 % na EEBench, 38,0 % na Terminal-Bench 4.0, 19,6 % na právním agentním benchmarku Harvey a 56,7 % na HealthBench Professional. Nezávisle ho Artificial Analysis staví na 46,3 na Intelligence Index v4.3.2 při vysokém úsilí proti 44,3 u Groku 4.6 a na 1695 na GDPval-AA v2.1 a 1657 na AA-Briefcase v1.1, v obou nad 1542 a 1569 u GPT-6 Astra. Cena se nehýbe, $2 / $6 za 1M tokenů s přeúčtováním celého požadavku na $4 / $12 nad 200 000 tokenů v promptu, a rychlá varianta běží s dvojnásobnou rychlostí výstupu za dvojnásobnou cenu. Co se hýbe, jsou náklady na úlohu: $2,73 proti $1,86 u Groku 4.6, protože 4.7 k témuž výsledku vypíše zhruba dvojnásobek výstupních tokenů, a úsilí xhigh nepřidá ani jedné generaci žádné body indexu. V bezpečnosti SpaceXAI uvádí nejsilnější odolnost vůči odmítání a jailbreakům, jakou testovala, 62,4 % na biobezpečnostním benchmarku LatchBio a 3,3 % propuštěných rizikových dvojúčelových promptů na vlastním HackerBench v0.3. Dostupnost je na straně vývojářů: Grok API, Cursor, Grok Build, cizí programátorské harnessy a cloudové routery. Oznámení neříká nic o spotřebitelské aplikaci Grok, která stále běží na Groku 4.6. Celý rozbor najdete v našem rozboru Groku 4.7.
21. zář. Xiaomi MiMo-V2.6-Pro od Xiaomi je nejlépe hodnocený otevřený model, jaký byl změřen, za $0,13 na úlohu indexu pod MIT Nové
Xiaomi zveřejnilo MiMo-V2.6-Pro dne 21. září 2026 pod čistou licencí MIT, s vahami na Hugging Face na adrese XiaomiMiMo/MiMo-V2.6-Pro-RL tentýž den. Je to směs expertů s 1,02 bilionu parametrů, 42 miliardami aktivních a kontextem 1M tokenů. Artificial Analysis ho měří, ne odhaduje, na 46,3 na Intelligence Index v4.3.2, což je nejvyšší otevřené skóre, jaké kdy zveřejnila: nad GLM-5.3 se 44,8, nad Kimi K3 se 43,6 a na úrovni zbrusu nového Groku 4.7 od SpaceXAI. Druhou polovinou příběhu je cena. Úlohu Intelligence Indexu zvládne za $0,13 při ceníku $0,435 / $0,87 za 1M tokenů, což je na úlohu levněji než kterýkoli jiný otevřený model na této stránce, zhruba polovina toho co GLM 5.3 Flash, a to o čtyři a půl bodu výš. Bere také 34,8 % na Terminal-Bench 4.0, 1673 na GDPval-AA v2.1, 49,4 % na Humanity's Last Exam a 86,3 % na AA-LCR, čímž je ve třech ze čtyř nad Kimi K3. Dvě omezení stojí za to říct rovnou. Neohodnotil ho žádný žebříček Areny, takže pro něj neexistuje vůbec žádný doklad lidských preferencí, a byl zveřejněn před čtyřmi dny, takže mimo Artificial Analysis nemá nezávislou historii. A 1,02 bilionu parametrů je na cluster, ne na pracovní stanici, a proto zůstává naším doporučením pro týmy, které si opravdu chtějí hostovat vlastní model, GLM 5.3 Flash. Korunu otevřených vah na této stránce přebírá na základě naměřeného skóre a ceny.
15. zář. TypeSafe TypeSafe vychází z utajení s modelem Jev, který místo textu vrací typovaná rozhodnutí, za $0.042 za 1M tokenů Nové
TypeSafe AI vyšla 15. září 2026 po dvou letech v utajení se 40 miliony dolarů v seed kole vedeném DCVC a s modelem, který vůbec negeneruje text. Jev je první z toho, čemu firma říká modely System One: pošlete mu blok stavu a pevně danou sadu typovaných otázek a on na všechny odpoví v jednom paralelním průchodu, přičemž místo věty vrátí volbu, skóre nebo pravděpodobnost ano-ne. Protože je prostor odpovědí definovaný před voláním, nemůže vrátit poškozený výsledek, a odtud pochází věta z oznámení, že Jev nemůže halucinovat. Špatnou možnost vybrat stále může a vlastní dokumentace TypeSafe uvádí, že kalibrace nezaručuje správnost jednotlivé odpovědi. Cena je $42 za miliardu vstupních tokenů, tedy $0.042 za 1M, výstup zdarma, kontext 64k a pouze textový vstup. Výkonnostní tvrzení je potřeba číst opatrně, protože firma jich za tři dny zveřejnila čtyři různá: od méně než 100 milisekund a až 100x rychleji v tiskové zprávě po 193.6x rychleji a 444.6x levněji na hlavní stránce, pokaždé proti jinému soupeři, přičemž vlastní poznámka pod čarou označuje velká čísla za horní hranici reálných zisků. Její vlastní hodnocení pracovních postupů se poměřuje s průměrem GPT-6 Astra a Fable 5.1, nikoli se skutečnou pravdou, a veřejná benchmarková skóre firma záměrně nezveřejňuje. Dva nezávislé testy z 18. září naměřily zhruba 6x nižší cenu a 8x vyšší rychlost proti levnému modelu s vypnutým uvažováním a kalibrace obstála. Nic z toho nemění volbu na této stránce: Jev nemá spotřebitelské rozhraní a je v předběžném přístupu na čekací listině. Podrobnosti v našem vysvětlení modelů System One.
10. zář. DeepSeek DeepSeek ukončuje V4-Flash, nahrazuje jej V4.1-Flash a snižuje sazbu Flash zhruba o třetinu Nové
DeepSeek 10. září 2026 ukončil DeepSeek-V4-Flash a na jeho místo postavil DeepSeek-V4.1-Flash. Název modelu je nyní deepseek-flash; starší názvy deepseek-v4-flash a deepseek-v4-flash-vision-exp stále fungují, ale modely za nimi byly ukončeny a požadavky obsluhuje V4.1-Flash za sazbu Flash. Ta je zhruba o třetinu nižší: $0.15 / $0.60 za 1M tokenů mimo špičku a $0.30 / $1.20 ve špičce proti $0.22 / $0.66 a $0.44 / $1.32 u nahrazované verze, s cache hit za $0.003 mimo špičku. Špičková okna se nemění, 01:00 až 04:00 a 06:00 až 10:00 UTC ve všední dny, každá další hodina je za polovinu. V4-Pro zůstává beze změny na $0.66 / $1.98 mimo špičku a DeepSeek uvedl, že jej bude provozovat i po datu ukončení 14. září. Nový model je mixture-of-experts s 552 miliardami parametrů na architektuře causal encoder-decoder, která aktivuje 8 miliard parametrů při prefillu a 16 miliard při dekódování, zvládá kontext 1M tokenů, nativně čte obrázky a týž den se objevil na Hugging Face pod MIT. Artificial Analysis mu dává 39,5 na Intelligence Index v4.3 proti 34,5 u nahrazované verze V4-Flash 0731, za $0.27 na jednu úlohu indexu. Volbu s nejlepším poměrem cena/výkon zpět nebere: GLM 5.3 Flash má 41,9 za $0.25 na úlohu. Podrobnosti v našem průvodci cenami DeepSeeku.
3. zář. OpenAI GPT-6 Astra vychází za $10 / $50 a během jediného dne je na Plus i Pro a vede programátorské žebříčky Nové
OpenAI spustila GPT-6 Astra 3. září 2026 a uzavřela tím spor, který se táhl celý rok: je to GPT-6, ne další dílčí vydání v řadě GPT-5. Prezident společnosti Greg Brockman na tiskovém brífinku řekl „Vítejte v éře AGI.“ Nezávislá čísla jsou střízlivější než ten rámec. Artificial Analysis dává Astře 61 na Intelligence Index v4.1.1 při nastavení max, přesně na úrovni GPT-5.6 Sol, o pět bodů za Claude Fable 5.1 se 66 a o dva za Claude Opus 5 se 63, a účtuje si $10 / $50 za 1M tokenů proti $4 / $20 u Sol, což vychází o 75 % dráž na jednu úlohu indexu než u modelu, který nahrazuje. Silnější výsledek má na Coding Agent Index, kde Astra v prostředí Codex získává 67, na úrovni Claude Opus 5 a Claude Fable 5 v Claude Code a za 70 u Claude Fable 5.1, a dostane se tam na třetině tokenů oproti Sol a pětině oproti Opus 5, což ji staví na hranici nákladové efektivity. Na AA-Omniscience také snižuje halucinace na polovinu, z 92 % na 51 % při nastavení max, a přitom získává čtyři body přesnosti, přidává zhruba 80 Elo na AA-Briefcase a šest bodů na Humanity's Last Exam. Proti tomu ztrácí asi 80 Elo na GDPval-AA v2 a propadá o dva až tři body v zákaznické podpoře, na SciCode a v uvažování nad dlouhým kontextem. S čísly z uvedení jdou dvě výhrady: 98,6 % na ARC-AGI-3 není podíl vyřešených úloh, ale skóre efektivity akcí proti lidské referenci, měřené na sestavě, u které sama OpenAI ukázala, že dokáže výsledek ztrojnásobit, a Epoch AI přiznává, že OpenAI financovala FrontierMath a má výhradní přístup k jeho části. Skutečným omezením je dostupnost. Astra je první model, který OpenAI ve svém Preparedness Frameworku označila za kritický z hlediska kybernetické bezpečnosti, takže ho nejdřív dostali prověření obránci z programu Daybreak. ChatGPT Business a Pro následovaly 4. září a Plus o pár hodin později, zatímco API, AWS, Azure a bezplatný tarif stále chybí. Artificial Analysis mezitím Coding Agent Index zrušila a ve vlastním běhu Terminal-Bench 4.0 nyní Astra vede jednoznačně, 60 % proti 55 % u Claude Fable 5.1, což je důvod, proč programátorská koruna na této stránce přešla na Astru. Podrobnosti najdete v našem rozboru GPT-6 Astra.
2. zář. Alibaba Qwen3.8-Max-0902 bere žebříček WebDev Areny Claude Opus 5 o tři body, za $2 / $6 Nové
Alibaba 2. září 2026 vydala Qwen3.8-Max-0902 a jako první je potřeba správně pochopit název: jde o post-tréninkové osvěžení modelu Qwen3.8-Max, který vyšel 3. srpna, nikoli o novou verzi, se stejnými 2,4 bilionu parametrů a stejným kontextovým oknem 1M tokenů. Qwen uvádí, že model prošel dalším post-tréninkem na programování a práci typu Cowork. Důležitý je ale žebříček, kterým pohnul. Arena téhož dne oznámila, že Qwen3.8-Max-0902 debutoval celkově na #1 v Code Arena: WebDev se skóre 1691 bodů, tři body před Claude Opus 5 (Max), sedmnáct před Kimi K3 (Max) a dvacet dva před předchozím Qwen3.8-Max, a k tomu bere #1 v kategoriích Data & Analytics a Consumer Product. Je to poprvé letos, kdy byl model od Anthropicu sesazen z vrcholu hlasovacího programátorského žebříčku. Ceny jsou $2 / $6 za 1M tokenů s cache hity za $0.17 explicitní a $0.25 implicitní, což Arena počítá jako smíšených $5 za milion a nejlepší pozici na své Pareto frontě. Čtěte to se třemi výhradami. Tři body jsou na hlasovacím žebříčku v pásmu šumu, Artificial Analysis tehdy pro snímek 0902 nezveřejnila žádný Intelligence Index a od té doby mu dala 45,4 na v4.3 a jde o hostovaný model na QwenCloud bez spotřebitelského chatového rozhraní: otevřené váhy, které Alibaba pro Qwen3.8-Max slíbila v srpnu, stále nedorazily, takže se tím naše volba mezi open-weight modely nemění. Arena uvádí, že skóre z Agent Areny teprve přijdou. Qwen3.8-Max-0902 mezitím na WebDev klesl na čtvrté místo, za GPT-6 Astra, Claude Fable 5.1 a Claude Opus 5, a programátorská kategorie přešla na Astru. Podrobný rozbor najdete v našem rozboru Qwen 3.8.
2. zář. Meta Muse Spark 1.3, Intelligence Index z 57 na 61 při nezměněných $1.25 / $4.25, vítězí v programování a prohrává každý agentický řádek Nové
Meta vydala Muse Spark 1.3 dne 2. září 2026, svůj čtvrtý model Muse Spark za pět měsíců, v Muse Code a Meta Model API. Artificial Analysis jej hodnotí 61 na Intelligence Index v4.1.1, oproti 57 u 1.2 a 53 u 1.1, což je osm bodů za dva měsíce a nejrychlejší vzestup, jaký na této stránce kdokoli předvádí. Ceny se vůbec nepohnuly: $1.25 / $4.25 za 1M tokenů při kontextovém okně 1M tokenů, s úrovní Contributor stále za $0.10 / $0.20 výměnou za to, že Meta smí trénovat na vašich promptech a completions. Dvě věci na tomto uvedení je třeba číst pozorně. Na vlastním hodnocení Mety model vyhrává každý programátorský řádek, DeepSWE v1.1 se skóre 75,4 proti 74,0 u Claude Opus 5 a SWEAtlas CodeBase QnA se skóre 59,4, remizuje s GPT-5.6 Sol na Terminal-Bench 2.1 na 88,8 a s velkým odstupem bere obě dlouhokontextová pásma MRCR, 98,1 v pásmu 512K až 1M proti 55,5 u 1.2. Zároveň prohrává všech šest řádků, které Meta řadí pod Agent, čtyři s Opus 5 a dva s GPT-5.6 Sol, a tato polovina grafu zůstala téměř nezmíněna. Druhý háček je v tom, který model se vlastně měřil: sloupec v benchmarku je Muse Spark 1.3 (max), omezený náhled pro partnery Mety se skóre 62, zatímco verze, kterou dnes může volat kdokoli, je xhigh se skóre 61, a srovnávací sloupec 1.2 Meta spustila na xhigh, nikoli na max. Meta jej nejdřív vydala pro vývojáře, v Muse Code a Meta Model API, a uvedla, že nasazení do Facebooku, Instagramu a aplikace Meta AI bude následovat během několika dní, a slib otevřených vah se opět odsunul: srpnový závazek zveřejnit váhy Muse Spark 1.2 se změnil na nedatovanou zmínku o otevřených vahách, které přijdou brzy. Podrobnosti v našem rozboru Muse Spark 1.3.
2. zář. Google Gemini 3.8 Flash, o tři body výš na Intelligence Index za stejných $0.75 / $3.75 Nové
Google zpřístupnil Gemini 3.8 Flash 2. září 2026, tři týdny po 3.7 Flash a jako své třetí vydání Flash za 43 dní. Všechny specifikace zůstávají beze změny: 1M vstupního kontextu, limit 64K na výstupu, znalostní uzávěrka březen 2026, stejný seznam modalit a stejných úvodních $0.75 / $3.75 za 1M tokenů, které se 1. ledna 2027 zdvojnásobí na $1.50 / $7.50. Pohnula se jen skóre, a to na každém zveřejněném řádku. DeepSWE v1.1 stoupá z 65,3 % na 73,7 %, Terminal-bench 2.1 z 85,8 % na 89,4 %, Terminal-bench 4.0 z 11,2 % na 19,1 % a BioMysteryBench Human Difficult ze 43,5 % na 56,5 %. Artificial Analysis mu dává 59 na Intelligence Index v4.1.1 proti 56 u 3.7 Flash a měří 304,6 výstupních tokenů za sekundu proti 279,4, s pomalou dobou do prvního tokenu 13,39 sekundy, což z něj dělá model pro dávky a agenty spíš než pro interaktivní chat. Výhry čtěte spolu s prohrami: vlastní srovnávací tabulka Googlu dává 3.8 Flash 8 ze 14 řádků a Claude Opus 5 stále bere Terminal-bench 4.0 v poměru 51,8 % ku 19,1 %, OSWorld-2.0 75,4 % ku 59,0 % a GDPVal-AA v2 1824 ku 1545 na Elo. Číslo z DeepSWE, které převzala většina článků o uvedení, 71,0 %, není to, které stojí v PDF od Googlu; tam je 73,7 % proti 74,0 % u Opus 5. Vývojářský přístup byl živý už při oznámení, přes Gemini API, AI Studio, Antigravity a Gemini Enterprise Agent Platform. Spotřebitelský přístup je hlášen pro předplatitele Google AI Pro a Ultra, ale poznámky k vydání aplikací Gemini o něm zatím nemají žádný záznam a bezplatný tarif Gemini stále běží na 3.6 Flash. Podrobnosti v našem rozboru Gemini 3.8 Flash.
1. zář. Anthropic Claude Fable 5.1 a Mythos 5.1, nová #1 na Artificial Analysis se skóre 66 a snížení ceny čtení z cache o 75 % Nové
Anthropic vydal Claude Fable 5.1 a Claude Mythos 5.1 dne 1. září 2026 a jde o jeden model ve dvou konfiguracích bezpečnostních pojistek, nikoli o dva modely. Fable 5.1 je obecně dostupný; Mythos 5.1 uvolňuje omezení v biologii a kybernetické bezpečnosti a rozdává se na pozvání, bez zveřejněných kritérií způsobilosti. Artificial Analysis hodnotí Fable 5.1 na 66 na svém Intelligence Index v4.1.1 při nastavení max effort, což je nejvyšší skóre, jaké kdy naměřil, před Claude Opus 5 se skóre 63, Claude Fable 5 se skóre 62 a GPT-5.6 Sol a Grok 4.6 se skóre 61. Vzal si tehdy také Agentic Index se skóre 61 proti 59 u Opus 5, žebříček GDPval-AA v2 pro profesionální výstupy se skóre 1853 proti 1824 a Humanity's Last Exam se skóre 59,1 % proti 55,5 % u Fable 5. Nastavení effort zde hraje větší roli než obvykle: tentýž model čte 58 při low, 60 při medium, 62 při high a 65 při xhigh a tato nastavení pokrývají jedenáctinásobný rozdíl ve výstupních tokenech, od 13,1 milionu do 143,7 milionu napříč celou sadou. Ceny zůstávají nezměněné na $10 / $50 za 1M tokenů, ale čtení z cache klesá o 75 % na $0.25 z $1.00 u Fable 5, a právě tam u dlouhých agentických běhů leží skutečná úspora. Na vlastních číslech Anthropicu dosahuje 52,6 % na Terminal-Bench-Science 0.1 proti 29,0 % u Opus 5 a 212stránková systémová karta zvýšila vlastní hodnocení rizika sladění společnosti z velmi nízkého na nízké. Dvě věci zvažte, než přejdete: Anthropic stále doporučuje začít s Opus 5 pro většinu zátěží za poloviční cenu a v době uvedení neměl žádný žebříček Areny hlasy ani pro jeden z těchto modelů. Fable 5.1 už hodnocení má: na obou programátorských žebříčcích Areny je druhý a na textovém pátý. Úplné podrobnosti najdete v našem rozboru Claude Fable 5.1 a Mythos 5.1.
28. srp. Z.ai Váhy GLM 5.3 jsou venku po bezpečnostní pauze, ale licence není MIT Nové
Z.ai zveřejnilo váhy GLM 5.3 na Hugging Face 28. srpna 2026, dva týdny po spuštění API a přesně k datu, které neslo zástupné místo, takže slíbené bezpečnostní vyhodnocení skutečně proběhlo a pauza je uzavřená, ne otevřená. Co se změnilo, je licence. GLM 5.3 Flash vyšel o dva dny dříve pod čistou MIT; vlajková loď nese vlastní dokument nazvaný GLM 5.3 License a pole licence v kartě modelu uvádí glm-5.3, nikoli mit. Samotné udělení práv MIT těsně sleduje, s právem model provozovat, nasazovat, dotrénovat, upravovat, šířit i prodávat a s váhami výslovně zahrnutými do definice softwaru, takže komerční užití je otevřené téměř všem. Jedna klauzule je skutečně nová: provozovatel model-as-a-service, jehož tržby přesáhnou 10 miliard dolarů za jakýchkoli dvanáct po sobě jdoucích měsíců, musí před komerčním nasazením projít bezpečnostní revizí Z.ai, přičemž rozsah a metodu té revize si Z.ai vyhrazuje určit samo. Všimněte si také, že Hugging Face počítá zveřejněný checkpoint na 753B parametrů proti základu 744B, který podle Z.ai sdílí s GLM-5.2; to je typ rozdílu, jaký vzniká mechanickým počítáním parametrů, nikoli doklad jiného modelu. Naši open-weight volbu to neposouvá. GLM 5.3 Flash zůstává modelem, který bychom hostovali, protože 320B pod čistou MIT se provozuje i právně ošetřuje výrazně snáz než 753B pod vlastní licencí. Podrobnosti v našem rozboru GLM 5.3.
28. srp. Tencent Tencent Hy4 Preview, 770B otevřených vah pod Apache 2.0 a zatím největší permisivně licencovaný model Nové
Tencent vydal a uvolnil Hy4 preview 28. srpna 2026, novou vlajkovou loď řady Hunyuan a největší model, jaký kdy kdo zveřejnil pod Apache 2.0. Běží na 770 miliardách parametrů celkem se 49 miliardami aktivních na token v architektuře mixture-of-experts, přijímá kontextové okno, které Tencent popisuje jako přesahující 1M tokenů, a vedle plné přesnosti vychází i ve variantě FP8. Ceny API jsou $0.834 za 1M vstupních tokenů, $2.501 za výstupní a $0.042 za kešovaný vstup, což je na tuto velikost levné. Skutečnou zprávou je licence: Apache 2.0 je permisivnější než vlastní dokument u Kimi K3 i než licence, kterou Z.ai téhož dne připojilo ke GLM 5.3. S tvrzením o kvalitě zacházejte opatrně, protože jediným dosavadním důkazem je dodavatelův vlastní. Tencent provedl interní slepé hodnocení 203 inženýrských úloh, které bodovalo 163 expertů, a Hy4 preview v něm získává 2,99 ze 4,00 proti 2,94 u Kimi K3 a 2,92 u GLM 5.3. To je vlastní panel Tencentu, rozdíly se vejdou do jedné desetiny bodu a žádná nezávislá firma pro model tehdy nezveřejnila Intelligence Index ani hodnocení Areny. Arena jej mezitím zařadila na jedenácté místo ve WebDev se skóre 1624, Intelligence Index od Artificial Analysis stále chybí, takže jej uvádíme, nikoli řadíme. Tencent rovněž tvrdí, že model pomohl automatizovat optimalizaci vlastního trénovacího procesu a zvýšil vlastní propustnost inference o naměřených 31,8 %. Je dostupný jako otevřené váhy a přes WorkBuddy, CodeBuddy, Yuanbao a ima, dále přes Tencent Cloud TokenHub a OpenRouter, s bezplatným přístupem na WorkBuddy a CodeBuddy po dobu dvou týdnů od uvedení. Podrobný rozbor najdete v našem rozboru Tencent Hy4 Preview.
26. srp. Z.ai GLM 5.3 Flash, odhalení Ox Alpha a první váhy pod MIT, které Z.ai vydalo od GLM-5.2 Nové
Z.ai vydalo GLM 5.3 Flash 26. srpna 2026 a není to model, na který se čekalo. Váhy zadržené 14. srpna patří GLM 5.3; tohle je samostatný model na nově natrénovaném základu, 320 miliard parametrů s 18 miliardami aktivních, první nativně multimodální model řady GLM-5, a na Hugging Face pod licencí MIT se objevil týž den. Je to zároveň onen utajený model, který obsluhoval provoz na OpenRouteru pod jménem Ox Alpha a během té ukázky běžel výhradně na čínských AI čipech, což popisuje způsob provozu, nikoli způsob trénování. Artificial Analysis mu dává 57 bodů na Intelligence Index v4.1.1, o čtyři body více než GLM-5.2 při méně než poloviční velikosti, a řadí jej na Paretovu hranici poměru inteligence a ceny. Na dnešním indexu v4.3 má 41,9 proti 34,0 u GLM-5.2, za $0.25 na jednu úlohu indexu. Ceníková sazba je $0.15 / $0.50 za 1M tokenů; padesátiprocentní uváděcí sleva běžela do 24:00 dne 9. září a skončila. Náhrada V4.1-Flash od DeepSeeku z 10. září většinu rozdílu smazala: mimo špičku jsou teď oba na vstupu shodně na $0.15, GLM je levnější na výstupu, $0.50 proti $0.60, a ve špičce GLM podbízí na obou stranách. S čísly pro programování a agentní práci zacházejte opatrně: pocházejí z vlastního grafu Z.ai, který si jako srovnání bere Claude Opus 4.8 a GPT-5.6 Terra místo současných lídrů, a stojí v něm Terminal Bench 2.1 84,3, DeepSWE v1.1 63,4 proti 46,2 u GLM-5.2 a AutomationBench 48,8. Jediné číslo v tom grafu, které měřila Artificial Analysis, je GDPval-AA v2, kde GLM 5.3 Flash dosahuje 1773 Elo, nejvíce ze všech vynesených modelů. Arena jej mezitím ohodnotila, sedmnáctý ve WebDev a desátý v image-to-WebDev. Naši open-weight volbu to mění: GLM 5.3 Flash nahrazuje GLM-5.2 jako model pod MIT, který bychom hostovali. Jedna výstraha k hardwaru: 18B aktivních neznamená 18B k hostování, protože směrování mixture-of-experts potřebuje mít všech 320B vah v paměti, takže jde o multi-GPU server, ne o pracovní stanici. Podrobnosti v našem rozboru GLM 5.3 Flash.
26. srp. Alibaba Qwen3.8-Flash-Next, otevřené váhy a první veřejný pohled na architekturu Qwen4 Nové
Alibaba zveřejnila Qwen3.8-Flash-Next na Hugging Face 26. srpna 2026 a jde v něm spíš o architekturu než o žebříčky: Qwen uvádí, že je to raný pohled na návrh, který použije rodina Qwen4, vydaný proto, aby se na něj komunita mohla připravit. Je to mixture-of-experts se 125 miliardami parametrů a pouhými 6 miliardami aktivních na token, plus samostatné N-gramové embedding s 51 miliardami parametrů, a přijímá text, obraz i video. Kontext je nativně 262 144 tokenů s rozšířením na 1M. Mezi zveřejněnými čísly Qwenu je 91,7 na GPQA Diamond, 62,5 na SWE-Bench Pro, 58,7 na DeepSWE 1.1, 81,0 na SWE-Bench Multilingual a 84,5 na AndroidWorld vision, vše dodavatelovo a tehdy zcela bez nezávislého hodnocení. Artificial Analysis mu od té doby dala 39,9 na Intelligence Index v4.3 a Arena jej řadí devátý ve WebDev se skóre 1635. Licenci je třeba si přečíst dřív, než na ní začnete stavět, protože to není Apache. Qwen Community License 1.0 povoluje komerční užití, úpravy i hostování, ale vyžaduje viditelné uvedení názvu modelu, jakmile produkt překročí 100 milionů měsíčních aktivních uživatelů nebo 20 milionů dolarů měsíčních tržeb, a vyžaduje samostatnou licenci od Qwenu pro provozování model-as-a-service nebo produktu typu AI pracovní asistent. Interní použití je z této druhé podmínky vyňato.
21. srp. OpenAI GPT-5.6 Sol zlevnil o více než 20 %, nyní je pod Claude Opus 5 na obou stranách Nové
OpenAI dne 21. srpna 2026 snížil cenu GPT-5.6 Sol z $5 / $30 na $4 / $20 za 1M tokenů, což je první zlevnění vlajkového modelu od červencového uvedení rodiny GPT-5.6. Sazba je propagační a podle OpenAI potrvá zhruba tři měsíce. Týká se API a kreditů pro Codex a ChatGPT Work; ceny předplatného Plus, Pro a Business se nemění. Za $4 / $20 nyní Sol podráží Claude Opus 5 za $5 / $25 ve vstupu i výstupu, poprvé je tedy vlajkový model OpenAI z těch dvou levnější.
16. srp. DeepSeek DeepSeek zdražuje API zhruba čtyřnásobně a dělí ceník na špičku a mimo špičku Nové
DeepSeek převedl oba modely V4 na nový ceník v 16:00 UTC dne 16. srpna 2026 a směr je pro tento obor nezvyklý: ceny šly nahoru, ve špičce zhruba čtyřnásobně. V4-Flash 0731 šel z rovných $0.14 / $0.28 za 1M tokenů na $0.22 / $0.66 mimo špičku a $0.44 / $1.32 ve špičce a V4-Pro 0813 z $0.435 / $0.87 na $0.66 / $1.98 mimo špičku a $1.32 / $3.96 ve špičce, s kešovaným vstupem na $0.007, respektive $0.022 mimo špičku. Špička je od 01:00 do 04:00 a od 06:00 do 10:00 UTC od pondělí do pátku a každá jiná hodina je mimo špičku, přesně za polovinu špičkové sazby. DeepSeek to podal jako rozumnější rozdělení kapacity. Na samotných modelech se nic nezměnilo, takže jde čistě o ekonomickou událost, ale pro tuto stránku o zásadní: stálo DeepSeek V4-Flash volbu s nejlepším poměrem cena/výkon, která přešla na GLM 5.3 Flash s ceníkovými $0.15 / $0.50. DeepSeek většinu zdražení 10. září otočil, V4-Flash ukončil a nahradil jej V4.1-Flash za $0.15 / $0.60 mimo špičku, takže na vstupu jsou mimo špičku znovu na stejné úrovni. Váhy zůstávají pod MIT, takže kdo si model hostí sám, se změny nedotkne. Podrobnosti v našem rozboru DeepSeek V4.
14. srp. Z.ai GLM 5.3, velký agentický skok jen z dotrénování, vyšel bez open weights Nové
Z.ai vydalo GLM 5.3 dne 14. srpna 2026 a pozoruhodné je to, co se nezměnilo: běží na stejném základu se 744 miliardami parametrů jako GLM-5.2, bez nového předtrénování. Veškerý nárůst pochází ze škálovaného dotrénování a ten agentický je velký. Na vlastním grafu Z.ai jde Terminal-Bench 3.0 z 4,6 na 28,3, DeepSWE v1.1 ze 46,2 na 66,9 a CyberGym ze 77,2 % na 84,5 %, o čemž firma tvrdí, že těsně předčí Claude Mythos 5 s 83,8 a GPT-5.6 Sol s 83,6. Všechna tato čísla jsou dodavatelova, zatím bez nezávislého auditu, a graf je jinde méně lichotivý: na interním Code Bench od Z.ai stále vede Claude Fable 5 s 39,5 % proti 31,4 % u GLM 5.3 a na ExploitBench jsou lídři frontier na 78,0 % proti 54,4 %. Háček je v licenci, nikoli ve skóre. GLM-5.2 vydal váhy pod MIT během několika dnů; GLM 5.3 nevyšel s žádnými a Z.ai uvedlo, že budou následovat po bezpečnostním vyhodnocení schopnosti modelu vyhledávat zranitelnosti, zhruba za dva týdny. To se vyřešilo 28. srpna 2026, kdy Z.ai zveřejnilo váhy přesně k datu, které zástupná stránka nesla, byť pod vlastní licencí GLM 5.3 License místo čisté MIT, kterou dostaly GLM-5.2 i GLM 5.3 Flash. Sazba za token je nyní zveřejněná, $1.40 / $4.40 za 1M tokenů, vedle GLM Coding Planu a ZCode. To, co dorazilo 26. srpna, byl místo toho GLM 5.3 Flash, jiný a menší model, který váhy pod MIT vydal, a právě to je vydání, které posunulo naši open-weight volbu. Podrobnosti v našem rozboru GLM 5.3.
13. srp. Google Gemini 3.7 Flash, programátorské skóre roste a cena klesá na polovinu na $0.75 / $3.75, do ledna Nové
Google vydal Gemini 3.7 Flash 13. srpna 2026, 23 dní po 3.6 Flash a jako třetí vydání Flash za necelé dva měsíce, zatímco Gemini 3.5 Pro stále nevyšel. Podstatou jsou programátorské zisky: DeepSWE v1.1 stoupá ze 49,0 % na 65,3 %, FrontierCode 1.1 Main z 34,4 % na 43,6 % a AutomationBench se téměř zdvojnásobuje ze 17,0 % na 30,4 %. Artificial Analysis jej hodnotí na 56 na svém indexu v4.1.1 proti 52 u 3.6 Flash a řadí jej na první místo ze 182 modelů v rychlosti výstupu s 385,1 tokenu za sekundu, což jej staví na Paretovu hranici inteligence versus čas. Kontextové okno a limit výstupu 64K jsou proti 3.6 Flash nezměněné, takže se nic neobětovalo. Dvě výhrady váží víc než benchmarky. Sazba $0.75 / $3.75 je úvodní a vyprší 31. prosince 2026, poté se zdvojnásobí na $1.50 / $7.50, přesně na to, co stál 3.6 Flash při uvedení; Google zároveň převedl 3.6 Flash na stejnou sazbu, takže oba nyní stojí stejně a upgrade je čistě rozhodnutí o schopnostech. A spotřebitelský přístup vede jen přes Spark, který vyžaduje Google AI Pro nebo Ultra a vylučuje Evropský hospodářský prostor, Spojené království, Švýcarsko a Nigérii, takže většina evropských čtenářů se k němu v aplikaci Gemini vůbec nedostane. Bezplatná úroveň Gemini stále dostává 3.6 Flash. Přístup přes API je všude nedotčen. Podrobnosti v našem rozboru Gemini 3.7 Flash.
12. srp. SpaceXAI Grok 4.6, dotrénování zvedá Intelligence Index z 56 na 61 při nezměněných $2 / $6 Nové
SpaceXAI vydala Grok 4.6 dne 12. srpna 2026 a výslovně nejde o nový základový model: společnost ponechala základ z Grok 4.5 a zlepšení koupila delším doplňkovým tréninkem, přegenerovanými trajektoriemi pro doladění a posilovaným učením v agentických prostředích. Žádná nová architektura ani počet parametrů zveřejněny nebyly. Artificial Analysis jej řadí na Intelligence Index 61, pět bodů nad Grok 4.5, což jej staví na sdílené třetí místo s GPT-5.6 Sol, za Claude Opus 5 se skóre 63 a Claude Fable 5 se skóre 62, jak index vypadal v tom měsíci; Claude Fable 5.1 se od té doby dostal nad všechny tři se skóre 66. Agentické hodnoty jsou silnější než souhrnný index: Elo 1753 na GDPval-AA v2 hned za Opus 5, 88,4 % na Terminal-Bench v2.1 a 50,7 % na tau3-Banking. Tehdejším argumentem byla efektivita, $0.84 na indexovou úlohu a zhruba 53 tahů a 0,5 miliardy vstupních tokenů u dlouhých úloh proti přibližně 103 tahům a 2,0 miliardám u Opus 5. Na dnešních číslech v4.3 od Artificial Analysis tento argument slábne: Grok 4.6 stojí $1.86 na indexovou úlohu, tedy více než $1.61 u Muse Spark 1.3 při vyšším skóre. Ceny zůstávají nezměněné na $2 / $6 za 1M tokenů s cache input za $0.50, na stejném kontextovém okně 500K tokenů, ale je tu past, kterou je dobré znát: jakmile prompt dosáhne 200 000 tokenů, SpaceXAI přeúčtuje celý požadavek sazbou $4 / $12, nikoli jen to, co limit přesahuje. Jedno varování k benchmarkům, protože řada článků to už popletla: Terminal-Bench v3.0 je jiný a mnohem těžší test než v2.1, takže 26 % na v3.0 a 88,4 % na v2.1 jsou obě pravdivá tvrzení o tomtéž modelu. Od prvního dne běží v API SpaceXAI, v Cursoru a Grok Build a u partnerů OpenRouter, Vercel a Cloudflare. Úplné podrobnosti najdete v našem rozboru benchmarků a cen Grok 4.6.
5. srp. Meta Muse Spark 1.2 a Muse Code, Intelligence Index z 51 na 57 při nezměněných $1.25 / $4.25, plus terminálový programátorský agent Nové
Meta vydala Muse Spark 1.2 dne 5. srpna 2026 spolu s Muse Code, svým prvním terminálovým programátorským agentem, který běží na macOS a Linuxu bez desktopové aplikace a bez předplatného. Artificial Analysis hodnotí model na Intelligence Index 57 při nejvyšším nastavení uvažování na svém aktuálním indexu v4.1.1, oproti 51 u verze 1.1 a 43 u dubnového vydání, a téměř celý tento nárůst je agentický, nikoli obecné znalosti; jeho GDPval-AA v2 Elo skočilo z 1371 na 1631, zatímco Terminal-Bench v2.1 se posunul jen z 78 % na 80 %. Ceny zůstávají nezměněny na $1.25 / $4.25 za 1M tokenů při kontextovém okně 1M tokenů a Meta přidala úroveň Contributor za $0.10 / $0.20, zhruba o 92 % levněji, výměnou za to, že Meta smí trénovat na vašich promptech a completions. Dostupnost se rozšířila z náhledu pouze pro USA, pod nímž vyšla verze 1.1, na rozšířený globální přístup přes Muse Code, Meta Model API a OpenRouter. Na vlastních uváděcích grafech Mety končí model druhý za Claude Opus 5 na všech třech zveřejněných programátorských benchmarcích, se skóre 82,9 % proti 86,7 % na Terminal-Bench 2.1.
3. srp. Alibaba Qwen 3.8 (Qwen3.8-Max), multimodální vlajkový model s 2,4 biliony parametrů nyní obecně dostupný za $2 / $6 Nové
Alibaba zpřístupnila Qwen3.8-Max obecně dne 3. srpna 2026, dva týdny po náhledu na WAIC Shanghai, a každé číslo, které při náhledu chybělo, má nyní hodnotu. Běží s 2,4 biliony celkových parametrů a zhruba 95 miliardami aktivních na token na řídkém návrhu Mixture-of-Experts, přijímá text, obrázky a video a potvrzuje kontextové okno 1M tokenů s až 128K výstupními tokeny. Ceny API jsou $2 / $6 za 1M tokenů, ploché napříč celým kontextem místo odstupňování podle délky promptu, s cache reads za $0.25. Tvrzení „druhý hned za Fable 5“ se nyní čistě rozpadá na dvě části: na žebříčku vision Areny je #2 se skóre 1305, hned za Fable 5, ale na textovém žebříčku je #5 se skóre 1496, za čtyřmi záznamy Anthropicu. Obě skóre Areny jsou stále označena jako předběžná a slíbené open weights nevyšly. Qwen 3.8 držíme mimo hodnocené volby, dokud váhy a licence skutečně nedorazí.
Čeká se Google Gemini 3.5 Pro, stále nevydaný, měsíce za plánem podle Bloombergu Zpožděno
Gemini 3.5 Pro zůstává největším čekajícím uvedením. Google jej oznámil na I/O dne 19. května spolu s Gemini 3.5 Flash, ale vyšel jen Flash a červnový cíl padl. Bloomberg 16. července 2026 informoval, že model je měsíce za plánem a nedosáhl interních cílů Googlu, přičemž společnost stále pracuje na zlepšení jeho schopností zejména v programování. To je celý podložený obraz. Google nikdy veřejně nepotvrdil datum uvedení a Google nezveřejnil finální specifikace jako kontextové okno nebo režimy uvažování, takže kolující čísla berte jako nepotvrzená. Mezitím používejte Gemini 3.8 Flash, pokud pracujete přes API, nebo Gemini 3.6 Flash, pokud jste na bezplatné aplikaci Gemini, která jej stále používá; 3.5 Pro přesuneme do hlavního žebříčku ve chvíli, kdy vyjde.
Volba kategorie, září 2026

Nejlepší AI na psaní

1
Claude Fable 5.1
Nejlepší psaní celkově
2
Kimi K3
Tvůrčí beletrie
3
Claude Sonnet 5
Zdarma na každý den

Nejlepší AI na psaní je Claude Fable 5.1 a argument pro něj je konzistence, ne jediné první místo. Je jediným modelem v nejlepší šestce na všech třech žebříčcích psaného textu: druhý na EQ-Bench Creative Writing v3 s 2152,7, druhý na LiveBench Language s 89,5 a šestý na žebříčku kreativního psaní Areny. Nic jiného to nesvede. GPT-6 Astra vede EQ-Bench s 2163,9, ale na žebříčku kreativního psaní Areny je 25.; Claude Fable 5 vede textový i kreativní žebříček Areny a je první na LiveBench Language s 90,7, ale na EQ-Bench klesl na osmé místo. Claude Opus 5.5, který 22. září sebral Fable 5.1 Intelligence Index i Humanity's Last Exam, není hodnocen na EQ-Bench ani na Areně a na LiveBench Language je osmý, takže zatím nemá na žebříčcích psaní žádný argument a koruna na něj nepřechází. Pokud je vaše psaní pracovní výstup, a ne próza, je to jiná otázka a žebříček profesionálních výstupů GDPval-AA v2.1 vede Claude Opus 5.5 s 1846 před Claude Fable 5.1 s 1735 a Claude Opus 5 s 1708. Claude Sonnet 5 zůstává volbou pro nejlepší poměr v bezplatné vrstvě a Claude Fable 5 volbou, pokud vážíte lidské hlasy Areny výš než skóre z harnessů; Fable 5 stojí $10 / $50 za 1M tokenů a je natrvalo součástí Claude Max a Team Premium zhruba s 50 % běžných limitů užití. Překlad je samostatná otázka se samostatným vítězem, kterou rozebíráme v průvodci nejlepší AI na překlad.

ModelNejlepší proSilná stránkaSlabinaCena (za 1M tokenů)
Claude Fable 5.1Nejlepší psaní celkově#2 EQ-Bench Creative Writing (2152,7), #2 LiveBench Language (89,5) a #6 kreativní psaní Areny, nejlepší souhrnné umístění ze všech modelůAni jeden ze tří nevede naplno; Claude Opus 5.5 mu 22. září sebral Intelligence Index a Humanity's Last Exam$10 / $50
Claude Fable 5Vede žebříčky lidských hlasů Areny#1 Arena text celkově (1505,7), #1 LiveBench Language (90.7), #8 EQ-BenchNejdražší volba zde$10 / $50
Kimi K3Tvůrčí beletrie a hlas#4 EQ-Bench Creative Writing (2070.6)Jen #27 na Arena tvůrčí psaní$3 / $15
Claude Sonnet 5Bezplatné psaní na každý denZdarma a výchozí na claude.ai, 1M kontext#53 Arena tvůrčí psaní; 75,0 LiveBench Language$2 / $10, nyní trvale
Claude Opus 5Profesionální výstupy s ohledem na cenu#2 GDPval-AA v2.1 se skóre 1708, před Fable 5 (1632)Za Fable 5 na Arena text, za Fable 5.1 na GDPval-AA v2.1$5 / $25
GPT-5.5Faktograficky ukotvené obchodní psaníDoložené zlepšení faktografické spolehlivosti oproti GPT-5.4Úrovně uvažování nyní označeny jako zastaralé$5 / $30
Gemini 3.8 FlashHromadné koncepty ve velkémIntelligence Index 40,9, 308,4 tok/s na výstupu, 1M kontextLaděný spíše na agenty než na prózu; úvodní cena se 1. ledna 2027 zdvojnásobí$0.75 / $3.75
Druhé místo a alternativy: Claude Fable 5 je druhý a je volbou, pokud vážíte lidské hlasy Areny, Kimi K3 je volbou pro výraznou fikci, i když je nyní na EQ-Bench čtvrtý, Claude Sonnet 5 je volbou s nejlepším poměrem a tou, kterou použít, pokud neplatíte, Claude Opus 5 je levnější volbou pro profesionální výstupy a Gemini 3.8 Flash je volbou pro hromadné psaní konceptů.
Co se tento měsíc změnilo

Koruna za psaní zůstává Claude Fable 5.1, ale změnilo se, na čem stojí. Claude Opus 5.5 mu 22. září sebral Intelligence Index i Humanity's Last Exam, což byla právě čísla, která tato karta citovala, takže jsme volbu opřeli o žebříčky, které skutečně měří prózu. Na nich je Fable 5.1 jediným modelem v nejlepší šestce na všech třech: druhý na EQ-Bench Creative Writing, druhý na LiveBench Language a šestý na žebříčku kreativního psaní Areny. Opus 5.5 není na dvou ze tří hodnocen a na třetím je osmý, takže pro psaní zatím argument nemá. Arena už Fable 5.1 ohodnotila, čímž mizí výhrada, kterou jsme nesli minulý měsíc, že se žebříčky lidských preferencí ještě nevyjádřily: je pátý na textovém žebříčku s 1498,5, kde stále vede Claude Fable 5 s 1505,7. GDPval-AA v2.1 byl znovu překotven a nyní ukazuje 1846 u Opusu 5.5, 1735 u Fable 5.1 a 1708 u Opusu 5, takže čísla v tomto bloku jsou výrazně níž než ta, která jsme uváděli v srpnu.

Volba kategorie, září 2026

Nejlepší AI pro chat & každodenního asistenta

1
GPT-5.6
Výchozí model ChatGPT
2
Claude Fable 5
Nejlépe hodnocený
3
Claude Opus 5
Promyšlená hloubka

Nejlepší AI pro každodenní chat je GPT-5.6 a upřímným důvodem je dosah, ne pozice na žebříčku. Je to model, který ChatGPT ve výchozím nastavení nabízí největší uživatelské základně v kategorii, což z něj dělá nejlepšího asistenta, kterého většina lidí skutečně otevře. V čisté lidské preferenci lídrem není: GPT-5.6 Sol sedí na #18 na textovém žebříčku Areny se skóre 1483,5, kde Claude Fable 5 vede se skóre 1505,7. Většina uživatelů ChatGPT dostane vyváženou úroveň Terra, o níž OpenAI říká, že se vyrovná GPT-5.5, a od snížení cen 30. července 2026 stojí o 60 % méně. Je dostupný v ChatGPT (zdarma s limity, Plus za $20/měsíc, Pro za $100/měsíc), přes API (úrovně řady 5.6: Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 za 1M tokenů) a zabalený uvnitř Fello AI vedle Claude, Gemini, Grok a DeepSeek. Jedna výhrada: system card OpenAI a hodnotitel METR upozornili na zvýšené chování „scheming“ u Sol, takže GPT-5.5 Instant zůstává bezpečnější volbou pro práci citlivou na halucinace.

ModelNejlepší proSilná stránkaSlabinaCena
GPT-5.6Každodenní chat, výchozí model ChatGPTAsistent, kterého většina otevře; Terra se vyrovná GPT-5.5 za ~poloviční cenu#14 na Arena text; scheming označen METRZdarma / $20/měs. Plus; API $0.20 / $1.20 až $4 / $20
Claude Fable 5Nejlépe hodnocená konverzace#1 na Arena text celkově (1505,7) a ve čtyřech z osmi podkategoriíŽádná bezplatná verze; přístup přes kredity použití na Pro$10 / $50 API
Claude Opus 5Promyšlené, jemné odpovědiTřetí na Intelligence Index od Artificial Analysis (50,8), za Claude Fable 5.1 a GPT-6 Astra#10 na Arena text, za Claude Fable 5$20/měs. Pro, $5 / $25 API
GPT-5.5 InstantKaždodenní práce citlivá na halucinaceO 52,5 % méně halucinovaných tvrzení vs. 5.3 InstantÚrovně uvažování nyní označeny jako zastaralé$20/měs. Plus; API $5 / $30
Gemini 3.6 FlashRychlý, zdarma, multimodálníStále model, který dostává bezplatná úroveň Gemini, 1M kontext, #12 na Arena textSlabší v nejtěžším uvažování; 3.8 Flash jej předčí za stejnou cenuZdarma / $0.75 / $3.75 API
Fello AIVšechny top modely, jedna aplikaceChatGPT + Claude + Gemini + Grok + DeepSeek a další na Macu, iPhonu a iPaduSměrováno přes aplikaci, ne přímo$9.99/měs.
Druhé místo a alternativy: Claude Fable 5 je druhý a skutečný lídr preferencí, Claude Opus 5 je druhý pro promyšlené každodenní použití, Gemini 3.6 Flash je druhý pro rychlý a zdarma a Grok 4.6 je nika pro dny s živými zprávami. Fello AI je přirozená volba, pokud chcete top modely v jedné aplikaci pro Mac a iOS za $9.99/měsíc místo žonglování s předplatnými.
Co se tento měsíc změnilo

GPT-5.6 si drží volbu pro chat díky dosahu a odstup od lídra preferencí se znovu zvětšil. Sol je nyní na 18. místě textového žebříčku Areny s 1483,5, dolů ze 14., zatímco Claude Fable 5 vede s 1505,7. Na produktu se nic nezměnilo, takže koruna se nehýbe: pořád jde o to, kterého asistenta si nejvíc lidí skutečně otevře. Dvě uvedení, která by jinak byla kandidáty, jimi nejsou: GPT-6 Astra se začátkem září dostal do ChatGPT Business, Pro a Plus, ale OpenAI neoznámila nic pro bezplatnou vrstvu, a Claude Opus 5.5, který 22. září sebral Intelligence Index, je model pro API a tarify Claude, ne výchozí asistent pro miliardu lidí. OpenAI 22. září vydala GPT-6 Sol a GPT-6 Luna a dala je do ChatGPT Work a Codexu s tím, že v Chatu zatím nejsou, takže okno, do kterého většina lidí píše, běží dál na GPT-5.6.

Volba kategorie, září 2026

Nejlepší AI na obrázky

1
ChatGPT Images 2.5
Text v obrázcích
2
MAI-Image-2.6
#1 úpravy obrázků AA
3
Muse Image
Ekosystém Meta AI

Nejlepší AI na generování obrázků je ChatGPT Images 2.5, který OpenAI 8. září nastavila jako výchozí ve všech tarifech ChatGPT a který nyní vede všechny čtyři obrázkové žebříčky, jež sledujeme. Jeho dva modely jsou na každém z nich první a druhý: GPT-Image-2.5 Sunburst, stavěný na přesnost, vede Arena text-to-image s 1423,2 a Arena úpravy obrázků s 1526,0 a vede i kvalitativní Elo od Artificial Analysis s 1196,8 a její žebříček úprav obrázků s 1221,3, přičemž rychlejší GPT-Image-2.5 Flare je na všech čtyřech druhý. To je změna proti minulému měsíci, kdy Artificial Analysis neohodnotila ani jeden model a její žebříčky si s Arenou odporovaly. Odstup mezi Sunburstem a Flare přesto berte jako předběžný, protože ta umístění na Areně stojí na několika tisících hlasů proti 83 000 a 259 000 u GPT Image 2 a na text-to-image oba sdílejí stejné pásmo pořadí. Druhý je MAI-Image-2.6, třetí na žebříčku úprav obrázků od Artificial Analysis s 1191,6 a čtvrtý na žebříčku text-to-image Areny s 1334,0, s Muse Image od Mety na třetím místě. Reve 2.1 si drží argument pro sazbu, typografii a nativní 4K, ale opustil stupně vítězů: je šestý na Arena text-to-image a čtrnáctý na Arena úpravách obrázků. Celý rozbor toho, co vyšlo, najdete v ChatGPT Images 2.5.

ModelNejlepší proSilná stránkaSlabinaCena
ChatGPT Images 2.5Obrázky s čitelným textem#1 a #2 na všech čtyřech žebříčcích: Arena text-to-image (1423,2 / 1401,3), Arena úpravy (1526,0 / 1481,8), kvalita Artificial Analysis (1196,8 / 1190,4) a úpravy (1221,3 / 1207,0)Umístění na Areně stojí na několika tisících hlasůVýchozí ve všech tarifech ChatGPT
MAI-Image-2.6Úprava obrázku, který už máte#3 na úpravách obrázků od Artificial Analysis (1191,6) a #4 na Arena text-to-image (1334,0)Veřejná ukázka, zatím ne v Copilotu ani v Bingu; vedení v úpravách u Artificial Analysis ztratil ve prospěch ChatGPT Images 2.5MAI Playground / Microsoft Foundry
Muse ImageÚpravy obrázků, ekosystém Meta#5 na úpravách obrázků od Artificial Analysis (1171,3) a #7 na jejím kvalitativním EluNový, kolem něj tenká nástrojová výbavaAplikace Meta AI
Nano Banana 2 (Gemini 3.1 Flash Image)Fotorealistické portréty a produkty#4 v generování obrázků z textu Artificial Analysis, před Nano Banana Pro na žebříčku ArenyV úpravách obrázků Areny je Nano Banana Pro výšeAplikace Gemini / AI Studio
Seedream 5.0 ProVícejazyčný text + úpravy oblastí10+ jazyků včetně arabštiny RTL, laso a vrstvové úpravyKolem desátého místa na nezávislých žebříčcích; nejistota kolem autorských právBytePlus / Magnific
Midjourney v8Stylizované umění, ilustraceEstetický základ, který většina umělců preferujeSlabší v textu v obrázku$10-$120/měs.
Grok ImagineNSFW / režim SpicyNejbenevolentnější mantinely; Arena řadí jeho model Image 2.0 na #5 v text-to-image a na #4 v úpravách obrázků a Artificial Analysis ho má nyní na #4 v kvalitativním EluV záznamu o vydáních nic neukazuje, že by Image 2.0 vyšel jako produkt$30 měsíčně SuperGrok
Druhé místo a alternativy: MAI-Image-2.6 je druhý celkově a volba pro úpravu obrázku, který již máte, Muse Image je třetí a volba uvnitř aplikací Mety a Nano Banana 2 je stále fotorealistická volba. Reve 2.1 zůstává volbou pro rozvržení, typografii a nativní 4K, i když opustil stupně vítězů. Grok Imagine je stále jediný frontier model, který umožňuje obsah pro dospělé v režimu Spicy Mode, a Arena nyní řadí jeho model Image 2.0 na páté místo v generování obrázků z textu a na čtvrté v úpravách obrázků.
Co se tento měsíc změnilo

ChatGPT Images 2.5 si drží obrázkovou korunu a jeho argument zesílil. Minulý měsíc Artificial Analysis neohodnotila ani jeden z jeho dvou API modelů, takže žebříčky, které sledujeme, si odporovaly: Arena měla Sunburst a Flare na prvním a druhém místě, zatímco Artificial Analysis měla stále GPT Image 2 v čele text-to-image a MAI-Image-2.6 od Microsoftu v čele úprav obrázků. Artificial Analysis teď oba ohodnotila a i tam jsou první a druhý, 1196,8 a 1190,4 na kvalitativním Elu a 1221,3 a 1207,0 na úpravách obrázků. Díky tomu je #1 a #2 na všech čtyřech žebříčcích. MAI-Image-2.6 zůstává druhý, ale klesá na třetí místo žebříčku úprav, který dřív vedl, a Grok Imagine Image 2.0 je nyní čtvrtý na kvalitativním Elu Artificial Analysis a čtvrtý na žebříčku úprav Areny, což je lepší umístění než třetí místo na našem pódiu; stále ho jen uvádíme a nekorunujeme, protože v záznamu o vydáních nic neukazuje, že by vyšel jako produkt.

Volba kategorie, září 2026

Nejlepší AI na video

1
Gemini Omni 1.1 Flash
#1 Arena text-to-video
2
MiniMax H3
2K + nativní zvuk
3
Dreamina Seedance 2.0
Nejbližší vyzyvatel

Nejlepší AI na generování videa je Gemini Omni 1.1 Flash, který Google vydal 27. srpna a který vede žebříček text-to-video Areny s 1516, těsně před vlastním předchůdcem Gemini Omni Flash s 1513. Berte to jako remízu: oba leží uvnitř intervalů spolehlivosti toho druhého a Arena sama dává 1.1 Flash pásmo pořadí jedna až čtyři. Rozhoduje specifikace, kde je 1.1 Flash zřetelně schopnější model: prodlužování scény po 10 sekundách až na souhrnných 40 sekund, řízení prvního a posledního snímku, videoreference, náhledy v 360p a výstup v 1080p nebo 4K, za zhruba $0,03 za sekundu v 360p, $0,10 v 720p, $0,15 v 1080p a $0,30 ve 4K. Gemini Omni Flash zůstává levnější volbou kolem $0,10 za sekundu, ale stropuje na 10sekundových klipech. Dvě omezení stojí za zmínku. Artificial Analysis 1.1 Flash vůbec neohodnotila; na jejím žebříčku text-to-video vede starší Omni Flash s 1512,8 před Wan 3.0 od Alibaby s 1431,4 a MiniMax H3 s 1407,7. A na žebříčku image-to-video Areny je 1.1 Flash druhý s 1488,5 za MiniMax H3 s 1495,4, takže koruna stojí na text-to-video a na specifikaci, ne na vyčištění stolu. Pokud potřebujete delší záběry uvnitř nástrojů Googlu, Veo 3.1 stále běží v aplikaci Gemini, v AI Studiu a ve Vertex AI s nativním zvukem a výstupem 1080p. MiniMax H3 (31. července) zůstává soupeřem po stránce specifikace, s klipy ve 2K o délce 4 až 15 sekund a nativním stereo zvukem od $0,13 za sekundu.

ModelNejlepší proSilná stránkaSlabinaCena
Gemini Omni 1.1 FlashNejlepší AI video celkově#1 Arena text-to-video (1516); prodloužení scény na 40 sekund, výstup ve 4KArtificial Analysis ho nehodnotila; na Arena image-to-video druhý za MiniMax H3$0,03-$0,30/s; Gemini API / AI Studio / Flow
Gemini Omni FlashLevnější desetisekundové klipy#2 Arena text-to-video (1511), #2 AA video (1238); konverzační úpravyKončí u desetisekundových generací~$0.10/s; aplikace Gemini / AI Studio
Wan 3.0Video z dokumentů a prezentací#1 na žebříčku videa od Artificial Analysis (1239); 2-30 s, až 1080p, vstup Omni-ReferenceJen přes API, bez zveřejněných vah; #3 na Areně$0.05-$0.20/s
MiniMax H32K klipy s nativním zvukem4-15 s ve 2K, nativní stereo zvuk; #8 Arena text-to-video (1462)#4 na AA videu (1227); otevřené váhy neobsahují 2K upscaler a vyžadují žádost v USA, EU, Británii a Jižní Koreji$0.13/s ve 2K
Dreamina Seedance 2.5Vyzyvatel od ByteDance#6 Arena text-to-video (1482); vede image-to-video se zvukemEkosystém ByteDance, omezený přístup na ZápaděDreamina / BytePlus
Muse VideoVideo v ekosystému Meta#3 generování videa z textu se skóre 1459Nejnovější ze skupiny, tenké nástrojeAplikace Meta AI
Veo 3.1Delší produkční klipyNativní zvuk, 1080p, silná fyzikální konzistence#6 na Arena video, ne lídr kvalityGoogle AI Pro / Ultra
Kling 3.0 / 3.0 TurboRychlá iterace za nižší cenuNativní 4K, 60fps, 15sekundové klipy; Turbo vyšel 17. červnaMimo top 16 na Arena generování videa z textuOd $10/měs.
Luma Ray 3Fotorealistické scénySilný realismus pro krajinyMenší komunitaZdarma / od $9.99/měs.
Druhé místo a alternativy: MiniMax H3 je druhý a nyní vede žebříček image-to-video Areny s 1495,4 před Gemini Omni 1.1 Flash s 1488,5. Dreamina Seedance 2.0 je třetí a stále je volbou pro image-to-video se zvukem. Veo 3.1 je volbou, když 10 sekund nestačí, a Wan 3.0 od Alibaby ten, po kterém sáhnout, když je zdrojem dokument, tabulka nebo prezentace. OpenAI ukončila spotřebitelskou aplikaci Sora 2 dne 26. dubna 2026 a zbývá jen vývojářské API, a to do 24. září 2026. Data ukončení starších modelů u všech poskytovatelů sledujeme v samostatném průběžném seznamu.
Co se tento měsíc změnilo

Gemini Omni 1.1 Flash si drží videokorunu, ale obrázek kolem ní je zamotanější, než naznačoval zápis z minulého měsíce. Stále vede žebříček text-to-video Areny, 1516 proti 1513 u Gemini Omni Flash, a Arena mu dává pásmo pořadí jedna až čtyři, takže to zůstává remíza rozhodnutá schopnostmi. Dvě věci, které jsme uvedli v srpnu, se mezitím změnily. Artificial Analysis znovu překotvila své videoelo a stará trojice 1239 / 1238 / 1235 už neexistuje: Gemini Omni Flash nyní ten žebříček vede s 1512,8 před Wan 3.0 s 1431,4 a MiniMax H3 s 1407,7 a Artificial Analysis 1.1 Flash stále vůbec neohodnotila. A MiniMax H3 obsadil čelo žebříčku image-to-video Areny s 1495,4 a odsunul 1.1 Flash na druhé místo s 1488,5, což je první žebříček, který tato koruna ztratila.

Volba kategorie, září 2026

Nejlepší AI na programování

1
Claude Opus 5.5
Vede všechny harnessy
2
GPT-6 Astra
Oba programátorské žebříčky Areny
3
Claude Fable 5.1
Druhý na harnessech

Nejlepší AI na programování je Claude Opus 5.5, který Anthropic vydal 22. září a který vede každý programátorský harness, jaký sledujeme: vlastní Terminal-Bench 4.0 od Artificial Analysis s 59,6 % proti 59,1 % u GPT-6 Astra, LiveBench Coding s 89,3 proti 80,4 a LiveBench Agentic Coding se 71,7 proti 57,3. Dělá to za $4 / $20 za 1M tokenů, tedy za méně než polovinu ceníku obou modelů, které této tabulce vládly minulý měsíc, se čtením z cache za $0,20, a podle vlastního testování Anthropicu stojí běžná zátěž o 40 % méně než na Claude Opus 5. Interní běh Terminal-Bench 4.0 u Anthropicu ten odstup ještě rozšiřuje, 66,4 % proti 57,9 %, které pro Astru uvádí OpenAI, vedle 54,4 % na FrontierCode v1.1 a 57,8 % na CursorBench 4.0. GPT-6 Astra si drží oba programátorské žebříčky Areny, WebDev s 1793 a image-to-WebDev s 1733, protože Opus 5.5 zatím nemá vůbec žádné hlasy Areny, a to je tady poctivé rozdělení: OpenAI vede v lidských preferencích, Anthropic na každém měřeném harnessu. Půlbodový odstup na Terminal-Bench čtěte obezřetně, protože Anthropic sám u toho benchmarku uvádí směrodatnou chybu kolem 2,6 bodu, takže tam oba berte jako vyrovnané a nechte rozhodnout žebříčky LiveBench a cenu. Claude Fable 5.1 je druhý na obou žebříčcích Areny a třetí na harnessech. Qwen3.8-Max-0902 od Alibaby držel WebDev Areny zhruba tři dny na začátku září a dnes je pátý s 1662. Mezi otevřenými vahami se obrázek změnil 21. září: MiMo-V2.6-Pro od Xiaomi bere 34,8 % na Terminal-Bench 4.0 pod čistou licencí MIT za $0,13 na úlohu indexu, zatímco GLM-5.3 je na tom harnessu stále nejsilnějším otevřeným modelem se 41,9 % a Kimi K3 je nejvýše postaveným otevřeným modelem na Arena WebDev, sedmý s 1658, ovšem jen s 12,6 % na harnessu. Artificial Analysis zrušila jak svůj Coding Index, tak Coding Agent Index, takže dvě složené programátorské žebříčky, které tato stránka citovala, už neexistují.

ModelNejlepší proSilná stránkaSlabinaCena (za 1M tokenů)
Claude Opus 5.5Nejlepší programování celkově#1 Terminal-Bench 4.0 (59,6 %), #1 Intelligence Index (57,6, v4.3.2) a #1 LiveBench Coding (89,3)Zatím žádné hlasy Areny, takže Astra si drží oba své programátorské žebříčky$4 / $20
GPT-6 AstraVrchol obou programátorských žebříčků Areny#1 Arena WebDev (1793) a #1 image-to-WebDev (1733); 59,1 % Terminal-Bench 4.02,5krát cena Opusu 5.5 a za ním na každém harnessu$10 / $50
Claude Fable 5.1Nejvyšší složené skóre před Opusem 5.5#2 na obou programátorských žebříčcích Areny; Intelligence Index 53,4; AA-Briefcase 167852,0 % Terminal-Bench 4.0; 2,5krát cena Opusu 5.5$10 / $50
Claude Opus 5Nahrazen Opusem 5.549,0 % Terminal-Bench 4.0 a #3 na obou programátorských žebříčcích ArenyStojí za token víc než Opus 5.5 a má o sedm bodů nižší skóre$5 / $25
Claude Fable 5Nejtěžší dlouhohorizontová agentní práceIntelligence Index 49,6; 42,4 % Terminal-Bench 4.0; kontext 1MNejdražší na úlohu indexu v této tabulce, $8,75; #6 na Arena image-to-WebDev$10 / $50
Qwen3.8-Max-0902Krátký držitel žebříčku WebDev Areny#5 Code Arena: WebDev (1662); Intelligence Index 45,4; 2,4 bilionu parametrů, kontext 1MJen API QwenCloud bez spotřebitelského rozhraní; vedení na WebDev ztratil během dní$2 / $6
Kimi K3Nejvýše postavený otevřený model na Areně#7 Arena WebDev (1658), nejlepší otevřené umístění na tom žebříčku; 2,8 bilionu/104 mld. aktivníchJen 12,6 % na Terminal-Bench 4.0; 1,56 TB pro vlastní hosting$3 / $15
GPT-5.6 SolLevnější vlajková loď OpenAIIntelligence Index 47,0; 39,9 % Terminal-Bench 4.0Nahrazen GPT-6 Sol, který má vyšší skóre za poloviční cenu; METR u něj označil obcházení testů$4 / $20
GPT-6 SolLevné programování v GPT-6 uvnitř CodexuIntelligence Index 47,5 (v4.3.2) a 43,9 % Terminal-Bench 4.0, obojí nad GPT-5.6 Sol, za poloviční cenuŽádné hlasy Areny; jen v Codexu a ChatGPT Work, ne v Chatu$2 / $10
Muse Spark 1.3Levné agentní programováníIntelligence Index 48,1 za $1,25 / $4,25 a $1,60 na úlohu indexu33,3 % na Terminal-Bench 4.0; programátorské výhry pocházejí z vlastního grafu Mety, měřeného na variantě max jen pro partnery$1,25 / $4,25
Grok 4.7Levný poměr cena/výkon46,3 % CursorBench 4.0 a 71,0 % DeepSWE v1.1 podle vlastních čísel SpaceXAI; Intelligence Index 46,324,7 % na Terminal-Bench 4.0; prompty od 200 tis. tokenů přeúčtují celý požadavek dvojnásobkem$2 / $6
Gemini 3.8 FlashAgentní programování ve velkémIntelligence Index 40,9; 308,4 výstupních tokenů za sekundu19,7 % na Terminal-Bench 4.0; zaváděcí cena se 1. ledna 2027 zdvojnásobí$0,75 / $3,75
GLM 5.3 FlashNejlevnější seriózní kodér, kterého uhostíte32,8 % Terminal-Bench 4.0 za $0,25 na úlohu indexu; MIT, 320 mld./18 mld. aktivníchGLM-5.3 dosahuje na témže harnessu 41,9 %; žádný spotřebitelský produktOtevřené váhy (MIT)
MiMo-V2.6-ProNejvyšší otevřený Intelligence Index46,3 na v4.3.2 a 34,8 % Terminal-Bench 4.0 za $0,13 na úlohu indexu; MIT, 1,02 bilionu/42 mld. aktivníchZveřejněn 21. září, takže zatím žádné hlasy Areny ani nezávislá historie$0,435 / $0,87
Druhé místo a alternativy: GPT-6 Astra je druhý a stále vede oba programátorské žebříčky Areny, Claude Fable 5.1 je na nich druhý a třetí na harnessech a Claude Opus 5 teď nahradil model, který je zároveň levnější i lepší. Mezi otevřenými vahami je novým lídrem ve skóre i v ceně MiMo-V2.6-Pro od Xiaomi, GLM-5.3 je nejsilnější na Terminal-Bench 4.0 od Artificial Analysis, Kimi K3 je nejvýše postaveným otevřeným modelem na žebříčku WebDev Areny a GLM 5.3 Flash je volbou pro týmy, které si hostují vlastní model, za $0,25 na úlohu indexu pod čistou licencí MIT. Uvnitř vývojových prostředí je Cursor s Claudem stále nejoblíbenější dvojicí a Claude Code je přirozená volba, pokud žijete v terminálu.
Co se tento měsíc změnilo

Programátorská koruna přešla na Claude Opus 5.5, čtyři dny poté, co připadla GPT-6 Astra. Anthropic ho vydal 22. září a vede každý programátorský harness, jaký sledujeme: 59,6 % proti 59,1 % u Astry na vlastním Terminal-Bench 4.0 od Artificial Analysis, 89,3 proti 80,4 na LiveBench Coding a 71,7 proti 57,3 na LiveBench Agentic Coding, za $4 / $20 proti $10 / $50. Astra si drží oba programátorské žebříčky Areny, protože Opus 5.5 tam zatím nemá hlasy, takže jde o rozdělení, ne o vyčištění stolu. Odstup na Terminal-Bench je půl bodu proti směrodatné chybě, kterou Anthropic klade kolem 2,6, takže ve skutečnosti rozhodují žebříčky LiveBench a cena. Claude Opus 5 opouští stupně vítězů: Opus 5.5 stojí za token méně, spotřebuje méně tokenů a má o sedm bodů vyšší Intelligence Index, což starý argument o výhodné ceně u Opusu 5 nečiní jen slabším, ale rovnou neplatným. Do tabulky přibývají MiMo-V2.6-Pro od Xiaomi a Grok 4.7 od SpaceXAI a všechna čísla indexu na této stránce se přesunula na v4.3.2, proto jsou o kousek níž než minulý měsíc. GPT-6 Sol přibyl do tabulky týž den za $2 / $10: Artificial Analysis ho měří na 47,5 na indexu a na 43,9 % na Terminal-Bench 4.0, v obojím nad GPT-5.6 Sol a za poloviční cenu, ale s velkým odstupem za Opusem 5.5, a k vývojářům se dostává přes Codex, ne přes chatovací okno.

Volba kategorie, září 2026

Nejlepší AI na kreativitu

1
Grok 4.7
Nejméně mantinelů
2
Claude Fable 5
Próza nejvyšší kvality
3
Kimi K3
Beletrie a hlas

Nejlepší AI na necenzurovanou, trendovou tvorbu je Grok 4.7 a chceme být přesní v tom proč. Tahle volba je o produktové řadě, ne o kvalitě prózy. Grok nese nejméně obsahových omezení ze všech špičkových modelů a jako jediný má nativní napojení na X v reálném čase, což z něj dělá jediný model, který se pustí do odvážných, aktuálních nebo záměrně provokativních zadání, jaká ostatní odmítají. Dostupnost čtěte pozorně: SpaceXAI vydala Grok 4.7 dne 21. září do Grok API, Cursoru, Grok Buildu, cizích harnessů a cloudových routerů a její oznámení neříká nic o spotřebitelské aplikaci, která předplatitelům SuperGrok a X Premium+ za $30 měsíčně stále servíruje Grok 4.6. Není to nejlepší pisatel. Arena už Grok 4.6 ohodnotila a je na 32. místě žebříčku kreativního psaní, před Grokem 4.5 na 36. místě, ale za starším Grokem 4.20-beta1 na 23. EQ-Bench neohodnotil ani 4.6, ani 4.7 a na tom žebříčku je Grok 4.5 na 46. místě s 1576,0, což je nově těsně před Grokem 4.20-beta, ne za ním. Protože SpaceXAI mířila oběma vydáními na programování a agentní práci, ne na prózu, nepředpokládáme, že 4.7 tady něco posunul. Pokud vybíráte čistě podle kvality výstupu, žebříček kreativního psaní Areny stále vede Claude Fable 5, zatímco EQ-Bench staví na první místo GPT-6 Astra s 2163,9, Claude Fable 5.1 na druhé a Kimi K3 na čtvrté. Grok volte podle toho, co vám dovolí vytvořit, ne podle toho, jak dobře píše.

ModelNejlepší proSilná stránkaSlabinaCena
Grok 4.7Necenzurovaný, vyhraněný, trendovýNejméně obsahových omezení, nativní ukotvení v X v reálném časeŽádný žebříček kreativního psaní ho neohodnotil; Grok 4.6 je #32 na kreativním psaní Areny$2 / $6 API; aplikace SuperGrok za $30 měsíčně, stále na 4.6
Claude Fable 5Tvůrčí próza nejvyšší kvality#1 Arena tvůrčí psaní, #1 LiveBench LanguageOpatrné mantinely u odvážných zadání$10 / $50 API
Kimi K3Beletrie a osobitý hlas#4 EQ-Bench Creative Writing s 2070,6Na kreativním psaní Areny jen #27$3 / $15
Claude Opus 5Strukturovaná dlouhá tvůrčí práceDrží dlouhá vlákna a sám se edituje; Intelligence Index 50,8, za Claude Fable 5.1 a GPT-6 AstraNejopatrnější ze skupiny$20/měs. Pro; $5 / $25 API
Gemini 3.1 ProMultimodální tvůrčí práceSilný řetězec textu, obrázku a videaKvóty v aplikaci GeminiZdarma / $2.00-$4.00 API vstup
Grok Imagine (Spicy Mode)NSFW / tvůrčí práce pro dospěléNejvolnější generování obrázkůNika$30/měs. SuperGrok
Druhé místo a alternativy: Claude Fable 5 je druhý a správná volba, pokud kvalita znamená víc než volnost, Kimi K3 je volba pro beletrii a Claude Opus 5 je volba pro tvůrčí projekty, které se táhnou přes mnoho kol. Pro tvůrčí práci pro dospělé je Grok Imagine Spicy Mode stále jedinou možností na úrovni frontier.
Co se tento měsíc změnilo

Grok si tuto volbu drží, nově na Groku 4.7, který SpaceXAI vydala 21. září na novém a větším základním modelu. Na benevolenci produktu ani na jeho živém přístupu k X se nic nezměnilo, a právě na tom volba stojí. Model pod tím je zase silnější, 46,3 na Intelligence Indexu proti 44,3 u Groku 4.6, jenže ten přírůstek dopadl do programování a agentní práce, ne do prózy, a žádný žebříček kreativního psaní 4.7 neohodnotil. Jedna oprava proti minulému zápisu: Arena mezitím Grok 4.6 ohodnotila a je na 32. místě jejího žebříčku kreativního psaní, takže věta, že ho neohodnotil ani jeden žebříček, už neplatí. Všimněte si i rozdělené dostupnosti, protože pro tuto kategorii je podstatná: 4.7 je v API, v Cursoru a v Grok Buildu, zatímco aplikace Grok za $30 měsíčně, o kterou u benevolence vlastně jde, stále běží na 4.6. Claude Fable 5 zůstává modelem, po kterém sáhnout, když chcete lepší text.

Volba kategorie, září 2026

Nejlepší AI na přesnost & výzkum

1
Claude Fable 5.1
Nejvyšší faktická přesnost
2
Gemini 3.1 Pro
Nejlepší poměr, $0,52/úloha
3
GPT-5.6 Sol
Nové uvažování

Nejlepší AI na přesnost a rešerše je Claude Fable 5.1, který drží nejvyšší faktickou přesnost, jakou Artificial Analysis změřila, 67 % na AA-Omniscience. To je přesně ten sloupec, podle kterého se tato kategorie rozhoduje, a 22. září obstál v tvrdé zkoušce: Claude Opus 5.5 porazil Fable 5.1 skoro ve všem ostatním, včetně Humanity's Last Exam 61,4 % proti 59,1 % a indexu AA-Omniscience s penalizací halucinací 46,4 proti 43,5, ale v syrové faktické přesnosti má 66 % proti 67 % u Fable 5.1. Ten jednobodový rozdíl berte sám o sobě jako remízu a čtěte oba modely dohromady: Opus 5.5 je lepší volba, když je špatná odpověď horší než žádná, Fable 5.1 tehdy, když chcete co nejvíc faktů správně. Volbou pro nejlepší poměr je Gemini 3.1 Pro a stále je to model, po kterém sáhneme, když jde o cenu. Jeho nejsilnějším výsledkem je ARC-AGI-1 od ARC Prize, kde má 98 % a vyrovnává lidský panel, a to za $0,52 na úlohu, i když Claude Fable 5 a GPT-6 Astra mezitím panel překonaly s 98,5 %. K tomu přidává nativní ukotvení ve Vyhledávání Google, což je to, co chcete, když má být odpověď aktuální, ne jen věrohodná. Má také 94,1 % na GPQA Diamond, kde se mu GPT-5.6 Sol nově vyrovnává místo aby zaostával, a 44,4 % na Humanity's Last Exam, a 46,44 na žebříčku HLE od Scale SEAL, který nyní vede Claude Fable 5 s 55,5 %. Dvě poctivé výhrady. Konkrétně u ukotveného vyhledávání vede žebříček vyhledávání Areny OpenAI, ne Google ani Anthropic: GPT-5.6 Sol je v čele s 1257, Claude Fable 5 pátý a Gemini 3.1 Pro s ukotvením devátý. A u nového uvažování sedí koruna úplně jinde, protože GPT-6 Astra vede ARC-AGI-2 i ARC-AGI-3. Tuto korunu jsme nepřesunuli na Claude Opus 5, protože Artificial Analysis mu měří míru halucinací 50 % a na AA-Omniscience ho staví výrazně pod oba modely Fable.

ModelNejlepší proKlíčový benchmarkSlabinaCena
Claude Fable 5.1Nejvyšší naměřená faktická přesnost67 % faktické přesnosti na AA-Omniscience, nejvíc, co kdy Artificial Analysis změřila, o bod nad Claude Opus 5.5Žádná levná varianta; na žebříčku vyhledávání Areny nehodnocen; Opus 5.5 vede Humanity's Last Exam i index AA-Omniscience$10 / $50
Gemini 3.1 ProNejlepší poměr, levná faktická práce98 % ARC-AGI-1 (vyrovnává lidský panel) za $0.52/úlohu, 94,1 % GPQA (vyrovnáno Sol)ARC-AGI-2 77,1 % nyní ~14.; #9 na Arena vyhledávání$2.00-$4.00 / $12.00-$18.00 (odstupňováno)
Claude Fable 5Ukotvené vyhledávání#5 na žebříčku vyhledávání Areny, za GPT-5.6 SolŽádná jediná levná úroveň$10 / $50 (Fable 5)
GPT-5.6 SolNové uvažování#3 ARC-AGI-2 se skóre 92,5 %, za GPT-6 Astra (95 %) a Claude Opus 5.5 (93,3 %)Scheming označen METR$4 / $20
Claude Opus 5Nejtěžší neviděné problémy#1 ARC-AGI-3 se skóre 30 %, ~3,75násobek dalšího modelu (ARC Prize)Artificial Analysis měří míru halucinací 50 %$5 / $25
Qwen 3.7 MaxFrontier přesnost za výhodnou cenu92,4 GPQA Diamond, 200 dotazů zdarma/denJen API, žádné chatovací rozhraní$1.25 / $3.75 promo; $2.50 / $7.50 ceníková
Claude Opus 4.6Poctivost pod tlakem#1 na žebříčku MASK od Scale SEAL se skóre 96,28; Anthropic drží top 5Nahrazen jako vlajkový modelStarší model Anthropicu
Druhé místo a alternativy: Gemini 3.1 Pro je druhý a volbou s nejlepším poměrem za $0,52 na úlohu s ukotvením ve Vyhledávání Google, GPT-5.6 Sol je druhý pro nové uvažování, Claude Opus 4.6 vede žebříček poctivosti pod tlakem a Qwen 3.7 Max je hodnotnou volbou na špici.
Co se tento měsíc změnilo

Koruna za přesnost zůstává Claude Fable 5.1 a prošla tvrdou zkouškou. Claude Opus 5.5 dorazil 22. září a sebral Humanity's Last Exam s 61,4 % proti 59,1 % a index AA-Omniscience s penalizací halucinací se 46,4 proti 43,5, jenže tato kategorie se rozhoduje podle sloupce syrové faktické přesnosti a tam má Fable 5.1 stále 67 % proti 66 % u Opusu 5.5. To je jednobodový rozdíl, takže blok teď rovnou říká, že se ti dva dělí, místo aby předstíral, že Fable 5.1 vyhrává na celé čáře: Opus 5.5 použijte, když je špatná odpověď horší než žádná, Fable 5.1 tehdy, když chcete co nejvíc faktů správně. A ještě dvě opravy proti minulému zápisu. Stálo tam, že ARC-AGI-2 vede GPT-5.6 Sol a ARC-AGI-3 Claude Opus 5; oba vede od svého uvedení 3. září GPT-6 Astra, jak už blok o řešení problémů uváděl, a ten rozpor je pryč. A ARC-AGI-1 se posunul nad lidský panel: Claude Fable 5 i GPT-6 Astra mají 98,5 %, kde panel z roku 2025 má 98 %, takže 98 % u Gemini 3.1 Pro za $0,52 na úlohu je stále pravda a stále je to argument o ceně, ale už to není čelo toho žebříčku. Druhým posunem v přesnosti je tento měsíc GPT-6 Sol, a to pod korunou: Artificial Analysis mu měří míru halucinací 60 % proti 92 % u GPT-5.6 Sol, přičemž holá faktická přesnost klesá z 59 % na 55 %, což jeho index AA-Omniscience zvedá z 22,0 na 27,1.

Volba kategorie, září 2026

Nejlepší AI na řešení problémů

1
GPT-6 Astra
Lídr v uvažování
2
Claude Opus 5
Agentické řetězce
3
GPT-5.6 Sol
Cenově výhodný STEM model

Nejlepší AI na těžké řešení problémů je GPT-6 Astra, která sebrala žebříčky uvažování GPT-5.6 Sol během několika dní od startu. Vede LiveBench Reasoning se skóre 92,65 a ARC-AGI-2 s 95 %, nejvíc, co kdo proti stoprocentnímu lidskému panelu tohoto žebříčku zvládl, a na LiveBench Mathematics je třetí se skóre 96,81 za 97,08 u Claude Opus 5.5 a 97,01 u Claude Fable 5.1. Uvádí také 97,6 % na FrontierMath Tier 4 v2, číslo, které je třeba brát spolu s informací Epoch AI, že OpenAI benchmark financovala a k části z něj má výhradní přístup. Háček je v ceně a dosahu: $10 / $50 za 1M tokenů proti $4 / $20 u Sol a vyžaduje placený tarif ChatGPT. GPT-5.6 Sol je cenově výhodnou alternativou, na obou žebříčcích LiveBench třetí se skóre 96,20 a 91,65 a na ARC-AGI-2 třetí, od chvíle, kdy Claude Opus 5.5 dosáhl 93,3 %. GPT-6 Sol stojí polovinu, $2 / $10, a na indexu Artificial Analysis ho předčí, jenže žádný žebříček uvažování ho zatím neohodnotil. Qwen 3.7 Max je rozpočtovou volbou pro soutěžní úlohy se skóre 97,1 na únorovém indexu HMMT 2026 a 44,5 na Apexu, s 200 bezplatnými dotazy denně. Claude Opus 5 zůstává alternativou pro dlouhé agentické řetězce uvažování, i když mu Astra sebrala i ARC-AGI-3.

ModelNejlepší proKlíčový benchmarkSlabinaCena
GPT-6 AstraNejtěžší matematika, věda a uvažování#1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3Vyžaduje placený tarif ChatGPT; 2,5x cena Sol$10 / $50
Claude Opus 5Dlouhé agentické řetězce uvažování#2 AA-Briefcase (1673) a #2 GDPval-AA v2.1 (1708); 30,2 % ARC-AGI-3ARC-AGI-3 nyní vede Astra; 50% míra halucinací$5 / $25
GPT-5.6 SolCenově výhodný STEM model#3 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) a Reasoning (91,65)FrontierMath stále nezveřejněn; METR označil manipulaci$100/měs. ChatGPT Pro; API $4 / $20
GPT-6 SolTáž úroveň za poloviční cenuIntelligence Index 47,5 (v4.3.2) proti 47,0 u GPT-5.6 Sol, za $1,06 na úlohu indexu proti $1,99Nehodnotil ho ani LiveBench, ani ARC Prize, takže tu nedrží žádný žebříček$2 / $10
Qwen 3.7 MaxSoutěžní matematika na rozpočet97,1 HMMT 2026 únor, 44,5 Apex, 200 dotazů zdarma/denJen API$1.25 / $3.75 promo; $2.50 / $7.50 ceníková
Claude Fable 5Matematika uvnitř programátorského workflow#1 na matematické podkategorii Areny (1543), 96,0 LiveBench MathematicsNejdražší volba zde$10 / $50
GLM 5.3 FlashOpen-weight řešení problémůIntelligence Index 41,8 pod MIT, o téměř osm bodů více než GLM-5.2 při méně než poloviční velikosti; 320B/18B aktivních, 1M kontextPotřebuje multi-GPU server, ne pracovní stanici; GLM 5.3 skóruje výš podle vlastních čísel Z.ai a od 28. srpna jej lze stáhnout, ale ve více než dvojnásobné velikosti a pod vlastní licencíOpen weights (MIT)
Druhé místo a alternativy: GPT-5.6 Sol je druhý a cenově výhodná volba za $4 / $20, Claude Opus 5 je přirozená volba pro dlouhé řetězce agentického uvažování, Qwen 3.7 Max je rozpočtová volba a GLM 5.3 Flash je open-weight volba. Náš samostatný průvodce nejlepší AI na matematiku rozebírá rozdělení podle úloh i bezplatné možnosti.
Co se tento měsíc změnilo

Koruna za řešení problémů přešla na GPT-6 Astra, která během několika dní od startu 3. září sebrala žebříčky, podle nichž se tato kategorie rozhoduje. Vede LiveBench Reasoning se skóre 92,65 proti 91,65 u GPT-5.6 Sol, bere ARC-AGI-2 s 95 % proti 92,5 % u Sol a vytlačila Claude Opus 5 z ARC-AGI-3, kde jejích 62,7 % na standardním harnessu překonává 30,2 % u Opus 5. Čísla z ARC-AGI-3 čtěte pozorně: tento žebříček měří efektivitu akcí na úrovni člověka v neznámých prostředích, nikoli počet vyřešených úloh, a široce citovaných 98,6 % pochází z harnessu s adaptérem poskytovatele, ne ze standardního. Sol klesl na obou žebříčcích LiveBench na třetí místo, ale zůstává cenově výhodnou alternativou za $4 / $20 proti $10 / $50 u Astry, a LiveBench Mathematics mezitím dvakrát změnil držitele, na Claude Fable 5.1 se skóre 97,01 a 22. září na Claude Opus 5.5 se skóre 97,08. Potom se pohnuly dvě věci. ARC Prize ohodnotila Claude Opus 5.5 na 93,3 % na ARC-AGI-2, což posouvá GPT-5.6 Sol na tomto žebříčku na třetí místo, a 22. září dorazil GPT-6 Sol za $2 / $10, tedy polovinu ceny úrovně 5.6, s vyšším Intelligence Indexem, ale zatím bez vlastního skóre na LiveBenchi či u ARC Prize.

Volba kategorie, září 2026

Nejlepší AI agent

1
Gemini Spark
Žije v cloudu
2
Claude Cowork
Žije na počítači
3
ChatGPT Codex
Programátorský agent

Nejlepší AI agent je Gemini Spark, pokud chcete agenta v cloudu, a Claude Cowork, pokud ho chcete na svém počítači. Jde o společné volby, nikoli o první a druhé místo: Spark běží ve virtuálním stroji Google Cloud, takže pracuje dál i se zavřeným notebookem, a je propojený s Gmailem, Dokumenty a od začátku září i s Fotkami Google; Cowork běží na vašem Macu nebo Windows a ovládá vaše místní aplikace i obrazovku. Žádný nezávislý žebříček tyto dva produkty proti sobě neměří, takže rozhodující je, kde má práce probíhat, ne kdo má vyšší skóre. Ani cena už jazýčkem na vahách není: Spark je nyní dostupný na tarifu Google AI Pro za $19.99/měsíc v USA a ve více než 160 dalších zemích a Cowork je bez příplatku součástí každého placeného tarifu Claude od $20/měsíc. ChatGPT Codex Mobile (14. května) je alternativou pro práci s programovacím agentem a prohlížečoví agenti třídy OpenAI Operator pro webové úlohy. Přečtěte si celé srovnání Gemini Spark vs Claude Cowork.

AgentNejlepší proKde běžíSilná stránkaCena
Gemini Spark24/7 cloudové úlohy, workflow WorkspaceGoogle Cloud VM (vždy zapnuto)První skutečný agent 24/7, hluboká integrace WorkspaceOd $19.99/měs. Google AI Pro
Claude CoworkDesktop, řízení aplikací, design + kódVáš desktop Mac/WindowsŘídí lokální aplikace, vidí vaši obrazovku$20/měs. Claude Pro
ChatGPT Codex MobileProgramátorský agent v telefonuCloud OpenAI + iOS/AndroidSchvalování diffů a přesměrování práce z telefonuZahrnuto v plánech ChatGPT
Grok Agentic (Grok 4.7)Rešerše v reálném čase, sběr z XCloud SpaceXAINativní integrace X; Elo 1695 na GDPval-AA v2.1, čtvrtý mezi odlišnými modely$30 měsíčně SuperGrok, stále na 4.6
OpenAI třídy OperatorÚlohy v prohlížeči, webové formulářeCloud OpenAI + váš prohlížečWebová automatizaceChatGPT Pro
Druhé místo a alternativy: Gemini Spark a Claude Cowork jsou společné volby rozdělené podle toho, kde agent běží, nikoli první a druhé místo. ChatGPT Codex Mobile je volba pro programovací agenty a Grok Agentic je specializovaná volba pro výzkum v reálném čase. Google AI Ultra za $99.99 nebo $199.99 měsíčně dnes u Sparku kupuje vyšší limity využití, nikoli přístup, ten začíná na tarifu Pro za $19.99.
Co se tento měsíc změnilo

Žádný nový spotřebitelský agentní produkt nevyšel, takže se koruny nehýbou: Gemini Spark (cloud) a Claude Cowork (počítač) zůstávají společnými volbami rozdělenými podle toho, kde agent běží. Spark se přesto rozšířil, dostal se na tarif Google AI Pro za $19,99 měsíčně a získal Fotky Google, kde umí hledat, upravovat, kurátorovat a spouštět plánované pracovní postupy. Vrstva modelů pod tím se posunula hodně a většina posunu přišla 22. září. Claude Opus 5.5 nyní vede oba agentní žebříčky, které Artificial Analysis publikuje: AA-Briefcase v1.1 s 1822 proti 1678 u Claude Fable 5.1 a 1673 u Claude Opus 5 a GDPval-AA v2.1 s 1846 proti 1735 a 1708. Zároveň se vyrovnává GPT-6 Astra na Terminal-Bench 4.0 za $4 / $20 proti $10 / $50, což z něj dělá model, na kterém by dnes většina týmů měla stavět, místo doporučení Opusu 5, které tento blok nesl. Agent Arena od Areny ho neohodnotila a tam stále vede Claude Fable 5.1 s 19,8 % dokončených úloh, GPT-6 Astra je druhý se 17,7 %, DeepSeek V4.1-Flash třetí a Claude Opus 5 čtvrtý. Druhým hybatelem je Grok 4.7 od SpaceXAI (21. září): 1695 na GDPval-AA v2.1 a 1657 na AA-Briefcase ho staví na čtvrté a sedmé místo, v obou nad GPT-6 Astra, byť míří do API, Cursoru a Grok Buildu, ne do spotřebitelského agentního produktu. Muse Spark 1.3 od Mety je na GDPval-AA v2.1 pátý mezi odlišnými modely s 1674, tedy pod Grokem 4.7, ne nad ním, jak jsme uváděli minulý měsíc, a Scale SEAL stále ohodnotil jen starší 1.1, který vede jeho žebříček práce s nástroji MCP Atlas s 88,1. GLM 5.3 Flash (26. srpna, MIT) je stále otevřený agentní model, který bychom hostovali, s AutomationBench 48,8 na vlastním grafu Z.ai, kde Claude Opus 4.8 dosahuje 41,0; na signálu dokončení úloh v Agent Areně je GLM-5.2 sedmnáctý a Kimi K3 pátý, přičemž nejvýše postaveným otevřeným modelem je DeepSeek V4.1-Flash na třetím místě.

Fello AI běžící na Macu, iPhonu a iPadu
Všechny špičkové AI modely, jedna aplikace

Přední modely jako ChatGPT, Claude a Gemini pohromadě na Macu, iPhonu a iPadu.

Začněte zdarma, hodnocení 4,7★ napříč 27 000+ recenzemi.

Stáhnout Fello AI

Průvodce použitím, září 2026

Nejlepší AI pro studenty

1
GPT-5.6 Luna
Eseje & výzkum
2
Gemini 3.6 Flash
STEM + PDF
3
Claude Sonnet 5
Psaní & úpravy

Nejlepší AI pro studenty je GPT-5.6 Luna uvnitř ChatGPT pro obecnou práci na kurzech a Gemini 3.6 Flash uvnitř aplikace Gemini pro STEM a multimodální studium, s Qwen 3.7 Max jako API alternativou pro těžší sady úloh (200 dotazů zdarma denně) a Claude Opus 5 jako alternativou pro úpravy esejí. Většina studentů nemusí platit a bezplatný tarif se 6. srpna zlepšil: GPT-5.6 Luna se stal výchozím modelem pro ChatGPT Free a Go, s neomezenými textovými chaty a tlačítkem Think pro těžší otázky, i když nahrávání souborů a obrazové nástroje zůstávají omezené. 22. září OpenAI přidala uživatelům Free a Go GPT-6 Luna v desktopové aplikaci ChatGPT, tedy model aktuální generace na bezplatné úrovni už od prvního dne, i když na indexu Artificial Analysis má stejných 37,3 jako GPT-5.6 Luna. Gemini 3.6 Flash je stále to, co nabízí bezplatná aplikace Gemini, Claude Sonnet 5 je výchozí bezplatný Claude a DeepSeek V4 je zdarma na chatovacím webu DeepSeeku. Luna je nejlevnější, nikoli nejsilnější člen rodiny GPT-5.6, takže když esej vyžaduje větší péči, sáhněte po tlačítku Think nebo přepněte na GPT-5.5. Pro krok za krokem řešení nejtěžší matematiky je GPT-5.6 Sol placenou vlajkovou lodí OpenAI a GPT-6 Astra nyní uvádí 97,6 % na FrontierMath Tier 4 v2 proti ověřeným 39,6 % u GPT-5.5 Pro, i když Astra zatím není v bezplatném tarifu ChatGPT; Qwen 3.7 Max je hodnotnou alternativou s 97,1 na HMMT únor 2026 a API cenou $1,25 / $3,75 v současné 50% akci ($2,50 / $7,50 ceníkově).

ÚlohaNejlepší modelPročZdarma?Alternativa
Eseje & práce na kurzechGPT-5.6 LunaVýchozí zdarma v ChatGPT od 6. srpna; neomezené textové chaty a od 22. září i GPT-6 Luna v desktopové aplikaciAnoClaude Sonnet 5 (Claude zdarma)
Řešení STEM úlohGPT-5.6 Sol / Qwen 3.7 MaxPlacená STEM vlajková loď; Astra uvádí 97,6 % FrontierMath Tier 4 v2 / 97,1 HMMT únor 2026Pro placené / Qwen API placenéGemini 3.6 Flash (zdarma)
Výzkum & přesnostGemini 3.1 Pro98 % ARC-AGI-1 za $0.52/úlohu, nativní ukotvení ve vyhledávání GoogleAno (aplikace Gemini)Claude Opus 5
Úpravy textuClaude Sonnet 5Zdarma a výchozí na claude.ai; Claude Fable 5 je lídr kvalityAno (Claude zdarma)Claude Fable 5
Multimodální studium (PDF, snímky, obrázky)Gemini 3.6 Flash1M kontext, zdarma v aplikaci GeminiAnoNotebookLM (Google)
Druhé místo a alternativy: Claude Sonnet 5 (zdarma) je druhý pro psaní a úpravy esejí. Gemini 3.6 Flash (zdarma) je druhý pro multimodální studium a příjem PDF. DeepSeek V4 je druhý pro řešení problémů na přísně nulovém rozpočtu.
Co se tento měsíc změnilo

Bezplatný tarif je to, co se v tomto průvodci posunulo. OpenAI 6. srpna udělalo z GPT-5.6 Luna výchozí model pro ChatGPT Free a Go a oběma dalo neomezené textové chaty plus tlačítko Think pro těžší otázky, takže bezplatnou volbou je nyní Luna místo GPT-5.5, který zůstává volitelný, když esej vyžaduje větší péči. Nahrávání souborů, obrázky a další nástroje jsou stále omezené. Na straně Googlu se nic nezměnilo: Gemini 3.8 Flash vyšel 2. září, ale k bezplatným uživatelům se dostane jen přes AI Studio a API, takže bezplatná aplikace Gemini stále nabízí 3.6 Flash a ten si drží multimodální řádek. GPT-6 Astra (3. září) je ta, kterou u těžkých sad úloh sledovat, s uváděnými 97,6 % na FrontierMath Tier 4 v2 proti ověřeným 39,6 % u GPT-5.5 Pro, ale vyžaduje placený tarif ChatGPT a žádný bezplatný tarif ji nezahrnuje. Bezplatná úroveň se pohnula znovu 22. září: uživatelé Free a Go se nyní k GPT-6 Luna dostanou v desktopové aplikaci ChatGPT. Berte to spíš jako levnější než chytřejší, protože Artificial Analysis mu dává 37,3, stejně jako verzi 5.6, a ARC Prize je na ARC-AGI-2 odděluje o dvě desetiny bodu.

Průvodce použitím, září 2026

Nejlepší AI pro práci & profesionály

1
GPT-5.6
Každodenní znalostní práce
2
Claude Opus 5
Programování & psaní
3
Gemini 3.1 Pro
Výzkum & podklady

Nejlepší AI pro profesionální práci je GPT-5.6 (výchozí model ChatGPT od 9. července) pro každodenní znalostní práci, Claude Opus 5 pro programování a psaní s vysokou mírou odpovědnosti a Gemini Spark pro agentické workflow 24/7. Většina profesionálů vytěží nejvíc, když provozuje dvě placená předplatná (ChatGPT Plus za $20/měsíc plus Claude Pro za $20/měsíc, celkem $40/měsíc), nebo konsoliduje s Fello AI za $9.99/měsíc pro všech pět top modelů v jedné aplikaci pro Mac/iOS. Pro agentickou práci, která běží, když spíte, je Gemini Spark jediným skutečným cloudovým agentem 24/7 a od 30. července je dostupný nejen na Google AI Ultra, ale i na tarifu Google AI Pro za $19.99/měsíc.

Případ použitíNejlepší modelKlíčový údajCenaAlternativa
Každodenní znalostní práceGPT-5.6Výchozí model ChatGPT od 9. července; asistent, kterého většina otevře$20/měs. ChatGPT PlusClaude Opus 5
ChatGPT Work a CodexGPT-6 SolV ChatGPT Work a Codexu pro Plus, Pro, Business, Enterprise a Edu od 22. září, v API za $2 / $10$20/měs. ChatGPT PlusGPT-6 Luna na objemovou práci
Programování (uzavřené modely)Claude Opus 5.5#1 Terminal-Bench 4.0 (59,6 %) a #1 na obou programátorských žebříčcích LiveBench, za $4 / $20$20 měsíčně Claude ProGPT-6 Astra, který si drží oba programátorské žebříčky Areny
Programování (cenově výhodné)Qwen3.8-Max-0902#5 Code Arena: WebDev (1662), za GPT-6 Astra, Claude Fable 5.1, Claude Opus 5 a starším Qwen3.8-Max; jen API na QwenCloud$2 / $6Qwen 3.7 Max; DeepSeek V4.1-Flash
Výzkum & podkladyGemini 3.1 Pro98 % ARC-AGI-1 za $0.52/úlohu, ukotvení GoogleGoogle AI Pro / UltraClaude Opus 5
Těžká matematika, fyzika, finanční modelováníGPT-6 Astra#1 LiveBench Reasoning a ARC-AGI-2 (95 %); uvádí 97,6 % FrontierMath Tier 4 v2$100/měs ChatGPT ProGPT-5.6 Sol; Qwen 3.7 Max
Nepřetržité agentické workflowGemini SparkPrvní cloudový agent 24/7Od $19.99/měs. Google AI ProClaude Cowork
Živé zprávy, tvůrčí práce s kontextem XGrok 4.7Intelligence Index 46,3 + nativní ukotvení v X; aplikace Grok stále běží na 4.6$30 měsíčně SuperGrokGemini 3.1 Pro
Konsolidace vše v jednomFello AIChatGPT + Claude + Gemini + Grok + DeepSeek$9.99/měs.Platit každému dodavateli zvlášť
Druhé místo a alternativy: pro většinu profesionálních týmů je Claude Opus 5.5 druhý za GPT-5.6 pro běžnou práci a zároveň lídr v programování na každém harnessu za $4 / $20, přičemž na programátorských žebříčcích založených na lidských hlasech je druhý GPT-6 Astra. Gemini 3.1 Pro je druhou volbou pro role s velkým podílem rešerší a Gemini Spark je jedinečná volba, pokud dokážete pustit cloudového agenta na dlouhé úkoly.
Co se tento měsíc změnilo

Tři uvedení přišla v prvních třech zářijových dnech a čtvrté 22. září, a právě to poslední mění cenový argument, na kterém tento blok stojí. Claude Opus 5.5 vede Intelligence Index od Artificial Analysis s 57,6 na v4.3.2 i oba její agentní žebříčky, a dělá to za $4 / $20 proti $5 / $25 u Claude Opus 5. Úvaha, kterou tento blok nesl, tedy že týmy mají začínat u Opusu 5, protože stojí polovinu toho co lepší modely, už neplatí: Opus 5.5 je zároveň lepší i levnější, takže přebírá řádek pro programování v uzavřených modelech a je to model, na kterém bychom stavěli běžnou práci. Řádek denního asistenta si přesto drží GPT-5.6, protože ten je o dosahu, ne o skóre, a ani Opus 5.5, ani GPT-6 Astra nejsou výchozí volbou pro stovky milionů lidí. Qwen3.8-Max-0902 od Alibaby (2. září) si drží řádek cenově efektivního programování za $2 / $6, i když je jen v API na QwenCloud bez spotřebitelského rozhraní. GPT-6 Sol a GPT-6 Luna dorazily 22. září přesně do prostředí, o kterém je tento blok: do ChatGPT Work a Codexu, pro Plus, Pro, Business, Enterprise a Edu, v API za $2 / $10 a $0,10 / $0,50, a ne do běžného chatovacího okna.

Srovnání cen

Ceny AI modelů v září 2026

Od bezplatných verzí za $0 po Google AI Ultra za $199,99 měsíčně. Nejzásadnější cenou v této tabulce je Claude Opus 5.5 za $4 / $20, protože Anthropic 22. září vydal nejlépe hodnocený model, jaký kterýkoli nezávislý hodnotitel změřil, za nižší ceníkovou cenu než model, který nahrazuje: Claude Opus 5 stojí $5 / $25 a čtení z cache klesá o 60 % na $0,20, přičemž podle vlastního údaje Anthropicu je běžná zátěž o 40 % levnější než na Opusu 5. To obrací tvar, který tato sekce měla celý rok, kdy byl nejlepší model zároveň nejdražší. Claude Fable 5.1 i GPT-6 Astra jsou v ceníku za $10 / $50 a oba mají nyní nižší skóre. Muse Spark 1.3 od Mety stojí $1,25 / $4,25 beze změny napříč třemi posuny schopností od července, s tarifem Contributor za $0,10 / $0,20 pro každého, kdo nechá Metu trénovat na svých promptech, a Grok 4.6 i Grok 4.7 stojí $2 / $6 s výhradou, že prompt od 200 000 tokenů přeúčtuje celý požadavek na $4 / $12. Grok 4.7 je na této stránce nejčistším případem ceny, která se nepohnula, zatímco náklady ano: tokeny stojí stejně a úloha Intelligence Indexu stojí $2,73 proti $1,86 u Groku 4.6, protože 4.7 k výsledku vypíše zhruba dvojnásobek výstupu. Levný konec se pohnul dvakrát. DeepSeek 16. srpna zvedl oba modely V4 zhruba čtyřnásobně, což stálo V4-Flash volbu pro poměr cena/výkon, a 10. září to z velké části zvrátil: V4-Flash byl stažen a jeho místo zaujal V4.1-Flash za $0,15 / $0,60 mimo špičku a $0,30 / $1,20 ve špičce. Mezi modely, které koupíte po tokenech, zůstává volbou GLM 5.3 Flash, nyní za prostý ceník $0,15 / $0,50 od vypršení zaváděcí akce 9. září, protože Artificial Analysis ho měří na $0,25 na úlohu Intelligence Indexu při skóre 41,8 proti $0,27 u DeepSeeku při 39,5. Mimo špičku jsou oba na vstupu na stejné úrovni a GLM je levnější na výstupu; ve špičce GLM vyhrává v obojím. Jeden otevřený model je poráží oba v ceně na úlohu a je čtyři dny starý: MiMo-V2.6-Pro od Xiaomi zvládne úlohu indexu za $0,13 při skóre 46,3 pod čistou licencí MIT, jenže si k tomu musíte uhostit 1,02 bilionu parametrů. Na špičce je volbou pro poměr Muse Spark 1.3 od Mety, za $1,60 na úlohu indexu při 48,1. Mezi uzavřenými modely tento titul 22. září převzala GPT-6 Luna, za $0,10 / $0,50 po tokenech a $0,07 na úlohu indexu, což je nejlevnější cena za úlohu na celé této stránce; stejně klesl i GPT-6 Sol, ze $4 / $20 na $2 / $10, čímž se trefil přesně do sazby Claude Sonnet 5, a OpenAI říká, že obě snížení jsou trvalá, ne promoakce. Podrobnější rozbor najdete v našem průvodci porovnáním cen AI.

ModelVstup (za 1M)Výstup (za 1M)KontextPřístup zdarma?
GPT-6 Astra$10.00$50.001 050 000 (max. vstup 922 000)V Chatu na Pro, Business a Enterprise od 4. září; Plus ho má v ChatGPT Work a Codexu, ne v Chatu; bez bezplatného tarifu; v API živě
GPT-6 Sol$2.00$10.001 050 000 (max. vstup 922 000)ChatGPT Work a Codex na Plus, Pro, Business, Enterprise a Edu od 22. září; API; ne v Chatu
GPT-6 Luna$0.10$0.501 050 000 (max. vstup 922 000)Free a Go v desktopové aplikaci ChatGPT; ChatGPT Work a Codex na placených tarifech; API; ne v Chatu
GPT-5.5$5.00$30.001M (400K v Codex)ChatGPT Free; API placené
GPT-5.5 Pro$30.00$180.001MChatGPT Pro od $100/měs. (úroveň s vyšším použitím $200)
GPT-5.6 Sol$4.00$20.00NezveřejněnoŽivé v ChatGPT, Codex & API (9. července); promo sazba minimálně do 21. listopadu 2026
GPT-5.6 Terra$2.00$12.00NezveřejněnoŽivé v ChatGPT, Codex & API (9. července)
GPT-5.6 Luna$0.20$1.20NezveřejněnoŽivé v ChatGPT, Codex & API (9. července)
Claude Opus 5.5$4.00$20.001MClaude Pro/Max/Team; API placené; čtení z cache $0,20
Claude Opus 5$5.00$25.001MVýchozí v Claude Pro/Max; API placené
Claude Opus 4.8$5.00$25.001MStarší model u Anthropicu; Pro/Max/API
Claude Fable 5.1$10.00$50.001MČtení z cache $0.25; v Max/Team Premium (~50 % limitů použití); Pro/Team Standard přes kredity. Mythos 5.1 se účtuje stejně, jen na pozvání
Claude Fable 5$10.00$50.001MTrvale v Max/Team Premium (~50 % limitů použití); Pro/Team Standard přes kredity
Claude Sonnet 5$2.00$10.001MVýchozí v Claude Free & Pro; API placené
Claude Sonnet 4.6$3.00$15.001MAPI placené (nahrazeno Sonnet 5)
Gemini 3.1 Pro$2.00 (≤200K) / $4.00 (>200K)$12.00 (≤200K) / $18.00 (>200K)1MOmezená aplikace Gemini; API placené
Gemini 3.8 Flash$0.75 úvodní / $1.50 od 1. 1. 2027$3.75 úvodní / $7.50 od 1. 1. 20271MAI Studio, Antigravity, Gemini Enterprise + placené API; v aplikaci Gemini hlášeno pro AI Pro/Ultra
Gemini 3.7 Flash$0.75 úvodní / $1.50 od 1. 1. 2027$3.75 úvodní / $7.50 od 1. 1. 20271MAI Studio, Android Studio, Antigravity + placené API; v aplikaci Gemini jen přes Spark (AI Pro/Ultra, mimo EHP/UK/CH/Nigérii)
Gemini 3.6 Flash$0.75 úvodní / $1.50 od 1. 1. 2027$3.75 úvodní / $7.50 od 1. 1. 20271MVýchozí model bezplatné aplikace Gemini; AI Studio; bezplatná úroveň API + placené API
Gemini 3.5 Flash-Lite$0.30$2.501MAI Studio; bezplatná úroveň API + placené API
Qwen3.8-Max-0902$2.00 ($0.17 explicitní cache hit, $0.25 implicitní)$6.001M (výstup 128K)Pouze API na QwenCloud; bez spotřebitelského chatu, bez otevřených vah
Qwen 3.7 Max$1.25 promo / $2.50 ceníková$3.75 promo / $7.50 ceníková1M200 dotazů zdarma/den; API placené nad rámec
MiniMax M3$0.30 (50 % z $0.60)$1.20 (≤512K)1MOpen weights; náklady na hosting
LongCat-2.0Závisí na poskytovateliZávisí na poskytovateli1MOpen weights (MIT); náklady na hosting
NVIDIA Nemotron 3 UltraZávisí na poskytovateliZávisí na poskytovateli1MOpen weights (OpenMDW); náklady na hosting
Qwen 3.5 (open-weight)Self-host / TogetherSelf-host / Together1MOpen weights; náklady na hosting
Nex-N2-ProSelf-host / poskytovateléSelf-host / poskytovatelé1MOpen weights (Apache 2.0); náklady na hosting
Rio 3.5 Open 397BSelf-host / poskytovateléSelf-host / poskytovatelé1MOpen weights (MIT); náklady na hosting
Grok 4.3$1.25$2.501MBezplatný spotřebitelský plán; API placené
Grok 4.6$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare
Grok 4.7$2.00 (<200K) / $4.00 (≥200K)$6.00 (<200K) / $12.00 (≥200K)500KAPI SpaceXAI, Cursor, Grok Build, harnessy a cloudové routery; ne v aplikaci Grok
Muse Spark 1.3$1.25 ($0.10 úroveň Contributor)$4.25 ($0.20 úroveň Contributor)1MPlacené API; Muse Code, Meta Model API a OpenRouter; úroveň Contributor mění práva k trénování za ~92% slevu
Kimi K3$3.00 ($0.30 cache-hit)$15.001MBezplatná základní úroveň v aplikaci Kimi; open weights na Hugging Face (Kimi K3 License)
Gemini Omni Flash (video)$1.50$17.50 (video výstup)10sekundové klipyAplikace Gemini / Flow; AI Studio + API
DeepSeek V4-Pro$0.66 mimo špičku / $1.32 ve špičce ($0.022 cache-hit mimo špičku)$1.98 mimo špičku / $3.96 ve špičce1MDeepSeek Chat zdarma; API placené, špičkové a mimošpičkové sazby od 16. srpna
DeepSeek V4.1-Flash$0.15 mimo špičku / $0.30 ve špičce ($0.003 cache hit mimo špičku)$0.60 mimo špičku / $1.20 ve špičce1MDeepSeek Chat zdarma; API placené, tarify mimo špičku a ve špičce; nahradil V4-Flash 10. září
Kimi K2.7 CodeZávisí na poskytovateliZávisí na poskytovateli256KOpen weights; náklady na hosting
GLM-5.2Závisí na poskytovateliZávisí na poskytovateli1MOpen weights; náklady na hosting
GLM 5.3$1.40 ($0.26 cache-hit)$4.401MZ.ai API, GLM Coding Plan a ZCode; váhy na Hugging Face od 28. srpna pod vlastní licencí GLM 5.3 License
GLM 5.3 Flash$0.15 ($0.03 cache-hit); $0.075 v akci$0.50; $0.25 v akci1MZ.ai API, GLM Coding Plan, OpenRouter; váhy pod MIT na Hugging Face; akce končí 9. září
Tencent Hy4 Preview$0.834 ($0.042 cache-hit)$2.5011M+Otevřené váhy (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy
Qwen3.8-Flash-NextPodle poskytovatelePodle poskytovatele262K (do 1M)Otevřené váhy (Qwen Community License 1.0); náklady na hosting se připočítávají
MiMo-V2.6-Pro$0.435$0.871MOtevřené váhy (MIT); náklady na hosting se platí
ERNIE 5.1Ceny pro region ČínaCeny pro region Čína256KBezplatná úroveň Baidu
Gemini Spark (agent)Bez ceny APIBez ceny API1M (základ Gemini)Google AI Pro $19.99, AI Ultra $99.99 nebo $199.99/měs.
Fello AI (agregátor)Směrováno přes aplikaciSměrováno přes aplikaciZávisí na modelu$9.99/měs., bezplatná verze dostupná

Výše uvedené sazby pro GPT-5.5 a GPT-5.5 Pro jsou ceny pro krátký kontext; OpenAI již specifické údaje pro dlouhý kontext nezveřejňuje. Úrovně GPT-5.6 se účtují za 2násobek vstupu a 1,5násobek výstupu, jakmile prompt přesáhne 272K vstupních tokenů, což dává long-context Terra na $4 / $18 a Luna na $0.40 / $1.80. U řady GPT-6 OpenAI žádnou přirážku za dlouhý kontext nezveřejňuje a čtení z cache je u nich o 90 % levnější: $1.00 u Astry, $0.20 u Solu a $0.01 u Luny. Grok 4.6 funguje stejně, ale tvrději: od 200 000 tokenů v promptu výše přeúčtuje SpaceXAI celý požadavek vyšší sazbou, nikoli jen to, co limit přesahuje, takže překročení o tisíc tokenů zdvojnásobí cenu celého volání. Druhým ceníkem, který je třeba číst dvakrát, je DeepSeek: od 16. srpna se oba modely V4 účtují špičkovou sazbou od 01:00 do 04:00 a od 06:00 do 10:00 UTC ve všední dny a přesně poloviční v každou jinou hodinu, takže stejná úloha může stát dvojnásobek podle toho, kdy ji spustíte. Pokud chcete přístup k více AI modelům bez správy samostatných předplatných, Fello AI poskytuje GPT, Claude, Gemini, Grok, Perplexity a další v jediné aplikaci pro Mac, iPhone a iPad od $9.99/měsíc.

Open-weight modely

Nejlepší open-weight modely v září 2026

Nejlepší model s otevřenými vahami v září 2026 je MiMo-V2.6-Pro, který Xiaomi zveřejnilo 21. září pod čistou licencí MIT: 1,02 bilionu parametrů se 42 miliardami aktivních, kontext 1M tokenů a váhy na Hugging Face tentýž den. Artificial Analysis ho měří na 46,3 na Intelligence Index v4.3.2, což je nejvyšší otevřené skóre, jaké kdy zveřejnila, nad GLM-5.3 se 44,8 a Kimi K3 se 43,6, a dělá to za $0,13 na úlohu Intelligence Indexu, levněji než kterýkoli jiný otevřený model na této stránce. Bere také 34,8 % na Terminal-Bench 4.0 a 1673 na GDPval-AA v2.1, čímž je v obou nad Kimi K3. Dvě poctivá omezení: neohodnotil ho žádný žebříček Areny, takže pro něj neexistuje vůbec žádný doklad lidských preferencí, a byl zveřejněn před čtyřmi dny, takže nemá nezávislou historii. Nejvýše postaveným otevřeným modelem na Areně je stále Kimi K3, sedmý na WebDev s 1658 a pátý na signálu dokončení úloh v Agent Areně, a GLM-5.3 je stále nejsilnějším otevřeným modelem na Terminal-Bench 4.0 od Artificial Analysis se 41,9 % proti 34,8 % u MiMo, ovšem pod vlastní licencí Z.ai, ne MIT. Praktickým doporučením pro týmy, které si provozují vlastní váhy, zůstává GLM 5.3 Flash (Z.ai, MIT), vydaný 26. srpna se skóre 41,8 na v4.3.2, 320 mld. celkem a 18 mld. aktivních, protože model s 1,02 bilionu parametrů není nic pro pracovní stanici a stažení K3 znamená 96 shardů safetensors a zhruba 1,56 TB. Levná otevřená vrstva se znovu změnila 10. září: DeepSeek stáhl V4-Flash 0731 a nahradil ho modelem DeepSeek-V4.1-Flash, 552 mld. s 8 mld. aktivními při prefillu a 16 mld. při dekódování, nativně multimodálním, pod MIT hned první den, se skóre 39,5 na v4.3.2 proti 34,3 u sestavení, které nahrazuje, a s cenou sraženou zpět na $0,15 / $0,60 mimo špičku. Je také třetí na signálu dokončení úloh v Agent Areně, nejvýše ze všech otevřených modelů. Ze tří vydání, která uzavřela srpen, GLM 5.3 zveřejnil váhy 28. srpna pod vlastní licencí s klauzulí, podle níž musí každý provozovatel model-as-a-service s tržbami nad 10 miliard dolarů nejprve projít bezpečnostní kontrolou Z.ai; Qwen3.8-Flash-Next od Alibaby, směs expertů se 125 mld. parametrů a jen 6 mld. aktivními, která předvádí architekturu Qwen4, má skóre 39,8 a je devátý na žebříčku WebDev Areny; a Hy4 Preview od Tencentu, 770 mld. celkem a 49 mld. aktivních pod Apache 2.0, nemá hodnocení od Artificial Analysis, ale je jedenáctý na Arena WebDev s 1624. Pozor také na to, že GLM 5.3 Flash není osekaný GLM 5.3, ale samostatný model na nově natrénovaném základu, a právě proto mohl vyjít pod čistou licencí MIT, zatímco vlajková loď ne.

ModelNejlepší proKlíčový benchmarkKontext / LicenceKde spustit
MiMo-V2.6-ProNejvyšší otevřený Intelligence Index, jaký byl změřenII 46,3 (v4.3.2), nad GLM-5.3 i Kimi K3, za $0,13 na úlohu indexu; 34,8 % Terminal-Bench 4.0; GDPval-AA v2.1 1673; 1,02 bilionu/42 mld. aktivních1M / MITHugging Face (XiaomiMiMo), poskytovatelé, vlastní hosting
Kimi K3Nejvýše postavený otevřený model na AreněII 43,6 (v4.3.2); #5 Arena WebDev, nejlepší umístění otevřeného modelu; #5 Agent Arena; 2.8T/104B aktivních1M / Kimi K3 LicenseHugging Face (96 shardů, 1.56 TB), Moonshot API, poskytovatelé
GLM 5.3 FlashNejlepší otevřený model, který si většina týmů skutečně dokáže provozovatII 41,8 (v4.3.2), na Paretově hranici poměru inteligence a ceny, zhruba $0.25 za úlohu indexu; 320B/18B aktivních, nativně multimodální1M / MITHugging Face, Z.ai API ($0.15/$0.50), OpenRouter
GLM-5.2Záložní volba s nezávislým záznamemII 33,7 (v4.3.2); #19 Arena WebDev (1,591.8), #17 Agent Arena; 744B/40B aktivních1M / MITZ.ai, Hugging Face, OpenRouter
GLM 5.3Otevřený od 28. srpna, ale pod vlastní licencíII 44,8 (v4.3.2), nejvyšší otevřené skóre, které jsme našli; stejný základ 744B jako GLM-5.2, jen dotrénovaný, zveřejněný checkpoint počítán na 753B; CyberGym 84,5 % a Terminal-Bench 3.0 28,3 (údaje dodavatele)1M / GLM 5.3 License (model-as-a-service nad 10 mld. USD tržeb potřebuje bezpečnostní revizi Z.ai)Hugging Face, Z.ai API ($1.40/$4.40), GLM Coding Plan, ZCode
DeepSeek V4.1-FlashNejlepší otevřená hodnota, pokud si jej hostíte samiII 39,5 (v4.3.2) proti 34,3 u nahrazované verze V4-Flash 0731; 552B, 8B aktivních při prefillu a 16B při dekódování1M / MITDeepSeek API ($0.15/$0.60 mimo špičku, $0.30/$1.20 ve špičce od 10. září), lokálně
Tencent Hy4 PreviewZatím největší permisivně licencovaný model770B/49B aktivních; 2,99/4,00 na vlastním panelu Tencentu se 203 úlohami proti 2,94 u Kimi K3 a 2,92 u GLM 5.3 (dodavatel); bez hodnocení Artificial Analysis; #11 Arena WebDev (1624)1M+ / Apache 2.0Hugging Face (BF16 a FP8), Tencent Cloud TokenHub, OpenRouter
Qwen3.8-Flash-NextUkázka architektury Qwen4125B celkem plus N-gramové embedding s 51B, 6B aktivních; 91,7 GPQA Diamond a 62,5 SWE-Bench Pro (dodavatel); II 39,8 (v4.3.2); #9 Arena WebDev (1635)262K až 1M / Qwen Community License 1.0Hugging Face, poskytovatelé, self-host
LongCat-2.0Frontier otevřený kodér trénovaný na čínských čipechII 33 (v4.1); 59,5 % SWE-Bench Pro (dodavatel), 1.6T/~48B aktivních1M / MITHugging Face, GitHub, OpenRouter
MiniMax M3Levný multimodální model třídy frontierII 44 (v4.1), 59 % SWE-Bench Pro, multimodální1M / licence TBDHugging Face, API $0.30/1M (50 % sleva)
Nex-N2-ProNejsilnější otevřené programátorské skóreII 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktivníchZaloženo na Qwen / Apache 2.0Hugging Face, poskytovatelé, self-host
Kimi K2.7 CodeNejsilnější komerčně licencovaný otevřený kodér+21,8 % na Kimi Code Bench v2 vs. K2.6 (dodavatel); 1T/32B aktivních256K / Modified MITHugging Face, DeepInfra, poskytovatelé
DeepSeek V4-ProAgentická práce v reálném světěII 44 (v4.1), 1.6T/49B aktivních1M / MITDeepSeek API ($0.66/$1.98 mimo špičku, $1.32/$3.96 ve špičce od 16. srpna), lokálně
Hy3Nejnovější účastník s permisivní licencíII 41 (v4.1); #22 na Arena WebDev (1,516.4)Apache 2.0Hugging Face, poskytovatelé, self-host
InklingPrvní open-weight model Thinking MachinesII 41 (v4.1), agentický 32,3, vydán 15. červenceOpen weightsHugging Face, poskytovatelé, self-host
Inkling SmallStejná rodina při čtvrtině velikostiII 40 (v4.1), agentický 30,8; 276B/12B aktivních, vstup text, obrázek a zvukApache 2.0Hugging Face (BF16 a NVFP4), poskytovatelé, self-host
NVIDIA Nemotron 3 UltraLaděno NVIDIA, plně permisivní licenceII 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktivních1M / OpenMDWOpenRouter, Hugging Face, AWS (8x B200 self-host)
Qwen 3.5 (397B / 17B aktivních)Multimodální, rychlé dekódování88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v61M / otevřenéTogether, OpenRouter, lokálně
Qwen3.6-35B-A3BEfektivní otevřený agentický kodér (3B aktivních)86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktivních262K (do 1M YaRN) / Apache 2.0Hugging Face, OpenRouter, lokálně
Qwen3.6-27BHustý kodér spustitelný na laptopu87,8 GPQA Diamond, hustý 27B, multimodální256K / Apache 2.0Lokálně Mac/PC, Hugging Face, OpenRouter
Rio 3.5 Open 397BFine-tune Qwen 3.5, vícejazyčné uvažování70,8 Terminal-Bench 2.1 (first-party), poráží Qwen 3.7 Plus na 4/5397B/17B aktivních / MITHugging Face, poskytovatelé, self-host
Llama 4 MaverickVlajkový model řady Meta17B aktivních / 400B celkových parametrůLlama 4 licenseCloud Meta, Hugging Face, lokálně
NVIDIA Nemotron 3 Nano OmniEdge / nízký výkonMultimodální, velmi malá stopaKompaktní / otevřenéLokálně, nástroj NVIDIA

Licencování zde záleží stejně jako holé skóre a srpen rozdíl mezi oběma skupinami ještě prohloubil. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) a Nemotron 3 Ultra (OpenMDW) všechny jasně umožňují komerční použití bez zkoumání tržeb. Zbytek nese podmínky, které je vhodné si přečíst dřív, než na nich začnete stavět: MiniMax M3 a MiniMax H3 vycházejí pod vlastními komunitními licencemi, přičemž H3 navíc vyžaduje žádost z USA, EU, Spojeného království a Jižní Koreje; Kimi K3 sedí na vlastní licenci s prahem tržeb pro každého, kdo jej přeprodává jako službu; GLM 5.3 vyžaduje bezpečnostní revizi Z.ai u každého provozovatele model-as-a-service s tržbami nad 10 miliard dolarů; a Qwen Community License 1.0 u Qwen3.8-Flash-Next vyžaduje samostatnou licenci od Qwenu pro provozování model-as-a-service nebo produktu typu AI pracovní asistent, byť interní použití je vyňato. Žádný open-weight model už není první na žádném žebříčku Areny, který sledujeme: Claude Opus 5 vzal žebříček Agent v červenci, poslední, který open-weight model vedl.

Jak hodnotíme

Benchmarky, ceny a praktické používání

Každé hodnocení na této stránce kombinuje tři vstupy: veřejné benchmarky od sedmi nezávislých firem (Artificial Analysis, Arena dříve LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize a oficiální žebříček Terminal-Bench 4.0, pokrývající Intelligence Index, GPQA Diamond, ARC-AGI-1 až 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas a Remote Labor Index), zveřejněné ceny API a předplatného z oficiální cenové stránky každého dodavatele a praktické používání redakčním týmem FelloAI, který spouští reálné prompty na téže úloze na každém modelu. Oficiální zdroje cen a benchmarků znovu načítáme před každou měsíční aktualizací.

Benchmarky jsou váženy podle případu použití: SWE-bench a Terminal-Bench pohánějí programování, GPQA Diamond a ARC-AGI-2 pohánějí přesnost, GDPval-AA (benchmark profesionálních výstupů od Artificial Analysis) informuje kvalitu profesionálních úloh, zatímco styl psaní se posuzuje primárně praktickým testováním, FrontierMath a HMMT pohánějí řešení problémů. Zveřejňujeme, když je benchmark hlášen dodavatelem, ale nezávisle neověřen, a vyřazujeme každé tvrzení, které nedokážeme reprodukovat proti živému zdroji. Řadíme podle naměřených skóre: koruna kategorie se posune, jakmile model překoná držitele na žebříčcích, které danou kategorii definují, aniž bychom čekali na žebříčky založené na hlasování, a model, který zatím není široce dostupný, je na kartě označen, nikoli o kartu připraven. Znovu ověřujeme pořadí, nejen čísla, protože skóre může zůstat správné, zatímco se žebříček kolem něj pohne. Když model mezi aktualizacemi projde velkým upgradem, kategorii přehodnotíme a přidáme řádek „Co se tento měsíc změnilo“ na konec podrobné analýzy.

Fello AI běžící na Macu, iPhonu a iPadu
Nevíte, který model zvolit?

Fello AI spojuje špičkové AI modely v jedné odlehčené nativní aplikaci.

Přepínejte mezi nimi kdykoli, žádná samostatná předplatná.

Stáhnout Fello AI
Často kladené dotazy

Časté dotazy

Jaký je nejlepší AI model právě teď v září 2026?
Záleží na úloze, ale jeden model teď vede víc žebříčků než kterýkoli jiný. V celkovém skóre benchmarků je Claude Opus 5.5 (22. září) #1 na Intelligence Indexu od Artificial Analysis s 57,6 na v4.3.2, o 4,3 bodu před Claude Fable 5.1, a vede také GDPval-AA v2.1 s 1846, AA-Briefcase v1.1 s 1822 a Humanity's Last Exam s 61,4 %, za $4 / $20 za 1M tokenů. V programování vede Opus 5.5 Terminal-Bench 4.0 od Artificial Analysis s 59,6 % i oba programátorské žebříčky LiveBench, zatímco GPT-6 Astra si drží oba programátorské žebříčky Areny, protože Opus 5.5 tam zatím nemá hlasy. V běžném chatu je GPT-5.6 výchozím modelem ChatGPT od 9. července a je to asistent, kterého si nejvíc lidí skutečně otevře, i když textový žebříček Areny vede Claude Fable 5. V psaní je Claude Fable 5.1 jediným modelem v nejlepší šestce na všech třech žebříčcích prózy. V přesnosti drží Claude Fable 5.1 stále nejvyšší faktickou přesnost, jakou Artificial Analysis změřila, 67 % na AA-Omniscience, o bod nad Opusem 5.5. V těžké matematice a uvažování vede GPT-6 Astra LiveBench Reasoning i ARC-AGI-2. V obrázcích vede ChatGPT Images 2.5 všechny čtyři žebříčky, které sledujeme, a ve videu vede Gemini Omni 1.1 Flash žebříček text-to-video Areny. V agentech je Gemini Spark cloudovým agentem 24/7 a Claude Cowork tím na počítači. Mezi otevřenými vahami má MiMo-V2.6-Pro od Xiaomi 46,3 pod čistou licencí MIT za $0,13 na úlohu indexu. OpenAI 22. září snížila ceny svých středních úrovní API na polovinu, díky čemuž je GPT-6 Luna s $0.07 nejlevnějším modelem na úlohu Intelligence Indexu na této stránce.
Je GPT-6 venku a je to teď nejlepší model?
GPT-6 je venku. OpenAI ho 3. září 2026 uvedla jako GPT-6 Astra, čímž se uzavřela rok stará otázka, zda Astra vyjde jako GPT-6, nebo jako další dílčí vydání řady GPT-5. Na nezávislých žebříčcích to není nejlepší model a 22. září klesl ještě níž. Artificial Analysis mu dává 52,7 na Intelligence Index v4.3.2, o 5,7 bodu před GPT-5.6 Sol, ale o 0,7 bodu za Claude Fable 5.1 s 53,4 a o 4,9 bodu za Claude Opus 5.5 s 57,6, a to za $10 / $50 za 1M tokenů proti $4 / $20 u Solu i u Opusu 5.5. Programování bylo jeho nejsilnějším nárokem a dnes je rozdělené: Astra vzala Terminal-Bench 4.0 od Artificial Analysis s 59,1 % a držela jej, dokud ji Opus 5.5 nepředběhl s 59,6 %, tedy o rozdíl uvnitř chybových mezí toho benchmarku, přičemž Astra si stále drží oba programátorské žebříčky Areny, protože Opus 5.5 tam zatím nemá hlasy. Zhruba také půlí halucinace na AA-Omniscience, z 92 % u Solu na 51 % při maximálním úsilí, a proti Opusu 5.5 stále vyhrává AutomationBench od Zapieru i Terminal-Bench-Science 0.1. Potřebujete placený tarif: Astra je první model, který OpenAI označila za Critical pro kybernetickou bezpečnost, takže jej nejdřív dostali prověření obránci v programu Daybreak, 4. září následovaly ChatGPT Business a Pro a o pár hodin později Plus, a pro bezplatnou vrstvu nebylo oznámeno nic. Náš celý rozbor GPT-6 Astra pokrývá benchmarky i výhrady. Rodina se 22. září rozrostla o GPT-6 Sol za $2 / $10 a GPT-6 Luna za $0,10 / $0,50, kterým Artificial Analysis dává 47,5 a 37,3 proti 52,7 u Astry. Oba jsou v ChatGPT Work, v Codexu a v API a OpenAI říká, že v Chatu zatím není ani jeden; zbytek najdete v našem rozboru GPT-6 Sol a Luna.
Co je Claude Opus 5?
Claude Opus 5 je vlajkový model Anthropicu z 24. července 2026 a byl #1 modelem na Artificial Analysis, dokud 1. září nedorazil Claude Fable 5.1. Nyní je třetí na Intelligence Index se skóre 50,8 proti 53,4 u Claude Fable 5.1 a 52,7 u GPT-6 Astra, druhý na AA-Briefcase s 1673 proti 1678 a při úsilí max dokonce vede žebříček GDPval-AA v2.1 pro profesionální výstupy s 1708 proti 1735 u Fable 5.1, s překrývajícími se intervaly spolehlivosti, stále výrazně před 1695 od Grok 4.7 a 1632 od Claude Fable 5. Ceny API jsou $5 / $25 za 1M tokenů, stejné jako Opus 4.8 a poloviční oproti Fable 5, s kontextovým oknem 1M tokenů a znalostním cutoff z května 2026. ARC Prize nezávisle potvrzuje uváděcí tvrzení Anthropicu k ARC-AGI-3, kde Opus 5 dosahuje 30 % proti 8 % u dalšího nejlepšího modelu, zhruba 3,75násobek. Arena jej nyní řadí třetí na obou programátorských žebříčcích, za GPT-6 Astra a Claude Fable 5.1, první v Document, čtvrtý v signálu dokončování úloh na Agent Areně a desátý v textu. Jedna věc, kterou mít na paměti: Artificial Analysis měří jeho míru halucinací na 50 %, což je důvod, proč na této stránce nedrží žádnou korunu za přesnost.
Co je Claude Fable 5.1?
Claude Fable 5.1 je vydání Anthropicu z 1. září 2026 a nejvýše hodnocený model, jaký kdy Artificial Analysis naměřil, se skóre 53,4 na Intelligence Index v4.3.2 při nastavení max effort a s prvním místem na AA-Briefcase s 1678. Vyšel spolu s Claude Mythos 5.1, což je tentýž model s uvolněnými pojistkami v biologii a kybernetické bezpečnosti, dostupný jen na pozvání a bez zveřejněných kritérií způsobilosti. Ceny jsou $10 / $50 za 1M tokenů, stejné jako u Fable 5, ale čtení z cache klesá o 75 % na $0.25, s kontextovým oknem 1M tokenů a znalostním cutoff z června 2026. Je zahrnutý v Claude Max a Team Premium zhruba na 50 % týdenních limitů a z Pro je dosažitelný přes kredity. Anthropic stále doporučuje začít pro většinu zátěží s Claude Opus 5, protože stojí polovinu a běží rychleji. Náš úplný rozbor Claude Fable 5.1 a Mythos 5.1 pokrývá systémovou kartu i rozdělení pojistek.
Je Claude Fable 5 zpět?
Ano. Anthropic znovu nasadil Claude Fable 5 dne 1. července 2026 poté, co vláda USA zrušila exportní omezení, které uvalila 12. června. Je opět dostupný na Claude API, Claude.ai, Claude Code a Claude Cowork. Anthropic učinil Fable 5 v placených plánech trvalým 20. července 2026. Max a Team Premium jej zahrnují zhruba na 50 % běžných limitů použití; Pro a Team Standard k němu dosáhnou přes kredity použití s jednorázovým startovním kreditem $100. Ceny API jsou $10 / $50 za milion tokenů. Fable 5 je model třídy Mythos postavený pro dlouhodobou agentickou práci s kontextem 1M tokenů a je druhý pro programování za Claude Opus 5, na #2 na žebříčku image-to-WebDev Areny (1,625.7) a #4 ve WebDev.
Co je GPT-5.6 a mohu jej používat?
Ano, od 9. července 2026. GPT-5.6 je rodina modelů OpenAI nové generace a po dvoutýdenním uzavřeném náhledu, který začal 26. června za bezpečnostní prověrkou vlády USA, dosáhla obecné dostupnosti 9. července. Existují tři úrovně, od nejméně po nejschopnější: Luna, rychlá, nejlevnější úroveň ($0.20 / $1.20 za 1M tokenů); Terra, vyvážený každodenní model, o němž OpenAI říká, že se vyrovná GPT-5.5 ($2 / $12); a Sol, vlajkový model laděný pro biologii, chemii a kyberbezpečnost ($4 / $20). OpenAI snížil Lunu o 80 % a Terru o 20 % dne 30. července 2026 a Sol nechal beze změny, poté 21. srpna 2026 snížil Sol o více než 20 % jako propagační sazbu zhruba na tři měsíce. Žádná cena předplatného ChatGPT se nezměnila. Nyní je živý napříč ChatGPT, Codex a API jako výchozí model OpenAI. Jedna výhrada: system card OpenAI a externí hodnotitel METR upozornili na zvýšené chování „scheming“ u Sol, takže s ním u faktografické práce s vysokou odpovědností zacházejte opatrně, dokud se nezávislé výsledky neustálí. Jedna poznámka k názvům od 22. září: OpenAI použila jména Sol a Luna znovu pro generaci GPT-6, takže samotné „Sol“ nebo „Luna“ je dnes dvojznačné. GPT-6 Sol stojí $2 / $10 a GPT-6 Luna $0,10 / $0,50 proti $4 / $20 a $0,20 / $1,20 u úrovní řady 5.6, které OpenAI dál prodává.
Je už Grok 4.7 venku?
Ano. SpaceXAI vydala Grok 4.7 dne 21. září 2026 a nahradila jím Grok 4.6 jako vlajkový model. Na rozdíl od 4.6, což bylo dotrénování téhož základu, stojí 4.7 na novém a větším základním modelu, trénovaném delším během posilovaného učení váženým k úlohám na mnoho hodin; počet parametrů SpaceXAI nezveřejňuje. Artificial Analysis mu dává 46,3 na Intelligence Index v4.3.2 při vysokém úsilí proti 44,3 u Groku 4.6 a na obou agentních žebříčcích stojí nad GPT-6 Astra, 1695 proti 1542 na GDPval-AA v2.1 a 1657 proti 1569 na AA-Briefcase v1.1. Cena zůstává $2 / $6 za 1M tokenů s kontextem 500 tis. tokenů, i když prompty od 200 000 tokenů přeúčtují celý požadavek na $4 / $12, a rychlá varianta běží s dvojnásobnou rychlostí výstupu za dvojnásobnou cenu. Náklady na úlohu Intelligence Indexu se posunuly, z $1,86 na $2,73, protože 4.7 vypíše zhruba dvojnásobek výstupních tokenů. Je živě v Grok API, v Cursoru, v Grok Buildu, v cizích programátorských harnessech a v cloudových routerech. Oznámení SpaceXAI neříká nic o spotřebitelské aplikaci Grok, která za $30 měsíčně stále běží na Groku 4.6. Grok je také naší volbou pro kreativitu, a to z důvodů produktových, ne kvůli kvalitě prózy; pro nejlépe napsaný výstup vyhrává naplno Claude Fable 5. Všechna čísla najdete v našem rozboru Groku 4.7.
Která AI je nejlepší na programování?
Nejlepší na programování je Claude Opus 5.5, kterého Anthropic vydal 22. září. Vede vlastní Terminal-Bench 4.0 od Artificial Analysis s 59,6 % proti 59,1 % u GPT-6 Astra, LiveBench Coding s 89,3 proti 80,4 a LiveBench Agentic Coding se 71,7 proti 57,3, a dělá to za $4 / $20 za 1M tokenů proti $10 / $50 u Astry. Na vlastním harnessu Anthropicu je odstup větší, 66,4 % na Terminal-Bench 4.0 proti 57,9 %, které pro Astru uvádí OpenAI, vedle 54,4 % na FrontierCode v1.1 a 57,8 % na CursorBench 4.0. GPT-6 Astra je druhý a drží si oba programátorské žebříčky Areny, WebDev s 1793 a image-to-WebDev s 1733, protože Opus 5.5 zatím nemá hlasy Areny, takže poctivé čtení je, že OpenAI vede v lidských preferencích a Anthropic na každém měřeném harnessu. Půlbodový odstup na Terminal-Bench berte jako remízu, protože Anthropic u něj uvádí směrodatnou chybu kolem 2,6 bodu. Claude Fable 5.1 je třetí. Mezi otevřenými vahami je na Terminal-Bench 4.0 nejsilnější GLM-5.3 se 41,9 % a nejvýše postaveným otevřeným modelem na Arena WebDev je Kimi K3 na sedmém místě, zatímco GLM 5.3 Flash je ten, kterého většina týmů uhostí, za $0,25 na úlohu indexu pod čistou licencí MIT. Artificial Analysis zrušila jak svůj Coding Index, tak Coding Agent Index.
Která AI je nejlepší na psaní?
Claude Fable 5.1 je nejlepší na psaní, kraluje Humanity's Last Exam se skóre 59,1 % a žebříčku profesionálních výstupů GDPval-AA v2.1. Claude Fable 5 je volbou, pokud vážíte lidské hlasy: stále vede Arena tvůrčí psaní a LiveBench Language (90.7), na EQ-Bench Creative Writing v3 je ale nyní #8. Stojí $10 / $50 za 1M tokenů. Claude Sonnet 5 je volba s nejlepším poměrem cena/výkon a to, co by většina lidí měla skutečně použít, protože je zdarma a výchozí na claude.ai za $2 / $10, úvodní sazbu, kterou Anthropic v srpnu 2026 učinil trvalou, ačkoli se řadí na #53 na Arena tvůrčí psaní. Kimi K3 je na EQ-Bench čtvrtý se skóre 2070.6, pokud chcete osobitou beletrii, Claude Fable 5.1 kraluje žebříčku GDPval-AA v2.1 pro profesionální výstupy se skóre 1846 s Claude Opus 5 druhým se skóre 1735, GPT-5.5 je alternativa pro faktograficky ukotvené obchodní psaní a Gemini 3.8 Flash je volba s nejlepším poměrem cena/výkon pro hromadný obsah.
Jaký je nejlepší open-weight AI model v roce 2026?
MiMo-V2.6-Pro od Xiaomi, zveřejněný 21. září 2026 pod čistou licencí MIT. Artificial Analysis ho měří na 46,3 na Intelligence Index v4.3.2, což je nejvyšší otevřené skóre, jaké kdy zveřejnila, nad GLM-5.3 se 44,8 a Kimi K3 se 43,6, a úlohu indexu zvládne za $0,13, levněji než kterýkoli jiný otevřený model na této stránce. Je to směs expertů s 1,02 bilionu parametrů, 42 miliardami aktivních, kontextem 1M tokenů a vahami na Hugging Face od prvního dne. Dvě výhrady: neohodnotil ho žádný žebříček Areny, takže neexistuje vůbec žádný doklad lidských preferencí, a je čtyři dny starý. Nejvýše postaveným otevřeným modelem na Areně zůstává Kimi K3, sedmý na WebDev a pátý na signálu dokončení úloh v Agent Areně, a GLM-5.3 je stále nejsilnějším otevřeným modelem na Terminal-Bench 4.0 od Artificial Analysis se 41,9 %, ovšem pod vlastní licencí Z.ai, ne MIT. Pro týmy, které si opravdu chtějí hostovat vlastní model, zůstává praktickým doporučením GLM 5.3 Flash (Z.ai, MIT) se 41,8 na indexu a 320 mld. celkem s 18 mld. aktivních, protože model s 1,02 bilionu parametrů potřebuje cluster a stažení Kimi K3 znamená 96 shardů a zhruba 1,56 TB.
Jaký je nejlevnější AI model třídy frontier?
V cenách API za milion tokenů je nejlevnějším uzavřeným modelem špičkové třídy GPT-6 Luna za $0.10 / $0.50 poté, co ji OpenAI 22. září 2026 zlevnila na polovinu, a Artificial Analysis mu na indexu v4.3.2 dává 37,3 proti 34,0 u Gemini 3.6 Flash. Mezi otevřenými vahami zůstává GLM 5.3 Flash, naše volba s nejlepším poměrem cena/výkon od srpna, nyní za prostý ceník $0.15 / $0.50 poté, co 9. září skončila uváděcí sleva, se skóre 41,8 pod čistou licencí MIT, kterou si můžete hostovat sami. DeepSeek tuto volbu držel, dokud 16. srpna nezdražil zhruba čtyřnásobně, a 10. září ji málem získal zpět, když V4.1-Flash nahradil V4-Flash za $0.15 / $0.60 mimo špičku a $0.30 / $1.20 ve špičce: mimo špičku jsou teď oba na vstupu shodní a GLM je levnější na výstupu. Artificial Analysis je stále rozlišuje v ceně na úlohu indexu, $0.25 u GLM proti $0.27 u DeepSeeku. Levný segment Googlu se znovu zlepšil 2. září, kdy Gemini 3.8 Flash dosáhl 40,9 za tutéž uváděcí cenu $0.75 / $3.75, i když se tato sazba 1. ledna 2027 zdvojnásobí. MiniMax M3 má ceník $0.30 za milion vstupních tokenů na trvalé padesátiprocentní slevě a silnou alternativou pod MIT je LongCat-2.0. Měřeno na úlohu Intelligence Indexu, nikoli na token, je nejlevnějším modelem na této stránce GPT-6 Luna s $0.07, před GPT-5.6 Luna s $0.18 a otevřeným MiMo-V2.6-Pro s $0.13.
Které AI modely jsou zdarma?
ChatGPT Free nyní ve výchozím nastavení používá GPT-5.6 (s GPT-5.5 stále dostupným) v rámci limitů použití. Uživatelé Free a Go se od 22. září dostanou i k GPT-6 Luna v desktopové aplikaci ChatGPT. Gemini Free spouští Gemini 3.6 Flash v aplikaci Gemini a Google AI Studio. Claude Free spouští Claude Sonnet 5 (nový výchozí) s denními limity. DeepSeek Chat spouští DeepSeek V4 zdarma na webu DeepSeeku. Grok má omezený bezplatný spotřebitelský plán (X Premium je placený doplněk). Qwen 3.5, Qwen3.8-Flash-Next, NVIDIA Nemotron 3 Ultra, MiniMax M3, LongCat-2.0, Kimi K2.6, DeepSeek V4, GLM-5.2, GLM 5.3, GLM 5.3 Flash, MiMo-V2.6-Pro a Hy4 Preview od Tencentu jsou open-weight a zdarma k self-hostingu, licence se však liší a jen část z nich je čistá MIT nebo Apache. Qwen 3.7 Max je jen API bez spotřebitelského chatovacího rozhraní, ale Alibaba nyní zahrnuje 200 dotazů na model zdarma denně. Kimi má bezplatnou základní úroveň ve své aplikaci, s měřeným náročnějším agentickým použitím.
Co je Gemini Spark a jaký tarif potřebujete?
Gemini Spark je první AI agent Googlu běžící v cloudu 24/7, uvedený na Google I/O dne 19. května 2026 a už není exkluzivní pro Ultra: od 30. července 2026 je dostupný i na tarifu Google AI Pro za $19.99/měsíc, v USA a ve více než 160 dalších zemích, zatímco Google AI Ultra za $99.99 nebo $199.99/měsíc nese širší globální nasazení. Google AI Plus, bezplatný tarif ani pracovní či školní účty jej nezahrnují. Spark je postaven na základních modelech Gemini s harnessem Antigravity od Googlu na Google Cloud VM, integruje se s Gmailem, Google Docs a dalšími aplikacemi Google Workspace a na straně zařízení dokáže interagovat s Chromem a systémem Halo pro Android. Za tu výdaji stojí pro uživatele, kteří mají opakovatelné dlouhoběžící workflow (třídění schránky, souhrny výzkumu, plánované úlohy). Pro jednorázové úlohy pokryje Claude Cowork za $20/měsíc většinu potřeb desktopového agenta.
Co je Fello AI?
Fello AI je AI chatbot pro Mac, iPhone a iPad, který vám umožní používat všechny top AI modely jako ChatGPT, Claude, Gemini, Grok a DeepSeek v jedné aplikaci, s modely pravidelně aktualizovanými, takže máte vždy ty nejnovější. Stojí $9.99/měsíc s hodnocením 4,7 hvězdičky napříč 27 000+ recenzemi.
Jak často tuto stránku aktualizujete?
Tuto stránku aktualizujeme minimálně měsíčně a do 24-48 hodin od každého většího uvedení modelu.
Související články
Claude vs. ChatGPT: která AI je v roce 2026 opravdu lepší?

Claude se počátkem roku 2026 dostal na #1 v App Store a poprvé vytlačil ChatGPT ze špičky. Spouštěčem bylo veřejné odmítnutí Anthropicu vyhovět požadavku Pentagonu nasadit jeho modely pro autonomní zbraně.

Číst dál →
Grok vs. ChatGPT: který AI chatbot je v roce 2026 opravdu lepší?

Oba chatboti se stále posouvají. ChatGPT běží na GPT-5.6 (úrovně Sol, Terra, Luna) a vlajkovým modelem SpaceXAI je nyní Grok 4.7, vydání z 21. září se skóre 46,3 na Intelligence Index za $2 / $6, i když aplikace Grok stále běží na 4.6.

Číst dál →
ChatGPT vs. Gemini v roce 2026: kterou AI byste měli opravdu používat?

ChatGPT přešel na GPT-5.6 jako svůj vlajkový model, zatímco Gemini 3.1 Pro zůstává placeným vlajkovým modelem Googlu. Přímé srovnání napříč psaním, programováním, obrázky a cenou.

Číst dál →
Kdy použít kterou AI: vyberte správný model

Žádná jediná AI není nejlepší na všechno. Přiřaďte úkol modelu, který v něm vede, podle tabulky pro kódování, psaní, rešerše i běžný chat.

Číst dál →
Nejlepší AI agenti v roce 2026: 30 nástrojů otestováno

Třicet AI agentů srovnaných podle toho, co s nimi chcete dělat: kódování, rešerše, kancelářská práce a automatizace, včetně cen a bezplatných možností.

Číst dál →
Gemini Nano Banana Pro vs. GPT-Image-1.5: dokonalé srovnání

Naše původní praktické srovnání z prosince 2025 dvou vedoucích modelů pro generování obrázků, se skutečnými ukázkami výstupů vedle sebe.

Číst dál →

Vyzkoušejte každý model.
Jedna krásná aplikace.

Každý model z tohoto průvodce v jedné nativní aplikaci: ChatGPT, Claude, Gemini, Grok a DeepSeek. Začněte zdarma.

Fello AI běžící na Macu, iPadu a iPhonu

Hodnocení 4,7·27 000+ recenzí·Začněte zdarma