Nejlepší AI modely v roce 2026
Žebříčky, srovnání a podrobné analýzy, každý měsíc aktualizované, jakmile vyjdou nové modely.
OpenAI 3. září spustila GPT-6 Astra, největší uvedení měsíce a o šest desetin bodu stále ne nejvyšší skóre. Artificial Analysis mu nyní na Intelligence Index v4.3 naměřila 52,8, o 5,7 bodu před GPT-5.6 Sol a o 0,6 bodu za Claude Fable 5.1, a to za $10 / $50 za 1M tokenů proti $4 / $20 u Sol. Kde se posouvá, je programování: vede vlastní běh Terminal-Bench 4.0 od Artificial Analysis s 60 % proti 55 % u Claude Fable 5.1, oba při úsilí xhigh, a dosáhne toho zhruba na 17 000 výstupních tokenech na úlohu proti 55 000 u Fable 5.1. Je to první model, který OpenAI označila za kritický z hlediska kybernetické bezpečnosti, takže nejdřív ho dostali prověření obránci z programu Daybreak; ChatGPT Business a Pro následovaly 4. září a Plus o pár hodin později, zatímco API, AWS, Azure a bezplatný tarif teprve přijdou. Tato stránka řadí podle naměřených skóre, takže model získává korunu, jakmile překoná držitele na žebříčcích, které kategorii definují, aniž by se čekalo na žebříčky založené na hlasování. Model, který zatím nikdo nemůže použít, je na kartě označen, nikoli o kartu připraven.
Claude Fable 5.1 dorazil 1. září a rovnou se postavil na vrchol Intelligence Index od Artificial Analysis, kde na verzi v4.3 stále vede se skóre 53,4, a vede i AA-Briefcase s 1646. Claude Opus 5 se stává volbou s nejlepším poměrem v tom, podle čeho se čtenáři skutečně rozhodují, v ceně, $5 / $25 za 1M tokenů proti $10 / $50 u Fable 5.1. Žebříčky založené na hlasování mezitím připadly OpenAI: GPT-6 Astra vede Code Arena: WebDev s 1800 a image-to-WebDev s 1733, Fable 5.1 je na obou druhý a Claude Opus 5 třetí, zatímco Qwen3.8-Max-0902 od Alibaby, který 2. září debutoval na #1 ve WebDev, klesl na čtvrté místo. Fable 5.1 má nyní v Areně tisíce hlasů, takže žebříčky lidských preferencí se už vyjádřily. Grok 4.6 je skutečným překvapením měsíce: dotrénování Grok 4.5 na stejném základu, které získalo pět bodů, 44,4 proti 39,1, a to za $2 / $6, a dlouhé agentické úlohy dokončí zhruba na polovinu tahů, které potřebuje Opus 5. Meta stoupá rychleji než kdokoli jiný: Muse Spark 1.3 dorazil 2. září se skóre 48,2 na témže indexu, za Claude Opus 5 a Claude Fable 5, i když vyšel nejdřív pro vývojáře, v Muse Code a Meta Model API, přičemž Meta uvedla, že nasazení do Facebooku, Instagramu a aplikace Meta AI bude následovat. Náš průvodce AI benchmarky vysvětluje, jak se tento index staví a proč záleží na jeho verzi.
Druhý pohyb je na levném konci a tento měsíc šel oběma směry. DeepSeek 16. srpna zdražil oba modely V4 zhruba čtyřnásobně a rozdělil ceník na špičku a mimo špičku, což stálo DeepSeek V4-Flash 0731 volbu s nejlepším poměrem cena/výkon; 10. září většinu toho otočil, V4-Flash ukončil a nahradil jej modelem DeepSeek-V4.1-Flash za $0.15 / $0.60 mimo špičku a $0.30 / $1.20 ve špičce, s vahami pod MIT hned první den. Volba zůstává u GLM 5.3 Flash, který dorazil 26. srpna s vahami pod MIT první den a dnes se prodává za prostý ceník $0.15 / $0.50 poté, co 9. září skončila uváděcí sleva: Artificial Analysis mu měří $0.25 na úlohu Intelligence Indexu při skóre 41,9 proti $0.27 a 39,5 u DeepSeeku. Mimo špičku jsou oba na vstupu shodní a GLM je levnější na výstupu; ve špičce vyhrává GLM na obou stranách. Google svou sazbu Flash snížil na polovinu už dřív: Gemini 3.7 Flash vyšel 13. srpna za uváděcích $0.75 / $3.75, na stejnou sazbu přešel i Gemini 3.6 Flash, a Gemini 3.8 Flash následoval 2. září přesně za tuto cenu se skóre 41,2 na indexu v4.3 od Artificial Analysis proti 39,4 u 3.7 Flash. Všechny tři ceny se 1. ledna 2027 zdvojnásobí.
Otevřené pole pak měsíc uzavřelo třemi vydáními během tří dnů: GLM 5.3 konečně 28. srpna zveřejnil své váhy, byť pod vlastní licencí Z.ai místo čisté MIT, kterou dostal jeho menší sourozenec, Alibaba 26. srpna otevřela Qwen3.8-Flash-Next jako první veřejný pohled na architekturu Qwen4 a Tencent 28. srpna uvolnil Hy4 Preview, 770 miliard parametrů pod Apache 2.0. Níže jsou vítězové kategorií pro září 2026. Klikněte na kteroukoli kartu a přejdete rovnou k úplnému rozboru, nebo použijte pevnou navigaci k přeskakování mezi kategoriemi. Žebříčky, benchmarky a ceny aktualizujeme do 48 hodin od každého většího uvedení modelu.
Chcete špičkové AI modely bez žonglování se samostatnými předplatnými? Fello AI spojuje přední modely v jedné nativní aplikaci pro Mac, iPhone a iPad.
Stáhnout Fello AI15. zář. TypeSafe TypeSafe vychází z utajení s modelem Jev, který místo textu vrací typovaná rozhodnutí, za $0.042 za 1M tokenů Nové
10. zář. DeepSeek DeepSeek ukončuje V4-Flash, nahrazuje jej V4.1-Flash a snižuje sazbu Flash zhruba o třetinu Nové
3. zář. OpenAI GPT-6 Astra vychází za $10 / $50 a během jediného dne je na Plus i Pro a vede programátorské žebříčky Nové
2. zář. Alibaba Qwen3.8-Max-0902 bere žebříček WebDev Areny Claude Opus 5 o tři body, za $2 / $6 Nové
2. zář. Muse Spark 1.3, Intelligence Index z 57 na 61 při nezměněných $1.25 / $4.25, vítězí v programování a prohrává každý agentický řádek Nové
2. zář. Google Gemini 3.8 Flash, o tři body výš na Intelligence Index za stejných $0.75 / $3.75 Nové
1. zář. Anthropic Claude Fable 5.1 a Mythos 5.1, nová #1 na Artificial Analysis se skóre 66 a snížení ceny čtení z cache o 75 % Nové
28. srp. Z.ai Váhy GLM 5.3 jsou venku po bezpečnostní pauze, ale licence není MIT Nové
28. srp. Tencent Tencent Hy4 Preview, 770B otevřených vah pod Apache 2.0 a zatím největší permisivně licencovaný model Nové
26. srp. Z.ai GLM 5.3 Flash, odhalení Ox Alpha a první váhy pod MIT, které Z.ai vydalo od GLM-5.2 Nové
26. srp. Alibaba Qwen3.8-Flash-Next, otevřené váhy a první veřejný pohled na architekturu Qwen4 Nové
21. srp. OpenAI GPT-5.6 Sol zlevnil o více než 20 %, nyní je pod Claude Opus 5 na obou stranách Nové
16. srp. DeepSeek DeepSeek zdražuje API zhruba čtyřnásobně a dělí ceník na špičku a mimo špičku Nové
14. srp. Z.ai GLM 5.3, velký agentický skok jen z dotrénování, vyšel bez open weights Nové
13. srp. Google Gemini 3.7 Flash, programátorské skóre roste a cena klesá na polovinu na $0.75 / $3.75, do ledna Nové
12. srp. SpaceXAI Grok 4.6, dotrénování zvedá Intelligence Index z 56 na 61 při nezměněných $2 / $6 Nové
5. srp. Muse Spark 1.2 a Muse Code, Intelligence Index z 51 na 57 při nezměněných $1.25 / $4.25, plus terminálový programátorský agent Nové
3. srp. Alibaba Qwen 3.8 (Qwen3.8-Max), multimodální vlajkový model s 2,4 biliony parametrů nyní obecně dostupný za $2 / $6 Nové
Čeká se Google Gemini 3.5 Pro, stále nevydaný, měsíce za plánem podle Bloombergu Zpožděno
Nejlepší AI na psaní
Nejlepší AI na psaní je Claude Fable 5.1, který poráží Claude Fable 5 na každém žebříčku, jenž změřil oba, za stejných $10 / $50, s Claude Sonnet 5 jako volbou s nejlepším poměrem cena/výkon v bezplatné verzi a Claude Fable 5 jako volbou, pokud vážíte lidské hlasy Areny výše než skóre z benchmarků. Fable 5 vede žebříček tvůrčího psaní Areny a kraluje LiveBench Language se skóre 90,7, na EQ-Bench Creative Writing v3 ale klesl na osmé místo. Tomu žebříčku nyní vévodí GPT-6 Astra se skóre 2163.9 a druhý je Claude Fable 5.1 se skóre 2152.7. Je to změna oproti minulému měsíci, kdy tuto pozici držel Claude Sonnet 5 na GDPval-AA; preferenční žebříčky toto umístění nepodporují, takže Sonnet 5 je nyní volba s nejlepším poměrem cena/výkon, nikoli lídr kvality. Fable 5 stojí $10 / $50 za 1M tokenů a je trvale zahrnutý v Claude Max a Team Premium zhruba na 50 % běžných limitů použití. Pokud je vaše psaní pracovní výstup, a ne próza, žebříčku GDPval-AA v2 pro profesionální výstupy nyní vládne Claude Fable 5.1 se skóre 1853, před Claude Opus 5 se skóre 1824 a Fable 5 se skóre 1723. Fable 5.1 dorazil 1. září jako schopnější model za stejných $10 / $50 a poráží Fable 5 na každém žebříčku, který změřil oba, včetně Humanity's Last Exam se skóre 59,1 % proti 55,5 %. Korunu jsme na něj přesunuli, protože tato stránka řadí podle naměřených skóre; Arena jej zatím neohodnotila, a proto Fable 5 zůstává v tabulce jako volba podle lidské preference. Překlad je samostatná otázka se samostatným vítězem, které se věnujeme v průvodci nejlepší AI na překlad.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena (za 1M tokenů) |
|---|---|---|---|---|
| Claude Fable 5.1 | Nejlepší psaní celkově | #1 Humanity's Last Exam (59 %), #1 Intelligence Index (53,4, v4.3), #1 přesnost AA-Omniscience (67 %) | Pátý na textovém žebříčku Areny, za Claude Fable 5 | $10 / $50 |
| Claude Fable 5 | Vede žebříčky lidských hlasů Areny | #1 Arena text celkově (1508.6), #1 LiveBench Language (90.7), #8 EQ-Bench | Nejdražší volba zde | $10 / $50 |
| Kimi K3 | Tvůrčí beletrie a hlas | #4 EQ-Bench Creative Writing (2070.6) | Jen #10 na Arena tvůrčí psaní | $3 / $15 |
| Claude Sonnet 5 | Bezplatné psaní na každý den | Zdarma a výchozí na claude.ai, 1M kontext | #53 Arena tvůrčí psaní; 75,0 LiveBench Language | $2 / $10, nyní trvale |
| Claude Opus 5 | Profesionální výstupy s ohledem na cenu | #2 GDPval-AA v2 se skóre 1824, před Fable 5 (1723) | Za Fable 5 na Arena text, za Fable 5.1 na GDPval-AA v2 | $5 / $25 |
| GPT-5.5 | Faktograficky ukotvené obchodní psaní | Doložené zlepšení faktografické spolehlivosti oproti GPT-5.4 | Úrovně uvažování nyní označeny jako zastaralé | $5 / $30 |
| Gemini 3.8 Flash | Hromadné koncepty ve velkém | Intelligence Index 41,2, 304,6 tok/s na výstupu, 1M kontext | Laděný spíše na agenty než na prózu; úvodní cena se 1. ledna 2027 zdvojnásobí | $0.75 / $3.75 |
Koruna za psaní přešla na Claude Fable 5.1 a spolu s ní se posunulo i pravidlo této stránky: řadíme nyní podle naměřených skóre, místo abychom čekali na lidské hlasy Areny. Fable 5.1 poráží Fable 5 na každém žebříčku, který změřil oba, s Humanity's Last Exam 59,1 % proti 55,5 %, GDPval-AA v2 1724 proti 1632 a Intelligence Indexem 53,4 proti 49,7 na v4.3, to vše za stejných $10 / $50. Claude Fable 5 si drží textový a tvůrčí žebříček Areny, kde je stále #1 s 1508,6 k datu 1. srpna, takže zůstává v tabulce pro každého, kdo váží lidskou preferenci výše než skóre z benchmarků, a Claude Sonnet 5 zůstává bezplatnou volbou s nejlepším poměrem. Dvě čísla, která jsme minulý měsíc uváděli, byla také přepočtena: AA-Omniscience nyní ukazuje 43 pro oba modely Fable místo 40 a Fable 5 na Humanity's Last Exam má 55,5 % místo 53,3 %.
Nejlepší AI pro chat & každodenního asistenta
Nejlepší AI pro každodenní chat je GPT-5.6 a upřímným důvodem je dosah, ne pozice na žebříčku. Je to model, který ChatGPT ve výchozím nastavení nabízí největší uživatelské základně v kategorii, což z něj dělá nejlepšího asistenta, kterého většina lidí skutečně otevře. V čisté lidské preferenci lídrem není: GPT-5.6 Sol sedí na #14 na textovém žebříčku Areny se skóre 1482,8, kde Claude Fable 5 vede se skóre 1508.6. Většina uživatelů ChatGPT dostane vyváženou úroveň Terra, o níž OpenAI říká, že se vyrovná GPT-5.5, a od snížení cen 30. července 2026 stojí o 60 % méně. Je dostupný v ChatGPT (zdarma s limity, Plus za $20/měsíc, Pro za $100/měsíc), přes API (Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 za 1M tokenů) a zabalený uvnitř Fello AI vedle Claude, Gemini, Grok a DeepSeek. Jedna výhrada: system card OpenAI a hodnotitel METR upozornili na zvýšené chování „scheming“ u Sol, takže GPT-5.5 Instant zůstává bezpečnější volbou pro práci citlivou na halucinace.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| GPT-5.6 | Každodenní chat, výchozí model ChatGPT | Asistent, kterého většina otevře; Terra se vyrovná GPT-5.5 za ~poloviční cenu | #14 na Arena text; scheming označen METR | Zdarma / $20/měs. Plus; API $0.20 / $1.20 až $4 / $20 |
| Claude Fable 5 | Nejlépe hodnocená konverzace | #1 na Arena text celkově (1508.6) a v 6 ze 7 podkategorií | Žádná bezplatná verze; přístup přes kredity použití na Pro | $10 / $50 API |
| Claude Opus 5 | Promyšlené, jemné odpovědi | Třetí na Intelligence Index od Artificial Analysis (50,7), za Claude Fable 5.1 a GPT-6 Astra | #10 na Arena text, za Claude Fable 5 | $20/měs. Pro, $5 / $25 API |
| GPT-5.5 Instant | Každodenní práce citlivá na halucinace | O 52,5 % méně halucinovaných tvrzení vs. 5.3 Instant | Úrovně uvažování nyní označeny jako zastaralé | $20/měs. Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rychlý, zdarma, multimodální | Stále model, který dostává bezplatná úroveň Gemini, 1M kontext, #12 na Arena text | Slabší v nejtěžším uvažování; 3.8 Flash jej předčí za stejnou cenu | Zdarma / $0.75 / $3.75 API |
| Fello AI | Všechny top modely, jedna aplikace | ChatGPT + Claude + Gemini + Grok + DeepSeek a další na Macu, iPhonu a iPadu | Směrováno přes aplikaci, ne přímo | $9.99/měs. |
GPT-5.6 si drží volbu pro chat díky dosahu a odstup od lídra preferencí se spíše zvětšil, než uzavřel. K datu 1. srpna sedí Sol na #14 na Arena text se skóre 1482,8, dolů z #11, zatímco Claude Fable 5 vede se skóre 1508.6. Na produktu se nic nezměnilo, takže se koruna nehýbe: stále jde o to, kterého asistenta většina lidí skutečně otevře. GPT-6 Astra od OpenAI vyšla 3. září a do ChatGPT Business a Pro dorazila 4. září a do Plus o pár hodin později, ale volba zůstává u GPT-5.6 kvůli dosahu: Astra šla nejdřív k prověřeným obráncům z programu Daybreak a pro bezplatný tarif OpenAI neoznámila nic.
Nejlepší AI na obrázky
Nejlepší AI na generování obrázků je ChatGPT Images 2.5, kterou OpenAI 8. září nastavila jako výchozí ve všech tarifech ChatGPT a která do jednoho dne obsadila oba obrázkové žebříčky Areny. Její dva modely skončily na každém z nich první a druhý: GPT-Image-2.5 Sunburst, stavěný na přesnost, vede generování obrázků z textu se skóre 1420,7 Elo a úpravy obrázků se skóre 1520,4, rychlejší GPT-Image-2.5 Flare je druhý se skóre 1399,0 a 1490,6 a GPT Image 2 z minulého měsíce je na obou odsunutý na třetí místo. Tato umístění stojí na několika tisících hlasů proti 79 000 a 236 000 u GPT Image 2 a v generování obrázků z textu ta dvojice sdílí stejné pásmo pořadí, takže rozestup mezi Sunburstem a Flare berte jako předběžný. Artificial Analysis nehodnotila ani jeden z těch modelů a její dva žebříčky se s Arenou už neshodují: GPT Image 2 tam stále vede generování obrázků z textu se skóre 1178,1, ale úpravy obrázků převzal MAI-Image-2.6 od Microsoftu se skóre 1122,5. Tím se MAI-Image-2.6 stává druhým celkově, je nejvýše postaveným modelem mimo OpenAI na žebříčku generování obrázků z textu Areny a je první nebo druhý na obou žebříčcích Artificial Analysis, a třetí je Muse Image od Mety. Reve 2.1 opouští stupně vítězů: na žebříčku generování obrázků z textu Artificial Analysis je stále třetí, ale na tom od Areny spadl na šesté místo a na dvou žebříčcích úprav obrázků na dvanácté a čtrnácté. Náš úplný rozbor toho, co přibylo, najdete v článku ChatGPT Images 2.5.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| ChatGPT Images 2.5 | Obrázky s čitelným textem | #1 a #2 v Arena generování obrázků z textu (1420,7 / 1399,0) a úpravách obrázků (1520,4 / 1490,6) | Zatím nehodnoceno Artificial Analysis | Výchozí ve všech tarifech ChatGPT |
| MAI-Image-2.6 | Úprava obrázku, který již máte | #1 v úpravách obrázků Artificial Analysis (1122,5) a #2 na jejím žebříčku generování obrázků z textu (1149,4) | Veřejná preview, zatím ne v Copilotu ani v Bingu | MAI Playground / Microsoft Foundry |
| Muse Image | Úpravy obrázků, ekosystém Meta | #3 v úpravách obrázků Artificial Analysis (1105,1), #5 na jejím žebříčku generování obrázků z textu | Nové, tenké nástroje kolem | Aplikace Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Fotorealistické portréty a produkty | #4 v generování obrázků z textu Artificial Analysis, před Nano Banana Pro na žebříčku Areny | V úpravách obrázků Areny je Nano Banana Pro výše | Aplikace Gemini / AI Studio |
| Seedream 5.0 Pro | Vícejazyčný text + úpravy oblastí | 10+ jazyků včetně arabštiny RTL, laso a vrstvové úpravy | Kolem desátého místa na nezávislých žebříčcích; nejistota kolem autorských práv | BytePlus / Magnific |
| Midjourney v8 | Stylizované umění, ilustrace | Estetický základ, který většina umělců preferuje | Slabší v textu v obrázku | $10-$120/měs. |
| Grok Imagine | NSFW / Spicy Mode | Nejvolnější mantinely; Arena řadí jeho model Image 2.0 na #5 v generování obrázků z textu a #4 v úpravách obrázků | Image 2.0 na žebříčcích Artificial Analysis chybí | $30/měs. SuperGrok |
Obrázková koruna se změnila. OpenAI 8. září vydala ChatGPT Images 2.5 a její dva API modely na obou žebříčcích Areny rovnou předběhly GPT Image 2: Sunburst je první v generování obrázků z textu se skóre 1420,7 a v úpravách obrázků se skóre 1520,4, Flare je druhý se skóre 1399,0 a 1490,6 a GPT Image 2 je na obou třetí. Tři žebříčky, které sledujeme, se už neshodují. Artificial Analysis modely 2.5 vůbec nehodnotila, stále má GPT Image 2 první v generování obrázků z textu se skóre 1178,1 a na jejím žebříčku úprav obrázků převzal první místo MAI-Image-2.6 od Microsoftu se skóre 1122,5. MAI-Image-2.6 nahrazuje Reve 2.1 na druhém místě a Reve 2.1 po pádu na šesté místo v generování obrázků z textu Areny opouští stupně vítězů úplně.
Nejlepší AI na video
Nejlepší AI na generování videa je Gemini Omni 1.1 Flash, který Google vydal 27. srpna a který nyní vede žebříček text-to-video Areny se skóre 1515, těsně před vlastním předchůdcem Gemini Omni Flash s 1511. Je to i schopnější model podle specifikace: prodlužování scény po desetisekundových krocích až na souhrnných 40 sekund, řízení prvního a posledního snímku, videoreference, náhledy v 360p a výstup v 1080p nebo 4K, s cenou zhruba $0.03 za sekundu v 360p, $0.10 v 720p, $0.15 v 1080p a $0.30 ve 4K. Gemini Omni Flash zůstává levnější volbou kolem $0.10 za sekundu a na Areně je statisticky nerozhodně, ale končí u desetisekundových klipů. Žebříčku videa od Artificial Analysis už nevede ani jeden: Wan 3.0 od Alibaby, model dostupný jen přes API vydaný 24. srpna, který staví video z dokumentů, tabulek a prezentací, mu vévodí se skóre 1239, Omni Flash má 1238 a MiniMax H3 Max 1235. Pokud potřebujete delší záběry v nástrojích Googlu, Veo 3.1 stále běží v aplikaci Gemini, AI Studiu a Vertex AI s nativním zvukem a výstupem v 1080p. MiniMax H3 (31. července) zůstává vyzyvatelem podle specifikace, s 2K klipy o délce 4 až 15 sekund a nativním stereo zvukem od $0.13 za sekundu.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash | Nejlepší AI video celkově | #1 Arena text-to-video (1515); prodloužení scény na 40 s, výstup ve 4K | Na žebříčku Artificial Analysis druhý za Wan 3.0 | $0.03-$0.30/s; Gemini API / AI Studio / Flow |
| Gemini Omni Flash | Levnější desetisekundové klipy | #2 Arena text-to-video (1511), #2 AA video (1238); konverzační úpravy | Končí u desetisekundových generací | ~$0.10/s; aplikace Gemini / AI Studio |
| Wan 3.0 | Video z dokumentů a prezentací | #1 na žebříčku videa od Artificial Analysis (1239); 2-30 s, až 1080p, vstup Omni-Reference | Jen přes API, bez zveřejněných vah; #3 na Areně | $0.05-$0.20/s |
| MiniMax H3 | 2K klipy s nativním zvukem | 4-15 s ve 2K, nativní stereo zvuk; #8 Arena text-to-video (1462) | #4 na AA videu (1227); otevřené váhy neobsahují 2K upscaler a vyžadují žádost v USA, EU, Británii a Jižní Koreji | $0.13/s ve 2K |
| Dreamina Seedance 2.5 | Vyzyvatel od ByteDance | #6 Arena text-to-video (1482); vede image-to-video se zvukem | Ekosystém ByteDance, omezený přístup na Západě | Dreamina / BytePlus |
| Muse Video | Video v ekosystému Meta | #3 generování videa z textu se skóre 1459 | Nejnovější ze skupiny, tenké nástroje | Aplikace Meta AI |
| Veo 3.1 | Delší produkční klipy | Nativní zvuk, 1080p, silná fyzikální konzistence | #6 na Arena video, ne lídr kvality | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Rychlá iterace za nižší cenu | Nativní 4K, 60fps, 15sekundové klipy; Turbo vyšel 17. června | Mimo top 16 na Arena generování videa z textu | Od $10/měs. |
| Luma Ray 3 | Fotorealistické scény | Silný realismus pro krajiny | Menší komunita | Zdarma / od $9.99/měs. |
Koruna za video přešla na Gemini Omni 1.1 Flash, který Google vydal 27. srpna a který nyní vede žebříček text-to-video Areny se skóre 1515 proti 1511 u Gemini Omni Flash. Oba jsou uvnitř intervalů spolehlivosti toho druhého, berte to tedy jako remízu rozhodnutou schopnostmi, nikoli jako jasné vítězství: 1.1 Flash prodlužuje scény na souhrnných 40 sekund a dává výstup ve 4K, zatímco Omni Flash končí na deseti sekundách. Větší změnou je, že žebříčku videa od Artificial Analysis už nevede ani jeden. Wan 3.0 od Alibaby jej převzal 24. srpna se skóre 1239 před 1238 u Omni Flash a 1235 u MiniMax H3 Max a přijímá na vstupu dokumenty, tabulky i prezentace. Wan 3.0 je dostupný jen přes API a bez zveřejněných vah, takže naše open-weight volby nemění. MiniMax H3 letos v měsíci také získal hlasy na Areně a na žebříčku text-to-video vstoupil na #8 se skóre 1462.
Nejlepší AI na programování
Nejlepší AI na programování je GPT-6 Astra, která vede vlastní Terminal-Bench 4.0 od Artificial Analysis s 60 % proti 55 % u Claude Fable 5.1 a je první na obou programátorských žebříčcích Areny, ve WebDev s 1800 a v image-to-WebDev s 1733. Claude Fable 5.1 je druhý a drží si souhrnná měřítka: vede Intelligence Index se skóre 53,4 na v4.3 a AA-Briefcase s 1646 proti 1562 u Astry, tedy agentický žebříček, který nahradil zrušený Agentic Index. Claude Opus 5 je volba s nejlepším poměrem, za $5 / $25 za 1M tokenů proti $10 / $50 u obou modelů nad ním, na Terminal-Bench 4.0 má 49 % a na obou programátorských žebříčcích Areny je třetí, a vlastní dokumentace Anthropicu stále doporučuje začínat u Opus 5 pro složitou agentickou práci. Cenový argument čtěte pozorně, protože jde o tokeny, nikoli o úlohy: Opus 5 stojí polovinu ceníkové ceny Astry, ale na jednu úlohu Intelligence Indexu vyjde dráž, $5.86 proti $3.26, protože k výsledku spotřebuje více tokenů. Qwen3.8-Max-0902 od Alibaby držel žebříček WebDev v Areně zhruba tři dny na začátku září a dnes je čtvrtý s 1681. U otevřených vah se důkazy rozcházejí: GLM-5.3 je na testovací sadě nejsilnější s 42 % na Terminal-Bench 4.0, zatímco Kimi K3 je nejvýše postavený otevřený model ve WebDev Areny, pátý s 1674, ale na téže sadě zvládne jen 13 % a hostování vlastními silami znamená 1,56 TB vah. Artificial Analysis zrušila jak Coding Index, tak Coding Agent Index, takže dvě souhrnná programátorská pořadí, která tato stránka dříve uváděla, už neexistují. Nejlevnějším vážným kandidátem je GLM 5.3 Flash za $0.15 / $0.50 pod MIT, který má na Terminal-Bench 4.0 33 % za dva centy na úlohu, a DeepSeek V4.1-Flash je s ním od 10. září na vstupu mimo špičku na stejné úrovni.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena (za 1M tokenů) |
|---|---|---|---|---|
| GPT-6 Astra | Nejlepší na programování celkově | 60 % Terminal-Bench 4.0 (xhigh), #1 Arena WebDev (1800) a #1 image-to-WebDev (1733) | Dvojnásobek ceny Opus 5; za Claude Fable 5.1 na Intelligence Indexu i AA-Briefcase | $10 / $50 |
| Claude Fable 5.1 | Nejvyšší souhrnná skóre | #1 Intelligence Index (53,4, v4.3) a #1 AA-Briefcase (1646); 55 % Terminal-Bench 4.0 | Za Astrou na všech třech programátorských žebříčcích; dvojnásobek ceny Opus 5 | $10 / $50 |
| Claude Opus 5 | Nejlepší poměr za poloviční cenu | 49 % Terminal-Bench 4.0 a třetí na obou programátorských žebříčcích Areny; dokumentace Anthropicu stále doporučuje začít zde | Na jednu úlohu indexu vyjde dráž než Astra, $5.86 proti $3.26 | $5 / $25 |
| Qwen3.8-Max-0902 | Krátkodobý držitel žebříčku WebDev | #4 Code Arena: WebDev (1681); Intelligence Index 45,4; 2,4 bilionu parametrů, kontext 1M | Pouze API na QwenCloud bez spotřebitelského rozhraní; vedení ve WebDev ztratil během několika dní | $2 / $6 |
| Claude Fable 5 | Nejtěžší dlouhé agentické úlohy | Intelligence Index 49,7; 42 % Terminal-Bench 4.0; kontext 1M | Nejdražší na úlohu indexu v této tabulce, $8.75; šestý v Areně image-to-WebDev | $10 / $50 |
| Kimi K3 | Nejvýše postavený otevřený model v Areně | #5 Arena WebDev (1674), nejlepší umístění otevřeného modelu na tomto žebříčku; 2,8T/104B aktivních | Na Terminal-Bench 4.0 jen 13 %; 1,56 TB pro vlastní hostování | $3 / $15 |
| GPT-5.6 Sol | Levnější vlajková loď OpenAI | Intelligence Index 47,1; 40 % Terminal-Bench 4.0 | Výrazně za Astrou na všech programátorských žebříčcích; METR upozornil na optimalizaci na testy | $4 / $20 |
| Muse Spark 1.3 | Levné agentické programování | Intelligence Index 48,2 za $1.25 / $4.25 a $1.61 na úlohu indexu | 33 % na Terminal-Bench 4.0; programátorská vítězství pocházejí z vlastního grafu Mety, měřená na variantě max jen pro partnery | $1.25 / $4.25 |
| Grok 4.6 | Levný poměr cena/výkon | 88,4 % na Terminal-Bench v2.1; Intelligence Index 44,4 | 21 % na Terminal-Bench 4.0; prompty od 200K tokenů přeúčtují celý požadavek dvojnásobně | $2 / $6 |
| Gemini 3.8 Flash | Agentické programování ve velkém | Intelligence Index 41,2; 304,6 výstupních tokenů za sekundu | 20 % na Terminal-Bench 4.0; uváděcí cena se 1. ledna 2027 zdvojnásobí | $0.75 / $3.75 |
| GLM 5.3 Flash | Nejlevnější vážný programátor, kterého si zahostíte | 33 % Terminal-Bench 4.0 za dva centy na úlohu; MIT, 320B/18B aktivních | GLM-5.3 má na téže sadě 42 %; žádný spotřebitelský produkt | Otevřené váhy (MIT) |
Programátorská koruna přešla na GPT-6 Astra. Artificial Analysis zrušila Coding Index i Coding Agent Index, tedy právě to, kde mělo Claude Fable 5.1 náskok, a na zbývajících žebříčcích je Astra napřed na všech třech: 60 % proti 55 % na vlastním Terminal-Bench 4.0 od Artificial Analysis, 1800 proti 1758 v žebříčku WebDev Areny a 1733 proti 1710 v image-to-WebDev. Claude Fable 5.1 si drží souhrnná měřítka, Intelligence Index se skóre 53,4 a AA-Briefcase s 1646 proti 1562 u Astry, a stává se druhým v pořadí. Claude Opus 5 zůstává volbou s nejlepším poměrem za $5 / $25, i když ten argument teď stojí na ceně za tokeny, nikoli na ceně za úlohu: jedna úloha Intelligence Indexu u něj stojí $5.86 proti $3.26 u Astry. Qwen3.8-Max-0902 od Alibaby držel WebDev zhruba tři dny a je nyní čtvrtý. U otevřených vah se důkazy rozdělily, Kimi K3 je nejvýš v Areně a GLM-5.3 má výrazný náskok na testovací sadě, 42 % proti 13 %.
Nejlepší AI na kreativitu
Nejlepší AI na nefiltrovanou, trendovou tvůrčí práci je Grok 4.6 a chceme být přesní, proč. Tato volba je o produktu, ne o kvalitě prózy. Grok nese nejméně obsahových omezení ze všech frontier modelů a jako jediný nativní integraci X v reálném čase, což z něj dělá jediný model, který se pustí do odvážných, aktuálních nebo záměrně provokativních zadání, jež ostatní odmítají. Je výchozím modelem v aplikaci Grok pro předplatitele SuperGrok a X Premium+ za $30/měsíc. Není to nejlepší pisatel a žebříčky to říkají bez obalu. Grok 4.5 sedí na #33 na EQ-Bench Creative Writing a #41 na žebříčku tvůrčího psaní Areny a prohrává na obou se starším Grok 4.20-beta1. Pokud vybíráte podle samotné kvality výstupu, Claude Fable 5 stále vede Arena tvůrčí psaní, zatímco na EQ-Bench je nyní první GPT-6 Astra se skóre 2163.9, druhý Claude Fable 5.1 a čtvrtý Kimi K3. Grok 4.5 volte pro to, co vám dovolí vytvořit, ne pro to, jak dobře píše.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| Grok 4.6 | Nefiltrovaný, vyhraněný, trendový | Nejméně obsahových omezení, nativní ukotvení v X v reálném čase | Žebříčky tvůrčího psaní jej zatím nehodnotily; Grok 4.5 byl #33 EQ-Bench, #41 Arena | $30/měs. SuperGrok |
| Claude Fable 5 | Tvůrčí próza nejvyšší kvality | #1 Arena tvůrčí psaní, #1 LiveBench Language | Opatrné mantinely u odvážných zadání | $10 / $50 API |
| Kimi K3 | Beletrie a osobitý hlas | #4 EQ-Bench Creative Writing se skóre 2070.6 | Jen #10 na Arena tvůrčí psaní | $3 / $15 |
| Claude Opus 5 | Strukturovaná dlouhá tvůrčí práce | Drží dlouhá vlákna a sám se edituje; Intelligence Index 50,7, za Claude Fable 5.1 a GPT-6 Astra | Nejopatrnější ze skupiny | $20/měs. Pro; $5 / $25 API |
| Gemini 3.1 Pro | Multimodální tvůrčí práce | Silný řetězec textu, obrázku a videa | Kvóty v aplikaci Gemini | Zdarma / $2.00-$4.00 API vstup |
| Grok Imagine (Spicy Mode) | NSFW / tvůrčí práce pro dospělé | Nejvolnější generování obrázků | Nika | $30/měs. SuperGrok |
Grok si drží tuto volbu, nyní s Grok 4.6, který 12. srpna nahradil Grok 4.5 jako vlajkový model SpaceXAI. Na volnosti ani na živém přístupu k X, na čemž tato volba stojí, se nic nezměnilo. Model pod tím je citelně silnější, o pět bodů výš na Intelligence Indexu, 44,4 proti 39,1 u Grok 4.5 na v4.3, jenže tento zisk přistál v programování a agentické práci, ne v próze, a žádný žebříček tvůrčího psaní zatím Grok 4.6 nehodnotil. Claude Fable 5 zůstává modelem, který použít, když chcete lepší psaní.
Nejlepší AI na přesnost & výzkum
Nejlepší AI na přesnost a výzkum je Claude Fable 5.1, který drží nejvyšší faktickou přesnost, jakou kdy Artificial Analysis změřila, 67 % na AA-Omniscience, a vede Humanity's Last Exam s 59,1 %. Volbou s nejlepším poměrem je Gemini 3.1 Pro a stále je to to, po čem bychom sáhli, když záleží na ceně. Jeho nejsilnější výsledek je na ARC-AGI-1 od ARC Prize, kde dosahuje 98 % a vyrovnává lidský panel, a to za $0.52 na úlohu. Tato kombinace je argument: několik modelů je schopnostmi blízko, žádný jej nedosahuje v ceně za spolehlivou faktografickou práci. Kombinuje to s nativním ukotvením ve vyhledávání Google, což chcete, když odpověď musí být aktuální, ne jen věrohodná. Dosahuje také 94,1 % na GPQA Diamond, kde se s ním GPT-5.6 Sol nyní vyrovnává, místo aby zaostával, a 44,4 % na Humanity's Last Exam a dosahuje 46,44 na žebříčku HLE od Scale SEAL, kterému nyní vévodí Claude Fable 5 se skóre 55,5 %. Zrušili jsme předchozí rámování přes ARC-AGI-2: jeho 77,1 % je stále správných, ale žebříček se pohnul a toto skóre jej nyní řadí kolem 14. místa. Dvě upřímné výhrady. Konkrétně u ukotveného vyhledávání vede žebříček vyhledávání Areny OpenAI, nikoli Google či Anthropic: GPT-5.6 Sol je první se skóre 1257, Claude Fable 5 pátý a Gemini 3.1 Pro s ukotvením devátý. A v novém uvažování vede GPT-5.6 Sol ARC-AGI-2 a Claude Opus 5 vede ARC-AGI-3 se skóre 30 %, zhruba 3,75násobek dalšího nejlepšího modelu. Korunu jsme na Opus 5 nepřesunuli, protože Artificial Analysis měří jeho míru halucinací na 50 % a řadí jej pod Fable 5 na AA-Omniscience, na jehož vrcholu nyní Claude Fable 5.1 stojí spolu s ním.
| Model | Nejlepší pro | Klíčový benchmark | Slabina | Cena |
|---|---|---|---|---|
| Claude Fable 5.1 | Nejvyšší naměřená faktická přesnost | 67 % faktické přesnosti na AA-Omniscience, nejvíc, co kdy Artificial Analysis změřila; #1 Humanity's Last Exam (59,1 %) | Žádná levná úroveň a bez hodnocení na vyhledávacím žebříčku Areny | $10 / $50 |
| Gemini 3.1 Pro | Nejlepší poměr, levná faktická práce | 98 % ARC-AGI-1 (vyrovnává lidský panel) za $0.52/úlohu, 94,1 % GPQA (vyrovnáno Sol) | ARC-AGI-2 77,1 % nyní ~14.; #7 na Arena vyhledávání | $2.00-$4.00 / $12.00-$18.00 (odstupňováno) |
| Claude Fable 5 | Ukotvené vyhledávání | #5 na žebříčku vyhledávání Areny, za GPT-5.6 Sol | Žádná jediná levná úroveň | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Nové uvažování | #1 ARC-AGI-2 se skóre 92,5 %, proti 100% lidskému panelu | Scheming označen METR | $4 / $20 |
| Claude Opus 5 | Nejtěžší neviděné problémy | #1 ARC-AGI-3 se skóre 30 %, ~3,75násobek dalšího modelu (ARC Prize) | Artificial Analysis měří míru halucinací 50 % | $5 / $25 |
| Qwen 3.7 Max | Frontier přesnost za výhodnou cenu | 92,4 GPQA Diamond, 200 dotazů zdarma/den | Jen API, žádné chatovací rozhraní | $1.25 / $3.75 promo; $2.50 / $7.50 ceníková |
| Claude Opus 4.6 | Poctivost pod tlakem | #1 na žebříčku MASK od Scale SEAL se skóre 96,28; Anthropic drží top 5 | Nahrazen jako vlajkový model | Starší model Anthropicu |
Koruna za přesnost přešla na Claude Fable 5.1, který drží nejvyšší faktickou přesnost, jakou kdy Artificial Analysis změřila, 67 % na AA-Omniscience proti 65 % u Claude Fable 5, a vede Humanity's Last Exam s 59,1 % proti 55,5 %. Samotný index AA-Omniscience ukazuje 43 pro oba modely, oproti 40, které jsme uváděli minulý měsíc, protože 5.1 si svou přesnost navíc kupuje vyšší mírou pokusů u otázek, které neumí zodpovědět. Gemini 3.1 Pro se stává volbou s nejlepším poměrem a je stále tím, po čem bychom sáhli kvůli ceně: 98 % na ARC-AGI-1 za $0,52 na úlohu, což vyrovnává lidský panel, plus nativní ukotvení ve Vyhledávání Google, ačkoli jeho GPQA Diamond bylo přepočteno na 94,1 % a GPT-5.6 Sol jej nyní přesně vyrovnává. GPT-6 Astra (3. září) je zde spíše vydáním, které sledovat, než novou korunou: Artificial Analysis měří pokles jeho míry halucinací z 92 % u Sol na 51 % při maximálním úsilí, zatímco přesnost roste o čtyři body, což je největší zlepšení poctivosti, jaké letos kdo zveřejnil, ale ztrácí zhruba 80 Elo na GDPval-AA v2 a není v bezplatném tarifu ChatGPT.
Nejlepší AI na řešení problémů
Nejlepší AI na těžké řešení problémů je GPT-6 Astra, která sebrala žebříčky uvažování GPT-5.6 Sol během několika dní od startu. Vede LiveBench Reasoning se skóre 92,65 a ARC-AGI-2 s 95 %, nejvíc, co kdo proti stoprocentnímu lidskému panelu tohoto žebříčku zvládl, a na LiveBench Mathematics je druhá se skóre 96,81 za 97,01 u Claude Fable 5.1. Uvádí také 97,6 % na FrontierMath Tier 4 v2, číslo, které je třeba brát spolu s informací Epoch AI, že OpenAI benchmark financovala a k části z něj má výhradní přístup. Háček je v ceně a dosahu: $10 / $50 za 1M tokenů proti $4 / $20 u Sol a vyžaduje placený tarif ChatGPT. GPT-5.6 Sol je cenově výhodnou alternativou, na obou žebříčcích LiveBench třetí se skóre 96,20 a 91,65 a druhý na ARC-AGI-2. Qwen 3.7 Max je rozpočtovou volbou pro soutěžní úlohy se skóre 97,1 na únorovém indexu HMMT 2026 a 44,5 na Apexu, s 200 bezplatnými dotazy denně. Claude Opus 5 zůstává alternativou pro dlouhé agentické řetězce uvažování, i když mu Astra sebrala i ARC-AGI-3.
| Model | Nejlepší pro | Klíčový benchmark | Slabina | Cena |
|---|---|---|---|---|
| GPT-6 Astra | Nejtěžší matematika, věda a uvažování | #1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3 | Vyžaduje placený tarif ChatGPT; 2,5x cena Sol | $10 / $50 |
| Claude Opus 5 | Dlouhé agentické řetězce uvažování | #2 AA-Briefcase (1645) a #2 GDPval-AA v2 (1737); 30,2 % ARC-AGI-3 | ARC-AGI-3 nyní vede Astra; 50% míra halucinací | $5 / $25 |
| GPT-5.6 Sol | Cenově výhodný STEM model | #2 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) a Reasoning (91,65) | FrontierMath stále nezveřejněn; METR označil manipulaci | $100/měs. ChatGPT Pro; API $4 / $20 |
| Qwen 3.7 Max | Soutěžní matematika na rozpočet | 97,1 HMMT 2026 únor, 44,5 Apex, 200 dotazů zdarma/den | Jen API | $1.25 / $3.75 promo; $2.50 / $7.50 ceníková |
| Claude Fable 5 | Matematika uvnitř programátorského workflow | #1 na matematické podkategorii Areny (1543), 96,0 LiveBench Mathematics | Nejdražší volba zde | $10 / $50 |
| GLM 5.3 Flash | Open-weight řešení problémů | Intelligence Index 41,9 pod MIT, o téměř osm bodů více než GLM-5.2 při méně než poloviční velikosti; 320B/18B aktivních, 1M kontext | Potřebuje multi-GPU server, ne pracovní stanici; GLM 5.3 skóruje výš podle vlastních čísel Z.ai a od 28. srpna jej lze stáhnout, ale ve více než dvojnásobné velikosti a pod vlastní licencí | Open weights (MIT) |
Koruna za řešení problémů přešla na GPT-6 Astra, která během několika dní od startu 3. září sebrala žebříčky, podle nichž se tato kategorie rozhoduje. Vede LiveBench Reasoning se skóre 92,65 proti 91,65 u GPT-5.6 Sol, bere ARC-AGI-2 s 95 % proti 92,5 % u Sol a vytlačila Claude Opus 5 z ARC-AGI-3, kde jejích 62,7 % na standardním harnessu překonává 30,2 % u Opus 5. Čísla z ARC-AGI-3 čtěte pozorně: tento žebříček měří efektivitu akcí na úrovni člověka v neznámých prostředích, nikoli počet vyřešených úloh, a široce citovaných 98,6 % pochází z harnessu s adaptérem poskytovatele, ne ze standardního. Sol klesl na obou žebříčcích LiveBench na třetí místo, ale zůstává cenově výhodnou alternativou za $4 / $20 proti $10 / $50 u Astry, a Claude Fable 5.1 nenápadně převzal LiveBench Mathematics se skóre 97,01.
Nejlepší AI agent
Nejlepší AI agent je Gemini Spark, pokud chcete agenta v cloudu, a Claude Cowork, pokud ho chcete na svém počítači. Jde o společné volby, nikoli o první a druhé místo: Spark běží ve virtuálním stroji Google Cloud, takže pracuje dál i se zavřeným notebookem, a je propojený s Gmailem, Dokumenty a od začátku září i s Fotkami Google; Cowork běží na vašem Macu nebo Windows a ovládá vaše místní aplikace i obrazovku. Žádný nezávislý žebříček tyto dva produkty proti sobě neměří, takže rozhodující je, kde má práce probíhat, ne kdo má vyšší skóre. Ani cena už jazýčkem na vahách není: Spark je nyní dostupný na tarifu Google AI Pro za $19.99/měsíc v USA a ve více než 160 dalších zemích a Cowork je bez příplatku součástí každého placeného tarifu Claude od $20/měsíc. ChatGPT Codex Mobile (14. května) je alternativou pro práci s programovacím agentem a prohlížečoví agenti třídy OpenAI Operator pro webové úlohy. Přečtěte si celé srovnání Gemini Spark vs Claude Cowork.
| Agent | Nejlepší pro | Kde běží | Silná stránka | Cena |
|---|---|---|---|---|
| Gemini Spark | 24/7 cloudové úlohy, workflow Workspace | Google Cloud VM (vždy zapnuto) | První skutečný agent 24/7, hluboká integrace Workspace | Od $19.99/měs. Google AI Pro |
| Claude Cowork | Desktop, řízení aplikací, design + kód | Váš desktop Mac/Windows | Řídí lokální aplikace, vidí vaši obrazovku | $20/měs. Claude Pro |
| ChatGPT Codex Mobile | Programátorský agent v telefonu | Cloud OpenAI + iOS/Android | Schvalování diffů a přesměrování práce z telefonu | Zahrnuto v plánech ChatGPT |
| Grok Agentic (Grok 4.6) | Výzkum v reálném čase, scraping X | Cloud SpaceXAI | Nativní integrace X; Elo 1663 na GDPval-AA v2 | $30/měs. SuperGrok |
| OpenAI třídy Operator | Úlohy v prohlížeči, webové formuláře | Cloud OpenAI + váš prohlížeč | Webová automatizace | ChatGPT Pro |
Žádný nový spotřebitelský agentní produkt nevyšel, i když Gemini Spark se rozšířil: dostal se do tarifu Google AI Pro za $19.99 měsíčně a přibyly mu Fotky Google, kde umí vyhledávat, upravovat, kurátorovat a spouštět plánované postupy. Muse Code od Mety (5. srpna) je terminálový nástroj pro vývojáře, nikoli spotřebitelský, takže volbu mezi Sparkem (cloud) a Cowork (desktop) řídí i nadále to, kde má agent běžet. Modelová vrstva pod tím se ale posunula výrazně. Claude Fable 5.1 (1. září) vede Agent Arenu od Areny v dokončování úloh s 19,8 %, GPT-6 Astra je druhá se 17,7 % a Claude Opus 5 čtvrtý, a vede i AA-Briefcase od Artificial Analysis s 1646 proti 1633 u Opus 5. Na GDPval-AA v2 se oba sblížily: Fable 5.1 vede při úsilí xhigh s 1745, ale při úsilí max je 1735 u Opus 5 nyní před 1724 u Fable 5.1 a intervaly spolehlivosti se překrývají, takže to berte jako remízu. Dvě poznámky k údržbě: Artificial Analysis zrušila samostatný Agentic Index spolu s Intelligence Index v4.2 dne 4. září a agentickou práci nyní měří přes AA-Briefcase a GDPval-AA v2, a zároveň znovu ukotvila škálu Elo u GDPval-AA v2, proto tato čísla leží výrazně níž než ta, která jsme uváděli v srpnu. Opus 5 je stále ten, na kterém by většina týmů měla stavět, za $5 / $25, tedy poloviční cenu Fable 5.1. Muse Spark 1.3 od Mety (2. září) si zaslouží spravedlivější posouzení, než mu dává vlastní graf z uvedení: Meta řadí šest benchmarků pod Agent a 1.3 všech šest prohrává, ale na nezávislém žebříčku GDPval-AA v2 od Artificial Analysis je třetí mezi odlišnými modely s 1703, před GLM 5.3, Grok 4.6 a Claude Fable 5, a to za $1.25 / $4.25. Vyhrává také dlouhý kontext, 98,1 na pásmu 512K až 1M v MRCR proti 55,5 u verze 1.2. Scale SEAL zatím ohodnotil jen starší 1.1, která vede jeho žebříček MCP Atlas pro práci s nástroji s 88,1. GLM 5.3 Flash (26. srpna, MIT) je agentní model s otevřenými vahami, který bychom hostovali, s AutomationBench 48,8 na vlastním grafu Z.ai, kde Claude Opus 4.8 má 41,0; v signálu dokončování úloh na Agent Areně je GLM-5.2 nyní sedmnáctý a Kimi K3 pátý, přičemž DeepSeek V4.1-Flash je celkově třetí a nejvýše postavený model s otevřenými vahami v tomto signálu. Grok 4.6 zůstává příběhem o ceně, nikoli novým agentním produktem: Elo 1663 na GDPval-AA v2, páté místo mezi odlišnými modely, přičemž dlouhé úlohy dokončí zhruba na 53 tazích a 0,5 miliardy vstupních tokenů proti přibližně 103 tahům a 2,0 miliardám u Opus 5. GPT-6 Astra (3. září) mluví spíš pro Codex než pro nový agentní produkt: vede Terminal-Bench 4.0 od Artificial Analysis a na Agent Areně je druhá, ale AA-Briefcase si drží Fable 5.1 poměrem 1646 ku 1562.
Přední modely jako ChatGPT, Claude a Gemini pohromadě na Macu, iPhonu a iPadu.
Začněte zdarma, hodnocení 4,7★ napříč 27 000+ recenzemi.
Stáhnout Fello AINejlepší AI pro studenty
Nejlepší AI pro studenty je GPT-5.6 Luna uvnitř ChatGPT pro obecnou práci na kurzech a Gemini 3.6 Flash uvnitř aplikace Gemini pro STEM a multimodální studium, s Qwen 3.7 Max jako API alternativou pro těžší sady úloh (200 dotazů zdarma denně) a Claude Opus 5 jako alternativou pro úpravy esejí. Většina studentů nemusí platit a bezplatný tarif se 6. srpna zlepšil: GPT-5.6 Luna se stal výchozím modelem pro ChatGPT Free a Go, s neomezenými textovými chaty a tlačítkem Think pro těžší otázky, i když nahrávání souborů a obrazové nástroje zůstávají omezené. Gemini 3.6 Flash je stále to, co nabízí bezplatná aplikace Gemini, Claude Sonnet 5 je výchozí bezplatný Claude a DeepSeek V4 je zdarma na chatovacím webu DeepSeeku. Luna je nejlevnější, nikoli nejsilnější člen rodiny GPT-5.6, takže když esej vyžaduje větší péči, sáhněte po tlačítku Think nebo přepněte na GPT-5.5. Pro krok za krokem řešení nejtěžší matematiky je GPT-5.6 Sol placenou vlajkovou lodí OpenAI a GPT-6 Astra nyní uvádí 97,6 % na FrontierMath Tier 4 v2 proti ověřeným 39,6 % u GPT-5.5 Pro, i když Astra zatím není v bezplatném tarifu ChatGPT; Qwen 3.7 Max je hodnotnou alternativou s 97,1 na HMMT únor 2026 a API cenou $1,25 / $3,75 v současné 50% akci ($2,50 / $7,50 ceníkově).
| Úloha | Nejlepší model | Proč | Zdarma? | Alternativa |
|---|---|---|---|---|
| Eseje & práce na kurzech | GPT-5.6 Luna | Výchozí zdarma v ChatGPT od 6. srpna; neomezené textové chaty | Ano | Claude Sonnet 5 (Claude zdarma) |
| Řešení STEM úloh | GPT-5.6 Sol / Qwen 3.7 Max | Placená STEM vlajková loď; Astra uvádí 97,6 % FrontierMath Tier 4 v2 / 97,1 HMMT únor 2026 | Pro placené / Qwen API placené | Gemini 3.6 Flash (zdarma) |
| Výzkum & přesnost | Gemini 3.1 Pro | 98 % ARC-AGI-1 za $0.52/úlohu, nativní ukotvení ve vyhledávání Google | Ano (aplikace Gemini) | Claude Opus 5 |
| Úpravy textu | Claude Sonnet 5 | Zdarma a výchozí na claude.ai; Claude Fable 5 je lídr kvality | Ano (Claude zdarma) | Claude Fable 5 |
| Multimodální studium (PDF, snímky, obrázky) | Gemini 3.6 Flash | 1M kontext, zdarma v aplikaci Gemini | Ano | NotebookLM (Google) |
Bezplatný tarif je to, co se v tomto průvodci posunulo. OpenAI 6. srpna udělalo z GPT-5.6 Luna výchozí model pro ChatGPT Free a Go a oběma dalo neomezené textové chaty plus tlačítko Think pro těžší otázky, takže bezplatnou volbou je nyní Luna místo GPT-5.5, který zůstává volitelný, když esej vyžaduje větší péči. Nahrávání souborů, obrázky a další nástroje jsou stále omezené. Na straně Googlu se nic nezměnilo: Gemini 3.8 Flash vyšel 2. září, ale k bezplatným uživatelům se dostane jen přes AI Studio a API, takže bezplatná aplikace Gemini stále nabízí 3.6 Flash a ten si drží multimodální řádek. GPT-6 Astra (3. září) je ta, kterou u těžkých sad úloh sledovat, s uváděnými 97,6 % na FrontierMath Tier 4 v2 proti ověřeným 39,6 % u GPT-5.5 Pro, ale vyžaduje placený tarif ChatGPT a žádný bezplatný tarif ji nezahrnuje.
Nejlepší AI pro práci & profesionály
Nejlepší AI pro profesionální práci je GPT-5.6 (výchozí model ChatGPT od 9. července) pro každodenní znalostní práci, Claude Opus 5 pro programování a psaní s vysokou mírou odpovědnosti a Gemini Spark pro agentické workflow 24/7. Většina profesionálů vytěží nejvíc, když provozuje dvě placená předplatná (ChatGPT Plus za $20/měsíc plus Claude Pro za $20/měsíc, celkem $40/měsíc), nebo konsoliduje s Fello AI za $9.99/měsíc pro všech pět top modelů v jedné aplikaci pro Mac/iOS. Pro agentickou práci, která běží, když spíte, je Gemini Spark jediným skutečným cloudovým agentem 24/7 a od 30. července je dostupný nejen na Google AI Ultra, ale i na tarifu Google AI Pro za $19.99/měsíc.
| Případ použití | Nejlepší model | Klíčový údaj | Cena | Alternativa |
|---|---|---|---|---|
| Každodenní znalostní práce | GPT-5.6 | Výchozí model ChatGPT od 9. července; asistent, kterého většina otevře | $20/měs. ChatGPT Plus | Claude Opus 5 |
| Programování (proprietární) | Claude Opus 5 | #1 na Arena image-to-WebDev (1,668.6) a #2 ve WebDev (1688); doporučený výchozí model Anthropicu | $20/měs. Claude Pro | Claude Fable 5 |
| Programování (cenově výhodné) | Qwen3.8-Max-0902 | #4 Code Arena: WebDev (1681), za GPT-6 Astra, Claude Fable 5.1 a Claude Opus 5; jen API na QwenCloud | $2 / $6 | Qwen 3.7 Max; DeepSeek V4.1-Flash |
| Výzkum & podklady | Gemini 3.1 Pro | 98 % ARC-AGI-1 za $0.52/úlohu, ukotvení Google | Google AI Pro / Ultra | Claude Opus 5 |
| Těžká matematika, fyzika, finanční modelování | GPT-6 Astra | #1 LiveBench Reasoning a ARC-AGI-2 (95 %); uvádí 97,6 % FrontierMath Tier 4 v2 | $100/měs ChatGPT Pro | GPT-5.6 Sol; Qwen 3.7 Max |
| Nepřetržité agentické workflow | Gemini Spark | První cloudový agent 24/7 | Od $19.99/měs. Google AI Pro | Claude Cowork |
| Živé zprávy, tvůrčí práce s kontextem X | Grok 4.6 | Intelligence Index 44,4 + nativní ukotvení v X | $30/měs. SuperGrok | Gemini 3.1 Pro |
| Konsolidace vše v jednom | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/měs. | Platit každému dodavateli zvlášť |
V prvních třech zářijových dnech přišla tři vydání a žádné z nich neposouvá volbu pro každodenní práci. Claude Fable 5.1 (1. září) vede Intelligence Index Artificial Analysis s 53,4 na v4.3 a její žebříček AA-Briefcase s 1646, ale Claude Opus 5 tu zůstává doporučením za $5 / $25, poloviční cenu oproti Fable 5.1, a vlastní dokumentace Anthropicu týmům stále říká, ať začnou s Opus 5. Qwen3.8-Max-0902 od Alibaby (2. září) sebral Opus 5 žebříček Arena WebDev o tři body a přebírá řádek cenově výhodného programování za $2 / $6, i když jde jen o API na QwenCloud bez spotřebitelského rozhraní. GPT-6 Astra (3. září) je vydání, které by řádkem každodenní práce pohnout mohlo, a zatím nepohnulo: Astra se na místa Business a Pro dostala 4. září a na Plus o pár hodin později, ale při $10 / $50 proti $4 / $20 u Sol je dražším výchozím modelem, takže si řádek drží GPT-5.6.
Ceny AI modelů v září 2026
Od bezplatných tarifů za $0 až po Google AI Ultra za $199.99 měsíčně. Nejdůležitější cenou v této tabulce je Claude Opus 5 za $5 / $25, protože je třetí nejvyšší na Intelligence Index od Artificial Analysis za poloviční ceníkovou cenu obou modelů Fable kolem něj. Claude Fable 5.1, který se 1. září dostal na vrchol tohoto indexu a s 53,4 na v4.3 si jej stále drží, má stejnou ceníkovou cenu $10 / $50 jako Fable 5, ale snižuje čtení z cache o 75 % na $0.25, a právě tam u dlouhých agentických běhů úspora skutečně leží, nikoli na cenovce. Muse Spark 1.3 od Mety má ceník $1.25 / $4.25, nezměněný přes tři skoky ve schopnostech od července, s tarifem Contributor za $0.10 / $0.20 pro každého, kdo nechá Metu trénovat na svých promptech, a Grok 4.6 stojí $2 / $6 s tím, že prompt od 200 000 tokenů přeúčtuje celý požadavek za $4 / $12. Levný konec se pohnul dvakrát. DeepSeek 16. srpna zdražil oba modely V4 zhruba čtyřnásobně, což stálo V4-Flash volbu s nejlepším poměrem cena/výkon, a 10. září většinu toho otočil: V4-Flash ukončil a jeho místo zaujal V4.1-Flash za $0.15 / $0.60 mimo špičku a $0.30 / $1.20 ve špičce. Volba přesto zůstává u GLM 5.3 Flash, nyní za prostý ceník $0.15 / $0.50 poté, co 9. září skončila uváděcí sleva, protože Artificial Analysis mu měří $0.25 na úlohu Intelligence Indexu při skóre 41,9 proti $0.27 a 39,5 u DeepSeeku. Mimo špičku jsou oba na vstupu na stejné úrovni a GLM je levnější na výstupu; ve špičce vyhrává GLM na obou stranách. Na špici je volbou s nejlepším poměrem Muse Spark 1.3 od Mety, za $1.61 na úlohu indexu při skóre 48,2, tedy lépe než Grok 4.6 v obou ohledech s $1.86 a 44,4. Mezi uzavřenými modely je nejlevnější GPT-5.6 Luna za $0.20 / $1.20 po zlevnění OpenAI z 30. července, a s $0.18 je zároveň nejlevnější na úlohu indexu ze všech modelů na této stránce. Podrobnější rozbor najdete v našem průvodci cenami AI. Nová vlajková loď měsíce tento tvar spíš potvrzuje, než mění: GPT-6 Astra dorazila 3. září za $10 / $50, stejnou ceníkovou cenu jako Claude Fable 5.1 a 2,5násobek GPT-5.6 Sol, s cache vstupem za $1 a zápisem do cache za $12.50, a Artificial Analysis ji měří o 64 % dráž na úlohu indexu než Sol, za o 5,7 bodu vyšší skóre.
| Model | Vstup (za 1M) | Výstup (za 1M) | Kontext | Přístup zdarma? |
|---|---|---|---|---|
| GPT-6 Astra | $10.00 | $50.00 | 1 050 000 (max. vstup 922 000) | ChatGPT Business/Pro od 4. září, Plus o pár hodin později; bez bezplatného tarifu. API, AWS a Azure teprve přijdou |
| GPT-5.5 | $5.00 | $30.00 | 1M (400K v Codex) | ChatGPT Free; API placené |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro od $100/měs. (úroveň s vyšším použitím $200) |
| GPT-5.6 Sol | $4.00 | $20.00 | Nezveřejněno | Živé v ChatGPT, Codex & API (9. července) |
| GPT-5.6 Terra | $2.00 | $12.00 | Nezveřejněno | Živé v ChatGPT, Codex & API (9. července) |
| GPT-5.6 Luna | $0.20 | $1.20 | Nezveřejněno | Živé v ChatGPT, Codex & API (9. července) |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Výchozí v Claude Pro/Max; API placené |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Starší model u Anthropicu; Pro/Max/API |
| Claude Fable 5.1 | $10.00 | $50.00 | 1M | Čtení z cache $0.25; v Max/Team Premium (~50 % limitů použití); Pro/Team Standard přes kredity. Mythos 5.1 se účtuje stejně, jen na pozvání |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Trvale v Max/Team Premium (~50 % limitů použití); Pro/Team Standard přes kredity |
| Claude Sonnet 5 | $2.00 | $10.00 | 1M | Výchozí v Claude Free & Pro; API placené |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API placené (nahrazeno Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Omezená aplikace Gemini; API placené |
| Gemini 3.8 Flash | $0.75 úvodní / $1.50 od 1. 1. 2027 | $3.75 úvodní / $7.50 od 1. 1. 2027 | 1M | AI Studio, Antigravity, Gemini Enterprise + placené API; v aplikaci Gemini hlášeno pro AI Pro/Ultra |
| Gemini 3.7 Flash | $0.75 úvodní / $1.50 od 1. 1. 2027 | $3.75 úvodní / $7.50 od 1. 1. 2027 | 1M | AI Studio, Android Studio, Antigravity + placené API; v aplikaci Gemini jen přes Spark (AI Pro/Ultra, mimo EHP/UK/CH/Nigérii) |
| Gemini 3.6 Flash | $0.75 úvodní / $1.50 od 1. 1. 2027 | $3.75 úvodní / $7.50 od 1. 1. 2027 | 1M | Výchozí model bezplatné aplikace Gemini; AI Studio; bezplatná úroveň API + placené API |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; bezplatná úroveň API + placené API |
| Qwen3.8-Max-0902 | $2.00 ($0.17 explicitní cache hit, $0.25 implicitní) | $6.00 | 1M (výstup 128K) | Pouze API na QwenCloud; bez spotřebitelského chatu, bez otevřených vah |
| Qwen 3.7 Max | $1.25 promo / $2.50 ceníková | $3.75 promo / $7.50 ceníková | 1M | 200 dotazů zdarma/den; API placené nad rámec |
| MiniMax M3 | $0.30 (50 % z $0.60) | $1.20 (≤512K) | 1M | Open weights; náklady na hosting |
| LongCat-2.0 | Závisí na poskytovateli | Závisí na poskytovateli | 1M | Open weights (MIT); náklady na hosting |
| NVIDIA Nemotron 3 Ultra | Závisí na poskytovateli | Závisí na poskytovateli | 1M | Open weights (OpenMDW); náklady na hosting |
| Qwen 3.5 (open-weight) | Self-host / Together | Self-host / Together | 1M | Open weights; náklady na hosting |
| Nex-N2-Pro | Self-host / poskytovatelé | Self-host / poskytovatelé | 1M | Open weights (Apache 2.0); náklady na hosting |
| Rio 3.5 Open 397B | Self-host / poskytovatelé | Self-host / poskytovatelé | 1M | Open weights (MIT); náklady na hosting |
| Grok 4.3 | $1.25 | $2.50 | 1M | Bezplatný spotřebitelský plán; API placené |
| Grok 4.6 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
| Muse Spark 1.3 | $1.25 ($0.10 úroveň Contributor) | $4.25 ($0.20 úroveň Contributor) | 1M | Placené API; Muse Code, Meta Model API a OpenRouter; úroveň Contributor mění práva k trénování za ~92% slevu |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Bezplatná základní úroveň v aplikaci Kimi; open weights na Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (video) | $1.50 | $17.50 (video výstup) | 10sekundové klipy | Aplikace Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.66 mimo špičku / $1.32 ve špičce ($0.022 cache-hit mimo špičku) | $1.98 mimo špičku / $3.96 ve špičce | 1M | DeepSeek Chat zdarma; API placené, špičkové a mimošpičkové sazby od 16. srpna |
| DeepSeek V4.1-Flash | $0.15 mimo špičku / $0.30 ve špičce ($0.003 cache hit mimo špičku) | $0.60 mimo špičku / $1.20 ve špičce | 1M | DeepSeek Chat zdarma; API placené, tarify mimo špičku a ve špičce; nahradil V4-Flash 10. září |
| Kimi K2.7 Code | Závisí na poskytovateli | Závisí na poskytovateli | 256K | Open weights; náklady na hosting |
| GLM-5.2 | Závisí na poskytovateli | Závisí na poskytovateli | 1M | Open weights; náklady na hosting |
| GLM 5.3 | $1.40 ($0.26 cache-hit) | $4.40 | 1M | Z.ai API, GLM Coding Plan a ZCode; váhy na Hugging Face od 28. srpna pod vlastní licencí GLM 5.3 License |
| GLM 5.3 Flash | $0.15 ($0.03 cache-hit); $0.075 v akci | $0.50; $0.25 v akci | 1M | Z.ai API, GLM Coding Plan, OpenRouter; váhy pod MIT na Hugging Face; akce končí 9. září |
| Tencent Hy4 Preview | $0.834 ($0.042 cache-hit) | $2.501 | 1M+ | Otevřené váhy (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy |
| Qwen3.8-Flash-Next | Podle poskytovatele | Podle poskytovatele | 262K (do 1M) | Otevřené váhy (Qwen Community License 1.0); náklady na hosting se připočítávají |
| ERNIE 5.1 | Ceny pro region Čína | Ceny pro region Čína | 256K | Bezplatná úroveň Baidu |
| Gemini Spark (agent) | Bez ceny API | Bez ceny API | 1M (základ Gemini) | Google AI Pro $19.99, AI Ultra $99.99 nebo $199.99/měs. |
| Fello AI (agregátor) | Směrováno přes aplikaci | Směrováno přes aplikaci | Závisí na modelu | $9.99/měs., bezplatná verze dostupná |
Výše uvedené sazby pro GPT-5.5 a GPT-5.5 Pro jsou ceny pro krátký kontext; OpenAI již specifické údaje pro dlouhý kontext nezveřejňuje. Úrovně GPT-5.6 se účtují za 2násobek vstupu a 1,5násobek výstupu, jakmile prompt přesáhne 272K vstupních tokenů, což dává long-context Terra na $4 / $18 a Luna na $0.40 / $1.80. Grok 4.6 funguje stejně, ale tvrději: od 200 000 tokenů v promptu výše přeúčtuje SpaceXAI celý požadavek vyšší sazbou, nikoli jen to, co limit přesahuje, takže překročení o tisíc tokenů zdvojnásobí cenu celého volání. Druhým ceníkem, který je třeba číst dvakrát, je DeepSeek: od 16. srpna se oba modely V4 účtují špičkovou sazbou od 01:00 do 04:00 a od 06:00 do 10:00 UTC ve všední dny a přesně poloviční v každou jinou hodinu, takže stejná úloha může stát dvojnásobek podle toho, kdy ji spustíte. Pokud chcete přístup k více AI modelům bez správy samostatných předplatných, Fello AI poskytuje GPT, Claude, Gemini, Grok, Perplexity a další v jediné aplikaci pro Mac, iPhone a iPad od $9.99/měsíc.
Nejlepší open-weight modely v září 2026
Nejlepším modelem s otevřenými vahami je v září 2026 Kimi K3, i když argumentů pro něj ubylo. Stále je to nejvýše postavený otevřený model v Areně, pátý ve WebDev s 1674 a pátý v signálu dokončování úloh na Agent Areně, ale už nedrží nejvyšší Intelligence Index mezi otevřenými modely: na indexu v4.3 od Artificial Analysis má GLM-5.3 skóre 44,9 proti 43,8 u Kimi K3, a GLM-5.3 jej vede i na AA-Briefcase, 1504 ku 1488, a na Terminal-Bench 4.0 s velkým odstupem, 42 % proti 13 %. Žádný otevřený model nevyhrává všude, takže Kimi K3 ponecháváme na základě jeho umístění v Areně a otevřeně říkáme, že naměřené žebříčky dnes ukazují na GLM-5.3, jehož licence je vlastní dokument Z.ai, nikoli MIT. O tom, který si vybrat, rozhoduje jeden háček. Stažení K3 je 96 safetensors shardů a zhruba 1,56 TB, což vyžaduje víceuzlový GPU cluster, nikoli pracovní stanici. Praktickým doporučením pro týmy, které si váhy provozují samy, tak zůstává GLM 5.3 Flash (Z.ai, MIT), vydaný 26. srpna se skóre 41,9 na v4.3, o téměř osm bodů výš než GLM-5.2 při méně než poloviční velikosti, 320B celkem a 18B aktivních. Je to první nativně multimodální model v řadě GLM-5, zvládá kontext 1M tokenů a váhy byly na Hugging Face pod MIT v den uvedení. Levný otevřený segment se 10. září změnil znovu: DeepSeek ukončil V4-Flash 0731 a nahradil jej modelem DeepSeek-V4.1-Flash, 552B s 8B aktivními při prefillu a 16B při dekódování, nativně multimodálním, pod MIT hned první den, se skóre 39,5 na v4.3 proti 34,5 u nahrazované verze a s cenou sraženou zpět na $0.15 / $0.60 mimo špičku. Je také třetí v signálu dokončování úloh na Agent Areně, tedy nejvýše postavený otevřený model v tomto signálu. Dvě ze tří vydání, která uzavřela srpen, už mají nezávislé hodnocení: GLM 5.3 zveřejnil váhy 28. srpna pod vlastní licencí s klauzulí, podle níž musí každý provozovatel model-as-a-service s obratem nad 10 miliard dolarů nejprve projít bezpečnostní revizí Z.ai, a Artificial Analysis mu dává 44,9; Qwen3.8-Flash-Next od Alibaby, mixture-of-experts se 125B a jen 6B aktivními, který předznamenává architekturu Qwen4, má 39,9 a je devátý v žebříčku WebDev Areny. Hy4 Preview od Tencentu, 770B celkem a 49B aktivních pod Apache 2.0 a stále největší permisivně licencovaný publikovaný model, nemá hodnocení od Artificial Analysis, ale je nyní jedenáctý ve WebDev Areny s 1624. Pozor také na to, že GLM 5.3 Flash není osekaný GLM 5.3, ale samostatný model na nově natrénovaném základu, a právě proto mohl vyjít pod čistým MIT, zatímco vlajková loď nikoli.
| Model | Nejlepší pro | Klíčový benchmark | Kontext / Licence | Kde spustit |
|---|---|---|---|---|
| Kimi K3 | Nejlépe hodnocený open-weight model, agentická a webová práce | II 43,8 (v4.3); #5 Arena WebDev, nejlepší umístění otevřeného modelu; #5 Agent Arena; 2.8T/104B aktivních | 1M / Kimi K3 License | Hugging Face (96 shardů, 1.56 TB), Moonshot API, poskytovatelé |
| GLM 5.3 Flash | Nejlepší otevřený model, který si většina týmů skutečně dokáže provozovat | II 41,9 (v4.3), na Paretově hranici poměru inteligence a ceny, zhruba $0.25 za úlohu indexu; 320B/18B aktivních, nativně multimodální | 1M / MIT | Hugging Face, Z.ai API ($0.15/$0.50), OpenRouter |
| GLM-5.2 | Záložní volba s nezávislým záznamem | II 34,0 (v4.3); #19 Arena WebDev (1,591.8), #17 Agent Arena; 744B/40B aktivních | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| GLM 5.3 | Otevřený od 28. srpna, ale pod vlastní licencí | II 44,9 (v4.3), nejvyšší otevřené skóre, které jsme našli; stejný základ 744B jako GLM-5.2, jen dotrénovaný, zveřejněný checkpoint počítán na 753B; CyberGym 84,5 % a Terminal-Bench 3.0 28,3 (údaje dodavatele) | 1M / GLM 5.3 License (model-as-a-service nad 10 mld. USD tržeb potřebuje bezpečnostní revizi Z.ai) | Hugging Face, Z.ai API ($1.40/$4.40), GLM Coding Plan, ZCode |
| DeepSeek V4.1-Flash | Nejlepší otevřená hodnota, pokud si jej hostíte sami | II 39,5 (v4.3) proti 34,5 u nahrazované verze V4-Flash 0731; 552B, 8B aktivních při prefillu a 16B při dekódování | 1M / MIT | DeepSeek API ($0.15/$0.60 mimo špičku, $0.30/$1.20 ve špičce od 10. září), lokálně |
| Tencent Hy4 Preview | Zatím největší permisivně licencovaný model | 770B/49B aktivních; 2,99/4,00 na vlastním panelu Tencentu se 203 úlohami proti 2,94 u Kimi K3 a 2,92 u GLM 5.3 (dodavatel); bez hodnocení Artificial Analysis; #11 Arena WebDev (1624) | 1M+ / Apache 2.0 | Hugging Face (BF16 a FP8), Tencent Cloud TokenHub, OpenRouter |
| Qwen3.8-Flash-Next | Ukázka architektury Qwen4 | 125B celkem plus N-gramové embedding s 51B, 6B aktivních; 91,7 GPQA Diamond a 62,5 SWE-Bench Pro (dodavatel); II 39,9 (v4.3); #9 Arena WebDev (1635) | 262K až 1M / Qwen Community License 1.0 | Hugging Face, poskytovatelé, self-host |
| LongCat-2.0 | Frontier otevřený kodér trénovaný na čínských čipech | II 33 (v4.1); 59,5 % SWE-Bench Pro (dodavatel), 1.6T/~48B aktivních | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Levný multimodální model třídy frontier | II 44 (v4.1), 59 % SWE-Bench Pro, multimodální | 1M / licence TBD | Hugging Face, API $0.30/1M (50 % sleva) |
| Nex-N2-Pro | Nejsilnější otevřené programátorské skóre | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktivních | Založeno na Qwen / Apache 2.0 | Hugging Face, poskytovatelé, self-host |
| Kimi K2.7 Code | Nejsilnější komerčně licencovaný otevřený kodér | +21,8 % na Kimi Code Bench v2 vs. K2.6 (dodavatel); 1T/32B aktivních | 256K / Modified MIT | Hugging Face, DeepInfra, poskytovatelé |
| DeepSeek V4-Pro | Agentická práce v reálném světě | II 44 (v4.1), 1.6T/49B aktivních | 1M / MIT | DeepSeek API ($0.66/$1.98 mimo špičku, $1.32/$3.96 ve špičce od 16. srpna), lokálně |
| Hy3 | Nejnovější účastník s permisivní licencí | II 41 (v4.1); #22 na Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, poskytovatelé, self-host |
| Inkling | První open-weight model Thinking Machines | II 41 (v4.1), agentický 32,3, vydán 15. července | Open weights | Hugging Face, poskytovatelé, self-host |
| Inkling Small | Stejná rodina při čtvrtině velikosti | II 40 (v4.1), agentický 30,8; 276B/12B aktivních, vstup text, obrázek a zvuk | Apache 2.0 | Hugging Face (BF16 a NVFP4), poskytovatelé, self-host |
| NVIDIA Nemotron 3 Ultra | Laděno NVIDIA, plně permisivní licence | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktivních | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 self-host) |
| Qwen 3.5 (397B / 17B aktivních) | Multimodální, rychlé dekódování | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / otevřené | Together, OpenRouter, lokálně |
| Qwen3.6-35B-A3B | Efektivní otevřený agentický kodér (3B aktivních) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktivních | 262K (do 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, lokálně |
| Qwen3.6-27B | Hustý kodér spustitelný na laptopu | 87,8 GPQA Diamond, hustý 27B, multimodální | 256K / Apache 2.0 | Lokálně Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune Qwen 3.5, vícejazyčné uvažování | 70,8 Terminal-Bench 2.1 (first-party), poráží Qwen 3.7 Plus na 4/5 | 397B/17B aktivních / MIT | Hugging Face, poskytovatelé, self-host |
| Llama 4 Maverick | Vlajkový model řady Meta | 17B aktivních / 400B celkových parametrů | Llama 4 license | Cloud Meta, Hugging Face, lokálně |
| NVIDIA Nemotron 3 Nano Omni | Edge / nízký výkon | Multimodální, velmi malá stopa | Kompaktní / otevřené | Lokálně, nástroj NVIDIA |
Licencování zde záleží stejně jako holé skóre a srpen rozdíl mezi oběma skupinami ještě prohloubil. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) a Nemotron 3 Ultra (OpenMDW) všechny jasně umožňují komerční použití bez zkoumání tržeb. Zbytek nese podmínky, které je vhodné si přečíst dřív, než na nich začnete stavět: MiniMax M3 a MiniMax H3 vycházejí pod vlastními komunitními licencemi, přičemž H3 navíc vyžaduje žádost z USA, EU, Spojeného království a Jižní Koreje; Kimi K3 sedí na vlastní licenci s prahem tržeb pro každého, kdo jej přeprodává jako službu; GLM 5.3 vyžaduje bezpečnostní revizi Z.ai u každého provozovatele model-as-a-service s tržbami nad 10 miliard dolarů; a Qwen Community License 1.0 u Qwen3.8-Flash-Next vyžaduje samostatnou licenci od Qwenu pro provozování model-as-a-service nebo produktu typu AI pracovní asistent, byť interní použití je vyňato. Žádný open-weight model už není první na žádném žebříčku Areny, který sledujeme: Claude Opus 5 vzal žebříček Agent v červenci, poslední, který open-weight model vedl.
Benchmarky, ceny a praktické používání
Každé hodnocení na této stránce kombinuje tři vstupy: veřejné benchmarky od sedmi nezávislých firem (Artificial Analysis, Arena dříve LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize a oficiální žebříček Terminal-Bench 2.1, pokrývající indexy Intelligence a Agentic, GPQA Diamond, ARC-AGI-1 až 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas a Remote Labor Index), zveřejněné ceny API a předplatného z oficiální cenové stránky každého dodavatele a praktické používání redakčním týmem FelloAI, který spouští reálné prompty na téže úloze na každém modelu. Oficiální zdroje cen a benchmarků znovu načítáme před každou měsíční aktualizací.
Benchmarky jsou váženy podle případu použití: SWE-bench a Terminal-Bench pohánějí programování, GPQA Diamond a ARC-AGI-2 pohánějí přesnost, GDPval-AA (benchmark profesionálních výstupů od Artificial Analysis) informuje kvalitu profesionálních úloh, zatímco styl psaní se posuzuje primárně praktickým testováním, FrontierMath a HMMT pohánějí řešení problémů. Zveřejňujeme, když je benchmark hlášen dodavatelem, ale nezávisle neověřen, a vyřazujeme každé tvrzení, které nedokážeme reprodukovat proti živému zdroji. Řadíme podle naměřených skóre: koruna kategorie se posune, jakmile model překoná držitele na žebříčcích, které danou kategorii definují, aniž bychom čekali na žebříčky založené na hlasování, a model, který zatím není široce dostupný, je na kartě označen, nikoli o kartu připraven. Znovu ověřujeme pořadí, nejen čísla, protože skóre může zůstat správné, zatímco se žebříček kolem něj pohne. Když model mezi aktualizacemi projde velkým upgradem, kategorii přehodnotíme a přidáme řádek „Co se tento měsíc změnilo“ na konec podrobné analýzy.
Fello AI spojuje špičkové AI modely v jedné odlehčené nativní aplikaci.
Přepínejte mezi nimi kdykoli, žádná samostatná předplatná.
Stáhnout Fello AI




