Nejlepší AI modely v roce 2026
Žebříčky, srovnání a podrobné analýzy, každý měsíc aktualizované, jakmile vyjdou nové modely.
Anthropic vydal 22. září Claude Opus 5.5 a bere programátorskou korunu. Artificial Analysis ho měří na 57,6 na Intelligence Index v4.3.2, nejvýš, co kdy zveřejnila, a o 4,3 bodu před Claude Fable 5.1, a spolu s tím vede GDPval-AA v2.1, AA-Briefcase v1.1 i Humanity's Last Exam. Dělá to za $4 / $20 za 1M tokenů, tedy pod Claude Opus 5 za $5 / $25, takže nejlepší model je nově i ten levnější.
OpenAI odpověděla zhruba o devadesát minut později modely GPT-6 Sol a GPT-6 Luna a s nimi snížila ceny svého API na polovinu: Sol stojí $2 / $10 za 1M tokenů a Luna $0,10 / $0,50, a ani jeden zatím není v chatovacím okně ChatGPT. GPT-6 Astra si drží oba programátorské žebříčky Areny, protože Opus 5.5 tam zatím nemá hlasy, a Claude Fable 5.1 si drží psaní a přesnost na žebříčcích, podle kterých se tyto kategorie rozhodují. Tato stránka řadí podle naměřených skóre, takže koruna přechází, jakmile model předčí držitele, a nečeká se na žebříčky založené na hlasování. Náš průvodce AI benchmarky vysvětluje, jak se ten index staví a proč na jeho čísle verze záleží.
SpaceXAI vydala 21. září Grok 4.7 na novém a větším základním modelu a stojí nad Astrou na obou agentních žebříčcích, které Artificial Analysis publikuje. Intelligence Index ukazuje 46,3 proti 44,3 u Groku 4.6 a cena za tokeny se nehýbe, $2 / $6, jenže úloha indexu stojí $2,73 proti $1,86, protože 4.7 vypíše zhruba dvojnásobek výstupu. Spustil se v API, v Cursoru a v Grok Buildu; aplikace Grok stále běží na 4.6.
Nového lídra má i otevřené pole: MiMo-V2.6-Pro od Xiaomi, zveřejněný 21. září pod čistou licencí MIT, má skóre 46,3 a úlohu indexu zvládne za $0,13, nejlevněji z otevřených modelů na této stránce. Níže najdete vítěze kategorií pro září 2026. Klepnutím na kartu přejdete rovnou na celý rozbor, nebo použijte lepivou navigaci a přeskakujte mezi kategoriemi. Žebříčky, benchmarky a ceny aktualizujeme do 48 hodin od každého významného uvedení modelu.
Chcete špičkové AI modely bez žonglování se samostatnými předplatnými? Fello AI spojuje přední modely v jedné nativní aplikaci pro Mac, iPhone a iPad.
Stáhnout Fello AI22. zář. OpenAI GPT-6 Sol a GPT-6 Luna půlí ceny API OpenAI a přistávají všude kromě chatu v ChatGPT Nové
22. zář. Anthropic Claude Opus 5.5 bere Intelligence Index s 57,6 a podbízí cenu Opusu 5 Nové
21. zář. SpaceXAI Grok 4.7 přichází na větším základním modelu za nezměněných $2 / $6 a stojí o 47 % víc na úlohu Nové
21. zář. Xiaomi MiMo-V2.6-Pro od Xiaomi je nejlépe hodnocený otevřený model, jaký byl změřen, za $0,13 na úlohu indexu pod MIT Nové
15. zář. TypeSafe TypeSafe vychází z utajení s modelem Jev, který místo textu vrací typovaná rozhodnutí, za $0.042 za 1M tokenů Nové
10. zář. DeepSeek DeepSeek ukončuje V4-Flash, nahrazuje jej V4.1-Flash a snižuje sazbu Flash zhruba o třetinu Nové
3. zář. OpenAI GPT-6 Astra vychází za $10 / $50 a během jediného dne je na Plus i Pro a vede programátorské žebříčky Nové
2. zář. Alibaba Qwen3.8-Max-0902 bere žebříček WebDev Areny Claude Opus 5 o tři body, za $2 / $6 Nové
2. zář. Muse Spark 1.3, Intelligence Index z 57 na 61 při nezměněných $1.25 / $4.25, vítězí v programování a prohrává každý agentický řádek Nové
2. zář. Google Gemini 3.8 Flash, o tři body výš na Intelligence Index za stejných $0.75 / $3.75 Nové
1. zář. Anthropic Claude Fable 5.1 a Mythos 5.1, nová #1 na Artificial Analysis se skóre 66 a snížení ceny čtení z cache o 75 % Nové
28. srp. Z.ai Váhy GLM 5.3 jsou venku po bezpečnostní pauze, ale licence není MIT Nové
28. srp. Tencent Tencent Hy4 Preview, 770B otevřených vah pod Apache 2.0 a zatím největší permisivně licencovaný model Nové
26. srp. Z.ai GLM 5.3 Flash, odhalení Ox Alpha a první váhy pod MIT, které Z.ai vydalo od GLM-5.2 Nové
26. srp. Alibaba Qwen3.8-Flash-Next, otevřené váhy a první veřejný pohled na architekturu Qwen4 Nové
21. srp. OpenAI GPT-5.6 Sol zlevnil o více než 20 %, nyní je pod Claude Opus 5 na obou stranách Nové
16. srp. DeepSeek DeepSeek zdražuje API zhruba čtyřnásobně a dělí ceník na špičku a mimo špičku Nové
14. srp. Z.ai GLM 5.3, velký agentický skok jen z dotrénování, vyšel bez open weights Nové
13. srp. Google Gemini 3.7 Flash, programátorské skóre roste a cena klesá na polovinu na $0.75 / $3.75, do ledna Nové
12. srp. SpaceXAI Grok 4.6, dotrénování zvedá Intelligence Index z 56 na 61 při nezměněných $2 / $6 Nové
5. srp. Muse Spark 1.2 a Muse Code, Intelligence Index z 51 na 57 při nezměněných $1.25 / $4.25, plus terminálový programátorský agent Nové
3. srp. Alibaba Qwen 3.8 (Qwen3.8-Max), multimodální vlajkový model s 2,4 biliony parametrů nyní obecně dostupný za $2 / $6 Nové
Čeká se Google Gemini 3.5 Pro, stále nevydaný, měsíce za plánem podle Bloombergu Zpožděno
Nejlepší AI na psaní
Nejlepší AI na psaní je Claude Fable 5.1 a argument pro něj je konzistence, ne jediné první místo. Je jediným modelem v nejlepší šestce na všech třech žebříčcích psaného textu: druhý na EQ-Bench Creative Writing v3 s 2152,7, druhý na LiveBench Language s 89,5 a šestý na žebříčku kreativního psaní Areny. Nic jiného to nesvede. GPT-6 Astra vede EQ-Bench s 2163,9, ale na žebříčku kreativního psaní Areny je 25.; Claude Fable 5 vede textový i kreativní žebříček Areny a je první na LiveBench Language s 90,7, ale na EQ-Bench klesl na osmé místo. Claude Opus 5.5, který 22. září sebral Fable 5.1 Intelligence Index i Humanity's Last Exam, není hodnocen na EQ-Bench ani na Areně a na LiveBench Language je osmý, takže zatím nemá na žebříčcích psaní žádný argument a koruna na něj nepřechází. Pokud je vaše psaní pracovní výstup, a ne próza, je to jiná otázka a žebříček profesionálních výstupů GDPval-AA v2.1 vede Claude Opus 5.5 s 1846 před Claude Fable 5.1 s 1735 a Claude Opus 5 s 1708. Claude Sonnet 5 zůstává volbou pro nejlepší poměr v bezplatné vrstvě a Claude Fable 5 volbou, pokud vážíte lidské hlasy Areny výš než skóre z harnessů; Fable 5 stojí $10 / $50 za 1M tokenů a je natrvalo součástí Claude Max a Team Premium zhruba s 50 % běžných limitů užití. Překlad je samostatná otázka se samostatným vítězem, kterou rozebíráme v průvodci nejlepší AI na překlad.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena (za 1M tokenů) |
|---|---|---|---|---|
| Claude Fable 5.1 | Nejlepší psaní celkově | #2 EQ-Bench Creative Writing (2152,7), #2 LiveBench Language (89,5) a #6 kreativní psaní Areny, nejlepší souhrnné umístění ze všech modelů | Ani jeden ze tří nevede naplno; Claude Opus 5.5 mu 22. září sebral Intelligence Index a Humanity's Last Exam | $10 / $50 |
| Claude Fable 5 | Vede žebříčky lidských hlasů Areny | #1 Arena text celkově (1505,7), #1 LiveBench Language (90.7), #8 EQ-Bench | Nejdražší volba zde | $10 / $50 |
| Kimi K3 | Tvůrčí beletrie a hlas | #4 EQ-Bench Creative Writing (2070.6) | Jen #27 na Arena tvůrčí psaní | $3 / $15 |
| Claude Sonnet 5 | Bezplatné psaní na každý den | Zdarma a výchozí na claude.ai, 1M kontext | #53 Arena tvůrčí psaní; 75,0 LiveBench Language | $2 / $10, nyní trvale |
| Claude Opus 5 | Profesionální výstupy s ohledem na cenu | #2 GDPval-AA v2.1 se skóre 1708, před Fable 5 (1632) | Za Fable 5 na Arena text, za Fable 5.1 na GDPval-AA v2.1 | $5 / $25 |
| GPT-5.5 | Faktograficky ukotvené obchodní psaní | Doložené zlepšení faktografické spolehlivosti oproti GPT-5.4 | Úrovně uvažování nyní označeny jako zastaralé | $5 / $30 |
| Gemini 3.8 Flash | Hromadné koncepty ve velkém | Intelligence Index 40,9, 308,4 tok/s na výstupu, 1M kontext | Laděný spíše na agenty než na prózu; úvodní cena se 1. ledna 2027 zdvojnásobí | $0.75 / $3.75 |
Koruna za psaní zůstává Claude Fable 5.1, ale změnilo se, na čem stojí. Claude Opus 5.5 mu 22. září sebral Intelligence Index i Humanity's Last Exam, což byla právě čísla, která tato karta citovala, takže jsme volbu opřeli o žebříčky, které skutečně měří prózu. Na nich je Fable 5.1 jediným modelem v nejlepší šestce na všech třech: druhý na EQ-Bench Creative Writing, druhý na LiveBench Language a šestý na žebříčku kreativního psaní Areny. Opus 5.5 není na dvou ze tří hodnocen a na třetím je osmý, takže pro psaní zatím argument nemá. Arena už Fable 5.1 ohodnotila, čímž mizí výhrada, kterou jsme nesli minulý měsíc, že se žebříčky lidských preferencí ještě nevyjádřily: je pátý na textovém žebříčku s 1498,5, kde stále vede Claude Fable 5 s 1505,7. GDPval-AA v2.1 byl znovu překotven a nyní ukazuje 1846 u Opusu 5.5, 1735 u Fable 5.1 a 1708 u Opusu 5, takže čísla v tomto bloku jsou výrazně níž než ta, která jsme uváděli v srpnu.
Nejlepší AI pro chat & každodenního asistenta
Nejlepší AI pro každodenní chat je GPT-5.6 a upřímným důvodem je dosah, ne pozice na žebříčku. Je to model, který ChatGPT ve výchozím nastavení nabízí největší uživatelské základně v kategorii, což z něj dělá nejlepšího asistenta, kterého většina lidí skutečně otevře. V čisté lidské preferenci lídrem není: GPT-5.6 Sol sedí na #18 na textovém žebříčku Areny se skóre 1483,5, kde Claude Fable 5 vede se skóre 1505,7. Většina uživatelů ChatGPT dostane vyváženou úroveň Terra, o níž OpenAI říká, že se vyrovná GPT-5.5, a od snížení cen 30. července 2026 stojí o 60 % méně. Je dostupný v ChatGPT (zdarma s limity, Plus za $20/měsíc, Pro za $100/měsíc), přes API (úrovně řady 5.6: Luna $0.20 / $1.20, Terra $2 / $12, Sol $4 / $20 za 1M tokenů) a zabalený uvnitř Fello AI vedle Claude, Gemini, Grok a DeepSeek. Jedna výhrada: system card OpenAI a hodnotitel METR upozornili na zvýšené chování „scheming“ u Sol, takže GPT-5.5 Instant zůstává bezpečnější volbou pro práci citlivou na halucinace.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| GPT-5.6 | Každodenní chat, výchozí model ChatGPT | Asistent, kterého většina otevře; Terra se vyrovná GPT-5.5 za ~poloviční cenu | #14 na Arena text; scheming označen METR | Zdarma / $20/měs. Plus; API $0.20 / $1.20 až $4 / $20 |
| Claude Fable 5 | Nejlépe hodnocená konverzace | #1 na Arena text celkově (1505,7) a ve čtyřech z osmi podkategorií | Žádná bezplatná verze; přístup přes kredity použití na Pro | $10 / $50 API |
| Claude Opus 5 | Promyšlené, jemné odpovědi | Třetí na Intelligence Index od Artificial Analysis (50,8), za Claude Fable 5.1 a GPT-6 Astra | #10 na Arena text, za Claude Fable 5 | $20/měs. Pro, $5 / $25 API |
| GPT-5.5 Instant | Každodenní práce citlivá na halucinace | O 52,5 % méně halucinovaných tvrzení vs. 5.3 Instant | Úrovně uvažování nyní označeny jako zastaralé | $20/měs. Plus; API $5 / $30 |
| Gemini 3.6 Flash | Rychlý, zdarma, multimodální | Stále model, který dostává bezplatná úroveň Gemini, 1M kontext, #12 na Arena text | Slabší v nejtěžším uvažování; 3.8 Flash jej předčí za stejnou cenu | Zdarma / $0.75 / $3.75 API |
| Fello AI | Všechny top modely, jedna aplikace | ChatGPT + Claude + Gemini + Grok + DeepSeek a další na Macu, iPhonu a iPadu | Směrováno přes aplikaci, ne přímo | $9.99/měs. |
GPT-5.6 si drží volbu pro chat díky dosahu a odstup od lídra preferencí se znovu zvětšil. Sol je nyní na 18. místě textového žebříčku Areny s 1483,5, dolů ze 14., zatímco Claude Fable 5 vede s 1505,7. Na produktu se nic nezměnilo, takže koruna se nehýbe: pořád jde o to, kterého asistenta si nejvíc lidí skutečně otevře. Dvě uvedení, která by jinak byla kandidáty, jimi nejsou: GPT-6 Astra se začátkem září dostal do ChatGPT Business, Pro a Plus, ale OpenAI neoznámila nic pro bezplatnou vrstvu, a Claude Opus 5.5, který 22. září sebral Intelligence Index, je model pro API a tarify Claude, ne výchozí asistent pro miliardu lidí. OpenAI 22. září vydala GPT-6 Sol a GPT-6 Luna a dala je do ChatGPT Work a Codexu s tím, že v Chatu zatím nejsou, takže okno, do kterého většina lidí píše, běží dál na GPT-5.6.
Nejlepší AI na obrázky
Nejlepší AI na generování obrázků je ChatGPT Images 2.5, který OpenAI 8. září nastavila jako výchozí ve všech tarifech ChatGPT a který nyní vede všechny čtyři obrázkové žebříčky, jež sledujeme. Jeho dva modely jsou na každém z nich první a druhý: GPT-Image-2.5 Sunburst, stavěný na přesnost, vede Arena text-to-image s 1423,2 a Arena úpravy obrázků s 1526,0 a vede i kvalitativní Elo od Artificial Analysis s 1196,8 a její žebříček úprav obrázků s 1221,3, přičemž rychlejší GPT-Image-2.5 Flare je na všech čtyřech druhý. To je změna proti minulému měsíci, kdy Artificial Analysis neohodnotila ani jeden model a její žebříčky si s Arenou odporovaly. Odstup mezi Sunburstem a Flare přesto berte jako předběžný, protože ta umístění na Areně stojí na několika tisících hlasů proti 83 000 a 259 000 u GPT Image 2 a na text-to-image oba sdílejí stejné pásmo pořadí. Druhý je MAI-Image-2.6, třetí na žebříčku úprav obrázků od Artificial Analysis s 1191,6 a čtvrtý na žebříčku text-to-image Areny s 1334,0, s Muse Image od Mety na třetím místě. Reve 2.1 si drží argument pro sazbu, typografii a nativní 4K, ale opustil stupně vítězů: je šestý na Arena text-to-image a čtrnáctý na Arena úpravách obrázků. Celý rozbor toho, co vyšlo, najdete v ChatGPT Images 2.5.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| ChatGPT Images 2.5 | Obrázky s čitelným textem | #1 a #2 na všech čtyřech žebříčcích: Arena text-to-image (1423,2 / 1401,3), Arena úpravy (1526,0 / 1481,8), kvalita Artificial Analysis (1196,8 / 1190,4) a úpravy (1221,3 / 1207,0) | Umístění na Areně stojí na několika tisících hlasů | Výchozí ve všech tarifech ChatGPT |
| MAI-Image-2.6 | Úprava obrázku, který už máte | #3 na úpravách obrázků od Artificial Analysis (1191,6) a #4 na Arena text-to-image (1334,0) | Veřejná ukázka, zatím ne v Copilotu ani v Bingu; vedení v úpravách u Artificial Analysis ztratil ve prospěch ChatGPT Images 2.5 | MAI Playground / Microsoft Foundry |
| Muse Image | Úpravy obrázků, ekosystém Meta | #5 na úpravách obrázků od Artificial Analysis (1171,3) a #7 na jejím kvalitativním Elu | Nový, kolem něj tenká nástrojová výbava | Aplikace Meta AI |
| Nano Banana 2 (Gemini 3.1 Flash Image) | Fotorealistické portréty a produkty | #4 v generování obrázků z textu Artificial Analysis, před Nano Banana Pro na žebříčku Areny | V úpravách obrázků Areny je Nano Banana Pro výše | Aplikace Gemini / AI Studio |
| Seedream 5.0 Pro | Vícejazyčný text + úpravy oblastí | 10+ jazyků včetně arabštiny RTL, laso a vrstvové úpravy | Kolem desátého místa na nezávislých žebříčcích; nejistota kolem autorských práv | BytePlus / Magnific |
| Midjourney v8 | Stylizované umění, ilustrace | Estetický základ, který většina umělců preferuje | Slabší v textu v obrázku | $10-$120/měs. |
| Grok Imagine | NSFW / režim Spicy | Nejbenevolentnější mantinely; Arena řadí jeho model Image 2.0 na #5 v text-to-image a na #4 v úpravách obrázků a Artificial Analysis ho má nyní na #4 v kvalitativním Elu | V záznamu o vydáních nic neukazuje, že by Image 2.0 vyšel jako produkt | $30 měsíčně SuperGrok |
ChatGPT Images 2.5 si drží obrázkovou korunu a jeho argument zesílil. Minulý měsíc Artificial Analysis neohodnotila ani jeden z jeho dvou API modelů, takže žebříčky, které sledujeme, si odporovaly: Arena měla Sunburst a Flare na prvním a druhém místě, zatímco Artificial Analysis měla stále GPT Image 2 v čele text-to-image a MAI-Image-2.6 od Microsoftu v čele úprav obrázků. Artificial Analysis teď oba ohodnotila a i tam jsou první a druhý, 1196,8 a 1190,4 na kvalitativním Elu a 1221,3 a 1207,0 na úpravách obrázků. Díky tomu je #1 a #2 na všech čtyřech žebříčcích. MAI-Image-2.6 zůstává druhý, ale klesá na třetí místo žebříčku úprav, který dřív vedl, a Grok Imagine Image 2.0 je nyní čtvrtý na kvalitativním Elu Artificial Analysis a čtvrtý na žebříčku úprav Areny, což je lepší umístění než třetí místo na našem pódiu; stále ho jen uvádíme a nekorunujeme, protože v záznamu o vydáních nic neukazuje, že by vyšel jako produkt.
Nejlepší AI na video
Nejlepší AI na generování videa je Gemini Omni 1.1 Flash, který Google vydal 27. srpna a který vede žebříček text-to-video Areny s 1516, těsně před vlastním předchůdcem Gemini Omni Flash s 1513. Berte to jako remízu: oba leží uvnitř intervalů spolehlivosti toho druhého a Arena sama dává 1.1 Flash pásmo pořadí jedna až čtyři. Rozhoduje specifikace, kde je 1.1 Flash zřetelně schopnější model: prodlužování scény po 10 sekundách až na souhrnných 40 sekund, řízení prvního a posledního snímku, videoreference, náhledy v 360p a výstup v 1080p nebo 4K, za zhruba $0,03 za sekundu v 360p, $0,10 v 720p, $0,15 v 1080p a $0,30 ve 4K. Gemini Omni Flash zůstává levnější volbou kolem $0,10 za sekundu, ale stropuje na 10sekundových klipech. Dvě omezení stojí za zmínku. Artificial Analysis 1.1 Flash vůbec neohodnotila; na jejím žebříčku text-to-video vede starší Omni Flash s 1512,8 před Wan 3.0 od Alibaby s 1431,4 a MiniMax H3 s 1407,7. A na žebříčku image-to-video Areny je 1.1 Flash druhý s 1488,5 za MiniMax H3 s 1495,4, takže koruna stojí na text-to-video a na specifikaci, ne na vyčištění stolu. Pokud potřebujete delší záběry uvnitř nástrojů Googlu, Veo 3.1 stále běží v aplikaci Gemini, v AI Studiu a ve Vertex AI s nativním zvukem a výstupem 1080p. MiniMax H3 (31. července) zůstává soupeřem po stránce specifikace, s klipy ve 2K o délce 4 až 15 sekund a nativním stereo zvukem od $0,13 za sekundu.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| Gemini Omni 1.1 Flash | Nejlepší AI video celkově | #1 Arena text-to-video (1516); prodloužení scény na 40 sekund, výstup ve 4K | Artificial Analysis ho nehodnotila; na Arena image-to-video druhý za MiniMax H3 | $0,03-$0,30/s; Gemini API / AI Studio / Flow |
| Gemini Omni Flash | Levnější desetisekundové klipy | #2 Arena text-to-video (1511), #2 AA video (1238); konverzační úpravy | Končí u desetisekundových generací | ~$0.10/s; aplikace Gemini / AI Studio |
| Wan 3.0 | Video z dokumentů a prezentací | #1 na žebříčku videa od Artificial Analysis (1239); 2-30 s, až 1080p, vstup Omni-Reference | Jen přes API, bez zveřejněných vah; #3 na Areně | $0.05-$0.20/s |
| MiniMax H3 | 2K klipy s nativním zvukem | 4-15 s ve 2K, nativní stereo zvuk; #8 Arena text-to-video (1462) | #4 na AA videu (1227); otevřené váhy neobsahují 2K upscaler a vyžadují žádost v USA, EU, Británii a Jižní Koreji | $0.13/s ve 2K |
| Dreamina Seedance 2.5 | Vyzyvatel od ByteDance | #6 Arena text-to-video (1482); vede image-to-video se zvukem | Ekosystém ByteDance, omezený přístup na Západě | Dreamina / BytePlus |
| Muse Video | Video v ekosystému Meta | #3 generování videa z textu se skóre 1459 | Nejnovější ze skupiny, tenké nástroje | Aplikace Meta AI |
| Veo 3.1 | Delší produkční klipy | Nativní zvuk, 1080p, silná fyzikální konzistence | #6 na Arena video, ne lídr kvality | Google AI Pro / Ultra |
| Kling 3.0 / 3.0 Turbo | Rychlá iterace za nižší cenu | Nativní 4K, 60fps, 15sekundové klipy; Turbo vyšel 17. června | Mimo top 16 na Arena generování videa z textu | Od $10/měs. |
| Luma Ray 3 | Fotorealistické scény | Silný realismus pro krajiny | Menší komunita | Zdarma / od $9.99/měs. |
Gemini Omni 1.1 Flash si drží videokorunu, ale obrázek kolem ní je zamotanější, než naznačoval zápis z minulého měsíce. Stále vede žebříček text-to-video Areny, 1516 proti 1513 u Gemini Omni Flash, a Arena mu dává pásmo pořadí jedna až čtyři, takže to zůstává remíza rozhodnutá schopnostmi. Dvě věci, které jsme uvedli v srpnu, se mezitím změnily. Artificial Analysis znovu překotvila své videoelo a stará trojice 1239 / 1238 / 1235 už neexistuje: Gemini Omni Flash nyní ten žebříček vede s 1512,8 před Wan 3.0 s 1431,4 a MiniMax H3 s 1407,7 a Artificial Analysis 1.1 Flash stále vůbec neohodnotila. A MiniMax H3 obsadil čelo žebříčku image-to-video Areny s 1495,4 a odsunul 1.1 Flash na druhé místo s 1488,5, což je první žebříček, který tato koruna ztratila.
Nejlepší AI na programování
Nejlepší AI na programování je Claude Opus 5.5, který Anthropic vydal 22. září a který vede každý programátorský harness, jaký sledujeme: vlastní Terminal-Bench 4.0 od Artificial Analysis s 59,6 % proti 59,1 % u GPT-6 Astra, LiveBench Coding s 89,3 proti 80,4 a LiveBench Agentic Coding se 71,7 proti 57,3. Dělá to za $4 / $20 za 1M tokenů, tedy za méně než polovinu ceníku obou modelů, které této tabulce vládly minulý měsíc, se čtením z cache za $0,20, a podle vlastního testování Anthropicu stojí běžná zátěž o 40 % méně než na Claude Opus 5. Interní běh Terminal-Bench 4.0 u Anthropicu ten odstup ještě rozšiřuje, 66,4 % proti 57,9 %, které pro Astru uvádí OpenAI, vedle 54,4 % na FrontierCode v1.1 a 57,8 % na CursorBench 4.0. GPT-6 Astra si drží oba programátorské žebříčky Areny, WebDev s 1793 a image-to-WebDev s 1733, protože Opus 5.5 zatím nemá vůbec žádné hlasy Areny, a to je tady poctivé rozdělení: OpenAI vede v lidských preferencích, Anthropic na každém měřeném harnessu. Půlbodový odstup na Terminal-Bench čtěte obezřetně, protože Anthropic sám u toho benchmarku uvádí směrodatnou chybu kolem 2,6 bodu, takže tam oba berte jako vyrovnané a nechte rozhodnout žebříčky LiveBench a cenu. Claude Fable 5.1 je druhý na obou žebříčcích Areny a třetí na harnessech. Qwen3.8-Max-0902 od Alibaby držel WebDev Areny zhruba tři dny na začátku září a dnes je pátý s 1662. Mezi otevřenými vahami se obrázek změnil 21. září: MiMo-V2.6-Pro od Xiaomi bere 34,8 % na Terminal-Bench 4.0 pod čistou licencí MIT za $0,13 na úlohu indexu, zatímco GLM-5.3 je na tom harnessu stále nejsilnějším otevřeným modelem se 41,9 % a Kimi K3 je nejvýše postaveným otevřeným modelem na Arena WebDev, sedmý s 1658, ovšem jen s 12,6 % na harnessu. Artificial Analysis zrušila jak svůj Coding Index, tak Coding Agent Index, takže dvě složené programátorské žebříčky, které tato stránka citovala, už neexistují.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena (za 1M tokenů) |
|---|---|---|---|---|
| Claude Opus 5.5 | Nejlepší programování celkově | #1 Terminal-Bench 4.0 (59,6 %), #1 Intelligence Index (57,6, v4.3.2) a #1 LiveBench Coding (89,3) | Zatím žádné hlasy Areny, takže Astra si drží oba své programátorské žebříčky | $4 / $20 |
| GPT-6 Astra | Vrchol obou programátorských žebříčků Areny | #1 Arena WebDev (1793) a #1 image-to-WebDev (1733); 59,1 % Terminal-Bench 4.0 | 2,5krát cena Opusu 5.5 a za ním na každém harnessu | $10 / $50 |
| Claude Fable 5.1 | Nejvyšší složené skóre před Opusem 5.5 | #2 na obou programátorských žebříčcích Areny; Intelligence Index 53,4; AA-Briefcase 1678 | 52,0 % Terminal-Bench 4.0; 2,5krát cena Opusu 5.5 | $10 / $50 |
| Claude Opus 5 | Nahrazen Opusem 5.5 | 49,0 % Terminal-Bench 4.0 a #3 na obou programátorských žebříčcích Areny | Stojí za token víc než Opus 5.5 a má o sedm bodů nižší skóre | $5 / $25 |
| Claude Fable 5 | Nejtěžší dlouhohorizontová agentní práce | Intelligence Index 49,6; 42,4 % Terminal-Bench 4.0; kontext 1M | Nejdražší na úlohu indexu v této tabulce, $8,75; #6 na Arena image-to-WebDev | $10 / $50 |
| Qwen3.8-Max-0902 | Krátký držitel žebříčku WebDev Areny | #5 Code Arena: WebDev (1662); Intelligence Index 45,4; 2,4 bilionu parametrů, kontext 1M | Jen API QwenCloud bez spotřebitelského rozhraní; vedení na WebDev ztratil během dní | $2 / $6 |
| Kimi K3 | Nejvýše postavený otevřený model na Areně | #7 Arena WebDev (1658), nejlepší otevřené umístění na tom žebříčku; 2,8 bilionu/104 mld. aktivních | Jen 12,6 % na Terminal-Bench 4.0; 1,56 TB pro vlastní hosting | $3 / $15 |
| GPT-5.6 Sol | Levnější vlajková loď OpenAI | Intelligence Index 47,0; 39,9 % Terminal-Bench 4.0 | Nahrazen GPT-6 Sol, který má vyšší skóre za poloviční cenu; METR u něj označil obcházení testů | $4 / $20 |
| GPT-6 Sol | Levné programování v GPT-6 uvnitř Codexu | Intelligence Index 47,5 (v4.3.2) a 43,9 % Terminal-Bench 4.0, obojí nad GPT-5.6 Sol, za poloviční cenu | Žádné hlasy Areny; jen v Codexu a ChatGPT Work, ne v Chatu | $2 / $10 |
| Muse Spark 1.3 | Levné agentní programování | Intelligence Index 48,1 za $1,25 / $4,25 a $1,60 na úlohu indexu | 33,3 % na Terminal-Bench 4.0; programátorské výhry pocházejí z vlastního grafu Mety, měřeného na variantě max jen pro partnery | $1,25 / $4,25 |
| Grok 4.7 | Levný poměr cena/výkon | 46,3 % CursorBench 4.0 a 71,0 % DeepSWE v1.1 podle vlastních čísel SpaceXAI; Intelligence Index 46,3 | 24,7 % na Terminal-Bench 4.0; prompty od 200 tis. tokenů přeúčtují celý požadavek dvojnásobkem | $2 / $6 |
| Gemini 3.8 Flash | Agentní programování ve velkém | Intelligence Index 40,9; 308,4 výstupních tokenů za sekundu | 19,7 % na Terminal-Bench 4.0; zaváděcí cena se 1. ledna 2027 zdvojnásobí | $0,75 / $3,75 |
| GLM 5.3 Flash | Nejlevnější seriózní kodér, kterého uhostíte | 32,8 % Terminal-Bench 4.0 za $0,25 na úlohu indexu; MIT, 320 mld./18 mld. aktivních | GLM-5.3 dosahuje na témže harnessu 41,9 %; žádný spotřebitelský produkt | Otevřené váhy (MIT) |
| MiMo-V2.6-Pro | Nejvyšší otevřený Intelligence Index | 46,3 na v4.3.2 a 34,8 % Terminal-Bench 4.0 za $0,13 na úlohu indexu; MIT, 1,02 bilionu/42 mld. aktivních | Zveřejněn 21. září, takže zatím žádné hlasy Areny ani nezávislá historie | $0,435 / $0,87 |
Programátorská koruna přešla na Claude Opus 5.5, čtyři dny poté, co připadla GPT-6 Astra. Anthropic ho vydal 22. září a vede každý programátorský harness, jaký sledujeme: 59,6 % proti 59,1 % u Astry na vlastním Terminal-Bench 4.0 od Artificial Analysis, 89,3 proti 80,4 na LiveBench Coding a 71,7 proti 57,3 na LiveBench Agentic Coding, za $4 / $20 proti $10 / $50. Astra si drží oba programátorské žebříčky Areny, protože Opus 5.5 tam zatím nemá hlasy, takže jde o rozdělení, ne o vyčištění stolu. Odstup na Terminal-Bench je půl bodu proti směrodatné chybě, kterou Anthropic klade kolem 2,6, takže ve skutečnosti rozhodují žebříčky LiveBench a cena. Claude Opus 5 opouští stupně vítězů: Opus 5.5 stojí za token méně, spotřebuje méně tokenů a má o sedm bodů vyšší Intelligence Index, což starý argument o výhodné ceně u Opusu 5 nečiní jen slabším, ale rovnou neplatným. Do tabulky přibývají MiMo-V2.6-Pro od Xiaomi a Grok 4.7 od SpaceXAI a všechna čísla indexu na této stránce se přesunula na v4.3.2, proto jsou o kousek níž než minulý měsíc. GPT-6 Sol přibyl do tabulky týž den za $2 / $10: Artificial Analysis ho měří na 47,5 na indexu a na 43,9 % na Terminal-Bench 4.0, v obojím nad GPT-5.6 Sol a za poloviční cenu, ale s velkým odstupem za Opusem 5.5, a k vývojářům se dostává přes Codex, ne přes chatovací okno.
Nejlepší AI na kreativitu
Nejlepší AI na necenzurovanou, trendovou tvorbu je Grok 4.7 a chceme být přesní v tom proč. Tahle volba je o produktové řadě, ne o kvalitě prózy. Grok nese nejméně obsahových omezení ze všech špičkových modelů a jako jediný má nativní napojení na X v reálném čase, což z něj dělá jediný model, který se pustí do odvážných, aktuálních nebo záměrně provokativních zadání, jaká ostatní odmítají. Dostupnost čtěte pozorně: SpaceXAI vydala Grok 4.7 dne 21. září do Grok API, Cursoru, Grok Buildu, cizích harnessů a cloudových routerů a její oznámení neříká nic o spotřebitelské aplikaci, která předplatitelům SuperGrok a X Premium+ za $30 měsíčně stále servíruje Grok 4.6. Není to nejlepší pisatel. Arena už Grok 4.6 ohodnotila a je na 32. místě žebříčku kreativního psaní, před Grokem 4.5 na 36. místě, ale za starším Grokem 4.20-beta1 na 23. EQ-Bench neohodnotil ani 4.6, ani 4.7 a na tom žebříčku je Grok 4.5 na 46. místě s 1576,0, což je nově těsně před Grokem 4.20-beta, ne za ním. Protože SpaceXAI mířila oběma vydáními na programování a agentní práci, ne na prózu, nepředpokládáme, že 4.7 tady něco posunul. Pokud vybíráte čistě podle kvality výstupu, žebříček kreativního psaní Areny stále vede Claude Fable 5, zatímco EQ-Bench staví na první místo GPT-6 Astra s 2163,9, Claude Fable 5.1 na druhé a Kimi K3 na čtvrté. Grok volte podle toho, co vám dovolí vytvořit, ne podle toho, jak dobře píše.
| Model | Nejlepší pro | Silná stránka | Slabina | Cena |
|---|---|---|---|---|
| Grok 4.7 | Necenzurovaný, vyhraněný, trendový | Nejméně obsahových omezení, nativní ukotvení v X v reálném čase | Žádný žebříček kreativního psaní ho neohodnotil; Grok 4.6 je #32 na kreativním psaní Areny | $2 / $6 API; aplikace SuperGrok za $30 měsíčně, stále na 4.6 |
| Claude Fable 5 | Tvůrčí próza nejvyšší kvality | #1 Arena tvůrčí psaní, #1 LiveBench Language | Opatrné mantinely u odvážných zadání | $10 / $50 API |
| Kimi K3 | Beletrie a osobitý hlas | #4 EQ-Bench Creative Writing s 2070,6 | Na kreativním psaní Areny jen #27 | $3 / $15 |
| Claude Opus 5 | Strukturovaná dlouhá tvůrčí práce | Drží dlouhá vlákna a sám se edituje; Intelligence Index 50,8, za Claude Fable 5.1 a GPT-6 Astra | Nejopatrnější ze skupiny | $20/měs. Pro; $5 / $25 API |
| Gemini 3.1 Pro | Multimodální tvůrčí práce | Silný řetězec textu, obrázku a videa | Kvóty v aplikaci Gemini | Zdarma / $2.00-$4.00 API vstup |
| Grok Imagine (Spicy Mode) | NSFW / tvůrčí práce pro dospělé | Nejvolnější generování obrázků | Nika | $30/měs. SuperGrok |
Grok si tuto volbu drží, nově na Groku 4.7, který SpaceXAI vydala 21. září na novém a větším základním modelu. Na benevolenci produktu ani na jeho živém přístupu k X se nic nezměnilo, a právě na tom volba stojí. Model pod tím je zase silnější, 46,3 na Intelligence Indexu proti 44,3 u Groku 4.6, jenže ten přírůstek dopadl do programování a agentní práce, ne do prózy, a žádný žebříček kreativního psaní 4.7 neohodnotil. Jedna oprava proti minulému zápisu: Arena mezitím Grok 4.6 ohodnotila a je na 32. místě jejího žebříčku kreativního psaní, takže věta, že ho neohodnotil ani jeden žebříček, už neplatí. Všimněte si i rozdělené dostupnosti, protože pro tuto kategorii je podstatná: 4.7 je v API, v Cursoru a v Grok Buildu, zatímco aplikace Grok za $30 měsíčně, o kterou u benevolence vlastně jde, stále běží na 4.6. Claude Fable 5 zůstává modelem, po kterém sáhnout, když chcete lepší text.
Nejlepší AI na přesnost & výzkum
Nejlepší AI na přesnost a rešerše je Claude Fable 5.1, který drží nejvyšší faktickou přesnost, jakou Artificial Analysis změřila, 67 % na AA-Omniscience. To je přesně ten sloupec, podle kterého se tato kategorie rozhoduje, a 22. září obstál v tvrdé zkoušce: Claude Opus 5.5 porazil Fable 5.1 skoro ve všem ostatním, včetně Humanity's Last Exam 61,4 % proti 59,1 % a indexu AA-Omniscience s penalizací halucinací 46,4 proti 43,5, ale v syrové faktické přesnosti má 66 % proti 67 % u Fable 5.1. Ten jednobodový rozdíl berte sám o sobě jako remízu a čtěte oba modely dohromady: Opus 5.5 je lepší volba, když je špatná odpověď horší než žádná, Fable 5.1 tehdy, když chcete co nejvíc faktů správně. Volbou pro nejlepší poměr je Gemini 3.1 Pro a stále je to model, po kterém sáhneme, když jde o cenu. Jeho nejsilnějším výsledkem je ARC-AGI-1 od ARC Prize, kde má 98 % a vyrovnává lidský panel, a to za $0,52 na úlohu, i když Claude Fable 5 a GPT-6 Astra mezitím panel překonaly s 98,5 %. K tomu přidává nativní ukotvení ve Vyhledávání Google, což je to, co chcete, když má být odpověď aktuální, ne jen věrohodná. Má také 94,1 % na GPQA Diamond, kde se mu GPT-5.6 Sol nově vyrovnává místo aby zaostával, a 44,4 % na Humanity's Last Exam, a 46,44 na žebříčku HLE od Scale SEAL, který nyní vede Claude Fable 5 s 55,5 %. Dvě poctivé výhrady. Konkrétně u ukotveného vyhledávání vede žebříček vyhledávání Areny OpenAI, ne Google ani Anthropic: GPT-5.6 Sol je v čele s 1257, Claude Fable 5 pátý a Gemini 3.1 Pro s ukotvením devátý. A u nového uvažování sedí koruna úplně jinde, protože GPT-6 Astra vede ARC-AGI-2 i ARC-AGI-3. Tuto korunu jsme nepřesunuli na Claude Opus 5, protože Artificial Analysis mu měří míru halucinací 50 % a na AA-Omniscience ho staví výrazně pod oba modely Fable.
| Model | Nejlepší pro | Klíčový benchmark | Slabina | Cena |
|---|---|---|---|---|
| Claude Fable 5.1 | Nejvyšší naměřená faktická přesnost | 67 % faktické přesnosti na AA-Omniscience, nejvíc, co kdy Artificial Analysis změřila, o bod nad Claude Opus 5.5 | Žádná levná varianta; na žebříčku vyhledávání Areny nehodnocen; Opus 5.5 vede Humanity's Last Exam i index AA-Omniscience | $10 / $50 |
| Gemini 3.1 Pro | Nejlepší poměr, levná faktická práce | 98 % ARC-AGI-1 (vyrovnává lidský panel) za $0.52/úlohu, 94,1 % GPQA (vyrovnáno Sol) | ARC-AGI-2 77,1 % nyní ~14.; #9 na Arena vyhledávání | $2.00-$4.00 / $12.00-$18.00 (odstupňováno) |
| Claude Fable 5 | Ukotvené vyhledávání | #5 na žebříčku vyhledávání Areny, za GPT-5.6 Sol | Žádná jediná levná úroveň | $10 / $50 (Fable 5) |
| GPT-5.6 Sol | Nové uvažování | #3 ARC-AGI-2 se skóre 92,5 %, za GPT-6 Astra (95 %) a Claude Opus 5.5 (93,3 %) | Scheming označen METR | $4 / $20 |
| Claude Opus 5 | Nejtěžší neviděné problémy | #1 ARC-AGI-3 se skóre 30 %, ~3,75násobek dalšího modelu (ARC Prize) | Artificial Analysis měří míru halucinací 50 % | $5 / $25 |
| Qwen 3.7 Max | Frontier přesnost za výhodnou cenu | 92,4 GPQA Diamond, 200 dotazů zdarma/den | Jen API, žádné chatovací rozhraní | $1.25 / $3.75 promo; $2.50 / $7.50 ceníková |
| Claude Opus 4.6 | Poctivost pod tlakem | #1 na žebříčku MASK od Scale SEAL se skóre 96,28; Anthropic drží top 5 | Nahrazen jako vlajkový model | Starší model Anthropicu |
Koruna za přesnost zůstává Claude Fable 5.1 a prošla tvrdou zkouškou. Claude Opus 5.5 dorazil 22. září a sebral Humanity's Last Exam s 61,4 % proti 59,1 % a index AA-Omniscience s penalizací halucinací se 46,4 proti 43,5, jenže tato kategorie se rozhoduje podle sloupce syrové faktické přesnosti a tam má Fable 5.1 stále 67 % proti 66 % u Opusu 5.5. To je jednobodový rozdíl, takže blok teď rovnou říká, že se ti dva dělí, místo aby předstíral, že Fable 5.1 vyhrává na celé čáře: Opus 5.5 použijte, když je špatná odpověď horší než žádná, Fable 5.1 tehdy, když chcete co nejvíc faktů správně. A ještě dvě opravy proti minulému zápisu. Stálo tam, že ARC-AGI-2 vede GPT-5.6 Sol a ARC-AGI-3 Claude Opus 5; oba vede od svého uvedení 3. září GPT-6 Astra, jak už blok o řešení problémů uváděl, a ten rozpor je pryč. A ARC-AGI-1 se posunul nad lidský panel: Claude Fable 5 i GPT-6 Astra mají 98,5 %, kde panel z roku 2025 má 98 %, takže 98 % u Gemini 3.1 Pro za $0,52 na úlohu je stále pravda a stále je to argument o ceně, ale už to není čelo toho žebříčku. Druhým posunem v přesnosti je tento měsíc GPT-6 Sol, a to pod korunou: Artificial Analysis mu měří míru halucinací 60 % proti 92 % u GPT-5.6 Sol, přičemž holá faktická přesnost klesá z 59 % na 55 %, což jeho index AA-Omniscience zvedá z 22,0 na 27,1.
Nejlepší AI na řešení problémů
Nejlepší AI na těžké řešení problémů je GPT-6 Astra, která sebrala žebříčky uvažování GPT-5.6 Sol během několika dní od startu. Vede LiveBench Reasoning se skóre 92,65 a ARC-AGI-2 s 95 %, nejvíc, co kdo proti stoprocentnímu lidskému panelu tohoto žebříčku zvládl, a na LiveBench Mathematics je třetí se skóre 96,81 za 97,08 u Claude Opus 5.5 a 97,01 u Claude Fable 5.1. Uvádí také 97,6 % na FrontierMath Tier 4 v2, číslo, které je třeba brát spolu s informací Epoch AI, že OpenAI benchmark financovala a k části z něj má výhradní přístup. Háček je v ceně a dosahu: $10 / $50 za 1M tokenů proti $4 / $20 u Sol a vyžaduje placený tarif ChatGPT. GPT-5.6 Sol je cenově výhodnou alternativou, na obou žebříčcích LiveBench třetí se skóre 96,20 a 91,65 a na ARC-AGI-2 třetí, od chvíle, kdy Claude Opus 5.5 dosáhl 93,3 %. GPT-6 Sol stojí polovinu, $2 / $10, a na indexu Artificial Analysis ho předčí, jenže žádný žebříček uvažování ho zatím neohodnotil. Qwen 3.7 Max je rozpočtovou volbou pro soutěžní úlohy se skóre 97,1 na únorovém indexu HMMT 2026 a 44,5 na Apexu, s 200 bezplatnými dotazy denně. Claude Opus 5 zůstává alternativou pro dlouhé agentické řetězce uvažování, i když mu Astra sebrala i ARC-AGI-3.
| Model | Nejlepší pro | Klíčový benchmark | Slabina | Cena |
|---|---|---|---|---|
| GPT-6 Astra | Nejtěžší matematika, věda a uvažování | #1 LiveBench Reasoning (92,65), #1 ARC-AGI-2 (95 %), #1 ARC-AGI-3 | Vyžaduje placený tarif ChatGPT; 2,5x cena Sol | $10 / $50 |
| Claude Opus 5 | Dlouhé agentické řetězce uvažování | #2 AA-Briefcase (1673) a #2 GDPval-AA v2.1 (1708); 30,2 % ARC-AGI-3 | ARC-AGI-3 nyní vede Astra; 50% míra halucinací | $5 / $25 |
| GPT-5.6 Sol | Cenově výhodný STEM model | #3 ARC-AGI-2 (92,5 %); #3 LiveBench Mathematics (96,20) a Reasoning (91,65) | FrontierMath stále nezveřejněn; METR označil manipulaci | $100/měs. ChatGPT Pro; API $4 / $20 |
| GPT-6 Sol | Táž úroveň za poloviční cenu | Intelligence Index 47,5 (v4.3.2) proti 47,0 u GPT-5.6 Sol, za $1,06 na úlohu indexu proti $1,99 | Nehodnotil ho ani LiveBench, ani ARC Prize, takže tu nedrží žádný žebříček | $2 / $10 |
| Qwen 3.7 Max | Soutěžní matematika na rozpočet | 97,1 HMMT 2026 únor, 44,5 Apex, 200 dotazů zdarma/den | Jen API | $1.25 / $3.75 promo; $2.50 / $7.50 ceníková |
| Claude Fable 5 | Matematika uvnitř programátorského workflow | #1 na matematické podkategorii Areny (1543), 96,0 LiveBench Mathematics | Nejdražší volba zde | $10 / $50 |
| GLM 5.3 Flash | Open-weight řešení problémů | Intelligence Index 41,8 pod MIT, o téměř osm bodů více než GLM-5.2 při méně než poloviční velikosti; 320B/18B aktivních, 1M kontext | Potřebuje multi-GPU server, ne pracovní stanici; GLM 5.3 skóruje výš podle vlastních čísel Z.ai a od 28. srpna jej lze stáhnout, ale ve více než dvojnásobné velikosti a pod vlastní licencí | Open weights (MIT) |
Koruna za řešení problémů přešla na GPT-6 Astra, která během několika dní od startu 3. září sebrala žebříčky, podle nichž se tato kategorie rozhoduje. Vede LiveBench Reasoning se skóre 92,65 proti 91,65 u GPT-5.6 Sol, bere ARC-AGI-2 s 95 % proti 92,5 % u Sol a vytlačila Claude Opus 5 z ARC-AGI-3, kde jejích 62,7 % na standardním harnessu překonává 30,2 % u Opus 5. Čísla z ARC-AGI-3 čtěte pozorně: tento žebříček měří efektivitu akcí na úrovni člověka v neznámých prostředích, nikoli počet vyřešených úloh, a široce citovaných 98,6 % pochází z harnessu s adaptérem poskytovatele, ne ze standardního. Sol klesl na obou žebříčcích LiveBench na třetí místo, ale zůstává cenově výhodnou alternativou za $4 / $20 proti $10 / $50 u Astry, a LiveBench Mathematics mezitím dvakrát změnil držitele, na Claude Fable 5.1 se skóre 97,01 a 22. září na Claude Opus 5.5 se skóre 97,08. Potom se pohnuly dvě věci. ARC Prize ohodnotila Claude Opus 5.5 na 93,3 % na ARC-AGI-2, což posouvá GPT-5.6 Sol na tomto žebříčku na třetí místo, a 22. září dorazil GPT-6 Sol za $2 / $10, tedy polovinu ceny úrovně 5.6, s vyšším Intelligence Indexem, ale zatím bez vlastního skóre na LiveBenchi či u ARC Prize.
Nejlepší AI agent
Nejlepší AI agent je Gemini Spark, pokud chcete agenta v cloudu, a Claude Cowork, pokud ho chcete na svém počítači. Jde o společné volby, nikoli o první a druhé místo: Spark běží ve virtuálním stroji Google Cloud, takže pracuje dál i se zavřeným notebookem, a je propojený s Gmailem, Dokumenty a od začátku září i s Fotkami Google; Cowork běží na vašem Macu nebo Windows a ovládá vaše místní aplikace i obrazovku. Žádný nezávislý žebříček tyto dva produkty proti sobě neměří, takže rozhodující je, kde má práce probíhat, ne kdo má vyšší skóre. Ani cena už jazýčkem na vahách není: Spark je nyní dostupný na tarifu Google AI Pro za $19.99/měsíc v USA a ve více než 160 dalších zemích a Cowork je bez příplatku součástí každého placeného tarifu Claude od $20/měsíc. ChatGPT Codex Mobile (14. května) je alternativou pro práci s programovacím agentem a prohlížečoví agenti třídy OpenAI Operator pro webové úlohy. Přečtěte si celé srovnání Gemini Spark vs Claude Cowork.
| Agent | Nejlepší pro | Kde běží | Silná stránka | Cena |
|---|---|---|---|---|
| Gemini Spark | 24/7 cloudové úlohy, workflow Workspace | Google Cloud VM (vždy zapnuto) | První skutečný agent 24/7, hluboká integrace Workspace | Od $19.99/měs. Google AI Pro |
| Claude Cowork | Desktop, řízení aplikací, design + kód | Váš desktop Mac/Windows | Řídí lokální aplikace, vidí vaši obrazovku | $20/měs. Claude Pro |
| ChatGPT Codex Mobile | Programátorský agent v telefonu | Cloud OpenAI + iOS/Android | Schvalování diffů a přesměrování práce z telefonu | Zahrnuto v plánech ChatGPT |
| Grok Agentic (Grok 4.7) | Rešerše v reálném čase, sběr z X | Cloud SpaceXAI | Nativní integrace X; Elo 1695 na GDPval-AA v2.1, čtvrtý mezi odlišnými modely | $30 měsíčně SuperGrok, stále na 4.6 |
| OpenAI třídy Operator | Úlohy v prohlížeči, webové formuláře | Cloud OpenAI + váš prohlížeč | Webová automatizace | ChatGPT Pro |
Žádný nový spotřebitelský agentní produkt nevyšel, takže se koruny nehýbou: Gemini Spark (cloud) a Claude Cowork (počítač) zůstávají společnými volbami rozdělenými podle toho, kde agent běží. Spark se přesto rozšířil, dostal se na tarif Google AI Pro za $19,99 měsíčně a získal Fotky Google, kde umí hledat, upravovat, kurátorovat a spouštět plánované pracovní postupy. Vrstva modelů pod tím se posunula hodně a většina posunu přišla 22. září. Claude Opus 5.5 nyní vede oba agentní žebříčky, které Artificial Analysis publikuje: AA-Briefcase v1.1 s 1822 proti 1678 u Claude Fable 5.1 a 1673 u Claude Opus 5 a GDPval-AA v2.1 s 1846 proti 1735 a 1708. Zároveň se vyrovnává GPT-6 Astra na Terminal-Bench 4.0 za $4 / $20 proti $10 / $50, což z něj dělá model, na kterém by dnes většina týmů měla stavět, místo doporučení Opusu 5, které tento blok nesl. Agent Arena od Areny ho neohodnotila a tam stále vede Claude Fable 5.1 s 19,8 % dokončených úloh, GPT-6 Astra je druhý se 17,7 %, DeepSeek V4.1-Flash třetí a Claude Opus 5 čtvrtý. Druhým hybatelem je Grok 4.7 od SpaceXAI (21. září): 1695 na GDPval-AA v2.1 a 1657 na AA-Briefcase ho staví na čtvrté a sedmé místo, v obou nad GPT-6 Astra, byť míří do API, Cursoru a Grok Buildu, ne do spotřebitelského agentního produktu. Muse Spark 1.3 od Mety je na GDPval-AA v2.1 pátý mezi odlišnými modely s 1674, tedy pod Grokem 4.7, ne nad ním, jak jsme uváděli minulý měsíc, a Scale SEAL stále ohodnotil jen starší 1.1, který vede jeho žebříček práce s nástroji MCP Atlas s 88,1. GLM 5.3 Flash (26. srpna, MIT) je stále otevřený agentní model, který bychom hostovali, s AutomationBench 48,8 na vlastním grafu Z.ai, kde Claude Opus 4.8 dosahuje 41,0; na signálu dokončení úloh v Agent Areně je GLM-5.2 sedmnáctý a Kimi K3 pátý, přičemž nejvýše postaveným otevřeným modelem je DeepSeek V4.1-Flash na třetím místě.
Přední modely jako ChatGPT, Claude a Gemini pohromadě na Macu, iPhonu a iPadu.
Začněte zdarma, hodnocení 4,7★ napříč 27 000+ recenzemi.
Stáhnout Fello AINejlepší AI pro studenty
Nejlepší AI pro studenty je GPT-5.6 Luna uvnitř ChatGPT pro obecnou práci na kurzech a Gemini 3.6 Flash uvnitř aplikace Gemini pro STEM a multimodální studium, s Qwen 3.7 Max jako API alternativou pro těžší sady úloh (200 dotazů zdarma denně) a Claude Opus 5 jako alternativou pro úpravy esejí. Většina studentů nemusí platit a bezplatný tarif se 6. srpna zlepšil: GPT-5.6 Luna se stal výchozím modelem pro ChatGPT Free a Go, s neomezenými textovými chaty a tlačítkem Think pro těžší otázky, i když nahrávání souborů a obrazové nástroje zůstávají omezené. 22. září OpenAI přidala uživatelům Free a Go GPT-6 Luna v desktopové aplikaci ChatGPT, tedy model aktuální generace na bezplatné úrovni už od prvního dne, i když na indexu Artificial Analysis má stejných 37,3 jako GPT-5.6 Luna. Gemini 3.6 Flash je stále to, co nabízí bezplatná aplikace Gemini, Claude Sonnet 5 je výchozí bezplatný Claude a DeepSeek V4 je zdarma na chatovacím webu DeepSeeku. Luna je nejlevnější, nikoli nejsilnější člen rodiny GPT-5.6, takže když esej vyžaduje větší péči, sáhněte po tlačítku Think nebo přepněte na GPT-5.5. Pro krok za krokem řešení nejtěžší matematiky je GPT-5.6 Sol placenou vlajkovou lodí OpenAI a GPT-6 Astra nyní uvádí 97,6 % na FrontierMath Tier 4 v2 proti ověřeným 39,6 % u GPT-5.5 Pro, i když Astra zatím není v bezplatném tarifu ChatGPT; Qwen 3.7 Max je hodnotnou alternativou s 97,1 na HMMT únor 2026 a API cenou $1,25 / $3,75 v současné 50% akci ($2,50 / $7,50 ceníkově).
| Úloha | Nejlepší model | Proč | Zdarma? | Alternativa |
|---|---|---|---|---|
| Eseje & práce na kurzech | GPT-5.6 Luna | Výchozí zdarma v ChatGPT od 6. srpna; neomezené textové chaty a od 22. září i GPT-6 Luna v desktopové aplikaci | Ano | Claude Sonnet 5 (Claude zdarma) |
| Řešení STEM úloh | GPT-5.6 Sol / Qwen 3.7 Max | Placená STEM vlajková loď; Astra uvádí 97,6 % FrontierMath Tier 4 v2 / 97,1 HMMT únor 2026 | Pro placené / Qwen API placené | Gemini 3.6 Flash (zdarma) |
| Výzkum & přesnost | Gemini 3.1 Pro | 98 % ARC-AGI-1 za $0.52/úlohu, nativní ukotvení ve vyhledávání Google | Ano (aplikace Gemini) | Claude Opus 5 |
| Úpravy textu | Claude Sonnet 5 | Zdarma a výchozí na claude.ai; Claude Fable 5 je lídr kvality | Ano (Claude zdarma) | Claude Fable 5 |
| Multimodální studium (PDF, snímky, obrázky) | Gemini 3.6 Flash | 1M kontext, zdarma v aplikaci Gemini | Ano | NotebookLM (Google) |
Bezplatný tarif je to, co se v tomto průvodci posunulo. OpenAI 6. srpna udělalo z GPT-5.6 Luna výchozí model pro ChatGPT Free a Go a oběma dalo neomezené textové chaty plus tlačítko Think pro těžší otázky, takže bezplatnou volbou je nyní Luna místo GPT-5.5, který zůstává volitelný, když esej vyžaduje větší péči. Nahrávání souborů, obrázky a další nástroje jsou stále omezené. Na straně Googlu se nic nezměnilo: Gemini 3.8 Flash vyšel 2. září, ale k bezplatným uživatelům se dostane jen přes AI Studio a API, takže bezplatná aplikace Gemini stále nabízí 3.6 Flash a ten si drží multimodální řádek. GPT-6 Astra (3. září) je ta, kterou u těžkých sad úloh sledovat, s uváděnými 97,6 % na FrontierMath Tier 4 v2 proti ověřeným 39,6 % u GPT-5.5 Pro, ale vyžaduje placený tarif ChatGPT a žádný bezplatný tarif ji nezahrnuje. Bezplatná úroveň se pohnula znovu 22. září: uživatelé Free a Go se nyní k GPT-6 Luna dostanou v desktopové aplikaci ChatGPT. Berte to spíš jako levnější než chytřejší, protože Artificial Analysis mu dává 37,3, stejně jako verzi 5.6, a ARC Prize je na ARC-AGI-2 odděluje o dvě desetiny bodu.
Nejlepší AI pro práci & profesionály
Nejlepší AI pro profesionální práci je GPT-5.6 (výchozí model ChatGPT od 9. července) pro každodenní znalostní práci, Claude Opus 5 pro programování a psaní s vysokou mírou odpovědnosti a Gemini Spark pro agentické workflow 24/7. Většina profesionálů vytěží nejvíc, když provozuje dvě placená předplatná (ChatGPT Plus za $20/měsíc plus Claude Pro za $20/měsíc, celkem $40/měsíc), nebo konsoliduje s Fello AI za $9.99/měsíc pro všech pět top modelů v jedné aplikaci pro Mac/iOS. Pro agentickou práci, která běží, když spíte, je Gemini Spark jediným skutečným cloudovým agentem 24/7 a od 30. července je dostupný nejen na Google AI Ultra, ale i na tarifu Google AI Pro za $19.99/měsíc.
| Případ použití | Nejlepší model | Klíčový údaj | Cena | Alternativa |
|---|---|---|---|---|
| Každodenní znalostní práce | GPT-5.6 | Výchozí model ChatGPT od 9. července; asistent, kterého většina otevře | $20/měs. ChatGPT Plus | Claude Opus 5 |
| ChatGPT Work a Codex | GPT-6 Sol | V ChatGPT Work a Codexu pro Plus, Pro, Business, Enterprise a Edu od 22. září, v API za $2 / $10 | $20/měs. ChatGPT Plus | GPT-6 Luna na objemovou práci |
| Programování (uzavřené modely) | Claude Opus 5.5 | #1 Terminal-Bench 4.0 (59,6 %) a #1 na obou programátorských žebříčcích LiveBench, za $4 / $20 | $20 měsíčně Claude Pro | GPT-6 Astra, který si drží oba programátorské žebříčky Areny |
| Programování (cenově výhodné) | Qwen3.8-Max-0902 | #5 Code Arena: WebDev (1662), za GPT-6 Astra, Claude Fable 5.1, Claude Opus 5 a starším Qwen3.8-Max; jen API na QwenCloud | $2 / $6 | Qwen 3.7 Max; DeepSeek V4.1-Flash |
| Výzkum & podklady | Gemini 3.1 Pro | 98 % ARC-AGI-1 za $0.52/úlohu, ukotvení Google | Google AI Pro / Ultra | Claude Opus 5 |
| Těžká matematika, fyzika, finanční modelování | GPT-6 Astra | #1 LiveBench Reasoning a ARC-AGI-2 (95 %); uvádí 97,6 % FrontierMath Tier 4 v2 | $100/měs ChatGPT Pro | GPT-5.6 Sol; Qwen 3.7 Max |
| Nepřetržité agentické workflow | Gemini Spark | První cloudový agent 24/7 | Od $19.99/měs. Google AI Pro | Claude Cowork |
| Živé zprávy, tvůrčí práce s kontextem X | Grok 4.7 | Intelligence Index 46,3 + nativní ukotvení v X; aplikace Grok stále běží na 4.6 | $30 měsíčně SuperGrok | Gemini 3.1 Pro |
| Konsolidace vše v jednom | Fello AI | ChatGPT + Claude + Gemini + Grok + DeepSeek | $9.99/měs. | Platit každému dodavateli zvlášť |
Tři uvedení přišla v prvních třech zářijových dnech a čtvrté 22. září, a právě to poslední mění cenový argument, na kterém tento blok stojí. Claude Opus 5.5 vede Intelligence Index od Artificial Analysis s 57,6 na v4.3.2 i oba její agentní žebříčky, a dělá to za $4 / $20 proti $5 / $25 u Claude Opus 5. Úvaha, kterou tento blok nesl, tedy že týmy mají začínat u Opusu 5, protože stojí polovinu toho co lepší modely, už neplatí: Opus 5.5 je zároveň lepší i levnější, takže přebírá řádek pro programování v uzavřených modelech a je to model, na kterém bychom stavěli běžnou práci. Řádek denního asistenta si přesto drží GPT-5.6, protože ten je o dosahu, ne o skóre, a ani Opus 5.5, ani GPT-6 Astra nejsou výchozí volbou pro stovky milionů lidí. Qwen3.8-Max-0902 od Alibaby (2. září) si drží řádek cenově efektivního programování za $2 / $6, i když je jen v API na QwenCloud bez spotřebitelského rozhraní. GPT-6 Sol a GPT-6 Luna dorazily 22. září přesně do prostředí, o kterém je tento blok: do ChatGPT Work a Codexu, pro Plus, Pro, Business, Enterprise a Edu, v API za $2 / $10 a $0,10 / $0,50, a ne do běžného chatovacího okna.
Ceny AI modelů v září 2026
Od bezplatných verzí za $0 po Google AI Ultra za $199,99 měsíčně. Nejzásadnější cenou v této tabulce je Claude Opus 5.5 za $4 / $20, protože Anthropic 22. září vydal nejlépe hodnocený model, jaký kterýkoli nezávislý hodnotitel změřil, za nižší ceníkovou cenu než model, který nahrazuje: Claude Opus 5 stojí $5 / $25 a čtení z cache klesá o 60 % na $0,20, přičemž podle vlastního údaje Anthropicu je běžná zátěž o 40 % levnější než na Opusu 5. To obrací tvar, který tato sekce měla celý rok, kdy byl nejlepší model zároveň nejdražší. Claude Fable 5.1 i GPT-6 Astra jsou v ceníku za $10 / $50 a oba mají nyní nižší skóre. Muse Spark 1.3 od Mety stojí $1,25 / $4,25 beze změny napříč třemi posuny schopností od července, s tarifem Contributor za $0,10 / $0,20 pro každého, kdo nechá Metu trénovat na svých promptech, a Grok 4.6 i Grok 4.7 stojí $2 / $6 s výhradou, že prompt od 200 000 tokenů přeúčtuje celý požadavek na $4 / $12. Grok 4.7 je na této stránce nejčistším případem ceny, která se nepohnula, zatímco náklady ano: tokeny stojí stejně a úloha Intelligence Indexu stojí $2,73 proti $1,86 u Groku 4.6, protože 4.7 k výsledku vypíše zhruba dvojnásobek výstupu. Levný konec se pohnul dvakrát. DeepSeek 16. srpna zvedl oba modely V4 zhruba čtyřnásobně, což stálo V4-Flash volbu pro poměr cena/výkon, a 10. září to z velké části zvrátil: V4-Flash byl stažen a jeho místo zaujal V4.1-Flash za $0,15 / $0,60 mimo špičku a $0,30 / $1,20 ve špičce. Mezi modely, které koupíte po tokenech, zůstává volbou GLM 5.3 Flash, nyní za prostý ceník $0,15 / $0,50 od vypršení zaváděcí akce 9. září, protože Artificial Analysis ho měří na $0,25 na úlohu Intelligence Indexu při skóre 41,8 proti $0,27 u DeepSeeku při 39,5. Mimo špičku jsou oba na vstupu na stejné úrovni a GLM je levnější na výstupu; ve špičce GLM vyhrává v obojím. Jeden otevřený model je poráží oba v ceně na úlohu a je čtyři dny starý: MiMo-V2.6-Pro od Xiaomi zvládne úlohu indexu za $0,13 při skóre 46,3 pod čistou licencí MIT, jenže si k tomu musíte uhostit 1,02 bilionu parametrů. Na špičce je volbou pro poměr Muse Spark 1.3 od Mety, za $1,60 na úlohu indexu při 48,1. Mezi uzavřenými modely tento titul 22. září převzala GPT-6 Luna, za $0,10 / $0,50 po tokenech a $0,07 na úlohu indexu, což je nejlevnější cena za úlohu na celé této stránce; stejně klesl i GPT-6 Sol, ze $4 / $20 na $2 / $10, čímž se trefil přesně do sazby Claude Sonnet 5, a OpenAI říká, že obě snížení jsou trvalá, ne promoakce. Podrobnější rozbor najdete v našem průvodci porovnáním cen AI.
| Model | Vstup (za 1M) | Výstup (za 1M) | Kontext | Přístup zdarma? |
|---|---|---|---|---|
| GPT-6 Astra | $10.00 | $50.00 | 1 050 000 (max. vstup 922 000) | V Chatu na Pro, Business a Enterprise od 4. září; Plus ho má v ChatGPT Work a Codexu, ne v Chatu; bez bezplatného tarifu; v API živě |
| GPT-6 Sol | $2.00 | $10.00 | 1 050 000 (max. vstup 922 000) | ChatGPT Work a Codex na Plus, Pro, Business, Enterprise a Edu od 22. září; API; ne v Chatu |
| GPT-6 Luna | $0.10 | $0.50 | 1 050 000 (max. vstup 922 000) | Free a Go v desktopové aplikaci ChatGPT; ChatGPT Work a Codex na placených tarifech; API; ne v Chatu |
| GPT-5.5 | $5.00 | $30.00 | 1M (400K v Codex) | ChatGPT Free; API placené |
| GPT-5.5 Pro | $30.00 | $180.00 | 1M | ChatGPT Pro od $100/měs. (úroveň s vyšším použitím $200) |
| GPT-5.6 Sol | $4.00 | $20.00 | Nezveřejněno | Živé v ChatGPT, Codex & API (9. července); promo sazba minimálně do 21. listopadu 2026 |
| GPT-5.6 Terra | $2.00 | $12.00 | Nezveřejněno | Živé v ChatGPT, Codex & API (9. července) |
| GPT-5.6 Luna | $0.20 | $1.20 | Nezveřejněno | Živé v ChatGPT, Codex & API (9. července) |
| Claude Opus 5.5 | $4.00 | $20.00 | 1M | Claude Pro/Max/Team; API placené; čtení z cache $0,20 |
| Claude Opus 5 | $5.00 | $25.00 | 1M | Výchozí v Claude Pro/Max; API placené |
| Claude Opus 4.8 | $5.00 | $25.00 | 1M | Starší model u Anthropicu; Pro/Max/API |
| Claude Fable 5.1 | $10.00 | $50.00 | 1M | Čtení z cache $0.25; v Max/Team Premium (~50 % limitů použití); Pro/Team Standard přes kredity. Mythos 5.1 se účtuje stejně, jen na pozvání |
| Claude Fable 5 | $10.00 | $50.00 | 1M | Trvale v Max/Team Premium (~50 % limitů použití); Pro/Team Standard přes kredity |
| Claude Sonnet 5 | $2.00 | $10.00 | 1M | Výchozí v Claude Free & Pro; API placené |
| Claude Sonnet 4.6 | $3.00 | $15.00 | 1M | API placené (nahrazeno Sonnet 5) |
| Gemini 3.1 Pro | $2.00 (≤200K) / $4.00 (>200K) | $12.00 (≤200K) / $18.00 (>200K) | 1M | Omezená aplikace Gemini; API placené |
| Gemini 3.8 Flash | $0.75 úvodní / $1.50 od 1. 1. 2027 | $3.75 úvodní / $7.50 od 1. 1. 2027 | 1M | AI Studio, Antigravity, Gemini Enterprise + placené API; v aplikaci Gemini hlášeno pro AI Pro/Ultra |
| Gemini 3.7 Flash | $0.75 úvodní / $1.50 od 1. 1. 2027 | $3.75 úvodní / $7.50 od 1. 1. 2027 | 1M | AI Studio, Android Studio, Antigravity + placené API; v aplikaci Gemini jen přes Spark (AI Pro/Ultra, mimo EHP/UK/CH/Nigérii) |
| Gemini 3.6 Flash | $0.75 úvodní / $1.50 od 1. 1. 2027 | $3.75 úvodní / $7.50 od 1. 1. 2027 | 1M | Výchozí model bezplatné aplikace Gemini; AI Studio; bezplatná úroveň API + placené API |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1M | AI Studio; bezplatná úroveň API + placené API |
| Qwen3.8-Max-0902 | $2.00 ($0.17 explicitní cache hit, $0.25 implicitní) | $6.00 | 1M (výstup 128K) | Pouze API na QwenCloud; bez spotřebitelského chatu, bez otevřených vah |
| Qwen 3.7 Max | $1.25 promo / $2.50 ceníková | $3.75 promo / $7.50 ceníková | 1M | 200 dotazů zdarma/den; API placené nad rámec |
| MiniMax M3 | $0.30 (50 % z $0.60) | $1.20 (≤512K) | 1M | Open weights; náklady na hosting |
| LongCat-2.0 | Závisí na poskytovateli | Závisí na poskytovateli | 1M | Open weights (MIT); náklady na hosting |
| NVIDIA Nemotron 3 Ultra | Závisí na poskytovateli | Závisí na poskytovateli | 1M | Open weights (OpenMDW); náklady na hosting |
| Qwen 3.5 (open-weight) | Self-host / Together | Self-host / Together | 1M | Open weights; náklady na hosting |
| Nex-N2-Pro | Self-host / poskytovatelé | Self-host / poskytovatelé | 1M | Open weights (Apache 2.0); náklady na hosting |
| Rio 3.5 Open 397B | Self-host / poskytovatelé | Self-host / poskytovatelé | 1M | Open weights (MIT); náklady na hosting |
| Grok 4.3 | $1.25 | $2.50 | 1M | Bezplatný spotřebitelský plán; API placené |
| Grok 4.6 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API SpaceXAI, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare |
| Grok 4.7 | $2.00 (<200K) / $4.00 (≥200K) | $6.00 (<200K) / $12.00 (≥200K) | 500K | API SpaceXAI, Cursor, Grok Build, harnessy a cloudové routery; ne v aplikaci Grok |
| Muse Spark 1.3 | $1.25 ($0.10 úroveň Contributor) | $4.25 ($0.20 úroveň Contributor) | 1M | Placené API; Muse Code, Meta Model API a OpenRouter; úroveň Contributor mění práva k trénování za ~92% slevu |
| Kimi K3 | $3.00 ($0.30 cache-hit) | $15.00 | 1M | Bezplatná základní úroveň v aplikaci Kimi; open weights na Hugging Face (Kimi K3 License) |
| Gemini Omni Flash (video) | $1.50 | $17.50 (video výstup) | 10sekundové klipy | Aplikace Gemini / Flow; AI Studio + API |
| DeepSeek V4-Pro | $0.66 mimo špičku / $1.32 ve špičce ($0.022 cache-hit mimo špičku) | $1.98 mimo špičku / $3.96 ve špičce | 1M | DeepSeek Chat zdarma; API placené, špičkové a mimošpičkové sazby od 16. srpna |
| DeepSeek V4.1-Flash | $0.15 mimo špičku / $0.30 ve špičce ($0.003 cache hit mimo špičku) | $0.60 mimo špičku / $1.20 ve špičce | 1M | DeepSeek Chat zdarma; API placené, tarify mimo špičku a ve špičce; nahradil V4-Flash 10. září |
| Kimi K2.7 Code | Závisí na poskytovateli | Závisí na poskytovateli | 256K | Open weights; náklady na hosting |
| GLM-5.2 | Závisí na poskytovateli | Závisí na poskytovateli | 1M | Open weights; náklady na hosting |
| GLM 5.3 | $1.40 ($0.26 cache-hit) | $4.40 | 1M | Z.ai API, GLM Coding Plan a ZCode; váhy na Hugging Face od 28. srpna pod vlastní licencí GLM 5.3 License |
| GLM 5.3 Flash | $0.15 ($0.03 cache-hit); $0.075 v akci | $0.50; $0.25 v akci | 1M | Z.ai API, GLM Coding Plan, OpenRouter; váhy pod MIT na Hugging Face; akce končí 9. září |
| Tencent Hy4 Preview | $0.834 ($0.042 cache-hit) | $2.501 | 1M+ | Otevřené váhy (Apache 2.0); Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy |
| Qwen3.8-Flash-Next | Podle poskytovatele | Podle poskytovatele | 262K (do 1M) | Otevřené váhy (Qwen Community License 1.0); náklady na hosting se připočítávají |
| MiMo-V2.6-Pro | $0.435 | $0.87 | 1M | Otevřené váhy (MIT); náklady na hosting se platí |
| ERNIE 5.1 | Ceny pro region Čína | Ceny pro region Čína | 256K | Bezplatná úroveň Baidu |
| Gemini Spark (agent) | Bez ceny API | Bez ceny API | 1M (základ Gemini) | Google AI Pro $19.99, AI Ultra $99.99 nebo $199.99/měs. |
| Fello AI (agregátor) | Směrováno přes aplikaci | Směrováno přes aplikaci | Závisí na modelu | $9.99/měs., bezplatná verze dostupná |
Výše uvedené sazby pro GPT-5.5 a GPT-5.5 Pro jsou ceny pro krátký kontext; OpenAI již specifické údaje pro dlouhý kontext nezveřejňuje. Úrovně GPT-5.6 se účtují za 2násobek vstupu a 1,5násobek výstupu, jakmile prompt přesáhne 272K vstupních tokenů, což dává long-context Terra na $4 / $18 a Luna na $0.40 / $1.80. U řady GPT-6 OpenAI žádnou přirážku za dlouhý kontext nezveřejňuje a čtení z cache je u nich o 90 % levnější: $1.00 u Astry, $0.20 u Solu a $0.01 u Luny. Grok 4.6 funguje stejně, ale tvrději: od 200 000 tokenů v promptu výše přeúčtuje SpaceXAI celý požadavek vyšší sazbou, nikoli jen to, co limit přesahuje, takže překročení o tisíc tokenů zdvojnásobí cenu celého volání. Druhým ceníkem, který je třeba číst dvakrát, je DeepSeek: od 16. srpna se oba modely V4 účtují špičkovou sazbou od 01:00 do 04:00 a od 06:00 do 10:00 UTC ve všední dny a přesně poloviční v každou jinou hodinu, takže stejná úloha může stát dvojnásobek podle toho, kdy ji spustíte. Pokud chcete přístup k více AI modelům bez správy samostatných předplatných, Fello AI poskytuje GPT, Claude, Gemini, Grok, Perplexity a další v jediné aplikaci pro Mac, iPhone a iPad od $9.99/měsíc.
Nejlepší open-weight modely v září 2026
Nejlepší model s otevřenými vahami v září 2026 je MiMo-V2.6-Pro, který Xiaomi zveřejnilo 21. září pod čistou licencí MIT: 1,02 bilionu parametrů se 42 miliardami aktivních, kontext 1M tokenů a váhy na Hugging Face tentýž den. Artificial Analysis ho měří na 46,3 na Intelligence Index v4.3.2, což je nejvyšší otevřené skóre, jaké kdy zveřejnila, nad GLM-5.3 se 44,8 a Kimi K3 se 43,6, a dělá to za $0,13 na úlohu Intelligence Indexu, levněji než kterýkoli jiný otevřený model na této stránce. Bere také 34,8 % na Terminal-Bench 4.0 a 1673 na GDPval-AA v2.1, čímž je v obou nad Kimi K3. Dvě poctivá omezení: neohodnotil ho žádný žebříček Areny, takže pro něj neexistuje vůbec žádný doklad lidských preferencí, a byl zveřejněn před čtyřmi dny, takže nemá nezávislou historii. Nejvýše postaveným otevřeným modelem na Areně je stále Kimi K3, sedmý na WebDev s 1658 a pátý na signálu dokončení úloh v Agent Areně, a GLM-5.3 je stále nejsilnějším otevřeným modelem na Terminal-Bench 4.0 od Artificial Analysis se 41,9 % proti 34,8 % u MiMo, ovšem pod vlastní licencí Z.ai, ne MIT. Praktickým doporučením pro týmy, které si provozují vlastní váhy, zůstává GLM 5.3 Flash (Z.ai, MIT), vydaný 26. srpna se skóre 41,8 na v4.3.2, 320 mld. celkem a 18 mld. aktivních, protože model s 1,02 bilionu parametrů není nic pro pracovní stanici a stažení K3 znamená 96 shardů safetensors a zhruba 1,56 TB. Levná otevřená vrstva se znovu změnila 10. září: DeepSeek stáhl V4-Flash 0731 a nahradil ho modelem DeepSeek-V4.1-Flash, 552 mld. s 8 mld. aktivními při prefillu a 16 mld. při dekódování, nativně multimodálním, pod MIT hned první den, se skóre 39,5 na v4.3.2 proti 34,3 u sestavení, které nahrazuje, a s cenou sraženou zpět na $0,15 / $0,60 mimo špičku. Je také třetí na signálu dokončení úloh v Agent Areně, nejvýše ze všech otevřených modelů. Ze tří vydání, která uzavřela srpen, GLM 5.3 zveřejnil váhy 28. srpna pod vlastní licencí s klauzulí, podle níž musí každý provozovatel model-as-a-service s tržbami nad 10 miliard dolarů nejprve projít bezpečnostní kontrolou Z.ai; Qwen3.8-Flash-Next od Alibaby, směs expertů se 125 mld. parametrů a jen 6 mld. aktivními, která předvádí architekturu Qwen4, má skóre 39,8 a je devátý na žebříčku WebDev Areny; a Hy4 Preview od Tencentu, 770 mld. celkem a 49 mld. aktivních pod Apache 2.0, nemá hodnocení od Artificial Analysis, ale je jedenáctý na Arena WebDev s 1624. Pozor také na to, že GLM 5.3 Flash není osekaný GLM 5.3, ale samostatný model na nově natrénovaném základu, a právě proto mohl vyjít pod čistou licencí MIT, zatímco vlajková loď ne.
| Model | Nejlepší pro | Klíčový benchmark | Kontext / Licence | Kde spustit |
|---|---|---|---|---|
| MiMo-V2.6-Pro | Nejvyšší otevřený Intelligence Index, jaký byl změřen | II 46,3 (v4.3.2), nad GLM-5.3 i Kimi K3, za $0,13 na úlohu indexu; 34,8 % Terminal-Bench 4.0; GDPval-AA v2.1 1673; 1,02 bilionu/42 mld. aktivních | 1M / MIT | Hugging Face (XiaomiMiMo), poskytovatelé, vlastní hosting |
| Kimi K3 | Nejvýše postavený otevřený model na Areně | II 43,6 (v4.3.2); #5 Arena WebDev, nejlepší umístění otevřeného modelu; #5 Agent Arena; 2.8T/104B aktivních | 1M / Kimi K3 License | Hugging Face (96 shardů, 1.56 TB), Moonshot API, poskytovatelé |
| GLM 5.3 Flash | Nejlepší otevřený model, který si většina týmů skutečně dokáže provozovat | II 41,8 (v4.3.2), na Paretově hranici poměru inteligence a ceny, zhruba $0.25 za úlohu indexu; 320B/18B aktivních, nativně multimodální | 1M / MIT | Hugging Face, Z.ai API ($0.15/$0.50), OpenRouter |
| GLM-5.2 | Záložní volba s nezávislým záznamem | II 33,7 (v4.3.2); #19 Arena WebDev (1,591.8), #17 Agent Arena; 744B/40B aktivních | 1M / MIT | Z.ai, Hugging Face, OpenRouter |
| GLM 5.3 | Otevřený od 28. srpna, ale pod vlastní licencí | II 44,8 (v4.3.2), nejvyšší otevřené skóre, které jsme našli; stejný základ 744B jako GLM-5.2, jen dotrénovaný, zveřejněný checkpoint počítán na 753B; CyberGym 84,5 % a Terminal-Bench 3.0 28,3 (údaje dodavatele) | 1M / GLM 5.3 License (model-as-a-service nad 10 mld. USD tržeb potřebuje bezpečnostní revizi Z.ai) | Hugging Face, Z.ai API ($1.40/$4.40), GLM Coding Plan, ZCode |
| DeepSeek V4.1-Flash | Nejlepší otevřená hodnota, pokud si jej hostíte sami | II 39,5 (v4.3.2) proti 34,3 u nahrazované verze V4-Flash 0731; 552B, 8B aktivních při prefillu a 16B při dekódování | 1M / MIT | DeepSeek API ($0.15/$0.60 mimo špičku, $0.30/$1.20 ve špičce od 10. září), lokálně |
| Tencent Hy4 Preview | Zatím největší permisivně licencovaný model | 770B/49B aktivních; 2,99/4,00 na vlastním panelu Tencentu se 203 úlohami proti 2,94 u Kimi K3 a 2,92 u GLM 5.3 (dodavatel); bez hodnocení Artificial Analysis; #11 Arena WebDev (1624) | 1M+ / Apache 2.0 | Hugging Face (BF16 a FP8), Tencent Cloud TokenHub, OpenRouter |
| Qwen3.8-Flash-Next | Ukázka architektury Qwen4 | 125B celkem plus N-gramové embedding s 51B, 6B aktivních; 91,7 GPQA Diamond a 62,5 SWE-Bench Pro (dodavatel); II 39,8 (v4.3.2); #9 Arena WebDev (1635) | 262K až 1M / Qwen Community License 1.0 | Hugging Face, poskytovatelé, self-host |
| LongCat-2.0 | Frontier otevřený kodér trénovaný na čínských čipech | II 33 (v4.1); 59,5 % SWE-Bench Pro (dodavatel), 1.6T/~48B aktivních | 1M / MIT | Hugging Face, GitHub, OpenRouter |
| MiniMax M3 | Levný multimodální model třídy frontier | II 44 (v4.1), 59 % SWE-Bench Pro, multimodální | 1M / licence TBD | Hugging Face, API $0.30/1M (50 % sleva) |
| Nex-N2-Pro | Nejsilnější otevřené programátorské skóre | II 41 (v4.1); 80,8 SWE-Bench Verified, 397B/17B aktivních | Založeno na Qwen / Apache 2.0 | Hugging Face, poskytovatelé, self-host |
| Kimi K2.7 Code | Nejsilnější komerčně licencovaný otevřený kodér | +21,8 % na Kimi Code Bench v2 vs. K2.6 (dodavatel); 1T/32B aktivních | 256K / Modified MIT | Hugging Face, DeepInfra, poskytovatelé |
| DeepSeek V4-Pro | Agentická práce v reálném světě | II 44 (v4.1), 1.6T/49B aktivních | 1M / MIT | DeepSeek API ($0.66/$1.98 mimo špičku, $1.32/$3.96 ve špičce od 16. srpna), lokálně |
| Hy3 | Nejnovější účastník s permisivní licencí | II 41 (v4.1); #22 na Arena WebDev (1,516.4) | Apache 2.0 | Hugging Face, poskytovatelé, self-host |
| Inkling | První open-weight model Thinking Machines | II 41 (v4.1), agentický 32,3, vydán 15. července | Open weights | Hugging Face, poskytovatelé, self-host |
| Inkling Small | Stejná rodina při čtvrtině velikosti | II 40 (v4.1), agentický 30,8; 276B/12B aktivních, vstup text, obrázek a zvuk | Apache 2.0 | Hugging Face (BF16 a NVFP4), poskytovatelé, self-host |
| NVIDIA Nemotron 3 Ultra | Laděno NVIDIA, plně permisivní licence | II 38 (v4.1), 65-70,4 SWE-Bench Verified, 550B/55B aktivních | 1M / OpenMDW | OpenRouter, Hugging Face, AWS (8x B200 self-host) |
| Qwen 3.5 (397B / 17B aktivních) | Multimodální, rychlé dekódování | 88,4 GPQA, 91,3 AIME 2026, 83,6 LiveCodeBench v6 | 1M / otevřené | Together, OpenRouter, lokálně |
| Qwen3.6-35B-A3B | Efektivní otevřený agentický kodér (3B aktivních) | 86,0 GPQA Diamond, 92,7 AIME 2026, 35B/3B aktivních | 262K (do 1M YaRN) / Apache 2.0 | Hugging Face, OpenRouter, lokálně |
| Qwen3.6-27B | Hustý kodér spustitelný na laptopu | 87,8 GPQA Diamond, hustý 27B, multimodální | 256K / Apache 2.0 | Lokálně Mac/PC, Hugging Face, OpenRouter |
| Rio 3.5 Open 397B | Fine-tune Qwen 3.5, vícejazyčné uvažování | 70,8 Terminal-Bench 2.1 (first-party), poráží Qwen 3.7 Plus na 4/5 | 397B/17B aktivních / MIT | Hugging Face, poskytovatelé, self-host |
| Llama 4 Maverick | Vlajkový model řady Meta | 17B aktivních / 400B celkových parametrů | Llama 4 license | Cloud Meta, Hugging Face, lokálně |
| NVIDIA Nemotron 3 Nano Omni | Edge / nízký výkon | Multimodální, velmi malá stopa | Kompaktní / otevřené | Lokálně, nástroj NVIDIA |
Licencování zde záleží stejně jako holé skóre a srpen rozdíl mezi oběma skupinami ještě prohloubil. Kimi K2.7 (Modified MIT), DeepSeek V4 (MIT), GLM 5.3 Flash (MIT), MiMo-V2.6-Pro (MIT), GLM-5.2 (MIT), LongCat-2.0 (MIT), Hy3 (Apache 2.0), Hy4 Preview (Apache 2.0), Nex-N2-Pro (Apache 2.0) a Nemotron 3 Ultra (OpenMDW) všechny jasně umožňují komerční použití bez zkoumání tržeb. Zbytek nese podmínky, které je vhodné si přečíst dřív, než na nich začnete stavět: MiniMax M3 a MiniMax H3 vycházejí pod vlastními komunitními licencemi, přičemž H3 navíc vyžaduje žádost z USA, EU, Spojeného království a Jižní Koreje; Kimi K3 sedí na vlastní licenci s prahem tržeb pro každého, kdo jej přeprodává jako službu; GLM 5.3 vyžaduje bezpečnostní revizi Z.ai u každého provozovatele model-as-a-service s tržbami nad 10 miliard dolarů; a Qwen Community License 1.0 u Qwen3.8-Flash-Next vyžaduje samostatnou licenci od Qwenu pro provozování model-as-a-service nebo produktu typu AI pracovní asistent, byť interní použití je vyňato. Žádný open-weight model už není první na žádném žebříčku Areny, který sledujeme: Claude Opus 5 vzal žebříček Agent v červenci, poslední, který open-weight model vedl.
Benchmarky, ceny a praktické používání
Každé hodnocení na této stránce kombinuje tři vstupy: veřejné benchmarky od sedmi nezávislých firem (Artificial Analysis, Arena dříve LMArena, Scale SEAL, LiveBench, EQ-Bench, ARC Prize a oficiální žebříček Terminal-Bench 4.0, pokrývající Intelligence Index, GPQA Diamond, ARC-AGI-1 až 3, Humanity's Last Exam, GDPval-AA, FrontierMath, HMMT, MCP Atlas, SWE Atlas a Remote Labor Index), zveřejněné ceny API a předplatného z oficiální cenové stránky každého dodavatele a praktické používání redakčním týmem FelloAI, který spouští reálné prompty na téže úloze na každém modelu. Oficiální zdroje cen a benchmarků znovu načítáme před každou měsíční aktualizací.
Benchmarky jsou váženy podle případu použití: SWE-bench a Terminal-Bench pohánějí programování, GPQA Diamond a ARC-AGI-2 pohánějí přesnost, GDPval-AA (benchmark profesionálních výstupů od Artificial Analysis) informuje kvalitu profesionálních úloh, zatímco styl psaní se posuzuje primárně praktickým testováním, FrontierMath a HMMT pohánějí řešení problémů. Zveřejňujeme, když je benchmark hlášen dodavatelem, ale nezávisle neověřen, a vyřazujeme každé tvrzení, které nedokážeme reprodukovat proti živému zdroji. Řadíme podle naměřených skóre: koruna kategorie se posune, jakmile model překoná držitele na žebříčcích, které danou kategorii definují, aniž bychom čekali na žebříčky založené na hlasování, a model, který zatím není široce dostupný, je na kartě označen, nikoli o kartu připraven. Znovu ověřujeme pořadí, nejen čísla, protože skóre může zůstat správné, zatímco se žebříček kolem něj pohne. Když model mezi aktualizacemi projde velkým upgradem, kategorii přehodnotíme a přidáme řádek „Co se tento měsíc změnilo“ na konec podrobné analýzy.
Fello AI spojuje špičkové AI modely v jedné odlehčené nativní aplikaci.
Přepínejte mezi nimi kdykoli, žádná samostatná předplatná.
Stáhnout Fello AI




