Dne 1. června 2026 MiniMax oficiálně vydal M3, nový vlajkový jazykový model šanghajské laboratoře, přesně podle slíbeného. Model, který strávil týdny jako architektonická upoutávka, je nyní živý a příslib se ukázal jako reálný: programování na frontierové úrovni, kontextové okno o 1 milionu tokenů a nativní multimodalita, vše v jednom open-weight modelu. MiniMax ho označuje za první a jediný open-weight model, který toto vše kombinuje.
Open weights jsou základem open source AI, kategorie modelů, které si můžete stáhnout a spustit sami, místo abyste platili za přístup přes uzavřené API.
Architektonický příběh, který jsme popsali před spuštěním, se potvrdil. M3 je postaven na novém designu MiniMax Sparse Attention (MSA), stejném řídkém pozornosti, které společnost v generaci M2 opustila a pro M3 znovu oživila. Můžete ho použít právě teď prostřednictvím MiniMax Code, tokenových plánů a API, přičemž open weights a úplná technická zpráva jsou slíbeny přibližně do deseti dnů. Níže najdete, co je potvrzeno při spuštění, co říkají benchmarky, kolik to stojí a nakolik tomu dnes lze věřit.
Klíčové body
- Vydán a dostupný nyní. M3 byl spuštěn 1. června 2026 a je přístupný přes MiniMax Code, předplacené tokenové plány a standardní API. Open weights a technická zpráva jsou očekávány do přibližně deseti dnů na Hugging Face a GitHubu.
- Tři frontierové schopnosti v jednom modelu. MiniMax prezentuje M3 jako první open-weight model kombinující frontierové programování, kontextové okno o 1 M tokenů a nativní porozumění obrazu a videu.
- Řídká pozornost v praxi. Architektura MSA snižuje výpočty na token při 1 M kontextu na jednu dvacetinu předchozí generace, s více než 9násobně rychlejším prefill a více než 15násobně rychlejším dekódováním.
- Silné benchmarky, ale s výhradami. M3 dosahuje 59,0 % na SWE-Bench Pro, překonává GPT-5.5 a Gemini 3.1 Pro a přibližuje se Claude Opus 4.7. Některé výsledky byly měřeny na vlastní infrastruktuře MiniMaxu s agentním scaffoldingem, takže nezávislé ověření stále chybí.
- Agresivně nízká cena. Vstupní cena v API začíná přibližně $0.30 za milion tokenů, s průměrnými náklady tak nízkými jako $0.06 za milion při využití cache.
Kde MiniMax M3 používat hned teď
M3 je dostupný od okamžiku spuštění třemi způsoby. Můžete ho volat přes standardní API, přihlásit se k odběru tokenového plánu MiniMax, nebo ho používat v MiniMax Code, agentním produktu společnosti. Open weights a technická zpráva nebyly dostupné v den jedna; MiniMax říká, že obě zveřejní na Hugging Face a GitHubu během příštích přibližně deseti dnů.
Načasování je důležité. Vývojáři mohou hostovaný model testovat okamžitě, ale open-weight tvrzení není plně prokázáno, dokud váhy a zpráva nejsou veřejné. Až se objeví, repozitář, který sledovat, je huggingface.co/MiniMaxAI s kartou modelu pojmenovanou MiniMax-M3.
Uvnitř MiniMax Sparse Attention (MSA)
Hlavní změna je architektonická a je to stejná, kterou MiniMax avizoval před spuštěním. M3 se vrací k řídké pozornosti poté, co společnost strávila celou generaci M2, včetně M2, M2.1, M2.5 a M2.7, s plnou pozorností přes celé kontextové okno.
Zjednodušeně řečeno, plná pozornost znamená, že každý token v kontextu může sledovat každý jiný token. To je přesné, ale drahé, a náklady explodují s rostoucím kontextem. Řídká pozornost umožňuje modelu přeskočit většinu těchto spojení a soustředit se pouze na tokeny, které jsou důležité. Návrh M3 využívá lehkou indexovou větev, která prochází příchozí tokeny a vybírá, které bloky minulých tokenů si zaslouží pozornost, a pak ji aplikuje pouze na tyto relevantní bloky klíč-hodnota.
Základem je Grouped Query Attention (GQA), nikoli Multi-head Latent Attention, přičemž výběr na úrovni bloků probíhá na skutečných, nekomprimovaných klíčových hodnotách, nikoli na komprimované reprezentaci. To je klíčový detail. M3 zachovává přesnost výpočtu skutečné pozornosti a provádí ji jen tam, kde na tom záleží, což je důvod, proč MiniMax tvrdí, že dosahuje efektivnostních výhod bez ztráty kvality.

Proč MiniMax opustil řídkou pozornost v M2 a vrátil se k ní
Toto je část, která dělá spuštění zajímavým, protože jde o veřejnou sebekorekci. Ve vlastním inženýrském blogu MiniMaxu vysvětlujícím architekturu M2 tým napsal, že „infrastruktura pro lineární a řídkou pozornost je mnohem méně vyspělá“ než plná pozornost, a že „efektivní pozornost má ještě kus cesty, než definitívně porazí plnou pozornost.“
To bylo publikováno přibližně před rokem. S M3 dodal stejný tým produkčně připravenou řídkou pozornost s řádovými zrychleními. Sázka je, že infrastruktura dohnala zpoždění a MSA je důkaz, který předkládají vývojářům.
Jak rychlý je MiniMax M3?
Čísla efektivity jsou nejjasnější částí vydání. Všechny hodnoty jsou měřeny při kontextové délce 1 milionu tokenů ve srovnání s předchozí generací.
| Metrika | MiniMax M3 |
|---|---|
| Výpočty na token při 1 M kontextu | 1/20 předchozí generace |
| Prefill (zpracování vstupu) | Více než 9× rychlejší |
| Dekódování (generování výstupu) | Více než 15× rychlejší |
| Rychlost výstupu | ~100 tokenů/s, ~3× rychlejší než Opus |
| Kontextové okno | Až 1 M tokenů (zaručené minimum 512 K) |
To je skutečný obchodní argument. Dlouhý kontext zní působivě, ale většina týmů nepotřebuje vkládat celý repozitář a rok tiketů do jednoho promptu. Potřebují model, který udržuje dostatek stavu pro práci v čase, aniž by latence a náklady na inferenci byly bolestivé. Snížením výpočtů na token při 1 M kontextu na dvacetinu je MSA navržen tak, aby agenti s dlouhým kontextem byli ekonomičtí pro běžné vývojářské pracovní postupy, nejen pro ukázky.
Výsledky benchmarků MiniMax M3
To jsou data, která předspouštěcí článek nemohl ukázat, protože benchmarky přesnosti ještě neexistovaly. Nyní existují. Na úlohách programování a agentního charakteru dosahuje M3 čísel, která ho řadí do frontierové společnosti.
| Benchmark | MiniMax M3 | Co měří |
|---|---|---|
| SWE-Bench Pro | 59,0 % | Opravy softwaru v reálném světě |
| Terminal-Bench 2.1 | 66,0 % | Agentní úlohy příkazového řádku |
| SWE-fficiency | 34,8 % | Efektivní změny kódu |
| KernelBench Hard | 28,8 % | Nízkoúrovňová optimalizace jádra |
| MCP Atlas | 74,2 % | Používání nástrojů přes MCP |
| BrowseComp | 83,5 | Webové vyhledávání a procházení |
Výraznými tvrzeními jsou: na SWE-Bench Pro M3 překonává GPT-5.5 a Gemini 3.1 Pro a přibližuje se Claude Opus 4.7. Na BrowseComp jeho skóre 83,5 překonává Opus 4.7 s výsledkem 79,3. V multimodální části M3 dosahuje vyššího skóre než Gemini 3.1 Pro na OmniDocBench, obsadil první místo na Claw-Eval (benchmark autonomního agenta end-to-end) a překonal Opus 4.7 na SVG-Bench.
K těmto číslům přistupujte s patřičnou opatrností. MiniMax zveřejňuje, že několik výsledků bylo měřeno na jeho vlastní infrastruktuře, často s použitím agentního scaffoldingu jako Claude Code, Mini-SWE-Agent nebo Terminus. To čísla nečiní bezcennými, ale znamená to, že model vypadající silně na žebříčku se může chovat jinak uvnitř nepořádného interního repozitáře. M3 zatím není na DeepSWE board, kde jsou sledovány úlohy softwaru s dlouhým horizontem, takže čisté srovnání s nejnovějšími vydáními Claude stále čeká. Nákupní rozhodnutí je rozumné odložit na nezávislé ověření.

Kolik stojí MiniMax M3?
Cena je oblast, kde M3 nejsilněji argumentuje, a náš kompletní průvodce ceníkem MiniMax ho srovnává s každým jiným plánem. API účtuje přibližně $0.30 za milion vstupních tokenů, a s optimalizací cache se průměrná cena snižuje na přibližně $0.06 za milion. Standardní sazba platí pro požadavky do 512 K vstupních tokenů, s vyšší sazbou nad tímto limitem pro scénáře s dlouhým kontextem, a jsou dostupné standardní i prioritní úrovně služeb.
Pro náročnější uživatele MiniMax prodává měsíční tokenové plány, které vycházejí levněji na token.
| Plán | Cena / měsíc | Tokenová kvóta |
|---|---|---|
| Plus | $20 | ~1,7 mld. tokenů |
| Max | $50 | ~5,1 mld. tokenů |
| Ultra | $120 | ~9,8 mld. tokenů |
Pro srovnání: Claude Opus 4.7 stojí přibližně $5 za milion vstupních tokenů a $25 za milion výstupních. Pokud si M3 udrží kvalitu, je na vstupu více než 15× levnější a navíc open-weight.
Co MiniMax M3 skutečně umí
MiniMax podložil spuštění třemi ukázkami dlouhodobých úloh, jejichž cílem je ukázat M3 pracující po mnoho hodin, nejen odpovídající na prompty.
- Reprodukce vědeckého článku. M3 autonomně reprodukoval článek z ICLR 2025 za 12 hodin, přičemž vytvořil 18 commitů a 23 grafů.
- Optimalizace CUDA jádra. Během 24hodinového běhu M3 zvýšil využití FP8 hardwaru z 7,6 % na 71,3 %, tedy 9,4násobné zrychlení, napříč 147 odeslanými benchmarky.
- Autonomní trénink modelu. M3 dosáhl skóre 0,37 na PostTrainBench, úloze, která žádá model, aby end-to-end natrénoval jiný model.
Tyto ukázky se pojí s MiniMax Code, agentním produktem obalujícím model. Rozkládá komplexní práci do víceúrovňových pracovních postupů pomocí frameworku Agent Team, spouští adversariální smyčku producent-ověřovatel k zachycení vlastních chyb a podporuje computer use prostřednictvím nativních multimodálních schopností M3. Postavený částečně na open-source projektech OpenCode a Pi, staví MiniMax do stejné kategorie jako Anthropic's Claude Code, kódovací agenty OpenAI a nástroje Google Gemini. Produkt již není jen model, je to model plus vrstva kolem něj.
MiniMax M3 vs M2.7 vs M2.5
Takto M3 stojí oproti nedávné M-sérii MiniMaxu a hlavnímu západnímu referenčnímu bodu, nyní kdy lze sloupec M3 vyplnit reálnými daty.
| MiniMax M3 | MiniMax M2.7 | MiniMax M2.5 | Claude Opus 4.7 (reference) | |
|---|---|---|---|---|
| Status | Vydán 1. 6. 2026 | Vydán 18. 3. 2026 | Vydán 12. 2. 2026 | Vydán |
| Pozornost | Řídká (MSA) | Plná | Plná | Proprietární |
| Kontextové okno | 1 M tokenů | Kratší, pomalý při 1 M | Kratší | Dlouhé |
| Multimodalita | Nativní (obraz + video) | Zaměřen na text | Zaměřen na text | Ano |
| SWE-Bench Pro | 59,0 % | Konkurenceschopný | Nižší | Vyšší |
| Open weights | Ano (váhy za ~10 dní) | Ano, nekomerční | Ano | Ne |
| Vstupní cena | ~$0.30 / M tokenů | ~$0.30 / M tokenů | Srovnatelná | $5 / M tokenů |
M2.7 zůstává modelem, na kterém běží většina současných uživatelů MiniMaxu, a není ukončován. Rozdíl je v tom, že M3 konečně činí kontext 1 M tokenů praktickým namísto bolestně pomalého a přidává nativní multimodalitu, kterou M2.7 nikdy neměl. Pro historii vývoje M-série si přečtěte náš rozbor MiniMax M2.5. M3 je jedním z několika červnových spuštění; o pár dní později Microsoft představil vlastní modely MAI na Build.
Jak si MiniMax M3 stojí oproti Claude, GPT-5.5, Gemini a DeepSeek?
S benchmarky nyní veřejnými je srovnání ostřejší než ve fázi upoutávky, ačkoli nezávislé ověření stále chybí.
Oproti Claude Opus 4.7. Claude pravděpodobně stále vede M3 v čisté kvalitě uvažování a drží náskok na nejnovějších testech programování s dlouhým horizontem. M3 je ale open-weight, více než 15× levnější na vstupu a ve webovém vyhledávání BrowseComp Opus 4.7 skutečně překonává. Mezera, která po léta rozhodovala, se zúžila na tenký okraj na specifických úlohách.
Oproti GPT-5.5 a Gemini 3.1 Pro. Vlastní čísla M3 ho staví před oba na SWE-Bench Pro. Silnějším tvrzením je architektura: M3 říká, že zvládl levnou inferenci s 1 M tokenů v produkci, což uzavřené laboratoře veřejně nezávazně nepřislíbily ve stejných termínech.
Oproti DeepSeek V4 a Qwen3.7-Max. Toto je nejbližší souboj. DeepSeek V4 a Qwen3.7-Max jsou skutečnou konkurenční skupinou M3, všechny čínské, open-weight a lovící stejné agentní případy použití. Čerstvým přírůstkem do tohoto balíčku open-weight modelů je Nex-N2-Pro, model MoE s 397 miliardami parametrů zaměřený na agentní programování. Diferenciátorem M3 v této kategorii je kombinace: přináší frontierové programování, kontext 1 M a multimodalitu najednou.
Pro širší pohled na to, jak americký a čínský závod modelů formuje ceny a licencování, si přečtěte náš rozbor Anthropic vs OpenAI.
Je MiniMax M3 open source?
Je open-weight, přičemž váhy a technická zpráva jsou slíbeny na Hugging Face a GitHubu do přibližně deseti dnů od spuštění. Zda se počítá jako plně open-source, závisí na licenci, která při spuštění nebyla zveřejněna.
Rozdíl je důležitý. Open-weight znamená, že si můžete stáhnout soubory modelu a spustit je lokálně. Open-source v přísném slova smyslu také znamená, že licence povoluje neomezené komerční použití. MiniMax-M2 byl vydán pod upravenou licencí MIT, ale novější licence M2.7 omezuje komerční použití modelu nebo jeho derivátů bez předchozího písemného souhlasu. Pokud M3 tento precedent sleduje, očekávejte stažitelné váhy s nekomerčním výchozím nastavením a podnikovým licencováním dostupným přes přímý prodej. Technická zpráva to vyjasní.
Kdo stojí za MiniMax M3?
MiniMax je šanghajská AI laboratoř založená v roce 2021. Mimo Čínu je nejznámější pro svůj video model Hailuo, který jsme popsali v recenzi Hailuo 02, a pro M-sérii jazykových modelů. Společnost vydala M1 v polovině roku 2025 (456 miliard parametrů) a poté přešla na menší, hustší a agentičtější rodinu M2, a nyní M3.
Komerční kontext dodává tomuto spuštění váhu. MiniMax vstoupil na hongkongskou burzu 9. ledna 2026, takže jde nyní o veřejnou společnost, která musí prokázat, že umí prodávat přístup k modelům, rozšiřovat přijetí mezi vývojáři a zároveň živit ekosystém open source. To je nelehká rovnováha: open weights budují důvěru a distribuci, ale hostovaná API a agentní předplatná jsou zdrojem opakovaných příjmů. Veřejnou tváří práce na M3 byl Skyler Miao (@SkylerMiao7), vedoucí inženýrství MiniMaxu, jehož příspěvky na X předjímaly architekturu před spuštěním.
Co MiniMax M3 znamená pro globální závod v AI
Po spuštění M3 vystupují do popředí dva posuny.
Za prvé, řídká pozornost je zpět na stole pro produkční systémy s dlouhým kontextem. MiniMax ji v roce 2025 označil za nepřipravenou. To, že s ní nyní vychází jako stěžejní funkcí, signalizuje, že zbývající obor má co dohánět. Anthropic, Google DeepMind i OpenAI mají výzkum efektivní pozornosti v chodu, ale žádný nevydal vlajkový model s takovým veřejným závazkem k efektivitě.
Za druhé, čínské open-weight laboratoře dále rozšiřují cenovou výhodu. DeepSeek tuto frontu otevřel, Qwen udržoval tlak a M3 ho znovu zvyšuje: levný na provoz, otevřený ke stažení a nyní skutečně konkurenceschopný v programování, kontextu a multimodální práci zároveň. Cenová přirážka amerických laboratoří se s každým spuštěním hůře hájí. Pro aktuální přehled toho, kde stojí každý vlajkový model, si přečtěte naše hodnocení nejlepších AI modelů.
Měli byste přejít na MiniMax M3?
Pokud vaše pracovní zátěž vyžaduje kontext 1 M tokenů, například analýzu celého repozitáře, agenty pro výzkum více dokumentů nebo dlouhotrvající paměť relace, M3 je první model, který stojí za otestování. Přesně pro tento případ byl navržen a efektivnostní výhody jsou tím, co tyto pracovní zátěže činí cenově dostupnými.
Pokud provozujete standardní agentní nebo kódovací pipeline, vyplatí se M3 pilotovat oproti vašemu současnému modelu, ale počkejte na nezávislé benchmarky a technickou zprávu dříve, než vsadíte produkci na čísla ze spuštění. Chytrý postup je otestovat hostovaný model nyní a znovu vyhodnotit, až budou váhy veřejné.
Pokud chcete jen vyzkoušet několik čínských i západních vlajkových modelů bez manipulace se samostatnými API klíči, aplikace Fello AI pro Mac a iOS přepíná mezi Claude, ChatGPT, Gemini, Grok a DeepSeek přes jedno rozhraní. M3 se v Fello AI objevil s aktualizací 6.7.0, takže nyní sedí ve stejném rozhraní jako tyto modely.
Co sledovat dál
Příštích několik týdnů rozhodne, jak moc ze spuštění přežije mimo testování. Tři věci ke sledování: open weights a technická zpráva přistávající na Hugging Face ve slíbených deseti dnech, první nezávislé benchmarkové běhy zbavené scaffoldingu MiniMaxu a případný nástup M3 na neutrální žebříčky jako DeepSWE. Pokud tyto kroky proběhnou čistě, MiniMax udělal víc než jen vydal další schopný model. Ztíží frontierový závod každé laboratoři prodávající kódovací agenty. Tento článek budeme aktualizovat, jakmile budou k dispozici ověřená data.
FAQ
Je MiniMax M3 již vydán?
Ano. MiniMax oficiálně vydal M3 1. června 2026. Je dostupný přes API, měsíční tokenové plány a agentní produkt MiniMax Code. Open weights a technická zpráva jsou očekávány na Hugging Face a GitHubu do přibližně deseti dnů.
Je MiniMax M3 open source?
Je open-weight, přičemž váhy a technická zpráva jsou slíbeny do přibližně deseti dnů od spuštění. Zda je plně open-source, závisí na licenci. Pokud M3 sleduje precedent M2.7, váhy bude možné stáhnout, ale komerční použití může vyžadovat písemný souhlas od MiniMaxu.
Jak rychlý je MiniMax M3?
Při kontextu 1 milionu tokenů MiniMax uvádí, že architektura MSA M3 používá jednu dvacetinu výpočtů na token oproti předchozí generaci, s více než 9× rychlejším prefillem a více než 15× rychlejším dekódováním. Výstup běží přibližně 100 tokenů za sekundu.
Jak dobrý je MiniMax M3 v programování?
MiniMax reportuje 59,0 % na SWE-Bench Pro, čímž překonává GPT-5.5 a Gemini 3.1 Pro a přibližuje se Claude Opus 4.7. Několik výsledků bylo měřeno na vlastní infrastruktuře MiniMaxu s agentním scaffoldingem, takže počkejte na nezávislé ověření, než je budete považovat za definitivní.
Kolik stojí MiniMax M3?
Vstupní cena API začíná přibližně $0.30 za milion tokenů a s optimalizací cache klesá na průměrných ~$0.06 za milion. Měsíční tokenové plány jsou $20 (Plus), $50 (Max) a $120 (Ultra). M3 je tak na vstupu více než 15× levnější než Claude Opus 4.7.