Pět open source AI modelů, které stojí za spuštění na M5 Macu v dubnu 2026, jsou Mistral 7B (16 GB), Qwen 3.5 9B (24 GB), DeepSeek R1 Distill Qwen 14B (24 GB), Gemma 4 26B-A4B (32 GB) a Qwen 3.5 35B-A3B (32 GB+). Minimální unified memory je 16 GB, ideální je 24 GB a cokoliv nad 30 miliard parametrů vyžaduje 32 GB nebo více. Frontierové open source modely jako GLM 5.2 nebo plný DeepSeek R1 potřebují stovky GB VRAM, takže je přeskočte. Níže uvedených pět skutečně vejde.
Všech pět tipů jsou příklady open source AI, modelů, jejichž váhy jsou volně zveřejněny, takže je můžete spouštět lokálně místo přes placené cloudové API.
Apple vlastní MLX benchmarky ukazují, že čip M5 přináší 3 až 4násobné zrychlení time-to-first-token oproti M4, díky novým Neural Accelerators uvnitř každého jádra GPU. 20miliardový model nyní na základním MacBook Pro vyprodukuje první token za méně než tři sekundy, což bylo před rokem nemyslitelné. Tento průvodce se věnuje lokálnímu spouštění modelů, což je jiná práce než ta, co dělá Fello AI. Fello AI přesměrovává na všechny hlavní cloudové chatovací modely, ChatGPT, Claude, Gemini, Grok, DeepSeek a Perplexity, přes jednu nativní Mac aplikaci za jediné předplatné $9.99/měsíc (vše sledováno v našem přehledu nejlepších AI modelů). Lokální modely jsou tu správným nástrojem pro soukromí, přístup offline nebo nulové náklady za API. Realistické nastavení pro rok 2026 je obojí: lokální model na rutinní práci, Fello AI otevřené pro těžké problémy.
Pro širší přehled za rámec toho, co se vejde na Mac, náš průvodce nejlepšími open source AI modely hodnotí kompletní nabídku open-weight modelů.
Klíčové závěry
Pět modelů, které stojí za stažení na M5 Mac, seřazených podle hardwarové vhodnosti:
- Mistral 7B pro 16GB Macy, které potřebují rychlé a přesné plnění pokynů
- Qwen 3.5 9B pro ideálních 24 GB, nejlepší univerzální každodenní model
- DeepSeek R1 Distill Qwen 14B pro náročné úlohy s uvažováním na 24GB strojích
- Gemma 4 26B-A4B pro 32GB Macy, které chtějí kvalitu blízkou frontieru
- Qwen 3.5 35B-A3B MoE pro 32GB+ sestavy a práci s dlouhým kontextem
Pro většinu modelů nainstalujte LM Studio s MLX backendem. Pro Gemma 4 konkrétně použijte Ollama (MLX má s ním od dubna 2026 stále chyby). Počítejte s tím, že model spotřebuje 60 % vaší paměti RAM a zbytek nechte pro macOS a kontext.
Srovnávací tabulka
| Model | Parametry | Velikost při Q4 | Min RAM | Licence | Nejlepší pro |
|---|---|---|---|---|---|
| Mistral 7B | 7B dense | ~5 GB | 16 GB | Apache 2.0 | Psaní, e-maily, návrhy |
| Qwen 3.5 9B | 9B dense | ~6 GB | 16–24 GB | Apache 2.0 | Univerzální každodenní model |
| DeepSeek R1 Distill Qwen 14B | 14B dense | ~9 GB | 24 GB | MIT | Matematika, logika, code review |
| Gemma 4 26B-A4B | 26B celkem, 3,8B aktivních (MoE) | ~18 GB | 32 GB | Apache 2.0 | Multimodální, dlouhý kontext |
| Qwen 3.5 35B-A3B | 35B celkem, 3B aktivní (MoE) | ~22 GB | 32 GB | Apache 2.0 | Koherence v dlouhých textech |
1. Vstup pro 16 GB: Mistral 7B
Pokud jste si pořídili základní M5 MacBook Air s 16 GB unified memory, tady začínáte. Mistral 7B je hustý model se 7 miliardami parametrů od francouzské laboratoře Mistral AI, vydaný pod licencí Apache 2.0. Při kvantizaci Q4_K_M se načte do přibližně 5 GB. Dost místa pro macOS i dlouhé kontextové okno.
Co umí dobře
Co ho odlišuje od davu 7B modelů na Hugging Face, je disciplína při plnění pokynů. Udělá, co žádáte, a skončí, až skončí. Žádné vycpávky. Pro psaní e-mailů, přepisování odstavců nebo čištění poznámek ze schůzek je tato zdrženlivost důležitější než výsledky v benchmarcích.
Rychlé parametry
- Hardwarová vhodnost: 16GB M5 MacBook Air bez problémů, 24 GB s velkými kontextovými okny.
- Licence: Apache 2.0 (komerční použití povoleno).
- Nejlepší pro: Každodenní pomoc s psaním, lehký chat, offline návrhy na cestách.
- Přeskočte, pokud: Potřebujete generování kódu nebo víceúrovňové uvažování.
2. Každodenní model pro 24 GB: Qwen 3.5 9B
Když tým Apple Machine Learning Research zveřejnil MLX benchmark pro čip M5, referenčním modelem, který zvolil, byl Qwen. To není náhoda. Rodina Qwen od Alibaby je ta, se kterou Apple MLX LM tutoriály dodává, protože se chová dobře na Apple Silicon a MLX konverze je čistá.
Proč Qwen 3.5 místo Qwen 3
Apple testoval Qwen 3. Aktuální generace, kterou chcete v dubnu 2026 skutečně stáhnout, je Qwen 3.5, verze, na které MLX komunita iteruje od února. Varianta 8B při 4bitové kvantizaci se načte pod 6 GB a na M5 Pro generuje přibližně 60 až 80 tokenů za sekundu.
Co umí dobře
Svou hodnotu dokazuje šíří záběru. Qwen 3.5 9B zvládá kódování, rozsáhlé texty, sumarizaci i vícejazyčné úlohy. Jeho český a čínský výstup jsou oba použitelné, což je v této velikostní třídě vzácné. MLX komunita vydává aktualizace každý týden, takže opravy chyb přicházejí rychle.
Rychlé parametry
- Hardwarová vhodnost: 16 GB těsně, 24 GB ideálně, 32 GB s přehledem.
- Licence: Apache 2.0.
- Nejlepší pro: Jediný lokální model, který si nechte nainstalovaný, pokud instalujete jen jeden.
- Přeskočte, pokud: Chcete model specializovaný na jediný úkol.
3. Model pro uvažování na 24 GB: DeepSeek R1 Distill Qwen 14B
Plný model DeepSeek R1 je monstrum se 671 miliardami parametrů, které se dostalo do titulků začátkem roku 2025. Spustit ho nelze. Co spustit lze, je distilovaná verze: DeepSeek vzal trasování uvažování R1 a použil je k doladění 14miliardového základu Qwen. Výsledkem je model, který se vejde do přibližně 9 GB při Q4, ale při matematice, logice a víceúrovňových problémech uvažuje jako velký model.
Jak funguje režim myšlení
Tento model je volbou pro každého, koho frustruje, když malé lokální modely tápe u čehokoliv náročnějšího než FAQ. Distilovaný R1 přemýšlí před odpovědí a píše řetězec uvažování uvnitř tagů <think> před finální odpovědí. To stojí rychlost. Kupuje to správnost u problémů, kde běžné 7B a 8B modely hádají.
Realistická rychlost na M5
Realistické očekávání na M5 Pro s 24 GB: 15 až 25 tokenů za sekundu při generování, plus průchod uvažováním, který zabere o pár sekund více u náročných promptů. Dost rychlé na použití, dost pomalé na to, aby bylo myšlení vidět.
Rychlé parametry
- Hardwarová vhodnost: 24GB M5 Pro je ideální. 16 GB funguje, ale bez rezervy.
- Licence: MIT.
- Nejlepší pro: Matematiku, ladění kódu, logické hádanky, právní uvažování, cokoliv, kde vás sebevědomá špatná odpověď stojí.
- Přeskočte, pokud: Chcete rychlý neformální chat.
4. Výkonná volba pro 32 GB: Gemma 4 26B-A4B
Google DeepMind vydal Gemma 4 2. dubna 2026 a okamžitě přeformoval diskusi o lokální AI. Vlajkový 31B Dense model se umístil na 3. místě žebříčku open-model LMArena se skóre 1 452. Verze, kterou na Macu skutečně chcete, je varianta Mixture-of-Experts 26B-A4B, která aktivuje pouze 3,8 miliardy parametrů na token a přitom čerpá z plných 26 miliard pro hloubku uvažování.
Proč je 32 GB nezbytných
Při 4bitové kvantizaci se vejde do přibližně 18 GB RAM, takže 32GB Mac ho spustí s reálnou rezervou. 24GB Mac ho sice načte, ale tlak na swap je reálný a inference klesá na minimum. Na 24 GB to nezkoušejte. Komunitní testování na M4 Pro s 24 GB hlásilo, že varianta 26B běžela přibližně na 2 tokenech za sekundu kvůli swapu. Na 32GB nebo 48GB stroji generuje čistě.
Nativní multimodalita a kontext
Hlavním přínosem Gemma 4 je nativní multimodalita. Model přijímá text, obrázky i video jako vstup. Můžete mu předat screenshoty, architektonické diagramy nebo PDF přímo. Podporuje kontextové okno 256K, což je dvakrát více než většina open modelů v této třídě nabízí. Licence Apache 2.0, komerční použití povoleno, Google zveřejnil spolu s podporou od prvního dne ze strany Hugging Face, llama.cpp, Ollama, LM Studio, MLX a Unsloth.
Pro tento model použijte Ollama, ne MLX
Důležitá výhrada pro duben 2026: MLX má se Gemma 4 známé problémy. Sestavení mlx-community v 4bitech jsou stále nestabilní a MLX backend LM Studia Gemma 4 zatím plně nepodporuje. Pro tento model konkrétně použijte Ollama, i když pro vše ostatní používáte LM Studio. Očekává se, že se to vyřeší během týdnů, ale dnes s tím nebojujte.
Rychlé parametry
- Hardwarová vhodnost: 32GB M5 Pro nebo Max doporučeno. 48 GB je pohodlné.
- Licence: Apache 2.0.
- Nejlepší pro: Multimodální práci, analýzu dlouhých dokumentů, vše, na co byste dříve sáhli po Gemini 2.5 přes API.
- Přeskočte, pokud: Máte jen 24 GB, nebo potřebujete rychlý krátký chat (místo toho použijte Qwen 3.5 9B).
Zmínka navíc: OpenAI GPT-OSS 20B
OpenAI tiše vydal open-weight model v srpnu 2025 pod licencí Apache 2.0 a většina lidí si toho nevšimla. GPT-OSS 20B je sestava Mixture-of-Experts s 21 miliardami celkových parametrů a 3,6 miliardami aktivními na token, trénovaná v přesnosti MXFP4, takže se vejde přibližně do 12 GB. Konkuruje Gemma 4 26B ve stejné třídě, ale se dvěma rozdíly: chybí mu multimodalita a je šest měsíců starý. Pokud vám problémy MLX s Gemma 4 blokují práci, GPT-OSS 20B je solidní náhrada. Jinak je Gemma 4 volbou pro duben 2026.
5. Maximum pro 32 GB+: Qwen 3.5 35B-A3B
Tento model stáhněte hned v den, kdy konfigurujete M5 Pro nebo Max s 48 GB nebo více. Qwen 3.5 35B-A3B je sestava Mixture-of-Experts s 35 miliardami parametrů, přičemž na token se aktivují jen 3 miliardy. Jinými slovy: získáte inteligenci 30B modelu při rychlosti inference 3B modelu, za předpokladu, že se vše vejde do paměti.
Co MoE znamená v praxi
Při 4bitové kvantizaci žije v přibližně 18 GB RAM. To zcela vylučuje 16GB Macy, 24 GB funguje, ale je těsné, a na 32GB nebo 48GB konfiguracích se cítí správně. Apple M5 benchmark zahrnoval verzi Qwen 3 této architektury a naměřil latenci prvního tokenu pod tři sekundy s rychlostmi generování, které překonávají většinu dense 14B modelů na stejném hardwaru. Aktualizace 3.5 na tomto základě zlepšila uvažování a generování kódu.
Kde vyniká
Co umožňuje, co menší modely nezvládají, je koherence v dlouhých textech. Úlohy jako „přefaktoruj tento soubor s 2 000 řádky", „shrň těchto dvacet PDF" nebo „napiš 4 000 slovní článek se specifickou strukturou" najednou fungují. Třída 7 až 8B se v půlce ztratí. Qwen 3.5 35B-A3B zůstane na zadání.
Qwen 3.5 35B-A3B vs Gemma 4 26B-A4B: který zvolit?
Jak si stojí vedle Gemma 4 26B-A4B? Gemma 4 je lepší volbou pro multimodální vstup a práci v ekosystému Google. Qwen 3.5 35B-A3B vítězí v hloubce čistě textového uvažování, práci s dlouhokontextovými dokumenty a má momentálně méně problémů s frameworky. Nainstalujte oba, pokud máte místo na disku.
Rychlé parametry
- Hardwarová vhodnost: 32 GB minimum, 48 GB doporučeno, 64 GB+ do budoucna.
- Licence: Apache 2.0.
- Nejlepší pro: Práci s dlouhým kontextem, vážné kódovací relace, náhradu Claude Sonnet pro rutinní úlohy, když chcete nulové náklady za API.
- Přeskočte, pokud: Máte méně než 32 GB RAM. Místo toho použijte Qwen 3.5 9B.
Co na Macu (zatím) nespustíte
Slovo upřímnosti, protože to je důležité. Titulky v dubnu 2026 ovládají modely, které lokálně nespustíte bez ohledu na to, kolik jste za MacBook zaplatili:
- GLM-4.7 a GLM-5 (Zhipu AI): 355 až 744 miliard parametrů. Sestavení FP8 potřebuje 8 GPU H200. Na laptopu to nepůjde.
- Claude Mythos Preview (Anthropic): Nejsou to open weights. Nikdy nebudou.
- DeepSeek R1 plný (ne distil): 671 miliard parametrů, potřebuje serverový rack.
- Llama 4 Maverick a Behemoth: Varianty 400B+ vyžadují multi-GPU sestavy.
- Gemma 4 31B Dense: Technicky možné na Macu s 48 GB+, ale varianta MoE 26B-A4B je rychlejší a téměř stejně schopná. Dense 31B přeskočte, pokud nedolaďujete model.
Pokud blogový příspěvek slibuje, že tyto modely poběží na vašem MacBooku „jen s trochou ladění", zavřete záložku. Lidé, kteří to píší, přeprodávají API kredity s extra kroky. Modely, které na Mac skutečně vejdou, jsou výše uvedených pět, a upřímná pravda je, že pro výstup na úrovni frontieru stále chcete cloudový přístup k originálu.
Přesně zde si Fello AI na M5 Macu zaslouží své místo. Jedna nativní aplikace vám dá ChatGPT, Claude, Gemini, Grok, DeepSeek a Perplexity za jediné předplatné $9.99/měsíc, včetně DeepSeek a Grok bez příplatku, za které byste jinak platili zvlášť. Váš lokální Qwen nebo Gemma 4 zvládne offline rutinní práci a frontierové cloudové modely jsou na dosah jednoho stisku klávesy pro vše, čeho 9B nebo 26B model nedosáhne. Což nás přivádí k praktické otázce.
Jak nainstalovat kterýkoliv z těchto modelů na M5 Mac
Pokud jste na macOS 26 s čipem M5 a stahujete cokoliv kromě Gemma 4, Ollama prozatím přeskočte. Existuje známá chyba Metal 4 shader, která na raných verzích Ollama rozbíjí GPU inferenci, a i oprava prochází MLX backendem. Začněte jednou z těchto dvou cest.
Snadná cesta: LM Studio
Stáhněte LM Studio, otevřete aplikaci, vyhledejte kterýkoliv z pěti výše uvedených modelů (pro nejlepší rychlost u Qwen, DeepSeek a Mistral modelů použijte prefix mlx-community/), klikněte na Download, klikněte na Load. Máte lokální klon ChatGPT s OpenAI-kompatibilním API na localhost:1234.
Pro Gemma 4 konkrétně použijte místo toho Ollama. MLX backend LM Studia k dubnu 2026 plně nepodporuje Gemma 4 a sestavení mlx-community v 4bitech mají problémy s načítáním. Spusťte ollama pull gemma4:26b-a4b a je hotovo.
Geek cesta: MLX-LM přímo
Otevřete Terminal, spusťte pip install mlx-lm a poté python -m mlx_lm.generate --model mlx-community/Qwen3.5-8B-4bit --prompt "hello". Model se jednou stáhne do ~/.cache/huggingface/ a každé další spuštění je okamžité.
Pro většinu lidí je LM Studio správná odpověď. Pro vývojáře budující aplikace nad lokálním modelem je MLX-LM přímo rychlejší na iterace.
Pravidlo palce pro hardware, které stojí za zapamatování: udržujte váhy modelu pod 60 % vaší unified memory. Na 24GB Macu je to přibližně 12 GB pro model a zbytek ponechte pro macOS, KV cache a prohlížeč. Překročte to a budete swapovat, což ničí rychlost inference.
Co se s čipem M5 skutečně změnilo
Jedna věc, kterou téměř každý jiný průvodce „lokální LLM na Macu" přehlíží: čip M5 je skutečná architektonická změna pro AI, ne jen vylepšení specifikací. Apple přidal dedikované Neural Accelerators uvnitř každého jádra GPU, navržené specificky pro maticové operace násobení, které dominují transformer inferenci. Proto Apple vlastní benchmark ukázal až 4násobné zrychlení time-to-first-token na M5 MacBook Pro oproti M4.
Paměťová šířka pásma také vzrostla. Základní M1 běžel na 68 GB/s. Základní M5 běží na 154 GB/s. Rychlost generování tokenů roste téměř lineárně s paměťovou šířkou pásma na Apple Silicon, takže praktický výsledek je, že 14B model na M5 Pro se cítí znatelně svižněji než stejný model na srovnatelném M4 Pro, i bez zrychlení Neural Accelerator.
Co to znamená pro nákupní rozhodnutí: pokud vybíráte mezi M4 Pro se slevou a novým M5 Pro za plnou cenu pro lokální AI práci, M5 je lepší volbou s reálným náskokem. Pokud vybíráte mezi M5 Pro s 24 GB a M5 Pro s 48 GB, upgrade paměti je důležitější než jakákoliv změna třídy čipu. Paměť na Apple Silicon po nákupu nelze rozšířit. Kupujte pro to, kde chcete být za dva roky, ne pro dnešek. Úplný přehled každé konfigurace M5 podle paměťové třídy najdete v našem průvodci nejlepším Macem pro AI.
Upřímné hodnocení
Pokud kupujete jeden model k instalaci a zapomenutí, stáhněte Qwen 3.5 9B přes LM Studio. Zvládne 80 % toho, co normální člověk chce od lokálního chatbota, a vejde se na každý prodávaný M5 Mac.
Pokud jste upgradovali na 32 GB nebo více, nainstalujte vedle něj Gemma 4 26B-A4B přes Ollama. Tato kombinace vám dá rychlý každodenní model plus multimodální možnost blízkou frontieru s téměř žádným překryvem. Pro práci s dlouhým kontextem konkrétně přidejte jako třetí možnost Qwen 3.5 35B-A3B.
Nestavte svůj pracovní postup kolem lokálních modelů pro práci na úrovni frontieru. Mezera mezi lokálním 9B modelem a nejnovějším Claude je stále velká a kdo vám říká opak, neprovozoval obojí v produkci. Lokální AI je druhý nástroj, ne náhrada. Používejte ji pro citlivá data, offline situace, neomezený průput na rutinní úlohy a pro prosté uspokojení z vědomí, že vaše data nikdy neopustila stroj. Pro vše ostatní je Fello AI nejčistší odpověď: ChatGPT, Claude, Gemini, Grok, DeepSeek a Perplexity v jedné nativní Mac aplikaci za $9.99/měsíc, přibližně o 83 % méně než při oddělených předplatných ChatGPT Plus, Claude Pro a Gemini Advanced, se DeepSeek a Grok v ceně bez příplatku.
To je nastavení, které v dubnu 2026 skutečně funguje: lokální Qwen plus lokální Gemma 4 na vašem Macu pro rutinní práci a frontierový stack na klik pro těžké problémy. Obojí, ne jedno nebo druhé.
Viz také exploit Claude Mythos na Apple M5 ochranu paměti.
FAQ
Kolik RAM potřebuji ke spuštění lokálního LLM na Macu?
Potřebujete minimálně 16 GB unified memory, abyste spustili cokoliv užitečného. Model 7B nebo 8B při 4bitové kvantizaci se pohodlně vejde do 16 GB a zbyde místo pro macOS. Ideál je 24 GB, které zvládnou 8B a 14B modely s rezervou pro dlouhá kontextová okna. Pro modely 26B až 30B jako Gemma 4 nebo Qwen 3.5 35B-A3B potřebujete 32 GB nebo více. Pod 16 GB jste odkázáni na drobné modely 1 až 3B, které existují hlavně jako proof-of-concept.
Je Ollama nebo LM Studio lepší na Macu?
LM Studio pro většinu případů užití v dubnu 2026. Má přehledné grafické rozhraní, nativní podporu MLX a funguje jako drop-in OpenAI-kompatibilní API server. Ollama použijte konkrétně pro Gemma 4, kde MLX od dubna 2026 stále obsahuje chyby, a pro headless serverové sestavy. Obě jsou zdarma. Obě pod kapotou běží stejné soubory modelů. Zvolte nejprve LM Studio, pro okrajové případy přejděte na Ollama.
Zvládne 16GB MacBook Air lokální AI?
Ano, s výhradami. 16GB M5 MacBook Air bez problémů spustí Mistral 7B nebo Qwen 3.5 9B. Bude těsné, pokud chcete zároveň Chrome s dvaceti záložkami a otevřený Slack. Plánujte zavírat paměťově náročné aplikace při spuštění inference, nebo počítejte s pomalejším generováním, když macOS začne stránkovat.
M5 Pro vs M5 Max pro AI práci, který zvolit?
Pro lokální AI konkrétně více RAM vždy poráží více GPU jader. M5 Pro s 48 GB předčí M5 Max s 32 GB na tomto zatížení, protože kapacita paměti určuje, které modely vůbec lze načíst. Extra GPU jádra čipu Max pomáhají při zpracování promptů, ale generování tokenů je omezeno paměťovou šířkou pásma a rozdíl mezi šířkou pásma Pro a Max je menší než cenový rozdíl. Kupte Pro s co největší RAM, kterou si můžete dovolit, než platit za upgrade na Max.
Mohu spustit DeepSeek R1 na Macu?
Ne plný R1. Vlajkový DeepSeek R1 má 671 miliard parametrů a potřebuje přibližně 400 GB paměti při 4bitové kvantizaci. To je serverový rack, ne laptop. Co spustit lze, je DeepSeek R1 Distill Qwen 14B, který uchovává chování uvažování R1 v balíčku 9 GB, jenž se vejde na jakýkoliv 24GB Mac. To je realistická cesta k „DeepSeek na Macu" v dubnu 2026.
Jsou lokální AI modely stejně dobré jako ChatGPT nebo Claude?
Pro rutinní úlohy jako psaní návrhů, sumarizace a základní kódování se mezera uzavřela natolik, že lokální modely jsou konkurenceschopné. Pro frontierové uvažování, komplexní víceúrovňové kódování nebo cokoliv, co vyžaduje nejnovější trénovací data, stále vítězí cloudové modely jako Claude a ChatGPT s citelným náskokem. Upřímná odpověď je, že lokální AI je doplněk, ne náhrada. Používejte ji pro soukromí, offline práci a neomezený průput. Cloudem řešte těžké věci.
Jaké je nejlepší nastavení: lokální AI nebo cloudová AI na Macu?
Obojí, ne jedno nebo druhé. Spusťte Qwen 3.5 9B nebo Gemma 4 26B-A4B lokálně přes LM Studio nebo Ollama pro citlivá data, offline relace a neomezený průput. Nechte Fello AI otevřené pro těžké problémy, které lokální model stále nezvládne: frontierové uvažování v Claude, komplexní agentní práci v ChatGPT, práci s dlouhým kontextem dokumentů v Gemini, matematiku DeepSeek a real-time odpovědi Grok, každý hlavní cloudový chatovací model sdružený do jedné nativní Mac aplikace za $9.99/měsíc. Lokální pokryje 80 % objemu, cloud pokryje 20 %, na kterých nejvíce záleží.