Die fünf Open-Source-KI-Modelle, die sich im April 2026 auf einem M5 Mac lohnen, sind Mistral 7B (16 GB), Qwen 3.5 9B (24 GB), DeepSeek R1 Distill Qwen 14B (24 GB), Gemma 4 26B-A4B (32 GB) und Qwen 3.5 35B-A3B (32 GB+). Der minimale Unified Memory ist 16 GB, der Sweetspot 24 GB, und alles über 30B Parametern braucht 32 GB oder mehr. Open-Source-Spitzenmodelle wie GLM 5.2 oder das volle DeepSeek R1 brauchen Hunderte GB VRAM, überspring die also ganz. Die fünf unten sind das, was tatsächlich passt.
Alle fünf Empfehlungen sind Beispiele für Open source KI, Modelle, deren Gewichte offen veröffentlicht sind, sodass du sie lokal ausführen kannst statt über eine kostenpflichtige Cloud-API.
Apples eigene MLX-Benchmarks zeigen, dass der M5-Chip beim Time-to-First-Token eine drei- bis vierfache Beschleunigung gegenüber dem M4 liefert, dank neuer Neural Accelerators in jedem GPU-Kern. Ein Modell mit 20 Milliarden Parametern produziert seinen ersten Token jetzt in unter drei Sekunden auf einem Basis-MacBook Pro, was vor einem Jahr undenkbar war. In diesem Guide geht es darum, Modelle lokal auszuführen, eine andere Aufgabe als das, was Fello AI tut. Fello AI leitet zu jedem großen Cloud-Chatmodell weiter – ChatGPT, Claude, Gemini, Grok, DeepSeek und Perplexity – über eine native Mac-App mit einem einzigen Abo für 9,99 $/Monat (alle verfolgt in unserem Hub der besten KI-Modelle). Lokale Modelle sind hier das richtige Werkzeug für Datenschutz, Offline-Zugang oder null API-Rechnungen. Das realistische Setup 2026 ist beides: ein lokales Modell für die Fließarbeit, Fello AI offen für die harten Probleme.
Für das breitere Feld jenseits dessen, was auf einen Mac passt, ordnet unser Guide zu den besten Open source KI-Modellen die volle Palette mit offenen Gewichten.
Das Wichtigste in Kürze
Fünf Modelle, die sich auf einem M5 Mac zum Download lohnen, nach Hardware-Eignung geordnet:
- Mistral 7B für 16-GB-Macs, die schnelles, sauberes Befolgen von Anweisungen brauchen
- Qwen 3.5 9B für den 24-GB-Sweetspot, der beste allgemeine Alltagsbegleiter
- DeepSeek R1 Distill Qwen 14B für reasoning-lastige Arbeit auf 24-GB-Maschinen
- Gemma 4 26B-A4B für 32-GB-Macs, die spitzennahe Qualität wollen
- Qwen 3.5 35B-A3B MoE für 32-GB+-Stretch-Builds und Arbeit mit langem Kontext
Installiere LM Studio mit dem MLX-Backend für die meisten Empfehlungen. Nutze Ollama speziell für Gemma 4 (MLX hat damit Stand April 2026 noch Bugs). Plane 60 % deines RAM für das Modell ein und lass den Rest für macOS und den Kontext.
Die Vergleichstabelle
| Modell | Parameter | Größe bei Q4 | Min. RAM | Lizenz | Ideal für |
|---|---|---|---|---|---|
| Mistral 7B | 7B dicht | ~5 GB | 16 GB | Apache 2.0 | Schreiben, E-Mail, Entwürfe |
| Qwen 3.5 9B | 9B dicht | ~6 GB | 16–24 GB | Apache 2.0 | Allgemeiner Alltagsbegleiter |
| DeepSeek R1 Distill Qwen 14B | 14B dicht | ~9 GB | 24 GB | MIT | Mathe, Logik, Code-Review |
| Gemma 4 26B-A4B | 26B gesamt, 3,8B aktiv (MoE) | ~18 GB | 32 GB | Apache 2.0 | Multimodal, langer Kontext |
| Qwen 3.5 35B-A3B | 35B gesamt, 3B aktiv (MoE) | ~22 GB | 32 GB | Apache 2.0 | Kohärenz in Langtexten |
1. 16-GB-Einstieg: Mistral 7B
Wenn du das Basis-M5-MacBook-Air mit 16 GB Unified Memory gekauft hast, ist das dein Startpunkt. Mistral 7B ist ein dichtes Modell mit 7 Milliarden Parametern vom französischen Labor Mistral AI, veröffentlicht unter Apache 2.0. Bei Q4_K_M-Quantisierung lädt es in etwa 5 GB. Reichlich Platz für macOS und ein langes Kontextfenster.
Worin es gut ist
Was es lohnenswerter macht als die Masse der 7B-Modelle auf Hugging Face, ist die Disziplin beim Befolgen von Anweisungen. Es tut, worum du bittest, und hört auf, wenn es fertig ist. Kein Füllwerk. Fürs Entwerfen von E-Mails, das Umschreiben von Absätzen oder das Aufräumen von Meeting-Notizen zählt diese Zurückhaltung mehr als Benchmark-Werte.
Kurz-Specs
- Hardware-Eignung: 16-GB-M5-MacBook-Air bequem, 24 GB mit großen Kontextfenstern.
- Lizenz: Apache 2.0 (kommerzielle Nutzung erlaubt).
- Ideal für: Tägliche Schreibhilfe, leichtgewichtigen Chat, Offline-Entwürfe unterwegs.
- Überspringen, wenn: Du Code-Generierung oder mehrstufiges Reasoning brauchst.
2. 24-GB-Alltagsbegleiter: Qwen 3.5 9B
Als Apples Machine-Learning-Research-Team seinen MLX-Benchmark für den M5-Chip veröffentlichte, war das gewählte Referenzmodell Qwen. Das ist kein Zufall. Die Qwen-Familie von Alibaba ist die, die das Apple-Team mit MLX-LM-Tutorials ausliefert, weil sie sich auf Apple-Chips gut verhält und die MLX-Konvertierung sauber ist.
Warum Qwen 3.5 statt Qwen 3
Apple hat Qwen 3 gebenchmarkt. Die aktuelle Generation, die du im April 2026 tatsächlich herunterladen willst, ist Qwen 3.5, die Version, an der die MLX-Community seit Februar iteriert. Die 8B-Variante bei 4-Bit-Quantisierung lädt in unter 6 GB und generiert mit rund 60–80 Token pro Sekunde auf einem M5 Pro.
Worin es gut ist
Wo es sich seinen Platz verdient, ist die Breite. Qwen 3.5 9B bewältigt Coding, Langtext-Schreiben, Zusammenfassung und mehrsprachige Aufgaben. Seine tschechische und chinesische Ausgabe sind beide brauchbar, was bei dieser Größe selten ist. Die MLX-Community-Builds werden wöchentlich aktualisiert, sodass Bugfixes schnell kommen.
Kurz-Specs
- Hardware-Eignung: 16 GB knapp, 24 GB ideal, 32 GB luxuriös.
- Lizenz: Apache 2.0.
- Ideal für: Das eine lokale Modell, das du installiert lässt, wenn du nur eines installierst.
- Überspringen, wenn: Du etwas willst, das auf eine einzelne Aufgabe spezialisiert ist.
3. 24-GB-Reasoning-Wahl: DeepSeek R1 Distill Qwen 14B
DeepSeeks volles R1-Modell ist ein Ungetüm mit 671 Milliarden Parametern, das Anfang 2025 Schlagzeilen machte. Du kannst es nicht ausführen. Ausführen kannst du die destillierte Version: DeepSeek nahm R1s Reasoning-Spuren und nutzte sie, um eine Qwen-Basis mit 14 Milliarden Parametern feinzutunen. Das Ergebnis ist ein Modell, das bei Q4 in etwa 9 GB passt, aber bei Mathe, Logik und mehrstufigen Problemen seinen Rechenweg zeigt, so wie es das große Modell tut.
So funktioniert der Denkmodus
Das ist die Wahl für alle, die es leid sind, dass kleine lokale Modelle bei allem, was schwerer als eine FAQ ist, durcheinanderkommen. Das destillierte R1 denkt vor der Antwort und schreibt eine Reasoning-Kette innerhalb von <think>-Tags vor der finalen Antwort. Das kostet Tempo. Es bringt Korrektheit bei Problemen, bei denen normale 7B- und 8B-Modelle raten.
Realistisches Tempo auf einem M5
Eine realistische Erwartung auf einem M5 Pro mit 24 GB: 15 bis 25 Token pro Sekunde bei der Generierung, plus ein Reasoning-Durchlauf, der bei harten Prompts ein paar zusätzliche Sekunden dauert. Schnell genug zum Nutzen, langsam genug, dass du es denken siehst.
Kurz-Specs
- Hardware-Eignung: 24-GB-M5-Pro ist der Sweetspot. 16 GB funktioniert, lässt aber keinen Spielraum.
- Lizenz: MIT.
- Ideal für: Mathe, Code-Debugging, Logikrätsel, juristisches Reasoning, alles, wo eine selbstsichere falsche Antwort dich etwas kostet.
- Überspringen, wenn: Du schnellen, lockeren Chat willst.
4. 32-GB-Power-Wahl: Gemma 4 26B-A4B
Google DeepMind brachte Gemma 4 am 2. April 2026 heraus, und es formte die Diskussion über lokale KI sofort neu. Das 31B-Dense-Flaggschiff belegt Platz 3 auf der LMArena-Bestenliste für offene Modelle mit einem Wert von 1.452. Die Version, die du auf einem Mac tatsächlich willst, ist die 26B-A4B-Mixture-of-Experts-Variante, die pro Token nur 3,8 Milliarden Parameter aktiviert, für die Reasoning-Tiefe aber auf die vollen 26 Milliarden zurückgreift.
Warum 32 GB nicht verhandelbar sind
Bei 4-Bit-Quantisierung passt es in etwa 18 GB RAM, was bedeutet, dass ein 32-GB-Mac es mit echtem Spielraum ausführt. Ein 24-GB-Mac kann es laden, aber der Swap-Druck ist real und die Inferenz sinkt auf ein Schneckentempo. Versuch das nicht auf 24 GB. Community-Tests auf einer M4-Pro-24-GB-Maschine berichteten, dass die 26B-Variante wegen Swap mit rund 2 Token pro Sekunde lief. Auf einer 32-GB- oder 48-GB-Maschine generiert sie sauber.
Native Multimodalität und Kontext
Das Große an Gemma 4 ist die native Multimodalität. Das Modell nimmt Text, Bilder und Video als Eingabe. Du kannst ihm Screenshots, Architekturdiagramme oder PDFs direkt geben. Es unterstützt ein 256K-Kontextfenster, doppelt so viel wie die meisten offenen Modelle dieser Klasse bieten. Apache-2.0-Lizenz, kommerzielle Nutzung erlaubt, und Google veröffentlichte es mit Day-One-Unterstützung durch Hugging Face, llama.cpp, Ollama, LM Studio, MLX und Unsloth.
Nutze für dieses hier Ollama, nicht MLX
Ein wichtiger Vorbehalt für April 2026: MLX hat bekannte Probleme mit Gemma 4. Die mlx-community-4-Bit-Builds sind noch fragil, und das MLX-Backend von LM Studio unterstützt Gemma 4 noch nicht vollständig. Nutze speziell für dieses Modell Ollama, selbst wenn du LM Studio für alles andere verwendest. Das dürfte sich in Wochen lösen, aber kämpfe heute nicht dagegen an.
Kurz-Specs
- Hardware-Eignung: 32-GB-M5-Pro oder -Max empfohlen. 48 GB ist bequem.
- Lizenz: Apache 2.0.
- Ideal für: Multimodale Arbeit, Analyse langer Dokumente, alles, wofür du zuvor zu Gemini 2.5 über die API gegriffen hättest.
- Überspringen, wenn: Du nur 24 GB hast oder schnellen Kurz-Chat brauchst (nimm stattdessen Qwen 3.5 9B).
Erwähnenswert: OpenAI GPT-OSS 20B
OpenAI veröffentlichte im August 2025 leise ein Modell mit offenen Gewichten unter Apache 2.0, und die meisten übersahen es. GPT-OSS 20B ist ein Mixture-of-Experts-Build mit 21 Milliarden Parametern insgesamt und 3,6 Milliarden aktiv pro Token, trainiert in MXFP4-Präzision, sodass es in rund 12 GB passt. Es konkurriert mit Gemma 4 26B in derselben Klasse, aber mit zwei Unterschieden: Ihm fehlt Multimodalität, und es ist inzwischen ein halbes Jahr alt. Wenn Gemma 4s MLX-Probleme dich blockieren, ist GPT-OSS 20B ein solider Notbehelf. Ansonsten ist Gemma 4 die Wahl für April 2026.
5. 32-GB+-Max-Stretch: Qwen 3.5 35B-A3B
Das ist das Modell, das du an dem Tag herunterlädst, an dem du einen M5 Pro oder Max mit 48 GB oder mehr konfigurierst. Qwen 3.5 35B-A3B ist ein Mixture-of-Experts-Build mit 35 Milliarden Parametern, bei dem pro Token nur 3 Milliarden Parameter aktiviert werden. Übersetzt: Du bekommst die Intelligenz eines 30B-Modells mit dem Inferenztempo eines 3B-Modells, vorausgesetzt, das Ganze passt in den Speicher.
Was MoE in der Praxis bedeutet
Bei 4-Bit-Quantisierung lebt es in etwa 18 GB RAM. Das schließt 16-GB-Macs ganz aus, macht 24 GB machbar, aber eng, und fühlt sich auf 32-GB- oder 48-GB-Konfigurationen richtig an. Apples M5-Benchmark umfasste die Qwen-3-Version dieser Architektur und maß eine First-Token-Latenz unter drei Sekunden, mit Generierungstempi, die die meisten dichten 14B-Modelle auf derselben Hardware übertreffen. Das 3.5-Update verbesserte Reasoning und Code-Generierung über diese Basis hinaus.
Wo es glänzt
Was es ermöglicht, das kleinere Modelle nicht bewältigen, ist Kohärenz in Langtexten. Aufgaben wie „refactore diese 2.000 Zeilen lange Datei“, „fasse diese zwanzig PDFs zusammen“ oder „schreibe einen 4.000-Wörter-Artikel mit einer bestimmten Struktur“ funktionieren plötzlich. Die 7–8B-Klasse verliert sich auf halbem Weg. Qwen 3.5 35B-A3B bleibt bei der Aufgabe.
Qwen 3.5 35B-A3B vs. Gemma 4 26B-A4B: welches?
Wo steht das neben Gemma 4 26B-A4B? Gemma 4 ist die bessere Wahl für multimodale Eingaben und Arbeit im Google-Ökosystem. Qwen 3.5 35B-A3B gewinnt bei reiner Textreasoning-Tiefe, bei Dokumentarbeit mit langem Kontext und hat gerade weniger Framework-Probleme. Installiere beide, wenn du den Speicherplatz hast.
Kurz-Specs
- Hardware-Eignung: 32 GB minimum, 48 GB empfohlen, 64 GB+ zukunftssicher.
- Lizenz: Apache 2.0.
- Ideal für: Arbeit mit langem Kontext, ernsthafte Coding-Sitzungen, das Ersetzen von Claude Sonnet für Routineaufgaben, wenn du null API-Kosten willst.
- Überspringen, wenn: Du weniger als 32 GB RAM hast. Nimm stattdessen Qwen 3.5 9B.
Was du (noch) nicht auf einem Mac ausführen kannst
Ein Wort der Ehrlichkeit, denn das zählt. Die Schlagzeilen im April 2026 werden von Modellen dominiert, die du lokal nicht ausführen kannst, egal wie viel du für dein MacBook ausgegeben hast:
- GLM-4.7 und GLM-5 (Zhipu AI): 355–744 Milliarden Parameter. Der FP8-Build braucht 8 H200-GPUs. Auf einem Laptop passiert das nicht.
- Claude Mythos Preview (Anthropic): Keine offenen Gewichte. Wird es nie geben.
- DeepSeek R1 vollständig (nicht das Distill): 671 Milliarden Parameter, braucht ein Server-Rack.
- Llama 4 Maverick und Behemoth: Die 400B+-Varianten brauchen Multi-GPU-Setups.
- Gemma 4 31B Dense: Technisch auf einem 48-GB+-Mac möglich, aber die 26B-A4B-MoE-Variante ist schneller und fast so leistungsfähig. Überspring das dichte 31B, außer du machst Fine-Tuning.
Wenn ein Blogbeitrag verspricht, dass diese auf deinem MacBook „mit nur ein bisschen Tüftelei“ laufen, schließ den Tab. Die Leute, die das schreiben, verkaufen API-Credits mit Extraschritten weiter. Die Modelle, die tatsächlich auf einen Mac passen, sind die fünf oben, und die ehrliche Wahrheit ist, dass du für Spitzenleistung weiterhin Cloud-Zugang zum echten Ding willst.
Genau hier verdient sich Fello AI seinen Platz auf einem M5 Mac. Eine native App gibt dir ChatGPT, Claude, Gemini, Grok, DeepSeek und Perplexity mit einem einzigen Abo für 9,99 $/Monat – inklusive DeepSeek und Grok ohne Aufpreis, die du sonst separat zahlen würdest. Dein lokales Qwen oder Gemma 4 übernimmt die Offline-Fließarbeit, und die Cloud-Spitzenmodelle sind einen Tastendruck entfernt für alles, was ein 9B- oder 26B-Modell nicht anfassen kann. Was uns zur praktischen Frage bringt.
So installierst du eines davon auf einem M5 Mac
Überspring Ollama vorerst, wenn du auf macOS 26 mit einem M5-Chip bist und alles außer Gemma 4 herunterlädst. Es gibt einen bekannten Metal-4-Shader-Bug, der die GPU-Inferenz auf frühen Ollama-Versionen kaputt macht, und selbst der Fix läuft über das MLX-Backend. Beginne mit einem dieser zwei Wege.
Einfacher Weg: LM Studio
Lade LM Studio herunter, öffne die App, suche nach einem der fünf Modelle oben (mit mlx-community/ voranstellen für bestes Tempo bei den Qwen-, DeepSeek- und Mistral-Empfehlungen), klicke auf Download, klicke auf Load. Du hast jetzt einen lokalen ChatGPT-Klon mit einer OpenAI-kompatiblen API auf localhost:1234.
Speziell für Gemma 4 nutze stattdessen Ollama. Das MLX-Backend von LM Studio unterstützt Gemma 4 Stand April 2026 nicht vollständig, und die mlx-community-4-Bit-Builds haben Ladeprobleme. Führe ollama pull gemma4:26b-a4b aus, und du bist startklar.
Nerd-Weg: MLX-LM direkt
Öffne das Terminal und führe pip install mlx-lm aus, dann python -m mlx_lm.generate --model mlx-community/Qwen3.5-8B-4bit --prompt "hello". Das Modell lädt einmal nach ~/.cache/huggingface/ herunter, und jeder weitere Lauf ist sofort da.
Für die meisten ist LM Studio die richtige Antwort. Für Entwickler, die Apps gegen ein lokales Modell bauen, iteriert man mit MLX-LM direkt schneller.
Eine merkenswerte Hardware-Faustregel: Halte die Modellgewichte unter 60 % deines Unified Memory. Auf einem 24-GB-Mac sind das rund 12 GB fürs Modell, der Rest bleibt für macOS, den KV-Cache und deinen Browser. Geh höher, und du swappst, was das Inferenztempo zerstört.
Was sich mit dem M5-Chip tatsächlich geändert hat
Eine Sache, über die fast jeder andere „lokales LLM auf dem Mac“-Guide hinweggeht: Der M5-Chip ist ein echter Architekturwandel für KI, kein bloßer Spec-Bump. Apple fügte in jeden GPU-Kern dedizierte Neural Accelerators ein, speziell für die Matrixmultiplikationen gebaut, die die Transformer-Inferenz dominieren. Deshalb zeigte Apples eigener Benchmark bis zu 4x schnellere Time-to-First-Token auf dem M5 MacBook Pro gegenüber dem M4.
Auch die Speicherbandbreite sprang. Der Basis-M1 lief mit 68 GB/s. Der Basis-M5 läuft mit 154 GB/s. Das Token-Generierungstempo skaliert auf Apple-Chips fast linear mit der Speicherbandbreite, sodass das praktische Ergebnis ist, dass sich ein 14B-Modell auf einem M5 Pro spürbar flotter anfühlt als dasselbe Modell auf einem gleichwertigen M4 Pro, selbst ohne den Neural-Accelerator-Schub.
Was das für eine Kaufentscheidung bedeutet: Wenn du für lokale KI-Arbeit zwischen einem M4 Pro im Angebot und einem neuen M5 Pro zum vollen Preis wählst, ist der M5 die bessere Wahl mit echtem Abstand. Wenn du zwischen einem M5 Pro mit 24 GB und einem M5 Pro mit 48 GB wählst, zählt das Speicher-Upgrade mehr als jede Chip-Stufe. Speicher auf Apple-Chips ist nach dem Kauf nicht aufrüstbar. Kaufe dafür, wo du in zwei Jahren sein willst, nicht heute. Für eine vollständige Aufschlüsselung jeder M5-Konfiguration nach RAM-Stufe siehe unseren Kaufberater für den besten Mac für KI.
Das ehrliche Urteil
Wenn du ein Modell zum Installieren und Vergessen kaufst, lade Qwen 3.5 9B über LM Studio herunter. Es bewältigt 80 % von dem, was eine normale Person von einem lokalen Chatbot will, und passt auf jeden verkauften M5 Mac.
Wenn du auf 32 GB oder mehr aufgerüstet hast, installiere Gemma 4 26B-A4B über Ollama daneben. Diese Kombination gibt dir einen schnellen Alltagsbegleiter plus eine spitzennahe multimodale Option mit fast keiner Überschneidung zwischen ihnen. Speziell für Textarbeit mit langem Kontext füge Qwen 3.5 35B-A3B als dritte Option hinzu.
Bau deinen Workflow für Spitzenarbeit nicht um lokale Modelle herum. Die Kluft zwischen einem lokalen 9B-Modell und dem neuesten Claude ist noch groß, und wer dir etwas anderes erzählt, hat nicht beide im Produktivbetrieb ausgeführt. Lokale KI ist ein zweites Werkzeug, kein Ersatz. Nutze sie für datenschutzsensible Arbeit, für Offline-Situationen, für unbegrenzten Durchsatz bei Routineaufgaben und für die schlichte Genugtuung zu wissen, dass deine Daten die Maschine nie verlassen haben. Für alles andere ist Fello AI die sauberste Antwort: ChatGPT, Claude, Gemini, Grok, DeepSeek und Perplexity in einer nativen Mac-App für 9,99 $/Monat – rund 83 % weniger, als ChatGPT Plus, Claude Pro und Gemini Advanced separat zu stapeln, und mit DeepSeek und Grok ohne Aufpreis dabei.
Das ist das Setup, das im April 2026 tatsächlich funktioniert: ein lokales Qwen plus ein lokales Gemma 4 auf deinem Mac für die Fließarbeit, und der Spitzen-Stack einen Klick entfernt für die harten Probleme. Beides, nicht das eine oder das andere.
Siehe auch ein Claude-Mythos-Exploit von Apples M5-Speicherschutz.
FAQ
Wie viel RAM brauche ich, um ein lokales LLM auf einem Mac auszuführen?
Du brauchst mindestens 16 GB Unified Memory, um etwas Brauchbares auszuführen. Ein 7B- oder 8B-Modell bei 4-Bit-Quantisierung passt bequem in 16 GB und lässt Platz für macOS. Der Sweetspot ist 24 GB, der 8B- und 14B-Modelle mit Platz für lange Kontextfenster bewältigt. Für 26B-30B-Modelle wie Gemma 4 oder Qwen 3.5 35B-A3B brauchst du 32 GB oder mehr. Unter 16 GB steckst du bei winzigen 1-3B-Modellen fest, die hauptsächlich als Machbarkeitsnachweis existieren.
Ist Ollama oder LM Studio auf einem Mac besser?
LM Studio für die meisten Anwendungsfälle im April 2026. Es hat eine saubere GUI, native MLX-Unterstützung und funktioniert als OpenAI-kompatibler API-Server zum direkten Einsetzen. Nutze Ollama speziell für Gemma 4, wo MLX Stand April 2026 noch Bugs hat, und für Headless-Server-Setups. Beide sind kostenlos. Beide führen unter der Haube dieselben Modelldateien aus. Wähle zuerst LM Studio, greif für die Sonderfälle auf Ollama zurück.
Kann ein 16-GB-MacBook-Air lokale KI ausführen?
Ja, mit Einschränkungen. Ein 16-GB-M5-MacBook-Air führt Mistral 7B oder Qwen 3.5 9B bequem aus. Es wird knapp, wenn du zusätzlich Chrome mit zwanzig Tabs und Slack offen haben willst. Plane, speicherhungrige Apps zu schließen, wenn du Inferenz laufen lässt, oder nimm langsamere Generierung in Kauf, wenn macOS zu pagen beginnt.
M5 Pro vs. M5 Max für KI-Arbeit, welches?
Speziell für lokale KI schlägt mehr RAM jedes Mal mehr GPU-Kerne. Ein M5 Pro mit 48 GB übertrifft bei dieser Arbeitslast einen M5 Max mit 32 GB, weil die Speicherkapazität bestimmt, welche Modelle du überhaupt laden kannst. Die zusätzlichen GPU-Kerne des Max-Chips helfen bei der Prompt-Verarbeitung, aber die Token-Generierung ist speicherbandbreiten-gebunden, und der Unterschied zwischen Pro- und Max-Bandbreite ist kleiner als die Preislücke. Kaufe den Pro mit dem meisten RAM, den du dir leisten kannst, bevor du für das Max-Upgrade zahlst.
Kann ich DeepSeek R1 auf einem Mac ausführen?
Nicht das volle R1. Das Flaggschiff DeepSeek R1 hat 671 Milliarden Parameter und braucht bei 4-Bit-Quantisierung rund 400 GB Speicher. Das ist ein Server-Rack, kein Laptop. Ausführen kannst du DeepSeek R1 Distill Qwen 14B, das R1s Reasoning-Verhalten in einem 9-GB-Paket behält, das auf jeden 24-GB-Mac passt. Das ist der realistische Weg zu „DeepSeek auf dem Mac“ im April 2026.
Sind lokale KI-Modelle so gut wie ChatGPT oder Claude?
Für Routineaufgaben wie Entwerfen, Zusammenfassen und einfaches Coding hat sich die Kluft weit genug geschlossen, dass lokale Modelle konkurrenzfähig sind. Für Spitzen-Reasoning, komplexes mehrstufiges Coding oder alles, was die neuesten Trainingsdaten braucht, gewinnen Cloud-Modelle wie Claude und ChatGPT weiterhin mit deutlichem Abstand. Die ehrliche Antwort ist, dass lokale KI eine Ergänzung ist, kein Ersatz. Nutze sie für Datenschutz, Offline-Arbeit und unbegrenzten Durchsatz. Nutze die Cloud für die harten Sachen.
Was’s das beste Setup: lokale KI oder Cloud-KI auf einem Mac?
Beides, nicht das eine oder das andere. Führe Qwen 3.5 9B oder Gemma 4 26B-A4B lokal über LM Studio oder Ollama aus für datenschutzsensible Arbeit, Offline-Sitzungen und unbegrenzten Durchsatz. Halte Fello AI offen für die harten Probleme, die ein lokales Modell noch verfehlt: Spitzen-Reasoning in Claude, komplexe Agent-Arbeit in ChatGPT, Dokumentarbeit mit langem Kontext in Gemini, dazu DeepSeek’s Mathe und Grok’s Echtzeit-Antworten – jedes große Cloud-Chatmodell gebündelt in einer nativen Mac-App für 9,99 $/Monat. Lokal deckt 80 % des Volumens ab, die Cloud deckt die 20 % ab, die am meisten zählen.