Die besten Open-Source-KI-Modelle haben im September erneut die Spitze gewechselt. Xiaomi veröffentlichte die Gewichte für MiMo-V2.6-Pro am 21. September 2026 unter einer schlichten MIT-Lizenz, und Artificial Analysis bewertet es jetzt mit 46,3 Punkten auf seinem Intelligence Index v4.3.2, dem höchsten Wert aller Open-Weight-Modelle und gleichauf mit Grok 4.7. Das beste geschlossene Modell, Claude Opus 5.5, liegt bei 57,6. Kimi K3 ist weiterhin das größte offene Modell und das offene Modell, das die Arena-Abstimmenden am höchsten einstufen, GLM 5.3 Flash ist die beste MIT-lizenzierte Wahl für die meisten Menschen, und Gemma 4 läuft nach wie vor auf einem Laptop. Unser vollständiger Vergleich DeepSeek gegen Claude stellt ein offenes und ein geschlossenes Labor direkt gegenüber.
Dieser Leitfaden ordnet die Open-Source-KI-Modelle, die 2026 deine Zeit wert sind, zeigt, worin jedes wirklich am besten ist, und wie du sie ohne ein Rack voller GPUs tatsächlich betreiben kannst. Wir haben die Auswahl anhand unabhängiger Benchmark-Daten, Lizenzbedingungen und echter Zugänglichkeit eingeordnet, denn die meisten Listen zu „bester Open-Source-KI“ werden von Unternehmen geschrieben, die dir die Hardware dafür verkaufen wollen. Wir verkaufen eine App, keine GPUs, dieses Ranking hat also kein Eigeninteresse in diesem Rennen. Für einen genaueren Blick darauf, wie sich ein offenes Modell gegen die bezahlten Flaggschiffe schlägt, sieh dir GLM im direkten Vergleich mit den Closed-Source-Flaggschiffen an.
Falls dir die Bezeichnung „Open Source“ selbst zu unklar ist, erklärt unser Beitrag dazu, was Open-Source-KI wirklich bedeutet, offene Gewichte, Lizenzierung und warum „offen“ nicht immer das bedeutet, was du denkst.
Das Wichtigste in Kürze
- MiMo-V2.6-Pro ist mit 46,3 das bestbewertete offene Modell im Artificial Analysis Intelligence Index, ein MIT-lizenziertes Modell mit 1,02 Billionen Parametern, das etwa 0,13 $ pro Index-Aufgabe kostet. Kimi K3 (43,6) ist mit 2,78 Billionen Parametern weiterhin das größte offene Modell und das beste offene Modell auf den Abstimmungs-Boards der Arena, auf denen MiMo noch nicht bewertet wurde.
- GLM 5.3 Flash ist für die meisten Menschen die richtige Wahl: 41,8 im Index, ein Kontext von 1 Mio. Token, native Bild- und Videoeingabe und eine saubere MIT-Lizenz bei einem 321B-Modell, für das du tatsächlich Hardware mieten kannst. Das ältere GLM 5.2 kommt auf 33,7, und Artificial Analysis führt es inzwischen als veraltet.
- DeepSeek V4.1 Flash (39,5, MIT) hat am 10. September V4-Pro als stärkstes offenes Modell von DeepSeek abgelöst und ist mit etwa 233 Token pro Sekunde das schnellste Modell in diesem Ranking.
- Die meisten „Open-Source“-Modelle sind eigentlich Open-Weight, die Gewichte sind frei, aber die Trainingsdaten bleiben privat. Echte Open-Source-KI ist seltener, als die Bezeichnung vermuten lässt, und mehrere der stärksten Modelle hier stehen unter eigenen Lizenzen statt unter MIT oder Apache 2.0.
- Du brauchst keine GPU-Farm für die meisten Modelle auf dieser Liste. Gemma 4 12B läuft auf einem modernen Laptop, Qwen 3.8 27B passt auf einen gut ausgestatteten Mac, und Apps leiten die größten Modelle ganz ohne lokale Hardware direkt an dein Mac oder iPhone.
Was als Open-Source-KI-Modell zählt
Ein Open-Source-KI-Modell veröffentlicht seine Gewichte und idealerweise auch Code und Trainingsdaten, sodass jeder es herunterladen, ausführen, verändern und weitergeben kann. Das ist das Versprechen. Die Realität ist differenzierter, und das solltest du wissen, bevor du dich für eines entscheidest.
Die meisten Modelle, die alle „Open Source“ nennen, sind eigentlich Open-Weight. Du bekommst die trainierten Gewichte kostenlos, aber die Trainingsdaten und das vollständige Rezept bleiben verschlossen. Die offizielle Definition der Open Source Initiative verlangt weit mehr Transparenz als das, weshalb kaum ein Frontier-Modell wirklich als vollständig offen gilt. Wir weisen den Unterschied durchgängig aus, denn eine „Modified MIT“- oder eine eigene Community-Lizenz kann kommerzielle Bedingungen enthalten, die eine echte MIT- oder Apache-2.0-Lizenz nicht hat.
Die praktische Erkenntnis ist einfach. Offene Gewichte bedeuten, dass du das Modell privat betreiben, feinabstimmen und dir Gebühren pro Token sparen kannst. Sie bedeuten nicht immer uneingeschränkte kommerzielle Nutzung, deshalb ist die Lizenzspalte in unserer Tabelle unten genauso wichtig wie die Benchmark-Werte.
Die besten Open-Source-KI-Modelle 2026 auf einen Blick
Hier ist das vollständige Ranking. Wir haben diese zehn nach unabhängiger Benchmark-Leistung, Aktualität, Lizenzfreiheit und danach ausgewählt, wie realistisch sie sich tatsächlich nutzen lassen. Die Index-Spalte ist der Artificial Analysis Intelligence Index v4.3.2, abgelesen am 25. September 2026. Mit „gesch.“ markierte Werte sind Schätzungen des Boards selbst statt vollständiger Durchläufe, und Werte aus früheren Versionen des Index sind mit diesen nicht vergleichbar, eine ältere „57“ für Kimi K3 ist also dasselbe Modell auf einem anderen Maßstab. Chinesische Labore belegen die ersten fünf Plätze. Inkling von Thinking Machines, die stärkste in den USA gebaute Familie, bekommt weiter unten einen eigenen Abschnitt.
| Modell | Am besten für | Parameter (gesamt / aktiv) | Kontext | Lizenz | AA Index v4.3.2 |
|---|---|---|---|---|---|
| MiMo-V2.6-Pro | Höchster gemessener Wert | 1,02T / 42B | 1M | MIT | 46,3 |
| Kimi K3 | Größtes offenes Modell, Spitze in der Arena | 2,78T / 104B | 1M | Kimi K3 (eigene Lizenz) | 43,6 |
| GLM 5.3 Flash | Am besten für die meisten | 321B / 18B | 1M | MIT | 41,8 |
| DeepSeek V4.1 Flash | Tempo und Preis-Leistung | 552B / 16B | 1M | MIT | 39,5 |
| Qwen 3.8 27B | Bestes Modell für den eigenen Mac | 27,8B dicht | 262K | Apache 2.0 | 33,7 |
| Kimi K2.7 Code | Agentisches Coden mit weniger Hardware | 1T / 32B | 256K | Modified MIT | 25,8 |
| Muse Glimmer | Metas offenes Modell für lokale Agenten | 30B dicht | 131K | Apache 2.0 | 17,5 |
| Gemma 4 31B | Leichtgewichtig + lokal | 31B dicht | 256K | Apache 2.0 | 19,0 (gesch.) |
| Nex-N2-Pro | Vollständig freizügig, agentisch | 397B / 17B | 262K | Apache 2.0 | 28,2 (gesch.) |
| MiniMax M3 | Effizienz auf schlanker Hardware | 427B / 23B | 1M | MiniMax Community | 29,2 |
Die besten Open-Source-KI-Modelle im Ranking
Hier ist jede Wahl im Detail, der Reihe nach, mit dem, worin sie wirklich am besten ist, den Benchmarks, die ihr den Platz eingebracht haben, und der Lizenz, die du tatsächlich bekommst. Wir beginnen mit den stärksten Allroundern und arbeiten uns zu den effizientesten und den am besten lokal nutzbaren vor.
1. MiMo-V2.6-Pro, das bestbewertete offene Modell
MiMo-V2.6-Pro von Xiaomi hat am 21. September 2026 die Spitze des offenen Feldes übernommen, an dem Tag, an dem seine Gewichte auf Hugging Face erschienen. Xiaomis Modellkarte beschreibt ein spärliches Mixture-of-Experts-Design mit 1,02 Billionen Parametern insgesamt und 42 Mrd. aktiven, einem Kontext von 1 Mio. Token und nativer Text-, Bild-, Video- und Audioeingabe in einem Modell. Die Lizenz ist eine schlichte MIT-Lizenz ohne Umsatzschwelle und ohne Namensnennungsklausel, was keines der beiden offenen Modelle, die ihm im Index am nächsten kommen, von sich sagen kann.
Die unabhängigen Zahlen bringen es auf Platz eins. Artificial Analysis bewertet es mit 46,3 im Intelligence Index v4.3.2, vor GLM-5.3 mit 44,8 und Kimi K3 mit 43,6 und gleichauf mit xAIs geschlossenem Grok 4.7 bei 46,4. Es ist zudem das günstigste Modell in der Nähe der Spitze dieses Boards, mit etwa 0,13 $ pro Index-Aufgabe gegenüber 2,00 $ für Kimi K3. Der Haken: Noch hat niemand darüber abgestimmt. MiMo-V2.6-Pro hat keinen Eintrag auf den Text- oder WebDev-Boards der Arena, das Bild der menschlichen Präferenz gehört also weiterhin K3. Unser Erklärstück zu Xiaomi MiMo behandelt die ganze Familie, ihre API-Preise und das kleinere V2.6 Flash.
2. Kimi K3, das größte offene Modell und der offene Favorit der Arena
Kimi K3 von Moonshot AI wurde am 27. Juli 2026 herunterladbar und ist weiterhin das größte offene Modell, das du bekommen kannst. Hugging Face listet 2,78 Billionen Parameter, ein Mixture-of-Experts-Design, das pro Token 104 Mrd. aktiviert, Text, Bilder und Video nativ verarbeitet und ein Kontextfenster von 1 Mio. Token mitbringt. Der nächste Konkurrent bei der Größe ist Alibabas Qwen-3.8-Flaggschiff mit 2,45 Billionen.
Die unabhängigen Boards sind sich bei ihm inzwischen uneins. Artificial Analysis bewertet K3 mit 43,6 im Intelligence Index v4.3.2, Platz drei unter den Open-Weight-Modellen hinter MiMo-V2.6-Pro und GLM-5.3. Die Abstimmenden der Arena setzen es im offenen Feld weiterhin auf Platz eins: Es ist Neunter insgesamt auf WebDev mit 1.659,6, nur geschlossene Modelle liegen darüber, und 17. auf dem Text-Board, auch dort der höchste offene Eintrag. Moonshots eigene Launch-Tabelle ergänzt 88,3 im Terminal-Bench 2.1 und 81,2 im FrontierSWE, und diese beiden sind vom Hersteller selbst gemessene Zahlen, keine unabhängigen.
Zwei Dinge solltest du wissen, bevor du damit planst. Die Gewichte stehen unter Moonshots eigener Kimi K3 License, die für fast alle freizügig ist. Sie greift nur, wenn du Modellzugang mit mehr als 20 Millionen $ Umsatz weiterverkaufst, was eine separate Vereinbarung erfordert, oder mehr als 100 Millionen monatliche Nutzer hast, was eine gut sichtbare Nennung von „Kimi K3“ verlangt. Der andere Haken ist die Hardware, denn 2,78 Billionen Parameter kommen in 96 Gewichts-Shards, das ist also ein Server-Modell und keines für den Laptop. Unsere Analyse zu Kimi K3 enthält die vollständige Benchmark-Tabelle.
3. GLM 5.3 Flash, das beste Open-Source-Modell für die meisten Menschen
GLM 5.3 Flash ist das offene Modell, das die meisten Teams tatsächlich betreiben sollten. Z.ai hat es am 26. August 2026 veröffentlicht, ein Mixture-of-Experts-Modell mit 321 Mrd. Parametern, das pro Token etwa 18 Mrd. aktiviert, einen Kontext von 1 Mio. Token liest, neben Text auch Bilder und Video verarbeitet und unter einer sauberen MIT-Lizenz steht. Es kommt auf 41,8 im Artificial-Analysis-Index bei etwa 0,25 $ pro Aufgabe und liegt damit weniger als fünf Punkte hinter der Spitze des offenen Feldes, mit deutlich weniger als der Hälfte der Parameter jedes Modells, das darüber liegt.
Es ersetzt GLM 5.2, das diesen Platz bis September innehatte. GLM 5.2 kommt jetzt auf 33,7, Artificial Analysis führt es als veraltet, und Z.ai verlangt dafür dieselben 1,40 $ / 4,40 $ pro Million Token wie für das vollständige GLM 5.3, das 44,8 erreicht. GLM 5.3 ist das stärkere Modell, und seine Gewichte liegen auf Hugging Face, stehen aber unter einer eigenen Lizenz statt unter MIT, weshalb die Empfehlung an das Flash-Modell geht. Den Rest von Zhipus GLM-Familie behandelt unser Erklärstück, und GLM 5.5 soll Gerüchten zufolge später im Jahr 2026 kommen.
4. DeepSeek V4.1 Flash, am besten für Tempo und Preis-Leistung
DeepSeek V4.1 Flash hat am 10. September 2026 V4-Flash ersetzt und ist jetzt das stärkste offene Modell von DeepSeek. Die Modellkarte beschreibt ein multimodales Mixture-of-Experts-Modell mit 552 Mrd. Backbone-Parametern, das beim Einlesen nur 8 Mrd. pro Token aktiviert und beim Schreiben 16 Mrd., mit nativer Bildeingabe, einem Kontext von 1 Mio. Token und einer MIT-Lizenz. Meituans quelloffenes LongCat-2.0 ist eine weitere Option mit 1 Mio. Token, speziell für agentisches Coden gebaut.
Es erreicht 39,5 im Artificial-Analysis-Index bei etwa 0,27 $ pro Aufgabe und ist mit rund 233 Token pro Sekunde das schnellste Modell in diesem Ranking. Das größere V4-Pro (1,6 Billionen gesamt, 49 Mrd. aktiv) ist mit 36,0 inzwischen das schwächere der beiden und hat keine Bildeingabe, seine Launch-Werte aus dem April, 80,6 im SWE-Bench Verified und 93,5 im LiveCodeBench, beschreiben also ein Modell, das DeepSeek selbst schon überholt hat. Lies die vollständige Analyse zu DeepSeek V4 für beide Modelle und die aktuellen API-Preise zu Spitzen- und Nebenzeiten.
5. Qwen 3.8 27B, das beste offene Modell für den eigenen Mac
Alibabas Qwen 3.8 27B ist das stärkste Modell auf dieser Liste, das auf einen einzigen gut ausgestatteten Rechner passt. Es ist ein dichtes Modell mit 27,8 Mrd. Parametern unter einer sauberen Apache-2.0-Lizenz, im August 2026 auf Hugging Face veröffentlicht, mit nativem Bild- und Videoverständnis und einem Kontext von 262K Token, der sich laut Alibaba auf 1 Million erweitern lässt. Es erreicht 33,7 im Artificial-Analysis-Index, exakt gleichauf mit GLM 5.2, einem Modell, das 27-mal so groß ist. Das größere Qwen 3.8-Flaggschiff mit 2,45 Billionen Parametern hat ebenfalls öffentliche Gewichte und kommt auf 39,9, steht aber unter Alibabas eigener Lizenz, genau wie das 180B-Modell Qwen3.8-Flash-Next (39,8), das zweithöchste offene Modell auf dem WebDev-Board der Arena.
Die früheren Qwen 3.6-Modelle lassen sich weiterhin herunterladen, und das 35B-A3B bleibt die leichtere Option für bescheidene Hardware, doch beim 27B ist die Entwicklung weitergegangen. Alibabas insgesamt stärkstes Modell, Qwen3.8 Max, erreicht 45,4 und ist nur per API und mit geschlossenen Gewichten verfügbar, es fällt also aus diesem Open-Source-Ranking heraus. Für ein offenes Modell, das auf deiner eigenen Hardware von allem etwas kann, ist Qwen 3.8 27B die sicherste Wahl. Wenn du es selbst betreibst, veröffentlicht das Prager Labor BottleCap AI ThinkingCap-Feintunings, die seine Reasoning-Token um 37 % bis 46 % senken, bei weniger als einem Punkt Genauigkeitsverlust.
6. Kimi K2.7 Code, am besten für agentisches Coden mit weniger Hardware
K3 ist das Flaggschiff, aber Kimi K2.7 Code ist das Kimi, das die meisten Teams realistisch einsetzen können, denn es hat weniger als zwei Fünftel der Größe von K3. Es ist ein Modell mit 1 Billion Parametern, das pro Token 32 Mrd. aktiviert, mit einem Kontextfenster von 256K Token unter einer Modified-MIT-Lizenz, veröffentlicht am 12. Juni 2026 und gezielt für Agenten gebaut, die über viele Schritte hinweg schreiben, ausführen und debuggen. Was Moonshots gehostete Modelle kosten, siehst du in unserem Leitfaden zu den Kimi-Preisen.
Eine ehrliche Einschränkung. Das meiste, was Moonshot veröffentlicht hat, darunter 62,0 auf der eigenen Kimi Code Bench v2 und 81,1 auf MCP Mark Verified, stammt aus hauseigenen Benchmarks. Die erste unabhängige Messung fällt weniger schmeichelhaft aus: Artificial Analysis bewertet es mit 25,8 auf seinem allgemeinen Index, deutlich unter den Modellen darüber, auch wenn dieser Index kein reiner Coding-Test ist. Betrachte es als Spezialisten, nicht als Allrounder. Unser Test von Kimi K2.7 Code enthält die Details und die Hinweise auf fehlende Daten.
7. Muse Glimmer, Metas offenes Modell für lokale Agenten
Metas Open-Weight-Veröffentlichung in diesem Jahr ist Muse Glimmer, erschienen am 10. August 2026 unter einer vollständig freizügigen Apache-2.0-Lizenz. Es ist ein dichtes 30B-Modell (etwa 29,8 Mrd. Parameter einschließlich seines Vision-Encoders), destilliert aus Metas geschlossenem Muse Spark, mit einem Kontextfenster von 131K und Bildeingabe, und Meta hat es für Agenten gebaut, die Werkzeuge nutzen und sich von eigenen Fehlern erholen, nicht für Chats. Ein Llama 5 gibt es nicht. Metas letzte Llama-Generation war Llama 4 im April 2025, und seine Modelle von 2026 erscheinen unter dem Namen Muse, wobei das Flaggschiff Muse Spark geschlossen bleibt. Meta hat auch für Muse Spark offene Gewichte versprochen, ein Versprechen, das es wiederholte, als Muse Spark 1.3 am 2. September 2026 erschien, weiterhin ohne Termin.
Bemerkenswert an Glimmer ist, dass Meta es selbst auf Macs gebenchmarkt hat. Seine 4-Bit-Version verkleinert das Sprachmodell auf unter 20 GB, die kleinste offizielle Quantisierung zielt auf Rechner mit 24 GB, und nach Metas eigenen Zahlen läuft es mit 37,8 Token pro Sekunde auf einem M4 Max und 50,2 auf einem M5 Max, sobald das spekulative DFlash-Decoding eingeschaltet ist. Ollama bietet eine Apple-Silicon-Version, die du mit ollama run muse-glimmer:30b-mlx laden kannst. Das unabhängige Bild ist bescheiden, 17,5 im Artificial-Analysis-Index, und Metas eigene Tabelle ist gemischt: Es schlägt Gemma 4 31B deutlich bei MCP Atlas (75,5 gegenüber 54,2) und SWE-Bench Pro (51,2 gegenüber 36,9), verliert aber gegen Qwen 3.6 27B bei OSWorld-Verified und Terminal-Bench 2.1. Es ist ein starkes lokales Agentenmodell, kein genereller Fortschritt gegenüber allem in seiner Größenklasse.
8. Gemma 4, das beste leichtgewichtige Modell für die lokale Nutzung
Wenn du KI mit dem geringsten Aufwand auf deinem eigenen Rechner betreiben willst, ist Gemma 4 von Google DeepMind die Antwort. Die Familie reicht von winzigen Edge-Modellen (E2B, E4B) und einem 12B-Modell bis zu einem dichten 31B-Flaggschiff und einer 26B-MoE-Variante, alle unter Apache 2.0, veröffentlicht am 2. April 2026.
Trotz des kleinen Fußabdrucks schlägt es auf den Boards, auf denen Menschen abstimmen, kräftig zu. Gemma 4 31B liegt mit 1.451 auf dem Text-Board der Arena vor MiniMax M3, Inkling und Qwen 3.8 27B, obwohl Artificial Analysis es auf seinem strengeren Index nur auf 19,0 schätzt. Googles eigene Zahlen sind 85,2 % im MMLU-Pro, 89,2 % bei AIME 2026 und 80,0 % im LiveCodeBench v6, während die 12B-Stufe bequem auf einem modernen Laptop läuft. Es ist der beste Einstieg, wenn du neu bei lokaler KI bist, und Googles offizielle Gemma-4-Modellkarte listet die genauen Spezifikationen je Größe.
9. Nex-N2-Pro, das beste vollständig freizügige Agentenmodell
Nex-N2-Pro von Nex AGI verdient seinen Platz durch Lizenzfreiheit plus echte Leistungsfähigkeit. Es ist ein MoE-Modell mit 397 Mrd. Parametern (17 Mrd. aktiv), aufgebaut auf dem größten offenen Modell von Qwen 3.5, mit einem Kontext von 262K, veröffentlicht unter der vollständig freizügigen Apache-2.0-Lizenz und gezielt für agentische Arbeit wie Tool-Aufrufe und lange mehrstufige Aufgaben abgestimmt.
Nex AGI meldet 80,8 im SWE-Bench Verified und 75,3 im Terminal-Bench 2.1, und Artificial Analysis schätzt es auf 28,2 im Index, im selben Bereich wie MiniMax M3, und das ohne jede kommerzielle Einschränkung. In unserer Analyse zu Nex-N2-Pro siehst du, wie es sich gegen die besten geschlossenen Modelle schlägt.
10. MiniMax M3, am besten für Effizienz
MiniMax M3 rundet die Liste für alle ab, die auf die Hardwarekosten achten. Veröffentlicht am 1. Juni 2026, arbeitet es mit 427 Mrd. Parametern insgesamt, von denen nur 23 Mrd. aktiv sind, und sein MiniMax-Sparse-Attention-Design dekodiert bei vollem Kontext etwa 15-mal schneller als M2. MiniMax meldet 59,0 % im SWE-Bench Pro, Artificial Analysis bewertet es mit 29,2 bei etwa 0,51 $ pro Aufgabe, und es liefert rund 153 Token pro Sekunde, mit einem vollen Kontext von 1 Mio. Token und nativer Multimodalität.
Mit dieser Version hat sich die Lizenz geändert. M3 steht unter der MiniMax Community License, frei zum Selbsthosten, verlangt aber von größeren kommerziellen Nutzern eine separate Vereinbarung, ein Rückschritt gegenüber den Modified-MIT-Bedingungen früherer Versionen. Es bleibt eine kluge Wahl, wenn du schnelles Coden nahe der Spitze mit einem schlankeren Hardwarebudget willst. Unser Test der MiniMax-Modelle behandelt die Entwicklungslinie und die Vorbehalte bei den Benchmarks.
Inkling, das stärkste US-Open-Weights-Modell
Inkling ist das erste Modell von Thinking Machines, dem Labor der ehemaligen OpenAI-CTO Mira Murati, und erschien am 15. Juli 2026. Es ist ein Mixture-of-Experts-Transformer mit 975 Mrd. Parametern insgesamt und 41 Mrd. aktiven pro Token, einem Kontextfenster von bis zu 1 Mio. Token und nativem Reasoning über Text, Bilder und Audio. Die Gewichte stehen unter einer schlichten Apache-2.0-Lizenz, womit es auf dieser Seite in der freizügigsten Stufe liegt, zusammen mit Qwen 3.8 27B, Gemma 4, Muse Glimmer und Nex-N2-Pro.
Die Schlagzeile ist eher national als global. Im Artificial Analysis Intelligence Index v4.3.2 erreicht Inkling 25,0, vor NVIDIAs Nemotron 3 Ultra mit 22,9, Muse Glimmer mit 17,5 und gpt-oss-120b mit 11,6, womit die Familie an der Spitze des offenen Feldes in den USA bleibt. Zugleich liegt es mehr als 20 Punkte hinter MiMo-V2.6-Pro, die Geschichte ist also, dass das beste amerikanische offene Modell das amerikanische Feld anführt, nicht die Welt. Auf seiner eigenen Bewertung kommt Inkling auf 77,6 % im SWE-bench Verified und 73,5 % im MMMU Pro.
Wo es Aufmerksamkeit verdient, sind Tempo und Kosten. Artificial Analysis misst Inkling mit etwa 167 Token pro Sekunde und 0,61 $ pro Index-Aufgabe, günstiger pro Aufgabe als Kimi K3 oder GLM-5.3 und ungefähr drei- bis fünfmal so schnell wie beide, auch wenn MiMo-V2.6-Pro und GLM 5.3 Flash inzwischen für weniger Geld deutlich höher abschneiden.
Die interessantere Veröffentlichung ist die kleine. Inkling-Small erschien mit vollständigen Gewichten am 30. Juli 2026 mit 276 Mrd. Parametern insgesamt und 12 Mrd. aktiven, weniger als ein Drittel seines Vorgängers, und Artificial Analysis schätzt es auf 27,8, über dem Flaggschiff. Außerdem liegt es bei Humanity’s Last Exam (33 % gegenüber 32 %) und GPQA Diamond (89 % gegenüber 87 %) knapp vor dem größeren Modell und liefert etwa 205 Token pro Sekunde. Wenn du ein in den USA gebautes Modell auf Hardware willst, die du realistisch mieten kannst, ist Inkling-Small die praktischere Hälfte dieses Paares.
Wir haben Inkling aus dem nummerierten Ranking oben herausgelassen, weil es allein nach Leistungsfähigkeit ziemlich weit unten landen würde, während es bei der Lizenzfreiheit mit den besten auf dieser Seite gleichzieht. Betrachte es als Standardwahl, wenn du gezielt ein in den USA gebautes Modell unter einer vollständig freizügigen Lizenz willst. Tencents 770B Hy4 Preview erschien am 28. August 2026 unter Apache 2.0 und wird hier aufgeführt statt eingeordnet, da noch kein unabhängiges Board es bewertet hat.
Wie wir diese Open-Source-KI-Modelle ausgewählt haben
Wir haben nach vier Kriterien geordnet, in dieser Reihenfolge. Unabhängige Benchmark-Leistung, angeführt vom Artificial Analysis Intelligence Index und den Abstimmungs-Boards der Arena, mit von den Laboren gemeldeten Tests (SWE-Bench Verified, GPQA Diamond, MMLU-Pro, LiveCodeBench) als ergänzendem Beleg. Aktualität, jedes Modell hier wurde 2026 veröffentlicht oder aktualisiert. Lizenzfreiheit, mit einer klaren Bevorzugung von MIT und Apache 2.0 gegenüber eigenen Community-Lizenzen. Und Zugänglichkeit, denn ein Modell, das du nicht realistisch betreiben kannst, nützt dir nichts. Unser Leitfaden zu KI-Benchmarks erklärt, was jeder dieser Tests tatsächlich misst.
Wir haben außerdem unabhängige Überprüfung gewichtet. Wo Werte nur von dem Labor stammen, das das Modell gebaut hat, wie bei Teilen von Moonshots K3-Tabelle und dem Großteil der Zahlen von Nex AGI, sagen wir das, und wo Artificial Analysis einen Wert nur schätzt, kennzeichnen wir ihn. Selbst gemeldete Benchmarks sind in der offenen KI derzeit ein echtes Problem, und du solltest sie mit Vorsicht behandeln, bis Dritte die Zahlen bestätigen.
Du brauchst keine GPU-Farm, um diese zu nutzen
Der größte Mythos über Open-Source-KI ist, dass man dafür Hardware auf Serverniveau braucht. Das hängt ganz vom Modell ab. Die Billionen-Parameter-Riesen wie Kimi K3 und MiMo-V2.6-Pro brauchen für Inferenz in voller Präzision tatsächlich Multi-GPU-Setups, aber viele starke offene Modelle laufen auf Consumer-Hardware.
Gemma 4 12B, die kleineren Qwen-Stufen und Metas Muse Glimmer laufen mit Tools wie Ollama oder LM Studio auf einem modernen Laptop oder Mac, und die Gewichte bekommst du direkt von Hugging Face. Und wenn du die größten Modelle ganz ohne eigene Hardware nutzen willst, leitet eine App wie Fello AI führende Modelle direkt an dein Mac oder iPhone, ganz ohne lokale Installation. Ein selbst betriebenes Modell umgeht außerdem Ausfälle von Anbietern vollständig, ein echtes Thema angesichts von Claudes wiederholten Ausfällen im Jahr 2026. Drei weitere Systeme sind einen Blick wert, auch wenn sie hier nicht eingeordnet sind. ByteDances Seed 2.1 Pro ist eine unveröffentlichte Vorschau, die im Juni Platz 8 in Code Arena: Frontend erreichte. Sakana AIs Fugu orchestriert einen Pool anderer Modelle, statt als einzelner Satz von Gewichten anzutreten, und sein Update Fugu-Ultra v1.1 hat diesen Vorsprung bei Coding- und Terminal-Benchmarks ausgebaut. Quantisierte Versionen verringern den Speicherbedarf zudem drastisch, oft bei minimalem Qualitätsverlust.
Wenn Coding dein Hauptanwendungsfall ist, vergleicht unser Überblick der besten kostenlosen KI fürs Coding diese offenen Modelle direkt bei Entwickleraufgaben.
Fazit
MiMo-V2.6-Pro ist jetzt das bestbewertete Open-Source-KI-Modell, das du herunterladen kannst, und es steht unter einer schlichten MIT-Lizenz. Kimi K3 ist das größte und das offene Modell, das menschliche Abstimmende am höchsten einstufen. Für die meisten Menschen ist GLM 5.3 Flash die bessere Wahl, mit der stärksten Mischung aus Reasoning, Lizenzfreiheit und einem Kontext von 1 Mio. Token auf Hardware, die du tatsächlich mieten kannst. Wenn du Tempo und Preis-Leistung willst, nimm DeepSeek V4.1 Flash. Wenn du KI auf deinem eigenen Mac betreiben willst, beginne mit Qwen 3.8 27B oder, auf leichterer Hardware, mit Gemma 4. Wenn du ein in den USA gebautes Modell unter einer sauberen Apache-2.0-Lizenz willst, ist Inkling-Small derzeit das beste Preis-Leistungs-Verhältnis in dieser Ecke. Und wenn du dir die Einrichtung lieber ganz sparst, sind dieselben offenen Spitzenmodelle über die besten KI-Modelle in Apps wie Fello AI verfügbar.
Der Abstand zwischen dem besten offenen und dem besten geschlossenen Modell beträgt 11,3 Punkte im Artificial Analysis Intelligence Index v4.3.2, 46,3 für MiMo-V2.6-Pro gegenüber 57,6 für Claude Opus 5.5. Ganz oben ist das eine echte Lücke, doch die offenen Spitzenreiter liegen inzwischen gleichauf mit geschlossenen Modellen wie Grok 4.7, zu einem Bruchteil des Preises, „kostenlos“ ist also oft die klügere Wahl. Wähle nach deinem Anwendungsfall, prüfe die Lizenz, und du wirst das Abo nicht vermissen. Prüfe auch die Veröffentlichungsbedingungen, denn GLM 5.3 und seine gestaffelten Gewichte zeigen, dass eine offene Modellreihe ihr bestes Modell unter strengeren Bedingungen veröffentlichen kann als das vorherige.
FAQ
Was ist gerade das beste Open-Source-KI-Modell?
MiMo-V2.6-Pro ist mit Stand 25. September 2026 das bestbewertete offene Modell, mit 46,3 im Artificial Analysis Intelligence Index v4.3.2 und MIT-lizenzierten Gewichten, die am 21. September veröffentlicht wurden. Kimi K3 ist das größte offene Modell und der höchste offene Eintrag auf den Abstimmungs-Boards der Arena. GLM 5.3 Flash ist für die meisten Menschen die bessere Wahl, mit MIT-Lizenz und einem Bruchteil der Hardwarekosten. Unter den in den USA gebauten offenen Modellen führt die Inkling-Familie von Thinking Machines.
Was ist der Unterschied zwischen Open-Source- und Open-Weight-KI?
Open-Weight bedeutet, dass die trainierten Gewichte kostenlos herunterladbar und nutzbar sind, aber die Trainingsdaten und das vollständige Rezept privat bleiben. Echte Open-Source-KI veröffentlicht nach der Definition der Open Source Initiative auch die Daten und den Code. Die meisten „Open-Source“-Modelle sind technisch gesehen Open-Weight.
Kann ich Open-Source-KI-Modelle ohne GPU betreiben?
Ja. Kleine Modelle wie Gemma 4 12B laufen auf einem modernen Laptop, Qwen 3.8 27B und Muse Glimmer laufen auf einem gut ausgestatteten Mac, und Apps wie Fello AI lassen dich die größten offenen Modelle ohne lokale Hardware von einem Mac oder iPhone aus nutzen. Nur die größten Modelle mit Billionen Parametern brauchen Multi-GPU-Setups.
Sind Open-Source-KI-Modelle kostenlos für die kommerzielle Nutzung?
Meistens, aber prüfe die Lizenz. MIT- und Apache-2.0-Modelle (MiMo-V2.6-Pro, GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen 3.8 27B, Gemma 4, Muse Glimmer, Nex-N2-Pro, Inkling und Inkling-Small) sind vollständig freizügig. Eigene Lizenzen wie die Kimi K3 License, die Lizenz von GLM 5.3, Alibabas Lizenz für das Qwen-3.8-Flaggschiff oder die MiniMax Community License fügen Bedingungen hinzu, etwa Umsatzschwellen, Nutzungsgrenzen oder Pflichten zur Namensnennung.
Sind Open-Source-Modelle so gut wie ChatGPT oder Claude?
Nah dran, aber an der Spitze nicht gleichauf. MiMo-V2.6-Pro erreicht 46,3 im Artificial Analysis Intelligence Index v4.3.2 gegenüber 57,6 für Claude Opus 5.5, das beste geschlossene Modell auf diesem Board, und GPT-6 Sol liegt mit 47,5 knapp über dem offenen Spitzenreiter. Bei vielen alltäglichen Aufgaben in Coding, Mathematik und langem Kontext ist der Unterschied klein, doch die absolute Spitze gehört weiterhin den geschlossenen Laboren.