Moonshot AI veröffentlichte die vollständigen Kimi K3-Gewichte am 27. Juli 2026, elf Tage nachdem das Modell in der Kimi-App live ging. Das Hugging-Face-Repository enthält 96 Safetensors-Shards mit insgesamt rund 1,56 TB. Mit 2,8 Billionen Gesamt-Parametern und 104 Milliarden aktiven Parametern pro Token ist K3 das größte je veröffentlichte open-source-Modell. Moonshot nennt es das weltweit erste offene 3T-Klasse-Modell, und hinter dieser Behauptung steckt nun ein Download-Button.
Die unabhängigen Werte sind ebenfalls angekommen und sie sind stark, ohne ein klarer Sweep zu sein. Kimi K3 erzielt 57 Punkte im Artificial-Analysis-Intelligence-Index, besser als jedes andere open-weight-Modell und nur hinter drei geschlossenen. Unten findest du die verifizierten Spezifikationen, was die Lizenz tatsächlich erlaubt, die offiziellen API-Preise, die Moonshot nun veröffentlicht hat, und eine ehrliche Einschätzung, wie K3 im Vergleich zu Claude Opus 5 dasteht.
Das Wichtigste auf einen Blick
- Die offenen Gewichte erschienen am 27. Juli 2026, 96 Shards und rund 1,56 TB auf Hugging Face, unter einer eigenen Kimi-K3-Lizenz statt MIT.
- Ein Mixture-of-Experts-Design mit 2,8 Billionen Gesamt-Parametern, 104 Milliarden aktivierten pro Token und einem 1.048.576-Token-Kontextfenster.
- Akzeptiert Text-, Bild- und Video-Eingabe, schlussfolgert immer und bietet jetzt niedrige, hohe und maximale Reasoning-Intensität statt nur Maximum.
- Der offizielle API-Preis beträgt $3.00 pro Million Eingabe-Token und $15.00 Ausgabe, bei gecachter Eingabe fallend auf $0.30, derselbe Preis wie Claude Sonnet 5.
- Erzielt 57 Punkte im Artificial-Analysis-Intelligence-Index, das beste Ergebnis unter open-weight-Modellen, mit GLM-5.2 als Nächstem bei 51.
Was ist Kimi K3?
Kimi K3 ist Moonshot AIs Flaggschiff-Sprachmodell, gestartet am 16. Juli 2026 und als offene Gewichte am 27. Juli veröffentlicht. Es verwendet ein Mixture-of-Experts-Design mit 2,8 Billionen Gesamt-Parametern, von denen 104 Milliarden pro Token aktiviert werden, und liest ein 1-Million-Token-Kontextfenster. Moonshoots eigene Dokumentation bestätigt, dass es Text-, Bild- und Video-Eingabe akzeptiert.
Die Lücke zwischen Launch und Gewichten war geplant, und Moonshot hat das damals so gesagt. Der Launch-Post versprach die Dateien „bis zum 27. Juli 2026", während das Team „eng mit Inferenzpartnern und open-source-Betreuern zusammenarbeitet, um technische Details abzustimmen und ein zuverlässiges Rollout im gesamten Ökosystem sicherzustellen". Der technische Bericht erschien zusammen mit den Gewichten statt ihnen hinterher.
| Spezifikation | Kimi K3 |
|---|---|
| Entwickler | Moonshot AI |
| Veröffentlicht | 16. Juli 2026 (Gewichte 27. Juli 2026) |
| Architektur | Mixture-of-Experts (MoE) |
| Gesamt-Parameter | 2,8 Billionen |
| Aktivierte Parameter | 104 Milliarden pro Token |
| Schichten | 93 (69 Kimi Delta Attention, 24 Gated MLA) |
| Experten | 896 gesamt, 16 ausgewählt pro Token |
| Vision-Encoder | MoonViT-V2, 401M Parameter |
| Kontextfenster | 1.048.576 Token |
| Eingabetypen | Text, Bild, Video |
| Quantisierung | MXFP4-Gewichte, MXFP8-Aktivierungen |
| Reasoning-Kontrolle | reasoning_effort niedrig / hoch / max, Standard: max |
| Lizenz | Kimi K3 License (eigene Lizenz, kein MIT) |
Mit 2,8 Billionen Parametern ist Kimi K3 das größte je veröffentlichte open-source-Modell, deutlich über DeepSeeks V4-Pro mit 1,6 Billionen. Das Mixture-of-Experts-Design bedeutet, dass bei jedem Token nur ein kleiner Bruchteil dieser Parameter aktiv ist, sodass die effektiven Rechenkosten weit unter dem liegen, was die rohe Zahl suggeriert. 16 von 896 Experten zu aktivieren ist ein ungewöhnlich hohes Sparsity-Verhältnis. Diese Wahl ist zentral dafür, wie Moonshot Frontier-Leistung aus der Architektur herausgepresst hat.

Kimi K3 offene Gewichte: Was tatsächlich erschienen ist
Das ist der Teil, der sich am 27. Juli änderte, und der Grund, warum K3 mehr bedeutet als sein Benchmark-Ergebnis. Jedes andere Modell auf diesem Fähigkeitsniveau ist eine API, die du mietest. K3 ist eine Datei, die du besitzen kannst.
Was im Repository steckt
Das Hugging-Face-Repo enthält 120 Dateien, davon 96 Safetensors-Shards, und der gesamte Download beläuft sich auf rund 1,56 TB. Moonshot liefert das Modell in nativen MXFP4-Gewichten mit MXFP8-Aktivierungen, die durch quantisierungsbewusstes Training ab der Supervised-Fine-Tuning-Phase angewendet wurden. Deshalb passt ein 2,8-Billionen-Parameter-Modell in 1,56 TB statt ein Vielfaches davon, und das bedeutet, du lädst keine verlustbehaftete Community-Quantisierung herunter, sondern das, was Moonshot trainiert hat.
Der Ansturm war sofort. Einen Tag nachdem die Dateien hochgeladen wurden, zeigte das Repository rund 99.000 Downloads und mehr als 7.300 Likes, gezählt am 28. Juli 2026. Für einen Checkpoint, den fast niemand auf seiner eigenen Hardware hosten kann, ist das viel Traffic, und ein Großteil davon werden Inferenzanbieter, Quantisierungsprojekte und Forschungslabors sein, keine Einzelpersonen.
Moonshot nennt drei Inferenz-Engines als empfohlene Laufzeiten: vLLM, SGLang und TokenSpeed, jede mit eigenem veröffentlichten Rezept für K3. Der technische Bericht erschien zusammen mit den Gewichten, sodass die Architekturdetails ebenfalls öffentlich sind.
Die Kimi-K3-Lizenz ist kein MIT
Lies das, bevor du ein Produkt darauf aufbaust.
Die Lizenz gewährt die üblichen Rechte zur Nutzung, Kopierung, Modifikation, Verteilung, Unterlizenzierung, Feinabstimmung und zum Verkauf, was für die meisten Leser wie MIT klingt. Zwei Klauseln fügen dann Bedingungen hinzu, die MIT nicht hat.
Die erste ist eine Umsatzschwelle beim Weiterverkauf. Wenn du ein Model-as-a-Service-Unternehmen betreibst und dein Umsatz in einem beliebigen Zeitraum von 12 aufeinanderfolgenden Monaten $20 Millionen überschreitet, musst du vor der kommerziellen Nutzung von K3 eine separate Vereinbarung mit Moonshot unterzeichnen. Die zweite ist eine Namensnennung. Jedes auf K3 aufgebaute Produkt mit mehr als 100 Millionen monatlich aktiven Nutzern oder mehr als $20 Millionen monatlichem Umsatz muss den Namen „Kimi K3" gut sichtbar in seiner Benutzeroberfläche anzeigen.
Beide Bedingungen entfallen bei rein internem Gebrauch, also allem, was das Modell oder seine Ausgaben nie Dritten zugänglich macht. Für einen einzelnen Entwickler, ein Startup oder eine Forschungsgruppe ist der praktische Effekt gleich null. Für einen Hyperscaler, der Inferenz weiterverkauft, ist es eine Verhandlung. Das ist auch der Grund, warum GLM und seine MIT-Lizenz bei der Lizenzfreiheit noch gewinnen, auch wenn K3 bei den Fähigkeiten gewinnt.
Was es braucht, um Kimi K3 selbst zu betreiben
Herunterladbar ist nicht dasselbe wie ausführbar. Ein 1,56-TB-Checkpoint braucht einen Multi-Node-GPU-Cluster, um bei vollem Kontext zu laufen, also ist „du kannst es selbst hosten" für Labs und ernsthafte Infrastruktur-Teams wahr, nicht für jemanden mit einer einzelnen Workstation. Wenn du ein open-source-Modell willst, das du wirklich auf deiner eigenen Hardware ausführen kannst, bleiben die kleineren Kimi-Modelle und GLM die realistischen Optionen. Unser Überblick der besten open-source-KI-Modelle ordnet sie nach Hardware-Anforderungen.
Die Architektur hinter dem Sprung
Moonshot berichtet eine rund 2,5-fache Verbesserung der allgemeinen Skalierungseffizienz gegenüber Kimi K2. Vereinfacht gesagt wandelt K3 rohe Rechenleistung deutlich effektiver in nutzbare Intelligenz um als die vorherige Generation. Drei Änderungen tragen den Großteil des Gewichts, und alle drei sind nun im öffentlichen technischen Bericht dokumentiert.
Kimi Delta Attention
Kimi Delta Attention (KDA) ist ein hybrides lineares Attention-Verfahren, und 69 der 93 Schichten des Modells verwenden es, während die verbleibenden 24 Gated MLA nutzen. Standard-Attention wird langsamer und speicherhungriger, je länger Sequenzen werden, genau das Problem bei einer Million Token. Moonshot berichtet, KDA ermöglicht bis zu 6,3-fach schnelleres Decoding in Millionen-Token-Kontexten, was bei agentischer Arbeit wichtig ist, bei der ein Modell wiederholt riesige Code- oder Dokument-Abschnitte liest und darüber nachdenkt.
Attention Residuals
Attention Residuals (AttnRes) adressieren, wie Informationen durch die Tiefe des Netzwerks statt über die Sequenzlänge fließen. Statt Repräsentationen gleichmäßig schicht für schicht anzuhäufen, ruft AttnRes selektiv Repräsentationen über die Tiefe ab. Moonshot sagt, das liefert rund 25 % höhere Trainingseffizienz bei weniger als 2 % zusätzlicher Rechenleistung, und hat die Technik Anfang 2026 als open source veröffentlicht, bevor es sie in K3 integrierte.
Stable LatentMoE und MXFP4-Training
Das dritte Element ist das Stable-LatentMoE-Framework, das die aggressive 16-von-896-Experten-Sparsity trainierbar macht, ohne die Instabilität, die normalerweise entsteht, wenn man MoE so weit treibt. Daneben steht die Entscheidung, ab der Feinabstimmungsphase in MXFP4 zu trainieren statt hinterher zu quantisieren, was dafür sorgt, dass die veröffentlichten Gewichte sowohl klein als auch treu zu dem Modell sind, das Moonshot ausgewertet hat.
Eine Demonstration, die Moonshot hervorhob, ist aufschlussreich. Das Team ließ K3 seinen eigenen AttnRes-Trainingskernel in Produktionsgröße optimieren: 96 Schichten, ein 8.192-dimensionales Modell und 8.192 Token. In 15 Stunden ununterbrochener Iteration entwarf K3 einen neuartigen Zwei-Phasen-Kernel-Algorithmus, fused Kernels unter Erhalt der Numerik und reduzierte die Forward-plus-Backward-Zeit von 283,6 ms auf 114,4 ms. Das ist die Art von langhorizontiger Engineering-Aufgabe, an der die meisten Modelle innerhalb von Minuten stagnieren.
Ein 1-Million-Token-Kontextfenster
Kimi K3 verarbeitet bis zu 1.048.576 Token in einem einzigen Kontext, rund viermal so viel wie das 256K-Fenster von K2.6. Das reicht, um eine gesamte Codebasis, einen Stapel langer Dokumente oder einen langen Multi-Step-Agenten-Lauf zu halten, ohne den Faden zu verlieren. Es entspricht auch dem Fenster, das Anthropic Claude Opus 5 und Sonnet 5 bietet, sodass der Langkontext-Vorteil, den Kimi gegenüber den geschlossenen Flaggschiffen hatte, auf ein Unentschieden geschrumpft ist.
Multimodale Eingabe und immer aktives Reasoning
K3 akzeptiert Text, Bilder und Video, was es über die textorientierte K2-Linie in echtes multimodales Terrain bringt. Moonshoots Modellliste stellt klar, dass K3, K2.7 Code und K2.6 alle Video-Eingabe akzeptieren, und die Modellkarte berichtet 90,0 bei Video-MME mit Untertiteln. Reasoning ist immer aktiv, und der reasoning_effort-Parameter unterstützt nun niedrig, hoch und max, mit max als Standard. Beim Launch war nur max verfügbar, die versprochenen Intensitätsstufen sind seitdem angekommen.
Wie Kimi K3 bei Benchmarks abschneidet
Hier leben zwei separate Fragen. Was sagen die unabhängigen Boards über Kimi K3, und was behauptet Moonshoots eigene Bewertungssuite? Das unabhängige Bild kam erst nach dem Launch, daher ist es der bessere Ausgangspunkt, und die Herstellerzahlen machen mehr Sinn, sobald man es gesehen hat.
Was die unabhängigen Boards sagen
Artificial Analysis bewertet Kimi K3 mit 57 Punkten in seinem Intelligence Index. Unter allen 264 Zeilen auf diesem Board erzielen genau sechs Varianten höhere Werte, und sie gehören zu nur drei Modellen: Claude Opus 5 mit 61, Claude Fable 5 mit 60 und GPT-5.6 Sol mit 59. Gegen die open-source-Konkurrenz ist es keine knappe Sache, mit GLM-5.2 als Nächstem bei 51 und DeepSeek V4 Pro bei 44.
Dasselbe Board bewertet K3 mit 50,1 im Agentic Index und 76,2 beim Coding, in beiden Fällen das beste open-weight-Ergebnis und in beiden Fällen hinter Opus 5 und GPT-5.6 Sol. Eine Zahl läuft in die andere Richtung: die Ausgabegeschwindigkeit. Artificial Analysis misst K3 bei rund 33 Token pro Sekunde, gegenüber 55 für Opus 5 und 81 für GPT-5.6 Sol, sodass K3 das langsamste Modell in der Frontier-Gruppe ist.
Im WebDev-Leaderboard von Arena, wo Menschen blind über generierte Front-Ends abstimmen, erzielte K3 1.681,6 Punkte nach dem Stimmenauszählungs-Cutoff vom 27. Juli. Das ist Platz zwei insgesamt, hinter Claude Opus 5 bei 1.725,3 und vor Claude Fable 5 bei 1.629,1, GPT-5.6 Sol bei 1.623,1 und GLM-5.2 bei 1.586,8. K3 hatte beim Launch die Spitzenposition inne, bevor Opus 5 am 24. Juli ankam und sie übernahm.
Das Agent-Leaderboard von Arena, das bewertet, wie gut Modelle Werkzeuge bei echten Aufgaben orchestrieren, setzt Kimi K3 derzeit auf Platz eins mit 0,148, vor Claude Fable 5 bei 0,099 und GLM 5.2 bei 0,091. Das mit einem Vorbehalt lesen, denn Claude Opus 5 erscheint auf diesem Board noch nicht. Im allgemeinen Text-Board liegt K3 auf Platz 11 mit 1.485,8 Punkten aus 3.559 Stimmen, eine Erinnerung daran, dass Chat-Präferenz und agentische Fähigkeit nicht dasselbe sind.
Moonshoots eigene Coding-Benchmarks
Moonshot veröffentlichte eine breite Suite, die Kimi K3 gegen Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 und GLM-5.2 vergleicht, alle bei maximaler Denkintensität ausgeführt. Das sind die eigenen Läufe des Herstellers, mit K3 auf dem Kimi-Code-Harness in mehreren Zeilen evaluiert, also als Moonshoots Behauptungen behandeln, nicht als unabhängige Ergebnisse.
| Benchmark | Kimi K3 | Fable 5 | GPT-5.6 Sol | Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 | 67,0 | 46,2 |
| ProgramBench | 77,8 | 76,8 | 77,6 | 71,9 | 70,8 | 63,7 |
| Terminal-Bench 2.1 | 88,3 | 88,0 | 88,8 | 84,6 | 83,4 | 82,7 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 | 64,9 | 67,3 |
| SWE-Marathon | 42,0 | 35,0 | 39,0 | 40,0 | 14,0 | 13,0 |
| Kimi Code Bench 2.0 | 72,9 | 76,9 | 64,8 | 71,7 | 69,0 | 64,2 |
Direktes Lesen ergibt: Kimi K3 gewinnt ProgramBench und SWE-Marathon klar und liegt beim Terminal-Bench 2.1 innerhalb eines halben Punktes vom Führenden. Bei FrontierSWE landet es auf Platz zwei hinter Fable 5, aber weit vor allem anderen. Moonshoots eigene Fußnoten fügen einen erwähnenswerten Vorbehalt hinzu: Claude Fable 5 traf bei 35 % der SWE-Marathon-Aufgaben in dieser Auswertung Sicherheits-Fallbacks, was sein Ergebnis nach unten gezogen haben könnte.
Agentische und Wissensarbeit-Benchmarks
| Benchmark | Kimi K3 | Fable 5 | GPT-5.6 Sol | Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 | n/a |
| MCPMark-Verified | 94,5 | 87,4 | 92,9 | 76,4 | n/a |
| GDPval-AA v2 (Elo) | 1.686 | 1.747 | 1.736 | 1.593 | 1.510 |
| AA-Briefcase (Elo) | 1.548 | 1.583 | 1.495 | 1.354 | 1.260 |
| JobBench | 54,3 | 57,4 | 45,4 | 48,4 | 43,4 |
| SpreadsheetBench 2 | 34,8 | 34,7 | 32,4 | 31,6 | 28,1 |
| AutomationBench | 30,8 | 29,1 | 29,7 | 27,2 | 12,9 |
| OSWorld 2.0 | 58,3 | 66,1 | 62,6 | 55,7 | n/a |
Kimi K3 führt bei BrowseComp, MCPMark, SpreadsheetBench 2 und AutomationBench und belegt beim AA-Briefcase, dem Langzeithorizont-Agentik-Benchmark, Platz zwei, hinter Fable 5 und vor GPT-5.6 Sol. Ein Vorbehalt bei BrowseComp: die 91,2 nutzen eine Kontextkomprimierungsstrategie, die bei 300K Token ausgelöst wird. Mit dem vollen 1M-Fenster und ohne Kontext-Management erzielt K3 90,4, was immer noch die beste Zahl in dieser Spalte ist.
Bei Computer Use schlagen Fable 5 und GPT-5.6 Sol K3 beide bei OSWorld 2.0, das open-source-Modell liegt also nicht überall vorne. Es erzielte 93,5 % beim GPQA Diamond, auf Augenhöhe mit GPT-5.5 und vor GLM-5.2 mit 91,2, sowie 94,6 beim Harvey Lab-AA, dem besten Wert in dieser Zeile aus jedem Modell in der Tabelle.
Moonshoots eigene Zusammenfassung ist zurückhaltender als die Berichterstattung es war. Ihr Launch-Blog sagt, K3s Gesamtleistung „liegt noch hinter den mächtigsten proprietären Modellen, Claude Fable 5 und GPT 5.6 Sol", zeige aber über die gesamte Suite Frontier-Niveau. Wenn ein Lab sein eigenes Modell untertreibt, ist das normalerweise die Zahl, der man vertrauen sollte.
Kimi K3 vs. Claude Opus 5
Der Vergleich, den alle anstellen, ist Kimi K3 vs. Claude, und das Duell verschob sich am 24. Juli, als Anthropic Claude Opus 5 lieferte. Moonshoots Launch-Tabelle wurde gegen Claude Opus 4.8 aufgebaut, das damals das Live-Flaggschiff war, sodass diese Spalten oben auf 4.8 bezogen bleiben. Für eine Entscheidung, die du heute triffst, ist Opus 5 das Modell auf der anderen Seite der Tabelle.
| Modell | Entwickler | Kontext | Offene Gewichte | API-Preis pro 1M |
|---|---|---|---|---|
| Kimi K3 | Moonshot AI | 1.048.576 | Ja, Kimi K3 License | $3 / $15 |
| Claude Opus 5 | Anthropic | 1M | Nein | $5 / $25 |
| Claude Fable 5 | Anthropic | 1M | Nein | $10 / $50 |
| GLM-5.2 | Z.ai | 1M | Ja, MIT | $1.40 / $4.40 |
| Kimi K2.6 | Moonshot AI | 262.144 | Ja, modified MIT | $0.95 / $4 |
Beim Preis ist K3 der klare Sieger, bei $3 / $15 gegenüber $5 / $25 für Opus 5 und $10 / $50 für Fable 5. Bei gemessener Leistung führt Opus 5, um vier Punkte im Artificial-Analysis-Intelligence-Index und um 44 Punkte im WebDev-Board von Arena. Anthropic veröffentlicht keinen SWE-bench-Wert für Opus 5, sodass jeder, der dir einen zitiert, nicht Anthropic zitiert.
Die eigentliche Trennlinie ist nicht der Score, sondern was du besitzen kannst. Opus 5 ist das stärkere Modell und die sicherere Standardwahl für Produktionscoding, und es ist Anthropics neuer Standard auf Claude Max. K3 ist das, das du herunterladen, prüfen, feinabstimmen und in deinem eigenen Netzwerk betreiben kannst, was kein Claude-Modell zu irgendeinem Preis erlaubt. Wenn du zwischen Flaggschiffen für eine konkrete Aufgabe wählst, schlüsselt unser Guide über wann welches KI-Modell zu nutzen ist die Entscheidung aufgabenweise auf.
Kimi K3: Preise
Moonshot hat nun offizielle Preise veröffentlicht, was die Drittanbieter-Schätzungen, die beim Launch kursierten, ablöst. Kimi K3-Preise sind $3.00 pro Million Eingabe-Token und $15.00 pro Million Ausgabe-Token, mit gecachter Eingabe bei $0.30, ein 90-%-Rabatt, der viel ausmacht, wenn du denselben langen Kontext immer wieder sendest.
| Modell | Eingabe (Cache-Miss) | Eingabe (Cache-Hit) | Ausgabe | Kontext |
|---|---|---|---|---|
| kimi-k3 | $3.00 | $0.30 | $15.00 | 1.048.576 |
| kimi-k2.7-code | $0.95 | $0.19 | $4.00 | 262.144 |
| kimi-k2.7-code-highspeed | $1.90 | $0.38 | $8.00 | 262.144 |
| kimi-k2.6 | $0.95 | $0.16 | $4.00 | 262.144 |
| kimi-k2.5 | $0.60 | $0.10 | $3.00 | 262.144 |
Diese Preise stellen K3 zum exakt gleichen Preis wie Claude Sonnet 5, das ebenfalls $3 Eingabe und $15 Ausgabe kostet, während es vier Punkte höher im Artificial-Analysis-Intelligence-Index abschneidet. Gegen die zwei Claude-Modelle, die es übertreffen, ist K3 40 % günstiger als Opus 5 und 70 % günstiger als Fable 5. Das integrierte Web-Such-Tool wird separat mit $0.005 pro erfolgreichem Aufruf abgerechnet, wobei Moonshot das Tool derzeit als überarbeitungsbedürftig kennzeichnet und davon abrät, sich kurzfristig darauf zu verlassen.
K3 ist ein klarer Kostensprung gegenüber der K2-Linie, was seinen größeren Footprint und das immer aktive Reasoning widerspiegelt. Wenn dein Workload keine Frontier-Skalierung braucht, bleiben K2.6 oder K2.7 Code deutlich günstiger. Auf der API-Plattform wird K3 verfügbar, sobald du mindestens $1 aufgeladen hast, und dein kumulativer Aufladebetrag legt deine Rate-Limits fest. Unser vollständiger Kimi-Preisvergleich stellt alle Tarife und API-Preise nebeneinander.
Die Nachfrage hat Moonshoots Hardware überholt. Am 20. Juli 2026 setzte das Unternehmen neue Kimi-Abos aus. Es sagte, die Nachfrage der vergangenen 48 Stunden habe „die Grenzen unserer aktuellen Kapazität erreicht", und werde „neue Abo-Plätze schrittweise" wieder öffnen, wenn Hardware hinzugefügt werde, in einer Erklärung, die die South China Morning Post übernahm. Bestehende Abonnenten behielten ihren Zugang. Der Engpass ist noch nicht vollständig vorbei. Moonshot beendet seinen K3-Launch-Aufladebonus jetzt am 29. Juli 2026 statt wie geplant am 12. August, und seine eigene Preisdokumentation nennt als Grund jüngste Engpässe bei Rechenressourcen.
So nutzt du Kimi K3
Es gibt jetzt, da die Gewichte öffentlich sind, vier Wege zu Kimi K3, und welcher passt, hängt davon ab, ob du ein Chat-Fenster, einen Terminal-Agenten, eine API oder die rohen Dateien willst. Hier ist die praktische Reihenfolge.
- Kimi-App und Playground. Der schnellste Weg ist die Kimi-App oder der web-basierte Playground, wo K3 für eingeloggte Nutzer auswählbar ist. Das ist die No-Code-Option zum Testen des Modells mit eigenen Prompts.
- Kimi Code CLI. Moonshot sagt, K3 funktioniert am besten in seinem eigenen Terminal-Agenten, wo du das Modell mit dem
/model-Befehl auswählst. K3 integriert sich auch in Codex CLI, Claude Code, OpenCode und Hermes Agent über Moonshoots dokumentierte Integrationen. - Die API. Entwickler rufen
kimi-k3über die Kimi-API-Plattform auf, die OpenAI-kompatible und Anthropic-kompatible Endpunkte bietet. Sie unterstützt Tool-Aufrufe, JSON-Schema-strukturierte Ausgabe, Kontext-Caching und die Reasoning-Effort-Kontrolle, und K3 ist auch auf Aggregatoren wie OpenRouter gelistet. - Offene Gewichte. Der vollständige Checkpoint ist auf Hugging Face unter der Kimi-K3-Lizenz, und Moonshot empfiehlt vLLM, SGLang oder TokenSpeed zum Betrieb. Plane für den 1,56-TB-Download und die Multi-Node-Hardware, die er braucht.
Möchtest du nicht für jedes neue Modell ein separates Abo jonglieren? Apps wie Fello vereinen leistungsstarke aktuelle KI-Modelle an einem Ort, was hilft, während sich ein Launch wie dieser setzt. Für einen breiteren Blick auf das open-source-Feld ordnet unser Überblick der derzeit besten open-source-KI-Modelle K3s Abstammung ein. Wenn du speziell chinesische open-source-Modelle abwägst, ist unser Explainer darüber, was GLM ist und wie es konkurriert, ein nützliches Begleitstück.
Das Unternehmen hinter Moonshot AI
Kimi K3 kommt zu einem entscheidenden Moment für Moonshot AI, das 2023 von Yang Zhilin in Peking gegründete Startup. Das Unternehmen sammelt berichten zufolge zwischen $1 Milliarde und $2 Milliarden in einer neuen Runde, die es mit bis zu $31,5 Milliarden bewerten würde. Das ist rund 50 % höher als die $20 Milliarden im Mai, als es $2 Milliarden aufnahm. Wenn die Runde zum Zielwert abgeschlossen wird, wäre das eine Siebenfache Bewertungssteigerung seit Dezember 2025, als Moonshot gut $4 Milliarden wert war. Eine noch größere Zahl wartet dahinter. Bloomberg berichtete am 22. Juli, dass Moonshot eine letzte Vor-IPO-Runde bei einem Vorab-Bewertung von bis zu $50 Milliarden plane, mit Gesprächen, die im August beginnen, und einer möglichen Börsennotierung in Hongkong innerhalb von sechs Monaten.
Die open-source-Strategie ist zentral für den Schwung. Als Moonshot Kimi K2.6 im April 2026 als open source veröffentlichte, stieg es bis Mitte 2026 zum zweitmeistgenutzten großen Sprachmodell auf OpenRouter auf. Damit stand ein drei Jahre altes Lab vor den meisten westlichen Frontier-Labs auf unabhängigen Nutzungs-Bestenlisten. Die Veröffentlichung der K3-Gewichte erweitert dieses Spielbuch auf ein Frontier-Modell.
Das Timing war kein Zufall. Kimi K3 erschien kurz vor der World Artificial Intelligence Conference 2026 in Shanghai, auf der der chinesische Präsident Xi Jinping voraussichtlich Pekings KI-Prioritäten umreißen würde. Tage später auf derselben Konferenz präsentierte Alibaba eine Vorschau auf Qwen 3.8, sein eigenes 2,4-Billionen-Parameter-Konkurrenzmodell. Die Reaktion im Westen war eine Mischung aus Staunen und Alarm, wobei Beobachter feststellten, dass China dabei zu sein scheint, einen einst komfortablen amerikanischen Vorsprung zu schließen.
Warum Kimi K3 wichtig ist
Kimi K3 ist nicht nur ein weiterer Modell-Drop. Mit den öffentlichen Gewichten ist es das größte je veröffentlichte open-weight-Modell und gibt Entwicklern Frontier-Skalierung, die sie herunterladen, prüfen und selbst betreiben können. Das ist eine direkte Herausforderung an die geschlossenen, hochpreisigen Flaggschiffe, die die Spitze des Marktes bisher definiert haben.
Die Lücke, die es schließt, ist enger als die Schlagzeile andeutet und breiter als es aussieht.
Vier Punkte im Artificial-Analysis-Intelligence-Index trennen K3 von Claude Opus 5, aber sechs Punkte trennen K3 vom besten open-source-Modell, das davor kam. Das open-source-Feld hat sich diesen Monat mehr bewegt als das geschlossene.
Der Geschäftskontext macht den Ehrgeiz klar. Moonshoots Kimi-Familie überquerte berichten zufolge bis Mitte Juni $300 Millionen annualisierten wiederkehrenden Umsatz, und laut TechCrunchs Launch-Bericht sammelt das Unternehmen frisches Kapital bei einer gemeldeten Bewertung von $31,5 Milliarden, mit einer größeren Vor-IPO-Runde dahinter. Ein gut finanziertes Lab, das ein riesiges open-source-Modell zu aggressiven Preisen veröffentlicht, ist genau die Art von Druck, der die Preisgestaltung aller anderen neu formt. Um zu sehen, wie schnell sich die geschlossene Seite bewegt, ist unser Guide über das Beste aus GPT-5.6 herausholen ein nützlicher Gegenpol.
Fazit
Kimi K3 hat geliefert, was es versprach. Die Gewichte sind öffentlich, die Lizenz ist für fast alle, die sie tatsächlich nutzen werden, handhabbar, und die Preise sind offiziell und niedrig. Unabhängige Boards bestätigen nun, dass es das stärkste open-source-Modell der Welt mit deutlichem Abstand ist. Was es nicht ist, ist das beste Modell der Welt, und Moonshot sagt das selbst.
Unsere Empfehlung: Nutze K3, wenn offene Gewichte, Kosten oder ein Millionen-Token-Kontext das sind, was du brauchst. Behalte Claude Opus 5 für das schwierigste Produktionscoding im Einsatz, wo es auf jedem unabhängigen Board, das beide bewertet hat, noch führt. Wenn du die praktische Version dieses Trade-offs willst, zeigt unsere Claude-Opus-5-Rezension, was die geschlossene Seite jetzt für $5 pro Million Token bietet.
Kimi K3 gehört in einen direkten Vergleich. Mit Fello AI kannst du Kimi neben Claude, GPT-5.6, Gemini, DeepSeek und Perplexity in einer nativen App für Mac, iPhone und iPad ausführen. Schick dieselbe Coding- oder Rechercheaufgabe an jedes Frontier-Modell gleichzeitig und sieh, welches tatsächlich bei deiner Arbeit gewinnt, ohne separate Konten zu jonglieren. Wenn ein so fähiges open-source-Modell erscheint, ist der schnellste Weg zur Beurteilung ein direkter Vergleich. Auf dem Mac ist das ein nativer Kimi-Desktop-Client, sodass K3 wie jede andere App öffnet.
FAQ
Sind die offenen Gewichte von Kimi K3 verfügbar?
Ja. Moonshot veröffentlichte die vollständigen Kimi-K3-Gewichte am 27. Juli 2026 auf Hugging Face, elf Tage nach dem Launch. Das Repository enthält 96 Safetensors-Shards, insgesamt rund 1,56 TB, veröffentlicht unter der eigenen Kimi-K3-Lizenz.
Ist Kimi K3 open source?
Es ist eher open weight als open source im engeren Sinne. Die Kimi-K3-Lizenz erlaubt Nutzung, Modifikation, Verteilung und kommerziellen Verkauf. Ein Model-as-a-Service-Unternehmen mit mehr als $20 Millionen Umsatz in 12 Monaten braucht eine separate Vereinbarung, und Produkte mit über 100 Millionen monatlichen Nutzern müssen Kimi K3 im Interface nennen.
Wie viele Parameter hat Kimi K3?
Kimi K3 hat 2,8 Billionen Gesamt-Parameter in einem Mixture-of-Experts-Design, von denen 104 Milliarden pro Token aktiviert werden. Moonshot nennt es das weltweit erste offene 3T-Klasse-Modell, und die Modellkarte bestätigt beide Zahlen.
Ist Kimi K3 besser als Claude Opus 5?
Nicht bei gemessener Leistung. Claude Opus 5 erzielt 61 Punkte im Artificial-Analysis-Intelligence-Index gegen 57 für Kimi K3 und führt das WebDev-Board von Arena. K3 gewinnt beim Preis, bei $3 und $15 pro Million Token gegen $5 und $25, und es ist das einzige der beiden, das du herunterladen und selbst betreiben kannst.
Was kostet Kimi K3?
Der offizielle API-Preis beträgt $3.00 pro Million Eingabe-Token und $15.00 pro Million Ausgabe-Token, fallend auf $0.30 pro Million bei gecachter Eingabe. Websuche wird separat mit $0.005 pro erfolgreichem Aufruf abgerechnet, und das Modell wird auf der API-Plattform nach einem Aufladen von mindestens $1 verfügbar.