Moonshot AI a publié l’intégralité des poids de Kimi K3 le 27 juillet 2026, onze jours après la mise en ligne du modèle dans l’application Kimi. Le dépôt Hugging Face compte 96 fragments safetensors totalisant environ 1,56 To. Avec 2,8 billions de paramètres au total, dont 104 milliards actifs par token, K3 est le plus grand modèle ouvert jamais publié. Moonshot le présente comme le premier modèle ouvert de classe 3T au monde, et cette affirmation dispose désormais d’un bouton de téléchargement pour l’étayer.
Le tableau indépendant a beaucoup bougé depuis le lancement, et pas en faveur de K3. Kimi K3 obtient désormais 43,6 sur l’Intelligence Index v4.3.2 d’Artificial Analysis, ce qui le place troisième parmi les modèles à poids ouverts et non premier, derrière le MiMo-V2.6-Pro de Xiaomi à 46,3 et le GLM-5.3 de Z.ai à 44,8. Les classements où votent des humains disent l’inverse, et K3 y mène toujours le camp ouvert sur les deux. Ci-dessous, vous trouverez les specs vérifiées, ce que la licence autorise réellement, les tarifs API officiels, et une lecture honnête de la façon dont K3 se compare à Claude Opus 5.5, qui a remplacé Opus 5 comme modèle par défaut d’Anthropic le 22 septembre 2026.
Les points clés à retenir
- Les poids ouverts sont sortis le 27 juillet 2026, 96 fragments et environ 1,56 To sur Hugging Face, sous une licence Kimi K3 personnalisée plutôt que MIT.
- Une conception à mélange d’experts avec 2,8 billions de paramètres au total, 104 milliards activés par token, et une fenêtre de contexte de 1 048 576 tokens.
- Accepte les entrées texte, image et vidéo, raisonne toujours, et expose désormais un effort de raisonnement faible, élevé et maximal plutôt que maximal uniquement.
- La tarification API officielle est de 3,00 $ par million de tokens en entrée et de 15,00 $ en sortie, tombant à 0,30 $ sur l’entrée en cache, l’écriture en cache étant facturée à part, 3,00 $ ou 6,00 $ selon la durée de vie de l’entrée.
- Obtient 43,6 sur l’Intelligence Index v4.3.2 d’Artificial Analysis, troisième parmi les poids ouverts derrière MiMo-V2.6-Pro à 46,3 et GLM-5.3 à 44,8, mais toujours le modèle ouvert le mieux placé sur les classements où votent des humains.
Qu’est-ce que Kimi K3 ?
Kimi K3 est le grand modèle de langage phare de Moonshot AI, lancé le 16 juillet 2026 et publié en poids ouverts le 27 juillet. Il utilise une conception à mélange d’experts avec 2,8 billions de paramètres au total, dont 104 milliards s’activent sur un token donné, et il lit une fenêtre de contexte d’un million de tokens. La propre documentation de Moonshot confirme qu’il accepte les entrées texte, image et vidéo.
L’écart entre le lancement et les poids était prévu, et Moonshot l’avait dit à l’époque. Son billet de lancement promettait les fichiers « d’ici le 27 juillet 2026 » pendant que l’équipe travaillait « en étroite collaboration avec les partenaires d’inférence et les mainteneurs open source pour aligner les détails techniques et assurer un déploiement fiable dans tout l’écosystème ». Le rapport technique est sorti avec les poids plutôt qu’après eux.
| Spec | Kimi K3 |
|---|---|
| Développeur | Moonshot AI |
| Sortie | 16 juillet 2026 (poids le 27 juillet 2026) |
| Architecture | Mélange d’experts (MoE) |
| Paramètres totaux | 2,8 billions |
| Paramètres activés | 104 milliards par token |
| Couches | 93 (69 Kimi Delta Attention, 24 Gated MLA) |
| Experts | 896 au total, 16 sélectionnés par token |
| Encodeur visuel | MoonViT-V2, 401 M de paramètres |
| Fenêtre de contexte | 1 048 576 tokens |
| Types d’entrée | Texte, image, vidéo |
| Quantification | Poids MXFP4, activations MXFP8 |
| Contrôle du raisonnement | reasoning_effort faible / élevé / maximal, maximal par défaut |
| Licence | Licence Kimi K3 (personnalisée, pas MIT) |
À 2,8 billions de paramètres, Kimi K3 reste le plus gros modèle ouvert publié à ce jour, même si la marge s’est resserrée depuis juillet : le Qwen3.8 2.4T A95B d’Alibaba annonce 2,45 billions, là où le rival le plus proche était le V4-Pro de DeepSeek à 1,6 billion. La conception Mixture-of-Experts fait que seule une petite fraction de ces paramètres s’active sur un token donné, si bien que le coût de calcul effectif reste très en dessous de ce que suggère le chiffre brut. Activer 16 experts sur 896 est un ratio de parcimonie inhabituellement élevé. Ce choix est central dans la façon dont Moonshot a tiré des performances de pointe de l’architecture.

Poids ouverts de Kimi K3 : ce qui est réellement sorti
C’est la partie qui a changé le 27 juillet, et c’est la raison pour laquelle K3 compte plus que sa ligne de benchmark. Tout autre modèle de ce niveau de capacité est une API que vous louez. K3 est un fichier que vous pouvez détenir.
Ce que contient le dépôt
Le dépôt Hugging Face contient 120 fichiers, dont 96 sont des fragments safetensors, et l’ensemble du téléchargement atteint environ 1,56 To. Moonshot livre le modèle en poids MXFP4 natifs avec des activations MXFP8, appliqués via un entraînement tenant compte de la quantification dès l’étape de fine-tuning supervisé. C’est pourquoi un modèle de 2,8 billions de paramètres tient dans 1,56 To au lieu de plusieurs fois cela, et cela signifie que vous ne téléchargez pas une quantification communautaire avec perte, vous téléchargez ce que Moonshot a entraîné.
L’afflux a été immédiat et il ne s’est pas tari. Un jour après la mise en ligne des fichiers, le dépôt affichait environ 99 000 téléchargements et plus de 7 300 mentions J’aime, comptés le 28 juillet 2026. Au 24 septembre, Hugging Face annonçait 1,86 million de téléchargements sur le mois écoulé et 11 500 mentions J’aime. Pour un checkpoint que presque personne ne peut héberger sur sa propre machine, cela fait beaucoup de trafic, et une bonne part viendra de fournisseurs d’inférence, de projets de quantification et de laboratoires de recherche plutôt que de particuliers.
Moonshot cite trois moteurs d’inférence comme runtimes recommandés, vLLM, SGLang et TokenSpeed, chacun avec sa propre recette publiée pour K3. Le rapport technique est sorti avec les poids plutôt qu’après eux, si bien que les détails de l’architecture sont eux aussi publics.
La licence Kimi K3 n’est pas MIT
Lisez ceci avant de concevoir un produit autour d’elle.
La licence accorde les droits habituels d’utiliser, copier, modifier, distribuer, sous-licencier, affiner et vendre, ce qui se lit comme du MIT pour la plupart des lecteurs. Deux clauses attachent ensuite des conditions que MIT n’a pas. Tencent a pris le chemin inverse le 28 août 2026 en publiant les poids de 770 milliards de paramètres de Hy4 Preview sous licence Apache 2.0 simple.
La première est un seuil de revenus sur la revente. Si vous exploitez une activité de modèle en tant que service et que vos revenus dépassent 20 millions de dollars sur 12 mois consécutifs, vous devez signer un accord distinct avec Moonshot avant d’utiliser K3 à des fins commerciales. La seconde est une règle d’attribution. Tout produit bâti sur K3 comptant plus de 100 millions d’utilisateurs actifs mensuels, ou plus de 20 millions de dollars de revenus mensuels, doit afficher le nom « Kimi K3 » de façon visible dans son interface.
Les deux conditions tombent pour un usage purement interne, c’est-à-dire tout ce qui n’expose jamais le modèle ni ses sorties à des tiers. Pour un développeur seul, une startup ou une équipe de recherche, l’effet pratique est nul. Pour un hyperscaler qui revend de l’inférence, c’est une négociation. Cet échange était autrefois tout l’argument en faveur de K3 : la capacité de pointe contre une licence qu’il faut lire sérieusement. C’est un argument plus faible aujourd’hui, car deux modèles ouverts passent devant K3 sur l’index d’Artificial Analysis, et l’un d’eux, le MiMo-V2.6-Pro de Xiaomi, sort sous une licence MIT sans condition. L’autre, c’est la gamme GLM de Z.ai, où le fleuron GLM-5.3 porte sa propre licence sur mesure et où seul GLM 5.3 Flash est en MIT.
Ce qu’il faut pour faire tourner Kimi K3 soi-même
Téléchargeable n’est pas la même chose qu’exécutable. Un point de contrôle de 1,56 To a besoin d’un cluster GPU multi-nœuds pour servir à plein contexte, si bien que « vous pouvez l’auto-héberger » est vrai pour les laboratoires et les équipes d’infrastructure sérieuses, pas pour quelqu’un doté d’une seule station de travail. Si vous voulez un modèle ouvert que vous pouvez réellement faire tourner sur votre propre matériel, les plus petits modèles Kimi et GLM restent les options réalistes. Notre sélection des meilleurs modèles d’IA open source les classe selon les exigences matérielles.
L’architecture derrière le bond
Moonshot rapporte une amélioration d’environ 2,5x de l’efficacité globale de mise à l’échelle par rapport à Kimi K2. En clair, K3 convertit le calcul brut en intelligence utilisable bien plus efficacement que la génération précédente. Trois changements portent l’essentiel du poids, et les trois sont désormais documentés dans le rapport technique public.
Kimi Delta Attention
Kimi Delta Attention (KDA) est un mécanisme d’attention linéaire hybride, et 69 des 93 couches du modèle l’utilisent, les 24 restantes tournant en Gated MLA. L’attention standard devient plus lente et plus gourmande en mémoire à mesure que les séquences s’allongent, ce qui est exactement le problème à un million de tokens. Moonshot rapporte que KDA permet un décodage jusqu’à 6,3x plus rapide dans des contextes d’un million de tokens, ce qui compte pour le travail agentique où un modèle lit et raisonne à répétition sur d’immenses portions de code ou de documents.
Attention Residuals
Les Attention Residuals (AttnRes) traitent la façon dont l’information circule à travers la profondeur du réseau plutôt qu’à travers la longueur de la séquence. Au lieu d’accumuler les représentations uniformément couche par couche, AttnRes récupère sélectivement des représentations à travers la profondeur. Moonshot indique que cela offre une efficacité d’entraînement supérieure d’environ 25 % tout en ajoutant moins de 2 % de calcul supplémentaire, et a ouvert la technique en open source plus tôt en 2026 avant de l’intégrer à K3.
Stable LatentMoE et entraînement MXFP4
La troisième pièce est le cadre Stable LatentMoE, qui rend entraînable la parcimonie agressive de 16 experts sur 896 sans l’instabilité qui accompagne habituellement le fait de pousser un MoE aussi loin. À ses côtés se trouve la décision d’entraîner en MXFP4 dès l’étape de fine-tuning plutôt que de quantifier ensuite, ce qui maintient les poids publiés à la fois petits et fidèles au modèle que Moonshot a évalué.
Une démonstration que Moonshot a mise en avant est parlante. L’équipe a chargé K3 d’optimiser son propre noyau d’entraînement AttnRes à l’échelle de production, 96 couches, un modèle à 8 192 dimensions et 8 192 tokens. Sur 15 heures d’itération ininterrompue, K3 a conçu un algorithme de noyau inédit en deux phases, fusionné des noyaux tout en préservant la numérique, et réduit le temps aller-plus-retour de 283,6 ms à 114,4 ms. C’est le genre de tâche d’ingénierie à long horizon sur laquelle la plupart des modèles calent en quelques minutes.
Une fenêtre de contexte d’un million de tokens
Kimi K3 gère jusqu’à 1 048 576 tokens dans un seul contexte, soit environ quatre fois la fenêtre de 256K de K2.6. C’est assez pour tenir une base de code entière, une pile de longs documents ou une longue exécution d’agent en plusieurs étapes sans perdre le fil. Cela correspond aussi à la fenêtre de 1M qu’Anthropic documente indifféremment pour Claude Opus 5.5, Fable 5.1 et Sonnet 5.5, si bien que l’avantage de contexte long que Kimi détenait sur les fleurons fermés s’est réduit à une égalité.
Entrée multimodale et raisonnement toujours actif
K3 accepte le texte, les images et la vidéo, ce qui le pousse au-delà de la gamme K2, centrée sur le texte, vers un vrai territoire multimodal. Le guide de démarrage K3 de Moonshot documente lui-même l’entrée vidéo via l’API de fichiers, et la fiche du modèle rapporte 90,0 sur Video-MME avec sous-titres. Le raisonnement est toujours actif, et le paramètre reasoning_effort accepte désormais low, high et max, avec max par défaut. Au lancement, seul max était disponible : les niveaux d’effort promis sont donc arrivés depuis.
Comment Kimi K3 se comporte sur les benchmarks
Deux questions distinctes se posent ici. Que disent les classements indépendants au sujet de Kimi K3, et que prétend la propre suite d’évaluation de Moonshot ? Le tableau indépendant n’est arrivé qu’après le lancement, c’est donc le meilleur point de départ, et les chiffres du fournisseur prennent davantage de sens une fois que vous l’avez vu.
Ce que disent les classements indépendants
Artificial Analysis note désormais Kimi K3 à 43,6 sur son Intelligence Index v4.3.2, relevé sur sa page modèle le 24 septembre 2026. L’essentiel de la chute depuis les 57 que cet article indiquait au départ est un réétalonnage et non une régression, car l’index est passé par v4.2 puis v4.3 en septembre et tous les scores du classement ont baissé avec lui. Ce qui a vraiment changé, c’est l’entourage de K3. Claude Opus 5.5 est à 57,6, Claude Fable 5.1 à 53,4 et GPT-6 Astra à 52,7, et parmi les poids ouverts K3 est maintenant troisième, derrière MiMo-V2.6-Pro à 46,3 et GLM-5.3 à 44,8.
Deux des chiffres que cet article citait n’existent plus. Artificial Analysis a fondu son Agentic Index dans l’index principal puis a supprimé purement et simplement son Coding Index, si bien qu’aucun des deux composites ne peut être actualisé. Ce qui reste, c’est la vitesse et le coût, et les deux jouent encore contre K3. Artificial Analysis le chronomètre à environ 37 tokens par seconde, contre 54 pour Claude Opus 5 et 116 pour GPT-6 Sol, ce qui en fait le modèle le plus lent du groupe de pointe. Il facture 2,00 $ par tâche de l’Intelligence Index, contre 5,98 $ pour Opus 5.5 et 0,13 $ pour MiMo-V2.6-Pro.
Sur le classement WebDev d’Arena, où des humains votent à l’aveugle sur des interfaces générées, K3 se situe désormais à 1 659,6 sur 13 252 votes, relevé le 24 septembre 2026. C’est le neuvième au classement général et le premier parmi les modèles à poids ouverts. Les huit entrées au-dessus de lui sont toutes fermées : Claude Opus 5.5 à 1 818,4, GPT-6 Astra à 1 792,2, Claude Fable 5.1 à 1 754,7, deux réglages d’effort de Claude Opus 5, GPT-6 Sol à 1 685,9 et deux instantanés de Qwen3.8 Max. K3 détenait la première place au lancement : c’est donc un classement sur lequel il s’est fait doubler, pas un classement dont il serait tombé.
Le classement Agent d’Arena, qui évalue à quel point les modèles orchestrent des outils sur de vraies tâches, publie maintenant un rang général, et il place Kimi K3 huitième à +0,062, en tête du camp ouvert et devant le Hy4 Preview de Tencent, DeepSeek V4.1 Flash et les deux entrées GLM. Les cinq signaux sous-jacents méritent une lecture séparée : K3 est cinquième sur l’achèvement des tâches, le signal qui dit si le travail a vraiment abouti, mais dix-septième sur la dirigeabilité et dix-neuvième sur la reprise après une commande shell échouée. Sur le classement texte général, il est 17e sur 125 avec 1 484,8 points issus de 20 987 votes. MiMo-V2.6-Pro, le modèle qui le dépasse désormais sur l’index, n’a aucun vote dans Arena.
Les propres benchmarks de codage de Moonshot
Moonshot a publié cette batterie au lancement, en juillet 2026, en comparant Kimi K3 à Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 et GLM-5.2, tous à effort de réflexion maximal. Lisez-la comme un instantané de juillet : chacun des modèles fermés qui y figurent a été remplacé depuis, et la ligne Terminal-Bench est la version 2.1, que le secteur a remplacée par la 4.0, bien plus dure. Ce sont en outre les propres exécutions du fournisseur, avec K3 évalué sur le harness Kimi Code dans plusieurs lignes, donc traitez-les comme des affirmations de Moonshot et non comme des résultats indépendants.
| Benchmark | Kimi K3 | Fable 5 | GPT-5.6 Sol | Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 | 67,0 | 46,2 |
| ProgramBench | 77,8 | 76,8 | 77,6 | 71,9 | 70,8 | 63,7 |
| Terminal-Bench 2.1 | 88,3 | 88,0 | 88,8 | 84,6 | 83,4 | 82,7 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 | 64,9 | 67,3 |
| SWE-Marathon | 42,0 | 35,0 | 39,0 | 40,0 | 14,0 | 13,0 |
| Kimi Code Bench 2.0 | 72,9 | 76,9 | 64,8 | 71,7 | 69,0 | 64,2 |
À lire tel quel, Kimi K3 remporte carrément ProgramBench et SWE-Marathon et se situe à moins d’un demi-point du leader sur Terminal-Bench 2.1. Sur FrontierSWE, il arrive deuxième derrière Fable 5 mais bien devant tout le reste. Les propres notes de bas de page de Moonshot ajoutent une réserve à garder en tête : Claude Fable 5 a déclenché des replis de sécurité sur 35 % des tâches SWE-Marathon dans cette évaluation, ce qui a pu tirer son score vers le bas.
Benchmarks agentiques et de travail intellectuel
| Benchmark | Kimi K3 | Fable 5 | GPT-5.6 Sol | Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 | n/d |
| MCPMark-Verified | 94,5 | 87,4 | 92,9 | 76,4 | n/d |
| GDPval-AA v2 (Elo) | 1 686 | 1 747 | 1 736 | 1 593 | 1 510 |
| AA-Briefcase (Elo) | 1 548 | 1 583 | 1 495 | 1 354 | 1 260 |
| JobBench | 54,3 | 57,4 | 45,4 | 48,4 | 43,4 |
| SpreadsheetBench 2 | 34,8 | 34,7 | 32,4 | 31,6 | 28,1 |
| AutomationBench | 30,8 | 29,1 | 29,7 | 27,2 | 12,9 |
| OSWorld 2.0 | 58,3 | 66,1 | 62,6 | 55,7 | n/d |
Kimi K3 mène BrowseComp, MCPMark, SpreadsheetBench 2 et AutomationBench, et prend la deuxième place sur AA-Briefcase, le benchmark agentique à long horizon, battant GPT-5.6 Sol et ne cédant qu’à Fable 5. Une note de bas de page compte sur BrowseComp : ce 91,2 utilise une stratégie de compaction du contexte déclenchée à 300K tokens. Exécuté avec la fenêtre complète de 1M et sans gestion du contexte, K3 obtient 90,4, ce qui reste le meilleur chiffre de la colonne.
Sur l’utilisation de l’ordinateur, Fable 5 et GPT-5.6 Sol battent tous deux K3 sur OSWorld 2.0, si bien que le modèle ouvert n’est pas en tête partout. Il a affiché 93,5 % sur GPQA Diamond, au niveau de GPT-5.5 et devant les 91,2 de GLM-5.2, et 94,6 sur Harvey Lab-AA, le meilleur score de cette ligne parmi tous les modèles du tableau.
Le propre résumé de Moonshot est plus mesuré que ne l’a été la couverture médiatique. Son billet de lancement indique que la performance globale de K3 « reste en retrait des modèles propriétaires les plus puissants, Claude Fable 5 et GPT 5.6 Sol », tout en démontrant une performance de niveau pointe sur l’ensemble de la suite. Cette phrase est toujours sur la page deux mois plus tard, et les deux modèles qu’elle nomme ont été remplacés depuis, par Claude Fable 5.1 et GPT-6 Sol. Quand un laboratoire sous-vend son propre modèle, c’est généralement le chiffre auquel se fier.
Kimi K3 vs Claude Opus 5.5
La comparaison que tout le monde fait, c’est Kimi K3 vs Claude, et le côté Claude a bougé deux fois depuis la sortie de K3. Anthropic a livré Claude Opus 5 le 24 juillet, ce qui explique que le tableau de lancement de Moonshot ci-dessus reste attribué à Opus 4.8. Puis, le 22 septembre, il a livré Claude Opus 5.5 et a basculé Opus 5 sur sa liste Legacy. Pour une décision que vous prenez aujourd’hui, c’est Opus 5.5 qui se trouve de l’autre côté de la table, et il est à la fois moins cher et plus fort que l’Opus 5 contre lequel cette comparaison a été écrite.
| Modèle | Développeur | Contexte | Poids ouverts | Prix API par 1M |
|---|---|---|---|---|
| Kimi K3 | Moonshot AI | 1 048 576 | Oui, Kimi K3 License | 3 $ / 15 $ |
| Claude Opus 5.5 | Anthropic | 1M | Non | 4 $ / 20 $ |
| Claude Opus 5 (Legacy) | Anthropic | 1M | Non | 5 $ / 25 $ |
| Claude Fable 5.1 | Anthropic | 1M | Non | 10 $ / 50 $ |
| MiMo-V2.6-Pro | Xiaomi | 1M | Oui, MIT | 0,435 $ / 0,87 $ |
| GLM-5.3 | Z.ai | 1M | Oui, GLM 5.3 License | 1,40 $ / 4,40 $ |
| Kimi K2.6 | Moonshot AI | 262 144 | Oui, MIT modifiée | 0,95 $ / 4 $ |
Sur le prix, K3 gagne toujours, mais de moins loin qu’avant : 3 $ / 15 $ contre 4 $ / 20 $ pour Opus 5.5, soit 25 % moins cher là où il sous-cotait Opus 5 de 40 %, et contre 10 $ / 50 $ pour Fable 5.1. Sur la capacité mesurée, l’écart est parti dans l’autre sens, de quatre points à quatorze sur l’Intelligence Index d’Artificial Analysis, et Opus 5.5 mène le classement WebDev d’Arena de 159 points. Anthropic ne publie de chiffre SWE-bench pour aucun des deux Opus, donc quiconque vous en cite un ne cite pas Anthropic.
La vraie ligne de partage n’est pas le score, c’est ce que vous avez le droit de posséder. Opus 5.5 est le modèle le plus fort et le choix par défaut le plus sûr pour du code en production, et la documentation d’Anthropic conseille désormais aux développeurs de commencer par lui pour la plupart des charges de travail. K3 est celui que vous pouvez télécharger, auditer, affiner et faire tourner dans votre propre réseau, ce qu’aucun modèle Claude ne permet à aucun prix. Si vous arbitrez entre fleurons pour un travail précis, notre guide sur quel modèle d’IA utiliser et quand détaille la décision tâche par tâche.
Tarifs de Kimi K3
Moonshot a désormais publié des tarifs officiels, ce qui périme les estimations de tiers qui circulaient au lancement. La tarification de Kimi K3 est de 3,00 $ par million de tokens en entrée et de 15,00 $ par million de tokens en sortie, avec l’entrée en cache à 0,30 $, une remise de 90 % qui compte beaucoup si vous renvoyez sans cesse le même long contexte. K3 facture aussi l’écriture en cache elle-même, 3,00 $ pour une entrée de cinq minutes ou 6,00 $ pour une entrée d’une heure, ce que les modèles K2 ne font pas.
| Modèle | Entrée (cache miss) | Entrée (cache hit) | Sortie | Contexte |
|---|---|---|---|---|
| kimi-k3 | 3,00 $ | 0,30 $ | 15,00 $ | 1 048 576 |
| kimi-k2.7-code | 0,95 $ | 0,19 $ | 4,00 $ | 262 144 |
| kimi-k2.7-code-highspeed | 1,90 $ | 0,38 $ | 8,00 $ | 262 144 |
| kimi-k2.6 | 0,95 $ | 0,16 $ | 4,00 $ | 262 144 |
Ces tarifs ne correspondent plus à Claude Sonnet 5.5, qui est à 2 $ en entrée et 10 $ en sortie : K3 est donc 50 % plus cher sur les deux moitiés de la facture, et depuis la sortie de Sonnet 5.5 le 28 septembre, Sonnet le devance aussi sur l’Intelligence Index d’Artificial Analysis, avec 56,0 contre 43,6. Face aux deux autres modèles Claude qui le devancent, K3 reste 25 % moins cher qu’Opus 5.5 et 70 % moins cher que Fable 5.1. La recherche web a elle aussi changé de forme. Moonshot l’a déplacée vers des endpoints REST autonomes en septembre et ne facture que les appels réussis, à 0,002 $ pour Web Search Basic, 0,003 $ pour Web Search Pro et 0,002 $ pour URL Fetch.
K3 représente un net saut de coût par rapport à la gamme K2, ce qui reflète son empreinte plus large et son raisonnement permanent. Si votre charge de travail n’a pas besoin d’une échelle de pointe, K2.6 ou K2.7 Code restent bien moins chers, et kimi-k2.5 n’est plus une option : Moonshot l’a arrêté avec toute la série moonshot-v1 le 31 août 2026, et les appels vers ces modèles renvoient désormais une erreur 404. Sur la plateforme API, K3 devient accessible dès que vous avez effectué une recharge réussie d’au moins 1 $, 5 $ cumulés donnent droit à un bon de 5 $, et votre recharge cumulée fixe vos limites de débit. Notre panorama complet des prix Kimi compare chaque formule et chaque tarif API côte à côte.
La demande a dépassé le matériel de Moonshot presque aussitôt. Le 19 juillet 2026, trois jours après le lancement, l’entreprise a suspendu les nouveaux abonnements Kimi, indiquant que la demande des 48 heures précédentes avait « poussé au bord des limites de notre capacité actuelle » et qu’elle « rouvrirait de nouvelles places d’abonnement par lots » à mesure qu’elle ajouterait du matériel, dans une déclaration rapportée par le South China Morning Post. Les abonnés existants ont conservé leur accès, et le même message promettait de scinder l’abonnement en Kimi Membership pour le web, l’app et Work, et Kimi Code Membership pour le code. La remise de recharge de lancement que Moonshot avait écourtée pour la même raison a disparu de la documentation tarifaire. Ce que la documentation consigne à la place, daté de septembre 2026, c’est un changement de facturation : la consommation est désormais décomptée à parts égales, 50 % sur le solde et 50 % sur les bons.
Comment utiliser Kimi K3
Il existe quatre façons d’atteindre Kimi K3 maintenant que les poids sont publics, et celle qui convient dépend de si vous voulez une fenêtre de chat, un agent de terminal, une API ou les fichiers bruts. Voici l’ordre pratique.
- Application Kimi et Playground. La voie la plus rapide est l’application Kimi ou le Playground web, où K3 est sélectionnable pour les utilisateurs connectés. C’est l’option sans code pour tester le modèle sur vos propres prompts.
- Kimi Code CLI. Moonshot indique que K3 fonctionne le mieux dans son propre agent de terminal, où vous choisissez le modèle avec la commande
/model. K3 se branche aussi sur Codex CLI, Claude Code, OpenCode et Hermes Agent via les intégrations documentées de Moonshot. - L’API. Les développeurs appellent
kimi-k3via la plateforme API de Kimi, qui propose des endpoints compatibles OpenAI et compatibles Anthropic. Elle prend en charge l’appel d’outils, la sortie structurée à schéma JSON, la mise en cache du contexte et le contrôle reasoning_effort, et K3 est aussi répertorié sur des agrégateurs comme OpenRouter. - Poids ouverts. Le point de contrôle complet est sur Hugging Face sous la licence Kimi K3, et Moonshot recommande vLLM, SGLang ou TokenSpeed pour le servir. Prévoyez le téléchargement de 1,56 To et le matériel multi-nœuds qu’il exige.
Vous préféreriez ne pas jongler avec un abonnement distinct pour chaque nouveau modèle ? Des applications comme Fello réunissent en un seul endroit de puissants modèles d’IA actuels, ce qui aide pendant qu’un lancement comme celui-ci se stabilise. Pour une vue plus large du terrain ouvert, notre sélection des meilleurs modèles d’IA open source disponibles en ce moment replace la lignée de K3 dans son contexte. Si vous pesez spécifiquement les modèles chinois ouverts, notre explication sur ce qu’est GLM et comment il rivalise est un compagnon utile.
L’entreprise derrière Moonshot AI
Kimi K3 arrive à un moment charnière pour Moonshot AI, la startup pékinoise fondée en 2023 par Yang Zhilin. En juillet, l’entreprise était donnée comme levant entre 1 et 2 milliards de dollars sur une valorisation pouvant atteindre 31,5 milliards, soit environ 50 % de plus que les 20 milliards atteints en mai et près de sept fois ce qu’elle valait en décembre 2025. Ce chiffre est déjà dépassé. Reuters a rapporté le 3 septembre 2026 que Moonshot avait déposé de façon confidentielle une introduction en bourse à Hong Kong, visant à lever 3 milliards de dollars sur une valorisation de 50 milliards de dollars dans un tour en cours, avec Goldman Sachs, CICC et Deutsche Bank. C’est l’introduction que TechNode avait signalée en juillet comme possible sous six mois, et Moonshot n’a pas souhaité commenter ce dépôt.
La stratégie open source est centrale dans cette dynamique. Quand Moonshot a ouvert Kimi K2.6 en open source en avril 2026, il est monté jusqu’à devenir le deuxième grand modèle de langage le plus utilisé sur OpenRouter à la mi-2026. Cela a placé un laboratoire fondé trois ans plus tôt devant la plupart des laboratoires de pointe occidentaux sur les classements d’usage indépendants. Publier les poids de K3 étend ce scénario à un modèle de classe pointe.
Le calendrier n’était pas accidentel. Kimi K3 est arrivé juste avant la Conférence mondiale sur l’intelligence artificielle 2026 à Shanghai, où le président chinois Xi Jinping devait exposer les priorités de Pékin en matière d’IA. Quelques jours plus tard, lors de cette même conférence, Alibaba a présenté en avant-première Qwen 3.8, son propre rival de 2,4 billions de paramètres. La réaction en Occident a été un mélange d’admiration et d’inquiétude, des observateurs notant que la Chine semble combler ce qui était autrefois une avance américaine confortable.
Pourquoi Kimi K3 compte
Kimi K3 n’est pas juste une énième sortie de modèle. Les poids étant publics, c’est le plus grand modèle à poids ouverts jamais publié, remettant aux développeurs une capacité à l’échelle de pointe qu’ils peuvent télécharger, inspecter et faire tourner eux-mêmes. C’est un défi direct aux modèles phares fermés et vendus au prix fort qui ont défini le sommet du marché.
L’écart qu’il comble est plus étroit que le titre le suggère et plus large qu’il n’y paraît.
Quatorze points sur l’Intelligence Index d’Artificial Analysis séparent désormais K3 de Claude Opus 5.5, et 2,7 points séparent K3 du modèle ouvert qui l’a dépassé en septembre. Il y a deux mois, le premier écart était de quatre points et le second allait dans l’autre sens. Le camp fermé a bougé davantage cet été que le camp ouvert, et le camp ouvert a en plus changé de leader.
Le contexte économique rend l’ambition explicite. La famille Kimi de Moonshot aurait dépassé 300 millions de dollars de revenus récurrents annualisés à la mi-juin et, selon le reportage de lancement de TechCrunch, l’entreprise levait alors des fonds sur une valorisation annoncée de 31,5 milliards de dollars. Deux mois plus tard, ce même tour est évoqué à 50 milliards de dollars, avec un dépôt d’introduction en bourse derrière. Un laboratoire bien financé qui livre un modèle ouvert géant à des prix agressifs, c’est exactement le genre de pression qui reconfigure ce que facturent tous les autres. Pour voir à quelle vitesse bouge le camp fermé, notre guide sur GPT-6 Sol et Luna est un contrepoint utile.
En résumé
Kimi K3 a tenu ce qu’il promettait. Les poids sont publics, la licence est utilisable par presque tous ceux qui s’en serviront vraiment, et la tarification est officielle et basse. Ce qui n’a pas tenu, c’est la couronne. Artificial Analysis ne le désigne plus comme le modèle ouvert le plus puissant qui soit et place au-dessus de lui le MiMo-V2.6-Pro de Xiaomi et le GLM-5.3 de Z.ai, tandis que les votants humains d’Arena classent toujours K3 premier des modèles ouverts sur les deux classements qui l’ont vu. Il n’a jamais été le meilleur modèle qui soit, et Moonshot le dit lui-même.
Notre recommandation : utilisez K3 quand ce sont les poids ouverts, le coût ou un contexte d’un million de tokens qu’il vous faut, et quand vous voulez un modèle ouvert avec un vrai historique derrière lui plutôt qu’un score de benchmark vieux de quelques jours. Gardez Claude Opus 5.5 sous la main pour le code de production le plus difficile, où il mène chaque classement indépendant ayant évalué les deux. Si vous voulez la version pratique de cet arbitrage, notre test de Claude Opus 5.5 détaille ce que le camp fermé propose aujourd’hui pour 4 $ par million de tokens en entrée.
Kimi K3 mérite une comparaison en face à face. Avec Fello AI, vous pouvez faire tourner Kimi aux côtés de Claude, GPT-6, Gemini, DeepSeek et Perplexity dans une seule app native pour Mac, iPhone et iPad. Envoyez la même tâche de code ou de recherche à tous les modèles de pointe d’un coup et voyez lequel gagne vraiment sur votre travail, sans jongler avec des comptes séparés. Quand un modèle ouvert aussi capable arrive, le moyen le plus rapide de le juger est un test côte à côte. Sur Mac, c’est un client de bureau Kimi natif, donc K3 s’ouvre comme n’importe quelle autre app. Pour savoir comment K3 se situe face aux modèles de chaque offre ChatGPT, consultez Kimi vs ChatGPT.
FAQ
Les poids ouverts de Kimi K3 sont-ils disponibles ?
Oui. Moonshot a publié l’intégralité des poids de Kimi K3 sur Hugging Face le 27 juillet 2026, onze jours après le lancement. Le dépôt contient 96 fragments safetensors, environ 1,56 To au total, publiés sous la licence Kimi K3 personnalisée.
Kimi K3 est-il open source ?
Il est à poids ouverts plutôt qu’open source au sens strict. La licence Kimi K3 autorise l’utilisation, la modification, la distribution et la vente commerciale. Une activité de modèle en tant que service générant plus de 20 millions de dollars sur 12 mois quelconques a besoin d’un accord distinct, et les produits comptant plus de 100 millions d’utilisateurs mensuels doivent créditer Kimi K3 à l’écran.
Combien de paramètres Kimi K3 a-t-il ?
Kimi K3 compte 2,8 billions de paramètres au total dans une conception à mélange d’experts, dont 104 milliards s’activent par token. Moonshot le présente comme le premier modèle ouvert de classe 3T au monde, et sa fiche de modèle confirme les deux chiffres.
Kimi K3 est-il meilleur que Claude Opus 5 ?
Pas sur la capacité mesurée, et l’écart s’est creusé en septembre. Sur l’Intelligence Index v4.3.2 d’Artificial Analysis, Claude Opus 5 obtient 50,8 et son remplaçant Claude Opus 5.5 obtient 57,6, contre 43,6 pour Kimi K3, et tous deux passent devant K3 sur le classement WebDev d’Arena. K3 gagne sur le prix, à 3 $ et 15 $ par million de tokens contre 5 $ et 25 $ pour Opus 5 et 4 $ et 20 $ pour Opus 5.5, et c’est le seul des trois que vous pouvez télécharger et faire tourner vous-même.
Combien coûte Kimi K3 ?
La tarification API officielle est de 3,00 $ par million de tokens en entrée et de 15,00 $ par million de tokens en sortie, tombant à 0,30 $ par million sur l’entrée en cache, l’écriture en cache étant facturée 3,00 $ ou 6,00 $ selon la durée de vie de l’entrée. La recherche web est passée à des endpoints autonomes en septembre 2026 et facture les appels réussis entre 0,002 $ et 0,003 $, et le modèle devient accessible sur la plateforme API après une recharge d’au moins 1 $.