Moonshot AI a mis en ligne aujourd'hui, 27 juillet 2026, les poids complets de Kimi K3 sur Hugging Face, tenant ainsi la promesse faite lors de la présentation du modèle à la World AI Conference de Shanghai le 16 juillet. Avec 2,8 billions de paramètres, K3 est le modèle open-weight le plus volumineux jamais publié, et son arrivée redistribue les cartes de l'économie et de la géopolitique de l'IA pour les entreprises et les développeurs du monde entier.
Points clés
- 2,8 billions de paramètres — la plus grande publication de modèle open-weight de l'histoire, dépassant tous les précédents jalons open-source
- 16 experts activés sur 896 par token, limitant le calcul actif à environ 50 milliards de paramètres pour une inférence efficiente
- Fenêtre de contexte d'un million de tokens avec des capacités de vision nativement intégrées
- Licence MIT modifiée — les organisations peuvent télécharger, inspecter, affiner et héberger le modèle elles-mêmes
- 2e au classement Vals AI et 1er dans le Frontend Code Arena parmi tous les modèles évalués publiquement
- L'écart de performance avec les modèles propriétaires frontières passe de 6–9 mois à environ 3–5 mois
Architecture : KDA et Stable LatentMoE
L'architecture de K3 combine Kimi Delta Attention (KDA) et les résidus d'attention (AttnRes) avec un framework Stable LatentMoE — le système de mélange d'experts de deuxième génération de Moonshot. Seuls 16 experts sur 896 s'activent par token, rendant le modèle creux malgré son énorme volume de paramètres. Moonshot annonce une amélioration de 2,5× de l'efficacité globale de mise à l'échelle par rapport à Kimi K2.
La vision native est intégrée au modèle de base plutôt qu'ajoutée via un adaptateur, permettant à K3 de raisonner sur des images et des documents dans le même contexte que du code et du texte.
Hébergement autonome : puissant mais exigeant
Télécharger K3 est gratuit. Le faire tourner est une autre affaire. Les poids seuls en précision MXFP4 quatre bits nécessitent environ 1,4 téraoctet de mémoire GPU rapide avant même de comptabiliser les tampons d'exécution et les activations. Moonshot recommande pour la production "une configuration supernode avec 64 accélérateurs ou plus", ce qui cantonne l'inférence réelle sur K3 aux centres de données de grande envergure, hors de portée des stations de travail individuelles.
Pour les organisations capables de franchir ce seuil d'infrastructure, l'hébergement autonome retire entièrement les requêtes de l'API Moonshot, éliminant le risque de souveraineté des données que de nombreuses industries réglementées associent aux API d'IA opérées depuis la Chine sous la loi sur le renseignement national.
Benchmarks : aux portes de la frontière
Les résultats de K3 sur les classements publics sont saisissants :
- Artificial Analysis Intelligence Index : 57, classé 4e sur 189 modèles évalués
- Vals AI Index : 74,70 %, classé 2e sur 38
- Arena WebDev : 1re place avec un score préliminaire de 1 679
- Vitesse de génération : 62 tokens par seconde via l'API hébergée
- Latence au premier token : 1,99 seconde
Le modèle surpasse tous les releases open-weight précédents sur les benchmarks de programmation — DeepSWE, Terminal-Bench et Program Bench — tout en restant en retrait des modèles propriétaires leaders (Claude Fable 5 et GPT-5.6 Sol) sur les évaluations de raisonnement global. Le blog de Moonshot décrit un scénario de recherche où K3 a "accompli en environ deux heures ce qui nécessiterait normalement une à deux semaines" de travail expert.
Tarification API vs coût d'hébergement autonome
Les organisations choisissant l'API hébergée de Moonshot paient :
| Type de token | Coût |
|---|---|
| Entrée avec cache | 0,30 $ par million de tokens |
| Entrée sans cache | 3,00 $ par million de tokens |
| Sortie | 15,00 $ par million de tokens |
C'est environ trois à quatre fois plus cher que Kimi K2.6, reflétant les capacités élargies et la longueur de contexte de K3. L'hébergement autonome supprime les frais par token mais les remplace par des dépenses d'investissement pour un cluster d'au moins 64 accélérateurs.
Le signal géopolitique des poids ouverts
Les analystes notent que cette publication coïncide avec l'engagement public du président chinois Xi Jinping en faveur de l'IA open-source et de la diffusion mondiale des capacités. En publiant les poids de K3 sous licence permissive, Moonshot permet à tout chercheur ou entreprise d'étudier, d'affiner et de redistribuer le modèle, créant une asymétrie d'accès où des modèles open-source d'origine chinoise se propagent mondialement tandis que leurs équivalents américains restent fermés ou soumis à des contrôles à l'exportation.
L'analyse d'interconnects.ai qualifie K3 de preuve que les laboratoires chinois ont atteint des capacités "quasi-frontières" avec "beaucoup moins de ressources" que leurs homologues occidentaux, accélérant la diffusion mondiale de l'IA avancée d'une manière qui complique l'application des contrôles à l'exportation.
La suite
L'attention de la communauté se porte immédiatement sur :
- L'intégration vLLM — Moonshot devrait publier une implémentation vLLM avec support natif de Kimi Delta Attention
- Les variantes affinées — la licence ouverte invite la communauté de recherche à produire des checkpoints spécialisés par domaine
- Le serving quantifié — les fournisseurs d'inférence travaillent déjà sur des variantes INT4 et INT8 pour rapprocher le coût par token de la parité avec GPT-4o
- Les audits en industries réglementées — la possibilité d'inspecter les poids répond aux exigences de transparence des modèles dans la santé, la finance et les marchés publics
Source : Moonshot AI — Blog Kimi K3