DevNews

Moonshot publie les poids de Kimi K3, 1,4 To au total

Sur cette page
  1. Ce qu'il y a dans la boîte
  2. L'arithmétique du matériel
  3. Les scores
  4. Lire la licence correctement
  5. Ce qu'il faut en retenir
  6. Sources et pour aller plus loin

Moonshot AI a publié les poids complets de Kimi K3 sur Hugging Face, ce qui fait d'un modèle à mélange d'experts de 2800 milliards de paramètres la plus grosse publication en poids ouverts à ce jour. Le téléchargement pèse environ 1,4 téraoctet en MXFP4, et un déploiement de service demande de l'ordre de soixante quatre accélérateurs répartis sur huit noeuds : ce n'est donc pas une affaire d'ordinateur portable. Ce qui mérite quand même votre après midi, c'est ce qui est sorti à côté des poids : les noyaux d'attention, la bibliothèque de communication MoE et le harnais que Moonshot utilise pour ses environnements d'agents. La licence est la partie à relire deux fois.

The short answer

Moonshot AI a publié les poids complets de Kimi K3 sur Hugging Face, un modèle à mélange d'experts creux de 2800 milliards de paramètres qui active 16 de ses 896 experts par jeton, soit environ 104 milliards de paramètres actifs. La fenêtre de contexte est de 1 048 576 jetons. Les poids sortent en MXFP4, environ 1,4 téraoctet sur disque, format pris en charge nativement par les accélérateurs NVIDIA Blackwell et AMD MI400. À côté du point de contrôle, Moonshot a ouvert ses noyaux d'attention, sa bibliothèque de communication MoE et son infrastructure d'environnements d'agents. La licence ressemble à MIT, avec un accord séparé exigé au dessus d'environ 20 millions de dollars de revenus en modèle en tant que service.

2,8 Tparamètres au total, 104 milliards actifs par jeton
1,4 Tole téléchargement des poids en MXFP4
64accélérateurs pour un déploiement de service réaliste
Carte réponse : Moonshot AI a publié les poids complets de Kimi K3 sur Hugging Face fin juillet 2026, un modèle à mélange d'experts de 2800 milliards de paramètres dont 104 milliards actifs par jeton, une fenêtre de contexte d'un million de jetons, des poids MXFP4 pesant environ 1,4 téraoctet, sous la licence Kimi K3.
Les chiffres qui décident si c'est exploitable chez vous. Source : la fiche du modèle Kimi K3 sur Hugging Face. PNG

Le modèle avait été dévoilé le seize juillet et l'API a suivi peu après. Ce qui est arrivé ces dernières vingt quatre heures, c'est la seule chose qui change réellement les options de quelqu'un : le point de contrôle lui même, téléchargeable, avec un rapport technique à côté.

L'annonce de Moonshot elle même : les poids, le rapport technique et l'infrastructure qui les entoure.

Ce qu'il y a dans la boîte

Kimi K3 est un modèle à mélange d'experts creux, 2800 milliards de paramètres stockés et environ 104 milliards qui participent par jeton. Le routeur sélectionne 16 experts sur 896. Si vous n'avez travaillé qu'avec des modèles denses, la conséquence pratique est que votre budget mémoire est fixé par le grand nombre et votre budget calcul par le petit.

L'attention se répartit sur 93 couches, 69 en Kimi Delta Attention et 24 en attention latente multi têtes à portes. Kimi Delta Attention est le schéma d'attention linéaire hybride de Moonshot, et l'annonce qui l'accompagne parle d'un décodage jusqu'à 6,3 fois plus rapide à un contexte plein d'un million de jetons par rapport à l'approche précédente. La longueur de contexte est de 1 048 576 jetons, et la vision vient de MoonViT-V2, un encodeur de 401 millions de paramètres qui donne au modèle une compréhension native des images et des vidéos, pas une étape de légendage rajoutée.

Les poids sont en MXFP4 avec des activations MXFP8, et ce n'est pas une compression appliquée après coup. Moonshot a entraîné avec conscience de la quantification, c'est pourquoi le point de contrôle en quatre bits est l'artefact de référence et non une version dégradée de commodité. MXFP4 tourne nativement sur NVIDIA Blackwell et sur les accélérateurs de la classe AMD MI400.

L'arithmétique du matériel

Graphique comparatif des scores de Kimi K3 : GPQA Diamond 93,5, BrowseComp 91,2, Terminal-Bench 2.1 88,3, DeepSWE 67,5 et indice d'intelligence Artificial Analysis 57.
Scores publiés et scores tiers pour Kimi K3. Sources : la fiche Hugging Face et Artificial Analysis. PNG

C'est ici que l'enthousiasme rencontre un tableur. Le téléchargement MXFP4 pèse environ 1,4 téraoctet. Déplié en 16 bits, il approche 5,6 téraoctets, ce qui explique que personne ne le fera.

Héberger 1,4 téraoctet de paramètres demande dix huit accélérateurs de 80 gigaoctets au minimum absolu, et c'est avant qu'un seul jeton de cache clé valeur n'existe. Un déploiement qui sert des requêtes concurrentes à des longueurs de contexte utiles a besoin de marge, et le chiffre qui revient dans les retours de déploiement tourne autour de soixante quatre accélérateurs sur huit noeuds. vLLM et SGLang prennent tous les deux le modèle en charge, donc le logiciel n'est pas l'obstacle.

Cette arithmétique trie proprement le public. Si vous exploitez déjà un cluster GPU, les poids ouverts veulent dire faire tourner un modèle de classe frontière sans qu'aucune donnée ne quitte votre réseau et sans facture au jeton, ce qui pour des charges réglementées constitue tout l'argument. Si ce n'est pas votre cas, les poids sont une lecture intéressante et vous passerez par l'API ou un point d'accès hébergé comme tout le monde. Together AI et Modal proposaient de l'hébergement dès le jour zéro.

Les scores

La fiche de Moonshot annonce 93,5 sur GPQA Diamond pour le raisonnement, 67,5 sur DeepSWE pour le code et 91,2 sur BrowseComp pour la navigation agentique. Les chiffres tiers vont dans le même sens : 88,3 sur Terminal-Bench 2.1, première place parmi les modèles à poids ouverts sur l'indice d'intelligence d'Artificial Analysis avec 57, et la tête d'Arena WebDev pour le code front end, devant plusieurs systèmes fermés de classe frontière.

La formulation choisie par Moonshot pour son travail d'architecture est l'affirmation la plus intéressante. Plutôt que de mettre en avant le nombre de paramètres, l'entreprise parle d'environ 2,5 fois plus d'intelligence par unité de calcul comparé à Kimi K2. Les tests indépendants sont plus mesurés, Fireworks AI évoquant une spécialisation plutôt qu'une domination générale face aux systèmes frontière. Les deux lectures peuvent être vraies, et la réponse raisonnable est la même dans les deux cas : passez votre propre jeu d'évaluation.

Lire la licence correctement

Les poids ne sont pas sous MIT simple, quoi qu'en laisse entendre le raccourci de certaines reprises. Moonshot les livre sous un document qu'elle nomme licence Kimi K3. Le fond ressemble à MIT, libre pour un usage commercial avec attribution, plus une clause de seuil : une activité de modèle en tant que service au dessus d'environ 20 millions de dollars de revenu annuel, ou servant une base d'utilisateurs mensuels très large, doit passer un accord séparé avec Moonshot. Artificial Analysis l'a classée usage commercial restreint sur cette base.

Pour la plupart des lecteurs de ce site, cette clause reste théorique. Si vous déployez le modèle dans une entreprise pour servir vos propres produits, vos propres équipes ou vos propres clients au sein d'un produit plus large, rien ne vous contraint. Si votre projet est de vendre de l'inférence sur Kimi K3 comme produit, c'est exactement le cas que la clause vise, et le texte doit passer devant un juriste avant de finir dans une page tarifaire.

Ce qu'il faut en retenir

Les trois publications d'infrastructure sont la partie la plus transposable de cette annonce, et celle qui a reçu le moins d'attention. Des noyaux d'attention pour un schéma linéaire hybride, une bibliothèque de communication pour le routage MoE et un harnais pour faire tourner des environnements d'agents à l'échelle sont autant de problèmes que les équipes servant de gros modèles creux résolvent mal et en privé. Disposer d'une implémentation de référence venue d'un laboratoire qui en exploite un de cette taille est utile, que vous chargiez le point de contrôle ou non.

Pour le modèle lui même, traitez le comme une option sérieuse à évaluer plutôt que comme une migration à planifier. Pointez un point d'accès hébergé sur votre propre jeu d'évaluation cette semaine. La question intéressante n'est pas de savoir si Kimi K3 est bon, le champ des mesures y a répondu, mais s'il est bon sur la tâche précise dont vous avez besoin, à un prix et une latence tenables.

Sources et pour aller plus loin

Questions fréquentes

Que puis je faire tourner chez moi ?

Rien, si on répond honnêtement à la question. Les poids occupent environ 1,4 téraoctet au format MXFP4 dans lequel Moonshot les a entraînés, et à peu près 5,6 téraoctets si on les déplie en 16 bits. Même le chiffre compressé réclame dix huit accélérateurs de 80 gigaoctets juste pour héberger les paramètres avant la moindre requête, et un déploiement qui sert du trafic réel avec de la place pour le cache clé valeur en contexte long se rapproche de soixante quatre accélérateurs sur huit noeuds. Les poids ouverts comptent pour une autre raison que l'inférence locale : ils permettent à une organisation qui possède déjà un cluster de faire tourner ce modèle sur son propre matériel, dans son propre réseau, sans qu'aucune requête ne sorte des murs.

La licence est elle vraiment ouverte ?

Elle est permissive pour presque tout le monde et conditionnelle pour quelques uns. Moonshot livre les poids sous ce qu'elle appelle la licence Kimi K3, proche de MIT dans l'esprit, avec une obligation d'attribution et une clause qui se déclenche à l'échelle : une activité de modèle en tant que service au dessus d'environ 20 millions de dollars de chiffre d'affaires, ou avec une base d'utilisateurs mensuels très large, doit passer un accord séparé avec Moonshot. Artificial Analysis l'a étiquetée usage commercial restreint pour cette raison précise. Si vous êtes une entreprise qui fait tourner le modèle pour ses propres produits ou son travail interne, ces conditions ne vous concernent quasiment jamais. Si votre projet est de revendre de l'inférence dessus comme métier, lisez le texte avant de bâtir une grille tarifaire par dessus.

Comment 2800 milliards de paramètres se concilient avec 104 milliards actifs ?

Ce sont deux comptages différents et les deux sont exacts. Le modèle contient 896 experts, et le routeur en choisit 16 par jeton, donc les paramètres qui participent à une passe avant donnée totalisent environ 104 milliards sur les 2800 milliards stockés. Le coût en mémoire suit le grand nombre, parce que chaque expert doit être présent et accessible. Le coût en calcul par jeton suit le petit. Cet écart est toute la raison d'être d'un mélange d'experts creux, et c'est pourquoi un modèle de cette taille peut être servi à un prix par jeton qui rivalise avec des modèles denses bien plus petits.

Qu'a publié Moonshot en dehors des poids ?

Trois choses sans doute plus réutilisables que le point de contrôle lui même. Les noyaux d'attention écrits pour Kimi Delta Attention, son schéma d'attention linéaire hybride, auquel l'entreprise attribue un décodage jusqu'à 6,3 fois plus rapide à un million de jetons de contexte. Une bibliothèque de communication pour le routage entre experts, c'est à dire la partie du service MoE qui finit d'habitude en plomberie maison. Et de l'infrastructure pour faire tourner des environnements d'agents à l'échelle, autrement dit le harnais utilisé pour entraîner et évaluer l'usage d'outils. Une équipe qui construit sur n'importe quel gros modèle MoE peut reprendre ces morceaux sans jamais toucher à Kimi K3.

Faut il changer de modèle en production ?

Probablement pas cette semaine, et la raison est opérationnelle plutôt que liée à la qualité. Les évaluations tierces placent Kimi K3 au sommet ou tout près du sommet du champ des poids ouverts, premier des modèles ouverts sur l'indice d'intelligence d'Artificial Analysis et en tête d'Arena WebDev, avec de solides résultats en code. Le tarif public de l'API, 3 dollars par million de jetons d'entrée et 15 dollars par million en sortie, est compétitif. Ce qui n'a pas encore eu lieu, c'est la partie ennuyeuse : des semaines de trafic de production, des mesures de latence sous charge, et les comportements de reprise et de refus qui n'apparaissent qu'au volume. Passez le modèle sur votre propre jeu d'évaluation via un point d'accès hébergé d'abord. Together AI et Modal proposaient tous les deux de l'hébergement le jour de la sortie, donc l'essai coûte une après midi et pas un cycle d'achat.

Advertisement