Le Financial Times a rapporté le 7 août que ByteDance pré-entraîne un modèle comptant jusqu'à 10 000 milliards de paramètres, en citant trois personnes au fait du projet. Ce serait plus de trois fois la taille du Kimi K3 de Moonshot, aujourd'hui parmi les plus gros modèles chinois avec environ 2 800 milliards. Le chiffre est frappant et assez faible en information, car le nombre de paramètres prédit très peu de ce qu'un modèle sait faire. L'entraînement est à ses débuts, ByteDance n'a rien confirmé, et aucun calendrier de sortie n'existe. Nous avons regardé ce que vaut ce nombre.
The short answer
Le Financial Times a rapporté le 7 août que ByteDance pré-entraîne un modèle allant jusqu'à 10 000 milliards de paramètres, en citant trois personnes au fait du projet. C'est plus de trois fois le Kimi K3 de Moonshot, à environ 2 800 milliards. Les estimations du secteur situent Mythos 5 d'Anthropic près de 8 000 milliards et Fable 5 près de 5 000 milliards. L'entraînement débute, un pré-entraînement de cette taille prend d'ordinaire trois à six mois, et le post-entraînement suivra. ByteDance n'a ni confirmé le modèle ni annoncé de date. Aucun nombre de paramètres actifs, budget de calcul ou résultat d'évaluation n'a été rapporté.
Tous les quelques mois, un nombre de paramètres arrive et se retrouve traité comme un tableau des scores. Celui-ci est réellement grand, et il mérite les deux moitiés d'une lecture honnête : c'est un vrai signal sur l'endroit où le calcul est engagé, et c'est presque inutile pour prédire la qualité du modèle qui en sortira.
Ce qui a été rapporté
Le Financial Times a indiqué le 7 août que ByteDance pré-entraîne un modèle comptant jusqu'à 10 000 milliards de paramètres, en citant trois personnes au fait du travail. Pour l'échelle, le Kimi K3 de Moonshot se situe autour de 2 800 milliards et figure parmi les plus gros modèles chinois en circulation, le chiffre rapporté représente donc plus de trois fois cela. Les estimations du secteur placent Mythos 5 d'Anthropic près de 8 000 milliards, et son cousin plus largement disponible Fable 5 près de 5 000 milliards, et il faut être explicite : ce sont des estimations, pas des chiffres publiés.
ByteDance n'a pas identifié publiquement le modèle et n'a pas annoncé s'il sortirait ni quand. Les travaux d'IA de l'entreprise passent par l'assistant Doubao, déjà très utilisé en Chine, et par l'équipe Seed.
Un détail se tient un peu à part : le fondateur Zhang Yiming aurait demandé à ses équipes de ne pas s'appuyer sur la distillation, la pratique consistant à entraîner un modèle plus petit sur les sorties d'un modèle plus fort. C'est une déclaration de stratégie plutôt que de technique, et une stratégie assez coûteuse.
Pourquoi le chiffre en dit moins qu'il n'en a l'air
Trois nombres rendraient les 10 000 milliards signifiants, et aucun n'a été rapporté.
Le premier est le nombre de paramètres actifs. Presque tous les modèles de cette taille sont des mélanges d'experts, ce qui veut dire qu'un sous-ensemble seulement des poids participe à la production d'un jeton donné. Un modèle à 10 000 milliards de paramètres peut n'en activer que quelques centaines de milliards par passe, et ce nombre actif gouverne le coût de service et, en grande partie, la capacité. Le total décrit la garde-robe. L'actif décrit ce qui est porté.
Le deuxième est le budget de calcul d'entraînement. Un très gros modèle nourri de trop peu de jetons est sous-entraîné, et il perdra contre un modèle plus petit mieux alimenté. La mise à l'échelle ne paie que si les données et le calcul montent avec elle, contrainte qui a déjà embarrassé plus d'un projet ambitieux.
Le troisième est la qualité et le mélange des données, l'ingrédient le moins visible et l'un des plus décisifs. C'est aussi celui que personne ne divulgue.
Sans ces trois éléments, ni aucun résultat d'évaluation, 10 000 milliards reste un fait sur la place occupée par les poids.
Ce qui porte réellement de l'information
L'implication matérielle est concrète. Moonshot aurait entraîné Kimi K3 sur environ 20 000 puces NVIDIA à quelque 2 800 milliards de paramètres. Un entraînement à 10 000 milliards suppose une grappe sensiblement plus grande, ou une grappe comparable immobilisée bien plus longtemps, et dans les deux cas cela signifie que ByteDance dirige aujourd'hui du calcul à l'échelle de la pointe vers un seul projet.
C'est la phrase à retenir, car elle tient quel que soit le résultat du modèle. Les contraintes d'accès aux accélérateurs les plus récents n'ont pas empêché les entreprises chinoises d'assembler des grappes d'entraînement à cette échelle. Que cela reflète des stocks, du silicium domestique, de la capacité louée à l'étranger ou simplement une meilleure exploitation du matériel installé, l'information de presse ne le tranche pas, et toute certitude affichée relève de la supposition.
La consigne contre la distillation pointe dans la même direction. La distillation est la voie efficace : entraîner un petit modèle sur les sorties d'un plus fort et arriver vite à un résultat correct. Elle hérite aussi d'un plafond. Choisir de construire directement, à 10 000 milliards de paramètres, c'est décider de dépenser beaucoup plus contre la possibilité d'être devant plutôt que fiablement derrière.
Comment lire la prochaine annonce du genre
Il y aura un autre chiffre dans quelques semaines, et la même discipline s'appliquera. Demandez le nombre de paramètres actifs avant le total. Demandez le budget de jetons d'entraînement. Demandez des évaluations sur les tâches qui vous intéressent, réalisées par quelqu'un d'autre que le laboratoire. Si ces éléments manquent, vous tenez un signal d'achat de matériel plutôt qu'une affirmation de capacité, ce qui reste intéressant mais parle d'autre chose.
Pour qui construit au-dessus de ces modèles, la position pratique n'a pas changé cette semaine. Rien n'est sorti, aucun test n'existe, et ByteDance n'a pas confirmé le projet. À lire aussi sur l'évolution des chiffres divulgués : notre couverture de Qwen3.8-Max et ses 2 400 milliards de paramètres et de Fable 5 et Mythos 5 chez Anthropic.
Sources et pour aller plus loin
- ByteDance Is Training a 10 Trillion Parameter AI Model, Financial Times reports, MLQ News, 7 août 2026
- ByteDance is training a 10 trillion parameter model to chase the frontier, TNW, 7 août 2026
- ByteDance Is Training a 10 Trillion Parameter Model To Chase the Frontier, discussion Slashdot
- ByteDance trains 10 trillion parameter AI model, The News
- ByteDance Trains AI With Up to 10 Trillion Parameters, but Raw Counts Cannot Measure the Gap, XenoSpectrum
Questions fréquentes
Pourquoi le nombre de paramètres renseigne-t-il mal sur la qualité d'un modèle ?
Parce qu'il mesure une capacité de stockage, pas une compétence, et c'est dans l'écart entre les deux que se loge toute l'ingénierie. Trois nombres comptent au moins autant et aucun n'a été rapporté ici. Le premier est le nombre de paramètres actifs : la plupart des grands modèles actuels sont des mélanges d'experts, ce qui signifie qu'une fraction seulement des poids participe à chaque passe avant, si bien qu'un modèle à 10 000 milliards de paramètres peut n'en activer que quelques centaines de milliards par jeton, et coûter en conséquence. Le deuxième est le budget de calcul d'entraînement, car un très gros modèle entraîné sur trop peu de jetons est sous-entraîné et perdra face à un modèle plus petit mieux nourri. Le troisième est la qualité et le mélange des données, l'ingrédient le moins spectaculaire et régulièrement l'un des plus décisifs. Sans eux, 10 000 milliards est un fait sur une taille de fichier, pas une affirmation sur la performance.
Comment cela se compare-t-il à l'existant ?
En chiffre brut, ce serait de loin le plus grand nombre divulgué. Le Kimi K3 de Moonshot tourne autour de 2 800 milliards de paramètres et compte parmi les plus gros modèles chinois en circulation, donc 10 000 milliards représente plus de trois fois cela. Les estimations du secteur situent Mythos 5 d'Anthropic près de 8 000 milliards et son cousin plus largement disponible Fable 5 près de 5 000 milliards, mais ce sont des estimations et non des chiffres publiés, à lire comme telles. La comparaison qui vaut n'est pas le classement mais la trajectoire : le haut de la fourchette a environ triplé en deux ans, ce qui indique que le pari de la mise à l'échelle est toujours posé par ceux qui ont le calcul pour le poser, en Chine comme aux États-Unis.
Que signifie un pré-entraînement à ses débuts en matière de calendrier ?
Que rien ne sortira avant un moment. Pré-entraîner un modèle de cette taille demande généralement trois à six mois de calcul continu, et ce n'est que la première étape. Vient ensuite le travail de post-entraînement, les cycles d'ajustement, d'alignement et d'évaluation, qui pour un système de pointe constituent un projet en soi et non une finition. ByteDance n'a pas identifié publiquement le modèle, n'a annoncé aucun calendrier, et pourrait ne jamais le publier sous la forme entraînée aujourd'hui, car les grands entraînements sont abandonnés ou redémarrés plus souvent que le dossier public ne le laisse croire. Traitez l'information comme un signal sur l'orientation du calcul aujourd'hui, pas comme une annonce de produit datée.
Quel matériel demande un entraînement pareil ?
Davantage que le point de comparaison, qui est déjà considérable. Moonshot aurait utilisé environ 20 000 puces NVIDIA pour entraîner Kimi K3 à quelque 2 800 milliards de paramètres, donc un entraînement à 10 000 milliards implique une grappe nettement plus grande, ou une occupation nettement plus longue d'une grappe comparable. C'est la partie de l'histoire aux implications les plus concrètes, car elle dit que les entreprises chinoises assemblent encore des grappes à l'échelle de la pointe malgré les contraintes d'accès aux accélérateurs les plus récents. Que cela vienne de stocks constitués, de silicium domestique, de capacité louée hors du pays ou d'une meilleure utilisation de l'installé, l'article ne le tranche pas, et affirmer le contraire relève de la supposition.
Pourquoi la consigne d'éviter la distillation compte-t-elle ?
Parce qu'elle dit quelque chose de l'intention que le nombre de paramètres ne dit pas. La distillation entraîne un modèle plus petit sur les sorties d'un modèle plus fort, ce qui est une manière efficace d'atteindre vite un bon résultat et une manière structurellement limitante, puisque l'élève hérite d'un plafond du maître et le dépasse rarement là où cela compte. Le fondateur Zhang Yiming aurait demandé à ses équipes de ne pas s'y appuyer. Lue à côté d'un pré-entraînement à 10 000 milliards de paramètres, la consigne ressemble à une décision de construire directement des capacités de pointe plutôt que de les poursuivre à bas coût, engagement bien plus cher et bien plus lent. C'est aussi la seule voie pour finir devant plutôt que durablement un cran derrière, si bien que la stratégie est cohérente avant même qu'un résultat existe.