DevNews

Qwen3.8-Max : 2 400 milliards de paramètres, poids ouverts

Sur cette page
  1. Ce qui a réellement été livré
  2. Les tests se coupent nettement en deux
  3. Les poids ouverts sont la partie qui change quelque chose
  4. Ce que nous en ferions
  5. Sources et pour aller plus loin

Alibaba a lancé Qwen3.8-Max le 3 août, et le chiffre qui compte le plus n'est pas les 2 400 milliards de paramètres. C'est la promesse de poids ouverts la semaine suivante, ce qui ferait du premier modèle de la gamme Max une publication publique plutôt qu'un service enfermé derrière une API. Le modèle est un mélange d'experts creux doté d'une fenêtre de contexte d'un million de jetons, facturé deux dollars le million de jetons en entrée. Sur les tests, il alterne avec la frontière plutôt qu'il ne la dépasse : devant sur PaperBench à 93,0, nettement derrière sur le code agentique, où SWE-bench Pro le place à 67,7 contre 80,0 pour Claude Fable 5.

The short answer

Alibaba a lancé Qwen3.8-Max le 3 août via Alibaba Cloud Model Studio et l'API DashScope. C'est un mélange d'experts creux de 2 400 milliards de paramètres au total, avec une fenêtre de contexte d'un million de jetons et une entrée multimodale couvrant texte, images et vidéo. Alibaba annonce la publication des poids de Qwen3.8-Max et d'un Qwen3.8-27B la semaine suivant le lancement, ce qui serait la première sortie publique d'un modèle de la gamme Max. Les résultats sont partagés : 93,0 sur PaperBench et 92,6 sur GPQA Diamond le placent à la frontière, tandis que 67,7 sur SWE-bench Pro contre 80,0 pour Claude Fable 5 laisse un écart net sur le code agentique.

2400 Mdparamètres au total, environ sept fois Qwen3.5 sorti en février
2 $ / 6 $par million de jetons en entrée et en sortie sur l'API hébergée
1 Mjetons de contexte, 991 000 en entrée maximale, 131 000 en sortie
Carte réponse : Alibaba a publié Qwen3.8-Max le 3 août 2026 avec 2 400 milliards de paramètres au total, une fenêtre de contexte d'un million de jetons, un tarif de deux dollars le million de jetons en entrée et six dollars en sortie, et des poids ouverts promis la semaine suivante avec un modèle Qwen3.8-27B.
Ce qu'Alibaba a livré le 3 août. Source : documentation Alibaba Cloud Model Studio et couverture du lancement. PNG

Toutes les quelques semaines, un laboratoire chinois publie un tableau de résultats et la même discussion recommence sur la fermeture ou non de l'écart avec la frontière. Le tableau de Qwen3.8-Max est plus intéressant que la moyenne, non parce qu'il gagne, mais à cause des endroits où il gagne et de ceux où il perd.

Ce qui a réellement été livré

Qwen3.8-Max est arrivé le 3 août sur Alibaba Cloud Model Studio, avec une API présentée comme compatible à la fois avec les conventions DashScope et OpenAI. C'est un mélange d'experts creux totalisant 2 400 milliards de paramètres, soit environ sept fois le Qwen3.5 publié en février. SiliconANGLE rapporte qu'environ 95 milliards de paramètres s'activent par requête, un chiffre qu'Alibaba n'a pas publié directement : à prendre comme une information de presse, pas comme une donnée confirmée.

La fenêtre de contexte est d'un million de jetons, avec une entrée maximale de 991 000 jetons qui tombe à 983 000 lorsque le raisonnement est activé, et une sortie maximale de 131 000 jetons. S'y ajoute un budget de raisonnement distinct pouvant atteindre 262 000 jetons. L'entrée accepte texte, images ou vidéo. La sortie reste du texte.

Le tarif est de deux dollars le million de jetons en entrée et six dollars le million en sortie. Ce sont les lectures de cache qui méritent l'attention : vingt-cinq cents le million pour une lecture implicite, dix-sept cents pour une lecture explicite, contre deux dollars cinquante pour créer une entrée de cache explicite. Les limites publiées sont de deux millions de jetons par minute et quinze mille requêtes par minute.

L'annonce du lancement sur le compte officiel d'Alibaba Group.

Les tests se coupent nettement en deux

Lisez le tableau en deux moitiés et il raconte une histoire cohérente plutôt qu'un argumentaire.

Sur le raisonnement et les connaissances, le modèle rivalise avec tout ce qui existe aujourd'hui. PaperBench, qui mesure la capacité à reproduire les résultats d'un article de recherche à partir du seul article, lui donne 93,0 contre 90,5 pour GPT-5.6 Sol, 88,8 pour Claude Fable 5 et 80,3 pour Claude Opus 4.8. GPQA Diamond ressort à 92,6. Sur Frontend Code Arena, qui note le développement d'interfaces, il atteint 1 668 points, soit 37 points derrière la configuration la plus avancée de Claude Opus 5.

Regardez ensuite l'ingénierie logicielle agentique. SWE-bench Pro place Qwen3.8-Max à 67,7 là où Claude Fable 5 est à 80,0. FrontierSWE donne 73,5 contre 88,8. Terminal-Bench 2.1 est le plus serré des trois à 86,6, juste derrière les 88,8 de GPT-5.6 Sol et légèrement devant Claude Opus 4.8 à 84,6. OSWorld-Verified, qui mesure l'usage de l'ordinateur, atterrit à 86,1.

Graphique comparatif des résultats publiés : Qwen3.8-Max atteint 93,0 sur PaperBench contre 88,8 pour Claude Fable 5, mais seulement 67,7 sur SWE-bench Pro contre 80,0 pour Fable 5, et 73,5 sur FrontierSWE contre 88,8.
Les résultats publiés lorsqu'une comparaison directe existe. Sources : tableau publié par Alibaba, repris par MarkTechPost et SiliconANGLE. PNG

Le motif est assez régulier pour être crédible. Le raisonnement en un coup, la reproduction de travaux de recherche et les questions de connaissances sont solides. Les tâches à long horizon, où un modèle doit maintenir un plan vivant sur des dizaines d'appels d'outils et se rattraper après ses propres erreurs, sont un cran en dessous. Alibaba cite bien un projet de code autonome sur seize jours et une optimisation de conception de puce dépassant cinq cents étapes, mais ce sont des démonstrations et non des comparaisons notées, et ce sont les comparaisons notées qui disent l'inverse.

Les poids ouverts sont la partie qui change quelque chose

L'API hébergée est un produit concurrentiel et sera jugée comme tel. Les poids sont un événement d'une autre nature.

Chaque Qwen-Max précédent est resté derrière l'API pendant que les modèles Qwen plus petits sortaient sous licence ouverte. Alibaba annonce que cela change la semaine suivant le lancement, pour le Max à 2 400 milliards de paramètres comme pour un Qwen3.8-27B conçu pour le déploiement sur site. Si cela tient, un modèle de la gamme Max devient quelque chose que vous pouvez poser sur votre propre matériel, sous réserve de ce que dit la licence.

Pour la plupart des lecteurs, c'est le 27B qui est utile. Deux mille quatre cents milliards de paramètres, même activés de façon creuse, imposent de garder tous les experts en mémoire, et Alibaba renvoie vers une infrastructure de centre de données multi-nœuds. C'est une grappe de machines, pas une station de travail. Le 27B est présenté comme le modèle à faire tourner sur vos propres GPU, et Alibaba en a bien moins dit sur ses résultats, ce qui est dommage car pour qui a une contrainte d'auto-hébergement, c'est le chiffre qui compte.

Nous séparerions aussi deux choses que la couverture de ce genre d'annonce mélange volontiers. Des poids ouverts signifient que vous recevez les paramètres et une licence. Cela ne veut pas dire open source, et cela ne vous donne ni les données d'entraînement, ni le code d'entraînement, ni le droit de faire n'importe quoi du résultat. Tant que les fichiers et le texte de la licence ne sont pas publiés, cela reste un engagement plutôt qu'une sortie.

Ce que nous en ferions

Si vous exploitez de l'inférence en production et que le coût est votre contrainte, les tarifs de cache méritent un vrai examen. Une charge qui réutilise un grand préfixe fixe sur de nombreuses requêtes, ce que la fenêtre d'un million de jetons encourage activement, paie dix-sept à vingt-cinq cents le million sur la partie mise en cache au lieu de deux dollars. C'est une économie structurelle et non marginale, et elle récompense une organisation du prompt pensée autour de la frontière de cache.

Si vous choisissez un modèle pour un agent de codage, les chiffres publiés ne justifient pas de changer. Douze points d'écart sur SWE-bench Pro et quinze sur FrontierSWE, c'est la différence entre un agent qui termine une tâche et un agent qu'il faut aller repêcher.

Et si vous avez une contrainte d'auto-hébergement, qu'il s'agisse de résidence des données, de déploiement isolé du réseau ou simplement du refus de dépendre de l'API d'un tiers, notez la semaine et allez lire la licence quand elle sortira. C'est là que cette annonce vous concernera, ou pas.

Sources et pour aller plus loin

Questions fréquentes

Qwen3.8-Max est-il vraiment open source ?

Pas encore, et le mot à surveiller est « poids » plutôt que « source ». Le jour du lancement, le modèle n'était accessible que via Alibaba Cloud Model Studio et l'API DashScope. Alibaba a annoncé la publication des poids de Qwen3.8-Max et du plus petit Qwen3.8-27B pour la semaine suivante. Si cela se confirme, c'est la première fois qu'un modèle de la gamme Max sort publiquement au lieu de rester derrière l'API, et c'est la partie de cette annonce qui a de vraies conséquences pour qui doit faire tourner un modèle sur son propre matériel. Des poids ouverts ne sont pas non plus de l'open source : vous recevez les paramètres et une licence, pas les données ni le code d'entraînement, et ce sont les termes de la licence qui décident de ce que vous avez le droit d'en faire. Tant que les fichiers ne sont pas publiés et la licence lisible, considérez qu'il s'agit d'une annonce.

Puis-je réellement l'héberger moi-même ?

Le modèle à 2 400 milliards de paramètres, non, pas sur quoi que ce soit que vous possédiez. Alibaba renvoie lui-même vers une infrastructure de centre de données multi-nœuds, et un mélange d'experts creux doit tout de même garder tous ses experts en mémoire même s'il n'en active qu'une fraction par jeton. Le modèle 27B est celui qui vise votre baie. Cette taille tient sur une seule machine dotée d'assez de mémoire GPU, tourne avec les piles locales habituelles, et il est explicitement présenté comme l'option sur site. Si votre intérêt pour ce lancement est pratique plutôt que sportif, le 27B est le modèle à surveiller, et ses résultats, qu'Alibaba n'a pas détaillés, comptent bien davantage pour vous que tout ce que le Max a obtenu.

Que vaut-il face à la frontière sur du vrai travail ?

Tout dépend du test retenu, et c'est justement le constat utile. Sur PaperBench, qui vérifie si un modèle sait reproduire les résultats d'un article de recherche, il obtient 93,0 contre 90,5 pour GPT-5.6 Sol et 88,8 pour Claude Fable 5. Sur GPQA Diamond, il atteint 92,6. Puis on regarde le travail logiciel agentique et l'image s'inverse : SWE-bench Pro le place à 67,7 là où Fable 5 est à 80,0, et FrontierSWE à 73,5 contre 88,8. Terminal-Bench 2.1 se situe entre les deux à 86,6, juste derrière GPT-5.6 Sol à 88,8 et légèrement devant Claude Opus 4.8 à 84,6. Lu dans son ensemble, c'est un modèle réellement de niveau frontière en raisonnement et en connaissances, et un cran en dessous sur les agents de codage à long horizon.

Combien coûte-t-il face aux alternatives ?

Deux dollars le million de jetons en entrée et six dollars le million en sortie, ce qui est l'extrémité agressive du marché pour un modèle qui revendique ces scores. C'est la mise en cache qui rend la grille intéressante : une lecture de cache implicite coûte vingt-cinq cents le million de jetons, une lecture de cache explicite dix-sept cents, soit huit à douze fois moins cher que de l'entrée fraîche. Si votre charge répète une grande instruction système ou un corpus documentaire fixe sur de nombreux appels, ce qu'une fenêtre d'un million de jetons rend tout à fait plausible, la tarification du cache pèse plus sur votre facture que le tarif affiché. Les limites publiées sont de deux millions de jetons par minute et quinze mille requêtes par minute.

Que vaut la fenêtre de contexte en pratique ?

Un million de jetons nominalement, avec des détails qui méritent lecture. L'entrée maximale est de 991 000 jetons, ramenée à 983 000 lorsque le raisonnement est activé, et la sortie maximale est de 131 000 jetons par réponse. Le budget de raisonnement monte jusqu'à 262 000 jetons, une enveloppe distincte de la sortie visible. Alibaba présente cette fenêtre comme plus de 200 pages de texte ou une centaine d'heures de vidéo par requête, le modèle acceptant texte, images et vidéo en entrée et ne produisant que du texte. La presse attribue cette gestion du contexte long à une attention hybride dont le coût croît linéairement plutôt que quadratiquement avec la longueur du prompt, mécanisme qu'Alibaba n'a pas confirmé.