DevNews

Qwen3.8-27B sort en poids ouverts sous Apache 2.0

Sur cette page
  1. Ce qui est sorti
  2. Les chiffres, et leur provenance
  3. Le mettre en service
  4. Ce que nous ferions cette semaine
  5. Sources et pour aller plus loin

Alibaba a publié Qwen3.8-27B le 14 août 2026, avec les poids disponibles sur Hugging Face et ModelScope sous licence Apache 2.0. C'est le petit compagnon promis lors de la sortie de Qwen3.8-Max le 3 août, et c'est un modèle dense et non un mélange d'experts, donc celui que vous pouvez réellement héberger vous-même. Il traite nativement le texte, les images et la vidéo, embarque 262 144 jetons de contexte et monte à un million avec YaRN. Alibaba annonce qu'il dépasse son propre Qwen3.7-Plus sur le code et le travail de bureau. Pour qui fait tourner des modèles sur sa propre machine, c'est la sortie de la semaine.

The short answer

Alibaba a sorti Qwen3.8-27B le 14 août 2026 sur Hugging Face et ModelScope sous licence Apache 2.0, en même temps que les poids ouverts du Qwen3.8-2.4T-A95B de 2 400 milliards de paramètres. Le 27B est un modèle dense, nativement multimodal, qui traite texte, images et vidéo, avec 262 144 jetons de contexte natif. Alibaba le donne devant son propre Qwen3.7-Plus sur le code et le travail de bureau, et devant Muse Glimmer-30B de Meta sur Terminal Bench 2.1, à 73,0 contre 51,7. Des recettes officielles existent pour SGLang, vLLM et TokenSpeed, plus un point de contrôle FP8.

27Bparamètres denses, tous actifs sur chaque jeton
262 144jetons de contexte natif, 1 M avec YaRN
Apache 2.0sans seuil d utilisateurs ni clause de domaine
Carte réponse décrivant la sortie de Qwen3.8-27B le 14 août 2026, un modèle dense multimodal de 27 milliards de paramètres publié sous Apache 2.0 avec 262 144 jetons de contexte natif, extensible à un million avec YaRN.
La sortie en une carte. Sources : l'annonce de l'équipe Qwen du 14 août 2026 et la fiche du modèle sur Hugging Face. PNG

Il y a douze jours, Alibaba sortait un modèle amiral de 2 400 milliards de paramètres et promettait un petit compagnon. Le compagnon est là, et pour la plupart d'entre nous c'est la moitié la plus intéressante du duo.

Ce qui est sorti

Le 14 août 2026, l'équipe Qwen a publié Qwen3.8-27B sur Hugging Face et ModelScope sous licence Apache 2.0, en même temps que les poids ouverts de Qwen3.8-2.4T-A95B, le mélange d'experts de gamme Max que nous avions couvert à sa sortie le 3 août.

Le 27B est un modèle de langage causal dense avec encodeur visuel intégré : texte, images et vidéo passent par le même point de contrôle. La fiche annonce 64 couches et une dimension cachée de 5 120, avec des blocs alternant Gated DeltaNet et Gated Attention, entraînés en prédiction multi-jetons. Le contexte natif est de 262 144 jetons, et la mise à l'échelle RoPE avec YaRN le porte à environ un million.

L'annonce de l'équipe Qwen elle-même, le 14 août 2026.

C'est le mot dense qui fait tout le travail. Un mélange d'experts à 2 400 milliards de paramètres est un objet fascinant et un problème d'hébergement. Un modèle dense de 27B est quelque chose que vous posez sur une machine que vous possédez déjà.

Les chiffres, et leur provenance

Tous les chiffres ci-dessous sont des évaluations publiées par Alibaba, relayées par des tiers mais non rejouées. Lisez-les comme une affirmation, pas comme une mesure.

Face à Muse Glimmer-30B de Meta, le rival de gamme visiblement choisi par Alibaba, l'écart annoncé est le plus large sur le travail agentique en terminal : Terminal Bench 2.1 à 73,0 contre 51,7. GPQA Diamond ressort à 89,2 contre 83,5 et IFBench à 79,5 contre 77,0.

Graphique comparant les scores annoncés par Alibaba pour Qwen3.8-27B face à Muse Glimmer-30B de Meta : Terminal Bench 2.1 à 73,0 contre 51,7, GPQA Diamond à 89,2 contre 83,5 et IFBench à 79,5 contre 77,0.
Les scores annoncés par Alibaba pour Qwen3.8-27B face à Muse Glimmer-30B. Chiffres du fournisseur, pas de test indépendant. PNG

La comparaison dont Alibaba semble le plus fier est interne. Face à Qwen3.7-Plus, un modèle plus gros de sa génération précédente, le 27B annonce SWE-bench Pro à 61,7 contre 57,6 et QwenSWEBench à 79,0 contre 59,2. Agents' Last Exam en pass@1 passe de 13,2 à 20,4. Un modèle plus petit qui dépasse le précédent plus gros, c'est le motif qui définit cette année, et c'est la raison pour laquelle une sortie en 27B mérite qu'on s'y arrête.

Le mettre en service

Des recettes de déploiement officielles existent pour SGLang, vLLM et TokenSpeed, ce qui couvre la plupart des infrastructures réellement utilisées. Alibaba publie aussi Qwen3.8-27B-FP8, un point de contrôle quantifié qui divise par deux la mémoire des poids bf16 sans conversion de votre côté.

En dessous, la communauté a été rapide : des centaines de conversions quantifiées sont déjà sur Hugging Face pour llama.cpp, LM Studio, Jan et Ollama. Alibaba ne publie pas de tableau de VRAM, donc quiconque vous donne un chiffre précis fait une estimation. La bonne approche reste empirique : prenez la quantification la plus large que votre carte accepte, faites tourner votre propre jeu d'évaluation, et ne descendez d'un cran que si cela tient.

Un réglage à connaître avant de câbler tout cela : le modèle expose un paramètre reasoning_effort, donc la profondeur de raisonnement s'ajuste par requête au lieu d'être figée au déploiement. Si vous avez déjà payé une longue chaîne de raisonnement pour une question qui appelait une réponse en une ligne, c'est le bouton à instrumenter en premier.

Ce que nous ferions cette semaine

Le télécharger et rejouer votre propre jeu d'évaluation, parce que la licence rend l'opération peu coûteuse et que les chiffres publiés la rendent nécessaire. Si vous servez déjà un modèle de gamme 30B, c'est un A contre B direct sur votre trafic réel, sans discussion d'achat associée.

Si vous faites tourner un modèle texte à côté d'un pipeline documentaire ou visuel séparé, testez si un point d'entrée en remplace deux. Cette consolidation vaut plus, en exploitation, que quelques points de benchmark.

Enfin, vérifiez l'économie du contexte avant d'activer le mode à un million de jetons. Les 262 144 jetons natifs sont généreux, l'extension YaRN est un compromis de qualité et non une mise à niveau gratuite, et la plupart des usages qui réclament un million de jetons veulent en réalité de la recherche documentaire.

Sources et pour aller plus loin

Questions fréquentes

Qu est-ce que Qwen3.8-27B exactement ?

C'est un modèle de langage causal dense de 27 milliards de paramètres, doté d'un encodeur visuel intégré, publié par l'équipe Qwen d'Alibaba le 14 août 2026 sous licence Apache 2.0. Le mot dense compte : contrairement au Qwen3.8-2.4T-A95B de 2 400 milliards de paramètres sorti en même temps, chaque paramètre est actif sur chaque jeton, donc l'empreinte mémoire est prévisible et une seule machine peut le contenir. La fiche du modèle décrit 64 couches et une dimension cachée de 5 120, avec des blocs alternant Gated DeltaNet et Gated Attention, entraînés en prédiction multi-jetons. Le contexte natif est de 262 144 jetons, extensible à environ un million avec des méthodes comme YaRN.

Qu apporte Apache 2.0 par rapport aux autres licences de poids ouverts ?

Apache 2.0 est une licence permissive avec une concession de brevets explicite, sans restriction de domaine d'usage, sans seuil d'utilisateurs actifs et sans annexe d'usage acceptable greffée par-dessus. Vous pouvez l'exploiter commercialement, l'affiner, redistribuer le dérivé et l'intégrer dans un produit sans demander l'autorisation à personne. Plusieurs sorties de poids ouverts très utilisées portent une licence maison qui paraît permissive jusqu'à la clause sur les utilisateurs actifs mensuels ou celle qui réserve certains déploiements. Celle-ci n'a pas ces clauses, et c'est la différence entre un modèle que votre service juridique valide en un après-midi et un modèle qui reste un mois en revue.

Quel matériel faut-il pour le faire tourner ?

Alibaba ne publie pas de tableau de VRAM, donc tout chiffre unique est une estimation et non une spécification. Ce que l'écosystème indique, en revanche, c'est la forme des options. Des recettes officielles existent pour SGLang, vLLM et TokenSpeed, un point de contrôle FP8 est publié sous le nom Qwen3.8-27B-FP8, et la communauté a déjà produit des centaines de conversions quantifiées qui se chargent dans llama.cpp, LM Studio, Jan et Ollama. Un modèle dense de 27B en FP8 tient sur un seul accélérateur à grande mémoire, et une quantification plus agressive le ramène à du matériel d'enthousiaste, au prix d'une perte de qualité. Le conseil honnête reste de tester votre quantification sur vos propres requêtes avant de vous engager.

Les chiffres de performance sont-ils indépendants ?

Non, et cela compte. Tous les chiffres de cet article proviennent des évaluations publiées par Alibaba, relayées par des médias tiers mais non rejouées par eux. Alibaba annonce Terminal Bench 2.1 à 73,0 contre 51,7 pour Muse Glimmer-30B de Meta, GPQA Diamond à 89,2 contre 83,5 et IFBench à 79,5 contre 77,0. Face à son propre Qwen3.7-Plus, plus gros, il annonce SWE-bench Pro à 61,7 contre 57,6 et QwenSWEBench à 79,0 contre 59,2. Des chiffres auto-déclarés donnent une direction utile et sont régulièrement optimistes. L'avantage d'une sortie sous Apache 2.0, c'est que vous pouvez télécharger et vérifier, ce que nous ferions avant de croire quoi que ce soit.

L encodeur visuel coûte-t-il quelque chose si nous ne faisons que du texte ?

Il coûte de la mémoire, puisqu'il est livré dans le même point de contrôle et chargé avec lui, et il ne coûte rien en débit sur des requêtes purement textuelles, le chemin visuel n'étant simplement pas sollicité. La vraie question est ailleurs : un modèle nativement multimodal signifie un déploiement au lieu de deux. Les équipes qui font tourner un modèle texte à côté d'un pipeline distinct pour les documents ou les captures d'écran peuvent réduire cela à un seul point d'entrée capable de lire des schémas, des documents numérisés et des images de vidéo. Reste à vérifier empiriquement la qualité sur vos types de documents, mais l'architecture supprime l'excuse des deux piles.