Meta Superintelligence Labs a publié Muse Glimmer le 10 août, un modèle dense de 30 milliards de paramètres livré en poids ouverts sous licence Apache 2.0. Son objet, c'est le travail d'agent en local : il est distillé du plus gros Muse Spark, entraîné pour l'appel d'outils et la reprise après échec, et ses versions quantifiées tiennent dans environ 17 Go de mémoire, ce qui met une carte grand public de 24 Go ou un Mac suffisamment doté en mémoire unifiée en position de le faire tourner sans aucun compte cloud. Il lit les images via un encodeur de perception séparé, gère un contexte de 131072 jetons par défaut avec un plafond documenté à 262144, et est arrivé avec un support immédiat dans llama.cpp, Ollama, LM Studio, vLLM et SGLang.
The short answer
Meta Superintelligence Labs a publié Muse Glimmer le 10 août, un modèle dense de 30 milliards de paramètres en poids ouverts sous Apache 2.0. Il est distillé du plus gros Muse Spark et entraîné pour ce que font réellement les agents locaux : appeler un outil, lire le résultat, et se rattraper quand l'appel échoue. Quantifié en 4 bits il demande environ 17 Go, ce qui le place sur un seul GPU grand public ou un Mac avec assez de mémoire unifiée. Il lit les images via un encodeur de perception séparé, couvre plus de 100 langues, et est arrivé avec un support immédiat dans llama.cpp, Ollama, LM Studio, vLLM et SGLang.
Le chiffre qui décide si la sortie d'un modèle vous concerne est rarement le nombre de paramètres. C'est la quantité de mémoire, parce que c'est elle qui vous dit si la chose tourne sur du matériel que vous possédez déjà.
Pour Muse Glimmer la réponse tient en une ligne : environ 17 Go en 4 bits. Une carte de 24 Go tient les poids avec de la marge pour le contexte, et un Mac de 32 Go y arrive par la mémoire unifiée. Meta a publié les poids le 10 août sous Apache 2.0, et c'est le second chiffre qui compte, parce que c'est la licence qui décide si vous pouvez livrer ce que vous construisez.
Ce que c'est, précisément
Trente milliards de paramètres, denses plutôt qu'un mélange d'experts, ce qui mérite d'être dit parce que les modèles denses de cette taille se comportent de façon prévisible sur une seule carte, là où les modèles épars n'y parviennent pas toujours.
Il a été distillé de Muse Spark, le modèle plus large présenté par Meta en avril, et l'entraînement s'est déroulé en trois étapes : distillation des logits contre le modèle enseignant, entraînement intermédiaire sur des contextes plus longs et des données agentiques, puis affinage supervisé combiné à de l'apprentissage par renforcement. La fenêtre de contexte est de 131072 jetons par défaut, avec un plafond documenté à 262144.
L'entrée multimodale passe par un encodeur de perception séparé plutôt que par une architecture fusionnée, le modèle alterne donc entre texte et images. En termes d'agent, cela veut dire qu'il peut regarder une capture d'écran, un graphique ou un document scanné dans le cadre d'une tâche, au lieu de recevoir une description textuelle. La couverture linguistique dépasse la centaine de langues.
La partie qui parle vraiment d'agents
Toutes les sorties de modèles depuis 2024 environ revendiquent l'usage d'outils. Le détail distinctif ici, c'est la reprise après échec.
Un agent local passe l'essentiel de sa vie dans une boucle : planifier une étape, appeler quelque chose, lire ce qui revient, décider de la suite. L'étape qui casse les modèles bon marché est celle où l'appel d'outil renvoie une erreur, un résultat vide, ou une sortie dont la forme n'était pas attendue. Un modèle incapable de le remarquer continuera comme si tout allait bien, et vous le découvrez trois étapes plus loin, quand l'exécution n'est plus rattrapable.
Meta a entraîné spécifiquement pour ce chemin, ainsi que pour les tâches longues et la logique de nouvelle tentative. Alexandr Wang, directeur IA de Meta, a décrit la cible comme la planification, les appels d'outils, la vérification des résultats et la reprise après échec, ce qui décrit le travail d'agent plus honnêtement que la plupart des textes de lancement.
Le lancer sans lire un article de recherche
La route la plus rapide est Ollama, qui a intégré le modèle en version 0.32.7, ou LM Studio si vous préférez une fenêtre à un terminal.
Si vous passez directement par llama.cpp, l'invocation qui fonctionne est llama-cli --model Muse-Glimmer-30B-UD-Q4_K_XL.gguf --mmproj mmproj-BF16.gguf --temp 1.0 --top-p 0.95 --top-k 64, où le fichier --mmproj est le projecteur multimodal, nécessaire uniquement si vous voulez l'entrée image.
Ces valeurs d'échantillonnage méritent une note, parce que ce sont les réglages par défaut de Meta et qu'elles sont plus hautes que celles que l'on emploie par habitude pour du code. Si votre réflexe est de mettre la température à 0.2 dès que c'est technique, résistez ici. Le modèle a été réglé à 1.0, et le brider peut dégrader le comportement agentique au lieu de le fiabiliser.
Côté service, vLLM et SGLang avaient tous deux le support dès le premier jour. LMSYS a rapporté environ 230 jetons par seconde sur une seule RTX 5090 avec des poids NVFP4 et le brouilleur DFlash activé, et a précisé que cela fonctionnait aussi tel quel sur RTX Pro 6000, DGX Spark et MLX sur Mac. Les chiffres de décodage spéculatif de Meta annoncent 3,1 fois plus vite sur une RTX 5090, 1,8 fois sur un M5 Max et 1,5 fois sur un M4 Max.
Pourquoi la licence est la vraie nouvelle
Apache 2.0 est un changement de posture, pas un détail.
Les modèles en poids ouverts précédents de Meta portaient une licence communautaire avec des clauses d'usage acceptable et un seuil au dessus duquel les gros déployeurs devaient demander l'autorisation. C'était assez de friction pour envoyer en revue juridique quiconque construisait un produit commercial, avant même de prototyper. Apache 2.0 supprime la revue : usage commercial, modification, redistribution et affinage sont tous accordés, et ce que vous devez en retour, c'est conserver intactes les mentions de licence et d'attribution.
Mark Zuckerberg a cadré la publication autour d'un écosystème d'IA open source mené par les États-Unis, en parallèle d'un long essai sur l'IA publié le même jour, et a annoncé que les poids ouverts de Muse Spark 1.2 suivraient dans les prochaines semaines. Lisez ce choix de licence en regard des modèles chinois sous licence permissive de l'année écoulée et la stratégie n'a rien de subtil.
Ce que nous ferions
Si vous faites déjà tourner un modèle local pour de l'automatisation, celui ci mérite d'être mesuré face à ce que vous avez plutôt que substitué à l'aveugle. Notre guide pour faire tourner Qwen 3.7 en local couvre le protocole de mesure, et la même méthode s'applique : lancez votre propre jeu de tâches, pas un classement.
Si vous partez de zéro sur un agent local, c'est un meilleur point de départ que la plupart, et la raison tient à l'entraînement à la reprise après échec plutôt qu'aux scores de référence. Notre tutoriel pour construire un agent IA local avec Ollama vous donne une boucle fonctionnelle, et Muse Glimmer s'y insère comme modèle.
Si vous êtes sur une carte de 16 Go, ne supposez pas que la version 3 bits ira. Testez la sur vos vraies invites avant de vous engager, parce qu'une dégradation de la fiabilité agentique est bien plus difficile à repérer qu'une dégradation de la qualité rédactionnelle, et qu'elle vous coûte bien plus cher quand elle survient.
Sources et pour aller plus loin
- Introducing Muse Glimmer, an open agentic model that runs on your device, Meta AI Research, 10 août 2026
- Meta publishes Muse Glimmer as 30B open agentic model, Phoronix, 10 août 2026
- Meta releases Muse Glimmer as an open local agent model, Techzine
- Muse Glimmer, how to run locally, documentation Unsloth
- Page du modèle Muse Glimmer, Meta for Developers
- Revue de presse Techmeme sur la sortie de Muse Glimmer, 10 août 2026
Questions fréquentes
De quel matériel ai-je réellement besoin pour faire tourner Muse Glimmer ?
Tout dépend de la quantification choisie, et l'écart est large. Les poids BF16 complets réclament environ 58 Go, ce qui les place hors du matériel grand public, du côté station de travail ou serveur. La version 4 bits que la plupart des gens utiliseront demande à peu près 17 Go : une carte de 24 Go comme une RTX 4090 ou 5090 la tient confortablement avec de la marge pour le contexte, et un Mac de 32 Go s'en sort par la mémoire unifiée. En descendant à 3 bits vous êtes entre 14 et 15 Go, et le 2 bits vous amène dans la plage 12 à 14 Go pour un coût en qualité que vous devriez mesurer plutôt que supposer. Attention, ces chiffres concernent les poids : les contextes longs ajoutent un cache KV par dessus, et à 131072 jetons ce n'est pas une erreur d'arrondi.
Qu'est-ce que la licence Apache 2.0 change par rapport aux licences que Meta utilisait avant ?
Elle supprime les conditions. Les précédentes publications de poids ouverts de Meta arrivaient avec une licence communautaire qui portait des clauses d'usage acceptable et, au dessus d'un seuil d'utilisateurs, une obligation de demander l'autorisation. Apache 2.0 n'a rien de tout cela. Vous pouvez utiliser les poids commercialement, les modifier, les redistribuer et les affiner dans un produit sans accord séparé, à condition de conserver les mentions de licence et d'attribution. Pour quiconque a déjà dû passer une revue juridique avant de mettre un modèle dans un produit livré, c'est la différence entre une conversation avec le service juridique et un simple téléchargement. Cela place aussi Muse Glimmer au même niveau que les modèles chinois sous licence permissive de l'année écoulée, ce qui fait manifestement partie du raisonnement.
Un modèle 30B suffit-il à piloter un vrai agent de code ?
Pour un agent au périmètre défini, souvent oui, et c'est le cadrage honnête plutôt qu'une prétention à remplacer un modèle de frontière. Muse Glimmer a été entraîné précisément pour la boucle que suivent les agents : planifier une étape, appeler un outil, lire le résultat, remarquer que l'appel a échoué, et tenter autre chose. C'est cette dernière partie qui met en échec les petits modèles, parce qu'un modèle incapable de reconnaître son propre appel d'outil raté continuera joyeusement. Là où il perdra encore face à un modèle de frontière, c'est sur le raisonnement à long horizon dans une grosse base de code inconnue. Notre lecture pratique : très bon candidat pour l'automatisation locale répétitive, le travail sur fichiers et journaux, et les tâches d'évaluation, moins bon pour de l'architecture ouverte.
Comment le lancer avec llama.cpp ?
Récupérez une version GGUF, puis pointez llama-cli sur le fichier de modèle et sur le projecteur multimodal si vous voulez l'entrée image. Une invocation qui fonctionne est `llama-cli --model Muse-Glimmer-30B-UD-Q4_K_XL.gguf --mmproj mmproj-BF16.gguf --temp 1.0 --top-p 0.95 --top-k 64`. Ces valeurs d'échantillonnage sont les réglages par défaut de Meta et non un choix de notre part, et elles comptent plus que d'habitude ici : le modèle a été réglé à une température de 1.0, donc la ramener au 0.2 que vous utilisez par réflexe pour du code peut dégrader le comportement agentique au lieu de l'améliorer. Si vous préférez ne toucher à aucun drapeau, Ollama a intégré le modèle en 0.32.7 et LM Studio offre une route graphique vers les mêmes poids.
Qu'est-ce que le brouilleur DFlash et le décodage spéculatif vaut-il la peine ?
DFlash est un petit modèle compagnon livré avec Muse Glimmer qui rédige plusieurs jetons d'avance pour que le gros modèle en vérifie un lot d'un coup au lieu d'en produire un à la fois. Meta annonce une accélération du décodage de 3,1 fois sur une RTX 5090, 1,8 fois sur un M5 Max et 1,5 fois sur un M4 Max, et LMSYS a mesuré environ 230 jetons par seconde sur une seule RTX 5090 avec des poids NVFP4 et DFlash activé. Cela vaut la peine pour l'usage interactif, où la latence est ce que vous ressentez. C'est moins évident pour le débit en lots, puisque le travail de vérification entre en concurrence avec le lot, raison pour laquelle vLLM traite le décodage spéculatif comme un arbitrage et non comme un gain gratuit.