Outils développeurActualité

Muse Glimmer : prévoir plus que les poids du modèle

Sur cette page
  1. Modèle publié et moteur compatible
  2. Additionner les composants, puis prévoir le contexte
  3. Vérifier toute la boucle de l’agent

Un fichier d’environ 17 Go ne garantit pas que tous les contextes et outils tiennent dans 17 Go de mémoire. Muse Glimmer utilise plusieurs composants aux rôles distincts.

Fichiers listés : texte 16,8 Go + vision 1,4 Go + DFlash optionnel 1,6 Go = 19,8 Go. Mémoire du moteur et cache KV restent à prévoir, sans être chiffrés par ces tailles. Exemple : 131 072 / 4 emplacements = 32 768 chacun.
Fichiers listés : texte 16,8 Go + vision 1,4 Go + DFlash optionnel 1,6 Go = 19,8 Go. Mémoire du moteur et cache KV restent à prévoir, sans être chiffrés par ces tailles. Exemple : 131 072 / 4 emplacements = 32 768 chacun. Graphique : PeopleAreGeek. Source des données.
Agrandir l’image

Modèle publié et moteur compatible

La présentation Meta du 10 août décrit un modèle local de 30 milliards de paramètres, distillé depuis Muse Spark. Les poids sont publiés, tandis que plusieurs intégrations sont annoncées pour les jours suivants : pas une disponibilité identique partout dès le premier jour.

Les instructions GGUF officielles actuelles demandent llama.cpp b10353 ou ultérieur. Elles distinguent CLI texte et llama-mtmd-cli pour les images, avec encodeur de perception. Ajouter ce fichier à une invocation texte inadaptée ne suffit pas. Vérifiez moteur et exemples actuels avant d’accuser le modèle.

Additionner les composants, puis prévoir le contexte

La liste publiée indique 16,8 Go pour le petit modèle texte, 1,4 Go pour l’encodeur et 1,6 Go pour le brouillon DFlash optionnel : 19,8 Go de fichiers au total. Ce n’est pas un pic RAM/VRAM mesuré. Tampons, cache KV, placement et autres applications restent à prendre en compte. La couverture sépare ces couches sans fabriquer une capture de GPU fonctionnel.

Les instructions précisent aussi que le contexte serveur est partagé entre emplacements parallèles. Exemple : 131 072 jetons au total et quatre emplacements donnent 32 768 par emplacement, pas 131 072 pour chaque requête. Inspectez le contexte réellement annoncé, en gardant de la place pour raisonnement et réponse.

Vérifier toute la boucle de l’agent

Un essai local utile inclut résultat d’outil réussi, erreur explicite et expiration ambiguë. Dans ce dernier cas, vérifiez si l’agent contrôle l’état avant de répéter une opération peut-être déjà réussie. Une belle réponse ou un débit élevé ne résout pas cette question.

Les poids sont sous Apache 2.0, avec ses conditions de redistribution. Cette licence ne certifie pas la fiabilité de l’application et ne rend pas les outils externes hors ligne. Distinguez l’emplacement de l’inférence des destinations auxquelles les outils envoient des données ou effectuent des actions.

Revue du 8 septembre : fichiers GGUF et version minimale vérifiés ; taille des fichiers séparée du pic mémoire et CLI texte du CLI image ; disponibilité au lancement nuancée.