En avril, Meta avait utilisé Muse Spark pour montrer qu'elle savait aussi construire un modèle phare fermé. Le 10 août, une partie de la même famille Muse revient vers l'open weight: Muse Glimmer 30B est disponible sur Hugging Face et vise des agents exécutés sur Mac ou PC avec GPU grand public.
Le chiffre 30B n'est pas le seul signal. Les modèles ouverts chinois et occidentaux ont déjà banalisé les longs contextes et les grands scores. La question de Meta est plus concrète: un modèle téléchargeable, sous licence favorable aux usages commerciaux, peut-il gérer de longues tâches, lire des images, appeler des outils et réessayer après échec sans envoyer chaque étape vers une API cloud?
“Some argue that superintelligence itself or a small set of experts who control it should decide what is best for humanity. We disagree.”
30B, c'est d'abord une affaire de mémoire
La model card Hugging Face décrit Muse Glimmer comme un dense causal Transformer d'environ 29,6B paramètres, avec un perception encoder ViT-G/14 d'environ 1,8B paramètres. Le contexte atteint 131 072+ tokens, le vocabulaire 202 048, l'entraînement couvre plus de 100 langues et la date de coupure des connaissances est le 4 janvier 2026.
Le nombre le plus utile est la mémoire. Meta indique qu'un 30B en pleine précision demanderait plus de 55GB. Glimmer utilise une quantification autour de 4-bit pour faire descendre le modèle de langage sous 20GB, tout en gardant de la place pour le KV cache, l'encodeur image et le drafter de speculative decoding dans une enveloppe 24GB ou 32GB.
Ce n'est ni une latence cloud ni un prix par token. C'est le seuil matériel pour faire tourner une boucle agent en local. Le drafter basé sur DFlash propose des blocs de 16 tokens que le modèle principal vérifie en parallèle. Meta annonce des gains de décodage de 3,1x sur RTX 5090, 1,8x sur M5 Max et 1,5x sur M4 Max avec la configuration K-Quant-17GB.
L'évaluation vise les agents
Les documents de Meta insistent sur l'achèvement de tâches de bout en bout, l'usage fiable d'outils, le raisonnement multi-étapes, la récupération après échec, l'entrée multimodale, la compatibilité avec des scaffolds comme OpenClaw, le reasoning effort contrôlable et le multilingue.
La model card indique 75,5 sur MCP Atlas Public, 74,6 sur DeepSearch QA, 51,2 sur SWE-Bench Pro et 76,0 sur SWE-Bench Verified. Côté multimodal, elle donne 78,8 sur Charxiv Reasoning et 75,4 sur ScreenSpot Pro, face à Gemma4-31B Thinking Mode et Qwen3.6-27B Thinking Mode.
Ces scores ne sont pas des taux de réussite en entreprise. Un agent réel traverse navigateur, dépôts de code, permissions, journaux et bases de données. Le déplacement reste net: Meta évalue les modèles locaux sur leur capacité à maintenir de longues boucles avec outils, pas seulement sur des réponses de chat.
Retour open-weight, avec garde-fous
Glimmer est sous Apache 2.0. Meta mentionne le téléchargement via Hugging Face, l'exécution locale par Ollama, LM Studio et Unsloth, les frameworks edge llama.cpp, ExecuTorch et MLX, le serving via vLLM et SGLang, et des accès rapides via Together AI, Fireworks AI et OpenRouter.
Le contraste avec Muse Spark est volontaire. Spark reste le modèle fermé plus puissant et a basculé vers des accès API payants. Glimmer donne aux développeurs un modèle agent local, pas le système le plus capable de Meta.
La model card fixe aussi des limites. Meta recommande de ne pas déployer Glimmer comme endpoint nu, mais avec des garde-fous pour la confirmation des actions irréversibles, la minimisation des données, les frontières de scaffold et la défense contre l'indirect prompt injection. Un agent local peut lire l'écran, toucher des fichiers et appeler des outils. Tourner sur l'appareil ne le rend pas sûr par défaut.
Les prochains tests sont simples à suivre: vitesse réelle sur machines 24GB et 32GB, qualité des intégrations Ollama/SGLang/OpenClaw, et nombre de reprises humaines pendant les longues tâches. Si cela tient, Meta retrouve une entrée ouverte après Llama. Sinon, Glimmer sera un autre 30B téléchargé, quantifié, benchmarké puis remplacé.
Sources: Meta AI Research, model card Hugging Face, Business Insider, FoneArena, CocoLoop; vérification des 29,6B paramètres, perception encoder 1,8B, contexte 131 072+ tokens, licence Apache 2.0, poids quantifiés sous 20GB, périmètre local 24GB/32GB, gains DFlash 3,1x/1,8x/1,5x et benchmarks MCP Atlas/SWE-Bench.