En abril, Meta usó Muse Spark para mostrar que también iba a competir con modelos insignia cerrados. El 10 de agosto, una parte de la misma familia Muse volvió a la ruta open-weight: Muse Glimmer 30B ya está en Hugging Face y apunta a agents que se ejecutan en un Mac o en un PC con GPU de consumo.
La cifra de 30B no es toda la noticia. Los modelos abiertos de China y Occidente ya han normalizado el contexto largo y los grandes benchmarks. La pregunta de Meta es más práctica: ¿puede un modelo descargable, con licencia favorable para uso comercial, hacer tareas largas, leer imágenes, llamar herramientas y reintentar después de fallos sin enviar cada paso a una API en la nube?
“Some argue that superintelligence itself or a small set of experts who control it should decide what is best for humanity. We disagree.”
30B es una decisión de memoria
La model card de Hugging Face describe Muse Glimmer como un dense causal Transformer de unos 29,6B parámetros, con un perception encoder ViT-G/14 de unos 1,8B parámetros. El contexto es de 131.072+ tokens, el vocabulario de 202.048, el entrenamiento cubre más de 100 idiomas y el corte de conocimiento es el 4 de enero de 2026.
El número más útil es la memoria. Meta dice que un modelo 30B en precisión completa necesitaría más de 55GB. Glimmer usa cuantización de aproximadamente 4-bit para reducir el modelo de lenguaje a menos de 20GB, dejando espacio para KV cache, el encoder de imagen y el drafter de speculative decoding dentro de una configuración de 24GB o 32GB.
Esto no es una latencia de nube ni una tarifa por token. Es el umbral de hardware para ejecutar un bucle de agent local. El drafter basado en DFlash propone bloques de 16 tokens y el modelo principal los verifica en paralelo. Meta reporta mejoras de decodificación de 3,1x en RTX 5090, 1,8x en M5 Max y 1,5x en M4 Max para la configuración K-Quant-17GB.
La evaluación mira a los agents
Los materiales de Meta se centran en finalización de tareas de extremo a extremo, uso fiable de herramientas, razonamiento de varios pasos, recuperación de fallos, entrada multimodal, compatibilidad con scaffolds como OpenClaw, reasoning effort controlable y soporte multilingüe.
La model card muestra 75,5 en MCP Atlas Public, 74,6 en DeepSearch QA, 51,2 en SWE-Bench Pro y 76,0 en SWE-Bench Verified. En multimodal, reporta 78,8 en Charxiv Reasoning y 75,4 en ScreenSpot Pro, frente a Gemma4-31B Thinking Mode y Qwen3.6-27B Thinking Mode.
Esos resultados no equivalen a una tasa de éxito empresarial. Un agent real cruza navegadores, repositorios, permisos, logs y bases de datos. Aun así, el cambio es claro: Meta está midiendo modelos locales por su capacidad de sostener bucles largos con herramientas, no solo por respuestas de chat.
Open weights con guardrails
Glimmer usa Apache 2.0. Meta señala descarga desde Hugging Face, ejecución local mediante Ollama, LM Studio y Unsloth, soporte edge con llama.cpp, ExecuTorch y MLX, serving con vLLM y SGLang, y arranque rápido con Together AI, Fireworks AI y OpenRouter.
El contraste con Muse Spark es deliberado. Spark sigue siendo el modelo cerrado más fuerte y ha entrado en acceso API de pago. Glimmer entrega a los desarrolladores un modelo agent local, no el sistema más capaz de Meta.
La model card también marca límites. Meta recomienda no desplegar Glimmer como endpoint desnudo, sino con guardrails adicionales para confirmar acciones irreversibles, minimizar datos, respetar límites de scaffold y defenderse de prompt injection indirecto. Un agent local puede leer la pantalla, tocar archivos y llamar herramientas. Ejecutarse en el dispositivo no lo hace seguro automáticamente.
Las próximas pruebas son concretas: velocidad real en máquinas de 24GB y 32GB, calidad de las integraciones con Ollama/SGLang/OpenClaw y cuántas veces debe intervenir una persona en tareas largas. Si eso funciona, Meta recupera una entrada abierta después de Llama. Si no, Glimmer será otro 30B descargado, cuantizado, medido y reemplazado.
Fuentes: Meta AI Research, model card de Hugging Face, Business Insider, FoneArena, CocoLoop; verificación de 29,6B parámetros, perception encoder de 1,8B, contexto de 131.072+ tokens, licencia Apache 2.0, pesos cuantizados por debajo de 20GB, alcance local de 24GB/32GB, mejoras DFlash de 3,1x/1,8x/1,5x y benchmarks MCP Atlas/SWE-Bench.