Em abril, a Meta usou o Muse Spark para mostrar que também seguiria a rota de modelos fechados de ponta. Em 10 de agosto, parte da mesma família Muse voltou ao caminho open-weight: o Muse Glimmer 30B já está no Hugging Face e mira agents rodando em Mac ou PC com GPU de consumidor.
O ponto não é apenas o número 30B. Modelos abertos da China e do Ocidente já tornaram contexto longo e benchmarks altos algo comum. A pergunta prática da Meta é outra: um modelo baixável, com licença favorável ao uso comercial, consegue executar tarefas longas, ler imagens, chamar ferramentas e tentar de novo após falhas sem mandar cada passo para uma API em nuvem?
“Some argue that superintelligence itself or a small set of experts who control it should decide what is best for humanity. We disagree.”
30B é uma decisão de memória
O model card no Hugging Face descreve o Muse Glimmer como um dense causal Transformer de cerca de 29,6B parâmetros, com um perception encoder ViT-G/14 de cerca de 1,8B parâmetros. O contexto é de 131.072+ tokens, o vocabulário tem 202.048 entradas, o treino cobre mais de 100 idiomas e o corte de conhecimento é 4 de janeiro de 2026.
O número mais útil é memória. A Meta diz que um 30B em precisão completa exigiria mais de 55GB. O Glimmer usa quantização em torno de 4-bit para reduzir o modelo de linguagem a menos de 20GB, deixando espaço para KV cache, encoder de imagem e drafter de speculative decoding em uma configuração de 24GB ou 32GB.
Isso não é latência de nuvem nem preço por token. É o limite de hardware para rodar um loop de agent localmente. O drafter baseado em DFlash propõe blocos de 16 tokens, e o modelo principal verifica em paralelo. A Meta relata ganhos de decodificação de 3,1x no RTX 5090, 1,8x no M5 Max e 1,5x no M4 Max para a configuração K-Quant-17GB.
A avaliação está centrada em agents
Os materiais da Meta destacam conclusão de tarefas de ponta a ponta, uso confiável de ferramentas, raciocínio em várias etapas, recuperação de falhas, entrada multimodal, compatibilidade com scaffolds como OpenClaw, reasoning effort controlável e suporte multilíngue.
O model card informa 75,5 no MCP Atlas Public, 74,6 no DeepSearch QA, 51,2 no SWE-Bench Pro e 76,0 no SWE-Bench Verified. No multimodal, aparecem 78,8 no Charxiv Reasoning e 75,4 no ScreenSpot Pro, com comparação contra Gemma4-31B Thinking Mode e Qwen3.6-27B Thinking Mode.
Esses placares não são taxa real de sucesso corporativo. Um agent em produção precisa passar por navegador, repositórios, permissões, logs e bancos de dados. Ainda assim, a mudança é clara: a Meta está avaliando modelos locais pela capacidade de manter loops longos com ferramentas, não só por respostas de chat.
Open weights voltam com limites
O Glimmer usa Apache 2.0. A Meta aponta download no Hugging Face, execução local por Ollama, LM Studio e Unsloth, caminhos edge por llama.cpp, ExecuTorch e MLX, serving por vLLM e SGLang, e início rápido por Together AI, Fireworks AI e OpenRouter.
O contraste com o Muse Spark é direto. Spark continua sendo o modelo fechado mais forte e já entrou no acesso pago via API. Glimmer dá aos desenvolvedores um modelo agent local, não o sistema mais capaz da Meta.
O model card também desenha limites. A Meta recomenda não usar Glimmer como endpoint isolado, mas sim com guardrails extras para confirmação de ações irreversíveis, minimização de dados, limites de scaffold e defesa contra prompt injection indireto. Um agent local pode ler a tela, tocar arquivos e chamar ferramentas. Rodar no dispositivo não torna o sistema seguro por si só.
Os próximos testes são objetivos: velocidade real em máquinas de 24GB e 32GB, qualidade das integrações com Ollama/SGLang/OpenClaw e quantas vezes uma pessoa precisa assumir tarefas longas. Se isso funcionar, a Meta recupera uma entrada aberta depois do Llama. Se não, Glimmer vira mais um 30B baixado, quantizado, medido e substituído.
Fontes: Meta AI Research, model card do Hugging Face, Business Insider, FoneArena, CocoLoop; verificação cobre 29,6B parâmetros, perception encoder de 1,8B, contexto de 131.072+ tokens, licença Apache 2.0, pesos quantizados abaixo de 20GB, escopo local de 24GB/32GB, ganhos DFlash de 3,1x/1,8x/1,5x e benchmarks MCP Atlas/SWE-Bench.