Pada April, Meta memakai Muse Spark untuk menunjukkan bahwa perusahaan itu juga akan mengejar model unggulan tertutup. Pada 10 Agustus, sebagian lini Muse kembali diarahkan ke open weight: Muse Glimmer 30B sudah tersedia di Hugging Face dan diposisikan sebagai model agent lokal untuk Mac atau PC dengan GPU konsumen.
Angka 30B bukan satu-satunya cerita. Model terbuka dari Tiongkok dan Barat sudah membuat klaim konteks panjang dan skor benchmark terasa biasa. Pertanyaan Meta lebih praktis: bisakah model yang bisa diunduh dan berlisensi ramah komersial menjalankan tugas panjang, membaca gambar, memanggil alat, dan mencoba lagi setelah gagal tanpa mengirim setiap langkah ke API cloud?
“Some argue that superintelligence itself or a small set of experts who control it should decide what is best for humanity. We disagree.”
30B adalah keputusan memori
Kartu model Hugging Face mencatat Muse Glimmer sebagai dense causal Transformer sekitar 29,6B parameter dengan perception encoder ViT-G/14 sekitar 1,8B parameter. Panjang konteksnya 131.072+ token, kosakatanya 202.048, dilatih pada lebih dari 100 bahasa, dan batas pengetahuannya 4 Januari 2026.
Angka paling penting untuk pengguna lokal adalah memori. Meta mengatakan model 30B full precision membutuhkan lebih dari 55GB. Glimmer memakai kuantisasi sekitar 4-bit untuk menekan model bahasa ke bawah 20GB, lalu menyisakan ruang bagi KV cache, encoder gambar, dan drafter speculative decoding dalam konfigurasi 24GB atau 32GB.
Ini bukan metrik latensi cloud dan bukan daftar harga token. Ini adalah ambang perangkat untuk menjalankan loop agent secara lokal. Drafter berbasis DFlash mengusulkan blok 16 token, lalu model utama memverifikasinya secara paralel. Meta melaporkan peningkatan kecepatan decoding 3,1x di RTX 5090, 1,8x di M5 Max, dan 1,5x di M4 Max untuk konfigurasi K-Quant-17GB.
Benchmark diarahkan ke agent
Materi Meta menekankan penyelesaian tugas end-to-end, penggunaan alat yang andal, penalaran multi-langkah, pemulihan dari kegagalan, input multimodal, kompatibilitas scaffold seperti OpenClaw, pengaturan reasoning effort, dan dukungan multibahasa.
Kartu model mencantumkan 75,5 pada MCP Atlas Public, 74,6 pada DeepSearch QA, 51,2 pada SWE-Bench Pro, dan 76,0 pada SWE-Bench Verified. Untuk multimodal, skornya 78,8 pada Charxiv Reasoning dan 75,4 pada ScreenSpot Pro, dibandingkan dengan Gemma4-31B Thinking Mode dan Qwen3.6-27B Thinking Mode.
Skor itu tidak sama dengan keberhasilan kerja di perusahaan. Agent nyata harus melewati browser, repositori, izin, log, dan basis data. Namun arah evaluasinya jelas: Meta ingin menilai model lokal dari kemampuan menjalankan loop alat yang panjang, bukan sekadar jawaban obrolan.
Open weight kembali dengan batas aman
Glimmer memakai lisensi Apache 2.0. Meta mengatakan bobotnya bisa diunduh dari Hugging Face, dengan jalur lokal lewat Ollama, LM Studio, dan Unsloth; dukungan edge melalui llama.cpp, ExecuTorch, dan MLX; serving melalui vLLM dan SGLang; serta akses cepat melalui Together AI, Fireworks AI, dan OpenRouter.
Kontrasnya dengan Muse Spark cukup kuat. Spark tetap menjadi model tertutup yang lebih kuat dan sudah masuk jalur API berbayar. Glimmer memberi pengembang model agent lokal, bukan sistem Meta yang paling kuat.
Kartu model juga menuliskan batasan. Meta menyarankan Glimmer tidak dipakai sebagai endpoint tunggal tanpa perlindungan tambahan, terutama untuk konfirmasi tindakan yang tidak bisa dibatalkan, minimisasi data, batas scaffold, dan pertahanan dari indirect prompt injection. Agent lokal bisa membaca layar, menyentuh file, dan memanggil alat. Berjalan di perangkat sendiri tidak otomatis membuatnya aman.
Yang perlu diuji berikutnya konkret: kecepatan nyata di perangkat 24GB dan 32GB, kualitas integrasi Ollama/SGLang/OpenClaw, dan seberapa sering manusia harus mengambil alih tugas panjang. Jika itu bertahan, Meta mendapat pintu ekosistem terbuka baru setelah Llama. Jika tidak, Glimmer akan menjadi model 30B lain yang diunduh, dikuantisasi, diuji benchmark, lalu digantikan.
Sumber: Meta AI Research, kartu model Hugging Face, Business Insider, FoneArena, CocoLoop; verifikasi mencakup 29,6B parameter, perception encoder 1,8B, konteks 131.072+ token, lisensi Apache 2.0, bobot kuantisasi di bawah 20GB, cakupan lokal 24GB/32GB, klaim decoding DFlash 3,1x/1,8x/1,5x, dan benchmark MCP Atlas/SWE-Bench.