Meta mở model agent cục bộ 30B

Tháng 4, Meta dùng Muse Spark để cho thấy họ cũng đi theo hướng model flagship đóng. Đến ngày 10 tháng 8, một phần dòng Muse quay lại open weight: Muse Glimmer 30B đã lên Hugging Face và được định vị là model agent cục bộ cho Mac hoặc PC dùng GPU phổ thông.

Con số 30B không phải toàn bộ câu chuyện. Các model mở từ Trung Quốc và phương Tây đã khiến ngữ cảnh dài và benchmark cao trở nên quen thuộc. Câu hỏi thực dụng hơn là: một model có thể tải về, giấy phép dễ dùng cho thương mại, có làm được tác vụ dài, đọc ảnh, gọi công cụ và thử lại sau lỗi mà không đưa mọi bước lên API đám mây hay không?

“Some argue that superintelligence itself or a small set of experts who control it should decide what is best for humanity. We disagree.”

30B là bài toán bộ nhớ

Model card trên Hugging Face ghi Muse Glimmer là dense causal Transformer khoảng 29,6B tham số, kèm perception encoder ViT-G/14 khoảng 1,8B tham số. Ngữ cảnh là 131.072+ token, từ vựng 202.048, huấn luyện trên hơn 100 ngôn ngữ và mốc kiến thức là ngày 4 tháng 1 năm 2026.

Con số hữu dụng nhất là bộ nhớ. Meta nói 30B ở full precision cần hơn 55GB, ngoài tầm với của phần lớn thiết bị cá nhân. Glimmer dùng lượng tử hóa khoảng 4-bit để đưa model ngôn ngữ xuống dưới 20GB, chừa chỗ cho KV cache, encoder ảnh và drafter speculative decoding trong khung 24GB hoặc 32GB.

Đây không phải độ trễ API đám mây, cũng không phải bảng giá token. Đây là ngưỡng phần cứng để chạy vòng lặp agent cục bộ. Drafter dựa trên DFlash đề xuất từng khối 16 token, rồi model chính xác minh song song. Meta báo mức tăng tốc giải mã 3,1 lần trên RTX 5090, 1,8 lần trên M5 Max và 1,5 lần trên M4 Max với cấu hình K-Quant-17GB.

Benchmark xoay quanh agent

Tài liệu của Meta tập trung vào hoàn thành nhiệm vụ đầu cuối, gọi công cụ đáng tin cậy, suy luận nhiều bước, phục hồi sau lỗi, đầu vào đa phương thức, tương thích scaffold như OpenClaw, điều chỉnh reasoning effort và hỗ trợ đa ngôn ngữ.

Model card ghi 75,5 trên MCP Atlas Public, 74,6 trên DeepSearch QA, 51,2 trên SWE-Bench Pro và 76,0 trên SWE-Bench Verified. Ở mảng đa phương thức, Charxiv Reasoning đạt 78,8 và ScreenSpot Pro đạt 75,4, so với Gemma4-31B Thinking Mode và Qwen3.6-27B Thinking Mode.

Những điểm số đó không chuyển thẳng thành tỷ lệ hoàn thành việc thật trong doanh nghiệp. Agent ngoài đời phải đi qua trình duyệt, repo mã, quyền truy cập, log và cơ sở dữ liệu. Dù vậy, sự dịch chuyển là rõ: Meta đang đo model cục bộ bằng khả năng chạy vòng lặp công cụ dài, không chỉ bằng câu trả lời hội thoại.

Open weight trở lại, kèm ranh giới

Glimmer dùng Apache 2.0. Meta nói weights đã có trên Hugging Face, sau đó có thể chạy cục bộ qua Ollama, LM Studio, Unsloth; triển khai edge qua llama.cpp, ExecuTorch, MLX; phục vụ qua vLLM và SGLang; hoặc dùng nhanh qua Together AI, Fireworks AI, OpenRouter.

Sự tương phản với Muse Spark rất rõ. Spark là model đóng mạnh hơn và đã đi vào API tính phí. Glimmer đưa cho nhà phát triển một model agent cục bộ, không phải hệ thống mạnh nhất của Meta.

Giới hạn an toàn cũng đáng đọc. Meta khuyến nghị không triển khai Glimmer như một endpoint trần, mà cần thêm guardrail cho xác nhận hành động không thể đảo ngược, tối thiểu hóa dữ liệu, ranh giới scaffold và phòng vệ indirect prompt injection. Agent cục bộ có thể đọc màn hình, chạm vào file và gọi công cụ. Chạy trên máy cá nhân không tự động đồng nghĩa an toàn.

Ba phép thử kế tiếp rất cụ thể: tốc độ thật trên máy 24GB/32GB, chất lượng tích hợp Ollama/SGLang/OpenClaw và số lần con người phải tiếp quản trong tác vụ dài. Nếu ổn, Meta có cửa vào hệ sinh thái mở mới sau Llama. Nếu không, Glimmer chỉ là một model 30B nữa được tải về, lượng tử hóa, benchmark rồi bị model mới che mất.

Nguồn: Meta AI Research, model card Hugging Face, Business Insider, FoneArena, CocoLoop; đối chiếu 29,6B tham số, perception encoder 1,8B, ngữ cảnh 131.072+ token, giấy phép Apache 2.0, weights lượng tử hóa dưới 20GB, phạm vi chạy cục bộ 24GB/32GB, tăng tốc DFlash 3,1x/1,8x/1,5x và phạm vi benchmark MCP Atlas/SWE-Bench.