Meta, 30B 로컬 Agent 모델 공개

Meta는 4월 Muse Spark로 폐쇄형 플래그십 모델 노선을 보여줬다. 8월 10일에는 같은 Muse 계열의 Muse Glimmer 30B를 Hugging Face에 공개하며, Mac이나 소비자용 GPU PC에서 돌아가는 로컬 Agent 모델이라고 설명했다.

관건은 30B라는 숫자만이 아니다. 긴 컨텍스트와 높은 벤치마크는 이미 여러 오픈 모델에서 흔해졌다. Meta가 묻는 질문은 더 실용적이다. 내려받을 수 있고 상업적으로 쓰기 쉬운 모델이 긴 작업, 이미지 이해, 도구 호출, 실패 뒤 재시도까지 클라우드 API 없이 처리할 수 있는가.

“Some argue that superintelligence itself or a small set of experts who control it should decide what is best for humanity. We disagree.”

30B는 메모리 설계의 숫자

Hugging Face 모델 카드에 따르면 Muse Glimmer는 약 29.6B 파라미터의 dense causal Transformer이며, 약 1.8B 파라미터 ViT-G/14 지각 인코더를 포함한다. 컨텍스트 길이는 131,072+ token, 어휘는 202,048, 100개 이상 언어로 학습됐고 지식 기준일은 2026년 1월 4일이다.

실제 배포에서 중요한 숫자는 메모리다. Meta는 30B 모델을 풀 프리시전으로 돌리면 55GB 이상이 필요하다고 설명한다. Glimmer는 약 4-bit 양자화로 언어 모델을 20GB 미만으로 줄이고, KV cache, 이미지 인코더, 투기적 디코딩 drafter를 24GB 또는 32GB 범위 안에 넣는 구성을 제시했다.

이는 클라우드 지연 시간도, 토큰 가격도 아니다. 로컬에서 Agent 루프를 돌릴 수 있는 하드웨어 문턱에 가깝다. DFlash 기반 drafter는 16 token 블록을 제안하고 주 모델이 병렬 검증한다. Meta는 K-Quant-17GB 구성에서 RTX 5090 3.1배, M5 Max 1.8배, M4 Max 1.5배의 디코딩 속도 향상을 제시했다.

평가는 채팅보다 Agent에 맞춰졌다

Meta의 설명은 작업 완료, 안정적인 도구 사용, 다단계 추론, 실패 복구, 멀티모달 입력, OpenClaw 계열 scaffold 호환성, reasoning effort 조절, 다국어 지원에 집중돼 있다.

모델 카드는 MCP Atlas Public 75.5, DeepSearch QA 74.6, SWE-Bench Pro 51.2, SWE-Bench Verified 76.0을 제시한다. 멀티모달에서는 Charxiv Reasoning 78.8, ScreenSpot Pro 75.4이며, Gemma4-31B Thinking Mode와 Qwen3.6-27B Thinking Mode를 비교 대상으로 둔다.

이 점수가 기업 환경의 작업 성공률은 아니다. 실제 Agent는 브라우저, 저장소, 권한, 로그, 데이터베이스를 지나야 한다. 그래도 Meta가 로컬 모델 평가의 중심을 답변 품질에서 도구 루프와 긴 작업으로 옮긴 점은 분명하다.

오픈 웨이트 복귀와 안전선

라이선스는 Apache 2.0이다. Meta는 Hugging Face 다운로드, Ollama, LM Studio, Unsloth 로컬 실행, llama.cpp, ExecuTorch, MLX, vLLM, SGLang, Together AI, Fireworks AI, OpenRouter 경로를 제시했다.

Muse Spark와의 대비는 뚜렷하다. Spark는 더 강한 폐쇄형 모델로 API 과금에 들어갔다. Glimmer는 Meta의 최강 모델이 아니라, 개발자가 개인 기기에서 실험할 수 있는 Agent 모델이다.

모델 카드의 제한도 중요하다. Meta는 Glimmer를 단독 엔드포인트처럼 노출하지 말고, 되돌릴 수 없는 작업 확인, 데이터 최소화, scaffold 경계, 간접 프롬프트 주입 방어 같은 추가 보호 장치를 붙이라고 권고한다. 로컬 Agent는 화면을 읽고 파일을 만지고 도구를 부를 수 있다. 기기 안에서 돌아간다는 사실만으로 안전해지지는 않는다.

이제 봐야 할 것은 24GB/32GB 장비의 실제 속도, Ollama/SGLang/OpenClaw 통합 품질, 장시간 작업에서 사람이 얼마나 자주 개입하는지다. 이 조건이 맞으면 Meta는 Llama 이후의 열린 생태계 입구를 다시 얻는다. 실패하면 Glimmer는 내려받고, 양자화하고, 벤치마크한 뒤 다음 30B 모델에 묻히게 된다.

출처: Meta AI Research, Hugging Face 모델 카드, Business Insider, FoneArena, CocoLoop; 29.6B 파라미터, 1.8B 지각 인코더, 131,072+ token 컨텍스트, Apache 2.0, 20GB 미만 양자화 가중치, 24GB/32GB 로컬 실행 범위, DFlash 3.1배/1.8배/1.5배 디코딩 가속, MCP Atlas/SWE-Bench 평가 범위를 확인했다.