Muse Glimmer는 Meta Superintelligence Labs가 공개한 300억 파라미터 오픈 가중치 에이전트 모델이다. 클라우드 API에 의존하지 않고 Mac, PC, 단일 소비자 GPU 같은 로컬 환경에서 도구 호출, 코딩, 장기 작업, 멀티모달 입력 처리를 수행하는 개인 에이전트를 겨냥한다.
왜 로컬 에이전트 모델인가
에이전트가 일정, 메시지, 파일, 개인 문서처럼 민감한 맥락을 다루려면 지연시간과 비용보다 프라이버시와 오프라인 실행성이 더 중요해질 때가 많다. Muse Glimmer는 이 문제를 “작지만 에이전트에 특화된 모델”로 푼다. 범용 대화 품질만 키우기보다, 실제 에이전트가 필요한 계획 수립, 도구 호출(tool calling), 오류 복구, 스캐폴드 호환성을 훈련 목표에 포함한다.
이 방향은 lfm2-5-2-6b나 needle-2처럼 로컬·엣지 장치에서 에이전트 기능을 나눠 처리하려는 흐름과 맞닿아 있다. 차이는 규모다. Muse Glimmer는 초소형 라우터가 아니라 30B급 로컬 주력 모델을 지향한다.
훈련 파이프라인
| 단계 | 역할 |
|---|---|
| Pre-training | Muse Spark 출력과 유사한 데이터 믹스를 활용한 로짓 증류(logit distillation) |
| Mid-training | 더 긴 컨텍스트, 에이전트 작업, 풍부한 reasoning trace를 포함한 중간 훈련 |
| Post-training | SFT, on-policy distillation, RL을 일반·추론·코딩·에이전트 영역에 적용 |
Meta는 Muse Glimmer가 Meta의 Advanced AI Scaling Framework 기준으로 평가됐고, 오픈 가중치 공개 가능성을 검토했다고 설명한다. 라이선스는 Apache 2.0이다.
에이전트 기능
Muse Glimmer의 핵심은 단일 질의응답보다 긴 작업 수행이다.
- 엔드투엔드 작업 완료: DeepSearch QA, MCP-Atlas, tau-Bench, SWE-Bench 같은 에이전트·코딩 벤치마크를 겨냥한다.
- 정확한 도구 사용: 긴 워크플로 안에서 함수 스키마를 따라 도구를 호출한다.
- 실패 복구: 도구 호출 실패나 예상 밖 결과가 나오면 멈추지 않고 원인을 진단해 재시도하도록 훈련됐다.
- 멀티모달 입력: 별도 perception encoder로 텍스트와 이미지를 함께 처리해 스크린샷, 차트, 문서를 읽는다.
- Reasoning effort 제어: 속도와 품질 사이에서 추론 강도를 조절하는 사용 방식을 지원한다.
- 다국어: 100개 이상 언어 데이터로 훈련됐다고 공개됐다.
로컬 실행 최적화
30B 모델은 보통 로컬 소비자 장비에 부담이 크다. Muse Glimmer는 약 4비트 수준의 양자화로 언어 모델 가중치를 20GB 미만으로 줄이고, KV cache, 이미지 인코더, speculative decoding용 drafter를 24GB 또는 32GB 메모리 안에 함께 넣는 구성을 목표로 한다.
또 하나의 특징은 dflash 기반 drafter 모델이다. 작은 companion network가 여러 토큰 후보를 먼저 제안하고, 메인 모델이 이를 병렬 검증해 표준 토큰별 생성보다 빠른 출력을 만든다. Meta는 K-Quant-17GB 모델과 양자화 drafter 조합에서 RTX 5090, MacBook M4 Max, M5 Max 기준의 속도 개선을 공개했다.
어디에 적합한가
Muse Glimmer는 다음 사용자가 특히 볼 만하다.
- 로컬에서 돌아가는 개인 비서나 파일·문서 에이전트를 만들려는 개발자
- 클라우드 LLM 호출 비용을 줄이고 싶은 코딩 에이전트·평가 하네스 운영자
- 이미지와 텍스트를 함께 읽는 로컬 작업 자동화를 실험하는 팀
- llama.cpp, MLX, ExecuTorch, vLLM, SGLang 기반 배포 경로를 비교하려는 인프라 팀
다만 30B급 모델은 “저사양 엣지”보다 고급 노트북, 워크스테이션, 소비자 GPU에 가깝다. 스마트폰·마이크로컨트롤러급 도구 라우팅은 needle-2 같은 더 작은 모델이 더 현실적이다.
관련 문서
- muse-spark-1-1 — Meta의 API 지원 코딩·에이전트 모델
- lfm2-5-2-6b — 휴대폰과 CPU에서 도구 호출을 수행하는 온디바이스 에이전트 모델
- local-slm — 로컬 소형 언어 모델 개요
- dflash — speculative decoding용 초경량 drafter 모델
- openclaw — 에이전트 하네스와 평가 환경
참고 자료
- Introducing Muse Glimmer: An Open Agentic Model That Runs on Your Device — Meta AI Research (2026-08-10)
- meta-models/Muse-Glimmer-30B — Hugging Face 모델