
이미지: METAL
요약
- 메타 AI가 로컬 에이전트 워크플로우용 300억 파라미터 모델 'Muse Glimmer'를 Apache 2.0 라이선스로 공개했다
- 4비트 양자화로 언어모델 용량을 20GB 이하로 줄여 24GB·32GB급 소비자 GPU에서도 구동 가능하다
- DFlash 기반 추측 디코딩과 함수 호출, 실패 복구 등 에이전트 루프 작업에 맞춰 학습됐다
- 모델명
- Muse Glimmer
- 파라미터 규모
- 300억(30B), 밀집형(dense)
- 라이선스
- Apache 2.0
- 메모리 요구
- 전체 정밀도 55GB 이상 → 4비트 양자화 시 20GB 미만
- 지원 언어
- 100개 이상
- 제공 채널
- Hugging Face, 향후 Ollama·LM Studio·Unsloth·vLLM·SGLang 등
메타 AI가 로컬 에이전트 워크플로우에 특화된 300억 파라미터 개방형 모델 'Muse Glimmer'를 공개했다. r/LocalLLaMA에 게시된 발표에 따르면 이 모델은 Apache 2.0 라이선스로 커뮤니티에 가중치가 공개됐다.
Muse Glimmer는 텍스트와 이미지를 교차 처리하는 전용 인식 인코더를 갖춘 멀티모달 모델로, 100개 이상 언어로 학습됐다. 추론 강도를 조절해 품질과 속도 사이 균형을 맞출 수 있는 기능도 포함됐다.
전체 정밀도로는 55GB 이상의 메모리가 필요해 소비자 하드웨어에서 구동이 어려웠지만, 4비트 양자화를 적용해 언어모델 자체 용량을 20GB 미만으로 낮췄다. 이를 통해 24GB나 32GB급 GPU에서도 KV 캐시, 인식 인코더, 추측 디코딩 드래프터를 동시에 실행할 여유가 생겼다고 밝혔다. 메타는 압축 후에도 에이전트 작업 성능 저하가 거의 없음을 확인했다고 설명했다.
모델은 DFlash 기반의 경량 드래프터를 함께 제공해 토큰 블록 단위로 후보를 제안하고 메인 모델이 병렬 검증하는 방식의 추측 디코딩을 지원한다. DeepSearch QA, MCP-Atlas, SWE-Bench 등에서 성능을 검증했으며, 도구 호출 실패 시 진단 후 재시도하는 '실패 복구' 능력도 학습 목표로 삼았다고 밝혔다.
가중치는 Hugging Face에 공개됐으며, 조만간 Ollama, LM Studio, Unsloth, torchtitan과 llama.cpp·MLX·ExecuTorch 최적화 통합이 지원될 예정이다. 서빙을 위한 vLLM·SGLang 지원과 Together AI, Fireworks AI, OpenRouter를 통한 접근도 제공된다. 메타는 AMD, Arm, Dell, Intel, NVIDIA와 기기별 최적화 작업도 진행 중이라고 덧붙였다.





댓글