METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

메타, 로컬 에이전트용 300억 파라미터 개방형 모델 공개

Muse Glimmer는 4비트 양자화로 24GB급 소비자 GPU에서 구동 가능한 에이전트 특화 모델이다

메타, 로컬 에이전트용 300억 파라미터 개방형 모델 공개

이미지: METAL

요약

  • 메타 AI가 로컬 에이전트 워크플로우용 300억 파라미터 모델 'Muse Glimmer'를 Apache 2.0 라이선스로 공개했다
  • 4비트 양자화로 언어모델 용량을 20GB 이하로 줄여 24GB·32GB급 소비자 GPU에서도 구동 가능하다
  • DFlash 기반 추측 디코딩과 함수 호출, 실패 복구 등 에이전트 루프 작업에 맞춰 학습됐다
모델명
Muse Glimmer
파라미터 규모
300억(30B), 밀집형(dense)
라이선스
Apache 2.0
메모리 요구
전체 정밀도 55GB 이상 → 4비트 양자화 시 20GB 미만
지원 언어
100개 이상
제공 채널
Hugging Face, 향후 Ollama·LM Studio·Unsloth·vLLM·SGLang 등

메타 AI가 로컬 에이전트 워크플로우에 특화된 300억 파라미터 개방형 모델 'Muse Glimmer'를 공개했다. r/LocalLLaMA에 게시된 발표에 따르면 이 모델은 Apache 2.0 라이선스로 커뮤니티에 가중치가 공개됐다.

Muse Glimmer는 텍스트와 이미지를 교차 처리하는 전용 인식 인코더를 갖춘 멀티모달 모델로, 100개 이상 언어로 학습됐다. 추론 강도를 조절해 품질과 속도 사이 균형을 맞출 수 있는 기능도 포함됐다.

전체 정밀도로는 55GB 이상의 메모리가 필요해 소비자 하드웨어에서 구동이 어려웠지만, 4비트 양자화를 적용해 언어모델 자체 용량을 20GB 미만으로 낮췄다. 이를 통해 24GB나 32GB급 GPU에서도 KV 캐시, 인식 인코더, 추측 디코딩 드래프터를 동시에 실행할 여유가 생겼다고 밝혔다. 메타는 압축 후에도 에이전트 작업 성능 저하가 거의 없음을 확인했다고 설명했다.

모델은 DFlash 기반의 경량 드래프터를 함께 제공해 토큰 블록 단위로 후보를 제안하고 메인 모델이 병렬 검증하는 방식의 추측 디코딩을 지원한다. DeepSearch QA, MCP-Atlas, SWE-Bench 등에서 성능을 검증했으며, 도구 호출 실패 시 진단 후 재시도하는 '실패 복구' 능력도 학습 목표로 삼았다고 밝혔다.

가중치는 Hugging Face에 공개됐으며, 조만간 Ollama, LM Studio, Unsloth, torchtitan과 llama.cpp·MLX·ExecuTorch 최적화 통합이 지원될 예정이다. 서빙을 위한 vLLM·SGLang 지원과 Together AI, Fireworks AI, OpenRouter를 통한 접근도 제공된다. 메타는 AMD, Arm, Dell, Intel, NVIDIA와 기기별 최적화 작업도 진행 중이라고 덧붙였다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글