
이미지: METAL LAB 생성
摘要
- Meta AI以Apache 2.0许可证发布了面向本地代理工作流的300亿参数模型"Muse Glimmer"
- 通过4比特量化将语言模型体积压缩至20GB以下,使其可在24GB、32GB级消费级GPU上运行
- 该模型基于DFlash的推测解码技术,并针对函数调用、故障恢复等代理循环任务进行了训练
- 모델명
- Muse Glimmer
- 파라미터 규모
- 300억(30B), 밀집형(dense)
- 라이선스
- Apache 2.0
- 메모리 요구
- 전체 정밀도 55GB 이상 → 4비트 양자화 시 20GB 미만
- 지원 언어
- 100개 이상
- 제공 채널
- Hugging Face, 향후 Ollama·LM Studio·Unsloth·vLLM·SGLang 등
Meta AI发布了专为本地代理工作流打造的300亿参数开放模型"Muse Glimmer"。据r/LocalLLaMA上发布的公告称,该模型已以Apache 2.0许可证向社区开放权重。
Muse Glimmer是一款多模态模型,配备专用感知编码器可交叉处理文本和图像,训练语料涵盖100多种语言。该模型还支持调节推理强度,以在质量和速度之间取得平衡。
以全精度运行需要55GB以上内存,难以在消费级硬件上部署,但通过4比特量化,语言模型本身的体积被压缩至20GB以下。据称,这使得24GB或32GB级GPU能够同时运行KV缓存、感知编码器和推测解码起草模型。Meta表示,经压缩后代理任务性能几乎没有下降。
该模型还配备了基于DFlash的轻量级起草模型,以token块为单位提出候选方案,再由主模型并行验证,从而支持推测解码。Meta表示已在DeepSearch QA、MCP-Atlas、SWE-Bench等测试中验证了性能,并将工具调用失败时进行诊断并重试的"故障恢复"能力也作为训练目标之一。
模型权重已在Hugging Face上公开,预计将很快支持Ollama、LM Studio、Unsloth、torchtitan,以及与llama.cpp、MLX、ExecuTorch的优化集成。此外还将提供用于服务部署的vLLM、SGLang支持,以及通过Together AI、Fireworks AI、OpenRouter的接入方式。Meta还表示,正与AMD、Arm、Dell、Intel、NVIDIA合作进行针对不同设备的优化工作。



