每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Meta,发布面向本地代理的300亿参数开放模型

Muse Glimmer是一款代理专用模型,经4比特量化后可在24GB级消费级GPU上运行

이미지: METAL LAB 생성

摘要

  • Meta AI以Apache 2.0许可证发布了面向本地代理工作流的300亿参数模型"Muse Glimmer"
  • 通过4比特量化将语言模型体积压缩至20GB以下,使其可在24GB、32GB级消费级GPU上运行
  • 该模型基于DFlash的推测解码技术,并针对函数调用、故障恢复等代理循环任务进行了训练
모델명
Muse Glimmer
파라미터 규모
300억(30B), 밀집형(dense)
라이선스
Apache 2.0
메모리 요구
전체 정밀도 55GB 이상 → 4비트 양자화 시 20GB 미만
지원 언어
100개 이상
제공 채널
Hugging Face, 향후 Ollama·LM Studio·Unsloth·vLLM·SGLang 등

Meta AI发布了专为本地代理工作流打造的300亿参数开放模型"Muse Glimmer"。据r/LocalLLaMA上发布的公告称,该模型已以Apache 2.0许可证向社区开放权重。

Muse Glimmer是一款多模态模型,配备专用感知编码器可交叉处理文本和图像,训练语料涵盖100多种语言。该模型还支持调节推理强度,以在质量和速度之间取得平衡。

以全精度运行需要55GB以上内存,难以在消费级硬件上部署,但通过4比特量化,语言模型本身的体积被压缩至20GB以下。据称,这使得24GB或32GB级GPU能够同时运行KV缓存、感知编码器和推测解码起草模型。Meta表示,经压缩后代理任务性能几乎没有下降。

该模型还配备了基于DFlash的轻量级起草模型,以token块为单位提出候选方案,再由主模型并行验证,从而支持推测解码。Meta表示已在DeepSearch QA、MCP-Atlas、SWE-Bench等测试中验证了性能,并将工具调用失败时进行诊断并重试的"故障恢复"能力也作为训练目标之一。

模型权重已在Hugging Face上公开,预计将很快支持Ollama、LM Studio、Unsloth、torchtitan,以及与llama.cpp、MLX、ExecuTorch的优化集成。此外还将提供用于服务部署的vLLM、SGLang支持,以及通过Together AI、Fireworks AI、OpenRouter的接入方式。Meta还表示,正与AMD、Arm、Dell、Intel、NVIDIA合作进行针对不同设备的优化工作。