每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

微软发布支持视频理解的视觉-语言模型Mage-VL

可同时处理图像、视频与文本的多模态模型以开源形式上线Hugging Face

이미지: METAL LAB 생성

摘要

  • 微软在Hugging Face上公开了image-text-to-text模型Mage-VL
  • 据悉该模型不仅支持图像理解,还具备视频理解和流式对话功能
  • 以Apache 2.0许可证发布,可直接在Transformers、vLLM、SGLang等平台使用
모델명
Mage-VL
개발사
Microsoft
태스크
image-text-to-text (멀티모달)
지원 기능
video-understanding, streaming, conversational
라이선스
Apache-2.0
관련 논문
arXiv 2607.24904

微软在Hugging Face上公开了视觉-语言模型Mage-VL。据确认,该模型执行image-text-to-text任务,并支持图像理解之外的视频理解(video-understanding)功能。

模型卡片上标注了multimodal、vision-language-model、streaming、conversational等标签,显示其设计并不局限于简单的图像问答,而是同时考虑了连续对话式交互和基于视频的输入处理。据悉,相关研究内容整理于arXiv 2607.24904论文中。

发布方式

Mage-VL以Apache-2.0许可证公开,可用于商业用途。用户可以在Hugging Face Transformers库中以pipeline形式直接调用,同时也支持通过vLLM和SGLang进行服务器端部署。该模型需要执行自定义代码(trust_remote_code),这表明其采用了自研实现方式,而非标准架构。

截至发布时,除该模型通过拥有322个赞、2.15万粉丝规模的微软账号发布这一信息外,模型卡片摘录内容中并未披露具体的参数规模或基准测试成绩。