METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

微软发布支持视频理解的视觉-语言模型Mage-VL

可同时处理图像、视频与文本的多模态模型以开源形式上线Hugging Face

微软发布支持视频理解的视觉-语言模型Mage-VL

图片:METAL

摘要

  • 微软在Hugging Face上公开了image-text-to-text模型Mage-VL
  • 据悉该模型不仅支持图像理解,还具备视频理解和流式对话功能
  • 以Apache 2.0许可证发布,可直接在Transformers、vLLM、SGLang等平台使用

微软在Hugging Face上公开了视觉-语言模型Mage-VL。据确认,该模型执行image-text-to-text任务,并支持图像理解之外的视频理解(video-understanding)功能。

模型卡片上标注了multimodal、vision-language-model、streaming、conversational等标签,显示其设计并不局限于简单的图像问答,而是同时考虑了连续对话式交互和基于视频的输入处理。据悉,相关研究内容整理于arXiv 2607.24904论文中。

发布方式

Mage-VL以Apache-2.0许可证公开,可用于商业用途。用户可以在Hugging Face Transformers库中以pipeline形式直接调用,同时也支持通过vLLM和SGLang进行服务器端部署。该模型需要执行自定义代码(trust_remote_code),这表明其采用了自研实现方式,而非标准架构。

截至发布时,除该模型通过拥有322个赞、2.15万粉丝规模的微软账号发布这一信息外,模型卡片摘录内容中并未披露具体的参数规模或基准测试成绩。

评论