
이미지: METAL LAB 생성
摘要
- 微软在Hugging Face上公开了image-text-to-text模型Mage-VL
- 据悉该模型不仅支持图像理解,还具备视频理解和流式对话功能
- 以Apache 2.0许可证发布,可直接在Transformers、vLLM、SGLang等平台使用
- 모델명
- Mage-VL
- 개발사
- Microsoft
- 태스크
- image-text-to-text (멀티모달)
- 지원 기능
- video-understanding, streaming, conversational
- 라이선스
- Apache-2.0
- 관련 논문
- arXiv 2607.24904
微软在Hugging Face上公开了视觉-语言模型Mage-VL。据确认,该模型执行image-text-to-text任务,并支持图像理解之外的视频理解(video-understanding)功能。
模型卡片上标注了multimodal、vision-language-model、streaming、conversational等标签,显示其设计并不局限于简单的图像问答,而是同时考虑了连续对话式交互和基于视频的输入处理。据悉,相关研究内容整理于arXiv 2607.24904论文中。
发布方式
Mage-VL以Apache-2.0许可证公开,可用于商业用途。用户可以在Hugging Face Transformers库中以pipeline形式直接调用,同时也支持通过vLLM和SGLang进行服务器端部署。该模型需要执行自定义代码(trust_remote_code),这表明其采用了自研实现方式,而非标准架构。
截至发布时,除该模型通过拥有322个赞、2.15万粉丝规模的微软账号发布这一信息外,模型卡片摘录内容中并未披露具体的参数规模或基准测试成绩。



