
이미지: METAL
요약
- 마이크로소프트가 허깅페이스에 image-text-to-text 모델 Mage-VL을 공개했다
- 이미지뿐 아니라 영상 이해와 스트리밍 대화 기능을 지원하는 것으로 알려졌다
- 아파치 2.0 라이선스로 배포돼 Transformers, vLLM, SGLang 등에서 바로 사용할 수 있다
- 모델명
- Mage-VL
- 개발사
- Microsoft
- 태스크
- image-text-to-text (멀티모달)
- 지원 기능
- video-understanding, streaming, conversational
- 라이선스
- Apache-2.0
- 관련 논문
- arXiv 2607.24904
마이크로소프트가 비전-언어 모델 Mage-VL을 허깅페이스에 공개했다. 이 모델은 image-text-to-text 태스크를 수행하며, 이미지와 함께 영상 이해(video-understanding) 기능을 지원하는 것으로 확인됐다.
모델 카드에는 multimodal, vision-language-model, streaming, conversational 등의 태그가 붙어 있어 단순 이미지 질의응답을 넘어 연속적인 대화형 상호작용과 영상 기반 입력 처리까지 염두에 둔 설계로 보인다. 관련 연구 내용은 arXiv 2607.24904 논문에 정리된 것으로 알려졌다.
배포 방식
Mage-VL은 Apache-2.0 라이선스로 공개돼 상업적 활용이 가능하다. Hugging Face Transformers 라이브러리에서 파이프라인 형태로 바로 불러올 수 있으며, vLLM과 SGLang을 통한 서버 배포도 지원된다. 커스텀 코드(trust_remote_code) 실행이 필요한 구조로, 표준 아키텍처 대신 자체 구현 방식을 택한 것으로 보인다.
공개 시점 기준 허깅페이스에서 좋아요 322개, 팔로워 2만1500명 규모의 마이크로소프트 계정을 통해 배포됐다는 점 외에 구체적인 파라미터 수나 벤치마크 성능은 모델 카드 발췌 내용에서 확인되지 않았다.





댓글