METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

마이크로소프트, 영상 이해 가능한 비전-언어 모델 Mage-VL 공개

이미지·영상과 텍스트를 함께 처리하는 멀티모달 모델을 허깅페이스에 오픈소스로 배포

마이크로소프트, 영상 이해 가능한 비전-언어 모델 Mage-VL 공개

이미지: METAL

요약

  • 마이크로소프트가 허깅페이스에 image-text-to-text 모델 Mage-VL을 공개했다
  • 이미지뿐 아니라 영상 이해와 스트리밍 대화 기능을 지원하는 것으로 알려졌다
  • 아파치 2.0 라이선스로 배포돼 Transformers, vLLM, SGLang 등에서 바로 사용할 수 있다
모델명
Mage-VL
개발사
Microsoft
태스크
image-text-to-text (멀티모달)
지원 기능
video-understanding, streaming, conversational
라이선스
Apache-2.0
관련 논문
arXiv 2607.24904

마이크로소프트가 비전-언어 모델 Mage-VL을 허깅페이스에 공개했다. 이 모델은 image-text-to-text 태스크를 수행하며, 이미지와 함께 영상 이해(video-understanding) 기능을 지원하는 것으로 확인됐다.

모델 카드에는 multimodal, vision-language-model, streaming, conversational 등의 태그가 붙어 있어 단순 이미지 질의응답을 넘어 연속적인 대화형 상호작용과 영상 기반 입력 처리까지 염두에 둔 설계로 보인다. 관련 연구 내용은 arXiv 2607.24904 논문에 정리된 것으로 알려졌다.

배포 방식

Mage-VL은 Apache-2.0 라이선스로 공개돼 상업적 활용이 가능하다. Hugging Face Transformers 라이브러리에서 파이프라인 형태로 바로 불러올 수 있으며, vLLM과 SGLang을 통한 서버 배포도 지원된다. 커스텀 코드(trust_remote_code) 실행이 필요한 구조로, 표준 아키텍처 대신 자체 구현 방식을 택한 것으로 보인다.

공개 시점 기준 허깅페이스에서 좋아요 322개, 팔로워 2만1500명 규모의 마이크로소프트 계정을 통해 배포됐다는 점 외에 구체적인 파라미터 수나 벤치마크 성능은 모델 카드 발췌 내용에서 확인되지 않았다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글