每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI 용어사전기사에 자주 나오는 기술 용어

비전 언어 모델

VLM

「보는 능력」이 있는 언어 모델. 사진을 주면 내용을 읽고 설명한다.

쉽게 말하면

VLM(Vision Language Model, 비전 언어 모델)은 「보는 능력」을 가진 언어 모델입니다. 사진·그림·문서를 입력하면 그 내용을 읽고, 글로 설명하고, 질문에 답합니다.

언어 모델(LLM)이 글만 아는 필담 상대라면, VLM은 눈이 달린 대화 상대입니다. 그래프가 든 보고서를 통째로 이해하고, 스크린샷 속 오류 메시지를 읽고, 냉장고 사진에서 재료를 알아봅니다.

멀티모달이라는 큰 우산 아래 「시각+언어」에 집중한 갈래가 VLM이라고 정리하면 됩니다. 최근에는 로봇·자율주행에 쓰이는 파생형도 자주 등장합니다 — 카메라로 본 것을 이해하고 행동으로 옮기는 모델(VLA)이 그것입니다. 기사에서 VLM이 보이면 「이미지를 이해하는 AI 두뇌」로 바꿔 읽으세요.

기사에서 이렇게 나와요

「신형 VLM, 차트·문서 이해 벤치마크 1위」 — 표·그래프·손글씨처럼 「어려운 보기」를 얼마나 정확히 읽는지가 VLM 경쟁의 주 종목입니다.

직접 해보기

  1. 뉴스나 보고서에서 차트·그래프가 있는 화면을 캡처합니다.
  2. 챗봇에 첨부하고 이렇게 물어보세요: 「이 차트에서 1위와 3위의 차이를 설명하고, 이 추세가 이어지면 어떻게 될지 한 줄로 말해 줘」
  3. 글자·막대·축을 함께 읽고 추론까지 하는 것 — 사진 묘사를 넘어선 「보는 이해」가 VLM의 실력입니다. 손글씨 메모나 복잡한 표로도 시험해 보세요.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기