비전 언어 모델
VLM
「보는 능력」이 있는 언어 모델. 사진을 주면 내용을 읽고 설명한다.
쉽게 말하면
VLM(Vision Language Model, 비전 언어 모델)은 「보는 능력」을 가진 언어 모델입니다. 사진·그림·문서를 입력하면 그 내용을 읽고, 글로 설명하고, 질문에 답합니다.
언어 모델(LLM)이 글만 아는 필담 상대라면, VLM은 눈이 달린 대화 상대입니다. 그래프가 든 보고서를 통째로 이해하고, 스크린샷 속 오류 메시지를 읽고, 냉장고 사진에서 재료를 알아봅니다.
멀티모달이라는 큰 우산 아래 「시각+언어」에 집중한 갈래가 VLM이라고 정리하면 됩니다. 최근에는 로봇·자율주행에 쓰이는 파생형도 자주 등장합니다 — 카메라로 본 것을 이해하고 행동으로 옮기는 모델(VLA)이 그것입니다. 기사에서 VLM이 보이면 「이미지를 이해하는 AI 두뇌」로 바꿔 읽으세요.
기사에서 이렇게 나와요
「신형 VLM, 차트·문서 이해 벤치마크 1위」 — 표·그래프·손글씨처럼 「어려운 보기」를 얼마나 정확히 읽는지가 VLM 경쟁의 주 종목입니다.
직접 해보기
- 뉴스나 보고서에서 차트·그래프가 있는 화면을 캡처합니다.
- 챗봇에 첨부하고 이렇게 물어보세요: 「이 차트에서 1위와 3위의 차이를 설명하고, 이 추세가 이어지면 어떻게 될지 한 줄로 말해 줘」
- 글자·막대·축을 함께 읽고 추론까지 하는 것 — 사진 묘사를 넘어선 「보는 이해」가 VLM의 실력입니다. 손글씨 메모나 복잡한 표로도 시험해 보세요.
함께 볼 용어
이 용어가 나온 기사
- 코히어, 24억 파라미터 비전모델 '노스 마이크로 비전' 공개模型 · 2026.08.13
- MS리서치, 흉부 엑스레이 심장비율 직접 계산하는 CARE-X 공개研究 · 2026.08.12
- 엔비디아, 양자컴퓨터 자동 보정용 VLM '이징 1.5' 공개研究 · 2026.08.09
- NVIDIA, 비전-언어 대신 영상으로 배우는 로봇 정책 제시研究 · 2026.08.09
- vLLM 리드 메인테이너, 50만 GPU 규모 오픈모델 운영 경험 공개模型 · 2026.08.09
- llama.cpp, AMD ROCm 7.14용 CI 빌드 타깃 추가产品 · 2026.08.11