멀티모달
Multimodal
글자만이 아니라 이미지·소리·영상까지 함께 이해하고 만들어 내는 능력.
쉽게 말하면
모달리티(modality)는 정보의 형태를 말합니다 — 글, 이미지, 소리, 영상. 멀티모달은 이 여러 형태를 한 모델이 함께 다룬다는 뜻입니다.
초기 언어 모델은 글만 읽고 글만 썼습니다. 눈과 귀가 없는 필담 상대였던 셈이죠. 멀티모달 모델은 사진을 보여 주면 내용을 읽고, 말로 걸면 알아듣고 목소리로 답하며, 표와 그래프가 섞인 문서도 통째로 이해합니다.
지금 나오는 주력 모델(GPT·클로드·제미나이 최신판)은 기본이 멀티모달입니다. 「냉장고 사진을 찍어 올리면 요리를 추천받는」 사용법이 가능해진 배경이고, 새 모델 발표에서 「음성 대화」 「화면 이해」 시연이 빠지지 않는 이유입니다.
기사에서 이렇게 나와요
「이미지·음성·영상을 아우르는 멀티모달 성능을 강조했다」 — 글자 밖의 능력, 특히 「보고 듣는」 능력이 세일즈 포인트라는 뜻입니다.
직접 해보기
- 손글씨 메모나 영수증, 칠판 사진을 한 장 찍습니다.
- 챗GPT나 클로드에 사진을 첨부하고 「여기 적힌 내용을 표로 정리해 줘」라고 입력합니다.
- 글자가 아닌 것(사진)을 글로 바꿔 내는 것 — 이게 멀티모달입니다.
함께 볼 용어
이 용어가 나온 기사
- 마이크로소프트, 영상 이해 가능한 비전-언어 모델 Mage-VL 공개模型 · 2026.08.10
- FLUX 3 비디오 정식 개방…20초에 소리까지, 한국어는 빠졌다模型 · 2026.08.05
- LTX-2.5, 개인 PC RTX 한 장서 도는 오픈 영상 생성모델 공개研究 · 2026.08.12
- 루마, Luma Agents에 미니맥스 H3 영상 모델 통합产品 · 2026.08.09
- NVIDIA, 오픈 월드모델 'Cosmos 3'로 피지컬 AI 생태계 확장产品 · 2026.08.09
- 트웰브랩스·Mimir, 영상 아카이브 AI 검색 통합产品 · 2026.08.05