One email each morning — yesterday's AI, sortedGet it in your inbox

METAL LAB

AI 용어사전쓰다 보면 만나는 말

멀티모달

Multimodal

글자만이 아니라 이미지·소리·영상까지 함께 이해하고 만들어 내는 능력.

쉽게 말하면

모달리티(modality)는 정보의 형태를 말합니다 — 글, 이미지, 소리, 영상. 멀티모달은 이 여러 형태를 한 모델이 함께 다룬다는 뜻입니다.

초기 언어 모델은 글만 읽고 글만 썼습니다. 눈과 귀가 없는 필담 상대였던 셈이죠. 멀티모달 모델은 사진을 보여 주면 내용을 읽고, 말로 걸면 알아듣고 목소리로 답하며, 표와 그래프가 섞인 문서도 통째로 이해합니다.

지금 나오는 주력 모델(GPT·클로드·제미나이 최신판)은 기본이 멀티모달입니다. 「냉장고 사진을 찍어 올리면 요리를 추천받는」 사용법이 가능해진 배경이고, 새 모델 발표에서 「음성 대화」 「화면 이해」 시연이 빠지지 않는 이유입니다.

기사에서 이렇게 나와요

「이미지·음성·영상을 아우르는 멀티모달 성능을 강조했다」 — 글자 밖의 능력, 특히 「보고 듣는」 능력이 세일즈 포인트라는 뜻입니다.

직접 해보기

  1. 손글씨 메모나 영수증, 칠판 사진을 한 장 찍습니다.
  2. 챗GPT나 클로드에 사진을 첨부하고 「여기 적힌 내용을 표로 정리해 줘」라고 입력합니다.
  3. 글자가 아닌 것(사진)을 글로 바꿔 내는 것 — 이게 멀티모달입니다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기