네이티브 멀티모달 모델
Native Multimodal Model
글, 사진, 소리, 영상을 하나의 모델이 처음부터 함께 배워서 이해하는 AI 모델
쉽게 말하면
네이티브 멀티모달 모델은 글자, 사진, 소리, 영상을 하나의 모델이 처음부터 한꺼번에 배워서 이해하는 AI예요. 여기서 '모달'은 정보가 들어오는 형태(글인지, 그림인지, 소리인지)를 뜻하고, '멀티모달'은 그런 여러 형태를 함께 다룬다는 말이에요.
예전 방식은 통역사 여러 명을 릴레이로 거치는 것과 비슷했어요. 사진을 잘 보는 모델이 먼저 '이 사진에는 강아지가 있다'는 설명 글을 만들면, 그 글을 다시 언어 모델에 넘겨서 답을 완성하는 식이었죠. 이 과정에서 사진의 미묘한 표정이나 소리의 억양 같은 디테일이 중간에 손실되기 쉬웠어요.
네이티브 멀티모달 모델은 태어날 때부터 여러 언어와 감각을 동시에 익힌 사람에 가까워요. 사진과 글, 목소리를 따로따로 거치지 않고 한 모델 안에서 바로 연결해 이해하기 때문에, 정보가 덜 깎여 나가고 여러 형태를 넘나드는 질문에도 더 자연스럽게 답할 수 있어요.
