멀티모달 미디어 임베딩
Multimodal Media Embedding
영상·소리·글자처럼 서로 다른 형태의 콘텐츠를 하나의 숫자 좌표로 바꿔 의미로 비교·검색하게 하는 기술.
쉽게 말하면
멀티모달 미디어 임베딩은 영상, 소리, 글자처럼 서로 다른 형태의 콘텐츠를 컴퓨터가 서로 비교할 수 있는 하나의 숫자 좌표로 바꾸는 기술이다.
방송사 창고에 테이프가 산더미처럼 쌓여 있고, 안에 뭐가 담겼는지는 담당자가 손으로 쓴 메모장에만 적혀 있다고 해보자. 그 담당자가 그만두면 아무도 내용을 모른다. 이 기술은 담당자 대신 영상 속 장면, 사람들의 말, 배경 소리까지 전부 훑어보고, 각 순간의 특징을 지문처럼 압축한 좌표 하나씩으로 남겨둔다. 사진이든 영상이든 소리든 형태는 달라도 결국 같은 좌표계 위에 놓이기 때문에, 서로 얼마나 비슷한지를 계산으로 비교할 수 있게 된다.
좌표가 만들어져 있으면 사람이 미리 태그를 달아두지 않아도 검색이 된다. 누군가 '계단'이나 '비 오는 날 슛하는 장면'이라고 문장으로 입력하면, 그 문장도 같은 방식으로 좌표로 바뀌어 가장 가까운 좌표를 가진 순간을 찾아준다. 태그가 아니라 뜻으로 찾는 검색이 가능해지는 것도 이 좌표 변환 덕분이다.
기사에서 이렇게 나와요
직접 해보기
영상 검색 기능이 있는 서비스를 쓸 때, 태그나 키워드 대신 상황을 문장으로 그대로 적어 검색해 보라. 예를 들어 '비 오는 날 왼쪽에서 오른쪽으로 슛하는 흰 셔츠 선수'처럼 구체적으로 묘사한 문장을 넣고, 결과가 사람이 미리 달아둔 태그 없이도 나오는지 확인해 보면 이 기술이 하는 일을 체감할 수 있다.
