비디오 언어 모델
Video Language Model
영상 속 장면·인물·행동을 이해해서 자연어로 설명하거나 검색할 수 있게 하는 AI 모델
쉽게 말하면
비디오 언어 모델은 영상을 보고 그 안에서 무슨 일이 벌어지는지 이해하는 AI다. 사람이 테이프를 처음부터 끝까지 보면서 어디에 뭐가 나오는지 노트에 적어두던 일을, 이 모델이 대신 영상을 훑어보며 자동으로 정리해준다고 생각하면 된다.
예를 들어 영상 한 편을 넣으면 이 모델은 장면을 나누고, 각 장면에 누가 나오는지, 무슨 행동을 하는지, 어떤 사물이 등장하는지를 자연어 문장으로 뽑아낸다. 그러면 나중에 사람이 굳이 태그를 미리 달아두지 않아도 계단, 달리는 사람들, 빗속 축구 골처럼 말로 검색하면 해당 장면을 바로 찾을 수 있다. 폭력이나 고어처럼 걸러내야 할 장면을 자동으로 표시하는 데도 쓰인다.
방송사나 미디어 회사처럼 영상 자료가 산더미처럼 쌓인 곳에서는 이런 모델이 창고 속 테이프를 검색 가능한 데이터로 바꿔주는 역할을 한다.
기사에서 이렇게 나와요
기사에서는 트웰브랩스의 비디오 언어 모델 페가수스(Pegasus)가 영상을 장면 단위로 쪼개고 폭력·고어·마약 관련 장면을 컴플라이언스 카테고리에 맞춰 자동으로 플래그 처리한다고 설명한다. 여기서 헷갈리기 쉬운 점은, 이 모델이 단순히 영상 화면을 인식하는 것을 넘어 발화 내용과 오디오 신호까지 함께 읽어 장면의 의미를 판단한다는 것이다. 즉 화면만 보는 게 아니라 영상 전체를 종합적으로 이해해 자연어로 설명해내는 모델이다.
직접 해보기
영상 검색이나 아카이브 도구에 자연어로 질문을 넣어보면 비디오 언어 모델의 작동 방식을 체감할 수 있다.
- 영상 검색 기능이 있는 도구를 연다.
- 태그 없이 상황을 묘사하는 문장을 입력한다. 예: 흰 셔츠를 입은 선수가 빗속에서 왼쪽에서 오른쪽으로 슛하는 장면
- 결과로 나온 장면이 실제 조건과 얼마나 일치하는지 확인한다.
- 조건을 하나씩 추가해 복합 문장으로 바꿔보고 검색 정확도가 어떻게 달라지는지 비교한다.
