참조 기반 영상 생성
Reference-to-Video
인물 얼굴이나 배경 같은 참조 이미지를 역할별로 나눠 지정해 그 특징을 유지한 채 영상을 만드는 방식
쉽게 말하면
참조 기반 영상 생성은 사람 얼굴 사진이나 배경 사진 같은 참조 이미지를 영상 생성 AI에 넣으면서, 각 사진이 결과물의 어떤 부분을 책임질지 미리 정해주는 방식이에요. 영화 촬영에 비유하면, 감독이 배우 프로필 사진은 '이 얼굴만 참고하라'고, 세트장 사진은 '이 배경만 참고하라'고 서로 다른 스태프에게 따로 나눠주는 것과 비슷해요.
기존에는 참조 이미지 한두 장을 넣으면 AI가 전체 분위기를 알아서 짐작해 반영했다면, 참조 기반 영상 생성은 '이 사진은 얼굴만', '저 사진은 옷차림만', '그 사진은 배경만' 하는 식으로 역할을 명확히 나눠 지시할 수 있다는 점이 달라요. 그 덕분에 등장인물이 여럿이고 배경도 따로 있는 복잡한 장면을, 사진들이 서로 뒤섞이지 않은 채로 한 번에 만들어낼 수 있어요.
기사에서 이렇게 나와요
기사에서는 'Pika가 알리바바의 영상 생성 모델 WAN 3.0으로 30초짜리 시대극 장면을 만들면서, 여성 인물 얼굴 사진 한 장, 남성 인물 얼굴 사진 한 장, 배경 사진 한 장을 각각 다른 역할로 지정해 참조 기반 영상 생성(R2V) 모드를 사용했다'고 설명해요. 헷갈리기 쉬운 점: R2V는 특정 회사의 독자 기술 이름이 아니라, 참조 이미지를 역할별로 나눠 넣는 기능 자체를 가리키는 말이에요. Pika는 WAN 3.0을 만든 곳이 아니라 자사 서비스를 통해 이 모델을 쓸 수 있게 제공하는 쪽이에요.
직접 해보기
영상 생성 도구가 참조 이미지 여러 장을 지원한다면, 아래처럼 이미지별 역할을 문장으로 못박아 프롬프트에 적어보세요.
이미지 1은 인물 A의 얼굴과 의상만 통제한다. 이미지 2는 인물 B의 얼굴과 의상만 통제한다. 이미지 3은 배경과 분위기만 통제한다.
이렇게 역할을 나눠 적으면 인물과 배경이 서로 뒤섞이지 않고, 각각 넣은 참조 사진대로 반영될 확률이 높아져요.
