월~금 오전 7시, 일요일 오전 8시 — AI 뉴스와 용어를 보내드립니다메일로 받아보기

METAL LAB

Pika, WAN 3.0에 얼굴 2개·배경 1개 따로 지정해 시대극 제작

Pika API Club이 알리바바 WAN 3.0에 인물별·배경별 참조 이미지를 나눠 넣어 30초 시대극 영상을 만들었어요

영상 제작 툴의 캐릭터 설정과 장면 프롬프트를 보여주는 화면

이미지: @pika_labs (X) 영상 갈무리 · METAL LAB 편집

요약

  • Pika가 Pika API Club을 통해 WAN 3.0에 다중 레퍼런스 이미지와 상세 프롬프트를 넣어 30초짜리 시대극 영상을 만들었다고 공개했어요.
  • 프롬프트는 참조 이미지 3장의 역할을 여성 인물 얼굴, 남성 인물 얼굴, 배경 환경으로 각각 나눠 지정하고 대사가 동기화된 단일 숏을 요구했어요.
  • WAN 3.0은 알리바바의 Wan 팀이 지난 8월 6일 퍼블릭 베타로 공개한 영상 생성 모델로, Pika는 이를 자체 API 클럽으로 제공하는 쪽이에요.
원문 영상
모델
WAN 3.0 (개발: 알리바바 Wan)
제공 경로
Pika API Club
생성 모드
R2V(Reference-to-Video), 16:9, 30초 단일 숏, 영어 대사 동기화
레퍼런스 수
이미지 3장 (인물 2명 얼굴·의상 + 배경 환경)
장면 설정
19세기 초 영국 전원 로맨스(period drama)
WAN 3.0 공개일
2026년 8월 6일(UTC), 퍼블릭 베타

얼굴 두 개, 배경 하나 – 참조 이미지를 역할별로 나눴다

Pika가 자사 계정에 알리바바의 영상 생성 모델 WAN 3.0으로 만든 30초짜리 시대극 장면을 공개했어요. 이번 시연에서 눈에 띄는 건 참조 이미지 3장을 서로 다른 역할로 나눠 넣었다는 점이에요. 여성 인물 '미스 하틀리'의 얼굴과 의상을 담은 사진 한 장, 남성 인물 '엘라이어스'의 얼굴과 의상을 담은 사진 한 장, 그리고 초원과 저택이 보이는 배경 사진 한 장을 각각 다른 통제 대상으로 지정한 프롬프트를 함께 입력했어요. Pika는 이 모델의 개발사가 아니라, 자사가 운영하는 Pika API Club을 통해 WAN 3.0을 갖다 쓸 수 있게 제공하는 쪽이에요.

여성 인물 얼굴, 남성 인물 얼굴, 배경 이미지 세 개의 참조가 각각 자신의 역할만 통제하며 화살표로 하나의 합성 영상 노드로 모인다. 세 참조는 서로 겹치지 않고 독립적으로 결과물에 실선으로 연결된다.

WAN 3.0은 알리바바가 만든 영상 모델

WAN 3.0은 알리바바의 영상 생성 모델 계열인 Wan 팀이 지난 8월 6일(UTC 기준) 퍼블릭 베타로 공개한 모델이에요. 30초 길이 영상을 한 번에 만들어내는 네이티브 생성과 '리얼리티 그레이드' 렌더링을 내세웠고, 텍스트·이미지·음성·영상뿐 아니라 문서·스프레드시트·슬라이드·웹페이지까지 참조로 넣을 수 있는 Omni-Reference 기능을 특징으로 삼았어요. 이번 Pika의 시연은 그 참조 기능 가운데 인물별·환경별로 이미지를 분리해 지정하는 R2V(Reference-to-Video, 참조 기반 영상 생성) 모드를 보여준 사례예요.

실제 프롬프트 전문

Pika가 공개한 이미지에는 실제로 입력한 프롬프트 전문이 담겨 있었어요. 모드 지정부터 인물별 통제 범위, 장면의 감정선까지 상세하게 적혀 있어서 그대로 옮겨봐요.

먼저 모드는 "MODE: R2V, one coherent 30-second 16:9 live-action sequence with synchronized English dialogue"(R2V 모드, 영어 대사가 동기화된 16대9 비율의 하나로 이어진 30초 실사 영상)로 지정했어요.

레퍼런스 역할은 이미지별로 나눠 적었어요. "Image 1 controls only Miss Hartley's adult face, natural skin tone, dark low updo, proportions and pale full-length period dress"(이미지 1은 미스 하틀리의 성인 얼굴, 피부톤, 낮게 올린 짙은 색 머리, 체형, 옅은 색 롱드레스만 통제한다)라고 못 박았고, "Image 2 controls only Elias's adult face, dark wavy hair, proportions and refined coatless wardrobe: tailored waistcoat, neckcloth, fitted trousers and low leather shoes"(이미지 2는 엘라이어스의 성인 얼굴, 짙은 웨이브 머리, 체형, 코트 없는 정장 차림만 통제한다)로 두 번째 인물의 범위를 갈랐어요. 배경 이미지는 "Image 3 controls only the environment layout and atmosphere: high meadow, large mature tree at screen-right, distant manor at screen-left, rolling countryside and late-afternoon light"(이미지 3은 환경 배치와 분위기만 통제한다 — 높은 초원, 화면 오른쪽의 큰 나무, 화면 왼쪽의 먼 저택, 완만한 시골 풍경과 늦은 오후 빛)로 지정했고요.

혼선을 막으려는 지시도 붙었어요. "Ignore white character-sheet backgrounds, duplicate views and reference poses. Show one woman and one man only"(흰색 캐릭터 시트 배경, 중복된 시점, 참조 포즈는 무시하고 여성 한 명과 남성 한 명만 등장시켜라)라고 명시했어요.

장면의 감정선도 구체적으로 적었어요. "The scene's emotional turn is that an intelligent, self-possessed woman realizes a wealthy young gentleman is quietly promising to remain"(영리하고 침착한 여성이, 부유한 젊은 신사가 조용히 남겠다고 약속하고 있음을 깨닫는 것이 이 장면의 감정적 전환점이다)이라는 문장으로 스토리 핵심을 못 박았고, 촬영 톤은 "Fine 35mm grain, gentle halation, soft highlights, mild lens bloom and natural skin. Warm late-afternoon side-backlight, muted greens and cool"(미세한 35mm 그레인, 은은한 헤일레이션, 부드러운 하이라이트, 옅은 렌즈 블룸과 자연스러운 피부, 따뜻한 늦은 오후 측면 역광, 채도 낮은 초록과 차가운 색)로 지정했어요. 원문은 이 대목에서 문장이 잘려 있어요.

이미지: @pika_labs (X)

Pika API Club에서 시도하는 법

Pika는 이 영상을 Pika API Club을 통해 만들었다고 밝혔어요. Pika API Club은 Pika가 운영하는 창구로, WAN 3.0 같은 외부 모델을 API 형태로 붙여 쓸 수 있게 해주는 서비스예요. 트윗에는 API Club으로 연결되는 링크가 함께 걸려 있었어요.

이렇게 인물·배경을 이미지별로 나눠 지정하는 방식은 광고나 짧은 드라마처럼 캐릭터 일관성이 중요한 영상을 만들 때 참고할 만해요. 예를 들어 같은 인물의 얼굴을 여러 장면에서 유지해야 하는 브랜드 영상이나, 배경만 바꿔가며 같은 배우로 여러 컷을 찍어야 하는 웹드라마 예고편을 만들 때 이번 프롬프트의 역할 분담 구조를 그대로 옮겨 써볼 수 있어요.

에디터의 시선

최근 영상 생성 모델 경쟁에서 화두는 해상도나 길이보다 '레퍼런스를 얼마나 정교하게 나눠 받아들이느냐'로 옮겨갔어요. WAN 3.0이 이번에 보여준 건 얼굴 두 개와 배경 하나를 서로 침범하지 않게 분리해 처리하는 능력인데, 이건 런웨이나 미드저니 계열이 오랫동안 씨름해온 '캐릭터 일관성' 문제를 참조 이미지 역할 분담이라는 다른 방식으로 풀려는 시도로 보여요. Omni-Reference처럼 참조 입력의 종류를 늘리는 것과, 이번처럼 참조 이미지 각각에 역할을 명시적으로 배정하는 것은 서로 다른 축의 발전이고, 알리바바 Wan 팀이 두 축을 동시에 밀고 있다는 뜻이기도 해요.

이런 류의 레퍼런스 기반 영상 모델을 실무에 붙여보면 늘 비슷한 지점에서 막혀요. 인물이 둘 이상 등장하는 순간 얼굴이 섞이거나, 배경 이미지 속 인물 포즈를 그대로 따라 하는 식이에요. 이번 프롬프트에 "흰색 캐릭터 시트 배경, 중복된 시점, 참조 포즈는 무시하라"는 문구가 굳이 들어간 것도, 그런 오염을 막으려는 실무자의 경험이 반영된 결과로 읽혀요.

국내에서 영상 콘텐츠를 다루는 팀이라면 프롬프트에 레퍼런스별 통제 범위를 문장으로 명시하는 습관을 들여볼 만해요. "이미지 1은 얼굴만, 이미지 2는 의상만, 이미지 3은 배경만"처럼 역할을 나눠 적는 방식은 모델이 바뀌어도 재사용할 수 있는 뼈대예요. 다만 30초 단일 숏에 대사 동기화까지 요구하는 건 아직 소수 API 창구에서만 시도되는 수준이라, 상업 제작에 바로 투입하기보다는 콘티나 프리비즈 단계에서 먼저 검증해보는 편이 안전해요.

Pika API Club이 WAN 3.0 같은 외부 모델을 계속 실어 나르는 흐름을 보면, 몇 주 안에 인물 3명 이상을 동시에 통제하는 프롬프트 사례나 대사 언어를 영어 외로 확장한 시연이 나올 가능성이 커요.

댓글