工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

Pika用WAN 3.0分别指定两张人脸和一张背景制作时代剧

Pika API Club将人物与背景的参考图分开输入阿里巴巴WAN 3.0,制作出一段30秒的时代剧视频

영상 제작 툴의 캐릭터 설정과 장면 프롬프트를 보여주는 화면

이미지: @pika_labs (X) 영상 갈무리 · METAL LAB 편집

摘要

  • Pika宣布通过Pika API Club,向WAN 3.0输入多张参考图和详细提示词,制作出一段30秒的时代剧视频。
  • 提示词将3张参考图的角色分别指定为女性人物脸部、男性人物脸部和背景环境,并要求生成台词同步的单一镜头。
  • WAN 3.0是阿里巴巴Wan团队于8月6日以公测形式发布的视频生成模型,Pika则通过自家的API Club提供该模型的调用服务。
原文视频
모델
WAN 3.0 (개발: 알리바바 Wan)
제공 경로
Pika API Club
생성 모드
R2V(Reference-to-Video), 16:9, 30초 단일 숏, 영어 대사 동기화
레퍼런스 수
이미지 3장 (인물 2명 얼굴·의상 + 배경 환경)
장면 설정
19세기 초 영국 전원 로맨스(period drama)
WAN 3.0 공개일
2026년 8월 6일(UTC), 퍼블릭 베타

两张脸,一个背景——参考图按角色拆分

Pika在自己的账号上公开了一段用阿里巴巴视频生成模型WAN 3.0制作的30秒时代剧片段。这次演示的亮点在于,3张参考图被分别赋予了不同的角色。提示词中分别指定了女性人物"哈特利小姐"的脸部与服装照片一张、男性人物"埃利亚斯"的脸部与服装照片一张,以及能看到草原和庄园的背景照片一张,各自作为独立的控制对象输入。需要说明的是,Pika并非这款模型的开发方,而是通过自己运营的Pika API Club提供WAN 3.0的调用服务。

女性人物脸部、男性人物脸部、背景图像三个参考各自只控制自己的角色,通过箭头汇入同一个合成视频节点。三个参考互不重叠,各自独立地以实线连接到最终成片。

WAN 3.0是阿里巴巴打造的视频模型

WAN 3.0是阿里巴巴视频生成模型系列Wan团队于8月6日(UTC时间)以公测形式发布的模型。该模型主打一次性生成30秒长视频的原生生成能力,以及"真实感级"渲染效果,并具备Omni-Reference功能——除了文本、图像、语音、视频外,还能将文档、电子表格、幻灯片乃至网页作为参考输入。这次Pika的演示展示的正是该参考功能中的R2V(Reference-to-Video,基于参考生成视频)模式,即按人物和环境分别指定图像的用法。

实际提示词全文

Pika公开的图片中包含了实际输入的完整提示词。从模式设定、各人物的控制范围,到场景的情感走向都写得相当详细,原文照录如下。

首先是模式设定:"MODE: R2V, one coherent 30-second 16:9 live-action sequence with synchronized English dialogue"(R2V模式,生成一段台词与画面同步、16:9画幅、连贯统一的30秒实景视频)。

参考图的角色分工则按图逐一说明。"Image 1 controls only Miss Hartley's adult face, natural skin tone, dark low updo, proportions and pale full-length period dress"(图1仅控制哈特利小姐的成年人脸部、自然肤色、低盘深色发髻、身材比例以及浅色长款时代裙装),明确限定了第一张图的范围;"Image 2 controls only Elias's adult face, dark wavy hair, proportions and refined coatless wardrobe: tailored waistcoat, neckcloth, fitted trousers and low leather shoes"(图2仅控制埃利亚斯的成年人脸部、深色波浪发型、身材比例以及不含外套的精致穿着——剪裁合身的马甲、领巾、修身长裤和低帮皮鞋),同样划定了第二个人物的边界。背景图像则被限定为:"Image 3 controls only the environment layout and atmosphere: high meadow, large mature tree at screen-right, distant manor at screen-left, rolling countryside and late-afternoon light"(图3仅控制环境布局与氛围——高地草原、画面右侧一棵茂盛大树、画面左侧远处的庄园、起伏的乡野和傍晚时分的光线)。

为避免混淆,提示词中还加入了明确排除指令:"Ignore white character-sheet backgrounds, duplicate views and reference poses. Show one woman and one man only"(忽略白色角色设定图背景、重复视角和参考姿势,画面中只能出现一名女性和一名男性)。

场景的情感走向也写得十分具体:"The scene's emotional turn is that an intelligent, self-possessed woman realizes a wealthy young gentleman is quietly promising to remain"(这场戏的情感转折点在于,一位聪慧、沉着的女性意识到,一位富有的年轻绅士正在悄悄承诺留下来),以此确立了故事的核心;而画面基调则被设定为:"Fine 35mm grain, gentle halation, soft highlights, mild lens bloom and natural skin. Warm late-afternoon side-backlight, muted greens and cool"(细腻的35mm胶片颗粒感、柔和的光晕、轻柔的高光、淡淡的镜头光晕以及自然肤色,温暖的傍晚侧逆光,低饱和度的绿色与冷色调)。原文提示词在这一处被截断,后续内容并未公开。

이미지: @pika_labs (X)

如何在Pika API Club上体验

Pika表示这段视频是通过Pika API Club制作的。Pika API Club是Pika运营的一个入口,让用户能以API形式接入WAN 3.0等外部模型来使用。相关推文中还附上了跳转到API Club的链接。

这种将人物与背景分别指定参考图的方法,对于需要保持角色一致性的广告或短剧制作很有参考价值。比如在需要同一人物脸部在多个场景中保持一致的品牌宣传片中,或是需要同一演员在不同背景下拍摄多个镜头的网剧预告片中,都可以直接套用这次提示词中展示的角色分工结构。

编辑视角

近来视频生成模型的竞争焦点,已经从分辨率或时长转移到了"能多精细地拆分并接收参考输入"上。WAN 3.0这次展示的能力,是把两张人脸和一个背景互不干扰地分开处理,这可以看作是对Runway、Midjourney系一直以来纠结的"角色一致性"难题,用参考图角色分工这种不同方式给出的解法。像Omni-Reference那样扩充参考输入的种类,和这次这样为每张参考图明确分配角色,是两个不同维度的进步,也说明阿里巴巴Wan团队正同时在这两条线上发力。

在实际业务中使用这类基于参考图的视频模型时,常常会卡在相似的地方——一旦出现两个以上人物,脸部就容易混淆,或者模型会照搬背景图中人物的姿势。这次提示词里特意加入"忽略白色角色设定图背景、重复视角和参考姿势"这样的措辞,读起来更像是从业者为防止这类"污染"而积累出的经验之谈。

如果国内团队在做视频内容,不妨养成在提示词中用完整句子明确各参考图控制范围的习惯。像"图1只管脸部、图2只管服装、图3只管背景"这样按角色拆分的写法,是一套即便换了模型也能沿用的骨架。不过要求单一30秒镜头还要同步台词,目前仍只在少数API入口中被尝试,与其直接投入商业制作,不如先在分镜稿或预演阶段验证效果更为稳妥。

从Pika API Club持续接入WAN 3.0等外部模型的趋势来看,不久之后很可能会出现同时控制三人以上人物的提示词案例,或者台词语言扩展到英语之外的演示。

评论