Reference-to-Video
一种视频生成方式:把人物脸孔、背景等参考图像分别指定不同角色,从而在生成结果中保留各自特征。
简单来说
Reference-to-Video 是这样一种方式:在把人脸照片、背景照片等参考图像输入视频生成 AI 时,提前规定好每张图片负责最终结果的哪一部分。打个比方,就像拍电影时,导演把演员的形象照交给一个工作人员,说“只参考这张脸”,又把片场照片交给另一个工作人员,说“只参考这个背景”,分头指派任务。
过去,如果只放入一两张参考图,AI 会自行揣测整体氛围并加以体现;而 Reference-to-Video 的不同之处在于,可以明确划分角色,比如“这张照片只管脸”“那张照片只管服装”“那张照片只管背景”。这样一来,即便场景中有多个人物、还有单独的背景,也能一次性生成出来,而不会让各张参考图相互混杂。
在报道中是这样出现的
文章中提到,Pika 用阿里巴巴的视频生成模型 WAN 3.0 制作了一段 30 秒的古装剧场景,把女性人物的脸部照片、男性人物的脸部照片、背景照片分别指定为不同角色,使用了 Reference-to-Video(R2V)模式。容易混淆的一点是:R2V 并不是某家公司独有的专属技术名称,而是泛指把参考图像按角色分开输入这一功能本身。Pika 并非 WAN 3.0 的开发方,而是通过自家服务让用户可以使用这一模型的一方。
亲手试一试
如果你使用的视频生成工具支持多张参考图,可以像下面这样,在提示词中用明确的句子锁定每张图片的角色:
图片1只控制人物A的脸部和服装。 图片2只控制人物B的脸部和服装。 图片3只控制背景和氛围。
这样分开写明角色后,人物和背景就更不容易相互混杂,结果也更有可能按照你分别放入的参考图来呈现。
