Lip Sync
让视频中人物的口型自动匹配语音内容的AI技术。
简单来说
Lip Sync是一种让视频中人物的口型与声音完全对上的技术。看外语电影的配音版时,如果演员的嘴唇在说英语,但听到的却是韩语配音,就会让人觉得别扭。Lip Sync消除了这种错位,不管把声音换成哪种语言,口型看起来都像是在真实地说那种语言。
过去,配音演员会一边调整台词一边配合原语言的口型来录音,而现在AI可以分析语音波形,自动生成与之匹配的口型视频。这项技术常用于制作多语言版本的企业培训视频,以及生成有真人出镜的多语言AI虚拟形象视频。不过,Lip Sync与整张脸替换的技术不同。它只匹配声音和口型,脸部和表情本身与原始视频保持一致。
不过值得指出的是,随着Lip Sync技术越来越精细,它被用来伪造某人说过实际上并未说过的话的风险也在随之增大。
在报道中是这样出现的
Synthesia在将配音功能扩展到多语言时,将其描述为“匹配原语言说话者口型的Lip Sync”。也就是说,这不仅仅是翻译声音后简单叠加,而是自然地重新生成用新语言说话时的口型。由于Lip Sync是匹配口型与声音的技术,而非改变脸部本身的技术,因此应将其与合成整张脸的深度伪造(deepfake)区分开来看待。
