Cross-lingual voice transfer
一种语音合成技术,能把用一种语言录制的嗓音特色原样套用到另一种语言的语句上。
简单来说
可以联想一下配音现场。如果原演员用韩语演出的嗓音要原样套到英语台词上,通常得重新找一位配音演员来配。跨语言声音迁移则不需要重新找人,而是只提取原说话人的音色和语调,再把它套用到另一种语言的句子上。也就是把说话内容(语言)和嗓音身份(说话人)分开处理:说话人保持不变,只替换语言。
这项技术之所以有用,是因为在多语言内容中,同一个人物用不同语言说话时嗓音也应保持一致。比如制作一段演讲者分别用韩语、英语、日语讲话的视频时,如果每种语言都由不同的人配音,人物的一致性就会被打破。跨语言声音迁移以原说话人的嗓音为轴心,只替换语言部分,由此解决这个问题。
不过,由于这项技术直接处理的是真实存在的人的嗓音特征,一旦未经本人同意就把他人的声音用作素材,立刻会引发法律和伦理问题。技术上能做到,和是否可以这样使用,是两个完全不同的问题。
在报道中是这样出现的
据介绍,audio.cpp 0.5 通过名为 Confucius4 的模型新增了跨语言声音迁移功能。这里常见的误解是把它当成翻译功能。实际上,句子所使用的语言已经是确定的(翻译是另外的步骤),这项技术更接近于用原说话人的音色特征把这句话读出来。它主要用于在多语言配音中保持说话人的一致性。
