voice steering
用自然语言指令实时调整AI语音的语气、情绪和表现方式的功能
简单来说
voice steering 就是让朗读文字的AI语音,按照你用文字给出的「表演指导」来说话的功能。这有点像给配音演员递上台词本时说「这里用耳语的方式念」「这句话要念得生气一点」——只不过接收指令并当场把它体现在声音上的,不是人类演员,而是AI。
以往的语音合成大多只能用一种固定语气朗读。想要悲伤的声音和开朗的声音,通常要从一开始就选择不同的设置。而支持voice steering的系统则不同:即便是同一句话,只要把提示词改成「用疲惫低沉的声音说」,输出结果就会完全不同。这与大语言模型能听懂自然语言指令的方式类似——语音合成模型也可以通过指令来操控语气、情绪和说话方式。
在保持同一说话人身份的前提下切换语言或方言,也常常和这项功能一起被介绍。它可以用于呼叫中心机器人根据情况调整语气,或有声书旁白在不同场景中表现出不同的情绪。
在报道中是这样出现的
Inworld AI在介绍其语音合成模型Realtime TTS-2时表示,「借助voice steering功能,可以像做表演指导一样,用自然语言随时调整声音的语气或情绪」。这里需要准确理解:这个说法并不是指改变声音本身(说话人的性别、年龄等身份特征),而是指在保持同一说话人身份不变的情况下,仅通过指令调整语气、情绪和表演风格。
亲手试一试
在语音合成工具中输入同一句话两次进行对比,就能直观感受到差别。
- 只输入句子:今天的会议已取消。
- 加上指令输入:(用疲惫低沉、略带抱歉的语气)今天的会议已取消。
- 换一种指令再输入:(用开朗轻快、像广播通知一样的语气)今天的会议已取消。
听一听同样的文字在语气和情绪上会有多大差异,就能直观理解voice steering究竟在做什么。
