Realtime TTS-2
Inworld AI推出的实时语音合成模型,可以通过自然语言指令实时调整声音的语调和情感。
简单来说
Realtime TTS-2是Inworld AI开发的语音合成程序,能把文字转换成人声朗读出来。
一般这类程序只能用预先设定好的单一语调说话,但这款程序可以像给演员做表演指导一样,通过「再开朗一点」「稍微悲伤一点」之类的指令,实时改变声音的语调和情感。它还能在保持同一个声音身份的前提下切换500多种方言,据该公司介绍,这种处理在150毫秒内就能完成,让对话听起来像真人交流一样自然流畅。
这是一项基础技术,可以用于呼叫中心客服机器人、有声书朗读等各种需要计算机用人声说话的服务。
在报道中是这样出现的
文章中提到,"Inworld AI正式发布了Realtime TTS-2,并登上了Artificial Analysis排行榜的第一位。"不过需要注意的是,这个第一名是该公司自行引用独立评测机构Artificial Analysis(对多个语音模型进行打分)的测评结果得出的,而且排名变动频繁——就在两周前,Cartesia的Sonic-3.6还是同一排行榜上的第一名。
亲手试一试
如果能用上像Realtime TTS-2这样可以通过指令调整语调的语音合成服务,可以对同一句话只改变指令,比较结果有何不同。
- 确定一句简短的话。例如:"今天的会议将于3点开始。"
- 用指令A读出来:"请用平静、公事公办的语调读这句话。"
- 用指令B再读一次同一句话:"请用兴奋、激动的语调读这句话。"
- 比较同样的文字根据不同指令听起来有多大差异。
