METAL LAB

Inworld AI发布实时TTS-2 语音合成榜首之争再起

Inworld AI宣布,自己重新夺回了两周前被Cartesia拿下的Artificial Analysis榜首位置

摘要

  • Inworld AI正式发布(GA)了实时语音合成模型Realtime TTS-2,并宣称自己登上了Artificial Analysis排行榜榜首。
  • 该模型延迟低于150毫秒,支持用自然语言调节语调的"语音操控"功能,还能让同一说话人在500多种方言之间自由切换。
  • 就在两周前的8月19日,Cartesia的Sonic-3.6还占据着同一排行榜的榜首,如今领先位置再度易主。
Realtime TTS-2 is GA today, now the #1 model on Artificial Analysis and fastest TTS in the world of its class.

Inworld AI宣布Realtime TTS-2正式发布

Realtime官方网站

图中显示,以粗框标出的Cartesia在8月19日用虚线箭头占据了排行榜位置(虚线圆圈),随后以圆点标出的Inworld又在9月2日用虚线箭头重新夺回了同一位置。两个箭头都是虚线,这也暗示着这个榜首位置随时可能再次易主,只是暂时的。图中显示,以粗框标出的Cartesia在8月19日用虚线箭头占据了排行榜位置(虚线圆圈),随后以圆点标出的Inworld又在9月2日用虚线箭头重新夺回了同一位置。两个箭头都是虚线,这也暗示着这个榜首位置随时可能再次易主,只是暂时的。

Inworld AI在9月2日(当地时间)于自家X账号发布的公告视频中宣布,实时语音合成模型"Realtime TTS-2"已正式发布(GA,General Availability)。该公司在发布中表示,这款模型登上了Artificial Analysis排行榜榜首,并且是同级别中速度最快的TTS模型。TTS(Text-to-Speech,文本转语音)是一种能把文字转换成逼真人声的语音合成技术,从呼叫中心的客服机器人到有声书朗读,应用范围十分广泛。

简单来说,Artificial Analysis是一家独立评测机构,专门实测各类AI模型的性能、速度和价格并据此排名。由于这家机构本身不开发模型、只负责打分,业内在证明自身性能时常常会引用它给出的"榜首"结果。

该公司表示,产品在研究预览阶段就涌入了远超预期的使用量,团队把这段经验重新反馈到研发中,才推出了这次的GA版本。公司将此次发布评价为"Inworld历史上最大的一次飞跃"。

榜首位置两周内再度易主

这个排行榜在最近一个月里其实已经易主过一次。8月19日,Cartesia的流式TTS模型Sonic-3.6曾同时拿下"供应商语音"和"可控语音"两个榜单的第一名。而这次Inworld AI又在同一排行榜上宣称夺回榜首,意味着领先位置在不到两周的时间里再次发生了变化。

이미지: @inworld_ai (X)

这次有哪些变化

Inworld AI表示,为了推出这次的GA版本,公司把服务架构和模型结构都做了彻底重建。新模型具备"可提示性"(promptable),也就是说它能像大语言模型一样直接理解自然语言指令,还能读懂对话的上下文。借助"语音操控(voice steering)"功能,用户可以像导演指导演员一样,用自然语言随时调整声音的语调和情绪;此外还加入了跨语言支持,能在保持同一说话人身份的前提下,实时切换500多种方言。该公司表示,这一整套处理过程耗时不到150毫秒,在实时对话中也能听起来自然流畅。

打造语音智能体框架的LiveKit联合创始人兼CTO大卫(David)在试用这款模型后表示,"感觉真的像在和真人说话"。他特别指出,即便是同样的文本,根据提示的不同也能表现出完全不同的情绪层次,这正是这款模型的一大优势。

项目Inworld Realtime TTS-2Cartesia Sonic-3.6
发布日期2026-09-022026-08-19
排行榜排名Artificial Analysis第一(自称)供应商语音、可控语音双料第一
延迟低于150毫秒(自称)低于90毫秒(自称)
核心特点语音操控、500+种方言切换状态空间模型(SSM)架构
opengraph image

如何体验

公司公开的视频里更多是演示场景,而非详细的使用说明。Inworld的研究人员轮流站在麦克风前,现场即兴切换声音风格来展示语音操控功能,并告知用户可以在"realtime.ai"上体验这款模型。具体的收费方案、API申请流程以及支持的平台,这次发布材料中都没有提及。

从功能范围来看,可以想象到的应用场景已经相当清晰。比如把这款模型接入客服机器人,就能只靠自然语言指令,根据情况在沉稳语调和急促语调之间切换应答方式。在多语言配音工作中,也可以保留同一说话人的声音特征,只更换语言重新录制。

编辑视角

TTS排行榜每隔几周就换一次榜首,这并非偶然。这恰恰说明Inworld AI、Cartesia、ElevenLabs这些公司围绕实时语音AI市场展开的竞争已经变得异常激烈。

从把实时语音模型投入实际业务的经验来看,过去只要TTS能把文字清清楚楚地读出来就够了。而现在,这已经变成了最基本的要求,能否理解对话上下文、自主调整语调,以及能否让同一说话人切换多种语言,才是真正决定采购与否的标准。

对于准备引入语音智能体的团队来说,与其把整套基础设施绑死在某一个模型上,不如通过LiveKit这类智能体框架,把TTS引擎设计成可替换的模块,这样更为稳妥。这次的案例已经证明,榜首头衔的寿命可能只有两三周而已。

未来几周内,Cartesia或ElevenLabs很可能会再次拿出延迟数据或Elo评分来做出回应。这场榜首之争,短期内应该还会持续下去。

评论