每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

ElevenLabs,实时对话语音模型"v3 Conversational"正式发布

支持70多种语言,内置情感调节音频标签……底层模型2月已GA,错误率降低68%

이미지: YouTube — 일레븐랩스 영상 갈무리

摘要

  • ElevenLabs正式发布(GA)了专为实时语音对话优化的"Eleven v3 Conversational"模型
  • 该模型可通过音频标签精细调节情感和语调,支持70多种语言,可直接在ElevenAgents和ElevenAPI中使用
  • 作为底层基础的Eleven v3已于今年2月脱离Alpha阶段实现GA,当时将数字、符号朗读错误率从15.3%降至4.9%
Eleven v3 Conversational is Now Generally Available
모델명
Eleven v3 Conversational
발표일
2026년 8월 20일(유튜브 공식 채널)
지원 언어
70여개 언어
제공 채널
ElevenAgents, ElevenAPI
강세 언어
독일어·스페인어·프랑스어·포르투갈어·힌디어
기반 모델 GA 시점
Eleven v3, 2026년 2월 2일 알파 종료 후 GA
기반 모델 정확도 개선
27개 카테고리·8개 언어 기준 오류율 15.3%→4.9%(68% 감소)

实时对话型语音模型正式发布

即便聊天机器人在回答途中轻轻一笑或语尾略带拖音,也能听起来自然不突兀,而且能够零延迟即时生成——这样的语音模型问世了。ElevenLabs于8月20日通过官方YouTube频道宣布,"Eleven v3 Conversational"已脱离Alpha阶段正式发布(GA)。该公司将这款模型介绍为"面向实时语音、表现力最强的模型"。

该模型在将文本转换为语音的过程中,可在句子中插入音频标签,从而对情感、语调、语速等细节进行精细调节。据该公司介绍,该模型支持70多种语言,其中在德语、西班牙语、法语、葡萄牙语、印地语上表现尤为出色。此次发布的核心在于,模型针对以流式方式依次生成语音的实时对话场景进行了专门优化。

Conversational版本与基础模型有何不同

对于不熟悉ElevenLabs这个名字的读者,简单介绍一下:这家公司一直以API形式向开发者和企业提供将文本转换为人声的语音合成服务。此次GA的"v3 Conversational",是在该公司现有文本转语音模型"Eleven v3"基础上,专门为实时对话场景调整而成的版本。而基础模型Eleven v3本身并非此次首次亮相,早在今年2月2日就已摘掉Alpha标签率先实现GA。

据当时该公司博客介绍,在Alpha版本与正式版本的用户偏好对比测试中,正式版本获得了72%的选择率。改进的核心在于对数字、符号、专业标注等按上下文准确朗读的能力。例如,对于电话号码"+49 170 9876543",Alpha版本曾错误地将其读作大位数的数字,而正式版本则改为按位分段朗读的正确方式。此前化学式"SO₂"被含糊读出的问题也得到修正,正式版能准确读作"S O 2";体育比分"102-98"此前也曾被误读作减法运算,如今则能正确解读为比赛比分。

该公司表示,在覆盖27个类别、8种语言的自有基准测试中,整体错误率从15.3%降至4.9%。其中化学式、电话号码、ISBN条目的错误率分别降低了99%、99%、100%,问题已基本消除。

类别Alpha错误率正式版错误率降低幅度
化学式45.6%0.6%99%
电话号码16.9%0.6%99%
URL/电子邮件45.6%3.9%91%
ISBN17.9%0.0%100%
车牌号14.4%1.2%91%
数学公式23.8%6.9%71%
地理坐标46.2%17.5%62%

此次发布的"Conversational"版本是否原样继承了这一精度改进数据,本次发布材料中并未单独说明。不过,由于是在同一v3系列基础上针对实时对话场景进行的调整,数字、符号朗读方面的改进很可能是其基础的一部分。

如何使用

Eleven v3 Conversational并非新推出的独立应用,而是可以直接在ElevenLabs现有的两个平台中使用。其一是用于构建语音智能体的"ElevenAgents",其二是供开发者直接调用API、接入自身服务的"ElevenAPI"。已在这两个平台拥有账号的开发者,只需在模型列表中选择v3 Conversational,即可将其应用于实时语音生成。

举例来说,若在客服语音机器人中接入该模型,可使其听起来像是客服人员在回答过程中自然地变换语调。又或者,面向多语言用户的服务,可通过音频标签指定情感表达,然后在70多种语言中选择所需语言,在保持相同语调的同时生成实时应答。

若想亲耳听听效果,可前往ElevenLabs文本转语音API页面进行体验。

竞争格局:流式TTS市场

在实时流式语音合成市场,近期其他企业的动向也十分引人注目。Cartesia的流式TTS模型"Sonic-3.6"曾在Artificial Analysis的两个语音排行榜上同时登顶第一。

ElevenLabs先是打磨了基础模型的文本解析准确度,随后又推出专门用于实时对话的变体版本,这一动作似乎也与围绕流式语音生成质量展开的这场竞争不无关系。

编辑观察

过去一年,语音AI行业的话题焦点已从"有多像人类"转向"实时状态下是否依然像人类"。事先接收全部文本再一次性合成语音,与在对话过程中逐句即时输出语音,是完全不同的技术难题。后者需要在降低延迟的同时,不让情感表达变得生硬破碎,而这正是此次v3 Conversational所瞄准的方向。

将这类规模的语音模型实际接入客服机器人或语音智能体时,问题总是出现在同一个环节:预先录制的演示中情感表达丰富,但一旦切换为实时流式传输,就会暴露出语调断续、数字符号读法怪异等问题。ElevenLabs先修复基础模型的数字符号错误率,随后再推出实时对话专用变体,这样的先后顺序表明其早已意识到这一问题所在。

对于国内正在筹备语音机器人或AI客服的团队而言,此次发布中值得关注的是音频标签功能。如果情感和语调可以不通过代码、而是直接以标签形式嵌入句子中指定,那么编剧或服务策划人员无需开发者协助,也能有余地自行调整语气。不过,中文在70多种支持语言中处于何种质量水平,本次资料并未给出确认,因此在实际引入前,仍需亲自试听中文样本进行验证。

未来数周内,Cartesia和ElevenLabs双方很可能会针对彼此的基准测试结果推出后续发布。实时流式语音质量的竞争,将成为文本转语音市场的下一个战场。

评论