
이미지: YouTube — 일레븐랩스 영상 갈무리
摘要
- ElevenLabs正式发布(GA)了专为实时语音对话优化的"Eleven v3 Conversational"模型
- 该模型可通过音频标签精细调节情感和语调,支持70多种语言,可直接在ElevenAgents和ElevenAPI中使用
- 作为底层基础的Eleven v3已于今年2月脱离Alpha阶段实现GA,当时将数字、符号朗读错误率从15.3%降至4.9%
- 모델명
- Eleven v3 Conversational
- 발표일
- 2026년 8월 20일(유튜브 공식 채널)
- 지원 언어
- 70여개 언어
- 제공 채널
- ElevenAgents, ElevenAPI
- 강세 언어
- 독일어·스페인어·프랑스어·포르투갈어·힌디어
- 기반 모델 GA 시점
- Eleven v3, 2026년 2월 2일 알파 종료 후 GA
- 기반 모델 정확도 개선
- 27개 카테고리·8개 언어 기준 오류율 15.3%→4.9%(68% 감소)
实时对话型语音模型正式发布
即便聊天机器人在回答途中轻轻一笑或语尾略带拖音,也能听起来自然不突兀,而且能够零延迟即时生成——这样的语音模型问世了。ElevenLabs于8月20日通过官方YouTube频道宣布,"Eleven v3 Conversational"已脱离Alpha阶段正式发布(GA)。该公司将这款模型介绍为"面向实时语音、表现力最强的模型"。
该模型在将文本转换为语音的过程中,可在句子中插入音频标签,从而对情感、语调、语速等细节进行精细调节。据该公司介绍,该模型支持70多种语言,其中在德语、西班牙语、法语、葡萄牙语、印地语上表现尤为出色。此次发布的核心在于,模型针对以流式方式依次生成语音的实时对话场景进行了专门优化。
Conversational版本与基础模型有何不同
对于不熟悉ElevenLabs这个名字的读者,简单介绍一下:这家公司一直以API形式向开发者和企业提供将文本转换为人声的语音合成服务。此次GA的"v3 Conversational",是在该公司现有文本转语音模型"Eleven v3"基础上,专门为实时对话场景调整而成的版本。而基础模型Eleven v3本身并非此次首次亮相,早在今年2月2日就已摘掉Alpha标签率先实现GA。
据当时该公司博客介绍,在Alpha版本与正式版本的用户偏好对比测试中,正式版本获得了72%的选择率。改进的核心在于对数字、符号、专业标注等按上下文准确朗读的能力。例如,对于电话号码"+49 170 9876543",Alpha版本曾错误地将其读作大位数的数字,而正式版本则改为按位分段朗读的正确方式。此前化学式"SO₂"被含糊读出的问题也得到修正,正式版能准确读作"S O 2";体育比分"102-98"此前也曾被误读作减法运算,如今则能正确解读为比赛比分。
该公司表示,在覆盖27个类别、8种语言的自有基准测试中,整体错误率从15.3%降至4.9%。其中化学式、电话号码、ISBN条目的错误率分别降低了99%、99%、100%,问题已基本消除。
| 类别 | Alpha错误率 | 正式版错误率 | 降低幅度 |
|---|---|---|---|
| 化学式 | 45.6% | 0.6% | 99% |
| 电话号码 | 16.9% | 0.6% | 99% |
| URL/电子邮件 | 45.6% | 3.9% | 91% |
| ISBN | 17.9% | 0.0% | 100% |
| 车牌号 | 14.4% | 1.2% | 91% |
| 数学公式 | 23.8% | 6.9% | 71% |
| 地理坐标 | 46.2% | 17.5% | 62% |
此次发布的"Conversational"版本是否原样继承了这一精度改进数据,本次发布材料中并未单独说明。不过,由于是在同一v3系列基础上针对实时对话场景进行的调整,数字、符号朗读方面的改进很可能是其基础的一部分。
如何使用
Eleven v3 Conversational并非新推出的独立应用,而是可以直接在ElevenLabs现有的两个平台中使用。其一是用于构建语音智能体的"ElevenAgents",其二是供开发者直接调用API、接入自身服务的"ElevenAPI"。已在这两个平台拥有账号的开发者,只需在模型列表中选择v3 Conversational,即可将其应用于实时语音生成。
举例来说,若在客服语音机器人中接入该模型,可使其听起来像是客服人员在回答过程中自然地变换语调。又或者,面向多语言用户的服务,可通过音频标签指定情感表达,然后在70多种语言中选择所需语言,在保持相同语调的同时生成实时应答。
若想亲耳听听效果,可前往ElevenLabs文本转语音API页面进行体验。
竞争格局:流式TTS市场
在实时流式语音合成市场,近期其他企业的动向也十分引人注目。Cartesia的流式TTS模型"Sonic-3.6"曾在Artificial Analysis的两个语音排行榜上同时登顶第一。
ElevenLabs先是打磨了基础模型的文本解析准确度,随后又推出专门用于实时对话的变体版本,这一动作似乎也与围绕流式语音生成质量展开的这场竞争不无关系。
编辑观察
过去一年,语音AI行业的话题焦点已从"有多像人类"转向"实时状态下是否依然像人类"。事先接收全部文本再一次性合成语音,与在对话过程中逐句即时输出语音,是完全不同的技术难题。后者需要在降低延迟的同时,不让情感表达变得生硬破碎,而这正是此次v3 Conversational所瞄准的方向。
将这类规模的语音模型实际接入客服机器人或语音智能体时,问题总是出现在同一个环节:预先录制的演示中情感表达丰富,但一旦切换为实时流式传输,就会暴露出语调断续、数字符号读法怪异等问题。ElevenLabs先修复基础模型的数字符号错误率,随后再推出实时对话专用变体,这样的先后顺序表明其早已意识到这一问题所在。
对于国内正在筹备语音机器人或AI客服的团队而言,此次发布中值得关注的是音频标签功能。如果情感和语调可以不通过代码、而是直接以标签形式嵌入句子中指定,那么编剧或服务策划人员无需开发者协助,也能有余地自行调整语气。不过,中文在70多种支持语言中处于何种质量水平,本次资料并未给出确认,因此在实际引入前,仍需亲自试听中文样本进行验证。
未来数周内,Cartesia和ElevenLabs双方很可能会针对彼此的基准测试结果推出后续发布。实时流式语音质量的竞争,将成为文本转语音市场的下一个战场。




评论