
이미지: METAL LAB 생성
摘要
- Cartesia的流式TTS模型Sonic-3.6在Artificial Analysis的两个语音排行榜上同时登顶第一
- 在使用8个相同基准声音、只比较引擎本身的Controlled Voice榜单上,超越了Sonic-3.5和ElevenLabs的Eleven v3
- 该模型采用状态空间模型(SSM)结构而非Transformer,目前处于测试阶段,仅通过Cartesia API提供
- 모델
- Cartesia Sonic-3.6 (스트리밍 TTS, Sonic-3.5 이후 약 3개월 만)
- 프로바이더 보이스 Elo
- 1,283점, 아티피셜 애널리시스 리더보드 1위
- 컨트롤드 보이스 Elo
- 1,123점, 1위(2위 Sonic-3.5, 3위 ElevenLabs Eleven v3)
- 아키텍처
- 트랜스포머 대신 스테이트 스페이스 모델(SSM) 기반
- 지연시간
- 첫 오디오 생성까지 90ms 미만(제조사 발표치)
- 공개 형태
- 베타, 카르테시아 API로만 제공, 오픈 웨이트·허깅페이스 저장소 없음
- 가격
- 100만 자당 49달러, ElevenLabs Eleven v3(100달러)의 절반, Speechify Simba 3.2(10달러)보다 고가
- 요금제
- Free/Pro 5달러, Startup 49달러/월, Scale 299달러/월(약 10,667분, 동시요청 15건)
统一声音之后依然获胜的原因
在为实时语音合成模型排名的Artificial Analysis上,存在两个排行榜。一个是Provider Voice榜单,各家公司用自己出售的声音直接一较高下;另一个是Controlled Voice榜单,所有模型都用相同的8个基准声音进行复刻后再比拼。后者剥离了声音目录本身的吸引力,只留下合成引擎自身的实力。Cartesia新推出的Sonic-3.6在这两个榜单上同时拿下第一——在Provider Voice榜单上获得1,283分,在Controlled Voice榜单上获得1,123分。Controlled Voice结果之所以更具意义,是因为它意味着提升的不是声音本身,而是引擎本身。在该榜单上,Sonic-3.5排名第二,ElevenLabs的Eleven v3排名第三。
Sonic-3.6带来的变化
Sonic-3.6在上一代Sonic-3.5发布约三个月后推出。最大的变化在于声音的自然度,而这一点的特点是可以由外部独立验证。MarkTechPost评价称:"这次的变化是自然度的提升,而这一点可以被独立确认。"该模型采用状态空间模型(SSM)结构运行,而非Transformer。Transformer的计算量会随句子变长而增加,而SSM则通过依序更新状态的方式运行,因此在实时流式传输方面更具优势。Cartesia表示,得益于这一结构,首个音频输出所需时间不到90毫秒。不过,这一数字是该公司自行测量的模型延迟,可能与实际服务中的往返延迟有所不同。
测试阶段与使用条件
Sonic-3.6目前仍处于测试阶段,只能通过Cartesia自有API使用。它不是可以直接下载并部署到服务器上的开放权重(open weight)形式,也没有上传到Hugging Face等公开仓库。这意味着它是一种租用式的商业模型。该公司官方文档中仍将Sonic-3.5标注为稳定版本,大多数合作伙伴目前使用的也是3.5版本。
| 套餐 | 适用对象 | 费用 |
|---|---|---|
| Free / Pro | 独立开发者、初创企业 | 0~5美元 |
| Startup | 运营呼叫中心的成长期企业 | 每月49美元 |
| Scale | 需要满足监管要求的大型企业 | 每月299美元(约10,667分钟TTS,支持15个并发请求) |
在价格方面,Artificial Analysis将Sonic-3.6定价为每百万字符49美元。这是ElevenLabs Eleven v3(100美元)的一半水平,但比获得1,240分的Speechify Simba 3.2(10美元)要贵。
| 模型 | 每百万字符价格 | 基准测试Elo分数 |
|---|---|---|
| Speechify Simba 3.2 | 10美元 | 1,240 |
| Cartesia Sonic-3.6 | 49美元 | 1,283(Provider Voice) |
| ElevenLabs Eleven v3 | 100美元 | Controlled Voice榜单第三 |
面向实际业务的功能
相比旁白类应用,Sonic-3.6加入了多项更适合客服对话脚本的控制功能。只需在文本中直接插入"[laughter]"等表现标签,就能播放笑声等非语言表达。仅凭约10秒的语音样本即可即时克隆声音,还支持像"<<s|ə|ˈ|p|i|n|ə>>"这样通过IPA标注直接指定发音的发音词典功能,可用于subpoena(传票)等词汇的发音。语速、音量、情绪值可通过API和LiveKit Agents插件调节,订单编号或电话号码等字母数字组合无需额外预处理即可准确朗读。公开的演示视频中,展示了带有自然停顿和口语习惯的英语,以及印地语与英语之间的语码转换案例。
使用方法
①从Cartesia官网的套餐页面选择Free或Pro等级开始。②创建账户后会获得API密钥,将其接入自己的应用程序或LiveKit Agents等集成工具。③将脚本文本通过API发送,同时指定表现标签、发音词典及语速、情绪等参数,即可以流式方式获得所需语调的语音。该公司列出的目标行业包括金融、医疗保健、零售电商、物流、招聘、SaaS客户支持、消费者陪伴类应用、媒体本地化等。例如呼叫中心可将其用于入站咨询自动应答或出站确认电话,媒体公司则可用于内容配音本地化。不过若要用于商业服务,至少需要从Pro等级(5美元)起步,大规模运营还需额外支付通话费用(每分钟0.06美元)。
编辑视角
此次发布中值得关注的重点,不在于排名本身,而在于是在哪个榜单上获胜。因声音目录出色而获胜,与因引擎出色而获胜是两回事,而Controlled Voice榜单正是剥离了这一差异,纯粹衡量合成质量。Cartesia在这个榜单上也拿下第一,可以理解为并非声音营销,而是模型本身的自然度确实得到了提升。
对关注这一领域数年的人来说,这是一个熟悉的模式正在重演。基于Transformer的TTS在提升质量的同时,延迟问题始终是掣肘,而近来采用状态空间模型的公司正在逐一打破这一权衡。Sonic-3.6在标榜不到90毫秒首音延迟的同时还拿下排行榜第一,证明了速度与质量并非必须二选一。
对于国内的呼叫中心或客户支持团队而言,首先应该看清这次发布的价格表。每百万字符49美元虽比ElevenLabs便宜,却比Speechify贵,处于中间位置,而且还要另外支付每分钟0.06美元的通话费用,若忽略这一点,月末账单很容易让人意外。稳妥的做法是先在Pro等级小规模测试发音词典和表现标签功能,再决定是否升级到Startup或更高等级。它并非开放权重而是租用型API,这对希望将语音引擎搭载到自有基础设施上的团队而言也是一种限制。
未来几周内值得关注的看点是,Cartesia的文档是否会将稳定版本从Sonic-3.5切换为3.6,以及ElevenLabs将如何应对这一排名。可以说,为夺回这两个排行榜第一名而展开的下一轮较量已经开始。



