
摘要
- Hume AI CEO安德鲁·埃廷格在MTS播客上公开了公司内部用于评估语音AI的框架"CLEAR"。
- 他解释称,恰当的应答和理解能力排在前面,听起来像人的自然度只是第三个要素。
- 最后第四项则是看这一切能否在数百到数千次交互中保持一致。
Hume AI首席执行官安德鲁·埃廷格正面推翻了语音AI行业普遍奉为第一标准的评判方式。他指出,声音听起来有多像人类,其实只是评估语音AI时排在第三位的因素。埃廷格在X上发布的一段视频中,介绍了Hume AI内部用来为语音AI系统打分的框架"CLEAR",并阐述了这一观点。
比声音质量更早被检验的东西
今年8月,Hume AI也曾与Hugging Face合作,实测并公开了11个开源语音识别(ASR)模型存在的基准测试记忆化现象。作为一家反复从事语音AI评分与验证工作的公司,这次的CLEAR框架也可以看作是这条工作脉络的延续。
埃廷格所说的CLEAR评估顺序是这样的:最先要看的是对话本身能否成立,也就是能否对对方的话给出恰当的回应。他表示,如果这一步就卡住了,其余项目根本无从谈起。第二项是听懂对方话语的能力——如果说得再好,却听不懂对方在说什么,对话同样无法成立。
只有这两项都通过之后,才轮到第三项——"听起来是否像人"。埃廷格解释说,即便应答内容和理解能力都对上了,如果声音听起来不自然,用户也不会愿意持续信任这个系统。而最后第四项,则是要看这一切能否在数百次、数千次的交互中,始终保持同样的语境和节奏。他的逻辑是:无论是用来做客服话务员,还是要让父母放心地用在医疗咨询上,光是偶尔表现出色是远远不够的。

"话说对了、也听懂了,但听起来不自然,照样没法信任"
埃廷格说:"即便这两项都做对了,如果听起来不自然,用户也不会想持续信任它。"随着语音合成技术的发展,行业营销大多把"声音有多像人"作为卖点摆在最前面,相比之下,这家真正塑造这个市场的公司的负责人,却把这一项降到了第三位,这一点格外值得关注。

顺序为何被颠倒
这似乎意味着,随着语音AI越来越深入呼叫中心、医疗咨询等实际生活场景,比起声音听起来好不好听,能否让对话不中断、不丢失语境,才是更该优先验证的事。哪怕声音再自然,只要答非所问或者忘记之前说过的话,用户就可能因为这一次失败,从此不再信任整个系统。反过来说,一旦应答和理解稳定下来,自然度才会发挥它留住用户信任的长期作用——这正是CLEAR框架所描绘的图景。
编辑视角
翻看语音AI的营销文案,几乎都把"听不出是不是人声"放在第一行。然而,恰恰是这个市场里长期打造评估工具的公司CEO,把这一项排到了第三位,这应当被解读为一个信号:行业在卖的东西,和实际所需要的东西之间,存在着落差。凡是接入过语音AI的团队大概都有过类似的经历——演示的时候声音听起来相当出色,可一旦真正上线,用户往往聊上两三句就流失了。而大多数问题的根源,并不在于声音的音调,而在于系统丢失了语境或者答非所问。
对于国内正打算引入语音AI客服或智能体的团队来说,不妨直接把这套顺序当作检查清单来用。不要把声音自然度作为选择供应商的第一标准,而是先用真实对话记录,以几百条为单位去验证"是否给出了恰当的回应"和"是否准确听懂了",然后再看自然度,最后才评估持续性。
未来几个月内,其他语音AI厂商很可能也会陆续公开类似的自研评估框架,抢先打出"我们是按这套标准来验证"的信息。因为在这个很难靠单一基准分数分出高下的市场里,评估方法本身也会成为一种营销资产。





评论