CLEAR
Hume AI用来给语音AI打分的四阶段标准,把对话是否顺畅、是否听懂放在声音像不像人之前
简单来说
语音AI评估框架(CLEAR)是一张按顺序打分的评分表,用来判断一个基于声音的人工智能做得好不好。通常这类技术在宣传时最爱强调'声音像不像人',但这张评分表把这一点放到了第三位。
可以把这个顺序比作烹饪比赛的评审流程。第一步看的是这道菜能不能吃,也就是AI在对话中是否给出了恰当的回应。第二步看的是食材有没有理解到位,也就是AI是否准确听懂了对方说的话。只有通过这两关,才轮到第三步看摆盘好不好看,也就是声音听起来是否自然、像人一样。第四步也是最后一步,是看这个水准能不能重复上百上千次,也就是长时间对话中,语境和时机是否始终保持稳定。
为什么要这样排序?因为声音再好听,如果答非所问,或者听不懂对方在说什么,整个对话就会崩掉。这个框架的逻辑是:只有在对话流畅和理解准确都稳固之后,自然的声音才能长久地留住用户的信任。
在报道中是这样出现的
Hume AI首席执行官Andrew Etinger在X上发布的视频中解释了CLEAR的评估顺序,他说:"就算回应和理解都对上了,如果声音听起来不自然,你也不会想继续信任它。"语音AI的宣传通常把'声音有多像人'放在第一位,但这个框架的关键在于,这一点排在第三,不是第一。
亲手试一试
如果你正在用某个语音AI服务,可以按这个顺序检查一下。
- 回应:它给出的回答跟我说的话对得上吗?
- 理解力:它是否准确听懂了我说的话?(会不会反复要求重复,或者理解得驴唇不对马嘴?)
- 自然度:声音听起来像人一样自然舒服吗?
- 一致性:长时间对话或多次重新开始后,前三项是否依然保持同样的水准?
按这个顺序检查,可以先发现一个常见问题:演示时声音很惊艳,但实际对话却总是断断续续。
