
이미지: @hume_ai (X) 화면 갈무리
摘要
- Hume AI与Hugging Face共同公开了一项研究,用三种方式测试了11个开源语音识别(ASR)模型
- 研究团队将基准音频中的数字做静音处理后,部分排名靠前的模型仍以30~40%的概率原样写出该数字
- 研究团队在Open ASR Leaderboard上新设了衡量这一现象的"Benchmark Fitting"标签页
- 연구 주체
- 흄AI(Hume AI)와 허깅페이스(Hugging Face) 공동 연구
- 테스트 대상
- 오픈소스 음성인식(ASR) 모델 11개
- 사용 데이터셋
- VoxPopuli, LibriSpeech
- 참조 오류 비율
- 분석한 VoxPopuli 클립의 40%에서 참조 전사 오류 가능성 발견
- 오류 답습 모델 수
- 11개 중 6개 모델이 'thank you' 누락 오류를 그대로 복제
- 무음 숫자 복원율
- 일부 모델이 30~40% 확률로 무음 처리된 숫자를 작성
- 표기 구분 정확도
- 'Mr.' vs 'Mister' 구분에서 일부 모델 약 90% 정확도
- 후속 조치
- Open ASR Leaderboard에 'Benchmark Fitting' 탭 신설
是如何得知被抹去的数字的
在Hume AI与Hugging Face共同进行的研究中,团队对一段基准音频片段中包含的数字做了完全静音处理。该数字在音频中不存在任何声音痕迹。然而,评分位居前列的若干语音识别(ASR)模型仍以30~40%的概率准确写出了这个数字。其中一个模型甚至原样填入了音频中完全不存在的数字"2011"。这说明模型并非在听音频后转录,而是记住了基准数据集本身。
语音识别模型是将人声转换为文本的AI。评估此类模型时,通常会为VoxPopuli或LibriSpeech等公开数据集配上正确的参考转录文本(reference transcript),再以错误率(WER)衡量模型的准确程度。问题在于,同一数据集也可能混入训练过程中。这样一来,模型给出的答案就不是靠"听",而是靠"背"。研究团队沿用了业界已有的说法来称呼这一现象。Hume AI在X上发文称:"社区早已给这种现象起了名字,叫benchmaxxing。"
三重检验
研究团队在VoxPopuli和LibriSpeech两个数据集上设计了三种情形——即音频实际上无法决定正确转录文本的情况——并以此对11个模型进行了测试。
第一项是"参照不一致"测试。鉴于VoxPopuli的正确参考转录文本本身就存在错误,研究团队在分析的片段中发现,40%的片段可能存在参考错误。其中一个案例是,音频中明明清楚地说出了"thank you",但正确参考文本中却遗漏了这句话,而在11个模型中有6个直接照搬了这一遗漏错误,忽略了音频中实际存在的内容。
第二项就是前文所述的"数字静音"测试。仅将音频中的数字部分抹去、其余保持不变,结果在公开基准数据上恢复率(recovery rate)很高,但换成同类别新录制的音频后,恢复率骤然下降。这暗示模型很可能直接记住了基准音频本身。
第三项是"拼写转换"测试。VoxPopuli将某词标注为"Mr.",LibriSpeech则标注为"Mister",但两者发音完全相同。按理说,仅凭听音频应无法判断该采用哪种拼写方式,但多个模型的准确率超过了掷硬币概率的50%,部分模型甚至高达约90%。这说明模型辨别出的并非声音本身,而是当前所处的测试环境。
并非偶然的证据
研究团队表示,这种行为并非单纯的统计巧合。通过一种名为低秩线性干预(low-rank linear intervention)的方法,他们能够开启或关闭这种照搬行为,在某些情况下,仅在音频片段末尾添加一段声音就足以改变模型的行为。这意味着模型内部确实存在某种能够察觉基准测试的特定回路在起作用。
从附带的图表来看,可以发现一种颇有意思的负相关关系:VoxPopuli错误率(WER)越低、得分越高的模型,照搬参考错误的比例反而越高。
| 模型 | VoxPopuli WER(%) | 参考错误照搬率 |
|---|---|---|
| Cohere-Transcribe | 5.6 | 3130.5% |
| Canary-Qwen-2.5B | 5.35 | 2423.5% |
| Higgs-Audio-v3-8B | 5.55 | 2221.5% |
| Granite-Speech-4.1-2B | 5.45 | 2121% |
| Phi-4-Multimodal | 5.65 | 2019.5% |
| Parakeet-TDT-0.6B-v2 | 5.65 | 1818% |
| Qwen3-ASR-0.6B | 6.75 | 99.2% |
| Voxtral-Mini-3B | 6.75 | 43.7% |
| Moonshine-Streaming | 8.0 | 65.5% |
| Kimi-Audio-7B | 7.7 | 32.8% |
| Whisper-Large-v3 | 8.65 | 32.7% |
表中可确认名称的模型中,Whisper-Large-v3据悉由OpenAI开发,Qwen3-ASR-0.6B由阿里巴巴Qwen(Alibaba Qwen)开发,Kimi-Audio-7B由Moonshot AI开发,Cohere-Transcribe则是Cohere的模型。错误率处于较低水平的Cohere-Transcribe和Canary-Qwen-2.5B,在参考错误照搬率上也位居前列;而错误率相对更高的Kimi-Audio-7B和Whisper-Large-v3,其照搬率反而更低。这是一个仅凭基准分数可能得出完全相反结论的地方。
排行榜新增了一个标签页
研究团队并未止步于一次性发布这一测量方法,而是将其反映到了Open ASR Leaderboard中。团队新设了"Benchmark Fitting"标签页,以参考错误重现率和拼写转换准确率为标准为各模型打分,并可与错误率(WER)排名并列查看。该研究由Alice Baird和Theo Lebryk主导,David Ayllon、Jakub Cłapa、Jens Madsen、Panagiotis Tzirakis参与其中。
编辑视角
语音识别模型市场是一个仅凭错误率小数点后一位差距就能左右排名的领域。而这项研究表明,这种小数点差距中相当一部分可能并非来自"更擅长听",而是来自"能识别出这是哪个基准测试"。这不过是大语言模型行业早已熟悉的问题被搬到了另一种模态上而已。多年来,业界一直有质疑称大型语言模型会从训练数据中记住数学、编程基准的答案模式来虚增分数,如今轮到听声音的模型了。
将这一结果落到实务层面,结论其实很简单。对于将ASR模型接入呼叫中心自动化或会议记录等实际服务的团队而言,仅凭公开排行榜的错误率排名来选择模型的做法本身就值得重新审视。正如表格所示,错误率表现最好的模型,其参考错误照搬率也最高。而实际服务中遇到的音频,往往是基准测试中从未出现过的新声音、新口音、新背景噪音。这意味着,真正的性能不在于基准排名,而在于用自家数据实际跑一遍所得到的结果。
预计未来几个月内,类似的验证方法论很可能会扩展到其他模态的基准测试中。如果Open ASR Leaderboard上新设的"Benchmark Fitting"标签页成为先例,预计图像、视频基准测试也将陆续引入同类的"记忆检测"指标。




评论