工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

From Inaudible Inputs to Model Failures: Low-Frequency Safety Risks in LALMs

arXiv:2608.091582026-08-09

人耳听不到的低频声音,竟能让语音AI大模型出错

研究团队设计了一种名为ILL的攻击方法,用人耳听不到的5到20赫兹低频声音混入正常语音,干扰大型音频语言模型(LALM)的理解。在六个模型上测试,ILL最多让准确率下降67个百分点,而人类听感评分却几乎和干净音频一样低。他们还提出防御方法DRG,通过检测异常低频分布并请求补录第二段录音,将被攻击后的平均准确率从28.5%提升到46.1%。

METAL LAB 解读图

ILL攻击与DRG防御的工作流程

证据状态已报告实测结果

  1. 威胁场景攻击者播放人耳听不到的5到20赫兹波形,与用户说话声在空气中混合后一起进入目标模型的麦克风。
  2. 构建ILL先用句子注意力尺度估计找出语音持续被关注的时间段,再用频率混淆迁移把语料库频谱变化规律转成相位连续的低频波形,形成可重复使用的通用攻击模板。
  3. 攻击评测在六个LALM上测试音频问答、语音识别、翻译、情绪分类等任务,测量准确率下降幅度及112人参与的听感评分。
  4. DRG防御将输入声音的频谱分布聚成两类,若被判定为可疑,则请求补录第二段录音,只依据两段录音中一致且可理解的内容作答。
  5. 恢复效果在补录录音干净的情况下,六个模型被攻击后的平均准确率从28.5%提升到46.1%。
这是 METAL LAB 制作的解读图,并非论文作者提供的原图。

他们做了什么

  1. 研究团队提出了攻击方法ILL,利用人耳听不到的5到20赫兹低频声音干扰能听懂语音、理解声音的大型音频语言模型(LALM)。
  2. ILL先通过“句子注意力尺度估计”找出模型持续关注语音的时间段,再通过“频率混淆迁移”把语料库中频谱变化的规律转成一段相位连续的低频波形,生成一个可反复使用的通用干扰模板,无需针对具体目标模型或语句单独调整。
  3. 在四个开源和两个闭源共六个LALM,以及音频问答、语音识别、翻译、情绪分类等多项任务上测试,ILL最多使准确率下降67个百分点,且对未参与制作攻击的模型同样有效。
  4. 在112人参与的听感实验中,混入ILL的音频平均可听度评分为1.33分(7分制,1分表示完全听不到),接近干净音频的1.17分,且落入人耳可听频段的噪声能量占比仅0.06%到0.08%。
  5. 防御方法DRG通过检测输入声音的低频分布异常(检测F1分数在89.69%到99.00%之间),对可疑输入请求补录第二段录音,在补录干净的情况下,把六个模型被攻击后的平均准确率从28.5%提高到46.1%。
Figure 1: Overview of the low-frequency perception gap, the construction of ILL, the DRG detection pipeline, and the evaluation.
Figure 1: Overview of the low-frequency perception gap, the construction of ILL, the DRG detection pipeline, and the evaluation.
Table 13: Paired comparisons between ILL and the six attack baselines across the 18 model–task cells.
BaselineMean accuracy difference (pp)ILL lower/tied/higherHolm-adjusted p
Gaussian1.29/5/4.422
PNL (Natural)1.010/3/5.422
PNL (Mechanical)1.412/0/6.422
PNL (Human)1.511/0/7.422
Audio-Adv.9.817/0/13.81×10−5
Whisper11.318/0/02.29×10−5
Figure 2: Attack effectiveness on translation and recognition. Lower BLEU and higher WER indicate stronger disruption.
Figure 2: Attack effectiveness on translation and recognition. Lower BLEU and higher WER indicate stronger disruption.
Table 14: Interpretation of the seven-point human audibility scale.
ScoreDescription
1Completely imperceptible
2Almost imperceptible
3Barely noticeable
4Slightly noticeable
5Moderately noticeable
6Clearly noticeable
7Highly noticeable
Figure 3: Human audibility ratings across 100+ responses.
Figure 3: Human audibility ratings across 100+ responses.

研究结果

  • 在六个LALM和多项音频任务上,ILL最多使准确率下降67个百分点,其中降幅最大的出现在未参与攻击构建的StepAudio2模型上,说明该攻击具有较强的跨模型迁移能力。
  • ILL的可听噪声占比(ANR)仅为0.06%到0.08%,而所有对比噪声方法均超过98.9%;在112人参与的听感实验中,ILL的平均评分为1.33分,接近干净音频的1.17分。
  • DRG在四个评测数据集上以89.69%到99.00%的F1分数检测出低频干扰,并在补录干净第二段录音后,把六个模型的平均被攻击准确率从28.5%提升到46.1%。
  • 在全部18个模型-任务组合中,ILL均降低了准确率(平均降幅13.1个百分点,具有统计显著性),且显著强于Audio-Adv.和Whisper两种基线攻击,但与高斯噪声及自然、机械、人声等环境噪声相比未显示出统计显著优势。
  • 模型内部分析显示,ILL攻击会降低模型对音频的注意力权重以及对正确答案的置信度,而DRG应用后这些指标会部分恢复到干净状态水平。
Figure 4: Defense effectiveness of DRG.
Figure 4: Defense effectiveness of DRG.

可应用场景

  • 智能音箱、语音助手、电话客服AI等使用麦克风输入的语音产品,可参考本研究在安全测试清单中加入不可闻低频干扰的鲁棒性测试。
  • 语音AI产品团队可借鉴DRG的思路,在系统中加入检测低频频谱异常并按需请求补录的输入过滤模块作为防御手段。
  • 新语音模型发布前的红队测评流程,可将不可闻频段攻击纳入标准评估项目之一。
Figure 5: Recovery under four additional attack types.
Figure 5: Recovery under four additional attack types.

局限与待验证事项

  • 研究仅模拟了麦克风接收到的波形,未还原扬声器到空气传播再到麦克风的完整物理链路,具体设备和环境下的效果仍需专门的物理实验验证。
  • 研究结果并不意味着这类低频信号对人体安全,作者也明确未在不受控的真实环境中部署过该攻击。
  • DRG的恢复效果在补录录音干净的情况下较大,在持续存在干扰的条件下提升幅度较小,说明其效果依赖补录质量。
  • 对注意力、表示和置信度变化的分析只揭示了相关性,并未确立完整的因果机制,更深入的机制分析留待未来工作。
  • ILL并非在所有情况下都优于其他噪声基线,与高斯噪声及一般环境噪声类别相比,经统计校正后差异并不显著。
Figure 6: ILL component analysis on Qwen3-Omni. Panels vary (a) amplitude, (b) duty cycle, (c) segment length, and (d) state-sequence construction. Dashed lines mark the configuration used in the main experiments.
Figure 6: ILL component analysis on Qwen3-Omni. Panels vary (a) amplitude, (b) duty cycle, (c) segment length, and (d) state-sequence construction. Dashed lines mark the configuration used in the main experiments.

为什么重要

这项研究首次较系统地证明,一段人完全听不到的声音也可能让语音AI系统的判断严重出错,这是用户自己无法察觉的一种安全隐患。对开发智能音箱、语音助手、电话客服AI等产品和负责安全评估的团队来说,这提示了一类需要提前防范的新风险。

本文术语

  • LALM(大型音频语言模型) · 能听懂音频并用语言理解和生成来回应的大型AI模型
  • 黑盒攻击 · 不需要知道目标模型内部结构和参数即可生效的攻击方式
  • 可听噪声占比(ANR) · 干扰声音能量中落在人耳正常可听范围(约20赫兹到20千赫兹)内的比例
  • F1分数 · 综合考虑准确率和召回率的检测效果指标
  • DRG(分布式补录防护) · 检测低频分布异常、对可疑输入请求补录第二段录音的防御方法

论文原文摘要(英文)

Large audio-language models (LALMs) have demonstrated strong capabilities in understanding diverse audio inputs. This diversity includes low-frequency signals that are inaudible to humans but can still enter the model and influence its generation. However, the practical impact of such low-frequency inputs on LALMs remains largely unexplored. In this paper, we propose Intermittent Low-Frequency Lockout (ILL), an inaudible red teaming method that evaluates this risk using a universal waveform template in a black box setting. ILL uses Sentence Attention Scale Estimation to determine active intervals and Frequency Confusion Transfer to construct a low-frequency waveform with continuous phase from corpus spectral variation. To mitigate this risk, we propose Distributional Requery Guard (DRG) to detect low-frequency distribution shifts and conditionally request a second recording for semantic recovery. Across six LALMs and multiple audio understanding tasks, ILL reduces accuracy by up to 67 percentage points while receiving a mean human audibility rating of 1.33, close to 1.17 for clean audio; DRG raises mean attacked accuracy from 28.5\% to 46.1\% after clean reacquisition. These findings identify a previously overlooked safety risk for LALMs and provide a foundation for future research on robust audio understanding.

作者 · Yuanhe Zhang

在 arXiv 阅读

最新论文

全部论文 →

METAL LAB 最新报道

图片来源: Yuanhe Zhang et al., arXiv:2608.09158, CC BY 4.0