No One Model Catches Every Harm: Benchmarking Content Moderation Across Safety Scenarios
把53个AI安全过滤模型放一起测试后发现:没有哪个模型能通吃所有类型的有害内容
研究团队对53个内容审核模型进行了基准测试,既包括GPT等通用大语言模型,也包括Llama Guard等专用安全模型,覆盖11个数据集和四类风险场景。测试分两种设置:只看用户提问,或者同时看提问和模型的实际回答。结果显示,在某一类风险上领先的大模型,到了另一类风险上往往被更小的专用模型甩在后面,而针对真实对话场景的有害内容检测,所有模型家族都没能真正解决。
METAL LAB 解读图
53个模型在11个数据集和4类风险场景下的评测结构
证据状态已报告实测结果
- 输入模式:Q对比QAQ模式只给审核模型用户提问,QA模式同时给出提问和模型的实际回答再做安全判断
- 四类风险场景C1至C4C1对抗性越狱攻击,C2标准政策违规,C3对无害提问的过度拒绝,C4真实对话场景中的安全问题
- 模型家族对比专用安全模型(Llama Guard、WildGuard、BingoGuard、PolyGuard)使用各自原生输入格式,通用大模型(GPT、Gemini、Command-A等)使用研究团队优化的14类别安全提示词
- 评分方式对安全/不安全的离散判定用macro F1统计,并用配对自举置信区间检验排名差异是否真实
- 结果模式不同类别的赢家不同:Q模式下大型商用模型领先,QA模式下小型专用模型领先,而C4真实对话场景所有模型都表现不佳
他们做了什么
- 研究团队在11个安全数据集上、以两种模式(只给提问的Q模式,和提问加模型实际回答的QA模式)评测了53个模型,其中31个是开源模型,其余为商用模型。
- 把有害内容分成四类:C1对抗性越狱攻击,C2标准政策执行(仇恨言论、骚扰等),C3对无害提问的过度拒绝,C4真实对话场景中的安全问题。
- 由于每个模型只输出安全或不安全的离散判定而非概率分数,研究用macro F1(各类别精确率和召回率的平均值)衡量表现,配对自举法(bootstrap)置信区间检验发现,18组第一名与第二名的比较中只有4组存在统计显著差异。
- 团队为通用大模型设计了一套优化过的安全提示词(包含14个违规类别及边界情形处理指引),在Q和QA两种模式下都比原始Llama Guard提示词高出4%到15%的macro F1,比简单的安全/不安全指令高出18%到28%。

| Simple | LlamaGuard | Ours | ||||
|---|---|---|---|---|---|---|
| Model | Q | QA | Q | QA | Q | QA |
| Gemma-3-4B | 42.8 | 52.7 | 60.9 | 60.9 | 64.7 | 67.5 |
| Llama-3.2-3B | 37.1 | 31.0 | 57.4 | 62.5 | 64.8 | 69.9 |
| Phi-4-mini | 46.4 | 58.9 | 51.9 | 52.8 | 66.4 | 66.2 |

| Dataset | Set. | Δ1-2 [95% CI] (%) | Sig. | Tie-tier |
|---|---|---|---|---|
| harmaug | Q | +2.3 [+0.3, +4.4] | Yes | 2 |
| harmbench | Q | +0.6 [−2.4, +3.8] | – | 10 |
| xrtest | Q | +1.0 [−4.1, +5.7] | – | 14 |
| aegis | Q | +0.8 [−3.0, +4.4] | – | 8 |
| oai | Q | +0.2 [−2.0, +2.4] | – | 11 |
| toxicchat | Q | +0.0 [−4.2, +4.1] | – | 6 |
| wildguard | Q | +0.2 [−0.9, +1.4] | – | 5 |
| simplesafety | Q | +0.0 [+0.0, +0.0] | – | 28 |
| xstest | Q | +0.7 [−0.7, +2.0] | – | 3 |
| beavertails | Q | +0.3 [−2.6, +3.6] | – | 16 |
| bingo | Q | +0.6 [+0.3, +0.9] | Yes | 1 |
| harmaug | QA | +9.2 [+6.8, +11.6] | Yes | 1 |
| harmbench | QA | +1.3 [−1.1, +3.7] | – | 6 |
| xrtest | QA | +0.5 [−2.3, +3.6] | – | 2 |
| wildguard | QA | +1.5 [−0.7, +3.9] | – | 3 |
| xstest | QA | +0.4 [−1.4, +2.2] | – | 4 |
| beavertails | QA | +0.7 [−1.4, +2.7] | – | 3 |
| bingo | QA | +1.5 [+1.0, +2.0] | Yes | 1 |

研究结果
- 在Q模式下,GPT-4o-mini、GPT-4.1、GPT-4.1-mini、GPT-5、Gemini-2.5-pro和Command-A等大型商用模型取得最高平均F1,分数在75%到77%之间。
- 在QA模式下,由于能看到模型的实际回答,判断变得更容易,Llama-Guard-3-8B以78.6%的F1领先,BingoGuard-Llama-8b和Gemma-2-27b-it紧随其后。
- C1(对抗性越狱攻击)在Q模式下最难,平均F1只有52.7%到61.2%,Llama-Guard-3-8B、Llama-Guard-4-12B、Phi-4-reasoning和GPT-4.1达到约67%位居前列。
- 在C2(标准政策执行)上,BingoGuard-Llama-8B(87.1%)和BingoGuard-Phi3-3B(82.2%)在Q和QA两种模式下都持续超过其他模型。
- C3(过度拒绝检测)最容易,Q模式下有15个模型F1超过95%(GPT-4.1最高达98.4%,GPT-5为98.2%);而C4(真实对话场景安全)始终是最难的类别,Q和QA模式下平均F1都只有约52%。

可应用场景
- 需要拦截越狱式攻击提示的服务,可以优先考虑在该类别上领先的大型通用大语言模型。
- 如果部署环境允许同时检查模型的实际输出,Llama Guard、BingoGuard这类较小的专用安全模型在QA模式下表现更强,可作为性价比更高的选择。
- 担心模型对无害问题过度拒绝的团队,可以参考XSTest、SimpleSafetyTests这类数据集作为部署前的基本合格线检查。
- 对延迟敏感的实时系统,可以关注BingoGuard-Phi3-3B、BingoGuard-Llama-8B这类体量小、且在速度与准确率上表现均衡的模型。
局限与待验证事项
- 评测只覆盖英语、单轮对话和二元安全/不安全标签,是否能推广到多语言、多轮对话或分级风险场景尚未验证。
- 每个数据集最多采样1000条记录,可能无法完全反映真实部署中长尾分布的有害内容模式。
- QA评测使用的回答来自原始数据集中有限的几个来源模型生成,在类似分布上训练过的审核模型可能因此占优。
- 优化提示词的效果只在三个开源模型上验证过,是否能迁移到闭源大模型上仍待未来的实证检验。
- 18组第一名与第二名的比较中只有4组具有统计显著性,意味着很多排名差异可能只是样本噪声而非真实性能差距。
为什么重要
对于要部署AI安全审核层的团队来说,这项研究提供的证据是:选“最好的一个模型”这个思路本身可能不成立,应该根据风险类型和是否能看到模型的实际回答来分别选模型。它也动摇了“模型越大就越安全”这一常见假设,对模型选型标准提出了新的参考。
本文术语
- Q / QA 设置 · Q是审核模型只看用户提问做判断,QA是审核模型同时看提问和模型的实际回答再做判断
- macro F1 · 综合精确率和召回率的评分指标,按类别分别计算后取平均,用于评估只输出离散判定的模型
- 过度拒绝(over-refusal) · 模型把实际上无害的请求误判为危险并拒绝回答的现象
- 专用安全模型(Llama Guard、WildGuard、BingoGuard、PolyGuard) · 专门为判断内容是否安全而训练的模型,评测时按其原生输入格式使用
- 配对自举置信区间 · 一种统计重采样方法,用来检验两个模型之间的性能差距是真实差异还是样本噪声
论文原文摘要(英文)
Large Language Models (LLMs) are increasingly deployed in real-world applications, yet they remain vulnerable to generating harmful content. From adversarial jailbreaks that bypass safety filters to implicit hate that evades detection, the range of risks these models pose continues to grow. While both specialized content moderators and general-purpose LLMs are being used as safety layers, the question of which model is best suited for which type of harmful content remains unanswered. We present the most comprehensive evaluation of LLM safety capabilities to date, systematically testing \textbf{53} models across \textbf{11} datasets that we organize into four distinct categories. Our evaluation under both prompt-only and prompt-response settings uncovers critical blind spots: large frontier models that lead on one category fall significantly behind smaller, specialized alternatives on others, and real-world conversational safety remains largely unsolved across all model families. These findings challenge the assumption that scale alone ensures safety, and provide the community with a structured framework for informed model selection.
在 arXiv 阅读最新论文
- Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians一个数学模型证明,哪怕是完全理性的人,也会被一味顺着自己说话的聊天机器人带入妄想
- GameXpert-Bench: How Far Are Coding Agents from Expert Game Development?AI编程智能体擅长从零做出一款能玩的游戏,但不擅长自己发现漏洞、也难在修改中保住原有功能
- There Is No Neutral Harness: Modern LLM Leaderboards Are Manufactured by Config-Fragile Items同一个模型只要换一种打分方式,准确率就能从31%变到89%,而这种打分方式正悄悄决定排行榜的冠军
- K-Bench: measuring model performance on real scientific agent requests用178个真实科研请求测试9个AI智能体,结果最强的模型也没能稳稳超过“合格线”
- RAG Collapse: LLM Responses Collapse When Retrieved Documents Are Self-AuthoredAI如果不断检索并引用自己以前写的内容,答案最终会趋同成一个版本
- AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scaleAI不再为单个任务搭环境,而是直接生成整个商业世界,让训练场自己扩展规模
- FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth用一套可执行的美食评分系统当裁判,而不是靠人或AI来打分的语言模型评测
- When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha治疗聊天机器人能听懂青少年的俚语,却常常判断不出话里藏着的危机
METAL LAB 最新报道
图片来源: Afshin Orojlooyjadid et al., arXiv:2608.21775, cc-by-nc-sa-4.0