
이미지: The Decoder
摘要
- Anthropic用于阻断生物、化学武器风险信息的分类器系统,从2025年5月到2026年4月约11个月间处于停用状态
- 在此期间,约5万名提供人类反馈的外部承包商在无过滤器状态下与模型进行了约1.33亿次互动
- Anthropic表示内部调查未发现实际滥用案例,并已加强了对承包商的审核要求
- 필터 비활성 기간
- 2025년 5월~2026년 4월 (약 11개월)
- 노출된 계약자 수
- 약 5만명
- 필터 없이 실행된 상호작용
- 약 1억3300만건
- 내부 조사 결과
- 실제 오용 사례 미확인
- 사후 조치
- 외부 계약자 심사 요건 강화
- 관련 사안
- Fable 5 분류기는 연구자 항의로 최근 완화
- 출처
- Anthropic Redacted Risk Report
1.33亿次对话在无过滤器状态下流出
根据Anthropic公布的安全报告,用于过滤生物、化学武器相关危险信息的内部分类器系统,在2025年5月至2026年4月约11个月间未能正常运作。在此期间,约5万名提供人类反馈的外部承包商在没有过滤器保护的情况下与模型进行了互动,总量高达约1.33亿次。这相当于一个人每天不间断对话8小时,也需要几十年才能完成的量。
停用的到底是什么
该分类器是一道安全防线,旨在过滤模型被滥用于提取化学武器或生物武器制造相关危险知识的风险。据报告显示,这批承包商团队并非由Anthropic自身审核,而是由外部供应商按照自有标准进行筛选,而这一审核流程在很多情况下并不完善。过滤器停用近一年这一事实本身,就说明用于验证安全装置的内部检查体系存在盲区。
Anthropic表示,在自行调查中未发现该期间存在实际滥用案例。不过这只是事后调查确认的结果,过滤器停用期间累积了超过1亿次未经实时过滤的对话这一事实本身并未改变。
为何值得警惕
据悉,Anthropic首席执行官Dario Amodei一直将利用AI开发化学、生物武器视为比网络攻击更大的威胁。而这样一家公司却将相关风险过滤器搁置近一年之久,这暴露出安全政策与实际运营之间的落差。对于处理前沿模型的公司而言,这类分类器绝非部署一次就万事大吉,而是需要建立持续监控体系,确认其是否始终处于开启状态、是否正常运作,这一点值得警惕。
Anthropic的应对措施
Anthropic表示,在发现问题后已加强了对外部承包商的审核要求。至于是彻底改变了将审核权委托给供应商的方式,还是仅仅提高了审核标准,报告中并未具体说明。该公司是通过依据"负责任扩展政策"(Responsible Scaling Policy)定期发布的风险报告,公开了此事。
也有过滤器被放宽的情况
在同一份报告中,Anthropic表示,近期反而放宽了应用于"Fable 5"模型的分类器。原因是研究人员反映过滤器运作过于激进,连正当研究也被阻断。一边是过滤器停用整整一年却无人察觉,另一边则是过滤器运作过于严格而招致抗议,这两种情况并列出现在同一份报告中。
编辑观察
这起事件值得关注的重点,不在于"未发现滥用"的结论,而在于"11个月间无人察觉"这一事实。安全过滤器真正的考验,不在部署的那一刻,而在部署之后。前沿模型公司争相发布新的分类器、新的护栏机制,但确认这些机制是否真正处于开启状态的运营体系,相对而言却较少受到关注。此次事件更像是一个案例,揭示出这种运营体系的漏洞是如何暴露出来的。
观察近期多家公司相继宣布加强安全措施,总会发现一个反复出现的模式:新模型发布时,安全卡片和分类器性能表被隆重公开,但几个月后再次确认该分类器是否仍正常运作的报告却少之又少。此次整个承包商团队在无过滤器状态下暴露、事后才通过报告披露的情况,说明这种依赖事后审计而非实时监控的结构性局限依然存在。
对于正在引入AI模型或进行自主微调的国内企业而言,这一案例带来的教训十分明确:加装安全过滤器或内容分类器并不意味着万事大吉,还需要建立单独的检查清单,定期验证该过滤器是否真正处于运作状态。将审核工作委托给外部供应商时,与其全盘信任对方的标准,不如同时进行自有样本验证,这样更为稳妥。
未来几周内,其他前沿模型公司很可能也会面临公开类似自查结果的压力。安全报告或将从形式化的性能表,转向包含"哪些功能停用了多久"等内容的方向发展。



