每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Claude Fable 5,生物学安全防护误判率降低85%

Anthropic表示已调整安全防护机制,以减少对健康、教育类问题的拦截

이미지: METAL LAB 생성

摘要

  • Anthropic更新了Claude Fable 5的生物学相关安全防护机制
  • 测试结果显示,生物学相关的回避(拦截)比例减少了约85%
  • 该公司表示,对日常健康、教育类问题的响应范围有所扩大
대상 모델
Claude Fable 5
업데이트 내용
생물학 관련 안전장치(세이프가드) 조정
효과
생물학 관련 폴백 약 85% 감소(전 제품 표면 기준)
목적
오탐(false positive) 감소, 일상 건강·교육 질문 지원 확대
발표 경로
X(구 트위터) 공식 Claude 계정
발표일
2026-08-07

发生了什么变化

Anthropic通过官方X账号宣布,已更新其模型Claude Fable 5的生物学相关安全防护机制。此次调整的目标是减少对实际并无风险的问题进行过度拦截的"误判(false positive)"现象。该公司表示,在测试过程中,生物学相关的回避性回应(即fallback)比例在所有产品界面中减少了约85%。

误判减少的具体数据

此次公布的数据仅有回避比例的下降幅度这一项,但降幅本身被认为相当可观。以下是此次发布中可以确认的核心变化。

项目内容
生物学相关回避比例降幅约85% bar:85
适用范围全部产品界面(Product Surfaces)
目标使用场景日常健康、教育类问题

不过,作为降幅计算基准的此前回避发生频率,以及具体的测试方法论,在原文中均未得到确认,仍存在不确定性。

背景:为何要调整安全防护机制

生物学相关安全防护机制原本是为了过滤危险生物学信息请求而设置的装置,但如果反应过于敏感,就会产生连健康信息或教育类问题也一并拦截的副作用。Anthropic表示,已朝着减少此类误判的方向对Claude Fable 5进行了调整。该公司在官方发布中说明称:"Fable can now assist on a wider range of everyday health and educational questions"(Fable现在可以为更广泛的日常健康和教育类问题提供帮助)。

关于AI模型安全防护机制及误判问题的相关报道,也可在metallab.ai的AI安全相关文章中查看。

仍待解答的问题

此次发布以简短公告的形式进行,并未公开具体的测试规模、作为对比对象的此前版本,以及是否存在安全性下降的单独验证结果。放宽生物学安全防护机制的同时,能否维持对真正高风险请求的拦截能力,仍是需要进一步确认的部分,该公司是否会有后续说明值得持续关注。