
이미지: AI 생성 — METAL LAB
摘要
- Anthropic改进了Fable 5的生物安全分类器,将基于误判的回退减少了约85%。
- 面向健康、教育目的的普通生物学提问将获得更宽松的响应,但病毒学、毒理学等双重用途领域仍会被拦截。
- Fable 5被拦截时会切换至Opus 5处理,面向专业研究人员的可信访问通道正在单独开发中。
为减少误判重新设计分类器
Anthropic是一家专注于AI安全研究的公司,致力于开发具备可靠性、可解释性和可控性的AI系统。此次公布的更新是对Fable 5生物安全分类器进行全面重写的成果。团队重新编写了作为分类器规则集的"宪法(constitution)",并据此重新构建训练数据,再对分类器进行了重新训练。整个过程还广泛征询了内部及外部各类专家群体的意见。
改进后的分类器能够更精确地区分良性(benign)提问与具有双重用途性质的提问之间的细微差别。结果显示,与生物学相关的回退在整体产品中减少了约85%。具体来看,Claude.ai的总回退量预计减少约67%,Cowork约减少55%,Claude Code约减少17%,Claude Platform约减少7%。

什么是回退(fallback)
当安全分类器检测到具有风险或双重用途潜力的生物学提问时,Fable 5会自动将该请求转由Opus 5处理。由于Opus 5不具备与Fable 5同等水平的生物学能力,能为恶意用户提供的帮助也相应受限。这就是用户所体验到的"回退"。
Anthropic表示,在Fable 5发布之初,曾刻意采用一套覆盖面极广的分类器,几乎拦截所有生物学相关提问。这是为了让模型在其他领域正常提供服务的同时,先行管控生物学滥用风险而做出的决定。与其等到分类器足够精细后才整体发布模型,团队选择先设置一张宽泛的防护网提前上线,随后再逐步优化改进。
为何生物学被单独对待
Anthropic对生物学领域施加额外强力防护措施的原因在于,该领域的双重用途区分尤为困难。研发某种疾病的治疗药物时,往往需要先制造出引发该疾病的危险化合物。减毒活疫苗就是典型例子——科学家必须直接培养他们想要预防的病原体。同样,在开发高血压治疗药物卡托普利的过程中,研究人员也需要分离出能急剧降压的蛇毒毒性成分。
根据Anthropic的能力评估,Fable 5在部分高难度生物学任务上的表现已经超越专家水平,团队判断该模型可能为恶意行为者提供其他渠道无法获得的能力。
目前的变化与仍受限制的部分
此次更新预计将大幅减少解读实验室检测结果、了解症状、出于教育目的学习生物学等日常健康与教育类提问中的回退情况。医疗专业人士在临床相关提问方面也将从Fable 5获得更多支持。
不过,病毒学、毒理学、分子设计等具有双重用途潜力的专业研究领域目前仍会回退至Opus 5,尚无法用于专业生物学研究或新药研发。Anthropic表示,正在单独开发一条可信访问通道(trusted access pathway)以弥补这一空缺。该通道的具体运作方式及上线时间目前尚未公开。



