
이미지: Anthropic
摘要
- Anthropic重新训练了Fable 5的生物安全分类器,将不必要的拦截(误报)减少了约85%。
- 普通医疗咨询、症状理解、教育用生物学等日常请求现在可以直接由更强大的Fable 5处理。
- 病毒学、毒理学、分子设计等具有双重用途可能性的专业研究领域,依然维持原有的拦截政策。
发生了什么变化
Anthropic于8月7日宣布,已大幅改进Claude Fable 5的生物安全分类器。此次更新使生物相关查询被转向能力较弱的Opus 5处理的"回退(fallback)"比例减少了约85%。Anthropic是一家以AI安全研究为核心使命的公司,其目标是构建可信、可解释、可控的AI系统。

真正从此次变化中获益的是日常医疗和教育目的的用户。检验结果解读、症状理解、教育场景下的生物学学习等请求现在由Fable 5直接处理。医疗专业人员在临床工作中也能获得更多Fable 5的支持。
为何最初要如此广泛地限制
Anthropic表示,在Fable 5发布之初,曾有意封锁几乎所有生物学相关查询。原因是该模型在部分高度复杂的生物学任务上已达到超越专家的水平。根据公司的能力评估,Fable 5可能为恶意行为者提供其他渠道无法获得的能力,即所谓"实质性能力提升(uplift)"。
与网络攻击不同,生物领域的核心担忧在于风险一旦显现便难以逆转。释放出的病毒无法远程终止,而制定应对措施需要时间。Anthropic援引美国情报机构发布的2026年度威胁评估(Annual Threat Assessment)指出,合成生物学、基因组编辑等生物技术的发展可能带来新的生物威胁,且很可能有部分国家行为者正维持着用于主动攻击的生物、化学武器项目。
生物学领域中有益研究与有害研究之间的界限难以划分,这也是维持广泛拦截范围的原因之一。例如,活疫苗的开发需要科学家直接培养其欲预防的病原体;而治疗高血压的药物卡托普利,正是从能急剧降低血压的蛇毒成分中分离提取而来。治疗药物研究与危险物质生产在同一过程中进行的情况并不少见。
分类器如何运作
Anthropic管理生物风险的核心手段是安全分类器——一种规模更小、自动化程度更高的AI系统,用于检测Fable 5是否正在执行特定生物学任务或生成有害输出。一旦分类器被触发,用户的请求就会被转向不具备同等生物学能力的Opus 5处理。
为完成此次改进,Anthropic历时数周全面重写了区分允许内容与禁止内容的规则集,即"分类器宪章(constitution)"。新宪章旨在更精细地区分良性(benign)使用场景,并综合了公司内部及外部专家团队的反馈意见。随后,Anthropic基于该宪章重新构建了训练数据并对分类器进行了重新训练,同时验证了分类器在允许更广泛良性用途的同时,是否仍能对有害或具有双重用途可能性的内容保持有效拦截。
此次更新的效果因产品界面而异。预计Claude.ai的整体回退率将减少约67%,Cowork约55%,Claude Code约17%,Claude Platform约7%。
仍然受限的领域
具有双重用途可能性的专业研究领域,在此次更新后依然维持拦截状态。病毒学、毒理学、分子设计等专业生物学研究,以及新药研发相关查询,仍会被转向Opus 5处理。Anthropic明确表示,正因如此,Fable 5目前尚不能用于专业生物学研究或新药研发用途。
此外,对于处于分类器安全边界之内的请求——即风险可能性极低但分类器仍会触发的情况——误报问题并未完全消除。Anthropic承认了这一局限性,并表示正在构建一项计划,通过可信访问路径(trusted access pathways)让研究人员使用受限功能。该计划旨在让专业研究人员在不受双重用途限制的情况下,访问Fable 5的最高能力水平,但具体的时间表或条件尚未公开。



