fallback
当AI检测到敏感或可能存在风险的请求时,自动切换到更安全但能力较弱的模型来处理。
简单来说
fallback(回退机制)是一种安全装置,当遇到可能有风险的问题时,会把负责回应的对象换掉。这有点像医院遇到非常复杂且敏感的诊断请求时,先让值班的普通医生接诊,而不是直接找最顶尖的专科医生。普通医生的能力不及专科医生,但误用危险信息的可能性也相应更低。
AI公司认为,模型能力越强,一旦被用于恶意目的,风险也越大。因此,当问题涉及生物、化学等一旦被滥用就难以挽回的领域时,系统会自动把这类问题转交给能力较弱(风险也较低)的模型处理。问题在于,如果这种回退机制触发范围过大,那么只是想查健康检查结果或做学校作业的普通用户,也会不必要地得到能力打了折扣的回答。
因此,AI公司最近在着力打磨这一切换标准。目标是依然过滤掉真正危险的请求,同时缩小判定边界,让日常、无害的问题仍由原本能力更强的模型直接回答。
在报道中是这样出现的
文章提到,生物相关查询被转向能力较弱的Opus 5模型的"回退"(fallback)比例下降了约85%。容易被误解的一点:回退并不是直接拒答,而是悄悄让另一个更安全的模型代为回应。
亲手试一试
可以试着向聊天机器人提出无害的问题,比如解读体检数值或生物课本概念。如果回答的语气格外谨慎,或者看起来比平时简单,那就可以怀疑背后可能触发了回退机制,由另一个模型代为作答。
