Preparedness Framework
OpenAI预先制定的规则手册,一旦AI模型的危险能力达到特定水平,就会自动触发安全措施
简单来说
Preparedness Framework用预先设定好的标准来衡量AI模型距离危险能力有多近,一旦超过这些标准,公司必须采取什么措施也都提前以规则的形式写好了。
可以联想医院急诊室的分诊制度。把患者状态分成轻度、中度、重度、危重等级别,就能提前规定好到了哪个级别该采取什么处置。Preparedness Framework也是同样的道理。它在生物武器、化学武器、网络安全、AI自我提升能力这四个领域,把模型能力划分成若干等级,一旦达到某个特定等级(尤其是'关键'等级),暂停发布或大幅加强安全防护等既定应对措施就会自动启动。
举例来说,网络安全领域的'关键'等级指的是,模型无需人类协助,就能自行在真实的核心系统中发现未知的安全漏洞并加以利用攻击的水平。一旦评估认为模型已经达到这一等级,或者无法排除已经达到的可能性,隔离访问权限、加密数据等强化安全管控措施就会立即跟进。
在报道中是这样出现的
文章中常见这样的表述:"Astra被认定不能排除达到Preparedness Framework中'关键'网络能力等级的可能性。"容易被误解的一点是,这并非政府制定的法律法规,而是OpenAI于2023年12月自行制定的内部政策。不过,白宫近来正在推动将这类内部评估标准纳入政府监管体系,因此企业内部规则转变为公共政策的可能性也正在被讨论。
