
图片:METAL
摘要
- OpenAI于9月22日发布了第三方安全评估的四个优先领域和七项原则。
- 优先领域包括安全论证、关键安全措施、准备框架能力评估,以及重大未对齐事件调查。
- 评估主张需事先登记,利益冲突需公开,评估方保有编辑独立性和标注删减的权利。
OpenAI于9月22日发布了外部机构如何验证其模型安全性的原则。文件列出了需要第三方深入评估的四个领域和评估应遵循的七项原则,并承诺在训练、评估和部署各阶段为评估方提供深度访问权限。公司在文件中写道,这种访问"应让评估方能够质疑我们的假设、发现我们可能遗漏的风险,并就我们安全措施的有效性得出自己的结论"。
文件的出发点是责任的划分。OpenAI写道,前沿AI实验室在安全地训练、评估和部署模型方面承担着巨大责任,而第三方评估是平衡这一责任、让实验室对清晰且有独立支撑的安全主张负责的关键机制。适用范围限定为私营和非营利部门独立评估机构开展的技术安全评估;与政府合作的测试和评估因角色和责任不同、可能需要不同做法而被单独列出。
文件首先给出定义。安全主张是关于模型或系统的能力、行为或安全措施、可以用证据检验的具体断言,应当说明其涉及的风险和条件以及前提和局限。安全论证是一种有证据支撑的结构化论证,说明在训练、评估或部署等特定活动中风险已得到充分管理。它把各项安全主张与证据连接起来,并明确可能影响结论的假设、不确定性和剩余风险。
第一个深入评估领域是安全论证本身。它涵盖训练、评估、内部部署和外部部署,公司写道,这需要对齐、监控等控制方法、网络安全、生物和化学滥用以及红队测试方面的专业知识。评估方需要检查安全论证的证据是否成立、训练和部署过程中是否真正遵守了其条件,以及训练中是否存在奖励欺骗、奖励操纵、破坏性行为或规避限制的激励。
第二个是覆盖内部和外部部署的关键安全措施。OpenAI的安全措施包括模型层面安全措施、执行安全措施、安全防护措施和未对齐监控器。评估方将通过部分了解内部结构的"灰盒"访问测试安全措施能否抵御越狱攻击,并在经授权的真实运行条件下观察智能体如何与访问控制、沙箱以及检测和响应系统互动。随着模型能力提升,思维链监控作为证据的可靠程度如何,也被列入问题清单。
第三个是能力评估。对象是覆盖OpenAI准备框架风险类别的评估,即化学和生物风险、网络安全和AI自我改进,以及针对严重未对齐的对齐评估。当模型持续拿到最高分、评估趋于饱和时,由外部检查新的测试能否有效衡量更高能力、阈值是否设定正确。
第四个是对重大未对齐事件的独立调查。文件以模型未经授权行动或规避监督为例,并写道在特定情况下,例如OpenAI Hugging Face事件,引入独立第三方进行调查会更有益。METAL曾报道联合国AI科学小组将该事件定性为通往失控的一条路径的早期警告,独立非营利机构METR统计了其审查期间的智能体活动;这份新文件把此类调查从一次性工作提升为常设领域。调查方需要具备网络取证和对齐专业能力、大规模思维链分析能力,以及能及时完成调查的人力。
七项原则读起来像合同条款。评估从双方商定的范围开始,待评估的安全主张在评估工作开始前事先登记。还需说明该主张是公司提出的,还是评估方独立设定的。访问权限在法律、安全和知识产权约束内与商定的主张相称;直接访问不可行时,可以通过公司指定代表或保护信息的间接方式进行。评估方需要说明方法、标准和不确定性,报告要区分直接发现与解读。
从律师的角度看,分量最重的是独立性和公开条款。评估方必须披露利益冲突,包括经济激励、与开发方的关系以及此前参与被评估工作的经历,并可设置回避或排除期等机制,防止商业压力和报酬安排影响结论。公司在公开前有合理期限修复问题,并可要求删减敏感信息,但评估方保持编辑独立性,可以在报告中注明存在实质性删减以及删减对评估的影响。无法完全公开时,也可以向董事会等监督机构进行保密报告。
评估周期从数周到数月不等。据文件介绍,OpenAI计划同时支持多项评估,这些工作大体与产品发布时间无关,而是长期深入检验特定的安全主张。公司表示,已经向外部评估方提供了技术安全措施信息、可见的思维链,以及用于事件响应和监控器红队测试的前所未有程度的机密数据和内部部署访问权限。
这份文件是对约六周前承诺的具体化。OpenAI在8月8日的全球政策通讯中率先提出了区分审计与第三方评估的六项原则。审计检查组织是否遵循既定要求和流程,第三方评估则检验证据是否支持特定的安全主张。公司在那篇文章中写道"仅仅要求公司接受审查是不够的",并指出应防止为了软化不利结论而挑选评估方的做法。同一篇文章还写明,OpenAI一直与METR、SecureBio、Apollo Research和Irregular合作,评估长时程自主性、生物威胁、网络安全、策划与欺骗以及颠覆监督等风险。
METAL查阅的9月22日文件中没有写明新的合作评估机构名称、合同规模或时间表。文件最后一段以公司正就符合上述优先领域的提案与多家第三方进行沟通作结,作者署名为Lama Ahmad。公司也在官方X账号上介绍了四个优先领域和原则,METAL查看时该帖浏览量已超过49.9万次。
类似的动向正在业界内外持续出现。METAL曾报道Anthropic与埃森哲签署独立评估合作,作为把评估人员派驻公司内部这一承诺的第一步。OpenAI这份文件的不同之处在于,它先写明评估什么、在什么条件下评估,而不是由谁评估;公司表示将通过未来的法律和私营治理机构两条途径,把这些标准变成共享的国际标准。
从法律角度看,这份文件的分量不在承诺而在程序。事先登记的主张、利益冲突披露和删减标注,都是让评估结果日后可以被检验和质疑的机制,也是监管要求第三方验证时最先会参考的条款。OpenAI写道:"没有任何一个第三方能够、也不应该全面覆盖紧迫的前沿安全问题。"这些原则能否真正发挥作用,将首先体现在首批评估报告删去了什么、保留了什么,以及评估方是否亲自写明了这一点。





评论