
图片:METAL
摘要
- Anthropic 于9月18日宣布与埃森哲达成嵌入式评估合作,具体工作由埃森哲的 AI 业务 Faculty 负责。
- 两家公司预计各自在五年内投入至少10亿美元,本次合作的费用由 Anthropic 直接承担。
- 嵌入式评估人员将获得相当于员工的权限,涵盖训练中的模型、部署决策以及与员工的直接交流。
把评估者请进公司内部、而不是留在外面的承诺,变成了一纸合约。Anthropic 于9月18日表示,将与埃森哲共同开展前沿 AI 的独立评估。公司写道,这一合作是迈向首席执行官 Dario Amodei 在文章 We Must Pace the Frontier 中所作承诺的重要一步,即把评估者常驻到 Anthropic 内部。
具体工作由埃森哲的 AI 专业机构 Faculty 承担。范围写明为三项:模型评估与红队测试、对齐评估,以及模型安全防护措施的检验。Anthropic 解释说,埃森哲在多个行业帮助企业与政府部署 AI,而它对企业实际如何使用 AI 的理解,塑造了其安全方法。
资金的量级说明了这一合作的性质。两家公司表示,预计未来五年各自在该领域的能力建设上投入至少10亿美元。这是把评估作为一个业务部门、而非一个研究课题来建设的规模。
与现有外部评估者的关键区别在于权限。公告写道,嵌入式评估人员将在 AI 公司内部以相当于员工的权限工作。凭借这种权限,他们可以观察模型在训练中成形的过程,跟进决定模型如何构建与部署的决策,并直接与员工交流。这个位置让他们能够评估公司如何运转、核实其是否履行安全承诺并指出盲点,同时也包括上报事故、向公众提供关于收益与风险的更准确说明。
责任的归属被明确保留。Anthropic 写道"独立的嵌入式评估者不会减轻我们的责任,而是让这份责任更可核实",并补充说模型的安全仍然是自身的责任。
同一篇文章也写明,尚缺的东西还很多。关于嵌入式评估者应当获得哪些信息、发现的问题应当如何上报,目前还没有标准;为独立评估提供资金的方式也尚未确定。公司表示,长期来看资金应当来自共同基金或政府财源,但目前两者都不存在,因此将与不同的评估者以不同的资金安排开展工作。
于是本次合作由 Anthropic 直接承担埃森哲的费用。这形成了被评估方向评估方付费的结构,而公司另外写道,正在与 METR 等非营利评估机构讨论以各自的资金试行嵌入式评估的部分环节。METAL 曾报道过 Anthropic 把 Claude 的四起事故改称为未对齐,并预告由 METR 进行独立复核。
METAL 下载原始 PDF 并亲自数过页数的19页 Advanced AI Framework 中,早已写明这一结构的风险。这份6月发布的文件写道"自我评估并不足够",并单列一项,指出所谓评估者挑选的风险,即公司去寻找那些对自己要求最少、评价最宽松的评估者。文件给出的处方是,由政府机构按照公开论证的严谨程度等既定标准为评估者评级,并在风险较大的情形下随机指派高评级的评估者。
同一份文件也写明了评估者应当获得什么。在法规生效后六个月内,开发者须定期聘请至少一家合格的独立评估机构,并向其提供最新风险报告与系统卡的未删减版本,以及对其最强模型的访问权限。评估者须承担不复制、不留存、不披露机密信息的义务,但除此之外,在可以公开的内容上不应受到限制,包括对风险报告或开发方行为的担忧。
合约的形态也沿用了那份文件。本次合作为非独家,Anthropic 写道将在数周内公布其他评估机构。埃森哲也将以类似角色与其他 AI 开发商合作。这正是公司表示预计前沿实验室会同时与多家机构合作的段落。
常驻评估究竟能发现什么,取决于公司开放到什么程度。METAL 曾报道过 Anthropic 未经英国 AISI 的发布前检查就推出了一款模型。这次关于常驻评估者拥有员工级权限的承诺,意味着这类判断不再由公司独自作出;而承诺是否兑现,还要在一个既无标准也无资金来源的位置上得到验证。





评论