
图片:METAL
摘要
- 微软CEO萨提亚·纳德拉于10月10日在X上发表文章《超级智能时代作为内部人风险的模型》。
- 他主张必须假设模型已被攻破并从一开始就加以隔离,还需要一个紧急刹车,让获得授权的人即使在任务进行中也能叫停模型。
- 文章提出模型多样性、全面观察、可验证性、独立控制、独立审计、隔离和事故披露七项原则,但没有说明实现这些原则的产品或技术标准。
微软首席执行官萨提亚·纳德拉发表文章,主张前沿AI模型应像公司内部的内部人风险一样被对待。纳德拉于10月10日在自己的X账号上发布了一篇题为《超级智能时代作为内部人风险的模型(Models as Insider Risks in the Super Intelligence Era)》的长文。其核心观点是:应假设模型已经被攻破,并从一开始就将其隔离。根据METAL查看的X原帖页面,这篇文章在一天之内浏览量就超过了570万次。
出发点是可追溯性。纳德拉写道,过去几十年里,传统软件可以把某个行为追溯到具体的代码路径,而如今的模型不允许这种机制性的理解。模型的行为和输出无法归因于特定的训练数据输入或模型权重配置。他指出,尽管如此,企业仍在让智能体系统访问最敏感的数据,并让它们执行关键业务操作。
他明确了责任归属。纳德拉写道:"模型提供方的保证并不能免除我们的这份责任。"他认为,不能把AI当作"一组层层嵌套的黑箱",只是接受或拒绝它的建议、回答和行动,而应构建行为可观察、边界可测试、行动随时可被隔离的系统。他用一句话概括了这一点:"我们需要把智能的供给与对它的授权分离开来。"
方法论借自安全领域。纳德拉提议暂且搁置对齐这一难题,先从隔离与治理的工程方法入手。即用确定性的系统设计、人的控制和可靠的操作流程包围非确定性的模型,并在现有标准不足之处建立行业标准。他提出无论是闭源模型还是开放权重模型,都应把前沿模型当作内部人风险来对待,也是同样的逻辑。他解释说,这并不是因为模型必然怀有恶意,而是因为任何能够访问重要系统、能力足够强的行为者都可能犯错或被攻破。他的判断是,企业几十年来不断完善身份认证、最小权限、活动日志、隔离边界等做法,如今正开始把这些原则应用到企业内部的AI上。
思维链(CoT)的公开被他设为起点。纳德拉写道,CoT透明度不容商量,"Neuralese"不能成为让模型推理保持不透明的理由。Neuralese指的是模型用人类无法读懂的内部表示进行推理的现象。不过他补充说,由于我们还不知道如何让模型输出始终如实反映其推理,单靠CoT既不充分,也不可靠。他也建议让模型之间相互进行对抗性测试和验证,但指出这样可能会形成一个不透明的模型处在不透明的编排层中、又被另一个不透明的模型监视的结构。
由此得出的结论是:控制必须位于模型之外。纳德拉援引了一条可追溯到20世纪70年代的信息安全原则作为依据:程序不得绕过或篡改执行其权限的机制。他写道,放在今天,这意味着把模型与编排其工作的"harness"以及界定其能做什么的行动空间分离开来,并把控制和防护措施外部化。
文章把这些归纳为七项设计原则。前三项是:模型多样性,即任何一个模型都不应成为重要结果的唯一依赖,也不应自己验证自己的工作;全面观察,即每一个有意义的行为都要留下防篡改、人类可读的证据;可验证性,即不仅持续测试成功的任务,还要测试失败、攻击、边缘情况和系统变更。随后是独立控制,即由组织独立决定模型能访问什么、能做什么;以及独立审计,即让验证与被验证的智能相互独立。其余两项是隔离与事故披露。纳德拉写道:"如果无法观察,就无法信任。"
最有力的一句出现在隔离这一项中。纳德拉写道:"我们必须假设模型已被攻破,并从一开始就加以隔离。可以把它想象成紧急刹车。"获得授权的人必须随时能够在任务进行中暂停或关闭模型;越先进的模型需要越先进的隔离技术,而这些技术需要标准化。在事故披露一项中,他主张应及时通知受影响者,全行业应共享哪些控制失效以及如何防止再次发生,披露内容还应包括会在运行时改变智能体行为的实现细节。
发表时机同样值得关注。据报道,这篇文章发表之际,多家主要AI公司正陆续承认一些似乎失去对模型控制的事件,而且是在Anthropic首席执行官达里奥·阿莫代伊发布更审慎的发展计划之后。METAL此前报道过阿莫代伊发表了关于调节AI发展速度的文章。据报道,纳德拉在全文中使用的"超级智能(Super Intelligence)"一词,是特朗普政府偏好的说法。要求人能够叫停模型的呼声,此前在政策层面也已出现。METAL此前报道过加州州长加文·纽森签署了AI紧急关停行政命令。
作者的身份也增加了分量。纳德拉于1992年加入微软,曾领导其云与企业部门,并于2014年2月出任CEO。据报道,微软在2026年4月29日的财报电话会上表示,其AI业务的年化营收已超过370亿美元,同比增长123%。文章没有说明将实现这些原则的微软产品或部署计划,也没有指定技术标准或监管体系。
从工程师的角度看,这篇文章使用的不是模型质量竞争的语言,而是系统设计的语言。把权限判定、记录和停止开关放在模型之外的要求,会变成摆在构建智能体团队面前的具体问题:授权工具调用的那一层是否与模型运行在同一进程中,行为记录是由系统而不是模型留下的,以及让人中途切断任务的路径是否真正经过了测试。纳德拉这样结束全文:"最值得信赖的超级智能系统,不是拥有我们最信任的模型的系统,而是让我们可以最少信任模型的系统。"





评论