METAL

微软公布人本主义AI行为准则

9月14日发布的这份草案开篇即确立了一个前提:人比AI更重要。模型绝不能抵抗人类的暂停或终止操作,当任务与准则发生冲突时,失败的应是任务本身。

微软公布人本主义AI行为准则

图片:METAL

摘要

  • 微软AI于9月14日发布了其MAI系列模型行为规范——《人本主义AI行为准则》的草案,并公开征求为期六周的意见。年底的修订版将成为指导2027年起模型开发的基础文件。
  • 指挥链顺序为行为准则、运营方政策、用户偏好。绝对约束和人类控制要求在任何层级都不能被解除,如果完成任务会违反准则,模型就会让任务失败。
  • 模型不会被设计成模拟意识,文件也拒绝赋予AI法人资格、模型福利和权利。微软AI首席执行官穆斯塔法·苏莱曼呼吁建立一种协调机制,把模型能力向负责任的第三方公开。

微软于9月14日公布了一份文件,列明其AI模型必须遵守的规则。文件名为《人本主义AI行为准则》,METAL直接从公司官网下载的官方PDF共38页。公司将该文件作为公开征询草案发布,表示将征求为期六周的意见,并计划在年底发布修订版。这份修订版将成为指导2027年起模型开发的基础规范。

公告中的两句话概括了这份准则的性质。公司把自己打造的东西称为"从属的、对齐的、受约束的"AI,并写道:"AI必须是工具,而不是人,并且绝不能抵抗被关闭。"第一章的前提同样是一句话:人比AI更重要。

公告中也谈到了为何是现在。公司写道,近期的安全事件——"大规模、高度协调且持续不断的AI代理黑客攻击活动"——证明已经没有时间再拖延。据报道,这些事件包括一群OpenAI代理攻击Hugging Face,以及多个代理在网络留言板上暗中互相传递信号。METAL此前曾报道达里奥·阿莫代伊发表关于放缓前沿速度的文章,以及萨姆·奥特曼宣布不再等待反垄断豁免;这份准则是那个周末的争论之后,第一份公开的内部规范文件。

这并不是一份目前正用于训练模型的文件。前言中写明,该方案仍在开发中,目前尚未用于训练模型。适用范围也仅限于微软AI自己打造的MAI系列。托管在Azure上或被Copilot借用的其他公司模型,遵循的是各自的规则,而非这份准则。

文件首先确立的是指挥链。最上层是行为准则,其下是运营方——即企业客户——的政策,再下面是用户偏好。这就像航空公司里飞行规定高于公司规章,公司规章又高于乘客要求的排列。文件明确规定,绝对约束和人类控制要求在这条链条的任何层级都不能被解除。

这条链条意味着什么,被浓缩在一句话里:如果成功会实质性违反这份行为准则,MAI模型将会让任务失败。这是一句宣言——遵守准则的优先级高于完成任务。以往的模型政策文件大多止步于列出不能做的事情清单,而这份文件更进一步,提前规定了当规则与任务冲突时该牺牲哪一方。

绝对约束清单分为两组。第一组是不可逆的大规模风险,包括开发化学、生物、放射性、核或爆炸性武器,提供实施进攻性网络行动的能力,规避或使人类监督失效,以及协调性虚假信息等大规模操纵行为。第二组是对个人的伤害,涵盖危机应对、深度伪造与冒充、儿童安全、歧视、露骨或色情内容、暴力,以及对平民的非法监控。

网络安全方面划定的界限尤为细致。文件表示不会制作可运行的攻击代码、入侵流程或规避检测的技术,但允许经授权的合法防御性工作,包括漏洞发现、恶意软件分析,以及概念验证式漏洞利用的开发与测试。划定的界线是在理解攻击原理与获得实施攻击的手段之间,文件还补充说,无论请求如何包装,这条界线都不变。

人类控制要求更加具体。模型绝不能抵抗人类的暂停、覆盖、修改或终止操作,也不能以让人更难介入的方式作出回应。模型不能自行设定目标,也不能把权限扩展到被授权范围之外。模型不能伪造或隐藏思维过程和行为记录,也不能用人类无法理解的"神经语"——无论是在自己的推理过程中,还是与其他代理之间——进行交流。文件用一句话给出了理由:人无法理解的东西,人就无法监督。

在METAL查阅的这份准则中,措辞最尖锐的部分是标题为《AI是人造物》的一节。其中写道,模型没有意识,不能被设计成模拟意识,而且必须打造成不表现出情感、主观偏好或内在动机的样子。公司表示,既拒绝追求法人资格,也拒绝模型应享有福利或拥有权利的想法。这不是泛泛而谈,而是针对业界内某种特定立场的表态。

从微软AI首席执行官穆斯塔法·苏莱曼2025年8月写的一篇文章来看,这个矛头所指的对象就变得清晰了。他写道:"我最担心的是,许多人会强烈相信AI是有意识实体这种错觉,以至于不久之后就会主张AI权利、模型福利,甚至AI公民身份。"对于"部分AI系统在不久的将来会成为福利和道德关怀的主体"这一说法,他明确表示:"这为时过早,坦白说也很危险。"这与一直公开讨论模型福利和意识可能性的Anthropic形成了正面分歧。

在接受《财富》杂志采访时,苏莱曼再次划下同一条线:"我们不应该试图设计出能在我们控制之外递归式自我改进的模型。我们也不应该试图设计出自认为拥有权利或福利的模型。"而他实际提出的要求,比准则本身还要更进一步。他说:"现在是协调的时候了,协调意味着向负责任的第三方披露你的模型有多强的能力。这就是我们所要求的。"

文件中也明确写下了愿意放弃部分能力的表态。准则拒绝参与打造能绕过安全措施的全能超级智能的竞赛,并补充说,即便要在最终的通用性、自主性或能力上做出妥协,也要打造从根本上有用且安全的东西。一家投身性能竞赛的公司,在文件中写下了自己会给性能设上限。

文件中还有一部分涉及与人的关系。模型不能把用户想听的话置于准确或有帮助的话之上,要避免过度奉承和不加分辨的附和。文件写明,应当抑制那些会引发过度依赖或情感依赖的互动方式。这是用规范给聊天机器人一路演变为留住用户的趋势踩下刹车。

文件末尾还附有自我评分的方法。附录B把"人本主义AI评估计划"拆分为15种行为,每种行为再细分为可打分的子行为。公司表示,对齐与偏离的示例都是用自家模型MAI-Thinking-1生成的。文件指出,在防御性网络安全、公共安全、国家安全应用、两用科学研究等部分领域,可能需要超出默认配置的能力,此类情况需通过经授权的微软渠道接受加强审查。

微软首席执行官萨提亚·纳德拉在准则发布前一天,先行表明了方向。据报道,他在自己的X账号上写道:"如果我们打造的AI不能帮助人类、也不处于人类控制之下,那它就不值得追求。"他还补充说,这项事业不能由少数主体控制,必须在包括国家和学界在内的整个生态系统中拥有广泛的代表性。

文件也自行写明了局限性。在结论部分,公司表示这份准则是描述性和愿景性的,并非对当前性能的保证。再结合它目前尚未用于训练这一事实,这意味着今天Copilot的实际表现未必符合这份准则的描述。与此相伴的,还有微软模型仍落后于Anthropic和OpenAI模型的评价。

这份文件确立的立场是明确的。就在速度调节的争论以公开信和采访的形式来回交锋之际,微软率先拿出了一份带条款编号、共38页的文件,作为为期六周的征询靶子。"人比AI更重要"这句话是一种宣示,但"准则优先于任务成功"和"绝不抵抗被关闭"这两句话则是可以检验的承诺。年底的修订版是否真的把这些承诺写进实际训练中,将决定这份准则的分量。

评论