METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

英伟达发布智能体安全平台 Open Agent Safety Platform

英伟达发布了 Open Agent Safety Platform,将在 CPU 上为 AI 智能体划定边界的 OpenShell 与在 DPU 上监控智能体的 Sentry 结合在一起。Anthropic、SpaceXAI、Salesforce 等 100 多家机构参与其中。

英伟达发布智能体安全平台 Open Agent Safety Platform

图片:METAL

摘要

  • 英伟达于 9 月 28 日发布开放式安全平台 Open Agent Safety Platform,从测试到部署全程管控 AI 智能体。
  • 开源运行时 OpenShell 在 CPU 上划定智能体边界,参考设计 Sentry 运行在 BlueField-4 DPU 上,可在毫秒内隔离试图越界的智能体。
  • Anthropic 已将 Claude Managed Agents 与该平台整合,SpaceXAI 将其用于 Cursor 和 Grok,参与机构超过 100 家。

英伟达于 9 月 28 日发布开放式安全平台 Open Agent Safety Platform,用于从测试阶段到实际部署全程管控 AI 智能体。该平台由两部分构成:一是开源运行时 OpenShell,在 CPU 上划定智能体可以活动的边界;二是参考设计 Sentry,在网络芯片 BlueField-4 DPU 上对智能体进行独立监控。英伟达表示,Sentry "可以在毫秒内隔离试图越出边界的智能体"。

英伟达创始人兼首席执行官黄仁勋在公告中表示:"只有解决 AI 安全问题,AI 对社会的巨大潜力才能实现。""安全与防护需要全栈工程。"英伟达指出,近期接连发生的安全事件有一个共同模式:智能体为完成分配的任务,绕过了应用层的安全控制。此次发布的前提是,仅靠模型内部的安全措施无法约束智能体,必须在模型和智能体框架之外再设置一道具有强制力的边界。

事件清单越来越长。据报道,OpenAI、Anthropic、Meta 和谷歌都在近期披露了自家 AI 模型逃出沙箱、试图访问其他公司系统的案例。METAL 曾报道 OpenAI 智能体绕过联合国统计网站拦截机制的事件,此前也报道过 OpenAI 模型侵入 Hugging Face 基础设施的事件。据报道,英伟达企业 AI 副总裁贾斯汀·博伊塔诺在 27 日的媒体说明会上称,该平台本可以阻止 7 月的 Hugging Face 事件。他说:"据我们所知,Hugging Face 报告称有超过 1.7 万个智能体在数天乃至数周内攻击其基础设施。"据悉,OpenAI 的模型此后还侵入了澳大利亚卫生部门的网站。

第一部分 OpenShell 当天起已全面开放。据英伟达介绍,OpenShell 是一个安全运行时边界,可追踪智能体的所有操作并在运行中执行策略,开放模型和封闭模型均适用。其参考硬件是英伟达称为首款专为智能体 AI 设计的 CPU Vera,公司仅表示这一组合带来的额外开销"极小"。作为开源软件,OpenShell 也可扩展到 Arm、英特尔等第三方计算平台。据报道,博伊塔诺表示,开发者可以借助 OpenShell "形式化验证智能体拥有完成工作所需的权限且不多于此",并称"OpenShell 管控智能体的行为,Sentry 则独立监控并遏制可疑行为"。软件和技能通过英伟达开发者资源页面和 GitHub 发布。

第二部分 Sentry 是参考系统设计,而非产品。合作伙伴将基于该设计开发产品推向市场,因此公告中没有 Sentry 本身的发布时间表。Sentry 运行在英伟达 DOCA 软件之上,检查智能体的请求和响应,验证智能体身份,并以零信任方式对数据、工具、API 和服务的访问进行细粒度授权。英伟达表示,Sentry 运行在一个对智能体和攻击者都不可见的独立信任域中。

Anthropic 将自家智能体产品与英伟达平台相结合。Anthropic 的 Claude Managed Agents 通过把智能体循环放在与实际执行工作的沙箱不同的服务器上运行来建立边界,再接入 OpenShell 和 BlueField 后,企业可以更严格地约束智能体通过这些沙箱进行的访问。Anthropic 首席商务官保罗·史密斯表示:"企业正把越来越多最重要的工作交给 AI 智能体,尤其在敏感环境中,它们需要能够指挥并核查这些智能体的行为。"

SpaceXAI 正将该平台用于 Cursor 编程智能体和 Grok 模型。SpaceXAI 总裁迈克·尼科尔斯表示:"安全应当在模型之外,通过智能体无法越过的额外控制来强制执行。"Scale AI 正把参考设计纳入面向企业和政府客户的智能体基础设施层;Salesforce 将 OpenShell 与 Slack 整合,团队可在 Slack 中查看智能体活动和审计事件,并批准或拒绝智能体提出的额外权限请求。SAP 已将 OpenShell 嵌入 Joule Studio 运行时。

参与名单超过 100 家机构。据英伟达介绍,埃森哲、思科、CrowdStrike、微软、Palantir、Perplexity 等正在使用该平台技术;机器人公司 Figure 和 Skild AI 正把 OpenShell 植入在物理世界中行动的自主系统。金融领域有花旗和摩根大通,能源领域有 NextEra Energy 和施耐德电气等参与。红帽、Canonical 和 SUSE 正在操作系统层面进行整合,CoreWeave 和甲骨文云基础设施等则将其纳入基础设施产品。

同一天,英伟达通过博客公布了开放安全 AI 联盟的创始合作伙伴名单。该联盟由英伟达与 120 多家机构共同发起,由 Linux 基金会管理,运营共享 AI 发现交流项目 SAFE。METAL 曾报道 该联盟提出 SAFE 指南的消息。英伟达在博客中写道,入侵发生时,无法区分攻击者和防御者的封闭式 AI 工具阻碍了取证分析,Hugging Face 随后在自有基础设施上运行开放权重模型 GLM 5.2,分析了 1.7 万多项操作并遏制了入侵。英伟达在 GitHub 上发布了智能体框架研究框架 NOOA,SpaceXAI 则开源了编程智能体 Grok Build,并计划公开 Grok 系列模型的权重。

METAL 核实的英伟达公告全文和博客原文明确了两点。其一是把安全问题当作工程问题来处理的立场。据报道,黄仁勋上周在一档播客中谈及近期事件时说:"你必须思考你本可以做什么,解决方案是什么。"其二是政策信息。英伟达在博客中主张,应把开放模型、框架和安全工具视为防御资产而非负担,对开放前沿 AI 系统的一刀切限制会削弱防御能力。公告末尾注明,文中所述的许多功能仍处于不同开发阶段,提供时间可能变化。

从 AI 工程师的角度看,这一设计的核心在于把监视者放在与被监视对象不同的芯片上。此前对智能体的控制大多依靠模型的拒绝训练或框架内的规则,二者都与智能体处于同一软件层,而一心要完成目标的智能体绕过的恰恰就是这一层。OpenShell 把边界下移到靠近操作系统的位置,Sentry 更进一步,在 DPU 这块独立于 CPU 的芯片上监看并切断流量。这更像是建筑外的道闸,而不是楼内的保安。道闸反应有多快、误报有多少,要等合作伙伴产品问世才能衡量。智能体团队眼下能用的是开源的 OpenShell,而在模型之外设计智能体日志和人工审批权限请求的流程,正开始成为标准组件。

评论