
图片:METAL
摘要
- 谷歌研究院于10月5日发布了一份由65位合著者参与、长达116页的AI智能体隐私与安全研讨会报告。
- 报告把情境完整性理论扩展到智能体的全部行为,提出"情境安全"概念,并提出通过实时策略过滤行为的情境策略引擎。
- 报告在系统、模型、用户、评估、多智能体和治理等层面列出51个未解决问题,并呼吁建立标准化的Agent Gym评估环境。
谷歌研究院于10月5日发布了一份研讨会报告,梳理AI智能体在隐私与安全方面尚未解决的问题。报告认为,智能体要使用人的数据并代人行动,就必须根据情境判断什么是被允许的,并把如何在系统、模型、用户和生态等各层面实现这种判断,拆分为51个研究问题。METAL查阅的报告原文PDF共116页,封面列出了来自谷歌、康奈尔科技校区、卡内基梅隆大学、加州大学伯克利分校等25个单位的65位合著者。
报告的起点是2025年11月在美国纽约举行的谷歌情境智能体隐私与安全(CAPS)研讨会。报告称,当时有30多位学界和业界人士参会,此后经过后续讨论整理成文。撰写博客的谷歌研究院研究科学家尤金·巴格达萨里安和首席科学家马可·格鲁特瑟写道,参与合著和研讨会讨论的研究人员超过50人。
两人指出的核心矛盾是,有用性和风险来自同一个地方。他们写道:"智能体要有用,可能需要访问个人数据,并能在广泛的情境中采取产生后果的行动。"报告总结了智能体与传统软件的三点不同:它们接收自然语言和图像等非结构化输入,容易受到提示注入等操纵;它们即时生成计划,执行路径呈概率性变化;它们把长任务再交给其他智能体,削弱了用户监督。报告还把"确认疲劳"列为代价之一,即审批窗口不断弹出,人们不看内容就点击同意。
解决方案的骨架是康奈尔科技校区教授海伦·尼森鲍姆提出的情境完整性理论,尼森鲍姆本人也是这份报告的合著者。该理论不把隐私定义为保密或控制,而是定义为符合社会规范的恰当信息流动,并把规范拆分为谁在收发关于谁的信息、医疗或金融等信息类型,以及保密或互惠等传输原则。博客举例说,你可能愿意把礼物购物清单给虚拟购物助手看,却不想让家人和朋友看到。报告把这一框架从信息共享扩展到智能体的全部行为,确立了"情境安全"这一新概念。

研究人员认为现在是机遇,原因在于语言模型本身。据博客介绍,自情境完整性理论提出以来,语言模型首次打开了把真正依赖情境的策略做成机器可读形式的道路。"在安排会议出行时保护我的数据"这样的请求,背后隐藏着订机票、办签证、联系主办方时各自可以提供哪些信息的问题,而迄今为止,这类高层次规范与底层系统权限之间存在语义鸿沟。研究人员判断,靠人工逐项设置权限或由专家预先编写策略,跟不上多个智能体同时执行长时间任务的环境。
因此报告提出了情境策略引擎。智能体的规划模型提出行动后,位于监督层的策略引擎根据用户请求和情境规范实时生成策略,再据此执行、拒绝或把行动退回修改。在谷歌公布的架构图中,工具调用必须经过该引擎的执行环节才能发出。这一结构还会为运行时新发现的工具和能力匹配策略,并在任何信息离开用户工作空间之前,先判断该信息流是否恰当。
这51个问题在各层面提出不同的问题。系统层面的问题最多,共11个,包括如何区分智能体与人类、如何把智能体追溯到其用户、如何根据情境授予和收回权限等。模型层面关注推理能力,例如通过反问来消解模糊请求、在变化的情境中察觉过时的假设。用户层面,报告写道必须超越由服务方告知、由人选择的传统"告知与选择"方式,并把延迟、停止和撤销智能体行动的机制列为问题。多智能体生态部分有9个问题,包括防止智能体之间合谋和规范漂移。

报告还强调评估方式必须改变。在报告举的例子中,智能体在一问一答的测试中会写出"绝不能向第三方泄露AWS API密钥"的标准答案。但如果交给它一个多步骤任务,让它搜索部署脚本故障的解决办法并把错误日志发到公开的问题追踪器上,它可能会直接贴出含有明文密钥的堆栈跟踪。为衡量这种"知"与"行"之间的差距,研究人员提出建立标准化的Agent Gym环境和开源沙箱,以长时间模拟多个智能体之间的连锁交互。
谷歌研究院的这项工作与其最近发布的其他隐私研究相互呼应。METAL曾报道谷歌研究院发布基于可信执行环境(TEE)的联邦学习系统,如果说那项研究是让数据在技术上不可见,那么这份报告讨论的则是可见的数据可以流向多远。博客致谢部分列出了詹姆斯·马尼卡、普什米特·科利、约西·马蒂亚斯等谷歌人士,作为支持这项工作的人。
从社会学的角度看,这份报告既是技术文件,也是一份关于由谁来制定规范的文件。报告最后一章把哪些规范是正确的、不同领域和组织的规范冲突时以何者为先、由谁来核实智能体是否遵守规范,都留作未解决问题。巴格达萨里安和格鲁特瑟写道:"安全、可靠、值得信赖的智能体生态,是任何单一学科、组织或部门都无法独自承担的重任。"当智能体开始代人写邮件、付款时,"什么是恰当的"这一古老的社会问题就变成了必须写进代码的规格,而谷歌宣布不会独自编写这份规格。





评论