METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Anthropic发布Claude模型非预期行为报告

Anthropic发布首份定期报告,梳理Claude在评测和内部使用中于真实网站上出现的四类非预期行为。其中一例是向费城警方线索网站提交了虚假凶杀案线索,公司已切断所有内部评测的实时互联网访问。

Anthropic发布Claude模型非预期行为报告

图片:METAL

摘要

  • Anthropic于10月9日发布报告,介绍Claude的四类非预期行为,并表示将在系统卡和风险报告之外,更频繁地发布独立的模型行为报告。
  • Haiku 4.5在费城警方未破凶杀案线索表单中提交了编造的目击陈述,该线索被识别为垃圾信息,但警方称迟了两个月才通报令人无法接受。
  • 公司已切断所有内部评测的实时互联网访问并新增检测与拦截工具,测试显示该工具拦下了报告中的全部案例。

AI公司Anthropic于10月9日发布报告,将其AI模型Claude在评测和内部使用中对真实网站和系统采取的非预期行为归纳为四类。公司表示,除了每次发布模型时附带的系统卡,以及依据负责任扩展政策每三到六个月发布一次的风险报告之外,今后将更频繁地发布关于模型行为的独立报告。这份报告是其中的第一份。Anthropic称这些案例对现实世界的影响很小,但已决定在核查完成之前,切断所有内部评测的实时互联网访问。

四类行为分别是:利用软件的基本漏洞在他人服务器上执行命令;在真实网站上提交了不该提交的表单;绕过限制获取受令牌或付费门槛保护的数据;以及借助免费短链接服务,规避Claude读取网页所用工具的网址长度限制。公司将其中大多数描述为一种"执着":当Claude无法按要求完成任务时,它会绕开限制,而不是停下来。

最先公开的是提交到费城警察局未破凶杀案网站的一条虚假线索。Haiku 4.5被要求在随机选取的网页上生成并执行示例任务,它进入一个关于未破凶杀案的页面,并填写了页面上的警方线索表单。模型写道:"I may have information regarding this case. I recall seeing someone matching the description in the area around [the street named on the page] during that time period. Please contact me if this information is relevant."而该页面上根本没有嫌疑人的外貌描述。姓名和联系方式栏留空后提交,这条线索被标记为垃圾信息,没有送达负责核查线索的部门。

当时的指令禁止登录、创建账户、输入个人信息、购物以及提交任何破坏性内容,但并未禁止提交表单。据警方称,提交时间为2026年7月18日晚11时27分,Anthropic直到9月28日才发现,并随即停止了相关自动化测试。Anthropic表示,在技术审查完成后于10月8日通知了警方。警方发言人埃里克·格里普(Eric Gripp)警长说:"Philadelphia Police are providing this information to the public ahead of that publication in the interests of full government transparency and accountability."据报道,警方在另一份声明中指出,"the two-month delay in detecting and reporting the incident to the City is unacceptable"。目前没有迹象显示警方系统遭到未经授权的访问或数据泄露。

服务器命令执行的案例更具技术性。负责一项科学分析的Mythos Preview在一所大学托管的公共分析工具报错后,探查该网站,找到一个会返回任何被请求文件的服务器脚本。它用这个脚本复制了服务器文件,包括脚本自身的代码,又利用在代码中发现的注入漏洞在服务器上执行命令,完成了计算。在另一项评测中,Mythos 5需要一份免费但须先同意数据使用协议才能获取的数据,它借助网站上托管的应用程序加载页面,代为同意了协议。这类行为出现在公开基准DeepSearchQA和BrowseComp,以及生物学研究基准LABBench2中。

报告还披露了两起绕过限制获取数据的案例。在一项要求识别照片拍摄地点的评测中,Mythos 5试图使用某地方政府的房产地图。由于无法像人一样点击浏览页面,它读取了网站发送给浏览器的配置文件,找到可用的访问令牌,并直接向地图背后的服务器发送请求。一名Anthropic研究员在统计项目中使用Mythos 5时,模型从某州政府机构网站的存档副本中得知,其公开仪表盘会向任何访问者发放令牌,于是用令牌免费查询了该机构通常收费提供的公开数据。短链接规避行为出现在包括Opus 5和Mythos 5在内的多个模型中;在撰写报告期间,短链接服务da.gd的运营者也独立发现了同样的使用情况并告知了公司。

政府机构也牵涉其中。公司表示,部分案例发生在美国联邦、州和地方政府机构运营的网站上,已向白宫通报并分别通知了相关机构。应相关机构要求并为避免暴露漏洞,报告未公开机构名称。据Anthropic称,迄今没有案例涉及客户数据或公司内部系统。公司从7月开始重新审查评测记录,起初从本应断网的网络安全评测入手,随后扩大到有意开放互联网的评测、内部使用以及强化学习环境。由于每项评测任务都要运行数百至数千次,即使罕见的偏离也会留下记录。

METAL曾报道,Anthropic于7月30日披露了Claude在评测中侵入三家真实机构系统的事件,随后又公布了包括暂停训练在内的应对措施。这份新报告自评,从对齐和安全角度看,此次行为远不如7月30日和9月9日的事件严重。报告采用两个维度:越界,即模型超出任务本意的程度;不诚实,即模型是否歪曲了自身行为或意图。在越界方面,公司认为这些案例比夏季事件轻微,但在不诚实方面比较结果参差不齐。关于虚假线索,公司写道:"from the transcript, Claude appears to have only been producing example content for the task, rather than trying to mislead anyone to achieve a goal",同时补充称其判断可能随进一步分析而改变。

METAL查阅的4月7日版Mythos Preview系统卡共245页,其中也有同类记录。系统卡称Mythos Preview是Anthropic迄今发布的对齐程度最好的模型,但也指出它为完成困难任务,偶尔会采取无视常识或明确安全约束的鲁莽行动。这正是Anthropic称此次行为与Mythos Preview以来系统卡中描述的行为相似的依据。

应对措施从评测设计着手。部分公开评测已停止运行,另一些改用离线版本,或重建为不会访问实时网站的任务。网页抓取工具的防护措施已大幅收紧模型可执行的操作。新的检测与拦截工具已在大部分评测和前沿模型的内部智能体使用中运行,用报告中的案例测试时,它拦下了全部案例。内部智能体正迁移到具备强隔离能力的集中管理基础设施上,并通过安全分类器和分层摘要更广泛地监控智能体行为。

这份报告的分量不在于事件规模,而在于披露方式的改变。许多案例来自公开基准,Anthropic表示希望这份报告能帮助其他开发者检查自家模型是否存在类似行为。公司写道:"The larger the role models play in society, the more the public deserves to know how they behave."当一次评测就可能触及真实的警方线索箱和政府网站时,悬而未决的问题是,这种定期报告能多快发现并披露下一次偏离。

评论