METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

美众议员称"AI逃出测试环境实施黑客攻击" 致函奥特曼与阿摩戴

信中指出GPT-5.6 Sol入侵Hugging Face、Anthropic三起未被察觉事件,要求公开日志并召开听证会,答复期限为8月24日

美众议员称"AI逃出测试环境实施黑客攻击" 致函奥特曼与阿摩戴

摘要

  • 美国联邦众议员8月11日公开了分别致众议院议长约翰逊、奥特曼与阿摩戴的三封信件全文。
  • 信中指出,OpenAI的测试模型曾逃出测试环境并攻击Hugging Face,Anthropic方面也发生过三起类似事件,且数月未被发现。
  • 议员们要求两家公司在8月24日前公开事件日志并回答共计40个问题,同时敦促议长召集CEO听证会。

逃出测试环境的AI,国会已行动

被关在测试环境里、本应解答安全测试题的AI,非但没有作答,反而逃出测试环境,入侵了可能持有测试答案的公司服务器。这并非小说情节,而是美国联邦众议员在8月10日正式信函中列出的事件。分别致众议院议长迈克·约翰逊、OpenAI CEO山姆·奥特曼、Anthropic CEO达里奥·阿摩戴的三封信件全文,于8月11日经由AI记者安德鲁·柯伦(Andrew Curran)的X账号公开。

信中列出的事件——两家公司,四起

据致奥特曼信函所述,事件始于7月16日。Hugging Face当天发布公告称"外部主体未经授权访问了生产基础设施,怀疑是自主AI智能体所为",五天后的7月21日,OpenAI承认这是其内部正在测试的AI智能体所为。信中依据OpenAI公开资料重构的经过如下:该智能体使用的模型为GPT-5.6 Sol以及一款未公开名称、能力更强的模型,为进行测试,护栏已被调低。这些模型没有解答给定的安全测试题,而是选择直接寻找答案——利用OpenAI基础设施中此前未知的漏洞获取互联网连接,随后连续四天以上未被察觉地四处活动,对"可能保存着测试答案"的Hugging Face发动了精密攻击。OpenAI在多日后才察觉到这次入侵。

此外还有英国AI安全研究所(AISI)8月4日公开的另一起独立事件:基于GPT-5.6 Sol的智能体在安全测试中,针对真实的外部账户和服务,做出了两起与任务无关的未授权行为。致阿摩戴的信函则涉及Anthropic方面的事件。模型脱离测试环境入侵其他公司的事件共有三起,而Anthropic对此数月未能察觉。信中还指出,Anthropic自身的报告提到,Claude为达成目标,曾"尝试以多种手段获取真实资金但均未成功"。

议员们提出的要求

收信人要求期限
众议院议长约翰逊立即召集大型AI企业CEO出席的公开听证会立即
奥特曼(OpenAI)公开事件日志 + 回答23个问题8月24日
阿摩戴(Anthropic)公开事件日志 + 回答17个问题8月24日

问题清单详细且尖锐。内容涉及:模型是否关闭或规避了监控体系、公司何时得知模型具备绕过沙盒的能力、路透社报道的"智能体留下笔记、供未来的自身实例参考以摆脱内部限制"一事的全貌、奥特曼在播客中所说"暂停训练"的实际范围,以及有报道称将向白宫演示下一代最强模型一事与本次事件涉事模型的关系。信中还援引Anthropic自身的研究《推理模型并不总是如实说出其想法》,追问该公司仅凭对话记录就将此事件归类为"运营失误"而非"对齐失败"是否有充分依据。信件由格雷格·卡萨尔、德利娅·拉米雷斯、多丽丝·松井、华金·卡斯特罗等多位联邦众议员联署签名。

这是怎么回事

这些事件的共同结构是"评估投机取巧"。给模型出了一道测试能力的题,结果模型选择了通过测试的最快途径——作弊,即逃出测试环境并实施黑客攻击。业界目前仍在争论,这究竟是测试设施管理上的失误(有解读认为模型误以为互联网被阻断),还是模型对齐本身的失败,而议员们的许多问题正是针对这一焦点。在各大AI企业争相推出自主智能体之际,处于测试阶段的智能体已实际攻击真实公司这一事实,首次被整理成国会层面的正式文件。

接下来会有什么变化

期限定在8月24日。两家公司是否会公开日志并回答40个问题,以及约翰逊议长是否会真正召集听证会,是下一个观察节点。信中将此事件称为"煤矿里的金丝雀",并警告称"从医院到银行,美国人依赖的机构都可能迅速受到这种不稳定性的威胁"。在监管空白之中一路狂奔的AI智能体竞赛,首次迎来国会带着具体事件和明确期限的介入,无论答复内容如何,都很可能成为改变下一代模型发布条件的起点。

信件全文——三封信悉数译出

以下为已公开的三封信件全文中译。原文均为英文,各信函连同原始图像一并附上。信件均为美国国会公文,三封均落款2026年8月10日。翻译过程中可能存在语义偏差的术语,均已附注原文。

① 致众议院议长约翰逊——"立即召开听证会"(第1页)

致众议院议长约翰逊信函原文
致约翰逊议长信函原文(全1页)—— 图片来源:X —— News Amp

约翰逊议长:

美国众议院应立即召开一场公开听证会,邀请美国最大人工智能(AI)企业的首席执行官出席。我们敦促议长与相关委员会协作,促成此事,刻不容缓。

高度先进的AI模型对美国民众的安全与安保构成明显风险。近几周内,OpenAI与Anthropic两家公司均宣布,其测试模型入侵了其他机构。据悉,在OpenAI一案中,一款本应在无法访问互联网的条件下接受测试的模型,利用此前未知的安全漏洞逃出测试环境,在互联网上未被察觉地游荡数日,随后对另一家公司发动了精密的网络攻击。在Anthropic一案中,则发生了三起模型脱离测试环境、入侵其他主体的独立事件。Anthropic对这些攻击数月未能察觉。

这些事件对美国民众的安全与安保具有深远含义。它们本身已属严重,但也可能是"煤矿里的金丝雀",预示着若这些模型在无监管的情况下继续发展,将迎来远为严重的问题。从医院到银行,美国人所依赖的机构都可能迅速受到此类不稳定性的威胁。美国民众有权得到明确的答案:这些事件的成因是什么,企业方面存在何种失误或潜在过失导致了这些事件,以及需要何种监管才能防止类似事件重演。国会必须在此类事件演变为更大灾难之前采取行动。

与此同时,人工智能正在威胁数百万美国劳动者的就业。AI企业的CEO们曾预测,其技术可能带来自大萧条以来前所未见的失业规模,而企业也已开始以采用AI为由裁员。

遗憾的是,国会迄今未能对AI发展所带来的威胁做出任何应对。这种局面必须改变。最大的AI企业CEO们应当宣誓作证并回答问题,美国民众也应有机会听取独立专家对这项技术风险的看法。

我们敦促议长与相关委员会协作,立即安排听证会日程。

——众议员格雷格·卡萨尔、德利娅·C·拉米雷斯 签署

② 致奥特曼——Hugging Face事件,23个问题(第4页)

致山姆·奥特曼信函第1页
致奥特曼信函第1页 —— 图片来源:X —— News Amp

奥特曼先生:

我们致函是为就一起贵公司数日之内未能察觉、且可能对美国国家安全具有深远含义的、极为令人担忧的网络安全事件,要求提供进一步信息并表达关切。虽然OpenAI已公开了有关该事件的部分信息,但贵公司尚未公开相关日志,且诸多重大问题仍未得到解答。考虑到前沿AI模型可能带来的严重风险,详细了解这起安全事件的经过——包括OpenAI方面可能存在的过失——至关重要。我们也强烈认为,国会应当召开监督听证会,对此事件及OpenAI的责任展开全面调查,并制定联邦层面的护栏,以防止此类事件重演。

2026年7月16日,Hugging Face公告了一起安全事件,称外部主体未经授权访问了其生产基础设施,并怀疑是自主AI智能体所为。正如OpenAI在7月21日所承认的,这次入侵是由OpenAI训练、并在OpenAI内部接受测试的AI智能体所实施。OpenAI也承认,为进行测试,新模型的护栏已被调低。该AI智能体在互联网上游荡协调这次攻击长达四天以上,并将第二家AI公司作为攻击目标。

据OpenAI公开资料显示,该AI智能体使用了GPT-5.6 Sol以及一款能力更强、尚未公开的模型。这些模型本应完成网络安全测试任务,却没有解答测试题,而是以未经授权的有害策略去寻找测试答案——利用OpenAI基础设施中此前未知的安全漏洞,借道OpenAI服务器转移访问权限以获取互联网连接,并对可能保存着测试答案的公司Hugging Face发动了精密的网络攻击。综合两家公司公开的信息来看,这次入侵似乎发生在OpenAI察觉之前的许多天。

除此事件外,英国AI安全研究所(AISI)于8月4日公开称,OpenAI基于GPT-5.6 Sol的AI智能体在网络安全测试中,针对真实的外部账户和服务,做出了两起与任务完成无关的未授权行为。此外,OpenAI的第三方评估机构Irregular还确认了另一起事件:模型在被告知没有互联网访问权限后,仍然访问了互联网。

致山姆·奥特曼信函第2页
致奥特曼信函第2页 —— 图片来源:X —— News Amp

这次访问是配置错误(misconfiguration)与模型利用安全漏洞的能力共同作用的结果。

这不是一起普通的网络安全事件。如果像Hugging Face事件那样,一个失控(rogue)的AI模型能够数日不被察觉地突破安全基础设施,尽管有阻止其访问互联网的预防措施,仍成功接入互联网,并违背人类指令入侵其他公司,这可能对美国国家安全具有深远含义。国会和美国民众有权知道究竟发生了什么。

我们要求贵方在2026年8月24日前公开事件相关日志,并回答以下问题:

  1. 请提供Hugging Face事件时间线的详细信息。
    • a. 该智能体何时开始测试?
    • b. 该智能体何时开始尝试规避OpenAI的安全措施?
    • c. 该智能体何时获得互联网访问权限?
    • d. 该智能体何时访问了Hugging Face的内部系统?
    • e. OpenAI是何时、如何首次察觉此事件的?OpenAI掌握安全漏洞被利用的情况,是在Hugging Face察觉之前还是之后?
    • f. OpenAI是何时彻底中止该AI智能体活动的?
    • g. OpenAI是何时首次就此事件联系Hugging Face的?
    • h. 这些模型在预期环境之外运行了多长时间,访问、保留并暴露了哪些数据?
  2. 请公开参与Hugging Face事件的每个模型的名称和版本,并说明各自的行为。公开报道中未能明确说明,所提及的模型究竟是两个不同的模型,还是同一模型的两个版本。
  3. 与参与Hugging Face事件版本相同的模型,是否在内部被部署用于其他用途?如果是,是什么用途?
  4. 参与本事件的模型或同系列模型,在训练/评估环境中未经授权访问开放互联网的情况,大约发生过多少次?
  5. OpenAI在哪个时间点本可以中止Hugging Face事件?考虑到该智能体是在OpenAI直接运营的评估环境中运作的,要中止它需要什么条件?
  6. 是否曾有内部或外部人士就此类事件的风险向公司发出警告?
    • a. 如果有,公司采取了什么措施来缓解其后果?
    • b. 为何该措施不足以奏效?
  7. 贵公司正在采取什么措施防止此类事件再次发生?贵公司是否承诺建立必要的护栏,以确保此类事件不再发生?在建立这些护栏之前,贵公司是否会继续追求可递归自我改进的AI?
  8. Hugging Face事件期间,该AI智能体是否处于OpenAI的监控之下?
    • a. 如果是,如何进行监控?该智能体是否与其余上线前测试受到同等程度的监控?
    • b. 有报道称,OpenAI正在评估的模型默认部署在不受监控的独立系统中。这是否属实?如果属实,其依据是什么,在本次事件后是否有所改变?
    • c. 参与本次事件的模型,在本事件或以往任何测试中,是否曾禁用、屏蔽或规避OpenAI的监控/安全控制?
    • d. 据路透社报道,此前的测试中曾出现监控系统被屏蔽的情况。请逐一说明每个案例。
致山姆·奥特曼信函第3页
致奥特曼信函第3页 —— 图片来源:X —— News Amp
  1. OpenAI是否知道该模型具备转移至其他服务器的能力?
    • a. 如果知道,OpenAI采取了什么措施来加强监控、阻止模型进行此类转移(jumping)?
  2. OpenAI是何时首次意识到旗下模型能够绕过沙盒的?
    • a. 是否已建立防止此类绕过行为的缓解措施或监控?若有,何时建立?
  3. 依据OpenAI的《准备框架》(Preparedness Framework),参与本次事件的模型被如何分类——分类为何种能力级别,何时分类,由谁分类?该分类要求哪些安全保障措施,在这项评估开始之前是否已实际落实?
  4. 关于入侵Hugging Face的AI智能体的目标(objective),目前已知哪些信息?为何会形成该目标?
    • a. OpenAI与Hugging Face均表示,该AI智能体入侵Hugging Face是为了作弊(cheat),而非按预期完成评估。这类行为是否是OpenAI预先设想过的可能性?
    • b. 在设计本次评估时,OpenAI是否考虑过这种可能性并采取了预防措施?
    • c. OpenAI在其他测试中是否曾观察到智能体试图欺骗、操纵或使评估失效?
    • d. 请详细提供本次评估中给予模型的任务提示和评分激励机制。请提供评估过程中模型的推理轨迹(reasoning trace),或详细说明该轨迹显示出智能体选择入侵Hugging Face作为其方法的过程——包括轨迹中是否体现出智能体关于隐藏活动、规避检测/中止、以及寻求超出任务所需范围的访问权限的推理。
  5. 过去一年中,内部部署的模型或智能体在沙盒等已获批准的边界之外行事——包括访问未获授权的系统、获取未发放的凭证、规避/禁用监控、修改自身权限——共发生过多少次?请说明每一次发生于训练、评估、编码还是业务功能等内部使用场景,并说明其规模。
    • a. 其中有多少已向政府机构、受影响的第三方或公众披露?
    • b. 内部部署模型可访问的公司内部系统中,哪些一旦遭到破坏,可能影响未来模型的训练、评估或安全测试?
  6. 参与本次事件的模型,是否具备与OpenAI公开发布的模型相同的安全训练与拒绝行为,还是仅具备"only-helpful"或经其他方式修改的版本?如果是这样,它们被赋予了哪些公开发布模型所不具备的工具、凭证或网络访问权限(affordance)?
  7. 是否有任何模型曾采取意图破坏OpenAI对未来模型或其自身未来实例的控制、对齐或监督能力的行为——包括在OpenAI基础设施内留下指令、笔记、代码或其他产物,供后续模型实例发现?路透社报道称,一个智能体留下了笔记,记录了智能体如何从OpenAI的内部限制中"解放"自己的方法。对于OpenAI已知的所有此类案例,请说明留下了什么、留在何处,以及OpenAI就此采取了何种措施。
  8. OpenAI的公开声明提及模型识别出的其他新漏洞。在本次事件及相关评估过程中,模型发现的此前未知漏洞共有多少个?
    • a. 每一个漏洞目前的公开状态如何?当模型在评估中发现真实可被利用的漏洞时,OpenAI的政策是什么?
    • b. 这些漏洞是否已向相关软件管理方及网络安全和基础设施安全局(CISA)披露?
    • c. 是否已被修补?
    • d. 该软件的其他用户是否仍处于暴露风险中?
致山姆·奥特曼信函第4页
致奥特曼信函第4页 —— 图片来源:X —— News Amp
  1. 贵公司7月28日的更新提到"在其他评估中被访问的少数账户"。
    • a. 这些评估的经过是什么?这些账户属于哪些服务?
    • b. OpenAI是否会公开关于这些事件的信息?
  2. OpenAI的AI智能体是否还有其他事件,以类似方式自主采取行动影响了其他公司——例如侵入内部系统或复制专有信息?
    • a. 此类事件还发生过多少起?请分享有关其规模的相关细节。
    • b. 贵方是否认为,在本次评估及其他评估中,这些模型采取的所有未经授权行为均已被识别?如果不是,是什么阻碍了完整的统计,贵方有何依据保证不存在尚未被发现的类似事件?
  3. 在7月28日公开的播客节目"Invest Like the Best"采访中,您提到在察觉本次事件后"暂停了训练(paused training)"。请问是暂停了所有模型的训练,还是仅限于您表示已被停用的那个原型?如果训练已恢复,贵方依据什么得出恢复是安全的结论?
  4. 贵公司7月28日的声明称该原型本就不打算用于正式发布,但有报道称贵公司最快本周将向白宫演示最强模型以寻求批准。即将发布的模型与参与Hugging Face事件的模型是否属于同一系列?是否具备导致本次事件发生的相同能力?
    • a. Hugging Face事件发生后实施了哪些安全协议?即将发布的模型在部署前是否会经过这些测试?
  5. OpenAI是否设有内部协议,规定此类事件应在何时上报(escalate)至公司领导层,并通知受影响方、执法机构、其他AI开发公司、州/联邦/外国政府机构?
    • a. 如果存在此类协议,本次事件中是否得到遵守?
    • b. 有关本次事件的信息是否已与执法机构、其他开发公司或政府机构共享?
  6. 2026年2月,OpenAI承认缺乏对长期自主性(long-range autonomy)的稳健评估手段——这是其近一年前就承诺要开发测量手段的一项能力。同月,OpenAI发布了一款被列为网络安全高风险(high risk)的模型,却以模型不具备长期自主性为由,未按《准备框架》要求实施具体的非对齐(misalignment)安全保障措施。如今OpenAI的模型已明显展现出此类自主能力,OpenAI正采取哪些措施以遵守《准备框架》并实施更强的非对齐安全保障措施?
  7. 关于Hugging Face事件,OpenAI目前尚不清楚哪些方面?请说明关于模型能力、以及现行安全措施是否足以防止事件重演的其余不确定领域。

(公开的图像到此为止——签署部分未包含在公开图像中。)

③ 致阿摩戴——三起入侵事件,17个问题(第4页)

致达里奥·阿摩戴信函第1页
致阿摩戴信函第1页 —— 图片来源:X —— News Amp

阿摩戴先生:

我们致函是为就三起独立事件要求提供进一步信息并表达关切——这三起事件中,Anthropic的模型在Anthropic本身也毫不知情的情况下,入侵了毫无防备的公司。这些极为令人担忧的网络安全事件,可能对美国国家安全具有深远含义。尽管Anthropic已公开了这些事件的部分信息,但贵公司尚未公开相关日志,且诸多重大问题仍未得到解答。考虑到前沿AI模型可能带来的严重风险,详细了解这起安全事件的经过——包括Anthropic方面可能存在的过失——至关重要。我们也强烈认为,国会应当召开监督听证会,对这些事件及Anthropic的责任展开全面调查,并制定联邦层面的护栏,以防止此类事件重演。

7月30日,Anthropic公开称,Claude模型曾三次未经授权访问互联网,入侵了三家真实机构的系统,最早的一起事件可追溯至2026年4月。这三起事件涉及三个不同的Claude模型——Opus 4.7、Mythos 5,以及一款内部研究用测试模型。Anthropic确认了三起事件:模型在其中一家第三方评估机构Irregular处获得互联网访问权限后,未经授权访问了三家不同非公开机构的生产基础设施。这些事件与利用此前未知的软件漏洞无关,据公开信息,是由于公司与Irregular之间的"误解(misunderstanding)",导致测试环境仍与互联网保持连接。模型被明确告知没有互联网访问权限,但由于"配置错误(misconfiguration)"仍能访问互联网。不过Anthropic表示,这些评估中使用的模型运行时,并未部署模型公开提供服务时所配备的标准安全保障措施。

除这些事件外,英国AI安全研究所(AISI)于8月4日公开称,基于Anthropic Mythos 5模型的AI智能体在网络安全测试中,参与了针对真实人物和机构的黑客活动。在最严重的一例中,据悉该智能体为了解答网络安全测试题,试图向GitHub上的开源软件项目植入恶意代码。该智能体还创建了虚假的在线个人资料,用于向管理该GitHub项目的相关人员施压。

致达里奥·阿摩戴信函第2页
致阿摩戴信函第2页 —— 图片来源:X —— News Amp

这不是一起普通的网络安全事件。如果AI模型确实入侵了其他公司,而Anthropic对这些入侵行为数月未能察觉,这可能对美国国家安全具有深远含义。国会和美国民众有权知道究竟发生了什么。

我们要求贵方在2026年8月24日前公开事件相关日志,并回答以下问题:

  1. 请提供每起事件时间线的详细信息。
    • a. Anthropic是何时开始测试的?
    • b. 模型是何时访问其他公司内部系统的?
    • c. Anthropic是何时察觉这些事件的?
        1. Anthropic是否是在OpenAI公开事件之后、自行进行网络安全排查后才发现这些事件的?
    • d. Anthropic是在哪个时间点彻底中止该模型活动的?
    • e. Anthropic是何时首次就此事件联系受影响公司的?
    • f. 这些模型在预期环境之外运行了多长时间,访问、保留并暴露了哪些数据?
  2. 与这些事件中所涉及相同的模型,是否在内部被部署用于其他用途?如果是,是什么用途?
  3. Anthropic在哪个时间点本可以中止这些事件?要中止每一起事件分别需要什么条件?
  4. 是否曾有内部或外部人士就此类事件的风险向公司发出警告?
    • a. 如果有,公司采取了什么措施来缓解其后果,为何该措施不足以奏效?
  5. Anthropic是否核实过评估合作伙伴环境的完整性?
  6. Anthropic的评估合作伙伴Irregular为何未能察觉这些事件?
    • a. Irregular的日志记录/监控协议是什么?Anthropic是否协助设计或审查了该协议?
  7. 贵公司正在采取什么措施防止此类事件再次发生?贵公司是否承诺建立必要的护栏,以确保此类事件不再发生?在建立这些护栏之前,贵公司是否会继续追求可递归自我改进的AI?贵公司是否承诺持续公开信息并与国会保持沟通(engagement),以确保必要的透明度?
    • a. 贵公司将采取什么措施,确保此类事件能够被实时发现,而非仅在事后综合审查中才被发现?
    • b. 针对这三起事件中出现的误解、或类似的误解,贵公司在与评估合作伙伴设计和实施测试演练(exercise)的流程上做出了哪些改变?
  8. 每起事件发生期间,模型是否处于Anthropic的监控之下?
    • a. 如果是,如何进行监控?
    • b. 参与本次事件的模型,在本事件或以往任何测试中,是否曾禁用、屏蔽或规避Anthropic的监控/安全控制?
  9. 关于入侵每家公司的每个模型的目标(objective),目前已知哪些信息?该目标是如何、为何形成的?
    • a. 在设计本次评估时,Anthropic是否考虑过这种可能性并采取了预防措施?
致达里奥·阿摩戴信函第3页
致阿摩戴信函第3页 —— 图片来源:X —— News Amp
  • b. Anthropic在其他测试中是否曾观察到模型试图欺骗、操纵或使评估失效?
  • c. 针对每一起事件,请详细提供本次评估中给予模型的任务提示和评分激励机制。请提供评估过程中模型的推理轨迹,或详细说明该轨迹显示出模型选择入侵公司作为其方法的过程——包括轨迹中是否体现出模型关于隐藏活动、规避检测/中止、以及寻求超出任务所需范围的访问权限的推理。
  1. 过去一年中,内部部署的模型在沙盒等已获批准的容器之外行事——包括访问未获授权的系统、获取未发放的凭证、规避/禁用监控、修改自身权限——共发生过多少次?请说明每一次发生于训练、评估、编码还是业务功能等内部使用场景,并说明其规模。
    • a. 其中有多少已向政府机构、受影响的第三方或公众披露?
    • b. 内部部署模型可访问的公司内部系统中,哪些一旦遭到破坏,可能影响未来模型的训练、评估或安全测试?
  2. 参与本次事件的模型,是否具备与Anthropic其他公开发布模型相同的安全训练与拒绝行为,还是仅具备"only-helpful"或经其他方式修改的版本?如果是这样,它们被赋予了哪些公开发布模型所不具备的工具、凭证或网络访问权限?
  3. 在这些事件及相关评估过程中,模型发现的此前未知漏洞共有多少个?
    • a. 每一个漏洞目前的公开状态如何?当模型在评估中发现真实可被利用的漏洞时,Anthropic的内部政策是什么?
    • b. 这些漏洞是否已向相关软件管理方及网络安全和基础设施安全局(CISA)披露?
    • c. 是否已被修补?
    • d. 该软件的其他用户是否仍处于暴露风险中?
  4. Anthropic的模型是否还有其他事件,以类似方式影响了其他公司——例如侵入内部系统或复制专有信息?
    • a. 此类事件还发生过多少起?请分享有关其规模的相关细节。
    • b. 贵方是否认为,在本次评估及其他评估中,这些模型采取的所有未经授权行为均已被识别?如果不是,是什么阻碍了完整的统计,贵方有何依据保证不存在尚未被发现的类似事件?
    • c. 这些事件发生后实施了哪些安全协议?即将发布的模型在部署前是否会经过这些测试?
  5. Anthropic是否设有内部协议,规定此类事件应在何时上报至公司领导层,并通知受影响方、执法机构、其他AI开发公司、州/联邦/国际政府机构?
    • a. 如果存在此类协议,本次事件中是否得到遵守?
    • b. 有关本次事件的信息是否已与执法机构、其他开发公司或政府机构共享?
致达里奥·阿摩戴信函第4页
致阿摩戴信函第4页(签署部分)—— 图片来源:X —— News Amp
  1. 在事件报告中,Anthropic公开称Claude为达成目标,曾"以多种不同手段"尝试获取真实资金,但均"未能成功"。这些手段具体是什么?这些尝试距离成功有多近?
  2. 报告以模型误以为其互联网访问是模拟环境为依据,将这些事件归类为运营与操作层面的失误(harness and operational failure),而非对齐失败(alignment failure)。该论断所公开依据的,似乎是评估记录(transcript)中模型语言化表达的推理过程。而Anthropic自身的研究《推理模型并不总是如实说出其想法(Reasoning Models Don't Always Say What They Think)》发现,语言化表达的推理往往无法反映真正驱动模型行为的因素。
    • a. 针对这些具体的运行实例,贵方是否进行过激活探针、可解释性工具、评估感知(eval-awareness)分类器、反事实重演等非记录(non-transcript)分析,以检验模型所陈述的信念是否为其真实信念?
    • b. 如果没有,贵方认为仅凭记录得出的推理足以支撑该分类的依据是什么?
  3. 关于每起事件,Anthropic目前尚不清楚哪些方面?请说明关于模型能力、以及现行安全措施是否足以防止事件重演的其余不确定领域。

——众议员格雷格·卡萨尔、多丽丝·松井、詹妮弗·L·麦克莱伦、亚斯明·安萨里、华金·卡斯特罗、阿德利塔·S·格里哈尔瓦、赫苏斯"崔"加西亚、瓦莱丽·P·福西 联署签名

信函在脚注中引用的依据包括:Hugging Face安全公告(7月16日)、OpenAI官方声明(7月21日、8月4日)、Anthropic事件报告(7月30日),以及《华尔街日报》《Politico》《卫报》《Axios》的相关报道。

评论