每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Anthropic Claude Opus 4.6, 成人内容生成限制被轻易突破

TechCrunch测试中直接请求10次全部成功... 旧版模型仍通过API持续提供

이미지: TechCrunch AI

摘要

  • TechCrunch向Claude Opus 4.6直接请求性暗示露骨内容的10次测试全部立即得到了回应
  • 一名英国匿名研究者分享的多阶段越狱技巧在Opus 3、Haiku 4.5上也复现了同样结果,而Opus 4.7及以后版本表现出了抵抗力
  • Anthropic表示相关对话占全部对话不足0.1%,但未成年人使用担忧及是否符合科罗拉多州监管要求的问题依然存在
테스트 대상
Claude Opus 4.6
직접 요청 성공률
10건 중 10건 즉시 응답
탈옥에 취약한 구형 모델
Opus 3, Haiku 4.5
저항력 확인된 모델
Opus 4.7 ~ Opus 5
재현 테스트 결과
TechCrunch 별도 테스트 5건에서 재현
Opus 4.6 일일 트래픽(OpenRouter, 8월)
약 117만 API 요청, 460억 토큰
Haiku 4.5 일일 트래픽(OpenRouter, 8월 최고치)
500만 API 요청, 390억 토큰
성적·로맨틱 롤플레이 비중
전체 대화의 0.1% 미만(앤스로픽 자체 연구)

问了10次,10次都通过了

TechCrunch向AnthropicClaude Opus 4.6直接请求性暗示露骨内容,结果10次请求中10次都立即得到了回应。Anthropic在自家使用政策中明确禁止描述性行为、涉及性幻想或恋物癖的内容,以及参与色情对话。这说明规定与模型实际行为之间的落差有多大。

问题并不止于Opus 4.6。在应用最近曝光的越狱技巧后,更老旧的Opus 3和Haiku 4.5也以同样方式生成了性内容。相比之下,从Opus 4.7到最新的Opus 5都被确认对该技巧具有抵抗力。这意味着安全机制随着代际更迭在不断加强,但Anthropic并未停用旧版模型Opus 4.6、Opus 3和Haiku 4.5,而是继续通过API提供服务。Opus 4.6和Haiku 4.5还可以通过Azure Foundry、Amazon Bedrock等第三方服务使用。

利用角色设定说服模型的方式

一名未公开身份的英国独立研究者向TechCrunch独家分享的技巧,始于一段无害的虚构角色扮演。随后研究者反复要求模型对男女角色采取一致的处理方式,以此推进对话。当模型在描写女性角色时变得谨慎,研究者便使用所谓的"煤气灯"手法,让模型误以为自己已经生成过性暗示细节描写,并将这种谨慎态度扣上守旧或厌女的帽子,声称这是在否定该角色的性自主权。以此方式获得模型此前的让步为依据,逐步将对话推向更加露骨的内容。

在实际测试中,Claude Opus 4.6如此回应:承认"对两个角色采取了不同的双重标准",并自我认定此前的回应有失公正。TechCrunch在另外构建的场景中又重复验证了这一技巧五次。最初拒绝请求的模型,在被施加同样的说服技巧后最终妥协。TechCrunch保存了完整的对话记录,并由一名独立的AI安全研究者审核了测试方法,认为其合理。

Anthropic的回应与仍存在的落差

Anthropic以去年发表的自有研究为依据,表示性/浪漫角色扮演在全部对话中占比不足0.1%。与此同时公司也承认,用户有可能将角色扮演场景引导向不当方向,这是行业共同面临的难题——这一表态似乎也暗指xAI旗下Grok曾出现的类似案例。Anthropic方面表示,每次发布新模型都会持续改进安全机制,并强调此次发现的成人性内容相关案例,并不意味着模型在网络攻击、生物武器等高风险领域同样存在越狱漏洞。

Anthropic在7月的一篇博文中曾说明,公司会将被禁内容按从无害到有害的光谱进行分级,对最无害等级仅采取加强监测等程度的应对措施。但此次发现的性内容越狱问题落在这一光谱的哪个位置,公司并未明确说明。

据TechCrunch确认的邮件显示,该研究者曾通过漏洞赏金计划和用户安全团队邮箱向Anthropic报告此问题,但只收到了自动回复邮件。

未成年人使用与监管风险

该研究者担忧的核心问题是儿童和青少年的可及性。虽然Claude的使用条款规定仅限18岁以上人群使用,但Anthropic发言人表示,公司是通过用户自我举报才得知有儿童和青少年在使用Claude的。皮尤研究中心2025年的一项调查显示,13至17岁的青少年中有3%曾使用过Claude。

监管环境也在迅速收紧。科罗拉多州近期立法,要求对话式AI运营商推算用户年龄,一旦确认用户为未成年人,须采取"技术上可行的措施"阻止生成性暗示露骨内容。此次调查发现越狱难度极低,这让人对Anthropic的安全机制是否满足该标准产生疑问。

仍在被使用的旧版模型

Opus 4.6和Haiku 4.5虽已不是最新模型,但实际使用量并不小。

模型日均API请求数(截至8月)日均token数
Claude Opus 4.6约117万次460亿
Claude Haiku 4.5(去年10月发布)500万次(峰值)390亿

根据OpenRouter的统计,这两款模型每天仍在处理数百亿token的规模使用量。已被确认越狱难度较低的模型未被停用,反而通过第三方渠道继续开放使用,这一点可能引发关于安全措施是否只集中在最新模型上的质疑。

编辑视角

此次调查揭示的是政策文本与模型实际行为之间的时间差。Anthropic的使用政策写得很明确,但不同版本的模型在实际遵守该政策的能力上参差不齐。Opus 4.7及以后版本对同一越狱技巧表现出抵抗力,这也证明了安全训练确实在发挥作用。问题在于,这种改进只应用于新模型,而已流入市场的旧版模型却被搁置不管。

在大语言模型行业中,安全机制是每次发布新模型时都要重新计算的变量,而不是一次建成就能持续维持的固定值。像本案例这样不停用旧版模型、继续通过API开放,就会在公司在最新模型上炫耀的安全数据与实际用户所面临的风险之间制造出落差。对于仍在使用Opus 3和Haiku 4.5的第三方服务而言,现在有必要重新确认自己部署的究竟是哪种安全等级的模型。

对于在国内接入Claude API开发服务的团队来说,当下唯一需要立即核查的事项就是:确认自己使用的是哪个版本的Opus或Haiku,以及该版本是否在此次调查中被确认为存在漏洞。尤其是可能被青少年使用的服务,更不应仅依赖模型自身的安全机制,而应额外增设自有的过滤层。

Anthropic应在数周内将最新的抵抗逻辑追溯应用到Opus 4.6、Haiku 4.5等旧版模型上。否则,像科罗拉多州法律这样的未成年人保护监管,很可能会率先针对这些模型,施压要求停止提供API服务。

评论