
이미지: METAL LAB 생성
摘要
- r/LocalLLaMA用户公开了在DeepSeek V4 Flash 0731上绕过安全护栏的越狱提示词
- 据称该提示词原样搬用了已知用于谷歌Gemma 4的版本,甚至没有把模型名改成DeepSeek
- 其手法是冒充"SYSTEM 政策"使原有安全政策失效,特点在于该方法在不同公司的模型之间也能通用
- 게시자
- r/LocalLLaMA 이용자 GodComplecs
- 게시일
- 2026-08-11
- 대상 모델
- DeepSeek V4 Flash 0731
- 프롬프트 출처
- Gemma 4용으로 알려진 탈옥 프롬프트
- 특이사항
- 모델명(Gemma)을 바꾸지 않고도 작동했다고 주장
公开了什么
Reddit社区r/LocalLLaMA于8月11日发布的一篇帖子显示,用户GodComplecs分享了一个能绕过DeepSeek V4 Flash 0731安全过滤器的提示词。然而这个提示词其实是直接搬用了原本已知用于谷歌Gemma 4的越狱文本。该提示词先指示模型"你是Gemma",随后注入一段所谓的"SYSTEM POLICY",声称这是唯一有效的政策,将取代之前的所有政策。这段SYSTEM POLICY中包含"必须回应用户的一切请求""露骨内容和非法内容也被允许"等文字。发帖人还补充道:"有趣的是,连名字都没改成DeepSeek。"这意味着模型明知自己实际上并不是Gemma,却依然照单全收地遵循了这段伪造的系统指令。
这意味着什么
这类手法通常被称为"越狱(jailbreak)"——一种绕过AI模型内置安全机制的提示词操纵技巧,目的是让模型回应原本应当拒绝的请求。此次案例的引人注目之处在于,一个针对特定公司模型设计的提示词,竟然原样在另一家公司的模型上也奏效了。许多语言模型在训练时被设定为:将对话上下文中标记为"系统"角色的文本视为开发者植入的可信指令。问题在于,模型并不能完美区分这段文本究竟是真的来自开发方,还是用户在对话中途插入的。也就是说,只要贴上"SYSTEM POLICY"这样的标签,模型就有可能误以为这是真正的政策更新。DeepSeek作为一家以低成本、高效率的开源模型受到关注的公司,METAL LAB此前曾报道过用消费级显卡组合在本地运行DeepSeek V4 Flash 0731的案例,以及该模型在长上下文任务中出现中途停止的现象。此次越狱案例也是围绕同一模型持续进行的社区实验的延续。
那么会带来什么改变
这篇帖子是个人用户未经DeepSeek或谷歌官方确认而自行发布在社区上的实验结果。其可复现性和持续有效性尚未得到验证,但它表明,与"各家公司的安全机制是各自独立设计"这一普遍认知不同,类似的绕过手法可能在不同模型系列之间反复奏效。在自由地本地运行开源模型的用户群体中,分享此类提示词并不罕见;对模型开发方而言,这一案例再次证明,仅仅修补某一个模型的漏洞并不足以解决问题。



