工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

ChatGPT带有"AI味"的原因,有人指向安全防护机制

Pangram CTO解释称,训练后加入的安全护栏会让AI文体变窄,从而更容易被识破

모드 붕괴와 모드 커버리지를 비교한 분포 그래프

이미지: METAL LAB 생성

摘要

  • AI文本检测初创公司Pangram的CTO Bradley Emi在公司博客中提出,训练后加入的安全机制会缩窄AI文体的多样性。
  • 他表示,未经过训练后处理的基础模型,以及像专门模仿海明威文风这类范围很窄的微调模型,都能躲过Pangram的检测。
  • 不过他也说明,带有水印的文本无论文体多样与否,今后仍将持续可被检测出来。
주장한 사람
브래들리 에미(AI 텍스트 탐지 스타트업 판그램(Pangram) CTO)
발표 형식
판그램 자사 블로그(서브스택) 게시물
핵심 개념
양식 붕괴(mode collapse) — 사후훈련이 문체 다양성을 특정 표현으로 수렴시키는 현상
탐지 대상
챗GPT·클로드·제미나이 등 사후훈련을 거친 상용 챗봇 출력
탐지 회피 사례
사후훈련 이전 베이스 모델, 헤밍웨이 전용 파인튜닝, 특정 서브레딧 학습 모델, 문법이 깨진 비문 텍스트
워터마크 텍스트
문체 다양성과 무관하게 계속 탐지 가능할 것이라고 주장
발행일
2026-08-20

读ChatGPT或Claude写出的文字时,有时会觉得那种腔调似曾相识、反复出现。AI文本检测服务Pangram的CTO Bradley Emi指出,这一现象的根源并非模型能力不足,而是安全机制在起作用。在发表于Pangram博客的文章中,他提出:语言模型理论上完全可以写得和人一样多样,但实际上却做不到。

训练后处理会收窄文体

ChatGPT、Claude、Gemini这类服务在正式上线前,都会经过一个叫做"训练后处理"(post-training)的阶段。这个阶段会在预训练好的原始模型基础上,进一步教会它对话礼仪、拒绝危险请求、审查特定政治言论等一系列行为规范。Emi解释说,这个过程会大幅收窄模型的表达范围。所谓的"模式坍缩"(mode collapse),指的就是模型不再像人类那样使用多种表达方式,而是收敛到某个固定说法上的现象。正常语言应该在多种表达之间比较均匀地分配概率(即"模式覆盖"),但经过训练后处理的模型,概率会高度集中在某一种偏好表达上。

基础模型和窄范围微调是例外

Emi论述中有意思的一点,是那些没有经过训练后处理的"基础模型"。这些只完成了预训练、尚未被灌输对话规则的原始模型,写出的文体和人类一样丰富多样。因此他表示,Pangram的检测系统也无法把这类基础模型写的文字识别为AI生成内容。他在发布于X的帖子中也提到类似的情况:只在海明威文风上做过微调的模型、只用特定子版块帖子训练出的窄范围微调模型,以及语法不通顺的病句文本,同样能躲过检测。与训练后处理会收窄多样性正相反,只用狭窄数据训练出的模型,反而会难以和某个特定人类群体的文风区分开来。

水印是另一回事

Emi特别指出,上述关于多样性的逻辑,只适用于没有加水印的AI文本。像谷歌这样一直在试验水印技术的公司,采用的方式是直接操纵模型选择某个词元(token)的概率本身。按照这个逻辑,即便模型写得像基础模型一样多样化,这种信号依然会留在文本里。他认为,只要文本加了水印,今后依然可以被持续检测出来。

表格:各类文本的可检测性

文本类型是否经过训练后处理Pangram能否检测
ChatGPT、Claude、Gemini等商用聊天机器人的输出经过可以
训练后处理之前的基础模型输出未经过较难
专攻海明威文风等窄范围微调模型窄范围经过较难
语法不通顺的病句文本不适用较难
带水印的文本不适用持续可以

编辑视角

这一说法揭示了整个AI文本检测行业正面临的一个悖论。一家销售检测工具的公司,其CTO竟然承认"我们的工具检测出的,其实是安全机制带来的副作用",这一点格外值得关注。OpenAIAnthropic、谷歌在模型正式发布前,都会大力植入拒绝有害言论、保持政治中立等规则。正是这些规则催生出反复出现的道歉话术、固定化的连接词模式,而像Pangram这样的检测服务,恰恰就是把这些模式当作指纹来识别。

对比不同世代的模型,这种差异感会更明显。用早期大语言模型的基础版本生成文字,文体参差不齐,有时甚至前后矛盾,但正因如此才难以预测。如今的ChatGPT或Claude虽然流畅得多、也安全得多,但Emi论点的核心恰恰在于:这种流畅本身就成了一种指纹。在当前的技术结构下,安全性与个性之间几乎是此消彼长的关系。

从实际应用角度看,这个话题会分出两条路。对于需要甄别AI文本的学校或媒体来说,这意味着安全机制越强的商用聊天机器人写出的文字越容易被检测出来,反过来,用开源基础模型或窄范围微调模型写出的文字则更难被识破。反之,对于想用AI写作却希望看起来像人写的一方来说,这也意味着安全机制越弱的模型,写出来的文体反而越自然。不过带水印的文本是这个规律里的例外——用带水印公司的模型写出的文字,无论文体如何,今后被抓到的可能性都会更高。

未来几个月,检测行业和模型开发商之间很可能会展开新一轮拉锯战。如果检测公司把"流畅的安全文体"当作指纹来提高准确率,模型开发商就会反过来寻找既能保持安全、又能让表达更多样的训练后处理方法。谁能率先找到这个平衡点,谁就将在下一轮竞争中占据主导地位。

评论