이미지: The Decoder
摘要
- Anthropic即将推出水印检测API,供第三方开发者确认某段文本是否由Claude生成
- 该技术改造自谷歌DeepMind 2024年发表于《自然》的SynthID Text方案,通过调整词汇选择时的随机性来实现
- 在短文本、纯事实性语句、代码以及经过大幅改写的文本上,检测准确率会下降
- 발표 내용
- 제3자 개발자용 클로드 워터마크 탐지 API 조만간 공개
- 기반 기술
- 구글 딥마인드가 2024년 네이처에 발표한 SynthID Text 방식의 변형
- 작동 방식
- 단어 선택 시 무작위성 조정, 앤스로픽에 따르면 품질·가독성엔 영향 없음
- 탐지 한계
- 짧은 글·사실 위주 문장·코드·전면 재작성 텍스트는 탐지 어려움
- 적용 모델
- 2025년 8월 2일 이후 출시 모델은 기본 지원, 구형 모델은 순차 적용
- 규제 배경
- EU AI Act 투명성 행동강령에 약 190개 서명사와 함께 2026년 7월 서명
- 파일 라벨링
- C2PA 표준 메타데이터 사용, 파일 자체는 변경하지 않음
Claude写的文字,如今外部也能核实
Anthropic即将推出一款水印检测API,供第三方开发者嵌入自家应用中使用。如果说此前在Claude生成文本中留下不可见痕迹本身就是新鲜事,那么这次发布的核心在于:这一痕迹如今可以被Anthropic以外的公司读取。无论是学校的论文查重工具,还是内容平台的AI识别功能,只要需要确认文本是否出自Claude,都可以接入这一API。
借用了SynthID的方案
据悉,该技术改造自谷歌DeepMind 2024年发表于《自然》杂志的SynthID Text方案。其原理是在逐词生成文本的过程中,对介入的随机性因素进行细微调整,从而在句子中嵌入可追踪的模式。Anthropic表示,这一过程“不会影响Claude生成文本的内容、创造力水平和可读性”。人在阅读时与普通文本并无二致,但经过检测API处理后,就能显示出Claude参与生成的可能性。
哪些地方不适用
不过,这种方式并非在所有文本中都同样有效。短文本或纯罗列事实的句子,由于可替换的表达本身较少,模式难以被有效嵌入。代码也是如此。若文本是人工逐词修改的纯校对稿,由于每个词都是人工选定的,水印不会留存。相反,Anthropic表示翻译文本中水印保留效果较好,因为翻译中最终所有词汇都是由Claude选定的。Anthropic在其公开的FAQ中还提到,如果对原文进行大幅度改写,水印也可能被抹去。
此外,该水印只能表明Claude有可能参与了文本撰写,无法区分是Claude全文撰写还是仅对部分内容进行了修改,也无法判断文本究竟是人工撰写还是出自其他公司的AI。
与传统检测工具的不同路径
Anthropic此次的方案与Pangram等现有AI检测工具有本质区别。由于Pangram一类的服务无法获取Anthropic的水印密钥,它们只能通过统计方式扫描AI特有的文体或常用表达模式来进行判断。相比之下,水印检测是直接核实Claude实际留下的痕迹,原理上能够得出更可靠的结果。
欧盟监管推动全球范围采用
Anthropic引入水印技术的背景是欧盟《人工智能法案》(EU AI Act)。去年7月,Anthropic与约190家签署方一同签署了欧盟《AI生成内容透明度行为准则》(Code of Practice)。由于目前没有合适的技术手段可以按地区限制功能,水印技术因此不仅适用于欧盟,而是在全球范围同步应用。2025年8月2日之后发布的所有Claude模型均默认支持水印,此前发布的模型也将在未来数月内陆续获得支持。对于非文本类文件,则采用名为C2PA的开放标准,在不改变文件本身的前提下附加来源元数据。
此前在8月11日,Anthropic曾宣布对Claude生成的全部内容强制加注水印,而此次推出的检测API则是下一步动作——让这一痕迹在Anthropic之外也能被读取。
具体如何使用
此次API的目标对象并非普通用户,而是开发者。若某公司希望在自身服务中加入“确认是否由Claude生成”的功能,只需调用Anthropic的检测API,即可获得该文本是否含有Claude水印模式的判定结果。具体上线日期或申请流程目前尚未公开,但其应用范围不难预见。例如,学校或学术期刊可将其用于初步筛查作业、论文提交物中是否存在AI介入;新闻或社区平台也可用其为AI生成的帖子添加标识;招聘平台则可将求职信是否由AI撰写作为参考指标之一。
编辑视角
嵌入水印和让外部核实水印,是两个完全不同层次的决定。如果说去年8月11日Anthropic宣布在全球范围内应用水印,是在宣告“我们将留下痕迹”,那么这次的API则是在宣告“我们也将把核实这一痕迹的钥匙交给外部”。对Anthropic而言,这是一个风险不小的决定——相当于主动让外部得以验证自家模型在何处、以何种方式被使用,一旦误判或规避案例增多,反而可能损害自身信誉。尽管如此仍选择这条路,合理的解释是欧盟《人工智能法案》这一外部压力起到了很大作用。若没有监管压力,主动承担相对竞争对手更重的透明度负担,动力本不会太大。
OpenAI和谷歌此前也各自尝试过AI文本标识方案,但将检测权限本身开放给第三方的案例并不多见。谷歌的SynthID此前主要在自家生态系统内使用,而Anthropic则借用这一思路,将其以API的形式对外开放。对实际操作过AI识别工具的人来说都清楚,基于统计文体分析的检测工具,误判率一直是老大难问题。基于水印的检测在原理上理应更为准确,但问题在于,代码、短文本、全面改写这些例外情况,恰恰是实务中最常遇到的场景。归根结底,即便有了这一API,“判定为非Claude所写”也不等同于“确定是人工撰写”,这一点在使用时需要清楚认识到。
对国内企业而言,眼下或许不必立即接入这一API,但对于内容平台或教育机构来说,已经到了可以开始评估引入的时候。不过,比起将水印检测结果作为唯一证据,更稳妥的做法是与现有的文体分析工具并用,作为辅助指标。可以预见,未来几周内OpenAI或谷歌很可能也会传出考虑类似的对外开放检测方案的消息。监管牵动一处、其余跟进的模式,此前已经不止一次上演。



