每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Anthropic推出可供第三方使用的水印API,用于识别Claude生成的文本

应用谷歌SynthID技术的检测方案,在代码与短文本上仍有局限……欧盟监管推动全球范围采用

이미지: The Decoder

摘要

  • Anthropic即将推出水印检测API,供第三方开发者确认某段文本是否由Claude生成
  • 该技术改造自谷歌DeepMind 2024年发表于《自然》的SynthID Text方案,通过调整词汇选择时的随机性来实现
  • 在短文本、纯事实性语句、代码以及经过大幅改写的文本上,检测准确率会下降
原文视频
발표 내용
제3자 개발자용 클로드 워터마크 탐지 API 조만간 공개
기반 기술
구글 딥마인드가 2024년 네이처에 발표한 SynthID Text 방식의 변형
작동 방식
단어 선택 시 무작위성 조정, 앤스로픽에 따르면 품질·가독성엔 영향 없음
탐지 한계
짧은 글·사실 위주 문장·코드·전면 재작성 텍스트는 탐지 어려움
적용 모델
2025년 8월 2일 이후 출시 모델은 기본 지원, 구형 모델은 순차 적용
규제 배경
EU AI Act 투명성 행동강령에 약 190개 서명사와 함께 2026년 7월 서명
파일 라벨링
C2PA 표준 메타데이터 사용, 파일 자체는 변경하지 않음

Claude写的文字,如今外部也能核实

Anthropic即将推出一款水印检测API,供第三方开发者嵌入自家应用中使用。如果说此前在Claude生成文本中留下不可见痕迹本身就是新鲜事,那么这次发布的核心在于:这一痕迹如今可以被Anthropic以外的公司读取。无论是学校的论文查重工具,还是内容平台的AI识别功能,只要需要确认文本是否出自Claude,都可以接入这一API。

借用了SynthID的方案

据悉,该技术改造自谷歌DeepMind 2024年发表于《自然》杂志的SynthID Text方案。其原理是在逐词生成文本的过程中,对介入的随机性因素进行细微调整,从而在句子中嵌入可追踪的模式。Anthropic表示,这一过程“不会影响Claude生成文本的内容、创造力水平和可读性”。人在阅读时与普通文本并无二致,但经过检测API处理后,就能显示出Claude参与生成的可能性。

哪些地方不适用

不过,这种方式并非在所有文本中都同样有效。短文本或纯罗列事实的句子,由于可替换的表达本身较少,模式难以被有效嵌入。代码也是如此。若文本是人工逐词修改的纯校对稿,由于每个词都是人工选定的,水印不会留存。相反,Anthropic表示翻译文本中水印保留效果较好,因为翻译中最终所有词汇都是由Claude选定的。Anthropic在其公开的FAQ中还提到,如果对原文进行大幅度改写,水印也可能被抹去。

此外,该水印只能表明Claude有可能参与了文本撰写,无法区分是Claude全文撰写还是仅对部分内容进行了修改,也无法判断文本究竟是人工撰写还是出自其他公司的AI。

与传统检测工具的不同路径

Anthropic此次的方案与Pangram等现有AI检测工具有本质区别。由于Pangram一类的服务无法获取Anthropic的水印密钥,它们只能通过统计方式扫描AI特有的文体或常用表达模式来进行判断。相比之下,水印检测是直接核实Claude实际留下的痕迹,原理上能够得出更可靠的结果。

欧盟监管推动全球范围采用

Anthropic引入水印技术的背景是欧盟《人工智能法案》(EU AI Act)。去年7月,Anthropic与约190家签署方一同签署了欧盟《AI生成内容透明度行为准则》(Code of Practice)。由于目前没有合适的技术手段可以按地区限制功能,水印技术因此不仅适用于欧盟,而是在全球范围同步应用。2025年8月2日之后发布的所有Claude模型均默认支持水印,此前发布的模型也将在未来数月内陆续获得支持。对于非文本类文件,则采用名为C2PA的开放标准,在不改变文件本身的前提下附加来源元数据。

此前在8月11日,Anthropic曾宣布对Claude生成的全部内容强制加注水印,而此次推出的检测API则是下一步动作——让这一痕迹在Anthropic之外也能被读取。

具体如何使用

此次API的目标对象并非普通用户,而是开发者。若某公司希望在自身服务中加入“确认是否由Claude生成”的功能,只需调用Anthropic的检测API,即可获得该文本是否含有Claude水印模式的判定结果。具体上线日期或申请流程目前尚未公开,但其应用范围不难预见。例如,学校或学术期刊可将其用于初步筛查作业、论文提交物中是否存在AI介入;新闻或社区平台也可用其为AI生成的帖子添加标识;招聘平台则可将求职信是否由AI撰写作为参考指标之一。

编辑视角

嵌入水印和让外部核实水印,是两个完全不同层次的决定。如果说去年8月11日Anthropic宣布在全球范围内应用水印,是在宣告“我们将留下痕迹”,那么这次的API则是在宣告“我们也将把核实这一痕迹的钥匙交给外部”。对Anthropic而言,这是一个风险不小的决定——相当于主动让外部得以验证自家模型在何处、以何种方式被使用,一旦误判或规避案例增多,反而可能损害自身信誉。尽管如此仍选择这条路,合理的解释是欧盟《人工智能法案》这一外部压力起到了很大作用。若没有监管压力,主动承担相对竞争对手更重的透明度负担,动力本不会太大。

OpenAI和谷歌此前也各自尝试过AI文本标识方案,但将检测权限本身开放给第三方的案例并不多见。谷歌的SynthID此前主要在自家生态系统内使用,而Anthropic则借用这一思路,将其以API的形式对外开放。对实际操作过AI识别工具的人来说都清楚,基于统计文体分析的检测工具,误判率一直是老大难问题。基于水印的检测在原理上理应更为准确,但问题在于,代码、短文本、全面改写这些例外情况,恰恰是实务中最常遇到的场景。归根结底,即便有了这一API,“判定为非Claude所写”也不等同于“确定是人工撰写”,这一点在使用时需要清楚认识到。

对国内企业而言,眼下或许不必立即接入这一API,但对于内容平台或教育机构来说,已经到了可以开始评估引入的时候。不过,比起将水印检测结果作为唯一证据,更稳妥的做法是与现有的文体分析工具并用,作为辅助指标。可以预见,未来几周内OpenAI或谷歌很可能也会传出考虑类似的对外开放检测方案的消息。监管牵动一处、其余跟进的模式,此前已经不止一次上演。