METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Anthropic推出可供第三方使用的Claude文本水印检测API

基于谷歌SynthID改造的检测技术,对代码和短文本存在局限——欧盟监管推动全球范围采用

Anthropic推出可供第三方使用的Claude文本水印检测API

图片:METAL

摘要

  • Anthropic即将推出一款水印检测API,供第三方开发者用来判断某段文本是否由Claude撰写
  • 该技术是对谷歌DeepMind 2024年发表于《Nature》的SynthID Text方法的改良版,通过调整选词过程中的随机性来实现
  • 该技术对短文本、以事实为主的句子、代码以及被大幅改写的文本,检测准确率会下降
原文视频

Claude写的文字,如今他人也能核实

Anthropic即将推出一款水印检测API,供第三方开发者嵌入到自家应用中使用。此前的突破在于让Claude生成的文本带上肉眼不可见的痕迹,而这次发布的核心在于:这种痕迹如今不仅Anthropic自己能读取,其他公司也能读取。无论是学校的查重工具,还是内容平台用来判别AI生成内容的功能,只要需要确认文本是否出自Claude,都可以接入这个API使用。

借用了SynthID的思路

据悉,该技术是对谷歌DeepMind于2024年发表在《Nature》上的SynthID Text方法进行改良而来。其原理是:在逐个选词的过程中,对介入其中的随机性因素做细微调整,从而在句子里嵌入可追踪的模式。Anthropic解释称,这一过程"不会影响Claude所写文本的内容、创意水准和可读性"。人类读起来与普通句子无异,但经过检测API处理后,就能显现出Claude参与创作的可能性。

哪些情况下不管用

不过,这种方式并非在所有文本中都同样有效。短文本或纯罗列事实的句子,因为可供选择的替代表达本身就少,模式难以嵌入。代码也是如此。若文本是经人工逐词校对而成的纯校订稿,其中不会留下水印,因为这些词是人选择的。相反,Anthropic表示译文中水印留存效果很好,因为翻译过程中所有词汇最终都是由Claude选定的。Anthropic在公开的FAQ中表示,若原文经过大幅改写,水印也可能被抹除。

此外,该水印只能提示Claude可能参与了文本撰写,无法判断是全文由Claude撰写,还是仅经过部分润色,也无法区分文本究竟出自人类之手,还是其他公司的AI。

与模式扫描类工具的不同之处

Anthropic此次的方式与Pangram等现有AI检测工具存在根本区别。由于Pangram一类的服务无法获取Anthropic的水印密钥,只能转而对AI特有的文体或常用表达模式进行统计层面的扫描。而水印检测则是核实Claude实际留下的痕迹,原理上可以得出更可靠的结果。

欧盟监管推动全球采用

Anthropic引入水印技术,背后源于欧盟《人工智能法案》(EU AI Act)。去年7月,Anthropic与约190家签署方一起,共同签署了欧盟《AI生成内容透明度行为准则》(Code of Practice)。由于没有合适的技术手段可以按地区限制功能,水印技术不仅适用于欧盟,也将同步应用于全球。2025年8月2日之后发布的所有Claude模型将默认支持水印功能,在此之前发布的模型也将在未来数月内陆续获得支持。对于非文本类文件,则采用名为C2PA的开放标准,在不改变文件本身的前提下,附加来源元数据。

此前,Anthropic已于8月11日宣布将对Claude的所有生成内容强制加注水印,而此次的检测API则是下一步——让这一痕迹能够在Anthropic之外也被读取。

如何使用

此次的API面向的是开发者,而非普通用户。想在自家服务中加入"判断文本是否由Claude生成"功能的公司,只需调用Anthropic的检测API,即可获得该文本是否含有Claude水印模式的判定结果。具体上线日期或申请流程目前尚未公布细节,但应用范围不难预见。例如,学校或学术期刊可将其用于初步筛查作业和论文提交中是否有AI参与;新闻或社区平台也可用来给AI生成的帖子加注标签;招聘平台也可能将其作为参考指标,判断求职信是否由AI撰写。

编辑视角

嵌入水印和让他人能够核实水印,是两个完全不同层次的决定。若说去年8月11日Anthropic宣布在全球范围应用水印技术,是"我们要留下痕迹"的宣言,那么此次的API则是"我们也要把核实这一痕迹的钥匙交给他人"的宣言。对Anthropic而言,这是一个风险不小的决定——相当于允许外部核实自家模型究竟在何处、以何种方式被使用,一旦误判或规避案例累积起来,反而可能损害自身信誉。尽管如此,公司还是走上了这条路,合理的解读是欧盟《AI法案》这一外部压力起到了重要推动作用。若无监管压力,公司本没有太大理由主动承担高于同行的透明度负担。

OpenAI和谷歌此前也都各自尝试过AI文本标识的方式,但将检测权限本身开放给第三方的案例并不多见。谷歌的SynthID此前主要在自身生态系统内使用,而Anthropic则借用了这一思路,将其以API形式对外开放。对于实际使用过AI判别工具的人来说都清楚,基于统计文体分析的检测工具,误判率一直是个头疼的问题。基于水印的检测原理上必然更准确,但问题在于,代码、短文本、大幅改写这几种例外情况,恰恰是实务中最常遇到的场景。归根结底,即便有了这个API,"判定非Claude所写"也并不等同于"确定为人类所写",使用时须理解这一点。

对国内企业来说,眼下或许还谈不上立即接入这个API,但对内容平台或教育机构而言,现在已经到了可以着手评估引入的时机。不过,比起将水印检测结果作为唯一证据,更稳妥的做法是与现有的文体分析工具并用,作为辅助指标。可以预见,未来数周内OpenAI或谷歌很可能也会传出考虑推出类似的开放式外部检测方案的消息。监管一旦推动一方行动,其余各方随后跟进的模式,此前已多次上演。

评论