METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

Claude写的文字留下指纹

Anthropic开始在Claude写的文字里加入肉眼不可见的标记。它不是偷偷塞进特殊字符,而是把选词时用的"骰子"换成一把密钥——属于谷歌DeepMind SynthID系列的技术。理由是应对欧盟AI法案,范围却覆盖全球。同一天,谷歌反其道而行之,开放了关闭可见水印的选项。

Claude写的文字留下指纹

摘要

  • Anthropic于8月14日发布说明,首次确认Claude文本水印属于谷歌DeepMind SynthID系列技术。由于只在选词方式上做文章、不额外添加文字,费用、速度和文章质量都不受影响。
  • 标记只会出现在Claude"本可以写成别的样子"的地方。像陈述句或代码这种答案唯一的位置几乎不会留下痕迹,对人类原文做轻微润色时也是如此。相反,翻译文本全部会被标记,而短文很难被检测出来。
  • 欧盟AI法案第50条已于8月2日生效,约190家机构因此被绑定到同一方向。韩国《人工智能基本法》将机器可读标识列为可选而非强制,谷歌则在韩国、印度、越南自动应用可见水印。

先说结论——我的文章会发生什么

Anthropic启用的标记不是偷偷塞入文字的方式。它只在Claude用哪个词都无所谓的位置,在选词方式里植入一套秘密规则。原理留到后面细讲,先看看我的文章会变成什么样。

水印只会留在Claude本可以写成别的样子的地方。这一句话几乎解释了一切。没有选择余地的地方,也就没有地方可以植入标记。

  • 整篇交给Claude起草,就会留下标记。 Claude决定的词越多,能留标记的位置也越多。
  • 让它润色我自己写的文章,几乎不会留下。 因为大部分词汇仍然是人写的。
  • 翻译全部会被标记。 译文里的每一个词都是Claude重新选择的。
  • 陈述事实的句子里极少出现。 "牛顿的代表作是《___》"这个空只能填"自然哲学的数学原理",填别的词句子就错了。
  • 代码里几乎不会触发。 需要精确输出的位置根本不适用这套机制。不过像Anthropic举例的代码注释这种可以随便写的地方,还是可能被标记。"代码里会被打上水印"这种说法是夸大其词。
  • 短文抓不到。 选择的次数就是信号量,文章越长置信度越高。

Anthropic举的例子把这个原理概括得很清楚。"2+2=___"答案只有4一个。但如果是在讲乔治·奥威尔《1984》的情节,正确答案也可能是5。一旦语境把答案收窄成唯一解,水印就没有立足之地了。

还有一个重要限制要说清楚。水印**无法区分"Claude写的"和"Claude大幅修改过的"。**反过来,没检测出标记也不代表没用AI——其他公司的AI用的是不同的密钥。所有权问题同理。Anthropic明确表示,水印不代表版权归属或作者身份,服务条款中的权利也不会因此改变。

图片和文件是另一回事。这一点被不少英文媒体忽略了。.png、.jpg、.svg文件上加的不是改动像素的水印,而是C2PA内容凭证——简单说就是附在文件信息栏里的防伪电子标签。这是相机厂商和图片编辑软件共用的公开标准,图片本身不会改变。但正因为是标签,摘掉就没了,这是它的弱点。

不是添加文字,而是换掉骰子

AI在选择下一个词时,会从多个候选中按概率抽取一个。"今天天气又冷又___"这句话里,"甜的"进不去,但"阴沉的"和"灰蒙蒙的"都很自然。选哪个词意思都不会变。这种怎么选都无所谓的地方,长文章里能出现几百次。

水印技术不会强行改变这个选择的结果。它改变的是用来选择的"骰子"。它不用普通随机数,而是用密钥和前面几个词组合生成一个数字,以此决定下一个词。表面上看起来仍然是随机的,但拥有密钥的一方回头核算,就会发现这种规律无法用巧合来解释。

Anthropic给出的比喻很贴切。假设在桌游中不掷骰子,而是依次读取圆周率(π)小数点后的数字来移动棋子。游戏进行中这和掷骰子毫无区别。但游戏结束后回看整局记录,知道π的人就能算出这局游戏是否用了π。

这里要澄清一个误解。这种方式并不会让Claude总是偏爱选"阴沉的"这种固定口味。Anthropic明确表示,也不会强行拉入平时不用的生僻同义词。它动的不是候选词的排序,而是抽签用的种子。

背后的技术来自谷歌DeepMind的SynthID-Text。它于2024年10月发表在国际学术期刊《自然》上,题为《面向大语言模型输出识别的可扩展水印技术》。该技术采用锦标赛式采样,将候选词两两配对进行"淘汰赛"(默认30轮)决出最终胜者,而每场对决谁赢的规则里就藏着密钥。在保持每个词被选中概率不变的设置下,理论上文章质量不会下降。DeepMind通过对比约2000万条真实Gemini回复的用户反馈发现,点赞率差异0.01个百分点、点踩率差异0.02个百分点——基本没有区别。Anthropic内部测试也表示没有影响。

和市面上的"AI检测器"是完全不同的东西

这是最容易被误解的地方。GPTZero、Pangram这类AI检测服务没有密钥。所以它们只能看文风习惯。Anthropic自己举的例子很有意思——AI模型特别喜欢用"这不是X,而是Y"这种句式,而且用"quietly(悄悄地)"这个副词的频率远高于人类。

水印检测正相反。它不看文风,而是用密钥计算,所以写得好的文章不会因此更容易被怀疑。但代价是**只有掌握密钥的Anthropic才能做检测。**无论老师、公司还是作者本人,目前都没有办法自行核实——检测API也只停留在"即将推出"这句话上。

会不会消失——学界看法也分歧

"改写一遍就能消除"这种说法只对了一半。

2023年,Krishna团队动用一个专门用于整句改写的AI(110亿参数),将一款主流检测器的准确率从70.3%拉低到4.6%。相反,马里兰大学Kirchenbauer团队在2023年6月的论文(ICLR 2024)中得出了完全相反的结论。他们发现,即便经过人工大幅改写,只要凑够平均800个token(AI处理文本的最小单位"词元"),即便在十万分之一的严苛误判标准下依然能被检测出来。因为改写后的文章里,原文的词语组合依然会零星残留。

两种结论分歧的关键在于文章长度。短则消失,长则留存。Anthropic的说明也没超出这个范围——"轻微编辑不会完全消除水印,但如果把每一个词都换掉、进行彻底重写,水印就会消失。当然,如果做到那种程度,这篇文章还能不能算是AI写的,本身就值得商榷。"

还有更根本的问题。苏黎世联邦理工学院的研究团队在2024年发现,仅靠反复调用API提问,就能反推出水印规则,**同时实现了消除和伪造。伪造尤其棘手——在人写的文章里植入虚假信号、栽赃成AI作品的滥用手法,比"检测不出来"更难对付。GPTZero的Alex Cui也表示"面对同时攻击选词和句法的强力改写,水印撑不住"——也就是说,一旦同时颠覆词汇和句子结构,水印就扛不住了。

为什么偏偏是现在——一项近四年前的老技术撞上了监管

水印技术不是突然冒出来的点子,而是一项在学界流传已久的技术遇上了监管,才一下子被推上台面。

2022年11月。当时以休假身份加入OpenAI的理论计算机科学家斯科特·阿伦森(Scott Aaronson)在得州大学奥斯汀分校的演讲中公开了他的主要项目——用只有OpenAI知道的秘密规则生成随机数来选词,这正是如今Anthropic启用方式的原型。他也承认,几百个token(几百个词元)的量就能捕捉到信号,但换一个AI重写就会失效。

2023年1月。马里兰大学Kirchenbauer团队的论文《面向大语言模型的水印技术》获得当年AI顶会ICML的最佳论文奖(在1800多篇录用论文中仅6篇获奖)。该方法预先把词汇分成两组,通过统计哪一组用得更多来判断,而"没有选择余地的句子无法植入标记"这一局限也是在这时被指出的。前面提到的"越长越能留存"那篇论文,正是同一个团队所写。

2023至2024年。谷歌DeepMind于2023年8月率先为图像推出SynthID,并于2024年5月将水印技术应用到Gemini的文本上。10月,伴随《自然》论文,该团队在开发者平台Hugging Face上**公开了代码,任何人都可以拿来使用。**这一刻,该技术从一家公司的专属资产变成了整个行业的通用零件。

而OpenAI选择了不启用。2024年8月,《华尔街日报》报道称,OpenAI已经研发出置信度达99.9%的文本水印技术,却将其推迟发布近一年。2023年4月的一份内部调查中,约30%的用户表示"如果只有OpenAI加水印而竞争对手不加,我会减少使用ChatGPT",这一结果起到了很大作用。OpenAI同一天公开提出的另一个理由更为沉重——水印可能给母语非英语的人群贴上标签。

2026年8月2日。欧盟AI法案(EU AI Act)第50条的透明度义务正式生效。提供AI内容生成系统的一方必须确保其输出内容以机器可读的形式加以标注。Anthropic于2026年7月签署了《AI生成内容透明度行为准则》,签署方约有190家。违反者最高将被处以**1500万欧元或全球营业额3%**的罚款。

最具争议的地方就在这里。Anthropic并没有只在欧洲启用水印,而是**面向全球启用。**理由只有一句话——"目前还没有可靠的方法按地区划分范围"。这是欧洲制定的监管规则直接成为全球标准的典型案例,也就是所谓的"布鲁塞尔效应"。

韩国不同——水印并非强制

《人工智能基本法》已于2026年1月22日正式实施。第31条第2款规定,生成式AI的输出内容须标明该事实,施行令第23条第2款则规定标注方式可以是人类可辨识的标识或机器可读的标识二选一。也就是说,满足其中一种即可。即便选择机器可读的方式,也必须至少向用户告知一次。

也就是说,韩国并未强制要求水印。这一点与欧盟不同。罚款(3000万韩元以下)的适用对象也是第31条第1款规定的事前告知义务违反,而不是因为输出内容未加标注就直接被处罚——这一点常常被误读。

欧盟韩国中国美国加州
生效日期2026-08-022026-01-222025-09-012026-08-02
机器可读标识强制可选强制强制
人类可见标签由分发方负责强制强制用户可选
使用者义务无无有无

只有中国的规定格外严密,不仅对开发企业,还对使用者和分发平台都设有义务。加州也将从2027年1月起,要求平台承担检测义务。

相关法律依据分别为欧盟AI法案第50条、韩国《人工智能基本法》第31条、中国《标识管理办法》以及加州SB 942。标注方式略有不同,中国指定的是嵌入文件信息栏的"隐式标识",加州指定的是"潜在标识",加州的人类可见标签还附带"在技术可行范围内"这一限定条件。

同一天,谷歌反其道而行之

就在Anthropic发布说明的同一天,谷歌发布了截然相反的公告。

谷歌实验室副总裁乔希·伍德沃德于8月14日(韩国时间晚上10点39分)宣布,在Gemini和Flow中开放了开关可见水印的功能。该功能适用于Nano Banana(图像)、Omni(视频)、Lyria(音乐)全线产品。判断标准不是订阅等级,而是该国法律是否要求保留水印。

这里韩国被点名了。谷歌Flow的帮助文档明确写道,**印度、韩国、越南的居民会自动应用可见水印。**不过实际情况中,国家、套餐、账户类型互相交织——Digital Trends报道称,即便在这三个国家,付费AI Ultra订阅用户也可以关闭水印,而企业/学校账户则根本没有该设置选项。

更重要的是伍德沃德附加的说明。**可以关闭的只是可见水印,不可见的SynthID和文件电子标签依然保留。**谷歌加标记的内容量,从2025年5月的100亿件,增长到2026年5月仅图像和视频就超过1000亿件。

两家公司的做法看似方向相反,实则趋势一致——**撤下人眼可见的标签,转向机器可读的标记。OpenAI也于2026年5月在图像上引入SynthID,7月底扩展到音频——不过文本方面至今仍未应用。**文本水印技术本身是谷歌先启用的,所以Anthropic的"第一次"不在于技术,而在于名义——这是首个以合规为由,面向全球启用的案例。

人们真正生气的原因

问题从发布方式就开始了。Anthropic第一次公开这件事,不是通过新闻发布,而是悄悄放进了一份帮助文档。8月10日,该消息在开发者社区Hacker News上获得449点赞后扩散,次日TechCrunch、Forbes、Euronews相继跟进报道。然而那份文档**并没有说明"具体是怎么标注的"。**科技专栏作家John Gruber(Daring Fireball)在8月11日以《在没说明"如何标注"的情况下,发布了"Claude如何标注AI内容"》为题,直指这一空白。他的批评是:如果是插入不可见字符的方式,在有字数限制的平台上就会导致篇幅虚增;如果是操纵选词方式,则与Anthropic自己宣称的"不改变含义、质量和可读性"的承诺相矛盾。

率先填补这一空白的是社区。开发者John J. Wang于8月12日检查了720万字的Claude生成文本,确认其中并未混入不可见的特殊字符,并推测"应该是用密钥改变选词方式"。但他也明确表示,并未证实这就是SynthID——这个空白直到8月14日才被Anthropic补上。与其说是新发布,不如说是对四天舆论反弹的事后解释,这才是这件事的本质。

反弹分成两派。第一种是**"被抓包作弊"的框架**。TechCrunch在8月12日将用户反应概括为"担心在职场和课堂上使用AI的事情被戳穿而愤怒"。"我下指令又润色过,所以Claude只是工具"的说法,和"你只是下了指令,真正写出来的是Claude"的反驳针锋相对。支持水印一方的论据很简单——"唯一不希望有水印的理由,就是想骗人。"

第二种反应要沉重得多。**那些把Claude当校对工具用的人。**电台主持人Erik Erickson写道,*"我因为它校对得更好而放弃了Grammarly、改用Claude,现在我自己写的文章却被打上了'Claude做过'的水印。"Hacker News上被广泛引用的一条回应更加直接。"我有自闭症、多动症和阅读障碍。光是把自己的想法表达清楚就已经很吃力了,现在还得操心水印的事。社会给的羞辱感已经够多了。"*这和OpenAI两年前放弃发布时提到的"给非母语者贴标签"的担忧,是完全同一个痛点。

Anthropic的回应是"轻微校对几乎不会留下标记"。原理上没错。但**轻微校对的界限在哪里,判断出错时该如何申诉,这些都没有公开。**一个靠概率推测出来的信号,一旦就这样流入学校和职场,会发生什么,过去几年AI检测器频频把人写的文章误判成AI文章的乌龙事件,早已给出了答案。

编辑视角

**这次决定的本质不是检测技术,而是责任分配。**Anthropic得到的是合规应对,失去的是那些把Claude当校对工具使用的用户的信任。两者之间的空白——判断界限、申诉渠道、误判救济——目前无人填补。检测API何时以何种标准推出,才是真正的关键结局。

**目前可以立即做出的判断有三条。**①整篇交给AI起草会留下标记,用于润色人写文章则几乎不会留下。②代码基本不受影响——注释算是例外。③翻译全部会被标记,如果有把翻译成果以自己名义发布的情况,现在值得检查一下。

改变的不是技术本身。从2022年阿伦森的提议,到2023年OpenAI的搁置,再到2026年Anthropic的强行推行,真正变化的是监管环境和竞争格局。OpenAI曾判断,若独自启用会流失用户;而如今,在欧盟行为准则下,约190家机构已被绑定到同一方向。水印技术从一开始就是协调问题,而不是算法问题——这正是《自然》那篇论文在阐述局限性时所写的那句话:"水印实施必须以各方协作为前提。"

但现在乐观还为时尚早。学界已经演示过伪造和消除水印的可能性,一旦这种技术被用作判定个人诚信的依据,受害的往往是那些遵守规则的人。水印真正应该回答的问题,不是"这篇文章是不是AI写的",而是"能不能用这个标记来惩罚一个人"。而对于后者,Anthropic的说明中至今没有给出答案。

评论