METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

OpenAI 宣布在欧盟推出文本水印

OpenAI 将依据欧盟《人工智能法》在 ChatGPT 和 Codex 的输出中加入名为 textGrain 的隐形文本水印,并向 API 客户提供可选功能。公司同时公布数据显示,只需替换四分之一的词语,检测率就会降至 17%,检测工具仅向研究人员开放。

OpenAI 宣布在欧盟推出文本水印

图片:METAL

摘要

  • OpenAI 于 10 月 5 日宣布,为应对欧盟《人工智能法》,将在未来几周内为欧盟地区 ChatGPT 和 Codex 的输出加入名为 textGrain 的隐形水印。
  • 全球 API 客户可在部分模型上自行开启水印,默认处于关闭状态,检测工具仅向经审核的研究人员和专业机构开放。
  • 在 1% 误报率目标下,400 个 token 文本的检测率约为 95%,但将 25% 的词语替换为同义词后降至 17%,公司表示在 Astra 的基准测试中未见明显的质量差异。

OpenAI 于 10 月 5 日(当地时间)宣布了应对欧盟《人工智能法》(AI Act)文本来源规则的文本水印引入计划。这项由公司自主开发的水印技术名为 textGrain。未来几周内,在欧盟范围内由 ChatGPT 和 Codex 生成的符合条件的文本输出将带上肉眼不可见的水印;全球 API 客户则从发布当天起即可在部分模型上自行开启水印。API 默认关闭。用于识别水印的检测工具不会向公众开放,而是接受经审核的研究人员和专业机构的申请。

欧盟《人工智能法》要求生成式 AI 提供者以机器可读的方式使 AI 生成的文本可被识别。据报道,载有这项义务的第 50 条已于 2026 年 8 月 2 日生效,现有系统获得了至 12 月 2 日的过渡期。OpenAI 在公告中表示,"文本水印和检测仍是早期技术,存在相当大的局限",并解释称分阶段推进的做法兼顾了法律要求与技术现状。OpenAI 此前曾在其支持页面上写道,"目标是将来源信号扩展到包括文本在内的所有形式"。

textGrain 的原理是在模型选择下一个词的概率中混入由密钥生成的统计信号。读者看不出任何差别,但持有同一密钥的检测工具会寻找词语选择中残留的偏向,以判断文本中是否含有 OpenAI 水印。根据 METAL 查阅的 20 页技术报告,该方法按密钥将词表划分为若干区块,并通过求解最优传输(optimal transport)问题,把区块的选择与密钥绑定。区块内部各词之间的原始相对概率保持不变。其设计确保在随机抽取的密钥上取平均时能还原模型的原始分布,因此水印不会让模型的回答偏向某一方向。

从工程师的角度看,核心机制是熵预算。以往的 Gumbel-max 方法在相同上下文和相同密钥下总会选出同一个词,因此反复提出同一个问题可能得到完全相同的回答。报告针对这一问题,用单一的 KL 散度值衡量水印所消耗的采样随机性,并将其上限设定为熵的固定比例。检测工具只需生成的文本和密钥即可运行,无需知道生成时使用的模型或预算值。报告还指出,该方法可与草稿模型和目标模型共享密钥的推测采样(speculative sampling)结合使用。报告共有 9 位作者,其中 5 人来自 OpenAI,4 人来自宾夕法尼亚大学和耶鲁大学,通讯作者为 OpenAI 的 Weijie Su。

OpenAI 公布的性能数据因条件不同差异很大。在误报率目标设为 1% 的测试中,检测工具在 200 个 token 的心理学回答中约有 80% 识别出水印,在 400 个 token 的回答中约为 95%。在用词选择余地较小的数学回答中,检测率大幅下降;根据公司公布的图表,200 个 token 时低于 40%,400 个 token 时也仅在 60% 上下。经过修改的文本更难识别。在 400 个 token 的文本中,将 10% 的词语替换为同义词后,检测率从约 92% 降至 66%;替换 25% 后则跌至 17%。OpenAI 表示,与其测试的其他方法相比,包括谷歌面向文本的 SynthID,textGrain 的表现持平或更优。不过公告也同时指出,理想条件下的成绩并不能保证日常使用中的可靠检测。

公司表示质量损失几乎可以忽略。OpenAI 以最高设置运行其最新前沿模型 Astra,在 8 项基准测试中比较了加水印与未加水印的输出。Artificial Analysis 智能指数从 49.57 分变为 49.76 分,GPQA Diamond 从 94.44% 变为 93.94%,DeepSWE v1.1 从 72.80% 变为 71.68%,Terminal-Bench 4.0 从 53.90% 变为 56.06%。由于数值有升有降,公司得出结论称未见有意义的性能差异。

오픈AI가 공개한 텍스트 길이와 분야별 워터마크 판별률 그래프. 오탐률 1% 기준 심리학 답변은 200토큰 약 80%에서 400토큰 약 95%로 오르고 수학 답변은 40% 아래에서 60% 안팎으로 오른다
오픈AI가 공개한 편집 정도별 워터마크 판별률 그래프. 400토큰 기준 원문 약 92%, 낱말 10% 교체 66%, 25% 교체 17%

不向公众开放检测工具的决定正是源于这些数据。OpenAI 以误报(在没有水印时报告存在水印)和漏报(未能发现实际存在的水印)的风险为由,表示在推出时不会公开该工具。检测工具将依据《行为准则》(Code of Practice)逐案授予访问权限,只报告是否检测到 OpenAI 水印,不会透露用户身份或其提示词和对话内容。公司还明确列出了水印结果无法说明的五件事:水印无法说明人类贡献了多少、文本的所有权和责任归属、由谁撰写,以及内容是否准确。未检测到水印也不能证明文本由人类撰写,因为文本可能过短、经过修改或翻译,也可能由其他公司的工具生成。

오픈AI가 공개한 아스트라 최대 설정의 워터마크 적용 전후 8개 벤치마크 비교표

在竞争对手中,Anthropic 率先行动。METAL 此前曾报道 Anthropic 决定在 Claude 撰写的文本中加入隐形水印的消息。Anthropic 当时表示将"从第一天起标记 AI 生成内容",并在所有支持地区实施。相比之下,OpenAI 表示 ChatGPT 水印仅在欧盟开启,不会作为全球默认设置,理由是先从区域起步,从实际使用和反馈中学习。据报道,Microsoft、Meta 和 Mistral 也签署了同一准则,但 xAI 没有签署,因此 Grok 没有同等承诺。

图像和音频方面的措施保持不变。OpenAI 为支持的图像附加内容凭证(Content Credentials),符合 C2PA 标准,并在图像和音频中嵌入 SynthID 水印。openai.com/verify 网页工具和内容来源 API(Content Provenance API)也将继续公开提供。公司表示,未来几周内计划为通过云合作伙伴调用的 OpenAI 模型输出提供水印,补充技术报告,并将 textGrain 开源。

这次发布留下的数字是 25%。改动四分之一的词语就会使检测率降至 17%,这意味着文本水印与其说是揪出 AI 文字的检测器,不如说是确认未经改动的输出来源的印章。OpenAI 选择连同数据一起先公开这一边界,并有限度地开放检测工具。公司表示,将随着证据和标准的积累,逐步缩小监管所要求的机器可读标记与现有技术所能提供的可靠性之间的差距。

评论