每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI写的畅销书,追踪句子出处发现抄袭痕迹

石溪大学研究团队利用Ai2的infini-gram,对AI生成小说与现有文献的重叠程度进行了量化

언덕 사이로 굽이진 길을 걷는 사람

이미지: Ai2 (Allen AI) Blog

摘要

  • 研究团队利用Ai2的infini-gram引擎,分析了AI生成文本与现有出版物中罕见表达的重叠程度
  • 在亚马逊200本畅销书中,AI文本比例较高的书籍比比例较低的书籍在罕见表达重叠度上高出4.4个百分点
  • 与获奖及入围文学作品相比,这一差距扩大到22.5个百分点
연구 주체
스토니브룩대 Tuhin Chakrabarty 교수 연구팀
사용 도구
Ai2의 infini-gram 엔진, Google Books 데이터
비교 대상
아마존 자가출판 고수익 상위 200권씩 AI텍스트 유무 그룹
격차 1
일반 비교군 대비 희귀 표현 겹침 4.4%p 차이
격차 2
수상·후보 문학 대비 격차 22.5%p로 확대
발단 사건
Commonwealth Foundation 수상작이 AI 작성 의혹을 받은 'GrantaGate'

获奖作品竟是AI写的

Commonwealth Foundation颁奖的一篇短篇小说因被读者质疑为机器生成,引发了所谓的"GrantaGate"事件。AI检测器虽然能给出该文本为机器生成的可能性分数,却无法说明这些句子究竟来自何处。为填补这一空白,石溪大学计算机科学系助理教授Tuhin Chakrabarty的研究团队引入了Ai2的infini-gram引擎。研究团队利用Google Books数据和infini-gram,将亚马逊上自出版的高收益畅销书前200本按AI文本检测比例分成两组进行比较。结果显示,AI文本比例较高的书籍与现有出版物中罕见表达的重叠度,比比例较低的书籍高出4.4个百分点。当与获奖作品或入围作品相比时,这一差距扩大到22.5个百分点。事实上,研究团队用infini-gram对GrantaGate争议中的原始小说进行检索后发现,"发酵中的酸味(sour tang of fermenting)"这一表达与某同人小说网站上的句子几乎完全一致。

infini-gram:寻找句子指纹的工具

infini-gram是一款可以将海量文本数据集建立索引、从而统计任意长度的短语在整个语料库中出现次数的搜索引擎。Ai2(艾伦人工智能研究所)已将该引擎与其完全开源的语言模型Olmo相结合,应用于两个项目:OlmoTrace,用于将模型输出的句子与训练数据原文直接对照;以及Creativity Index,用于对照参考语料库为文本的原创性打分。Chakrabarty教授表示,他正是通过这两个项目了解到infini-gram的存在。他说:"在机器学习,尤其是大语言模型领域,溯源是一个非常棘手的问题。"研究的出发点在于,AI检测分数本身只能告诉我们某段文字是机器写成的概率,而无法揭示更多信息。研究团队解释称,在确认某段内容是AI生成之后,可以借助infini-gram之类的工具对句子进行实际"解剖"。这项研究于今年7月底以论文形式发布在arXiv上,据悉同月《大西洋月刊》和《纽约时报》在报道AI生成书籍的泛滥及版权问题时也曾提及这项研究。

这意味着什么

此次分析所揭示的情况是,AI写作的文字与其说是创造全新的语言,不如说更倾向于重新组合现有文本中的罕见表达。仅凭检测分数很难判断是否存在抄袭或版权侵权的可能,但如果结合infini-gram这类短语对照工具,就能够具体追溯某个句子究竟源自何处。这可以为出版社或文学奖主办方筛查AI生成稿件提供实证依据,同时也为探讨AI模型在多大程度上原样复现训练数据中的表达这一版权争议,提供了线索。