工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

用侵权书籍训练AI,是否违法?法庭交锋持续

Anthropic 15亿美元和解金背后的真正焦点:训练本身没问题,偷来的才是问题

파란 책을 읽고 있는 흰색 휴머노이드 로봇

이미지: METAL LAB 생성

摘要

  • 法官William Alsup虽然判Anthropic支付15亿美元版权和解金,但同时认定AI训练本身是合法的
  • 关键在于,法官处罚的不是训练行为,而是从非法影子图书馆下载书籍这一举动
  • Thomson Reuters诉Ross Intelligence案与Thaler诉Perlmutter案交织,正在为AI版权诉讼划出基准线
앤스로픽 합의금
15억 달러 (윌리엄 알섭 판사 명령, 지난해)
판결 요지
AI 학습 자체는 합법, 불법 쉐도우 라이브러리에서 내려받은 행위만 처벌
미국 저작권법 제정
1976년 이후 큰 개정 없음
톰슨로이터 대 로스 인텔리전스
경쟁 플랫폼 제작 목적의 학습은 공정 이용 불인정
탈러 대 펄머터
AI가 100% 생성한 저작물은 저작권 보호 대상 아님
앤스로픽 매출 전망
2028년 연 매출 약 2000억 달러 (로이터 보도)
인터뷰이
캐시 겔리스(IP·저작권 전문 변호사), 제이슨 헨더슨(JWL인터내셔널 변호사)

作家自己都不知道,自己的作品成了训练素材

驱动ChatGPT、GeminiClaude等聊天机器人的大语言模型(LLM),一直以来靠数亿本书籍、论文和网络文章作为训练素材。问题是,写出这些书的作者大多对此毫不知情,也从未表示同意。换句话说,他们在不知情的情况下,为可能威胁自己生计的技术提供了原料。这看似明显违法,但真正走进法庭后,事情远比想象中复杂。知识产权与版权律师Cathy Gellis对TechCrunch表示:"整个领域本来就极其复杂,而且正反双方情绪都很激烈。"

15亿美元和解金,却不算败诉

去年,法官William Alsup裁定Anthropic就版权侵权支付15亿美元和解金。这笔钱赔给的是那些作品被用来训练Claude的作者们,乍看之下像是作家的胜利,但Alsup法官真正认定违法的,并不是AI训练本身。他只是认定,Anthropic从不合法的网络"影子图书馆"擅自下载书籍这部分构成侵权;至于把作品用作训练素材本身,他判定是合法的。据悉,在判决书中,Alsup法官将Anthropic的大语言模型比作一名文学系学生——它并非要抄袭或取代此前的作品,而是通过阅读海量文字来创造出全新的东西。

Gellis认为,这份判决其实对AI企业更有利。对于到2028年预计年营收将达2000亿美元的Anthropic来说,这笔罚金根本谈不上撼动业务的负担。她指出,Alsup法官把AI训练理解为更接近"阅读与体验"而非"原样复制"的行为,这对整个AI训练领域来说是一个积极信号。

从书籍到AI模型的训练箭头上有一道关卡,代表从影子图书馆非法下载。越过这道关卡后,AI模型指向判决节点,该判决承认训练本身合法,却命令仅就非法下载部分进行赔偿。通往判决的连线为虚线,表示这一标准仍可能因其他法院的判断而被推翻。

版权法的判断标准:是不是"复制"

美国版权法自1976年制定以来几乎没有大改,这意味着法院不得不把一套诞生于50年前的原则,硬套用到AI时代。知识产权与媒体律师Jason Henderson表示:"大家现在焦虑,是因为法律本身一团乱。"他说,所有人都知道AI模型学习了海量资料,但法律还没跟上这个问题。

这类案件大多取决于"合理使用(fair use)"原则。合理使用是一项例外规定,允许在未经版权方许可的情况下,出于评论、戏仿、教育等目的使用作品,法院会综合考量使用的目的与性质、使用比例的多少,以及对原作品市场造成的影响。Henderson解释说:"版权问题归根结底都是在保护和培育市场。"如果AI训练的目的是打造出与原作品直接竞争的东西,法院往往会持否定态度;如果不构成竞争,则倾向于放行。

Ross Intelligence案划出的界线

Henderson举的例子是Thomson Reuters诉Ross Intelligence案。媒体科技公司Thomson Reuters起诉研究公司Ross Intelligence,称其抄袭自家内容打造了一个与之竞争的AI法律平台。审理此案的法官Stephanos Bibas在判决书中指出,Ross的使用方式与Thomson Reuters原本的用途并无"不同的目的或性质",因此不构成合理使用。问题就出在:Ross用Thomson Reuters的内容训练出了一个与Thomson Reuters直接竞争的平台。作家们同样可以主张,聊天机器人利用自己的作品生成新的合成书籍来与自己竞争,但目前这一逻辑尚未在法庭上获得认可。

AI写出的东西,版权归谁

Gellis认为,谈AI与版权问题时应该把焦点分清楚。"用作品训练AI"和"要不要给AI生成的成果本身授予版权"是两件完全不同的事。在Thaler诉Perlmutter案判决中,法院认定如果一件作品100%由AI生成,则不受版权保护。要套用这一标准,首先就得证明某部作品是否由AI生成、以及AI参与的程度有多深,这本身就是个新难题。Gellis打了个比方:用Word写小说、再用拼写检查功能修改,没人会觉得Word因此拥有这部小说的版权;同样,AI的出现正在迫使我们重新审视那些长期被搁置的问题。

案件核心争议法院判定
作家诉Anthropic用作品训练AI训练合法,仅就非法下载部分赔偿(15亿美元)
Thomson Reuters诉Ross Intelligence以打造竞争平台为目的的训练不构成合理使用
Thaler诉PerlmutterAI 100%生成内容的版权不受版权保护

诉讼战远未结束

目前大多数AI企业仍深陷相关诉讼之中,短期内很难出现明确的定论。Gellis认为,眼下这些判决作为早期判例确实具有影响力,但一旦其他法院做出不同判断,这种影响力也可能被推翻。哪个判例最终会站稳脚跟,还得看后续诉讼走到哪一步。尽管如此,AI企业也无法忽视目前已有的判决,因为这些判断已经在实际影响整个行业的走向。

编辑视角

Alsup这份判决给行业传递的信息很明确——训练没问题,偷来的素材才有问题。这份判决其实近乎给AI企业发了一张免责牌:15亿美元相对于营收规模实在微不足道,今后版权诉讼很可能不会成为拖慢AI企业增长的变量,而是被当作一项经营成本吸收掉。缴罚款、继续做生意,成了理性的选择。

这样的套路并不陌生。当年Napster引发的音乐版权诉讼、Google图书扫描案,最终都是技术先铺开、法律再姗姗来迟划定边界。这一次,法院同样沿用"复制还是学习"这套老版权框架来套用AI,而在这个框架下,结论天然就会偏向AI企业——因为版权法从一开始设计出来,是为了惩罚"抄袭",而不是阻止"阅读与学习"。

对国内企业和内容创作者而言,这波趋势下有两件事值得留意。第一,把自家数据交给AI训练时,要签订来源和授权都明确的合同;第二,商用AI生成内容前,要提前判断"这是否算受版权保护的创作物"。如果直接套用Thaler诉Perlmutter案的标准,完全由AI生成的内容可能得不到法律保护,因此保留人工编辑、修改的过程记录,在实务上会更稳妥。

未来几个月,在针对OpenAI、Google、Meta的类似诉讼中,Thomson Reuters诉Ross Intelligence案确立的标准——是否以直接竞争为目的——预计会反复被援引。可以预见,推出与特定行业直接竞争的AI产品的企业,面临的诉讼风险将进一步加大。

评论