每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI电子书泛滥,亚马逊上人类作家的销售额也被蚕食

虽然AI书籍占目录20%,但销售额占比仅为12%……在没有AI内容的书籍中,7个类型的销售额也在下降

책 더미가 컨베이어를 타고 아마존 킨들 로고로 향하는 일러스트

이미지: The Decoder

摘要

  • 对14,419本自出版电子书的分析显示,AI生成内容占比高的书籍占目录的20%,但销售额仅占12.1%
  • 即便只看完全不含AI文本的书籍,8个类型中也有7个类型的单本销售额出现下降,证实了存在"稀释效应"
  • 研究团队认为,这一结果可以作为版权侵权诉讼中一直缺乏的市场损害证据使用
분석 대상
2023년 1월~2026년 3월 출간 자가출판 전자책 14,419권
AI 판별 도구
Pangram v3.3(오탐률 0.04%), 이후 Pangram 4 출시
AI 다량 함유 도서
카탈로그의 20%, 판매량 12.1%, 매출액 11.3%
AI 텍스트 없는 도서
카탈로그의 62.9%, 매출액 72.5%
카탈로그·매출 성장률
2023년 1분기~2026년 1분기 카탈로그 38.3배, 분기 매출 8.9배
권당 매출 하락
8개 장르 중 6개 하락, AI 텍스트 없는 책만 봐도 7개 장르 하락
예외 장르
판타지/초자연/호러 - 무AI 도서 권당 매출 35% 상승

目录扩大38倍,销售额只增长了9倍

从2023年到2026年初,亚马逊自出版市场发生的变化用数字来说很简单:在售图书的种类增加了38.3倍,但这些书籍所分得的销售额只增长了8.9倍。这是纽约州立大学石溪分校研究团队对14,419本自出版电子书进行全面分析后得出的结果。样本取自美国五大出版社之一管理的内部数据库,据悉该数据库追踪约50万种亚马逊图书,覆盖每日电子书销量的约95%。

与以往只看简短书籍预览来判断是否为AI生成的研究不同,研究团队将全书正文都输入了检测工具。使用的工具是Pangram v3.3,开发方公布的误报率为0.04%。虽然后续版本Pangram 4已经发布,但本次分析以v3.3版本为准。书籍按AI文本占比被分为三个区间:"无"、"轻微(25%以下)"、"大量(超过25%)"。

AI书籍占比20%,销售额仅占12%

含有大量AI文本的书籍占调查目录的20%,但按销量计算仅占12.1%,按销售额计算仅占11.3%。相反,完全未检测到AI文本的书籍占目录的62.9%,却拿走了72.5%的销售额。

分类目录占比销量占比销售额占比
无AI文本62.9% 63-72.5% 73
大量AI文本(25%以上)20% 2012.1% 1211.3% 11

单看这些数字,会得出一个熟悉的结论:AI写的书仍然是质量低下的"垃圾内容",停留在市场底层。但研究团队指出,这种解读遗漏了真实的市场动态。

即便不含AI文本的书籍,7个类型的销售额也在下降

将2023年出版的作品与2025年出版的作品按相同的上市后时长进行比较后发现,8个类型中有6个类型的单本销售额出现下降。这里有趣的一点是,即使只单独抽出完全未检测到AI文本的书籍来看,8个类型中也有7个类型的销售额出现下降。这意味着,"销量不佳的AI书籍充斥目录、拉低平均值"这一解释,并不能完全说明这一现象。

研究团队将这一现象命名为"稀释(dilution)"。不过他们也明确表示,这种比较仅仅是观察到的相关关系,并非通过实验证明的因果关系。唯一的例外是奇幻/超自然/恐怖类型。在这个AI文本流入最晚、扩散速度也最慢的类型中,不含AI文本的书籍单本销售额反而上升了35%。研究团队将这一反转作为证据,说明整体市场趋势并非其他类型销售额下降的原因。这种模式在Kindle Unlimited使用比例较高的类型中——即读者从同一个订阅池中选书阅读的类型中——表现得更为明显。

版权诉讼所需的"市场损害"证据

研究团队认为,这次分析可以为针对AI企业提起的版权侵权诉讼提供实质性资料。此前原告方一直主张AI通过学习作品对市场造成了损害,但缺乏能够用数字证明这种损害的数据。这次调查提供了一个具体模式:即便撇开AI生成书籍数量增加不谈,人类作家的书籍单本销售额本身也在下降。

同一研究团队在8月11日公布的另一项分析中,曾利用艾伦人工智能研究所(Ai2)的infini-gram引擎,考察了AI生成文本与既有出版物之间的罕见表达重叠情况。当时,AI文本占比高的200本亚马逊畅销书,其罕见表达重叠度比普通对照组高出4.4个百分点;与获奖及入围文学作品相比,差距甚至扩大到22.5个百分点。将这次销售额分析与之前的结果放在一起看,在版权侵权争议诉讼中,"文本相似性"和"市场损害"这两方面的证据正在同时积累。

编辑视角

这项研究有趣的地方在于,它的结论出现了反转。乍一看数字,会给人一种熟悉的安心感:"AI书籍仍然是垫底的垃圾内容"。目录占比20%,销售额只占12%,似乎印证了"读者最终会筛掉低质量AI文本"这一叙事。但研究团队更深入一层,单独抽出完全不含AI文本的书籍来看后发现,这些书籍在8个类型中也有7个类型的销售额在下降。这说明问题并非出在AI书籍的质量上,而纯粹是数量问题。当蛋糕只扩大了9倍,而分蛋糕的嘴却增加到38倍时,即便人类作家写出和以前一样好的书,能分到的份额也在减少,这样的结构已经形成。

在出版之前,类似的事情早已在图库照片、YouTube短视频、素材内容市场上演过。新渠道出现之初,会先靠质量进行筛选,但一旦数量突破临界点,无论质量高低,整体单价都会下滑。自出版电子书市场几乎没有准入门槛,只是这个临界点来得格外快而已。像Kindle Unlimited这种按固定订阅池分成的结构,稀释效应会表现得更强,这一点也就顺理成章——因为蛋糕本身是固定的,分的人越多,不管是谁份额都会减少。

对于国内内容行业,尤其是运营网络小说、电子书平台或在这些平台上发文的人来说,这些数字不应被当作与己无关的事。虽然目前数量还没有像亚马逊那样集中涌入,但如果是同样结构的市场,大概率会走向同一个方向。现在能采取的实际应对有两个:一是不再拼出版速度,而是发展与读者的直接渠道(订阅、邮件通讯、粉丝群体)——稀释效应在匿名的搜索、推荐流量中表现强烈,而对已经拥有粉丝的创作者影响相对较小。二是关注像这次研究一样通过数据证明损害的趋势。如果国内的创作者团体也开始收集类似的销售数据,版权争论从情绪化讨论转向数字较量的时刻恐怕不会太远。

在接下来的几个月里,这项研究很可能被引用为正在进行中的AI版权诉讼的证据材料,包括亚马逊在内的各平台也将不得不面临压力,着手调整AI生成内容的标识方式或搜索曝光机制。