AI生成书籍正淹没亚马逊,并拉低人类作者的单书收入
AI-generated books are flooding Amazon and tanking sales for human authors
一项对14,419本自出版电子书的分析显示,AI生成书籍正以数量而非质量挤占人类作者市场,即便未检测到AI文本的书籍,单书收入也在下滑。2023年Q1至2026年Q1,书目总量增长38.3倍,而季度收入仅增长8.9倍;在八个类型中,七个类型的无AI文本书籍单书收入下降。
这项研究把市场稀释从推测变成可量化证据,版权诉讼中此前缺少的经验性数据可能由此补上,并影响合理使用的判断。

一项对超过 14,000 本亚马逊自出版图书的分析显示,AI 生成的书籍正凭借数量而非质量挤占人类作者的空间。即便是未检测到 AI 文本的图书,单本收入也在下降。
研究人员分析了 2023 年 1 月至 2026 年 3 月期间随机抽取的 14,419 本自出版电子书。对于每本书,他们从美国五大出版商之一维护的内部数据集中提取了每日销售数据。据研究人员称,该数据集追踪约 50 万本亚马逊图书,覆盖该平台每日售出电子书的约 95%。
与早期仅凭简短图书预览来检测 AI 文本的研究不同,研究人员根据全文对每本书进行分类。他们使用了 Pangram v3.3 检测器,其开发者报告的误报率为 0.04%。此后 Pangram 4 已发布。根据被标记为 AI 生成的文本占比,图书被分为三档:无、轻度(不超过 25%)和大量(超过 25%)。
目录占比大,销量低于平均水平
含有大量 AI 内容的图书占所研究目录的 20%,但仅占销量的 12.1% 和收入的 11.3%。未检测到 AI 文本的图书占目录的 62.9%,却贡献了 72.5% 的收入。乍一看,这似乎印证了 AI 图书仍是质量低下的“垃圾内容”、被困在市场底部的观点。

不过,该研究显示,这种看法忽略了真实的市场动态。从 2023 年第一季度到 2026 年第一季度,累计书目规模增长了 38.3 倍,而每季度有销量的书目数量仅增长了 19.2 倍。季度营收只增长了 8.9 倍。如今有更多的书在争夺一个增长缓慢得多的营收池。
即便是未检测到 AI 文本的书目,单本营收也在下降
在八个类型中,有六个类型的单本营收在对比 2023 年和 2025 年发行的书目(取发行后相同时间窗口)时出现下降。仅看未检测到 AI 文本的书目,八个类型中有七个类型的营收出现下降。
这排除了“平均值下降只是因为销量差的 AI 书籍扩充了书目”这一解释。作者将这种效应称为“稀释”,但强调他们的比较属于观察性和关联性研究,并非因果关系的实验性证明。

唯一的例外是奇幻/超自然/恐怖类,AI 文本在该类型中出现最晚,影响力也最小。在那里,未检测到 AI 文本的书目单本营收反而上升了 35%。研究人员表示,这种反转说明整体市场趋势并非导致该现象的原因。
在 Kindle Unlimited 覆盖率较高的类型中,这种模式更为明显,因为读者共享同一个订阅池。在这些类型中,未检测到 AI 文本的书籍在收入分成上的领先优势,比 Kindle Unlimited 覆盖率较低的类型小了 8.4 个百分点。研究人员将这一差距归因于各类型的自身特点,并未将其与 Kindle Unlimited 本身建立因果关系。
AI 书籍正在闯入头部榜单
在研究期间,含有大量 AI 内容的新晋 Top 25 作品占比从接近零上升到了 31%。头部榜单的更替速度也加快了。未检测到 AI 文本的书籍中,能连续两个季度留在 Top 25 的比例一度跌至约 28%,到研究结束时回升并稳定在约 62%。

产出集中在少数高产作者手中。在 385 个出版了大量含 AI 内容作品(在其第一本 AI 书籍之后)的作者身份中,有 287 个在此后提高了月度产出。收入最高的笔名在扣除平台费用前,凭借八部作品实现了 170 万美元的总收入。单本含大量 AI 内容的书籍中,收入最高的一本售出 80,431 册,带来了 64.3 万美元的收入。
这项研究呼应了《纽约时报》关于“Coral Hart”的报道,据报道,此人一年内以21个笔名出版了200多部言情小说,售出约5万本。AI垃圾内容还不止于图书领域。一名男子利用AI生成的歌曲在流媒体平台上诈骗了数百万美元。

畅销AI图书与现有作品中的罕见语言高度重叠
为了衡量畅销 AI 书籍与现有作品中罕见语言的重叠程度,研究人员使用了艾伦人工智能研究所的 infini-gram 工具以及 Google Books 索引。
他们识别出那些出现在五部或更少 Google Books 卷册中、且完全不存在于一个 4.7 万亿 token 网络快照中的罕见表达。这类短语指向与已出版书籍密切相关的语言模式。

在50部包含大量AI内容、票房收入最高的作品中,这些罕见表达覆盖了文本的45%,而在未检测到AI文本的前50本书中,这一比例为37.7%。对于获奖或入围奖项的小说,这一数字仅为19.1%。
在AI书籍中,收入每增加十倍,重叠率就上升7.6个百分点。在未检测到AI文本的书籍中,不存在这种相关性。该方法并不追踪个别段落的来源,也不能证明任何特定书籍被抄袭。它衡量的是整体语言重叠程度。
Chakrabarty 告诉Ai2,AI检测器只会返回“一个估计值——一个衡量某段文字有多大可能为合成内容的分数”,而不会指出这些语言来自何处。如果一段可疑文本还包含未出现在互联网上、且仅出现在少数书籍中的罕见表达,那么人们就“可以相当有把握地说,它是从书籍中提取的”。这类证据“作为支持AI检测器分数的间接证据”,同时“有助于驳斥一些陈词滥调的论点,这些论点将人类阅读书籍类比为AI在书籍上进行训练”——这是AI公司在版权纠纷中的标准辩护说辞。
研究结果直接关联到正在进行的版权诉讼
这些结果对针对AI公司的版权诉讼具有直接影响。在Kadrey诉Meta案中,法官Vince Chhabria于2025年6月作出了有利于Meta的裁决,但发出了严厉警告。他表示,很难想象利用受版权保护的书籍来构建一个产生数十亿美元收入、同时可能源源不断产出竞争性作品的产品,能够被认定为合理使用。
原告此前并未就这种市场稀释效应提供任何实证证据。而这项新研究恰好补上了此前缺失的那类证据,表明当大量AI生成书籍涌入市场时,未检测出AI文本的书籍收入会随之下降。
让这场诉讼更难推进的另一个事实是,平台本身无法识别AI内容。作者通过Kindle Direct Publishing出版时必须披露是否使用了AI,但亚马逊并不会把这一信息转告给消费者。多年来,该平台一直深受那些冒用知名作者姓名与写作风格的AI生成书籍困扰,其主要应对措施是将每日上架数量限制在三本以内。
语言重叠的发现与 2025 年 11 月的一项研究一致,该研究表明语言模型几乎可以逐字复现受版权保护书籍中的段落。同样在 2025 年秋季,另一篇论文表明,仅需两本书就足以针对某位作者的风格对模型进行微调。
来源:The Decoder:AI News(RSS) · the-decoder.com