跳到正文
北京时间
原文
The Decoder:AI News(RSS)· Jonathan Kemper·· 2026-08-15精选AI 评分70

AI生成书籍正淹没亚马逊,并拉低人类作者的单书收入

AI-generated books are flooding Amazon and tanking sales for human authors

AI 导读

一项对14,419本自出版电子书的分析显示,AI生成书籍正以数量而非质量挤占人类作者市场,即便未检测到AI文本的书籍,单书收入也在下滑。2023年Q1至2026年Q1,书目总量增长38.3倍,而季度收入仅增长8.9倍;在八个类型中,七个类型的无AI文本书籍单书收入下降。

推荐理由

这项研究把市场稀释从推测变成可量化证据,版权诉讼中此前缺少的经验性数据可能由此补上,并影响合理使用的判断。

正文 · AI 翻译

Image description

一项对超过 14,000 本亚马逊自出版图书的分析显示,AI 生成的书籍正凭借数量而非质量挤占人类作者的空间。即便是未检测到 AI 文本的图书,单本收入也在下降。

研究人员分析了 2023 年 1 月至 2026 年 3 月期间随机抽取的 14,419 本自出版电子书。对于每本书,他们从美国五大出版商之一维护的内部数据集中提取了每日销售数据。据研究人员称,该数据集追踪约 50 万本亚马逊图书,覆盖该平台每日售出电子书的约 95%。

与早期仅凭简短图书预览来检测 AI 文本的研究不同,研究人员根据全文对每本书进行分类。他们使用了 Pangram v3.3 检测器,其开发者报告的误报率为 0.04%。此后 Pangram 4 已发布。根据被标记为 AI 生成的文本占比,图书被分为三档:无、轻度(不超过 25%)和大量(超过 25%)。

目录占比大,销量低于平均水平

含有大量 AI 内容的图书占所研究目录的 20%,但仅占销量的 12.1% 和收入的 11.3%。未检测到 AI 文本的图书占目录的 62.9%,却贡献了 72.5% 的收入。乍一看,这似乎印证了 AI 图书仍是质量低下的“垃圾内容”、被困在市场底部的观点。

Three-part chart on AI text in self-publishing: line graphs show the rising share of new titles with over 25 percent AI text from 2023 to 2026 across eight genres, bar charts break down sales-rank tiers by AI-text band, and a slope graph compares title, sales, and revenue shares across the three AI bands.
含大量 AI 内容的书籍占书目总量的 20%,却仅占销售额的 12.1% 和营收的 11.3%。| 图片来源:Chakrabarty 等人

不过,该研究显示,这种看法忽略了真实的市场动态。从 2023 年第一季度到 2026 年第一季度,累计书目规模增长了 38.3 倍,而每季度有销量的书目数量仅增长了 19.2 倍。季度营收只增长了 8.9 倍。如今有更多的书在争夺一个增长缓慢得多的营收池。

即便是未检测到 AI 文本的书目,单本营收也在下降

在八个类型中,有六个类型的单本营收在对比 2023 年和 2025 年发行的书目(取发行后相同时间窗口)时出现下降。仅看未检测到 AI 文本的书目,八个类型中有七个类型的营收出现下降。

这排除了“平均值下降只是因为销量差的 AI 书籍扩充了书目”这一解释。作者将这种效应称为“稀释”,但强调他们的比较属于观察性和关联性研究,并非因果关系的实验性证明。

Four charts on revenue per book: growth curves for catalog, selling titles, sales, and revenue relative to 2023; revenue per title in the launch window by release cohort; and two genre-level comparisons of the 2023 and 2025 cohorts.
书目规模增长了 38.3 倍,而营收仅增长了 8.9 倍;在八个类型中,有七个类型中未含 AI 文本的书目单本营收出现下降。| 图片来源:Chakrabarty 等人

唯一的例外是奇幻/超自然/恐怖类,AI 文本在该类型中出现最晚,影响力也最小。在那里,未检测到 AI 文本的书目单本营收反而上升了 35%。研究人员表示,这种反转说明整体市场趋势并非导致该现象的原因。

在 Kindle Unlimited 覆盖率较高的类型中,这种模式更为明显,因为读者共享同一个订阅池。在这些类型中,未检测到 AI 文本的书籍在收入分成上的领先优势,比 Kindle Unlimited 覆盖率较低的类型小了 8.4 个百分点。研究人员将这一差距归因于各类型的自身特点,并未将其与 Kindle Unlimited 本身建立因果关系。

AI 书籍正在闯入头部榜单

在研究期间,含有大量 AI 内容的新晋 Top 25 作品占比从接近零上升到了 31%。头部榜单的更替速度也加快了。未检测到 AI 文本的书籍中,能连续两个季度留在 Top 25 的比例一度跌至约 28%,到研究结束时回升并稳定在约 62%。

Four charts on AI books' market position: sales share by AI-text band over time, area chart of Top 25 rank slots, heatmap of Top 25 shares by genre, and curves for bestseller retention and new entrants.
无 AI 文本书籍的销售份额从 2023 年初的近 100% 下降到 2026 年第二季度的约 60%,而 AI 作品占新晋 Top 25 上榜作品的比重最高达 31%。| 图片来源:Chakrabarty 等人

产出集中在少数高产作者手中。在 385 个出版了大量含 AI 内容作品(在其第一本 AI 书籍之后)的作者身份中,有 287 个在此后提高了月度产出。收入最高的笔名在扣除平台费用前,凭借八部作品实现了 170 万美元的总收入。单本含大量 AI 内容的书籍中,收入最高的一本售出 80,431 册,带来了 64.3 万美元的收入。

这项研究呼应了《纽约时报》关于“Coral Hart”的报道,据报道,此人一年内以21个笔名出版了200多部言情小说,售出约5万本。AI垃圾内容还不止于图书领域。一名男子利用AI生成的歌曲在流媒体平台上诈骗了数百万美元。

Six charts on AI exposure and author output: Top 25 share of books with no AI text by catalog exposure, comparison by Kindle Unlimited availability, scatter plot of monthly book output before and after AI adoption, and three bar rankings of output and revenue for the most successful author identities.
在385个作者身份中,有287个在出版第一本AI图书后产量激增。收入最高的身份通过8部作品实现了170万美元的总收入。| 图片来源:Chakrabarty等人

畅销AI图书与现有作品中的罕见语言高度重叠

为了衡量畅销 AI 书籍与现有作品中罕见语言的重叠程度,研究人员使用了艾伦人工智能研究所的 infini-gram 工具以及 Google Books 索引。

他们识别出那些出现在五部或更少 Google Books 卷册中、且完全不存在于一个 4.7 万亿 token 网络快照中的罕见表达。这类短语指向与已出版书籍密切相关的语言模式。

Three charts on overlap with rare expressions from existing books: bar comparison for Top 50, 100, and 200 by revenue, scatter plot of revenue versus coverage with regression lines, and density curves for AI books, self-published bestsellers, and award-winning literature.
畅销 AI 书籍对现有书籍中罕见表达的借鉴程度远高于获奖文学作品,后者的覆盖率仅为 19.1%。| 图片来源:Chakrabarty 等人

在50部包含大量AI内容、票房收入最高的作品中,这些罕见表达覆盖了文本的45%,而在未检测到AI文本的前50本书中,这一比例为37.7%。对于获奖或入围奖项的小说,这一数字仅为19.1%。

在AI书籍中,收入每增加十倍,重叠率就上升7.6个百分点。在未检测到AI文本的书籍中,不存在这种相关性。该方法并不追踪个别段落的来源,也不能证明任何特定书籍被抄袭。它衡量的是整体语言重叠程度。

Chakrabarty 告诉Ai2,AI检测器只会返回“一个估计值——一个衡量某段文字有多大可能为合成内容的分数”,而不会指出这些语言来自何处。如果一段可疑文本还包含未出现在互联网上、且仅出现在少数书籍中的罕见表达,那么人们就“可以相当有把握地说,它是从书籍中提取的”。这类证据“作为支持AI检测器分数的间接证据”,同时“有助于驳斥一些陈词滥调的论点,这些论点将人类阅读书籍类比为AI在书籍上进行训练”——这是AI公司在版权纠纷中的标准辩护说辞。

研究结果直接关联到正在进行的版权诉讼

这些结果对针对AI公司的版权诉讼具有直接影响。在Kadrey诉Meta案中,法官Vince Chhabria于2025年6月作出了有利于Meta的裁决,但发出了严厉警告。他表示,很难想象利用受版权保护的书籍来构建一个产生数十亿美元收入、同时可能源源不断产出竞争性作品的产品,能够被认定为合理使用。

原告此前并未就这种市场稀释效应提供任何实证证据。而这项新研究恰好补上了此前缺失的那类证据,表明当大量AI生成书籍涌入市场时,未检测出AI文本的书籍收入会随之下降。

让这场诉讼更难推进的另一个事实是,平台本身无法识别AI内容。作者通过Kindle Direct Publishing出版时必须披露是否使用了AI,但亚马逊并不会把这一信息转告给消费者。多年来,该平台一直深受那些冒用知名作者姓名与写作风格的AI生成书籍困扰,其主要应对措施是将每日上架数量限制在三本以内。

语言重叠的发现与 2025 年 11 月的一项研究一致,该研究表明语言模型几乎可以逐字复现受版权保护书籍中的段落。同样在 2025 年秋季,另一篇论文表明,仅需两本书就足以针对某位作者的风格对模型进行微调。

来源:The Decoder:AI News(RSS) · the-decoder.com

相关事件