ArXiv上超30%新投稿文本特征与AI撰写一致
目前,ArXiv上超过30%的新投稿读起来像是人工智能撰写的
一项对12,750篇ArXiv论文全文的检测显示,截至2026年7月,约32%的新投稿文本特征与AI撰写一致,该比例在2026年初峰值接近39%。计算机科学领域最高(65%),数学领域最低(0.7%)。检测器在0.4%假阳性率下可识别85%的AI学术文本。
用 0.4% 假阳性门槛做锚,测出 ArXiv 上 AI 写作比例已超三成,计算机科学高达 65%,这是我见过最严谨的同类测量。
我们如何衡量 arXiv 上的 AI 写作,以及这种衡量在哪里失效
我们对 12,750 篇 arXiv 论文的全文进行了评分,发现其中约三分之一的新论文读起来像是机器写的。以下是方法、结果,以及对局限性的诚实说明。
方法论 · 5 分钟阅读 · 2026


假阳性下限
有一类标题会宣称“X 中有 N% 现在是 AI”,其中大多数都不值得一读,因为支撑这个数字的检测器同时也会把一部分真正由人类撰写的文字标记出来。如果一个工具把 40% 的新论文标记为机器撰写,但同时也把 ChatGPT 出现之前撰写的论文中的 20% 标记为机器撰写,那么真正值得关注的是那没人提及的 20%。
于是我们围绕这一质疑来设计研究。我们的检测器在此处有描述,是针对学术写作校准的;在 0.4% 的假阳性率下,它能正确识别 99.6% 的真正的前 LLM 时代科学文本,并能召回 85% 的 AI 学术文本。我们把这一假阳性率作为基准锚点。我们取 2021 年和 2022 年、即 ChatGPT 之前提交的论文,将其视为真实人类写作,并设定标记阈值,使得恰好 0.4% 的论文触发该阈值。这条线就是下限。我们报告的每一个数字,都是高于某一阈值的论文占比,而按照构造,真正的前 LLM 时代写作在该阈值处恰好位于 0.4%。ChatGPT 之前的年份因此充当了一个内置对照组:如果这一上升是检测器造成的假象,那么 2021 年和 2022 年的标记率应当与 2026 年一样高。第一张图显示并非如此。
我们测量了什么
我们从 2023 年 1 月到 2026 年 7 月,抽取了十个领域组,每个领域每月约 25 篇论文,再加上 2021 年和 2022 年的八个对照月份,总计 12,750 篇论文。对于每一篇,我们都提取了第 1 版 PDF,因此一篇在 2026 年修订的论文不会把现代文本回泄到它 2023 年的位置。我们评分的是全文正文,而不是摘要,因为摘要会低估信号:我们见过同一篇论文在摘要上得分低于 20%,而在正文上得分超过 70%。我们报告的每一个数字都带有 bootstrap 95% 置信区间。
结果
被标记的占比在 2021 年和 2022 年全年持平于 0.4%,在 ChatGPT 发布后的几个月内开始上升,并在最近一个完整季度以两波涨势攀升至约 32%,在 2026 年初达到接近 39% 的峰值。各领域之间的差异很大,而正是表格和第二张图体现了这一点。以下数值是各领域截至 2026 年 7 月的 12 个月内的被标记占比,以及其 LLM 之前的对照水平。
| 领域分组 | LLM 之前对照 | 近期被标记占比 | 95% CI |
|---|---|---|---|
| 计算机科学 | 0.2% | 65.0% | [59.3, 70.3] |
| 定量生物学 | 3.5% | 56.3% | [51.0, 61.7] |
| 电气工程与系统 | 1.7% | 51.3% | [46.0, 57.0] |
| 经济与金融 | 2.5% | 47.0% | [41.3, 52.7] |
| 应用物理 | 1.3% | 34.0% | [29.0, 39.7] |
| 统计学 | 1.8% | 31.3% | [26.0, 36.7] |
| 凝聚态 | 0.0% | 24.0% | [19.3, 29.0] |
| 高能物理 | 0.5% | 14.0% | [10.0, 18.0] |
| 天体物理学 | 0.0% | 10.7% | [7.3, 14.3] |
| 数学 | 0.0% | 0.7% | [0.0, 1.7] |
计算机科学以约 65% 领先。数学最低,接近 0.7%,局限性部分解释了为何其低值难以解读。对照列是各领域 2021 至 2022 年的标记率在三种敏感性设置下的平均值;上升最多的领域并非 LLM 出现前对照水平最高的领域,因此起点较高并不能解释这一上升。
局限性
控制样本量。 每个领域在 ChatGPT 之前的对照样本为 200 篇论文。在 0.4% 的标记率下,整个 2000 篇论文的对照组中仅有八篇被标记,且稀疏散布于十个领域,因此按领域设置单一阈值的对照率过于粗糙。合并后的下限估计得较为可靠,也是该研究锚定的依据,但各领域的对照水平仅为近似值,而且扩大对照样本也无法解决这一问题:要在每个领域锁定百分之零点几的比率,每个领域需要数千篇对照论文,而 2023 年之前的 arXiv 体量并不包含这么多论文。
低分可能表明采用率低,也可能表明检测器存在盲区。 数学是最明显的案例。数学论文以符号和定理证明结构为主,一旦移除公式和参考文献,剩余的散文内容十分稀疏,且与检测器训练所用的科学英语截然不同。一篇在大量模型辅助下撰写的数学论文可能得分很低,因为其散文内容对检测器而言属于分布外样本,因此数学领域的低分只能作为人类撰写了该论文的弱证据。这一结果与两种截然不同的解释都相符——采用率较低,或该文体下检测器灵敏度降低——而本数据无法区分二者。分布内假设最强的领域,即散文内容密集的领域,恰恰也是上升幅度最大的领域,因此这一混杂因素无法解释总体趋势。但在低分领域中,排名应被解读为采用率的下限。
检测器覆盖范围。该检测器对某些生成器比其他生成器更敏感,而我们无法针对作者实际使用的确切、私密的模型与提示词混合进行评测。覆盖不完整会降低标记率,因此所报告的流行率是一个下界:真实占比至少与我们测得的一样高。检测器说明文档报告了针对每个生成器的性能。
被标记并不等于就是作者。该检测器估计的是文本读起来是否像机器所写,给出的是一个经过校准、具有已知错误率的概率。它无法区分一份经过轻度编辑的文档和一份完全生成的文档,而单一分数绝不能成为指控某个具体个人的依据。我们报告的是机器式写作的流行率,其中包含大量 AI 辅助编辑的情况。
试一试
来源:Hacker News 热门(buzzing.cc 中文翻译) · unslop.run