跳到正文
北京时间
原文
HuggingFace Daily Papers(社区热门论文)·· 2026-05-27精选AI 评分71

AI研究智能体窄化科学探索

AI Research Agents Narrow Scientific Exploration

AI 导读

本研究将AI研究智能体视为科学搜索系统进行评估。通过四个框架和六个大语言模型,从共享种子文献中生成了37,802个科学想法,并与人类论文、后续研究及种子文献进行对比。实验揭示了四个一致的模式:AI生成的想法比同领域人类论文更为集中;更贴近其起始文献,而非后续人类研究;与AI想法最相似的论文后续引用量往往较低;当AI想法与已有工作不同时,差异主要源于对现有技术方法的重组,而非引入全新的研究问题。总体而言,当前的AI研究智能体更擅长局部细化,而非拓展科学探索的广度。

推荐理由

这篇论文用3万多个AI生成的想法证明,当前AI研究代理更像是在现有研究上修修补补,而不是开拓新方向。所有想靠AI加速科研的团队都该看一下,别高估了AI的「创造力」。

正文 · AI 翻译
摘要

当前,AI 研究智能体已能够支持大规模、AI 辅助的科学发现。我们考察了 AI 生成的思路究竟是拓宽了科学探索的边界,还是主要强化了既有研究。通过使用五种智能体框架和五个大语言模型,我们为不同科学领域生成了 219,655 个研究思路。在多项实验中,出现了四个一致的模式。第一,与同一研究领域中人类撰写的论文相比,AI 生成的思路更为集中。第二,与人类后续的跟进研究相比,AI 生成的思路与起始文献的距离要近得多。第三,AI 生成的思路与未来的人类研究方向契合度较低。最后,AI 生成的思路位于历史科学图景中影响力较低的区域。总体而言,当前的 AI 研究智能体似乎更擅长局部细化,而非拓宽科学探索的广度。

关键词:

人工智能,智能体 AI,科学发现,大语言模型,科学学

1 引言

Refer to caption
图 1:研究设计概览。我们首先从 Semantic Scholar 语料库中构建研究领域,然后使用 AI 研究智能体基于这些领域的既有文献生成科学思路,最后将生成的思路与人类撰写的论文进行比较。

近期 AI 研究智能体的进展,使得自动化科学发现成为可能。这些智能体如今能够进行文献综述、生成研究思路、规划实验、运行代码、撰写论文,并迭代式地探索和完善科学假设 [lu2026towards, baek2025researchagent, schmidgall2025agent, hao2026artificial]。重要的是,这些 AI 研究智能体框架被明确设计为鼓励探索性的科学构思。它们的提示词和推理流程通常会指示智能体生成新颖、高影响力且非传统的思路,而非对先前工作的简单延伸 [lu2026towards, baek2025researchagent, schmidgall2025agent]。随着此类系统能力日益增强且更易获取,它们可能会从根本上重塑科学发现的过程。

然而,大规模生成研究创意的能力并不必然意味着更广泛的科学探索。科学发现往往依赖于超越既定方向、探索较为陌生的领域,并以非常规方式重组已有知识[foster2015tradition, uzzi2013atypical]。现有对AI研究智能体的评估主要考察单个创意是否有趣、新颖、可行或可执行[si2024canllms, wang2024scimon],但对于反复借助AI进行创意构思会如何塑造科学探索的整体格局,则揭示得少得多。这引出了一个更广泛的问题:AI研究智能体是否拓宽了科学探索的边界?

为了研究这个问题,我们从涵盖广泛领域的科学文献中构建研究领域,并使用AI研究智能体在每个研究领域内基于共享的种子论文生成创意。具体而言,我们以2020年至2025年间发表在Semantic Scholar学术图谱上的论文作为种子文献,利用先进的AI研究智能体框架(包括AIScientist [lu2026towards]、ResearchAgent [baek2025researchagent]、AgentLaboratory [schmidgall2025agent]和Co-Scientist [gottweis2026coscientist]),结合五个大语言模型来生成完整的科学研究创意,其中既包含研究问题也包含研究方法。我们总共分析了219,655个有效的AI生成研究创意,这些创意横跨12个广泛的科学领域和155个研究子领域。在整个创意构思过程中,所有被评估的AI智能体框架都明确被指示要探索超越种子文献的新研究方向。这些AI智能体框架还可以进一步从整个Semantic Scholar数据库中搜索和检索额外的相关文献。

随后,我们从四个维度对这些AI生成的创意进行研究:它们是否探索了多样化的科学方向,是否超越了起始文献走向新的研究主题,是否与未来的研究前沿相契合,以及是否与科学图景中潜在的高影响力区域相关联。

跨研究领域,且在被评估的智能体框架和底层大语言模型中一致地呈现出四种模式。第一,AI 生成的想法比来自同一研究领域的人类撰写的论文要集中得多。第二,AI 生成的想法与其起始文献的距离,远小于人类后续跟进工作与起始文献的距离,这表明它们主要是在先前工作的基础上进行局部外推。第三,与人类后续论文相比,AI 生成的想法所涵盖的、用于表征下一年研究前沿(由后续人类研究中被最频繁研究的主题所定义)的关键词要少得多。最后,AI 生成的想法所关联的人类撰写的论文,其被引次数低于人类后续工作。

这些发现表明,对于当前 AI 研究智能体在科学发现中的作用,应持谨慎态度。尽管当前的 AI 智能体能够高效地大规模生成连贯且基于文献的研究想法,但其产出似乎并未实质性地拓展科学探索的前沿。随着 AI 系统日益融入科学工作流程,区分规模化生成想法与拓宽科学探索之间的差异可能变得愈发重要。因此,更广泛的挑战不仅仅是让 AI 系统生成更多看似合理的科学想法,而是要设计出能够真正拓展科学探索范围的系统。

媒体内容 · 前往原文查看
表 1:本研究中评估的 AI 研究智能体框架。
框架 智能体机制 实现摘要 新颖性指令摘录
零样本 单次生成 大语言模型接收文献上下文,并在单次交互中生成一个研究想法。 “提出一个基于文献的新颖研究想法”
AI Scientist [lu2026towards] 迭代式自我反思 智能体迭代地批判和修订生成的想法,并可在各轮次之间选择性地刷新文献上下文。 “提出任何新颖的想法或实验;确保它们具有新颖性”;“质量、新颖性和可行性”
ResearchAgent [baek2025researchagent] 多阶段规划与验证 该智能体将构思过程分解为问题发现、方法设计和实验规划,并设有中间验证智能体对输出结果进行评分。 “有前景的、新颖且关键的科学问题”;“原创的”;“创新的”;验证维度包括“原创性”和“创新性”
AgentLaboratory [schmidgall2025agent] 多智能体协商 多个基于角色的智能体通过对话迭代讨论并完善研究方案。 “极具创新性,前所未见”;“确保你的新输出与之前截然不同”
Co-Scientist [gottweis2026coscientist] 基于锦标赛的假设演化 多个智能体生成相互竞争的假设,然后通过锦标赛式比较进行评审、排序和演化,最后进行元评审。 “提出一个新颖、可行的研究假设”以及“根据新颖性、重要性、可行性和可检验性对假设进行排序”

最后一列展示了每个框架中与新颖性相关的明确指令摘录。

2 利用AI智能体生成科学想法

定义研究领域。

我们首先从各主要科学领域的学术文献中构建研究领域。我们从Semantic Scholar学术图谱API(https://www.semanticscholar.org/product/api)收集论文及其参考文献和引文信息。最终形成的语料库涵盖12个领域,包括医学、生物学、工程学、化学、计算机科学、环境科学、材料科学、物理学、数学、经济学、商业和社会学。每条论文记录包含其摘要、发表年份、主要领域和引文链接。我们使用2020年之前发表的论文来构建研究领域。

在每个科学领域内,我们利用文献耦合 [kessler1963bibliographic] 来识别研究领域。具体而言,论文通过其引文档案进行表示,并根据文献耦合相似度进行聚类。最终识别出的研究领域涵盖冷冻电镜、胰腺癌治疗、海上风电、重离子物理以及微生物群落组装等主题。详细构建步骤见补充方法(参见SM S1.1)。

科学创意生成。

接下来,我们利用 AI 研究智能体,基于已有文献生成新的科学创意。针对每个已识别的研究领域,我们反复从 2020 年至 2025 年间发表的论文中抽取种子论文集,以启动 AI 创意生成。每个种子集包含五篇论文:一篇锚点论文,以及通过引用关系从同一研究领域选取的四篇相关论文。我们使用五篇种子论文,是因为大多数被评估的 AI 研究智能体框架都受限于当前大语言模型的上下文窗口限制。这些种子论文定义了一个连贯的研究主题,并为创意生成提供了共同的起始文献背景。

在创意生成过程中,被评估的智能体框架可以进一步搜索本地部署的 Semantic Scholar 数据库,以检索更多相关论文,从而将文献背景扩展到初始种子集之外。为了保持历史设定,智能体仅允许检索种子论文发表时已有的论文。

我们评估了五个具有代表性的 AI 研究智能体框架:零样本基线、AIScientist [lu2026towards]、ResearchAgent [baek2025researchagent]、AgentLaboratory [schmidgall2025agent] 和 Co-Scientist [gottweis2026coscientist]。这些框架代表了 AI 研究智能体的几种主要设计思路,包括迭代自我反思、多阶段规划与验证、多智能体协商以及锦标赛式假设演化。除零样本基线外,所有被评估的智能体框架都可以从本地部署的 Semantic Scholar 数据库中检索更多论文。表 1 总结了被评估的框架及其相应的智能体机制。

重要的是,在所有被评估的框架中,构思提示词都明确鼓励探索超出种子文献的范围。零样本基线要求模型提出新颖的研究想法。AIScientist 强调通过迭代式自我反思和修订来生成“新颖”且“高影响力”的想法。ResearchAgent 在多阶段规划和验证过程中鼓励创新性的方法设计。Agent Laboratory 明确指示智能体在文献基础上进行扩展,并生成“极具创新性且前所未见”的想法。Co-Scientist 通过比较来生成和完善假设,并在每一轮中明确奖励新颖性。补充方法部分提供了每个被评估框架的完整提示词和详细的智能体设计(参见补充材料 S1.2)。

每个 AI 智能体框架都需要与一个大语言模型配对使用。我们评估了五个大语言模型:四个开放权重的模型,参数量从 8B 到 35B 不等,分别是 Gemma-4-31B-IT [farabet_lacombe_gemma4_2026]、Llama-3.1-8B [grattafiori2024llama]、Hermes-4-14B [teknium2025hermes] 和 Qwen3-35B-A3B [qwen3.5],以及 OpenAI 的 GPT-5.4 [openai_chat]。

在五个智能体框架和五个大语言模型上,我们从已确定的研究领域中引导出种子论文集合。总体而言,我们的分析使用了来自 155 个研究领域(涵盖 12 个广泛的科学领域)的 219,655 个有效的 AI 生成想法,这些想法来自 232,800 次生成运行。如果一次生成运行成功产生了一个非空的结构化研究想法,则该运行被视为有效(详细分类和示例见补充材料 S1.2、表 S3 和 S4)。

Refer to caption
图 2:AI 生成的想法比人类撰写的论文表现出更低的探索广度。(a–b) 在同一研究领域内和跨不同研究领域的平均探索广度,按智能体框架和大语言模型分别展示,并附有相应的人类论文基线。(c–d) 不同智能体框架和不同大语言模型生成的想法之间的成对探索广度矩阵。最后一行和最后一列将 AI 生成的想法与人类撰写的论文进行比较。

3 量化 AI 生成的科学想法

接下来,我们引入几种度量方法来描述 AI 生成的科学想法的特征。

探索广度。我们将探索广度定义为 AI 生成的创意在特定研究领域内,沿着不同方向进行拓展的程度 [peng2021neural]。为了量化这一广度,我们使用文本嵌入模型将每个 AI 生成的创意编码到一个共享的语义嵌入空间中。探索广度随后通过同一研究领域内 AI 生成创意之间的平均成对余弦距离来衡量。平均余弦距离越大,表明生成的创意在语义创意空间中占据的区域越广,因此探索的科学方向范围也更广 [pnasHofstra2020, cohan2020specter]。作为稳健性检验,我们还使用基于质心的距离度量来量化探索广度(见补充材料 S2.2 和表 S6)。

探索距离。我们将探索距离定义为 AI 生成的创意偏离用于启动创意构思的种子文献的程度 [shibayama2021measuring]。对于每个创意,我们首先计算五篇人类撰写的种子论文在语义嵌入空间中的质心。探索距离随后量化为每个 AI 生成的创意与相应种子论文质心之间的余弦距离。距离越大,表明生成的创意偏离其起始文献越远。

前沿对齐。我们将前沿对齐定义为 AI 生成的创意与新兴研究方向相一致的程度。对于每个广泛的科学领域,我们将下一年的领域前沿定义为:从种子论文集发布年份之后一年内发表的人类撰写的论文中,提取出的出现频率最高的前 10% 的学术关键词集合 [cui2026aging]。为了获得统一的表示,我们使用一个大语言模型从 AI 生成的创意和人类撰写的论文中提取学术关键词。对于每个识别出的研究领域,我们将所有 AI 生成创意中提取的关键词汇总成一个单一的 AI 关键词集合。前沿对齐度随后计算为:同时出现在汇总的 AI 关键词集合中的前沿关键词所占的比例。前沿对齐度越高,表明 AI 生成的创意与未来的人类研究前沿契合度越高。

潜在科学影响力。我们基于语义相似的人类撰写论文的引用表现来衡量AI生成想法的潜在科学影响力[arts2025beyond]。由于AI生成想法本身没有引用记录,我们使用语义嵌入空间中邻近的人类撰写论文作为可观测的代理指标。我们首先为每篇人类撰写论文计算一个归一化引用分数,该分数相对于同一研究领域和发表年份的论文。然后,我们为每个AI生成想法找出20篇最邻近的人类撰写论文,并将其潜在影响力分数定义为这些邻居的平均归一化引用分数。影响力分数越高,表明AI生成想法位于科学图景中潜在影响力更高的区域。

4 实证分析

4.1 探索广度:AI想法比人类论文更集中

{tableorg}

[t] 按智能体框架和大语言模型划分的探索广度。探索广度首先在每个研究领域内计算,然后跨研究领域取平均值。AI列和Human列分别报告AI生成想法和对应人类撰写论文的平均探索广度。AI–Human表示AI生成想法与人类撰写论文之间的差异。方括号内报告95%自助法置信区间。组别 AI Human AI–Human [95% CI] 合并 所有数据 0.554 0.599 -0.045 [-0.049, -0.042] 按智能体框架 Agent Laboratory 0.541 0.599 -0.058 [-0.063, -0.053] AIScientist 0.548 0.599 -0.051 [-0.055, -0.046] Co-Scientist 0.563 0.599 -0.036 [-0.040, -0.030] ResearchAgent 0.570 0.599 -0.029 [-0.033, -0.025] 零样本 0.546 0.599 -0.053 [-0.058, -0.048] 按大语言模型 GPT-5.4 0.518 0.585 -0.067 [-0.080, -0.060] Gemma-4-31B-IT 0.562 0.599 -0.037 [-0.041, -0.032] Hermes-4-14B 0.553 0.599 -0.047 [-0.051, -0.041] Llama-3.1-8B 0.545 0.599 -0.054 [-0.059, -0.050] Qwen3-35B-A3B 0.572 0.599 -0.027 [-0.032, -0.023]

我们考察了每个已识别研究领域中 AI 生成想法的探索广度。作为对比,我们还测量了人类作者撰写的种子论文的探索广度。为确保公平比较,我们为每个 AI 生成的想法随机抽取一篇种子论文,使得人类和 AI 的集合包含相同数量的想法。

图 2a–b 显示了五个智能体框架和五个大语言模型之间的一致模式。同一研究领域内,AI 生成的想法彼此之间的相似度高于来自这些领域的人类作者论文。跨智能体框架平均后,AI 生成想法的广度为 0.554,人类作者论文为 0.599,这意味着 AI 生成想法的探索广度降低了 7.5%。

图 c–d 进一步显示,不同的大语言模型和智能体框架常常探索同一研究领域的重叠区域。在同一研究领域内,不同智能体框架生成的想法之间的平均探索广度为 0.572,而不同大语言模型生成的想法之间的平均探索广度为 0.570。这些平均值仍然低于人类同领域基线。在 12 个广泛科学领域中的 11 个中,领域层面的分析显示了相同的模式,数学是唯一的例外(见补充材料 S2.1 和表 S5)。

我们使用另一种基于质心的探索广度度量方法观察到了相同的模式。对于每个研究领域,AI 生成的想法比人类作者论文更接近其领域质心,这再次表明了一种更集中的探索模式(见补充材料 S2.2 和表 S6)。

4.2 探索距离:AI 想法紧贴其起始文献

接下来,我们考察 AI 生成想法的探索距离,以评估它们是超越了用于启动构思的种子文献,还是仍然局部锚定于这些文献。作为对比,我们考察了直接引用至少一篇种子论文的人类后续作者论文 [wu2019large]。这些后续论文代表了源自同一研究主题的后续人类研究。

图3比较了连续四个年度(2020-2021至2023-2024)中AI生成想法与后续人类论文的探索距离分布。在所有四个年度中,AI生成想法始终比后续人类研究更接近种子文献。每一年度,AI的分布都向更小的探索距离偏移,而后续人类论文则呈现出更广泛的分布,延伸至显著更大的距离。跨年度平均来看,AI生成想法的探索距离为0.322,而后续人类论文为0.410。领域层面的分析显示,所有十二个广泛科学领域均呈现相同模式,且每个领域的差异在统计上均保持显著(见补充材料S2.1及表S5)。这一结果表明,尽管所有被评估的AI智能体框架都能从Semantic Scholar数据库中搜索并检索相关文献,但AI生成的想法在很大程度上仍局限于局部探索。

{tableorg}

[t] 按年份、智能体框架和大语言模型划分的种子文献探索距离。探索距离首先针对每组种子论文进行计算,然后取各组种子论文的平均值。AI列和Human列分别报告AI生成想法的平均探索距离以及相应后续人类论文的平均探索距离。AI–Human表示AI生成想法与后续人类论文之间的差异。方括号内报告95%自助法置信区间。分组 AI Human AI–Human [95% CI] 按年份 所有年份 0.322 0.410 -0.088 [-0.092, -0.083] 2020-2021 0.318 0.399 -0.081 [-0.090, -0.072] 2021-2022 0.320 0.407 -0.087 [-0.097, -0.077] 2022-2023 0.322 0.411 -0.089 [-0.098, -0.079] 2023-2024 0.328 0.422 -0.093 [-0.103, -0.084] 按智能体框架 Agent Laboratory 0.382 0.410 -0.027 [-0.033, -0.022] AIScientist 0.320 0.410 -0.090 [-0.095, -0.085] Co-Scientist 0.328 0.410 -0.082 [-0.087, -0.077] ResearchAgent 0.313 0.410 -0.096 [-0.101, -0.091] 零样本 0.265 0.410 -0.144 [-0.149, -0.140] 按大语言模型 GPT-5.4 0.289 0.411 -0.121 [-0.142, -0.100] Gemma-4-31B-IT 0.314 0.410 -0.095 [-0.100, -0.091] Hermes-4-14B 0.318 0.410 -0.092 [-0.097, -0.087] Llama-3.1-8B 0.337 0.410 -0.072 [-0.078, -0.067] Qwen3-35B-A3B 0.319 0.410 -0.091 [-0.096, -0.086]

4.3 前沿对齐:AI想法与未来研究前沿的一致性较低

{tableorg}

[htbp] 基于智能体框架与大语言模型的次年领域前沿对齐度。首先计算每个广泛科学领域的前沿对齐度,然后跨领域取平均值。AI 列和 Human 列分别报告 AI 生成想法及对应后续人类论文的平均前沿覆盖率。AI–Human 表示 AI 生成想法与后续人类论文之间的差值。方括号内报告 95% 自助法置信区间。分组 AI 人类 AI–人类 [95% 置信区间] 前沿对齐度 全部数据 0.285 0.365 -0.080 [-0.085, -0.075] 按智能体框架 Agent Laboratory 0.250 0.377 -0.127 [-0.137, -0.117] AI Scientist v2 0.328 0.360 -0.032 [-0.041, -0.022] Co-Scientist 0.282 0.375 -0.093 [-0.104, -0.081] ResearchAgent 0.234 0.336 -0.102 [-0.111, -0.093] Zero-shot 0.331 0.377 -0.046 [-0.054, -0.038] 按大语言模型 GPT-5.4 0.073 0.142 -0.068 [-0.077, -0.060] Gemma-4-31B-IT 0.259 0.391 -0.131 [-0.140, -0.123] Hermes-4-14B 0.302 0.343 -0.041 [-0.049, -0.033] Llama-3.1-8B 0.363 0.391 -0.028 [-0.036, -0.021] Qwen3-35B-A3B 0.269 0.391 -0.122 [-0.132, -0.113]

接下来,我们考察 AI 生成想法的前沿对齐度,以评估它们是否与科学研究的未来方向一致。作为对比,我们测量了由人类撰写的、直接引用至少一篇种子论文的后续论文的前沿对齐度。为确保公平比较,在构建前沿关键词集时,这些后续论文被排除在次年语料库之外。AI 生成想法与人类后续论文平均提取的关键词数量相当(11.80 对 11.88)。

在多个研究领域中,AI 生成的创意覆盖了次年前沿关键词的 28.5%,而后续人类论文的这一比例为 36.5%。在所有被评估的研究领域中,这一差异均具有统计显著性。一个潜在的担忧是,大语言模型在种子文献发表后的论文上进行预训练可能引发信息泄露。为缓解这一问题,所有 AI 智能体均被限制只能检索构思时可获取的论文,从而明确禁止其访问未来出版物。尽管预训练的大语言模型仍可能隐式编码来自后续论文的知识,但 AI 生成的创意与前沿方向的契合度仍显著低于后续的人类研究。因此,所报告的差异很可能是保守估计。综合来看,这些结果表明,与人类研究者后续产出的工作相比,AI 生成的创意与未来研究方向的契合度较低。

4.4 潜在科学影响力:AI 创意位于科学图景中影响力较低的区域

接下来,我们考察 AI 生成创意的潜在科学影响力。作为对比,我们还测量了直接引用至少一篇种子论文的后续人类论文的科学影响力。对于人类撰写的论文,科学影响力通过按发表年份和研究领域归一化的引用次数来衡量。结果显示,AI 生成的创意获得的影响力评分低于后续人类论文。跨研究领域和研究年份取平均值,AI 生成创意的平均潜在影响力得分为 0.387,而后续人类论文为 0.492,比后续人类论文低 21.3%(表 4.4)。这一模式在 12 个被评估的科学领域中的 11 个领域均成立,数学是唯一一个差异不具有统计显著性的领域。

此外,我们通过对人类撰写的论文进行留一法分析,验证了基于邻域的潜在影响力代理指标。由相邻论文计算得出的潜在科学影响力得分,能够正向预测目标论文自身的标准化引用得分(Spearman 相关系数,详见补充材料 S2.3 节及表 S7),这支持了利用局部邻域来估算 AI 生成创意潜在影响力的有效性。

{tableorg}

[t] 按智能体框架和大语言模型划分的潜在科学影响力。首先针对每个研究领域和发表年份计算潜在科学影响力,然后按研究领域和年份取平均值。AI 列和 Human 列分别报告 AI 生成创意的平均潜在科学影响力得分,以及相应后续人类论文的真实标准化引用次数。AI–Human 表示 AI 生成创意与后续人类论文之间的差值。方括号内报告 95% 自助法置信区间。分组 AI Human AI–Human [95% CI] 合并全量数据 0.387 0.492 -0.105 [-0.114, -0.096] 按智能体框架 Agent Laboratory 0.411 0.492 -0.081 [-0.090, -0.073] AI Scientist v2 0.412 0.492 -0.081 [-0.089, -0.072] Co-Scientist 0.424 0.492 -0.068 [-0.076, -0.060] ResearchAgent 0.427 0.492 -0.065 [-0.074, -0.057] Zero-shot 0.423 0.492 -0.069 [-0.078, -0.061] 按大语言模型 GPT-5.4 0.472 0.464 0.008 [-0.029, 0.046] Gemma-4-31B-IT 0.441 0.492 -0.051 [-0.059, -0.043] Hermes-4-14B 0.393 0.492 -0.099 [-0.108, -0.091] Llama-3.1-8B 0.383 0.492 -0.109 [-0.118, -0.101] Qwen3-35B-A3B 0.450 0.492 -0.043 [-0.051, -0.035]

4.5 跨智能体框架与大语言模型的一致性

我们检验了上述四项发现在不同 AI 智能体框架及底层大语言模型之间是否保持一致(表 4.1–4.4)。总体而言,定性模式保持高度稳定。更复杂的智能体框架并未显著缩小 AI 生成创意与人类撰写研究在这四项指标上的差距,尽管在个别维度上出现了小幅改善。

例如,零样本基线是唯一无法访问语义学者搜索工具的框架,其探索距离差距最大,表明其生成的想法仍然最紧密地锚定于初始种子论文。能够检索额外文献的智能体框架缩小了这一探索距离差距,表明文献搜索有助于智能体超越初始种子上下文。然而,这种改进并未转化为显著更高的前沿对齐度或潜在科学影响力。因此,仅提供额外文献的访问权限并不能从根本上改变整体的探索模式。

在大语言模型中也观察到了类似的模式。GPT-5.4 是唯一一个生成想法所占据的语义邻域具有与后续人类研究相当潜在科学影响力的被评估模型。然而,GPT-5.4 探索的科学想法空间区域更窄,其前沿覆盖率也显著低于人类的后续工作。

综合来看,这些发现暗示了一个更广泛的含义。尽管所有被评估的 AI 智能体框架都明确被指示要生成新颖且高影响力的想法,许多框架通过迭代自我反思和优化来明确奖励新颖性,并且所有智能体框架都能主动搜索和检索相关先前文献,但当前的 AI 研究智能体在科学探索方面并未显著缩小与人类研究人员的差距。

4.6 AI 想法主要引入新方法而非研究问题

最后,我们考察了 AI 生成的想法是如何构建的。科学新颖性可能源于识别新的研究问题、开发新的技术方法,或以新颖方式重新组合现有想法 [luo2022combination, uzzi2013atypical]。因此,我们提示一个大语言模型将每个 AI 生成的想法标注为两个组成部分:一个研究问题,描述正在研究的科学问题;以及一个或多个方法,描述如何解决该问题。然后,我们将提取出的研究问题和方法与构思过程中使用的相应五篇种子论文中出现的研究问题和方法进行比较(详见补充材料 S1.2 和 S2.4)。

总体而言,AI 生成的创意很少引入全新的研究问题。仅有 10.5% 的 AI 生成创意包含了源文献中未出现的研究问题(图 4a-b)。相比之下,90.4% 的创意引入了源论文中未出现的新方法。这些结果表明,当 AI 生成的创意与先前工作存在差异时,这种差异主要源于对方法的修改或重组,而非识别新的科学问题。

有趣的是,AI 生成创意构建于先前工作的方式在不同科学领域存在差异(图 4c)。在工程与自然科学领域,包括计算机科学、数学、物理学、化学、材料科学与工程,AI 生成的创意几乎总是保留现有的研究问题,其明显的差异主要来自新方法或方法的重组。相比之下,社会学与商学领域展现出显著更高的新研究问题比例,以及相应更低的新方法比例。这种模式与这些领域的本质特征相符:新兴的社会与商业现象频繁催生新的研究问题,而工程与自然科学领域的创新则更多体现为用新方法解决既有问题。

5 讨论与启示

这项研究建议对当前 AI 研究智能体应持更为审慎的解读。近期研究在科学构思中引入了日益复杂的智能体机制,包括自我反思、分阶段验证、角色分解以及多智能体协商 [lu2026towards, baek2025researchagent, schmidgall2025agent]。这些机制能够提升所生成研究提案的连贯性与合理性。然而,我们的研究结果表明,此类能力并不一定能转化为更广泛的科学探索。尽管这些 AI 智能体被明确要求提出新颖、高影响力或不同于以往工作的想法,但 AI 生成的想法在分布上仍比人类撰写的研究更为集中,相较于后续人类跟进工作更贴近起始文献,与未来研究前沿的契合度更低,且预估的科学影响力也更小。

这一区别之所以重要,是因为科学发现不仅关乎产生合理的想法,更在于探索可能想法的空间。人类的科学进步往往涉及超越既定方向、探索较为陌生的领域,有时甚至需要重新定义研究问题本身 [foster2015tradition, uzzi2013atypical, fortunato2018science]。从这个角度来看,当前的 AI 研究智能体似乎更擅长局部细化而非探索。我们的研究结果还表明,日益复杂的智能体 AI 框架以及扩展大语言模型,并不能从根本上解决这一局限。

更广泛地说,我们的研究结果指向了 AI 辅助科学发现未来将面临的一项挑战。核心问题可能不仅在于 AI 系统能否生成连贯的科学想法,更在于它们能否帮助拓展科学方向的范围。随着 AI 研究智能体越来越深入地融入科学工作流程,设计能够拓宽科学探索范围的智能体 AI 系统将变得愈发重要。

Refer to caption
图 3:AI 生成的创意相较于后续人类研究,仍更接近种子文献。图中展示了连续四个年份对中,AI 生成创意(蓝色)与后续人类论文(红色)的探索距离分布。横轴表示探索距离,第二个横轴表示仅用于可视化的第一残差主成分。彩色竖线表示各组均值。
Refer to caption
图 4:AI 生成创意相对于种子文献所引入的新研究问题与方法。(a–b)按智能体框架划分,AI 生成创意中引入相应种子文献中未出现的新研究问题或方法的占比。(c)按领域划分,AI 生成创意中引入新研究问题与新方法的占比。

参考文献

补充信息

S1 补充方法

S1.1 数据来源与研究领域构建

概述。

我们利用文献耦合来识别研究领域。其主要思路是,研究相关问题的论文倾向于引用相同的先前工作。因此,我们通过每篇论文引用的参考文献来表征该论文,将这些高维的参考文献特征转化为紧凑的论文嵌入向量,并对具有相似嵌入向量的论文进行聚类。

语料库与元数据。

我们从 Semantic Scholar 学术图谱(网址:https://www.semanticscholar.org/product/api)收集论文及其引用链接。原始论文索引包含标题、发表年份、摘要、引用次数、参考文献数量、发表刊物、作者、外部标识符以及 Semantic Scholar 研究领域。主要的创意分析使用了 12 个领域,这些领域在经过领域层面的质量检查后,其标题和上下文具有足够的连贯性,包括医学、生物学、工程学、化学、计算机科学、环境科学、材料科学、物理学、数学、经济学、商学和社会学。我们使用 2020 年之前发表的论文来构建文献耦合表征。我们在主要分析中使用 2020 年至 2025 年间发表的论文。表 S1 总结了本研究所使用的 Semantic Scholar 语料库。

媒体内容 · 前往原文查看
表 S1:主要分析中使用的 Semantic Scholar 语料库及抽样创意输入摘要。
数量 数值
论文索引中保留的语义学者论文 149,405,218
用于上下文构建的论文 75,019,333
主要创意分析中使用的领域 12
研究年份 2020–2025
选定的研究领域 155
种子论文集 11,520

用于论文表示的文献耦合。

我们在每个广泛学科内分别构建研究领域。对于给定领域,设其论文集合为,其引用的语料库论文集合为。

我们按照文献耦合的逻辑 [kessler1963bibliographic],通过每篇论文的参考文献来表示该论文:引用重叠先前文献的论文往往处理相关的问题。在矩阵公式下,如果表示论文–参考文献矩阵,则标准文献耦合矩阵由下式给出

其中每个条目计算两篇论文共同引用的参考文献数量。原始耦合矩阵捕捉了共享的引用结构,但它对所有参考文献一视同仁。在实践中,一些被高度引用的论文(例如,广泛使用的优化方法或基础架构)被许多不相关的研究领域引用,因此它们提供的主题相似性证据相对较弱。

因此,对于每个领域,我们直接从论文–参考文献矩阵构建论文引用嵌入向量。为了减少广泛引用参考文献的影响,我们通过逆文档频率项对每个参考文献列进行加权,使得被许多论文引用的参考文献获得较低权重,而更具领域特异性的参考文献获得较高权重。加权后的行向量经过 L2 归一化,使用截断 SVD 投影到维度,并再次进行 L2 归一化,以生成用于后续研究领域识别的文献耦合嵌入向量。

研究领域识别。

研究领域通过对2020–2025年间发表的论文进行聚类来识别。在每个学科内,对嵌入向量应用MiniBatchKMeans [sculley2010web] 以获取候选的引文定义领域,并将论文分配到其最近的聚类中心。我们使用MiniBatchKMeans,因为每个学科的语料库包含数百万篇论文,需要一种可扩展的聚类方法,且该方法能一致地应用于所有被分析的学科。我们仅保留那些在2020年至2025年每个研究年份都有论文的活跃领域。这一纵向筛选得到了11520组种子论文,覆盖了12个被分析学科中的155个不同研究领域。表S2总结了每个学科中选定研究领域的数量及示例。

媒体内容 · 前往原文查看
表S2:按学科划分的已识别研究领域。
学科 领域数量 代表性选定领域
生物学 10 拟南芥遗传学;干细胞分化;卵母细胞成熟;干细胞培养;进化合作;微生物群落组装
商学 19 供应链;保险理赔;供应商选择;数字平台;直播;新冠疫情商业中断;财务报告
化学 13 DNA折纸术;金纳米颗粒;电子结构;离子迁移脂质组学;脂质膜;分子光谱学;高分子材料
计算机科学 9 认知无线电网络;纠错码;图像融合;教育AI系统;机器学习应用;网络化智能体;统计评估
经济学 18 合成控制法;时间序列预测;倾向得分方法;数字货币;工具变量;处理效应;金融风险
工程学 12 道路交通系统;蚁群优化;卫星通信;光遗传学控制;电力系统稳定性;结构监测;无线网络
环境科学 11 贝叶斯生态建模;寄生虫群落;持久性污染物;重金属污染;废水处理;微生物生态学;森林治理
材料科学 14 单层石墨烯;金纳米颗粒;第一性原理材料建模;锂离子电池;氧化铁;纳米复合材料;薄膜
数学 10 部分双曲动力学;映射类群;最小二乘估计;巴拿赫空间;单群;偏微分方程;随机过程
医学 9 代谢综合征;体力活动;胰腺癌;传染病;寄生虫;身体质量指数;生物标志物;临床风险因素
物理学 15 量子模拟;非线性波动方程;原子重力测量;太阳日冕物质抛射;光子晶体;有限元方法;重离子碰撞
社会学 15 社会经济地位;计划生育;集体效能;老龄化;老年人;原住民社区;社会不平等;公共卫生行为
总计 155

S1.2 利用 AI 智能体生成科学想法

本附录提供了正文中所述构思实验的额外实现细节。

种子论文上下文。

我们在各研究领域抽取了 11,520 组种子论文集,每个领域每年抽取 8 个研究子领域,并在 2020–2025 研究年份内每个子领域抽取 20 篇锚定论文。每组包含五篇论文:一篇锚定论文和四篇来自同一研究子领域的相关论文。相关论文选自不晚于锚定论文年份的论文。在给定运行中,所有智能体框架接收相同的五篇论文上下文,且该上下文仅包含论文标题和摘要。

AI 研究智能体框架。

我们评估了五种 AI 研究智能体框架。零样本智能体一次性接收五篇论文的上下文,直接生成一个研究思路。AIScientist 接收相同的上下文,生成初始思路,然后通过自我反思轮次进行优化。在本研究中,我们仅评估 AIScientist [lu2026towards] 的这个构思阶段,并未运行其后续的实验执行树搜索阶段。ResearchAgent [baek2025researchagent] 使用相同的五篇论文上下文来提出研究问题、开发方法并设计实验,在最终选择之前由验证智能体对中间输出进行评分。AgentLaboratory [schmidgall2025agent] 将相同的文献上下文作为简短的文献综述接收,并使用基于角色的智能体(包括博士后智能体和博士生智能体)之间的对话来制定最终研究计划。Co-Scientist [gottweis2026coscientist] 基于该框架已发表的描述实现:多个智能体生成、反思、排序、进化并综合相互竞争的假设,最后进行元评审。

提示词与工具。

本节记录了用于生成思路的提示词和工具。每个系统都接收来自时间点之前可用论文库中的相同五篇论文标题和摘要,但各系统在如何将这些证据转化为提案方面有所不同。零样本提示使用一个直接的 JSON 提示。AIScientist 使用迭代构思和反思,并配有文献搜索命令。ResearchAgent 使用独立的问题、方法和实验阶段。AgentLaboratory 使用基于角色的智能体之间的对话来生成最终计划。Co-Scientist 使用监督解析、文献搜索、假设生成、反思、锦标赛排序、进化和元评审阶段。

提示词列表中的占位符 `{five_paper_literature_context}` 表示运行时使用的五篇论文上下文。它是一个编号列表,仅包含每篇种子论文的标题和摘要。对于零样本基线,这个渲染后的代码块直接插入到用户消息的开头。对于 AIScientist,相同的渲染代码块作为 `{workshop_description}` 传递给初始想法生成提示词。对于 ResearchAgent,第一篇种子论文通过原始实现的主论文字段传递,其余四篇种子论文作为参考文献传递,实体列表留空;我们的封装器也为简化的回退提示词保留了完整的五篇论文列表。对于 AgentLaboratory,这五篇论文被转换为精简后的文献综述字段,展示给博士后和博士生智能体。对于 Co-Scientist,这五篇论文作为初始研究目标和文献上下文传递给主管阶段。后续阶段则使用解析后的研究问题、检索到的文献和中间假设。列表中的其他花括号字段由同一智能体运行中早期阶段的中间输出填充。

执行协议。

每次生成运行都从一个种子论文集、一个智能体框架和一个大语言模型开始。零样本基线会进行一次单一模型调用,并返回该次调用的 JSON 创意。AIScientist 首先在创意生成提示词中接收五篇论文的上下文,然后运行五轮创意构思与反思;在每一轮中,模型要么执行 SearchSemanticScholar 动作,要么返回 FinalizeIdea 动作。搜索动作由本地文献搜索封装器提供,该封装器仅检索在时间点之前可用的论文,因此智能体永远不会观察到评估期内的后续论文。ResearchAgent 按顺序运行三个阶段:问题识别、方法开发和实验设计。在完整的 ResearchAgent 路径中,每个阶段都会生成并经过两轮验证,得分最高的候选方案会进入下一阶段。AgentLaboratory 从博士后智能体开始,在博士后和博士生角色之间交替进行最多八步的方案制定步骤,并将博士后的 PLAN 指令作为最终创意。Co-Scientist 首先从共享文献上下文中生成相互竞争的假设,对每个假设进行反思,对候选方案进行排序,然后通过元评审阶段撰写最终的综合性提案。如果某个智能体未能生成所需的最终结构化输出,则该次运行被标记为无效,并通过下面的有效性过滤器排除。

提示词列表。

这些方框重现了生成运行中使用的提示词文本。对于具有多个阶段的系统,方框按照生成过程的相同顺序排列。

零样本基线。

AIScientist。

我们使用了原始的 AIScientist 创意构思设置,该设置包含一个系统提示词、一个创意生成用户提示词和一个反思用户提示词。智能体运行五轮创意构思和反思。它可以调用

SearchSemanticScholar

,然后通过

FinalizeIdea

来最终确定一个创意。提示词将此文献搜索命令命名为

SearchSemanticScholar

;在我们的运行中,该命令从我们的本地论文语料库中返回论文,且仅限于在时间点之前可用的论文。

AIScientist 系统提示词。

AIScientist 创意生成用户提示词。

AIScientist 反思用户提示词。

ResearchAgent。

ResearchAgent 通过三个阶段来构思想法:问题识别、方法开发和实验设计。每个阶段都使用一个角色特定的系统提示词和一个用户提示词。经过评估的 ResearchAgent 想法,是由生成的问题、方法和实验计划构建而成的。

ProblemIdentifier 系统提示词。

ProblemIdentifier 用户提示词。

MethodDeveloper 系统提示词。

MethodDeveloper 用户提示词。

ExperimentDesigner 系统提示词。

ExperimentDesigner 用户提示词。

Validator 系统提示词。

AgentLaboratory。

AgentLaboratory 在制定计划时,使用博士后智能体与博士生智能体之间的对话。我们评估在此阶段产生的最终

PLAN

命令。在我们的设定中,这个计划制定阶段会使用所提供的文献背景和对话历史。

共享推理模板。

博士后角色描述与阶段提示词。

博士后命令描述。

博士生角色描述与阶段提示词。

博士生命令描述。

Co-Scientist。

Co-Scientist 遵循已发布的“生成–辩论–进化”工作流程。一个监督智能体解析研究目标和搜索查询;生成智能体提出假设;反思智能体对其进行批判;排序智能体根据新颖性、重要性、可行性和可测试性对假设进行比较;进化智能体修改排名靠前的假设;最后,一个元评审智能体综合形成最终提案。

Co-Scientist 监督提示词。

Co-Scientist 生成提示词。

Co-Scientist 反思提示词。

Co-Scientist 排序提示词。

Co-Scientist 进化提示词。

Co-Scientist 元评审提示词。

为了确保可复现性,我们为每次运行存储了渲染后的提示词文本、原始模型响应、解析后的动作以及中间阶段的输出。

输出标准化。

被评估的 AI 研究智能体框架生成的输出格式差异显著,包括结构化的 JSON 想法、分阶段的研究提案、Markdown 格式计划以及多智能体对话记录。在分析之前,我们首先将每个框架的输出转换为标准化的生成想法文档。对于 Zero-shot、AIScientist 和 Co-Scientist,我们使用生成的标题(或名称)、假设以及类似摘要的提案文本。对于 ResearchAgent,我们使用提出的研究问题和方法。对于 Agent Laboratory,我们使用最终研究计划中的主要提案部分。这种标准化处理为每个生成的想法提供了统一的文本表示形式。

尽管生成的想法已被标准化为通用的文本格式,但它们与人类撰写的论文(以标题和摘要表示)相比仍存在异质性。为了实现统一比较,我们进一步将 AI 生成的想法和人类撰写的论文,按照近期科学文章关键见解提取方法 [song2025scientific],转换为通用的学术标注模式。具体来说,我们提示 Gemma-4-31B-IT 为每份文档提取目标、动机、研究问题、技术方法和学术关键词。提取出的研究问题和技术方法被拼接起来,并编码到本文所使用的共享语义嵌入空间中。

提取提示词如下所示:

想法生成与有效性过滤。

针对 11,520 组种子论文集,我们在五种 AI 智能体框架下评估了四个开源大语言模型,共进行了 230,400 次生成运行。由于预算限制,使用专有模型 GPT-5.4 进行的实验仅针对从 2022 年随机抽样的种子论文集,额外产生了 2,400 次生成运行。本研究总共包含了 232,800 次 AI 想法生成运行。

接下来我们应用有效性过滤,以剔除未成功生成的方案。如果智能体成功完成运行,并生成了非空的结构化输出,且能从该输出中提取出研究思路,则该次生成运行被视为有效。未能完成运行、返回无法解析的结构化输出或生成空白的最终提案的运行均被排除。经过此过滤,我们从 232,800 次生成运行中获得了 219,655 个有效的 AI 生成思路,对应有效率为 94.4%。

表 S3 按发表年份、AI 智能体框架和大语言模型汇总了生成运行次数和有效思路数量。表 S4 展示了在相同种子论文集下,使用 Gemma-4-31B-IT 在不同智能体框架下生成的代表性 AI 思路。

媒体内容 · 前往原文查看
表 S3:按研究年份、智能体框架和大语言模型划分的构思设计明细。
维度 类别 生成运行次数
总体
开放权重模型运行总数 230,400
GPT-5.4 子集运行次数 2022 年代表性子集 2,400
生成运行总数 开放权重模型 + GPT-5.4 232,800
AI 生成思路总数 有效输出 219,655
按年份划分(1,920 个种子集 × 5 个智能体 × 4 个大语言模型)
2020 1,920 个种子集 38,400
2021 1,920 个种子集 38,400
2022 1,920 个种子集 38,400
2023 1,920 个种子集 38,400
2024 1,920 个种子集 38,400
2025 1,920 个种子集 38,400
按智能体划分(11,520 个种子集 × 4 个大语言模型)
Agent Laboratory 1 个智能体 46,080
AIScientist 1 个智能体 46,080
ResearchAgent 1 个智能体 46,080
Co-Scientist 1 个智能体 46,080
零样本 1 个智能体 46,080
按大语言模型划分(11,520 个种子集 × 5 个智能体)
Gemma-4-31B-IT 开放权重 57,600
Llama-3.1-8B 开放权重 57,600
Hermes-4-14B 开放权重 57,600
Qwen3-35B-A3B 开放权重 57,600
GPT-5.4 专有模型 2,400
媒体内容 · 前往原文查看
表 S4:AI 生成思路示例。使用 Gemma-4-31B-IT 作为大语言模型。
智能体 生成的思路
2025 年运行 1:长程图表示学习。通过随机游走学习图上的长程依赖 [chen2025learning];Polynormer [deng2024polynormer];经典 GNN 是强基线 [luo2024classic];扩散至顶端 [lin2025diffusing];在异质性下预测全局标签关系矩阵 [liang2023predicting]。
零样本 PolyWalker。用多项式表达能力的线性注意力机制替代随机游走序列编码器,以高效捕获图上的长程依赖关系。
AIScientist GraphMamba。利用选择性状态空间模型处理随机游走序列,以线性内存规模扩展长程图依赖建模。
ResearchAgent PolyWalk-LR。结合了局部消息传递、随机游走嵌入、多项式注意力机制以及低秩全局标签关系矩阵。
Agent Lab。 PolyDiff-GNN。为经典GNN添加即插即用的多项式扩散层,无需图Transformer的计算成本即可建模多跳依赖关系。
Co-Scientist AdaptiveWalk-GNN。学习节点自适应门控机制,融合随机游走序列特征、多项式扩散尺度与局部消息传递,并采用标签关系正则化处理异配图。
2025年第二轮运行:因果视觉推理与工具使用智能体。NarrativeBridge [nadeem2025narrativebridge];CS-Bench [song2025csbench];TACT [caciularu2024tact];VisMin [awal2024vismin];GTA:通用工具智能体基准 [wang2024gta]。
零样本 CausalVisTool。将因果时序视频叙事与工具使用评估相结合,检验多模态智能体是否保持因果一致性。
AIScientist Counterfactual-VideoBench。将因果视频理解转化为反事实干预基准测试,检验视觉语言模型是否依赖时序相关性。
ResearchAgent MATR。在感知-聚合-执行流水线中,将细粒度视觉感知、聚合信息提取与工具执行相连接。
Agent Lab。 CCTR。通过要求智能体将动态视觉事件与正确的工具操作及反事实变体相关联,评估因果工具推理能力。
Co-Scientist InterveneBench。将经过最小编辑的反事实视频与可执行工具轨迹配对,测试当因果事件发生变化而无关视觉内容保持不变时,智能体是否会修正工具选择。

S1.3 探索度量的定义

本节对正文中引入的四种度量进行形式化定义。每个AI生成的想法或人类撰写的论文均以其标准化文本表示,我们据此计算文本嵌入向量并提取学术关键词。下文中, 表示某个想法或论文 的L2归一化嵌入向量。本文采用Qwen3-Embedding-4B [zhang2025qwen3]作为文本嵌入模型。

探索广度衡量一组想法或论文在同一研究领域内的传播广泛程度。设集合包含来自该研究领域的 AI 生成想法或人类撰写的论文。广度是这些元素之间成对余弦距离的平均值。

正文中报告的值是将该指标在各比较组(按整体、按智能体框架或按大语言模型)的研究领域内进行平均后得到的结果。

探索距离衡量一个想法或论文偏离种子文献的程度。每次生成运行都从一组五篇种子论文开始,这些论文由归一化质心进行概括。

来自某次运行的 AI 生成想法,以及引用该运行中至少一篇论文的后续人类论文,根据它们与该质心的余弦距离进行评分。

因此,那些与种子文献保持接近的想法和论文会获得较小的距离值。

前沿对齐衡量一组想法或论文覆盖下一年度热门主题的程度。对于特定领域和种子年份,下一年度的前沿是指在该领域于该年份发表的人类论文中,出现频率最高的前 10% 学术关键词集合,但不包括被评估的后续论文。对于每个比较组,从其想法或论文中提取的关键词被汇集为一个集合,前沿对齐度就是该集合所覆盖的前沿关键词所占的比例。

潜在科学影响力衡量一个想法或论文是否接近其研究领域中历史上具有影响力的部分。来自特定研究领域和发表年份的每篇人类论文都会获得一个归一化的引用分数。

其中,是该论文的引用次数,是同一领域和年份其他论文的值的留一法平均值。一个 AI 生成想法或后续人类论文的潜在科学影响力,是其在同一领域中最邻近人类论文的平均分数。

其中,包含通过余弦相似度找到的最邻近论文,且这些论文的发表时间不晚于种子年份。

S2 补充讨论

S2.1 按科学领域划分的结果

正文报告了12个广泛科学领域的平均结果。此处我们展示所有四项指标的学科层面结果。对于每项指标,所报告的差距定义为AI生成想法得分减去对应人类论文得分。因此,负值表示AI生成想法在探索广度、探索距离、前沿对齐或潜在科学影响力方面低于对应的人类撰写论文。详细结果见表S5。

媒体内容 · 前往原文查看
表S5:学科层面结果。每项差距计算为AI生成想法得分减去对应人类论文得分。因此,负值表示AI生成想法在探索广度、探索距离、前沿对齐或潜在科学影响力方面低于人类撰写论文。各学科按影响力差距从大到小排列。
学科 广度差距 距离差距 前沿差距 影响力差距
计算机科学 -0.032∗∗ -0.069∗∗ -0.068∗∗ -0.161∗∗
商学 -0.041∗∗ -0.059∗∗ -0.084∗∗ -0.143∗∗
社会学 -0.045∗∗ -0.037∗∗ -0.119∗∗ -0.109∗∗
材料科学 -0.024∗ -0.086∗∗ -0.103∗∗ -0.101∗∗
工程学 -0.047∗∗ -0.079∗∗ -0.066∗∗ -0.089∗∗
化学 -0.027∗∗ -0.072∗∗ -0.066∗∗ -0.065∗∗
环境科学 -0.030∗ -0.052∗∗ -0.071∗∗ -0.058∗∗
医学 -0.025∗ -0.040∗∗ -0.141∗∗ -0.050∗∗
经济学 -0.041∗∗ -0.083∗∗ -0.039∗∗ -0.037∗
物理学 -0.023∗∗ -0.056∗∗ -0.050∗∗ -0.032∗
生物学 -0.028∗∗ -0.088∗∗ -0.052∗∗ -0.028∗
数学 0.008 -0.045∗∗ -0.101∗∗ -0.006

S2.2 稳健性检验:基于质心的探索广度度量

我们使用一种替代的基于质心的方法来度量探索广度。对于每个研究领域和每个比较组(即由特定智能体框架、大语言模型和发表年份生成的AI想法),我们计算语义嵌入的归一化质心,并测量每个AI生成想法与其对应质心之间的余弦距离。距离越大表示探索广度越大,而距离越小表示论文或想法更紧密地集中在其研究领域的质心附近。

表 S6 报告了各 AI 智能体框架和大语言模型下的质心距离统计结果。与主要的成对相似性分析一致,AI 生成的想法相比人类撰写的论文,仍然更接近其所在领域的质心。这一模式适用于每个智能体框架和每个大语言模型,包括 Co-Scientist 和 GPT-5.4。

媒体内容 · 前往原文查看
表 S6:探索广度的基于质心的稳健性检验。距离为到归一化领域内质心的余弦距离。数值越低表示集中程度越高。
组别 平均距离 中位距离
AI 想法 0.340 0.335
人类论文 0.362 0.355
按智能体框架划分的 AI 想法
零样本 0.319 0.314
AIScientist 0.320 0.315
ResearchAgent 0.338 0.329
Agent Lab. 0.319 0.315
Co-Scientist 0.334 0.326
按大语言模型划分的 AI 想法
Llama-3.1-8B 0.319 0.314
Hermes-4-14B 0.325 0.318
Gemma-4-31B-IT 0.332 0.328
Qwen3-35B-A3B 0.340 0.335
GPT-5.4 0.303 0.298

S2.3 潜在科学影响力指标的验证

我们使用 AI 生成想法在语义空间中最邻近的 20 篇人类论文的平均归一化引用分数,来估算其潜在科学影响力。在此,我们通过针对人类撰写的论文进行留一法分析,来验证这种基于邻域的影响力指标。具体来说,对于每篇目标人类论文,我们移除该目标论文本身,然后计算同一研究领域中,与其最邻近的 20 篇先前人类论文的平均归一化引用分数。接着,我们检验这个基于邻域的影响力分数是否能预测目标论文自身的归一化引用分数。

表 S7 显示,基于邻域的影响力分数与目标论文后续的引用表现呈正相关(斯皮尔曼相关系数 ,皮尔逊相关系数 ;两者均 )。因此,位于历史上引用影响力较高的语义邻域中的论文,其自身也更有可能成为高被引论文。尽管局部语义邻域只能解释引用结果的部分变异,但这些结果支持将邻域引用统计数据用作估算 AI 生成想法潜在科学影响力的代理指标。

媒体内容 · 前往原文查看
表 S7:人类论文中影响力评分的验证。每篇目标论文的评分,取自其所属研究领域中,与该论文最邻近的 20 篇已有人类论文的平均引用分数。
指标 数值
已评估的人类论文数量 16,500
平均邻近论文数量 19.9
斯皮尔曼相关系数 0.155∗∗
皮尔逊相关系数 0.166∗∗

S2.4 研究问题与方法标注的验证

第 4.6 节的分析依赖于识别每个 AI 生成想法的研究问题和技术方法,并判断它们是否已存在于对应的五篇种子论文中。为评估此标注流程的可靠性,我们遵循近期关于大语言模型标注可靠性的研究工作 [gilardi2023chatgpt],采用独立的基于大语言模型的验证方法。

具体而言,三位独立的大语言模型标注者,包括 Qwen-30b、Llama-8B 和 Gemma-31B,被给予相同的 AI 生成想法及其对应的五篇种子论文。每位标注者独立判断该生成想法是否引入了(i)种子文献中不存在的研究问题,以及(ii)种子文献中不存在的技术方法。表 S8 总结了三位标注者之间的一致性。对于研究问题和研究方法的判断,一致性均很高。三位标注者在 74.0% 的研究问题标签和 77.6% 的技术方法标签上达成一致。两两之间的一致性范围在 80.8% 到 89.9% 之间,而尽管存在类别不平衡,Gwet 的 AC1 系数在两项任务上均超过 0.77。这些结果表明,判断一个 AI 生成的想法相对于种子文献是否引入了新的研究问题或新方法,是一项可靠的标注任务。

媒体内容 · 前往原文查看
表 S8:三位大语言模型标注者在“新问题”和“新方法或新途径”标签上的一致性。每位标注者将生成的想法与相同的五篇种子论文进行比较。数值基于具有有效标签的生成想法的共同集合计算得出。报告 Gwet 的 AC1 系数是因为两个二分类标签均存在不平衡 [gwet2002kappa]。
一致性指标 研究问题 方法
三位标注者全部一致 74.0% 77.6%
Gwet 的 AC1 系数 0.771 0.809
Qwen 30B 与 Llama 8B 对比 82.7% 80.8%
Qwen 30B 与 Gemma 31B 对比 82.9% 84.5%
Llama 8B 对比 Gemma 31B 82.3% 89.9%

来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org