HuggingFace Daily Papers(社区热门论文)·· 2026-04-20精选AI 评分70
AI科学家产生结果却不进行科学推理
AI scientists produce results without reasoning scientifically
AI 导读
一项针对LLM科学智能体的评估通过25,000余次运行发现,基础模型贡献了解释方差的41.4%,而脚手架仅占1.5%。数据显示,68%的推理轨迹忽略证据,仅26%出现反驳驱动的信念修正,且趋同多测试证据罕见。这些认知缺陷在工作流执行或假设探究中均存在,即使提供成功推理示例也无法改善。当前智能体虽能执行科学工作流,但不具备自我修正的科学推理模式,且基于结果的评估无法检测此类失败。
推荐理由
这篇论文给所有‘AI科学家’泼了冷水,LLM代理能跑出结果但根本不按科学推理来,证据忽视率68%,靠评估结果根本看不出问题,做科研自动化的该重新审视了。
正文 · AI 翻译
摘要:基于大语言模型的系统正越来越多地被部署用于自主开展科学研究,然而,它们的推理过程是否遵循使科学探究具备自我修正能力的认知规范,目前尚不明确。在此,我们通过超过 25,000 次智能体运行,并借助两个互补视角——(i) 将基础模型与智能体框架的贡献进行分解的系统性性能分析,以及 (ii) 对智能体推理认知结构的行为分析——对基于大语言模型的科学智能体在八个领域(涵盖工作流执行到假设驱动型探究)进行了评估。我们观察到,基础模型是性能和行为的首要决定因素,其解释的方差占比为 41.4%,而框架仅为 1.5%。在所有配置中,68% 的追踪记录忽略了证据,基于反驳的信念修正仅占 26%,且汇聚多重测试证据的情况极为罕见。无论智能体执行的是计算工作流还是进行假设驱动型探究,都呈现出相同的推理模式。即使智能体在上下文中获得了近乎完整的成功推理轨迹,这些模式依然存在,并且在认知要求较高的领域中,由此产生的不可靠性会在重复试验中不断累积。因此,当前基于大语言模型的智能体能够执行科学工作流,但并未展现出表征科学推理的认知模式。基于结果的评估无法检测到这些失败,而仅靠框架工程也无法修复它们。在推理本身成为训练目标之前,此类智能体产生的科学知识无法通过其生成过程得到合理证明。
| 主题分类: | 人工智能 (cs.AI);材料科学 (cond-mat.mtrl-sci);机器学习 (cs.LG) |
| 引用方式: | arXiv:2604.18805 [cs.AI] |
| (或本版本 arXiv:2604.18805v1 [cs.AI]) | |
| https://doi.org/10.48550/arXiv.2604.18805 arXiv 通过 DataCite 发布的 DOI |
提交历史
来自:Kevin Maik Jablonka [
2026 年 4 月 20 日,星期一,20:23:42 UTC (6,053 KB)
访问论文:
![]()
当前浏览上下文:
凝聚态物理
凝聚态物理 - 材料科学
参考文献与引用
书签
![]()
书目与引用工具
本文相关的代码、数据与媒体
演示
推荐与搜索工具
arXivLabs:与社区合作者共同开展的实验性项目
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org