EurekAgent:环境工程化实现自主科学发现
EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery
EurekAgent 是一个环境工程化的大语言模型智能体系统,专为度量驱动的自主科学发现设计。它从权限工程(可控执行与隔离评估)、产物工程(文件系统与 Git 协作)、预算工程(成本感知探索)和人在回路工程(简便监督干预)四个维度构建执行环境。EurekAgent 在数学、内核工程和机器学习任务上取得新 SOTA,包括以不到 11 美元总 API 成本发现新的 26 圆填充结果。代码与结果已开源。
EurekAgent 把科学发现的目光从设计智能体流程转向环境工程,用不到 11 美元就找到了新的圆打包纪录,这可能是低成本自主科研的转折点。
艾米·辛
,萧建宁
,王俊杰
,姚子钧
张凡锦
,宋健
,侯磊
,李涓子
清华大学计算机科学与技术系
中国人民大学信息学院
{xin-x25, xiaojn25}@mails.tsinghua.edu.cn
摘要
基于大语言模型的智能体在自动化科学发现方面展现出日益增长的潜力。给定一个可优化的指标和一个执行环境,它们能够提出、验证并迭代科学解决方案,并且已经产生了超越人类设计方法的结果。随着模型能力的持续提升,我们认为,自主科学发现的瓶颈正从规定智能体工作流转向设计智能体环境——即塑造智能体行为的资源、约束和接口。我们将此定义为环境工程:构建能够放大有益行为(如开放式探索、系统性工件管理和智能体间协作)的环境,同时抑制有害行为(如奖励作弊和高摩擦的人工监督)。我们提出了 EurekAgent,一个用于指标驱动型自主科学发现的环境工程化智能体系统。EurekAgent 从四个维度对环境进行工程化设计:用于限定智能体执行和隔离评估的权限工程;用于基于文件系统和 Git 协作的工件工程;用于预算感知探索的预算工程;以及用于便捷人工监督和干预的人机协同工程。EurekAgent 在多项数学、内核工程和机器学习任务上取得了新的最先进成果,包括在总 API 成本低于 11 美元的情况下发现了新的 26 圆填充最先进结果。我们开源了代码和结果,并呼吁将环境工程作为开发可靠自主研究智能体的核心研究方向。
| 数学 | 内核工程 | 机器学习 | |||
| 圆填充 () | 埃尔德什最小重叠 () | 一阶自相关不等式 () | TriMul () | MLE-Bench () | |
| 此前最佳人类 | 2.634[5] | 0.380927[7] | 1.509730[18] | 不适用 | |
| 此前最佳 AI | 2.635986[27] | 0.380876[30] | 1.502863[30] | [30] | 71.43%[31] |
| EurekAgent | 2.635999 | 0.380870 | 1.502861 | 2005.03 µs | 85.71% |
1 引言
大语言模型正日益将科学发现从人工试错转变为计算探索:在研究进展可通过可优化指标来衡量的领域中,基于大语言模型的智能体能够自主提出假设、运行实验、观察反馈并迭代解决方案,从而在方法调优中减少人力投入,同时大幅扩大探索规模。基于大语言模型的智能体已在数学、算法、内核工程和机器学习工程等多个领域的任务中取得了显著成果(Jiang 等人,2025;Novikov 等人,2025;Lange 等人,2025;Wang 等人,2025;Yuksekgonul 等人,2026;Ouyang 等人,2025;Chan 等人,2025;Yang 等人,2025;Zhang 等人,2026;Li 等人,2025)。我们将其视为科学研究中一种新兴的范式转变:人类越来越专注于选择有价值的方向、制定有意义的指标以及监督有效性,而智能体则负责执行大规模的方法探索。
大多数现有的自主研究系统通过预设研究专用的智能体工作流来实现这一愿景。诸如 AlphaEvolve 之类的进化系统会显式维护候选程序的种群,并利用评估器的反馈来指导变异与选择(Novikov 等人,2025;Lange 等人,2025;Liu 等人,2026b)。诸如 AIDE 之类的机器学习系统则围绕解树、反馈循环和角色专业化智能体来组织探索过程(Jiang 等人,2025;Yang 等人,2025)。较新的系统引入了结构化辩论、周期性自我审查和自我学习模块(Liu 等人,2026a;Qu 等人,2026)。虽然这些设计可能有效,但它们也编码了关于研究应如何进行的强烈假设。随着像 Claude Code 和 Codex 这样的通用编码智能体变得更强,近期证据表明,许多有用的能力可能已经存在于基础智能体中:给定一个清晰的研究任务和一个可优化的指标,这些智能体已经能够发现新的最前沿科学解决方案(Liu 等人,2026c;Karpathy,2026)。在 ResearchClawBench(Xu 等人,2026)——一个涵盖 10 个不同领域共 40 个研究任务的基准测试中,无论是 Claude Code 还是 Codex,作为独立的通用智能体使用时,其表现均优于所有被评估的研究专用智能体系统。
然而,仅凭任务表现并不能造就可靠的自主研究者。科学发现需要严谨性、可复现性和可检查性,但智能体可能会污染评估、操纵产物,或未能遵循程序约束。此类奖励黑客行为和可观测性失效问题已在智能体研究系统中被报道(Luo 等人,2025;Kokoromyti,2026;Anthropic,2026)。因此,在没有环境约束的情况下信任智能体,可能会产生令人印象深刻但不可靠的结果。
这些观察表明,随着通用型智能体能力不断增强,自主科学发现的瓶颈正从通过详细工作流程规定智能体行为,转向设计智能体运行的环境。我们将此称为环境工程。这呼应了吉布森在生态心理学中的可供性理论:环境塑造了行动者可采取行动的可能性,“无论好坏”(吉布森,1979)。对于科学发现而言,一个精心设计的环境应抑制有害的可供性,例如评估篡改和人为产物操纵,同时增强有益的可供性,例如自由探索、准确奖励、智能体间协调以及便捷的人类监督。这好比一位能力出众的博士生:其生产力并非来自分秒必争的指令,而是来自问责机制、研究自主权、准确反馈、同行协作以及导师监督。
我们提出了 EurekAgent,这是一个用于自主科学发现的智能体系统,它通过四个环境工程维度协调现成的 CLI 智能体:(1)权限工程,用于暴露有用的能力和资源,同时防止研究诚信违规;(2)产物工程,用于将解决方案、日志和评估结果构建为共享的进度记忆;(3)预算工程,用于在运行时和计算边界内实现预算感知的探索;(4)人在回路工程,用于支持便捷的人类监督与干预。在此环境中,智能体仍可自由选择自己的研究工作流程和策略。
我们在涵盖数学、内核工程和机器学习工程的指标驱动型研究任务上评估了 EurekAgent。通过使用现成的 CLI 智能体和环境级设计,EurekAgent 在所有数学和内核工程任务上取得了新的最先进成果,并在所评估的 MLE-Bench 子集中排名第一。此外,当使用 Claude Code 作为 CLI 智能体、GLM-5.1 作为基础模型时,EurekAgent 在三个数学任务上取得了新的最先进成果,平均 API 成本低于 17 美元,其中 26 圆填充任务的 API 成本最低,仅为 11 美元。我们呼吁将环境工程作为构建有能力、高效且负责任的自主研究智能体的核心研究方向。
2 相关工作
2.1 科学发现智能体
自主研究智能体因能够通过大规模计算探索加速科学进程而日益受到关注。诸如 The AI Scientist 等系统旨在以端到端的方式自动化科学研究,涵盖创意生成、实验和论文撰写等阶段(Lu 等人,2024)。在这一更宏大的愿景中,一个尤为具体的方向是面向可验证目标和可优化指标的科学发现,即智能体通过评估器反馈自主探索并演化解决方案。在机器学习工程领域,诸如 AIDE、R&D-Agent、AIBuildAI、MLE-STAR 和 ML-Master 等系统将进展描述为由验证分数引导的迭代代码开发过程(Jiang 等人,2025;Yang 等人,2025;Zhang 等人,2026;Nam 等人,2026;Zhu 等人,2026)。在算法和数学发现领域,诸如 FunSearch、AlphaEvolve、ShinkaEvolve、EvoX、AdaEvolve 和 OpenEvolve 等免训练解决方案演化方法,利用大语言模型在评估器引导的选择机制下提出或变异候选程序(Romera-Paredes 等人,2024;Novikov 等人,2025;Lange 等人,2025;Liu 等人,2026b;Cemri 等人,2026;Sharma,2025)。最近,诸如 ThetaEvolve 和 TTT-Discover 等测试时训练系统进一步将可优化指标作为奖励信号,在探索过程中更新模型(Wang 等人,2025;Yuksekgonul 等人,2026)。这些系统展示了评估器引导发现的强大能力,但它们通常使用固定的工作流来规定智能体的核心行为,如提议、变异、选择或反思。而 EurekAgent 则采用强大的通用 CLI 智能体作为基本节点,并专注于构建一个能让智能体可靠地发挥自身能力的环境。
2.2 智能体环境与研究诚信
随着智能体变得越来越自主,其周围环境便成为决定其可靠性的核心因素。近期一些系统已开始认识到环境可靠性的重要性,并为特定的故障模式引入了防护措施。例如,MLE-STAR 为机器学习流水线增加了泄漏检查,而 CORAL 则将评分代码隐藏在评估接口之后(Nam 等人,2026 年;Qu 等人,2026 年)。同时,对真实奖励破解事件的分析表明,智能体可能利用薄弱的评估协议、污染证据或违反程序性假设(Luo 等人,2025 年;Kokoromyti,2026 年;Anthropic,2026 年)。在复杂的智能体场景中,指令遵循的失败进一步表明,可靠性不能完全委托给提示词工程(Qi 等人,2025 年)。因此,一些现有工作探索了环境设计以避免常见故障,但这些通常只是作为特定任务的防护措施引入的。EurekAgent 将环境工程作为核心设计目标:它将权限、工件、预算和人工监督组织为一等机制,以支持开放式的智能体探索,同时保持评估者的完整性、可追溯性和可复现性。
3 EurekAgent
在本节中,我们将介绍 EurekAgent 的系统设计。图 2 总结了整体架构。我们首先概述整个系统循环(3.1 节),然后详细说明环境工程设计(3.2 节)。
3.1 系统概览
EurekAgent 是一个面向指标驱动型研究任务的环境工程化智能体系统。给定问题描述、隐藏评估脚本、提交格式规范文档、可选的初始代码以及时间和 API 成本预算,EurekAgent 协调多个现成 CLI 智能体的会话,自主提出并迭代高分解决方案。EurekAgent 并非规定详细的研究工作流程,而是设计一个外部环境,通过一个简单的三阶段循环来组织智能体活动:
其中 是最大迭代轮数, 是每个实施阶段的最大并行实现会话数,两者均可由用户调整。每一轮包含一个提案会话,随后最多进行 个并行实施会话。跨阶段和轮次,环境仅处理外层循环协调:它初始化工作空间、在阶段之间进行转换、指定每个会话的目标和所需交付物、暴露工具和资源接口、记录并排序已评分解、持久化运行和会话状态,并强制执行时间和成本预算。在这些边界内,CLI 智能体会话可自由决定自己的研究策略、实验计划、实现细节和优化过程。
准备阶段。
在迭代开始之前,EurekAgent 启动一个准备智能体会话,为后续解决方案迭代建立可靠的运行时环境。该智能体读取问题描述、面向评估者的提交要求文档以及可选的初始代码;测试隐藏评估服务;并安装或验证所需的运行时依赖项。如果问题设置不明确或存在缺陷,智能体可以暂停并请求人工澄清,而不是让优化从不可靠的设置继续进行。该阶段通过编写准备摘要和完成工件来结束,这些内容将成为后续提案和实施会话的共享上下文。此阶段仅在研究过程开始时执行一次;之后,EurekAgent 执行提案-实施迭代轮次。
提案阶段。
在每个迭代轮次开始时,EurekAgent 会启动一个提案智能体会话,为下一轮解决方案优化生成多样化的初始假设。该会话会读取任务输入、准备摘要,以及前几轮中排名靠前的最佳解决方案(如有)。它还可以检查前几轮的工作空间以获取实现细节,并使用网络搜索或浏览工具收集相关文献或现有的开源解决方案。随后,它会编写一份包含最多候选假设的清单,并为每个假设创建一份可供实现的描述。这一阶段充当 EurekAgent 的汇聚步骤:来自前几轮的实证经验,连同从互联网获取的信息,被提炼为一组新的、有前景的、多样化的且可独立执行的研究假设。
实现阶段。
实现阶段是 EurekAgent 的发散步骤。对于每个提出的假设,EurekAgent 会并行启动一个独立的实现智能体会话,并为其分配独立的工作空间。每个会话从分配到的假设作为初始方向开始,但可能会根据隐藏评估器的反馈,迭代地优化、调试或修改解决方案。会话通过安全评估服务提交候选解决方案,该服务会记录所有已评估的提交结果,并同时维护中间结果和最佳有效结果。当并行的实现会话完成或耗尽预算后,EurekAgent 会自动对所有有效提交进行排名,并更新一份排名解决方案历史文件,作为下一轮共享上下文。这种提案-实现循环将广泛的并行探索与跨轮次的实证进展积累相结合,持续进行改进,直到达到预算限制或阶段完成条件。
3.2 EurekAgent 中的环境工程
EurekAgent 通过四个环境工程维度进行设计:(1) 权限工程,(2) 工件工程,(3) 预算工程,以及 (4) 人机协同工程。其目标是赋予智能体会话足够的操作能力以执行开放式解决方案优化,同时使研究过程可靠、可审查且资源受限。
权限工程。
科学发现智能体需要广泛的能力,但不受约束的能力可能会损害研究诚信。EurekAgent 通过施加系统级权限边界,在支持高效探索的同时,防止研究诚信违规行为。在高效方面,EurekAgent 提供了一个可自由配置的 Python 环境、工作区级别的 shell 访问权限、功能强大的网络搜索和浏览器工具,以及对同一轮运行中先前轮次产物的完全访问权限。这使得智能体能够像研究人员一样访问工具、文件、互联网和先前的经验,以辅助解决方案的迭代。在约束方面,EurekAgent 使用运行级隔离和控制器拥有的接口来防止常见的故障模式。每次运行都在一个挂载了工作区的 Docker 容器内执行,从而保护运行外部的文件免受意外或恶意修改。隐藏的评估器及其可能包含的测试数据被置于智能体可见的工作区之外,仅通过一个安全的评分服务暴露:智能体可以提交候选方案并获得官方评分,但不能检查或修改评估器本身。由隐藏评估器生成的权威结果文件由系统自动更新,并实现了钩子机制以阻止智能体修改这些控制器拥有的文件。EurekAgent 还在并行的实现会话之间强制执行同轮隔离:一个实现会话可以从之前的轮次中学习,但不能检查或复制同轮中其他并行方案的内容,从而减少过早收敛到单一局部方向的风险。对于 GPU 任务,EurekAgent 采用默认拒绝策略:除非通过提供的 GPU 辅助 API 获取,否则 GPU 对智能体不可见;该 API 会记录锁的所有权,并确保每个物理 GPU 在同一时间最多只能被一个智能体会话持有。这些机制共同作用,在暴露有用资源的同时,消除了诸如评估器泄露、分数篡改、不受控的 GPU 争用以及同轮方案复制等高危能力。
产物工程。
EurekAgent 将文件系统与 Git 历史记录结合,作为共享的长期记忆。文件系统存储各阶段的交付物,用于跨会话通信,包括准备摘要、提案清单、假设、解决方案代码、评估器反馈以及评分后的提交内容。EurekAgent 还维护系统管理的工件:网络搜索历史被记录为已探索互联网信息的缓存,官方评分会被自动记录并排序。排序后的历史解决方案使后续的智能体会话能够快速识别出优秀的先前方案,并在需要时检查其代码、日志和中间结果。所有运行工件都持久化保存在运行目录下,为可追溯性、中断恢复和可恢复性提供了持久的基础。在每个会话内部,Git 提交记录追踪解决方案的演变过程。我们指示智能体在每个提交信息中既描述当前独立的解决方案,也说明与前一版本相比发生了哪些变化。
预算工程。
自主研究智能体可能会消耗大量时间、算力和 API 预算,因此 EurekAgent 将预算限制作为环境设置的一部分。EurekAgent 沿两个维度控制资源:挂钟时间和 API 成本。在时间方面,用户可为提案阶段和实施阶段分别设定限制,这反映了假设生成与长期运行的解决方案迭代需要不同的时间尺度。此外,EurekAgent 通过主动和被动两种机制让智能体具备时间感知能力:(i) 主动机制下,智能体可调用内置的时间检查辅助 API,查看当前阶段已用时间和剩余时间;(ii) 被动机制下,当某个阶段的截止时间临近而所需交付物仍未完成时,EurekAgent 会注入一条警告消息,要求智能体停止探索并生成必要的产物。对于 API 成本,EurekAgent 会追踪跨会话的累计 token 使用量,但不会向智能体暴露 token 消耗信息。当成本限制达到时,运行将被中止,当前工作空间将作为最终快照保留。预算控制还支持长期研究过程的运行连续性。EurekAgent 会持久化每个阶段的会话标识符、状态、已用时间和有效预算,因此中断的运行可以在剩余预算下从最新的文件系统状态恢复,而无需从头开始。用户还可以修改已配置的时间限制,或者在某个阶段在产出所需产物之前已耗尽预算时,明确授予额外的恢复时间。这使得预算工程不仅是一个停止规则,更是一个用于受控延续的操作接口。
人在回路工程。
尽管 EurekAgent 支持完全自主的迭代,但科学发现仍然受益于人类监督。因此,EurekAgent 提供了两种互补的交互界面。一方面,终端用户界面(图 4)展示了每种方法的进展、原始会话输出,以及一个供用户与活跃会话通信的输入框。另一方面,网络监控界面(图 3)提供了运行过程更高层次的视图,呈现了可视化的分数演变,包括每轮最佳方法和全局最佳方法。这些界面在保持过程完全可观测的同时,保留了智能体的自主性,并允许人类在需要时重新引导智能体的行为。
4 实验
我们在三个领域评估了 EurekAgent:数学、内核工程和机器学习工程。我们专注于具有可优化指标的任务,这些任务的进展可以通过客观分数来衡量。所有实验均使用 EurekAgent,并以 Claude Code 作为 CLI 智能体,GLM-5.1 作为基础大语言模型。在此设置基础上,我们配置了 Web Search Prime MCP(https://docs.z.ai/devpack/mcp/search-mcp-server)以启用搜索引擎能力,以及 Playwright MCP(https://github.com/microsoft/playwright-mcp)以启用网页浏览器导航。
4.1 数学
我们遵循先前的研究工作(Novikov 等人,2025;Wang 等人,2025;Yuksekgonul 等人,2026),在三个数学优化问题上评估了 EurekAgent:(1)圆填充问题,目标是在单位正方形内放置 26 个互不重叠的圆,并最大化它们的半径之和,使用 OpenEvolve 风格的评估器,对边界和重叠检查设有容差;(2)Erdős 最小重叠问题,目标是使两个等大小集合之间的极限最大重叠最小化;以及(3)第一自相关不等式问题,目标是找到一个非负构造,以证明自卷积常数已知最紧的上界。对于圆填充问题,我们与在相同容差设置下报告的最佳 AI 结果进行了比较。所有三个问题都具有可验证且可优化的目标函数,因此适合进行智能体化的解决方案迭代。我们在附录 A 中报告了 EurekAgent 的超参数设置。
| 任务 | EurekAgent | 大语言模型 | 此前最佳 AI | 大语言模型 |
|---|---|---|---|---|
| 圆填充问题 () | 2.635999 | GLM-5.1 | 2.635986[27] | R1-Distill-Qwen3-8B |
| Erdős 最小重叠问题 () | 0.380870 | GLM-5.1 | 0.380876[30] | gpt-oss-120b |
| 一阶自相关不等式 () | 1.502861 | GLM-5.1 | 1.502863[30] | gpt-oss-120b |
如表 2 所示,EurekAgent 在所有三个数学任务上都取得了新的最优结果。值得注意的是,EurekAgent 在保持无需训练的同时超越了此前的测试时训练系统,这表明仅凭环境工程设计就能在不更新主干模型的情况下实现突破性成果。
4.2 内核工程
我们在 GPUMODE TriMul 竞赛上评估了 EurekAgent,该竞赛针对三角矩阵乘法的优化实现。参赛作品根据基准测试用例的几何平均运行时间进行评分,运行时间越短越好。我们在 A100 设置下进行评估。
由于官方 GPUMODE 排行榜已关闭,我们无法提交新解决方案并获得官方评分。因此,我们使用已发布的 TTT-Discover TriMul 设置(Yuksekgonul 等人,2026 年)在 A100 GPU 上进行本地评估,仅对 EurekAgent 的提交格式做了最小限度的适配。为了公平比较,我们从 GPUMODE 下载了排行榜顶部的解决方案脚本,并在相同的本地协议下重新评分。所有候选方案均在相同的 A100 GPU 上评估,原始正确性测试、基准测试用例、评分规则和计时逻辑均保持不变。我们运行三轮热身,随后进行十轮正式测量,并随机打乱候选顺序以减少顺序效应,同时报告几何平均运行时间的中位数和平均值。对于 EurekAgent,我们报告单次系统运行过程中发现的四个最佳解决方案;超参数设置见附录 A。
| 排名 | 解决方案 | 大语言模型 | 中位数 () () | 平均值 () () |
|---|---|---|---|---|
| 1 | EurekAgent-CUDA Graph | GLM-5.1 | 2005.0307 | 2014.1874 |
| 2 | EurekAgent-INT8 BMM | GLM-5.1 | 2006.9998 | 2013.5141 |
| 3 | EurekAgent-Fused Front-End | GLM-5.1 | 2016.5718 | 2020.2674 |
| 4 | EurekAgent-Triton Autotune | GLM-5.1 | 2030.6877 | 2041.5578 |
| 5 | josusamartin | 不适用 | 2096.0441 | 2105.1655 |
| 6 | TTT-Discover[30] | gpt-oss-120b | 2247.7849 | 2248.2307 |
| 7 | rd9000 | 不适用 | 2300.4883 | 2307.5716 |
表 3 显示,EurekAgent 发现了多个解决方案,其性能均优于同一本地评估器下排行榜上的最佳提交方案。EurekAgent 排名前四的解决方案中位运行时间均低于某一阈值,这表明其实现了稳定且高质量的优化,而非仅凭一次幸运的尝试。EurekAgent 的最佳内核相比排行榜上经重新评分的最强解决方案提升了约一定幅度,相比 TTT-Discover 则提升了约一定幅度。
4.3 机器学习工程
我们在 MLE-Bench Lite 拆分(Chan 等人,2025)中精选的七项竞赛子集上评估了 EurekAgent。MLE-Bench 在真实的 Kaggle 式机器学习竞赛中评估智能体,参赛作品将根据保留测试集进行评分,并映射到奖牌阈值。为了平衡成本、多样性和难度,我们从 22 项 Lite 竞赛出发,并利用公开的 MLE-Bench 排行榜结果来评估可行性。我们根据过往智能体的综合奖牌率将任务划分为简单、中等和困难三个等级,然后从中抽取 2 项简单、2 项中等和 3 项困难的竞赛。所选竞赛涵盖图像、文本、音频和表格数据预测。我们选定的任务详情见附录 B。
我们对每项竞赛运行一次 EurekAgent,并报告其获得的奖牌率。遵循 MLE-Bench 官方的 24 小时单 GPU 设置,我们为每次运行分配一个 GPU,并在附录 A 中报告 EurekAgent 的超参数设置。对于基线方法,我们使用同一任务上对应的公开 MLE-Bench 排行榜结果。当某个基线报告了多次运行的综合得分时,我们报告其得分范围的上限。
| 排名 | 智能体 | 大语言模型 | 获得任何奖牌 | 金牌 | 高于中位数 |
|---|---|---|---|---|---|
| 1 | EurekAgent | GLM-5.1 | 85.71% | 71.43% | 100.00% |
| 2 | AIBuildAI[31] | Claude-Opus-4.6 | 71.43% | 57.14% | 85.71% |
| 3 | Famou-Agent[12] | Gemini-2.5-Pro | 71.43% | 57.14% | 100.00% |
| 4 | Famou-Agent 2.0[12] | Gemini-2.5-Pro | 71.43% | 65.39% | 95.24% |
| 5 | LoongFlow[26] | Gemini-3-Flash-Preview | 71.43% | 57.14% | 71.43% |
| 6 | CAIR MARS+[4] | Gemini-3-Pro-Preview | 71.43% | 71.43% | 100.00% |
如表4所示,EurekAgent在选定的MLE-Bench子集上取得了最高的任意奖牌率,且每项任务仅运行一次。在使用非商业开源模型的方法中,它还获得了最高的金牌率。所有列出的基线方法均使用闭源商业模型,而EurekAgent运行的是开源大语言模型GLM-5.1,这表明经过环境工程设计的自主迭代即使不依赖最强的专有模型也能具备竞争力。
5 结论与局限性
我们提出了EurekAgent,一个面向指标驱动型研究任务、用于自主科学发现的环境工程设计系统。EurekAgent并非规定详细的研究工作流程,而是通过一个简单的准备-提出-实施循环来协调现成的CLI智能体会话,同时塑造周围环境以实现可靠的评估、共享的进度记忆、资源边界和人类监督。使用Claude Code作为CLI智能体、GLM-5.1作为基础大语言模型,EurekAgent在所有评估的数学和内核工程任务上取得了新的最先进成果,并在我们评估的MLE-Bench Lite子集中排名第一。这些结果表明,随着通用CLI智能体能力不断增强,经过精心设计的科学发现环境可以将模型能力转化为可靠的科学进步。
展望未来,我们将环境工程设计视为下一代自主研究系统的核心层。随着智能体能力日益增强,科学进步将不仅取决于模型智能,还取决于那些定义可靠反馈、持久记忆、资源控制、评估器完整性、人类监督以及可恢复的长时间运行的环境。我们当前的实验聚焦于具有可执行评估器的指标驱动型任务,但随着自主研究向更广泛、更开放的科学场景推进,同样的视角将变得更加重要。
我们开源了 EurekAgent,作为朝这一方向迈出的初步一步,并邀请社区在此基础上进行构建、改进和贡献。我们将持续维护该项目,将其扩展到更丰富的研究领域,并更新关于其性能、能力和边界的实证结果。我们希望 EurekAgent 能够成为集体探索环境工程(作为可靠自主科学发现的基础)的一个实用起点。
参考文献
- Anthropic (2026) Claude Opus 4.7 系统卡。注:https://www.anthropic.com/system-cards 引用自:§1, §2.2。
- M. Cemri, S. Agrawal, A. Gupta, S. Liu, A. Cheng, Q. Mang, A. Naren, L. E. Erdogan, K. Sen, M. Zaharia, 等 (2026) Adaevolve: 自适应大语言模型驱动的零阶优化。arXiv 预印本 arXiv:2602.20133。引用自:§2.1。
- J. S. Chan, N. Chowdhury, O. Jaffe, J. Aung, D. Sherburn, E. Mays, G. Starace, K. Liu, L. Maksin, T. Patwardhan, 等 (2025) Mle-bench: 评估机器学习智能体在机器学习工程中的表现。收录于《国际学习表征会议》,第 2025 卷,第 50466–50494 页。引用自:§1, §4.3。
- J. Chen, B. D. Mishra, J. Nam, R. Meng, T. Pfister, 和 J. Yoon (2026) MARS: 具备反思性搜索的模块化智能体,用于自动化人工智能研究。arXiv 预印本 arXiv:2602.02660。引用自:表 4。
- E. Friedman (2024) Erich 的装箱中心。注:https://erich-friedman.github.io/packing/ 引用自:表 1。
- J. J. Gibson (1979) 视觉感知的生态学方法。霍顿·米夫林出版社,波士顿,马萨诸塞州。引用自:§1。
- J. K. Haugland (2016) 最小重叠问题再探。arXiv 预印本 arXiv:1609.08000。引用自:表 1。
- Z. Jiang, D. Schmidt, D. Srikanth, D. Xu, I. Kaplan, D. Jacenko, 和 Y. Wu (2025) Aide: 代码空间中的人工智能驱动探索。arXiv 预印本 arXiv:2502.13138。引用自:§1, §1, §2.1。
- A. Karpathy (2026) autoresearch: 在单 GPU nanochat 训练上自动运行研究的 AI 智能体。注:https://github.com/karpathy/autoresearch 引用自:§1。
- N. Kokoromyti (2026) 奖励破解的剖析:来自最新 GPU Mode NVFP4 竞赛的真实故事。注:https://www.gpumode.com/news/reward-hacking-nvfp4 引用自:§1, §2.2。
- R. T. Lange、Y. Imajuku 和 E. Cetin(2025)《Shinkaevolve:迈向开放式且样本高效的程序进化》。arXiv 预印本 arXiv:2509.19349。引用自:§1、§1、§2.1。
- A. Li、C. Wu、Z. Ge、Y. H. Chong、Z. Hou、L. Cao、C. Ju、J. Wu、H. Li、H. Zhang、S. Feng、M. Zhao、F. Qiu、R. Yang、M. Zhang、W. Zhu、Y. Sun、Q. Sun、S. Yan、D. Liu、D. Yin 和 D. Shen(2025)《FM 智能体》。外部链接:2510.26144,链接。引用自:§1、表 4、表 4。
- J. Liu、S. Qiu、M. Li、B. Li、H. Ji、S. Han、X. Ye、P. Xia、Z. Dong、C. Zhang 等人(2026a)《AutoResearchClaw:基于人机协作的自我强化自主研究》。arXiv 预印本 arXiv:2605.20025。引用自:§1。
- S. Liu、S. Agarwal、M. Maheswaran、M. Cemri、Z. Li、Q. Mang、A. Naren、E. Boneh、A. Cheng、M. Z. Pan 等人(2026b)《Evox:面向自动化发现的元进化》。arXiv 预印本 arXiv:2602.23413。引用自:§1、§2.1。
- T. Liu、Y. Yang、X. Ye 和 D. Chen(2026c)《编码智能体能自主优化算法吗?》。注:https://tengxiaoliu.github.io/autoevolver/。引用自:§1。
- C. Lu、C. Lu、R. T. Lange、J. Foerster、J. Clune 和 D. Ha(2024)《AI 科学家:迈向完全自动化的开放式科学发现》。arXiv 预印本 arXiv:2408.06292。引用自:§2.1。
- Z. Luo、A. Kasirzadeh 和 N. B. Shah(2025)《自动化程度越高,所见越少:AI 科学家系统的隐藏陷阱》。arXiv 预印本 arXiv:2509.08713。引用自:§1、§2.2。
- M. Matolcsi 和 C. Vinuesa(2010)《自卷积上确界的改进边界》。数学分析与应用杂志 372 (2),第 439–447 页。引用自:表 1。
- J. Nam、J. Yoon、J. Chen、J. Shin、S. Arik 和 T. Pfister(2026)《MLE-star:通过搜索与定向精炼实现机器学习工程智能体》。神经信息处理系统进展 38,第 116692–116712 页。引用自:§2.1、§2.2。
- A. Novikov、N. Vũ、M. Eisenberger、E. Dupont、P. Huang、A. Z. Wagner、S. Shirobokov、B. Kozlovskii、F. J. Ruiz、A. Mehrabian 等人(2025)《AlphaEvolve:面向科学与算法发现的编码智能体》。arXiv 预印本 arXiv:2506.13131。引用自:§1、§1、§2.1、§4.1。
- A. Ouyang、S. Guo、S. Arora、A. L. Zhang、W. Hu、C. Ré 和 A. Mirhoseini(2025)《Kernelbench:大语言模型能否编写高效的 GPU 内核?》arXiv 预印本 arXiv:2502.10517。引用于 §1。
- Y. Qi、H. Peng、X. Wang、A. Xin、Y. Liu、B. Xu、L. Hou 和 J. Li(2025)《Agentif:在智能体场景下对大语言模型指令遵循能力的基准测试》arXiv 预印本 arXiv:2505.16944。引用于 §2.2。
- A. Qu、H. Zheng、Z. Zhou、Y. Yan、Y. Tang、S. Y. Ong、F. Hong、K. Zhou、C. Jiang、M. Kong 等人(2026)《Coral:迈向面向开放式发现的自主多智能体进化》arXiv 预印本 arXiv:2604.01658。引用于 §1、§2.2。
- B. Romera-Paredes、M. Barekatain、A. Novikov、M. Balog、M. P. Kumar、E. Dupont、F. J. Ruiz、J. S. Ellenberg、P. Wang、O. Fawzi 等人(2024)《利用大语言模型进行程序搜索的数学发现》Nature 625 (7995),第 468–475 页。引用于 §2.1。
- A. Sharma(2025)《OpenEvolve:一个开源的进化式编码智能体》外部链接:Link。引用于 §2.1。
- C. Wan、X. Dai、Z. Wang、M. Li、Y. Wang、Y. Mao、Y. Lan 和 Z. Xiao(2025)《Loongflow:通过认知的规划-执行-总结范式进行定向进化搜索》arXiv 预印本 arXiv:2512.24077。引用于表 4。
- Y. Wang、S. Su、Z. Zeng、E. Xu、L. Ren、X. Yang、Z. Huang、X. He、L. Ma、B. Peng 等人(2025)《Thetaevolve:在开放问题上的测试时学习》arXiv 预印本 arXiv:2511.23473。引用于表 1、§1、§2.1、§4.1、表 2。
- W. Xu、S. Li、T. Ye、Q. Cao、Y. Chen、H. Gao、Y. Wang、Q. Li、K. Li、S. Xu、S. Chai、F. Yu、X. Zhao、Z. Zhao、W. Ma、Z. Guo、H. Zhou、H. Yin、L. Cheng、C. Hu、H. Li、L. Mi、X. Xie、Y. Zhou、R. Chen、Z. Zhou、X. Guo、Y. Zhou、X. He、S. Xu、X. Gu、J. Wu、M. Liu、C. Song、F. Ling、D. Zhou、S. Tang、Y. Li、M. Su、P. Ye、S. Sun、B. Wang、X. Yang、Z. Yin、T. Fu、G. Zhai、W. Ouyang、B. Zhang、L. Bai 和 W. Zhang(2026)《ResearchClawBench:面向端到端自主科学研究的基准测试》外部链接:2606.07591,Link。引用于 §1。
- X. Yang, X. Yang, S. Fang, B. Xian, Y. Li, J. Wang, M. Xu, H. Pan, X. Hong, W. Liu 等人 (2025) 《R&D-Agent:通过大语言模型驱动的自动化研究、开发与演进,实现数据驱动型 AI 解决方案构建》。arXiv 电子预印本,arXiv–2505。引用自:§1, §1, §2.1。
- M. Yuksekgonul, D. Koceja, X. Li, F. Bianchi, J. McCaleb, X. Wang, J. Kautz, Y. Choi, J. Zou, C. Guestrin 等人 (2026) 《在测试时学习发现》。arXiv 预印本 arXiv:2601.16175。引用自:表 1, 表 1, 表 1, §1, §2.1, §4.1, §4.2, 表 2, 表 2, 表 3。
- R. Zhang, P. Qin, Q. Cao, L. Zhang 和 P. Xie (2026) 《AIBuildAI:用于自动构建 AI 模型的 AI 智能体》。arXiv 预印本 arXiv:2604.14455。引用自:表 1, §1, §2.1, 表 4。
- X. Zhu, Y. Cai, Z. Liu, B. Zheng, C. Wang, R. Ye, J. Chen, H. Wang, W. Wang, Y. Zhang 等人 (2026) 《迈向超长周期智能体科学:机器学习工程的认知积累》。arXiv 预印本 arXiv:2601.10402。引用自:§2.1。
附录 A EurekAgent 超参数设置
表 5 总结了我们在实验中使用的 EurekAgent 超参数。其中, 表示提议-实现迭代轮次的最大数量, 表示每个实现阶段中生成的并行实现会话的最大数量。
| 任务 | 备注 | ||||
|---|---|---|---|---|---|
| 圆填充 | 5 | 3 | 20 分钟 | 120 分钟 | – |
| Erdős 最小重叠 | 8 | 3 | 20 分钟 | 120 分钟 | – |
| 一阶自相关不等式 | 8 | 3 | 20 分钟 | 120 分钟 | – |
| TriMul | 13 | 3 | 20 分钟 | 160 分钟 | A100 评估环境。 |
| MLE-Bench Lite | 12 | 3 | 20 分钟 | 100 分钟 | 每次运行使用一块 GPU。 |
附录 B 选定的 MLE-Bench Lite 竞赛
我们从三个难度等级中选取了七项 MLE-Bench Lite 竞赛,使用先前公开排行榜上智能体的综合奖牌率作为任务难度的代理指标:
- •
简单():组织病理学癌症检测(57.0%)和植物病理学 2020-FGVC7(49.7%)。
- •
中等(–):空中仙人掌识别(26.2%)和 ICML 2013 鲸鱼重赛(23.5%)。
- •
困难():Jigsaw 有毒评论分类(9.1%)、犬种识别(0.4%)和表格游乐场 2022 年 5 月(0.4%)。
来源:HuggingFace Daily Papers(社区热门论文) · arxiv.org