跳到正文
北京时间
原文
Hacker News 热门(buzzing.cc 中文翻译)· matt_d·· 2026-08-28精选AI 评分72

Terminal-Bench-Science 0.1:评估科研工作流中的 AI 智能体

终端-工作台-科学:在科学研究工作流中评估人工智能代理

AI 导读

斯坦福大学研究人员领衔发布 Terminal-Bench-Science 0.1,用来自生命、物理、地球、数学和工程科学的 70 个专家精选任务评估 AI 智能体的科研能力。

推荐理由

70 个专家任务里最强模型仅解决 30%,成本与 token 前沿还显示不同系统取舍,为选择科学智能体提供了比软件基准更接近真实研究的依据。

正文 · AI 翻译

Terminal-Bench-Science 0.1

Terminal-Bench-Science 基于研究人员自身工作中的工作流来评估 AI 智能体。科学能力的标准由科学家而非模型开发者或数据供应商来设定。

Terminal-Bench-Science 是由 Stanford University 的研究人员主导、由 Terminal-Bench 背后的团队构建的基准,并与来自全球多个科学学科和研究机构的领域专家合作完成。它通过一组多样化的、由专家精心策划、源自科学研究的挑战性工作流来衡量 AI 智能体的能力。

Terminal-Bench-Science 是一个持续演进的基准,与前沿 AI 同步发展,在科学需求与 AI 开发之间形成反馈闭环。我们的首个版本包含来自生命科学、物理科学、地球科学、数学和工程科学的 70 项任务。在评估中表现最强的模型 Claude Opus 5 在 Terminal-Bench-Science 0.1 上达到了 30% 的解决率。

Terminal-Bench-Science 0.1 排行榜

Terminal-Bench-ScienceTerminal-Bench-Science

Terminal-Bench-Science 0.1 上 70 项科学工作流任务的解决率

概述

尽管 Terminal-Bench 推动了 AI 智能体在软件工程领域的进步,Terminal-Bench-Science 将同样的雄心带到了科学领域。我们的目标是推动具备科学能力的智能体发展,使其成为有用的研究助手。这些智能体应当执行技术难度高且耗时的工作流,从而让科学家将更多时间投入到科学中最需要人类判断的环节:定义研究问题、提出假设、解读与验证结果,以及传播研究发现。在这一角色中,AI 智能体可以拓展研究人员所能取得的成果,并帮助加速科学发现。

要实现这一目标,需要能够反映真实科学实践、提供可验证的能力证据,并随 AI 前沿一同演进的评测基准。

我们需要源自真实科学工作流的评测基准。科学能力应当基于真实研究实践来评估,而非教科书问题或标准化习题,并且应由身处科研一线的科学家亲自贡献。Terminal-Bench-Science 为各领域的科学家提供了一个直接发声的机会和一个共享平台,让他们为自己所关心的问题设定 AI 进步的标杆。科学事关重大,其评测基准必须反映科学界的优先事项,而非外部利益。

我们需要可验证的科学能力证据。没有可靠的评估,我们就无法判断智能体的能力是在提升,还是其局限依然存在。Terminal-Bench-Science 在真实环境中评估智能体,并通过可复现的、针对具体任务的测试,对分析、模拟、证明、代码和数据产品等具体产出物进行评分。

我们需要一个能跟上前沿步伐的基准。科学基准往往被当作要发表的论文,而非推动进步的机制。它们一经发布便被弃置一旁,而模型不断进步,已知的局限却依然存在。Terminal-Bench-Science 是一个与 AI 前沿共同演进的持续型基准。通过定期发布,科学家可以贡献新的工作流、改进现有任务,并在科学需求与 AI 发展之间建立反馈循环。

媒体内容 · 前往原文查看

Terminal-Bench-Science 反馈循环

Terminal-Bench-Science 反馈循环

任务

Terminal-Bench-Science 0.1 包含 70 项任务,涵盖生命科学、物理科学、地球科学、数学科学和工程科学。任务涉及科学数据分析、统计推断、仿真、优化、定理证明、图像重建、信号处理、反问题、传感器校准、模型拟合、分类以及科学机器学习。

媒体内容 · 前往原文查看

Terminal-Bench-Science 0.1 任务覆盖范围

70 项由专家精心策划的任务,横跨五个科学领域

任务由研究人员通过一个开放流程贡献,该流程托管在GitHub上,讨论和反馈则在#tb-science频道中进行,该频道位于Discord上。贡献以提案的形式开始,评审人员会讨论每个想法、留下反馈,并批准那些看起来非常契合的提案:即具有科学依据、值得在基准中衡量的工作流。获批的提案会以 pull request 的形式实现,评审人员会确认每个任务都可客观验证、对 AI 智能体确实具有挑战性,并且不是当今前沿系统已经能轻松解决的问题。要合并,领域评审人员会评估科学有效性和现实性,技术评审人员会检查任务构建和验证,还有一位标准把关人进行最终质量检查。在 920 份提案中,464 份获批实现,386 个 pull request 被提交,但只有 70 个任务进入了 Terminal-Bench-Science 0.1。这种选择性反映出,要创建既具有科学趣味、又对前沿智能体具有挑战性,并且足够明确以进行严格评估的任务是多么困难。提案、pull request 和评审的进展都在公开任务仪表盘.

Terminal-Bench-Science 0.1 贡献

媒体内容 · 前往原文查看
从 920 个任务提案到 70 个落地于 Terminal-Bench-Science 0.1
World map showing the geographic density of Terminal-Bench-Science proposal and implementation authors using public profile locations and affiliationsWorld map showing the geographic density of Terminal-Bench-Science proposal and implementation authors using public profile locations and affiliations
来自 22 个国家的 376 位贡献者,通过提案、评审或拉取请求参与

结果

Terminal-Bench-Science 0.1 为 AI 智能体在科学研究方面留下了巨大的进步空间。每个被评估的模型在全部 70 项任务中,每项任务都运行了三次独立试验。搭配 Claude Code 的 Claude Opus 5 取得了最高的解决率,为 30.0%,紧随其后的是搭配 Codex 的 GPT-5.6 Sol,为 22.4%,以及搭配 Claude Code 的 Claude Fable 5,为 21.4%。Claude Opus 4.8 位居中游,为 10.5%。GPT-5.6 Terra、Kimi K3 和 Grok 4.6 解决的任务均不足 10%。GLM 5.3 是最强的开源模型,为 8.1%,而 GPT-5.6 Luna 垫底,为 3.3%。

Terminal-Bench-Science 对系统之间的区分能力与 Terminal-Bench 3.0 大致相当,同时使每个在两个基准上都接受评估的模型的解决率下降了 10 个百分点以上。这一差距是刻意为之的:在评审期间,任务经过校准,以挑战最新的前沿模型。

媒体内容 · 前往原文查看

Terminal-Bench-Science 与 Terminal-Bench 对比

在 Terminal-Bench 2.1、Terminal-Bench 3.0 和 Terminal-Bench-Science 0.1 上的解决率

性能只是进展的一个维度。成本-解决率图展示了全部 70 项任务的总评估成本与解决率之间的关系。GPT-5.6 Luna、Kimi K3 和 GPT-5.6 Terra 位于前沿的低成本一端。GPT-5.6 Sol 和 Claude Opus 5 以更高的成本达到最高的解决率,其中 Opus 5 为 $7.0k。GPT-5.6 Sol 以不到三分之一成本($4.2k 对 $14.2k)达到与 Claude Fable 5 相当的性能。Token 用量则呈现出另一条前沿。Claude Fable 5 在达到 GPT-5.6 Sol 性能的同时,使用的 token 少了约四分之一(6.4B 对 8.4B)。Kimi K3 占据低 token 一端,Claude Opus 5 占据高解决率一端。只有 Kimi K3 和 Claude Opus 5 同时出现在两条帕累托前沿上。

媒体内容 · 前往原文查看

Terminal-Bench-Science 0.1 成本与解决率对比

各评估系统在成本与解决率上的帕累托前沿
媒体内容 · 前往原文查看

Terminal-Bench-Science 0.1 Token 用量与解决率对比

各评估系统在 token 用量与解决率上的帕累托前沿

解决率也因科学领域而异。Anthropic 和 OpenAI 的模型在除工程科学之外的每个领域都占据前两名,而在工程科学领域,Grok 4.6 以更低的成本和 token 用量与 GPT-5.6 Sol 并列第二(14.8%)。Claude Opus 5 在除数学科学之外的每个领域都领先于 GPT-5.6 Sol 和 Claude Fable 5,而在数学科学领域,Claude Fable 5(33.3%)和 GPT-5.6 Sol(31.4%)占据前两名。按领域划分的完整细分可在排行榜上查看。

媒体内容 · 前往原文查看

Terminal-Bench-Science 0.1 各领域解决率

  • Opus 5
  • GPT-5.6 Sol
  • Grok 4.6
各领域解决率:Opus 5、GPT-5.6 Sol 和 Grok 4.6

结论与路线图

Terminal-Bench-Science 0.1 是由生命科学、物理科学、地球科学、数学和工程科学领域的研究人员,联合 Terminal-Bench 和 Harbor 团队共同发起的一项社区协作成果。它是我们能够在开放环境下构建的最严格的科学智能体能力评测基准,而这一切才刚刚开始:Terminal-Bench-Science 0.1 是一个持续更新基准的首个版本。

定期发布将新增任务、扩大对五个科学领域的覆盖范围、淘汰智能体已饱和或经审查发现定义不明确的任务,并随着新前沿模型的发布保持排行榜的时效性。每次发布都会针对当时的前沿水平进行校准。对于 Terminal-Bench-Science 0.1,当时的前沿是 Claude Opus 5 和 GPT-5.6 Sol,随着更强模型的出现,我们将用它们来评估和校准新增及改进的任务。任务经过版本管理,因此试验可以通过一条 Harbor 命令复用、重新评分或重新运行,从而将更新结果的成本保持在较低水平。进展在任务仪表盘上公开跟踪,每次发布都会在GitHub和Harbor Hub上打标签。

Terminal-Bench-Science 0.2的工作已经在进行中,pull request 截止日期为2026 年 10 月 5 日。如果你是一名研究者,拥有前沿智能体应该能够完成但目前尚无法完成的工作流,我们希望将其纳入基准测试。贡献流程为提议 → 构建 → 审查:通过任务提议表单提议你的任务,按照贡献指南进行构建,之后将经过自动化检查、并行领域与技术审查,以及最终的抬高门槛审批,方可合并。

加入 #tb-science 上的这项行动,在 Discord 和 GitHub 上参与进来,并通过 项目日历 参加我们的每周会议和办公时间。让我们让科学家来定义 AI 中的科学能力应该是什么样子,并一起严格地衡量它。

引用

如果你觉得这项工作有用,请引用它。你可以使用 GitHub 上的“Cite this repository”按钮(由 CITATION.cff 生成),或使用下面的信息手动引用。

@software{Terminal-Bench-Science_Team_Terminal-Bench-Science_Evaluating_AI_2026,
  author = {{Terminal-Bench-Science Team}},
  doi = {10.5281/zenodo.22110254},
  license = {Apache-2.0},
  month = aug,
  title = {{Terminal-Bench-Science: Evaluating AI agents on research workflows across scientific domains}},
  url = {https://github.com/harbor-framework/terminal-bench-science},
  version = {v0.1.0},
  year = {2026}
}

致谢

感谢 Terminal-Bench-Science 背后的所有 任务贡献者、审阅者和顾问。

特别感谢我们的项目首席顾问 Ludwig Schmidt 和 Sanmi Koyejo;我们的高级审阅者 Allen Hart、Ivan Bercovich、Joseph Janssen、Jiaming Hu、Steffen Bollmann 和 Sergey Aganezov;我们的 AI 研究顾问 Ryan Marten、Alex Shaw、Lin Shi、Benjamin Feuer、Mike A. Merrill、Alex Dimakis、Jenia Jitsev、Bodhisattwa Majumder、Peter Clark、Thomas Wolf、Braden Hancock 和 Andy Konwinski;以及我们的科学顾问 Sara Beery、Jo Dunkley、J. Nathan Kutz、Ching-Yao Lai、Scott Linderman、Emma Lundberg、Russ Poldrack、Aviv Regev 和 Risa Wechsler。

Terminal-Bench-Science 是由 Stanford University 和 Laude Institute 主办的开放学术合作项目,合作伙伴包括 Stanford AI Lab (SAIL)、Stanford Institute for Human-Centered Artificial Intelligence (HAI)、Stanford AI Measurement Science (AIMS)、NSF AI Institute for Foundations of Machine Learning (IFML)、Allen Institute 以及 Allen Institute for AI (Ai2)。作为 Terminal-Bench 系列的一部分,它由 Terminal-Bench 和 Harbor 团队与 科学贡献者社区共同构建。

我们感谢 Laude Institute 通过 Slingshots 计划提供的支持,Snorkel AI 通过 Open Benchmarks Grants 计划提供的支持,2077AI Open Source Foundation 提供的 PP API 额度支持任务审核与整理,以及 UniPat AI 和 Modal 对 Terminal-Bench-Science 的支持。我们感谢 Bespoke Labs、Anthropic、Google、Moonshot AI、SpaceXAI 和 Z.ai 提供 API 额度支持排行榜评测。

作者: Steven Dillmann

来源:Hacker News 热门(buzzing.cc 中文翻译) · terminal-bench-science.ai