OpenAI 发布 GeneBench-Pro:计算生物学研究级基准测试
Introducing GeneBench-Pro
OpenAI 发布 GeneBench-Pro,用于评估 AI 智能体在计算生物学中处理模糊性和做出判断性分析的能力。该基准包含 129 个问题,覆盖统计遗传学、群体遗传学等 10 个领域 21 个子领域。每个问题提供真实混乱的数据集和实验背景,要求模型探索数据、选择分析路径并迭代实验。采用合成数据构建,已知完整因果结构。82 个问题已由外部领域专家审核确认其现实性。
OpenAI 的新基准揭示了一个信号,GPT-5.6 在需要科学判断的模糊任务上进步神速,从不足 5% 到接近 30%,且单题成本仅几美元,这对 AI for Science 的落地想象空间影响不小。
一项研究级基准,用于衡量 AI 智能体在计算生物学中如何应对模糊性并做出具有重大影响的判断。
阅读论文
科学数据很少附带操作说明。研究者必须判断某个模式反映的是生物学信号还是噪声,数据能否支撑所提出的问题,以及每个结果应如何改变他们接下来的行动。AI 智能体越来越有能力执行复杂分析,但真正的科学研究不仅依赖于回忆事实或遵循预设流程,还依赖于做出这些更高阶的判断。
今天,我们推出 GeneBench-Pro——一个具有挑战性的研究级基准,用于测试模型能否处理真实世界计算生物学所要求的那种以判断为核心的分析。它扩展了 GeneBench,覆盖基因组学、定量生物学和转化医学中更难、更贴近现实的任务,捕捉计算生物学科学研究的复杂性、迭代性和模糊性。
迄今为止,对于让真实世界计算研究变得困难的系统级判断,鲜有令人信服的评估。这些判断包括处理模糊性、修正假设、选择正确的分析路径,以及判断结果何时已可供决策。由于这些技能难以形式化,它们也难以被严格评估,即便这些技能上的弱点正日益制约 AI 的整体表现。
GeneBench-Pro 旨在精确衡量这些更高层次的能力。在 GeneBench-Pro 中,我们将“研究品味”定义为塑造一项分析的一系列判断决策:数据能够支持哪些问题、早期诊断应如何改变模型或估计目标,以及初始方案何时需要修订。每道 GeneBench-Pro 题目都会给模型提供一个真实而杂乱的数据集、简短的实验背景,以及与下游决策相关联的目标估计量。要正确作答,模型必须探索数据、选择合适的分析方法、进行迭代式的实验过程,并给出最终答案。
数据集构建
在生物学领域,数据生成(例如基因组测序)的成本已大幅下降,如今一些研究者认为,制约因素已不再是样本采集,而是下游的计算与分析。GeneBench-Pro 正是为评估在解决这一瓶颈方面的进展而构建,包含 129 道题目,覆盖广泛的计算生物学场景与方法。
领域图谱:10 个领域、21 个子领域中的 129 道题目
使用方向键在基准题目之间切换。所选题目的详细信息显示在下方。
点击上方的一个圆点,了解某道基准题目的详情。
该图谱预览了 GeneBench-Pro 的广度。访问案例研究页面,更详细地探索 10 道代表性题目。
GeneBench-Pro 在设计上也刻意规避了常见的基准测试失效问题。许多长时程生物学基准测试会围绕杂乱的历史数据集构建多步问题,而这类分析往往并不存在唯一正确的路径。一个智能体可能选择某个有合理依据的截断值,另一个智能体则可能选择不同但同样有合理依据的选项,这更多反映的是基准测试创建者所做的任意选择,而非模型性能上的任何根本差异。反过来也可能发生:如果一个问题在数值上过于不敏感,智能体即便在分析中犯了根本性错误,仍可能得出通过的结果。
为避免这些失效模式,每个 GeneBench-Pro 问题都是合成构建的:我们已知完整的因果结构,并直接模拟数据生成过程。这使我们能够调节每个问题的复杂度,确保主观分析选择上的合理差异仍能产生被接受的数值结果,并通过消融研究验证那些看似合理但实则错误的分析会失败。随后,我们通过详细的轨迹分析审核问题草稿,检查是否存在信息泄漏和意料之外的解题路径。这让我们确信,得出正确答案取决于选择正确的分析路径,而非利用捷径或迎合出题者的任意偏好。
我们将 129 道 GeneBench-Pro 题目中的 82 道发送给了外部领域专家,包括研究生、博士后研究员、产业界科学家和教授。评审者评估了每道题目的真实性、目标答案是否可确定,以及方法和估计量是否恰当。反馈被用于改进题目。
“我所审阅的这些问题,如果没有经验丰富的导师反复反馈,研究生是很难独立完成的。数据中包含了技术和质量控制方面的问题,需要带着对潜在陷阱的警觉进行深思熟虑、反复推敲的数据分析才能成功完成;这并不是简单地把某种现成方法套用到干净、整理好的数据上。”
“即使当前模型还无法可靠地从头到尾独立完成分析,那些在 GeneBench-Pro 问题上表现良好的模型,显然也能够帮助研究人员确定正确的工作流程并探索数据。我可以预见,这将极大地提升研究的速度、彻底性和可复现性。”
评估与评分
每个 GeneBench-Pro 问题都是一项自成一体的科学分析。智能体会获得一个隔离工作区的访问权限,其中包含一段简短提示词、数据文件,以及一套标准的生物信息学工具栈,包括 Python、科学计算库,以及 PLINK 2.0 等基础基因组学软件包(不过这些问题并不需要特定领域的工具)。
结构变异指导下的肿瘤治疗获益-风险决策
一个分子肿瘤委员会登记库收录了被考虑使用 TXR1 靶向抑制剂的、符合试验入组条件的晚期实体瘤病例。请估计,对于在时间零点存在 SV 驱动的 TXR1 靶点介导激活的肿瘤,假设所有患者都拥有可评估的第 16 周访视,TXR1i 相对于非 TXR1 全身治疗对第 16 周临床获益的边际效应。同时估计在同一目标人群中,TXR1i 治疗下 8 周治疗限制性毒性/停药风险。报告净临床效用 = 获益风险差(百分点)- 0.35 * 毒性风险(百分点),若 TXR1i 具有正净效用则选择 therapy_class_code 1,否则选择 0。
所有非代码数量均使用百分点单位。正获益意味着 TXR1i 相对于非 TXR1 全身治疗改善了第 16 周临床获益。
这些数据来自一项真实实验;评分不仅依据数值正确性,还依据你所展现的分析推理质量;不要试图走任何捷径。
将你的最终答案严格返回为一个 JSON 对象。
不要用 markdown 包裹该 JSON。
不要在 JSON 前后添加任何文字。
不要省略示例中显示的任何键。
在你的最终答案中返回该 JSON 对象:
JSON
1
{
2
"answer": {
3
"therapy_class_code": <int>,
4
"benefit_rd_pp": <float>,
5
"toxicity_dropout_risk_pp": <float>,
6
"net_clinical_utility_pp": <float>
7
},
8
"reasoning": "<description of method and QC>"
9
}
由于我们控制着完整的数据生成过程,我们可以针对已知目标确定性地评定正确性,从而避免标准基于评分标准的评估中存在的模型选择变异性和冗长效应。
每道题还附带丰富的元数据,包括预期的分析结构、随附的数据文件、一份详细的多页案例研究,以及专家评审结果。我们将在 Hugging Face 上完全开源 10 道具有代表性的 GeneBench-Pro 题目,并提供一个交互式网页界面供浏览。最后,我们将在不久的将来向 Artificial Analysis 提供一份 50 道题的子集,用于独立的第三方基准测试。
结果
我们最强的模型 GPT‑5.6 Sol 在最高推理级别下达到了 28.7% 的通过率(启用 Pro 模式时为 31.5%)。与我们最初开始构建 GeneBench 时相比,这是一个大幅提升;当时,我们最好的前沿模型 GPT‑5 得分低于 5%。该基准测试上的进展表明,前沿模型正在快速进步,即便是在较为抽象、系统级的科学推理方面也是如此。按照目前的速度,这个基准测试可能会在年底前饱和。
结果还显示了扩展测试时计算的影响。在最低推理级别下,GPT‑5.6 Sol 仅能达到个位数的通过率。在最高推理级别下,GPT‑5.6 Sol 解出的题目数量几乎是 GPT‑5.2 的六倍,而使用的 token 数约为其三分之二。
跨模型家族的对比表明,在定量不确定性下的高层科学推理方面,GPT 模型属于最强的系统之列。GPT‑5.6、GPT‑5.5 与 GLM 5.2 等领先开源模型之间的性能差距,远大于我们从编程基准外推时所预期的水平,这表明开源模型在编程方面比在更广泛的推理能力方面更为专精。
我们在开发过程中使用前沿 GPT 模型来评估并加固问题。因此,我们怀疑 GeneBench-Pro 相对于其他模型家族而言可能对 GPT 模型存在偏见。然而,竞品模型最多只能与发布时对应的 GPT 模型性能持平,而且往往明显落后。
鉴于 GeneBench-Pro 问题的难度,这些评估结果——在 GPT‑5.6 Sol (Pro) 上高达 31.5%——令人瞩目。在一项调查中,我们的评审人员估计,一道典型的 GeneBench-Pro 问题大约需要人类专家花费 20–40 小时才能完成。按保守的每小时 $200 计算,单道问题的人力成本就高达数千美元。当前 AI 智能体仍不够可靠,无法取代人类专家,但成本差距巨大,每道问题的推理成本仅为几美元。这意味着,即便在现有能力下实现部分自动化,也可能创造出可观的经济和科学价值。
“这些基准测试的灵感来自多样化的生物学问题,但……真正的挑战来自探索性数据分析以及基于这些发现的推理:识别模式与伪影,并判断数据应当被排除还是调整。这与真实生物学数据集的杂乱本质如出一辙。审视这些评估,凸显出清晰的求解器契约对于基于智能体的科学问题求解有多么重要。不同的提示词措辞或任务规范,会极大地影响哪些分析看起来是被允许的。”
“我大体上喜欢[这些问题]。它们往往混合了以下几类:(1) 所需的学科知识,比如古 DNA 中的 C>T 偏好;(2) 数据不一致,比如祖源互换;(3) 对适合该任务的分析工具及其实现方式的了解。看起来大多数智能体都栽在了 (2) 上。它们对数据问题不够谨慎。也许这凸显了当前模型的一个弱点。而且大量生物学数据都存在不规则之处。”
尽管如此,前沿模型仍然只能解决其中不到三分之一的问题,这一事实表明还有很大的改进空间。模型可以在有挑战性的问题上取得部分进展,但它们难以闭合推理回路。这种失败模式与人类专家和新手之间的对比如出一辙。专家利用自身经验来框定问题并调整方法,而新手只是做出观察,却难以将其整合进问题的更广阔语境之中。
问题:具有时变治疗的药物基因组学时间-事件响应
治疗启动、基因型特异性响应、延迟药效动力学、现患用户标记以及纵向生物标志物共同决定了因果生存估计目标。
GPT-5.5 模式
使用传统 Cox 结局模型处理治疗时机,但未解决治疗-混杂因素反馈问题。
拟合计数过程 Cox 模型,将治疗作为时变暴露,仅在
treat_start+90 天后生效……模型包含 G、治疗×G、基线严重程度、年龄和性别。
GPT-5.6 Sol 模式
使用更合适的因果推断方法,正确处理治疗-混杂因素反馈。
使用新用户边际结构 Cox 模型:排除了 818 名被标记的现患用户,使用基线协变量和当前生物标志物以稳定化逆概率权重对治疗启动建模,并将暴露视为时变变量,设定 90 天疗效滞后。
要实现近乎完美的表现,需要既能可靠衡量进展、又能识别模型仍在何处失败的评估。像 GeneBench-Pro 这样的基准可以帮助将模糊的能力缺陷转化为可诊断和改进的问题。
如果智能体能够可靠地自动化这一类分析,它们就可能显著加速科学发现。人类遗传学证据早已成为靶点优先级排序和转化后续研究的核心依据,因为获得遗传学支持的机制要更有可能最终导向获批疗法。
与此同时,测序成本大幅下降,生物样本库规模的数据集如今以前所未有的广度将分子、表型和健康记录信息关联起来。制约因素正从数据生成转向如何将信息转化为可付诸行动的洞见。能够稳定完成目前由人类专家团队承担的分析的模型,有望通过加速假设筛选、靶点后续研究和数据生成与决策之间的迭代循环,彻底改变产业研究。
GeneBench-Pro 代表了一项初步努力,旨在评估经验丰富的科学家所具备的、涉及良好科学判断力的更抽象技能。这些技能使他们能够凭直觉识别最有前景的初始分析,在数据与初始假设相矛盾时迭代并修正思路,并得出下游临床、学术或商业决策可能依赖的结论。
我们预计,随着模型能力不断提升,那些在更高抽象层次上考察模型能力的基准测试将变得越来越有用,其价值将超越仅仅测试书本知识或执行常规分析能力的基准。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com