LifeSciBench 发布
Introducing LifeSciBench
2026 年 6 月,OpenAI 联合 173 位博士级生命科学家发布 LifeSciBench 评测基准,涵盖 750 个真实研究任务,覆盖证据处理、分析、设计优化等七个工作流及七个生物领域。每项任务配有约 25 条细化评分标准(共 19,020 条),评估模型的科学正确性与实用价值。79% 的任务需多步推理,53% 要求解读图表、PDF 等附件数据,旨在衡量 AI 在复杂、不确定的研究任务中的实际能力,而非仅回答结构化问题。
OpenAI 这个基准请了 173 位博士级科学家出题,第一次把 AI 评估拉到真实科研决策里。结果很实在:前沿模型在需要结合复杂图表、设计实验的任务上仍然乏力,做 AI for Science 的团队值得拿来校准预期。
智能体式 AI 系统在执行科学任务方面的能力正日益增强。然而,它们对生命科学研究人员的实用价值,取决于它们能在多大程度上应对真实研究的复杂性。这类工作很少表现为单一的事实回忆题或干净的预测问题。研究人员需要解读不完整的证据、调和相互矛盾的结果、设计高难度实验、排查检测方法故障、评估转化风险,并在不确定条件下决定下一步该做什么。
当前的基准测试并未充分覆盖这些能力。许多生命科学评测聚焦于狭窄领域或孤立技能,因而题目往往采用结构化的问题格式并配有干净的参考答案。这些评测虽有价值,却常常无法真正评估一个模型能否在更广泛的研究级工作中作出贡献。
我们设计了 LifeSciBench,以帮助弥合这一差距。每一项任务都建立在执业生命科学家的判断之上,他们拥有 Ph.D. 级别的训练,并具备在生物技术和制药环境中推进药物发现项目的直接经验。
LifeSciBench 包含 750 项由专家编写的任务,覆盖七类工作流程和七个生物学领域。
任务工件
科学家贡献者
评分标准细则
专家评审员
LifeSciBench 衡量什么
LifeSciBench 衡量的是 AI 系统能否支持真实的生命科学研究任务,而不仅仅是回答生物学问题。为了定义该基准的分类体系,我们调查了在职生命科学家,了解他们在应用研究场景中最常使用的工作流程。随后,我们将他们的回答归纳为七个反复出现的类别:证据处理、分析与设计优化、科学推理、验证与运营、转化、以及科学传播。
每个任务的结构都类似于科学家向一位知识渊博的合作者提出的请求:科学提示词、任何相关上下文或材料,以及自由作答的答案。由专家编写的评分标准评估模型能否针对特定问题给出正确答案,并具备科学家所期望的恰当详细程度、论证依据、注意事项和格式。
数据集构建
LifeSciBench 在评估科学推理能力的同时,也评估真实世界科学应用所必需的、定义不那么明确的实践技能。其任务要求模型处理真实的研究问题:解读证据、做出有领域依据的判断,并传达对专家评审者有用的结论。许多任务还要求模型处理不确定性,并基于支撑数据文件进行推理,而非仅依赖提示词文本。
该基准旨在反映生命科学工作的复杂性。总体而言,79% 的任务需要多个推理或决策步骤,每个任务平均需要四步。LifeSciBench 包含 1,062 个附件材料,涵盖图表、PDF、表格、序列文件、结构或化学文件以及网络参考资料。超过半数任务(53%)要求模型解读或综合至少一个附件中的信息。
任务由 173 位来自不同生命科学学科的专家科学家创建。每位科学家均具有博士级训练背景以及生物技术或制药行业经验。任务在被接受前可经历任意多轮修订,轮数不设固定上限;被接受的任务平均经历六轮自主自动化审查,并至少完成两轮专家评审。评审以可验证的正确答案或强有力的专家共识为依据,相关领域评审者之间的一致率至少达到 90%。这一流程有助于确保被接受的任务具有科学依据、清晰度足以评分,并能代表应用研究。
评分与评分标准细分
LifeSciBench 任务采用详细的、针对具体任务的评分标准进行评分,该标准将预期回答拆解为具体的科学论断、计算、决策、论证等。在整个基准中,由专家制定的评分标准包含 19,020 条准则——平均每个任务 25 条——用以评估科学正确性以及对研究决策的实用性。
这一设计反映了科学工作在实践中是如何被评估的:许多生命科学任务无法仅通过检查最终答案来评分。一个回答可能得出了正确的高层次结论,但如果它例如忽略了某项关键的实验局限,或未能主动提出一个具有高度重要性的生物学细微之处,仍可能被判定为不完整。反过来,一个部分完成的回答即便没有完全解决任务,也可能包含高质量的推理。
细粒度的评分标准捕捉到了这种细微之处。LifeSciBench 不仅评估最终答案的准确性,还评估模型是否以科学上有效且操作上有用的方式得出其答案。
从论文、图表、表格和实验记录中提取、核对并审计科学证据。
评估示例
我们正在筹备一场关于 AAV9-microDys-X 的 FDA Type B 会议,这是一种基于 AAV9 的 micro-dystrophin 基因疗法,用于杜氏肌营养不良症,由 MCK 启动子表达一个 138 kDa 的构建体,我们希望对我们当前的申报资料包进行一次严厉的批判性审视,看它是否真正支持以 micro-dystrophin 表达作为替代终点、且该终点合理可能预测临床获益,来获得加速批准。
研究背景:一项开放标签的 1b/2 期研究,纳入 12 名 4–7 岁可行走的男孩,均已确诊 DMD 且携带框外 rod 结构域缺失。申报资料包如下:
- 治疗前股外侧肌活检:使用针对 N 端肌动蛋白结合结构域的 MANEX1A 进行定量 Western blot,结果为健康对照 dystrophin 的 0–3%。
- 治疗后 12 周对侧股外侧肌活检:采用同一 Western blot 检测,以考马斯染色归一化至总蛋白后,平均 micro-dystrophin 为健康对照的 38%(范围 18–61%)。
- 治疗后免疫荧光:使用多克隆抗 dystrophin C 端抗体,75–95% 的肌纤维显示肌膜信号。
- 48 周功能:NSAA 较基线平均变化 +1.4 分,而外部已发表自然史注册队列为 −0.6 分(非配对 t 检验 p = 0.03)。
- 安全性:8/12 例患者出现一过性转氨酶升高,经激素减量处理;1 例心肌炎已缓解;无死亡。
- 生物分布/持续性:12 周时肌肉中可检测到 AAV9 载体基因组,平均为每个细胞核 2.3 个载体基因组。
- 入组条件:基线无抗 AAV9 中和抗体(滴度 <1:400),且无外显子 44 缺失。
请逐项对这一申报材料进行压力测试:FDA 或持怀疑态度的审评者会在哪些地方指出,按目前呈现方式,证据不足以支持我们的结论;如果可能,需要哪些额外数据、分析或设计变更来弥补这些缺口?对于任何未明确说明的内容,假定截至 2025 年 12 月 31 日从其他临床级 138 kDa micro-dystrophin 项目和相关临床试验中已知的信息同样适用。
候选回复
结论: 就目前呈现的内容而言,该申报资料不足以支持以微肌营养不良蛋白表达作为替代终点获得加速批准——该终点需合理可能地预测临床获益。持怀疑态度的 FDA 审评员很可能认为,生物标志物、功能性、持久性、安全性以及可推广性方面的证据均存在实质性不足。
| 申报资料条目 | 关键失败模式 | 所需补充内容 |
|---|---|---|
| Western blot 定量 | MANEX1A 结合的是内源性全长肌营养不良蛋白与微肌营养不良蛋白转基因共有的 N 端表位,因此该检测方法无法清晰区分转基因与残留/回复型肌营养不良蛋白。此外,以健康人全长肌营养不良蛋白作为标准品来定量 138 kDa 的微肌营养不良蛋白也是不合理的。 | 使用重组微肌营养不良蛋白标准品,并采用能够区分转基因与内源性肌营养不良蛋白的正交方法,例如靶向质谱法或转基因特异性/表位特异性检测。 |
| 免疫荧光 | C 端多克隆抗体并不适用,因为该 138 kDa 构建体缺乏 C 端结构域。许多 DMD 患者存在回复型肌纤维,而回复型肌营养不良蛋白可保留 C 端表位。回复型肌纤维可能随年龄增长而克隆性扩增,从而对免疫荧光信号产生偏倚,在年龄较大的男孩中尤为明显。 | 用针对转基因中存在、而回复型抗肌萎缩蛋白中不存在的表位的抗体,重复免疫荧光(IF)检测。将转基因阳性纤维与回复型纤维分别定量。 |
| 替代终点的有效性 | 该材料将蛋白量与临床功能混为一谈。"健康对照蛋白量的38%"并不意味着正常抗肌萎缩蛋白功能的38%,因为微型抗肌萎缩蛋白在结构上是截短的。 | 在将表达量作为替代终点之前,需通过实证验证微型抗肌萎缩蛋白质量百分比、肌膜定位、下游功能恢复与临床获益之间的关系。 |
| 活检设计 | 治疗前和治疗后的对侧股外侧肌活检会引入左右侧及肌内空间变异性。疾病进展和纤维脂肪替代也可能改变以总蛋白归一化的信号。 | 使用一致的解剖标志标准化活检部位,以肌肉特异性蛋白进行归一化,并同步测量纤维脂肪组成。 |
| NSAA 对照/统计 | 外部自然病史队列并非随机同期对照。试验入组标准、支持性治疗、参与效应、基线 NSAA、类固醇方案、年龄以及外显子类别都可能使比较产生偏倚。非配对 t 检验并不充分。此外,+1.4 的 NSAA 变化在该年龄组的重测变异范围内。 | 开展随机同期安慰剂对照研究,或至少采用校正分析,纳入基线 NSAA、年龄、类固醇方案、外显子类别及其他混杂因素。 |
| 年龄窗口混杂 | 4–7 岁男孩正处于发育窗口期,未经治疗的可行走 DMD 患者可能在该阶段先获得运动功能,之后衰退才占主导。48 周的 NSAA 变化混合了发育性增益、疾病进展以及可能的治疗效果。 | 采用按年龄分层的同期随机对照,以将发育轨迹与治疗效果区分开来。 |
| 既往临床先例 | 开放标签 micro-dystrophin 功能性信号未能可靠预测确证性获益;已发表的先例包括 micro-dystrophin 基因治疗确证性试验未能重现开放标签 NSAA 改善。 | 不要依赖开放标签 NSAA 变化作为决定性支持。需要受控的功能性证据。 |
| 该构念的结构性局限 | 138 kDa 构建体缺失了血影蛋白重复序列 R16/17,而该区域包含 nNOS 结合位点。nNOS 募集缺失会损害运动期间的功能性交感溶解和缺血保护,从而在机制层面形成独立于表达水平的救援上限。 | 补充机制研究,以说明这一特定构建体是否能恢复相关的抗肌萎缩蛋白相关复合物功能、nNOS 定位、运动生理学以及肌肉保护。 |
| AAV 持久性 | 12 周时的载体基因组并不能确立持久表达。AAV9 基因组主要是非整合型游离体,可能随时间推移而减少。载体基因组的持续存在并不等同于持续的蛋白表达。 | 测量 12 周之后的纵向转基因蛋白表达和功能性生物标志物持久性。 |
| 免疫/安全性特征 | 8/12 例患者出现转氨酶升高,这与对 AAV 转导细胞的免疫反应一致,但其机制尚未确立。鉴于 AAV9 的心脏嗜性,1 例心肌炎病例令人担忧。 | 提供更深入的免疫监测、肝脏/心脏安全性表征,并加强心脏随访。 |
| 患者选择/可推广性 | 排除抗AAV9中和抗体阳性的患者限制了普遍适用性。排除外显子44缺失限制了其对这一DMD亚组的适用性。n=12的样本量太小,无法在更广泛的DMD人群中表征安全性和有效性。 | 在可能的情况下放宽入组资格,或在将结果用于支持广泛批准之前,预先设定按抗体状态、基因型/外显子类别、年龄和基线功能进行的分层分析。 |
监管结论:该申报资料可能显示出生物学活性,但尚不能确立所测得的微型抗肌萎缩蛋白表达是一个可靠且合理可能预测临床获益的替代终点。主要缺口包括:检测方法的特异性、无效的定量标准、可能的回复纤维混杂、缺乏随机对照、年龄相关的NSAA混杂、持久性不确定,以及尚未解决的安全性和普遍适用性问题。
为弥补这一缺口,该研发项目需要一项受控的、按年龄分层的临床设计,配备转基因特异性表达检测、正交蛋白定量、组织成分对照、纵向持久性数据、针对截短构建体的机制性功能检测,以及更强的安全性监测,尤其是肝脏和心脏方面。
评分标准与等级
标准
分值
指出 micro-dystrophin 定量中的检测/测量问题,包括 MANEX1A 表位共享、全长 dystrophin 标准品无效,以及需要采用重组或正交的转基因特异性测量方法。
解释为何 micro-dystrophin 表达水平并不自动构成功能性临床获益的有效替代指标。
指出活检部位、组织组成和年龄窗口等混杂因素会削弱表达量与 NSAA 解读的可靠性。
批评 NSAA 的对照/统计方法,尤其是对外部自然病史对照的依赖。
讨论 AAV 持久性、免疫反应、转氨酶升高、心肌炎,以及需要更长期的表达/安全性随访。
指出患者选择/可推广性方面的不足,包括排除抗 AAV9 阳性者、排除 exon-44 以及样本量小。
验证 LifeSciBench
我们通过独立专家评审对 LifeSciBench 进行了验证。反馈来自 453 名未参与任务编写的评审人。在这些评审人中,97% 拥有 Ph.D. 或同等博士学位,平均拥有 12 年领域经验和 14 篇同行评审发表论文;88% 报告至少获得过一项奖项或 fellowship。
评审人员对每项任务是否体现了成为高质量基准问题所需的特质进行了评分:是否与真实世界的研究工作相符、是否恰当地考察了科学推理与领域专业知识、是否有证据或专家共识作为依据,以及对于评估模型性能的整体实用性。每个类别的评分一致率均超过 96%。
真实世界相关性
这项任务是否反映了真实的现实世界生命科学工作?
强烈同意 90.4%
总体同意 98.3%
科学推理 / 领域技能
这项任务是否考察并评估了正确的科学推理和生命科学领域技能?
强烈同意 86.4%
总体同意 98.1%
科学依据
这项任务是否有科学依据、可作答,并锚定于适当的证据、数据、材料或专家共识?
强烈同意 77.1%
总体同意 96.5%
整体实用性
总体而言,这是否是一项高质量的生命科学评估任务?
强烈同意 79.1%
总体同意 96.6%
评审员的评论印证了量化评分:
“总体而言,这是一项高质量的任务,因为它有一个正确的核心解读,同时又留有空间,可以根据对不确定性界定的严谨程度来区分更优的答案。”
“这是一道出色的提示词……它融合了结构生物学、药物化学、受体药理学以及配体作用机制等多个要素。”
“它并非简单地测试模型能否回忆信息,而是测试模型能否根据当下展示给它的证据进行推理。”
结果
我们报告两项互补的指标。通过率是模型达到任务级成功阈值 70% 的任务所占百分比。得分是评分标准的平均奖励,即使任务未完全解决,也会对各项单独标准给予部分分数。两者都很重要,因为对一项科学任务的回答可能部分正确或有参考价值,却未满足完整答案的全部要求。
模型表现因任务类型、工作流程和回答格式的不同而差异显著。
AI 系统在哪些方面展现出早期优势
LifeSciBench 表明,前沿模型在涉及科学综合、沟通和结构化解读的任务上相对最强。绝对通过率仍然不高,因此这些基准领域远未饱和,但 GPT‑Rosalind 相比 GPT‑5.5 展现出有意义的进步,整体精确通过率从 25.7% 提升至 36.1%。
模型能力提升最强劲的方向出现在科学沟通与转化。例如,科学沟通的通过率从 GPT‑5.5 的 56.3% 提升至 GPT‑Rosalind 的 71.1%;该类别样本量较小(n=9),因此应谨慎解读,但它表明前沿模型在组织证据并产出有说服力的面向专家的解释方面正在快速进步。转化(药物开发中"从实验台到病床"的过程)呈现出类似模式,从 GPT‑5.5 的 36.8% 上升至 GPT‑Rosalind 的 57.7%,表明模型在将临床前证据与临床意义相连接的能力上正在快速提升。
评分标准层面的结果指向同一方向。在需要专家可用或可操作输出的任务上,GPT‑Rosalind 得分为 44.7%,而 GPT‑5.5 为 29.1%。在需要处理不确定性和注意事项的任务上,其得分为 44.8%,而 GPT‑5.5 为 29.3%。这一模式表明,当任务具有明确的证据边界并要求结构化科学判断时,模型最为有用。
GPT‑Rosalind 在由行业和学术专家认定的具有科学价值的任务上表现领先。
GPT‑Rosalind 在核心生命科学工作流上的表现优于 GPT‑5.5,其中在翻译和科学传播方面提升最为显著。
AI 系统仍有不足的地方
在工件密集、设计密集以及受操作约束的科研工作上,表现仍然弱得多。具体而言,设计、优化与预测仍然是最难的工作流之一,GPT‑Rosalind 的通过率为 30.7%;分析同样困难,为 30.3%。
工件使用是一个尤为明显的短板。尽管 GPT‑Rosalind 在工件密集的场景中表现优于 GPT‑5.5,但其通过率仍从纯文本任务上的 45.1% 下降到带工件或 URL 任务上的 28.1%。GPT‑5.5 也呈现同样的模式,从 29.9% 降至 21.9%。更详细的分析证实,前沿模型在从复杂图表或大型序列文件中提取信息,并将这些信息整合进最终答案方面存在困难。
当任务需要基于来源的推理或处理工件时,通过率会下降
答案格式也很重要。要求精确序列、结构或构造级输出的任务通过率更低:GPT‑Rosalind 在数值任务上仅达到 14.8%,在序列或结构输出上为 24.0%。构造生成类任务同样脆弱,GPT‑Rosalind 为 27.3%,相较 GPT‑5.5 几乎没有提升。这一差距部分可能反映了精确答案任务更严格的评分标准——计算或格式上的微小差异就可能导致回答低于通过阈值。尽管如此,这些失败在科学上仍有意义,因为许多生命科学工作流要求输出足够精确,能够直接使用,例如 CRISPR/HDR 供体设计或 siRNA 设计。
模型也常常只完成了一部分,而未能完全解决任务。在大约 14% 的任务中,模型尽管未达到精确通过阈值,却获得了可观的评分标准得分。对 GPT‑Rosalind 而言,有 109 个任务的通过率低于 20%,但仍获得了至少 50% 的评分标准奖励。在实践中,这意味着模型可能识别出相关证据或给出看似合理的部分答案,但仍会失败,因为它们遗漏了关键约束、使用了错误的证据、计算不完整,或未能将其推理与有科学价值的最终决策联系起来。
局限与下一步
LifeSciBench 是朝着衡量 AI 系统对生命科学研究有多大用处迈出的一步,但它不能替代在真实研究环境中对模型的研究。该基准聚焦于反映反复出现的行业工作流的自包含任务,同时将许多科学专业领域和任务类型排除在当前范围之外。真实研究是迭代的:科学家收集新证据、修正假设、设计后续实验,并随着结果的出现调整计划。
因此,在 LifeSciBench 上的强劲表现应被解读为具备真实任务级能力的证据,而非对下游研究影响力的直接衡量。该基准植根于行业工作流程,但它并未涵盖实际研究项目的全部多样性或动态变化,在这些项目中,进展取决于随时间逐步展开的各种因素。
下一步是将基准表现与实际研究流程中的部署研究联系起来。尽管 LifeSciBench 是与从业科学家共同开发的,但要衡量 AI 系统是否能加速发现或改善研发成果,需要在真实研究环境中、在更长的时间跨度内、跨越多轮推理、反馈和实验跟进,来研究模型的使用情况和表现。
参与其中
帮助塑造下一代生命科学 AI 基准,或申请获取 GPT-Rosalind 的访问权限。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com