OpenAI与哈佛等合作研究:o3 Deep Research模型辅助诊断儿童罕见病,额外诊断率4.8%
Using AI to help physicians diagnose rare genetic diseases affecting children
波士顿儿童医院、哈佛大学与OpenAI合作,在《NEJM AI》发表研究。团队使用OpenAI o3 Deep Research推理模型重新分析376例此前未确诊的罕见病案例,产出基于证据的候选解释。经专家评审、额外检测和临床确认,医生在18例中建立诊断,额外诊断率达4.8%。研究显示,AI辅助工作流可帮助专家在未解病例中生成可检验假设,使定期再分析更具可扩展性。模型不直接诊断或做临床决策,仅提供证据链供专家审查。
这是AI辅助罕见病诊断的严肃实证,4.8%的新诊断率在专家反复分析过的病例里相当扎实。虽然离临床落地还很远,但证明推理模型能帮专家从旧数据里挖出新线索。
在《NEJM AI》的一项研究中,专家们使用 OpenAI 的推理模型重新分析了 376 个此前未解决的病例,并为 18 项诊断找到了线索。
在 NEJM AI 阅读该研究摘要
即便有了基因组测序,许多罕见病患者也始终无法获得明确的基因诊断。经过大量检测和专家复核后,大约仍有一半人未能确诊。他们的医疗数据中可能藏有线索,但要找到这些线索,可能需要筛查数千到数百万个可能的基因变异、零散的临床记录,以及快速变化的科学文献。
随着新的基因—疾病关系、病例报告和分类证据不断积累,未解决的病例可能变得可以重新解读。
来自波士顿儿童医院曼顿孤儿病研究中心、哈佛大学和 OpenAI 的研究人员,使用 OpenAI o3 Deep Research 推理模型,分析了 376 个此前已分析但仍未解决的病例的去标识化临床和基因组信息。该模型为研究人员和临床医生呈现了带有证据关联的候选解释,供其审阅。经过专家审阅、额外检测和临床确认,医生在 18 个病例中确立了诊断——在专家此前分析的基础上,额外诊断产出率为 4.8%。这项研究于 2026 年 6 月 18 日发表在 NEJM AI 上,展示了 AI 辅助的研究工作流程如何在重新审视一些最棘手的病例时,帮助专家生成线索。
这些病例中有许多曾躲过多年专家分析。在这项研究中,OpenAI o3 Deep Research 帮助研究人员发现了线索,这些线索随后通过既有的临床流程进行了评估,这表明随着知识不断演进,由专家主导的定期重新分析可能变得更具可扩展性。该模型没有诊断任何患者,也没有做出任何临床决策。它生成的是与证据相关联的假设,供专家审查,并在适当情况下通过额外检测进行调查,并在临床实验室中加以确认。
为什么一个旧病例可能包含新答案
一项无定论的基因检测并不总是永久性的结论。患者表型描述、检测结果和家族史可能分散在使用不同标识符、格式和词汇表的数据库中。将这些记录关联起来很困难,因此即便是专家也可能漏诊。专家也可能在相关基因或其变异尚未被证实与疾病相关之前,就对儿童进行了基因组测序。随着科学知识的进步,同样的数据可以揭示出此前不可能发现的答案。
罕见病重新分析既是科学问题,也是维护问题。患者的基因组可能保持不变,但其周围的证据却在不断变化:研究人员将新的基因和变异与疾病关联起来,实验室对旧变异重新分类,病例数据库和论文不断积累新的观察结果。每一次更新都可能使一个旧的、无定论的病例值得重新审视,因此许多机构继承了一个不断增长的基因组积压,需要与不断变化的知识库保持同步。
在这项研究中,研究人员设计的工作流程让模型充当现有基因组分析流程之上的“解释优先”推理层。模型不只是返回一个排序后的基因,而是被要求将临床特征、遗传模式、变异证据和科学文献串联成一份可供人工审核者质询的论证依据。
再分析是如何进行的
对于每个病例,团队组装了一个去标识化的数据包,其中包含用于描述患者临床表现的标准化 Human Phenotype Ontology 术语、偶尔出现的临床医生笔记及任何描述性临床诊断、年龄和性别等元数据,以及一张经过过滤的变异表。该表记录了每个变异的罕见程度、其对所编码蛋白质的预测影响、ClinVar 分类,以及在可用家庭成员中的信号质量。大多数病例都包含了患儿及其亲生父母双方的数据。
团队要求模型提出最合理的分子解释,并展示其推理过程。随后,研究人员使用临床实验室对遗传变异进行分类时所采用的同一套 ACMG/AMP 框架来审查模型的输出。每个候选结果至少由两名团队成员审查,分歧通过共识解决,模型输出从未被当作诊断结果。只有当合格专家审查了证据、变异被分类为致病性或可能致病性、经 CLIA 认证的实验室予以确认,并且临床团队将结果反馈给家庭之后,一项发现才被计为诊断。
在分析未解病例之前,团队先在已有明确诊断的病例上优化了工作流程。在包含多种罕见病症的51例病例中,该流程在重复运行中为48例找回了正确的基因和变异。在一组57例神经肌肉病例中,该流程在重复运行中为45例给出了正确诊断。在一组15例长读长基因组数据中,它为每一例都指出了正确的基因,并在12例中识别出了两个致病等位基因。这些评估有助于提示词的开发,并表明在哪些环节专家审查仍然不可或缺。
在这些此前已解决的病例中,模型自报的置信度分数与正确诊断相符:始终正确判断的平均最低分为85.6,而错误或未知判断的平均最低分为42.1。这些分数并非经过校准的概率,团队也没有将其作为证据或临床判定的替代品。但它们有助于引导专家审查者聚焦于最有希望的候选诊断。
研究人员的发现
随后,团队将该工作流程应用于四组此前未解决的病例:患有神经发育疾病的儿童、患有罕见神经肌肉疾病的人群、患有早发性精神病的儿童和青少年,以及儿科突发意外死亡病例。这些并非等待首次审查的新病例。许多病例已经过多个商业或机构流程的检查,并经过多学科团队的讨论。
各队列结果
队列 | 病例 | 已发现的诊断 | 检出率 |
神经发育 | 100 | 10 | 10.0% |
神经肌肉疾病 | 61 | 4 | 6.6% |
儿科突发意外死亡 | 200 | 2 | 1.0% |
早期精神病 | 15 | 2 | 13.3% |
总计 | 376 | 18 | 4.8% |
早期精神病队列规模较小,因此其百分比具有较宽的置信区间。检出率也反映了每个队列存在单基因解释的可能性有多大。
在模型筛选出候选结果、专家完成审核与临床确认之后,医生对 4.8% 的病例确立了诊断。这一比例虽然不高,但在此人群中具有重要意义,因为此前的专家审核未能解决这些病例。类似的再分析研究报告称,在经过大量审核的病例中,增益仅为个位数;更高的检出率通常来自包含新病例或已知有待基因确认的罕见病的研究。
在 18 例诊断中,有 7 例是重新发现:这些诊断是在当地研究工作流程之外确立的,但未出现在团队所审核的记录中。在若干案例中,这些变异已在公共数据库中被列为致病性或可能致病性,凸显了跨数据源整合信息在操作层面的挑战。
在识别变异时展现出灵活性
在一个早期精神病病例中,模型推断出基因组中存在一个输入数据中并未列出的结构事件。它将22号染色体上一段低质量检出结果与患儿的心脏、免疫、神经发育和精神特征联系起来,进而假设存在一个与DiGeorge综合征相关的22q11.2缺失。这一假设性变异随后通过后续基因组测序得到了确认。
尽管提示词要求给出一个单基因病因,模型有时会给出两个能更好解释复杂表型的基因。在一个病例中,LAMA2和FOXP1的变异共同帮助解释了肌肉和神经发育方面的特征;另一个病例则涉及TTN和SRPK3,呈现出此前未被识别的双基因解释。
提出可检验且生物学上自洽的假设
除诊断之外,模型还为一种名为白癜风的疾病识别出一种可能的新机制解释。在一个神经发育病例中,模型指出一名白癜风患者的S1PR1存在一个11个氨基酸的缺失。S1PR1编码一种参与信号传导、免疫细胞迁移和组织生物学的细胞表面受体。模型整合证据表明,该缺失可能以改变受体结构和信号传导的方式,既减少色素生成,又帮助免疫细胞在皮肤中持续存在。
所提出的 S1PR1 与白癜风之间的关系还需要更多实验验证,但它展示了 AI 在将结构生物学、免疫学和临床遗传学中零散的发现转化为具体、可检验的假设方面所能发挥的强大作用。
团队还在神经肌肉队列中观察到了可能的表型扩展。HSPB8 和 CDK13 中的致病性变异与该基因最广为人知的疾病并不完全吻合,提示存在更广泛的临床谱系,需要更多病例和实验室工作来加以验证。
案例研究:Kyra 在近二十年后获得诊断
事情始于空手道课上,Kyra 的母亲注意到她 9 岁的女儿在做马步时不再像以前那样蹲得那么低。Kyra 在足球训练中也开始变慢,走路和跑步时总是踮着脚尖。她的儿科医生无法确定她肌肉无力的原因,于是将她转诊给了一位专科医生。此后是近 20 年的求医之路,经历了各种检查、治疗和会诊,却始终未能获得诊断。
Kyra 的病例是神经肌肉队列中浮现的四个诊断之一。团队将她的病情与 HSPB8 中的一个移码变异联系起来,诊断出了一种肌原纤维肌病,在这种疾病中,异常的蛋白质结构在肌纤维中积聚并导致肌无力。Manton Center 的一位遗传咨询师在 Kyra 28 岁生日前大约一周给她打了电话。
那时,Kyra 一生中大部分时间都在适应这种疾病。到 13 岁时,她已经依赖呼吸机并坐上了轮椅,不过她的病情此后已趋于稳定。尽管 Kyra 所患的这种肌原纤维肌病极为罕见,人们对其长期病程知之甚少,但这一诊断还是带来了一定程度的了结。
局限性
这项研究表明,通用推理模型能够将表型、遗传方式、变异注释、数据质量模式以及科学文献整合为可供审查的假设,从而为回顾性基因组再分析做出贡献。它也说明了为何定期再分析至关重要:有些答案只有在知识进步或零散的记录被汇集到一起之后才会浮现。
这项研究并不能证明患者、临床医生或客户应当使用 OpenAI 模型来诊断疾病或做出医疗决策。它并未描述或认可 OpenAI o3 Deep Research、ChatGPT 或任何其他 OpenAI 产品用于诊断的预期客户用途。该模型没有诊断任何参与者;所有诊断均由医生及其他合格的临床专家通过既定的审查、检测和临床确认流程做出。
该研究为回顾性研究,队列具有异质性,且审查者未对模型置信度设盲。研究人员没有测量节省的时间、成本、临床医生的工作量、假阳性带来的工作负担或护理方面的变化。他们也没有系统性地评估其他形式的遗传变异,例如结构变异、重复扩增、深内含子改变或嵌合现象。
大语言模型可能会误读上下文,或给出乍看合理、细究之下却站不住脚的解释。因此,每一项结果都经过了人工裁定和临床确认。模型拓宽了搜索范围,并为后续由人类主导的分析聚焦了方向;它并不决定应当向一个家庭返回哪些信息或何种诊断。
本研究使用的是去标识化信息,未在获批环境之外使用或传输任何受保护的健康信息。更广泛的临床部署将需要对隐私、安全、可审计性以及当地法规给予同样的重视,这与所有医疗服务所适用的要求一致。获得模型访问权限并不能取代测序基础设施、遗传咨询、验证性检测或专家判断。

“瓶颈在于时间。一位专家每天能投入到任何一个人身上的精力终究是有限的。”
Catherine Brownstein 医生,波士顿儿童医院 Manton 罕见病研究中心

“像 Catherine 和我这样的研究人员,不可能把 8,000 种不同的疾病都记在脑子里。这就是 AI 的力量所在。”
Alan Beggs,Manton 罕见病研究中心主任
接下来会怎样
前瞻性、多中心研究应将 LLM 辅助的再分析与标准实践进行比较,评估指标包括诊断率、得出候选诊断所需时间、临床医生工作量、假阳性负担、成本以及对诊疗的影响。带版本管理的提示词、参考核查、审计日志和经过校准的不确定性,对于可复现性和安全性将十分重要。此类研究仍需要合格的临床医生来评估证据、开具适当的检查,并做出任何诊断或治疗决策。
本研究使用了 OpenAI o3 Deep Research。较新的通用模型能够检索并综合更多科学材料,而诸如 GPT‑Rosalind 这类专用系统则专为更深入的生命科学工作而设计,包括变异对蛋白质结构和功能的影响。这些能力未在本研究中接受测试,将需要各自独立的评估和访问控制。
尽管 OpenAI 为这项初步研究提供了支持,Manton Center 将通过 OpenAI Foundation 的一笔资助来主导下一阶段的工作。该资助将支持该中心更广泛的努力,即开发一个与平台无关、低成本的遗传学 AI copilot,帮助临床团队更快速、更一致地分析罕见病病例。
更长期的研究机会在于探索由专家主导的 AI 辅助再分析能否帮助科学理解跟上发现的步伐。其前景并非 AI 取代医生的诊断,而是经过审慎评估的研究工具可能帮助专科医生识别值得进一步调查的证据。对于成千上万个家庭而言,当今悬而未决的问题不必永远没有答案。
来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com