跳到正文
北京时间
原文
Microsoft AI:官方博客·· 2025-07-01精选AI 评分72

Microsoft 发布 MAI-DxO 诊断研究,在 SD Bench 上诊断准确率达 85%,超过医生四倍

The Path to Medical Superintelligence

AI 导读

Microsoft AI 发布 MAI-DxO 诊断编排器研究,在由 304 个 NEJM 病例构建的 SD Bench 序贯诊断基准上,最高正确诊断 85% 的病例,是受测经验丰富医生组的四倍以上,且花费更低。研究基于 2024 年底启动的消费级健康项目,目前仅为研究演示、未获临床使用批准,论文以预印本形式发布并正在提交外部同行评审。

推荐理由

原文同时给出诊断准确率与虚拟成本两个维度的结果,并明示研究局限和未开放状态,读者可据此评估医疗 AI 的实际边界。

正文 · AI 翻译

Two people sit across from each other having a conversation. One, with gray hair and a mustache, wears a blue suit; the other, with dark hair and glasses, wears an orange jacket. A notebook and pen are on the table between them.

我们以《新英格兰医学杂志》每周发布的真实世界病例记录为基准进行测试,结果表明,Microsoft AI Diagnostic Orchestrator(MAI-DxO)能够正确诊断高达85%的NEJM病例,这一比率是一组经验丰富的医生的四倍以上。MAI-DxO 还能以比医生更具成本效益的方式得出正确诊断。

随着医疗保健需求持续增长,成本以不可持续的速度攀升,数十亿人面临着获得更好健康的诸多障碍——包括不准确和延迟的诊断。越来越多的人转向数字工具寻求医疗建议和支持。在微软的 Bing 和 Copilot 等 AI 消费产品中,我们每天看到超过 5000 万次与健康相关的会话。从首次查询膝盖疼痛到深夜搜索紧急护理诊所,搜索引擎和 AI 助手正迅速成为医疗保健的新前线。

我们希望做更多来提供帮助——并相信生成式 AI 可以带来变革。正因如此,2024 年底,我们在 Microsoft AI 启动了一项专门的消费者健康工作,由临床医生、设计师、工程师和 AI 科学家领导。这项工作补充了微软更广泛的健康计划,并建立在我们对合作与创新的长期承诺之上。现有解决方案包括 RAD-DINO,它有助于加速和改善放射学工作流程,以及 Microsoft Dragon Copilot,这是我们为临床医生开创的语音优先 AI 助手。

要让 AI 发挥作用,临床医生和患者都必须能够信任其表现。这正是我们新的基准测试和 AI 编排器发挥作用的地方。

医学病例挑战与基准测试

要在美国行医,医生需要通过美国医师执照考试(USMLE),这是一项对临床知识和决策能力的严格标准化评估。USMLE 题目是最早用于评估医学 AI 系统的基准之一,提供了一种结构化的方式来比较模型表现——既包括模型之间的比较,也包括与人类临床医生的比较。

短短三年内,生成式 AI 已发展到在 USMLE 及类似考试中取得近乎满分成绩的水平。但这些测试主要依赖多项选择题,这更有利于记忆而非深度理解。通过将医学简化为多项选择题的一次性答案,此类基准夸大了 AI 系统的表面能力,并掩盖了其局限性。

在 Microsoft AI,我们正致力于推进和评估临床推理能力。为了超越多项选择题的局限,我们专注于序贯诊断,这是现实世界医学决策的基石。在这一过程中,临床医生从患者初始表现开始,然后迭代地选择问题和诊断测试,以得出最终诊断。例如,一名表现为咳嗽和发热的患者可能会促使临床医生开具并审查血液检查和胸部 X 光片,然后才有信心诊断肺炎。

每周,《新英格兰医学杂志》(NEJM)——世界领先的医学期刊之一——都会发布麻省总医院的一份病例记录,以详细、叙述性的形式呈现一位患者的诊疗历程。这些病例是临床医学中诊断最为复杂、对智力要求最高的病例之一,通常需要多位专科医生和诊断测试才能得出明确诊断。

AI的表现如何?为了回答这个问题,我们基于NEJM病例系列创建了交互式病例挑战——我们称之为序贯诊断基准(SD Bench)。该基准将304个近期的NEJM病例转化为逐步诊断遭遇,模型——或人类医生——可以迭代地提问并开具检查。随着新信息的出现,模型或临床医生更新其推理,逐渐缩小范围以得出最终诊断。然后可以将该诊断与NEJM发布的黄金标准结果进行比较。

每项要求的检查也会产生(虚拟)成本,反映现实世界的医疗支出。这使我们能够在两个关键维度上评估表现:诊断准确性和资源消耗。您可以通过这个短视频观看AI系统如何完成其中一项挑战。

下一步是什么?

医生通常以其专业知识的广度或深度为特征。全科医生,如家庭医生,管理跨越年龄和器官系统的各种疾病。专科医生,如风湿病学家,则深入专注于单一系统、疾病领域甚至特定病症。然而,没有一位医生能够涵盖NEJM病例系列的全部复杂性。另一方面,AI不受这种权衡的限制。它可以融合专业知识的广度和深度,在临床推理的许多方面展现出超越任何单个医生的临床推理能力。

这种推理有可能重塑医疗保健。AI可以帮助患者自我管理常规护理,并为临床医生提供针对复杂病例的高级决策支持。我们的发现还表明,AI可以减少不必要的医疗成本。美国的医疗支出接近美国GDP的20%,其中高达25%估计被浪费——即对患者结果影响甚微。

当然,我们的研究有重要的局限性。尽管MAI-DxO擅长应对最复杂的诊断挑战,但仍需要进一步测试以评估其在更常见、日常表现中的性能。我们研究中的临床医生在没有同事、教科书甚至生成式AI的情况下工作,而这些可能在他们正常的临床实践中存在。这样做是为了能够与原始人类表现进行公平比较。

这项工作的一个新方面是其对成本的关注。虽然现实世界的医疗成本因地域和系统而异,并包括许多我们未考虑的下游因素,但我们对所有评估的代理和医生应用一致的方法,以帮助量化诊断准确性和资源使用之间的高层权衡。

对我们而言,这只是第一步。我们对前方的机遇感到振奋。在生成式 AI 能够安全、负责任地部署到医疗健康领域之前,仍存在重要挑战。我们需要来自真实临床环境的证据,以及适当的治理和监管框架,以确保可靠性、安全性和有效性。这就是为什么我们正与领先的医疗机构合作,严格测试和验证这些方法——这是在更广泛推广之前必不可少的一步。

与我们的合作伙伴一起,我们坚信医疗健康的未来将由人类专业知识和同理心与机器智能的力量相结合来塑造。我们很高兴能迈出下一步,让这一愿景成为现实。

更多信息

SD Bench 和 MAI-DxO 仅为研究演示,目前尚不可作为公开基准或编排器使用。您可以在与本博客同期发布的预印本论文中,找到有关底层方法和结果的更多细节。我们正在将这项工作提交外部同行评审,并积极与合作伙伴探索将 SDBench 作为公开基准发布的可能性。

致谢

我们感谢 NEJM Group 允许我们在本博客文章所报告的研究中使用 NEJM 病例。此处描述的研究受益于许多人的见解。我们感谢 arXiv 论文上署名的作者以及 MAI 更广泛的团队。我们还感谢微软内外更多同事分享他们的见解,包括 Bryan Bunning、Nando de Freitas、Andrija Milicevic、Hoifung Poon、David Rhew、Karén Simonyan、Eric Topol 和 Jim Weinstein。Gianluca Fontana 和 Kevin
Hawkins(Prova Health)在卫生经济学与结果部分提供了支持。

查看出版物

问答

这种 AI 用于医疗健康安全吗?

这里展示的工作尚未获准用于临床,只有在经过严格的安全测试、临床验证和监管审查后才会获得批准。目前,这代表着令人兴奋的初步研究。在任何将这项技术部署到现实世界的计划中,核心都是我们对安全、信任和质量的承诺,确保任何医疗健康解决方案都基于临床、设计合乎伦理且沟通透明。

AI 会取代医生吗?

虽然 AI 正在成为医疗健康领域的强大工具,但我们的执业临床医生团队认为,AI 是对医生和其他卫生专业人员的补充。尽管这项技术正在迅速发展,但他们的临床角色远不止做出诊断。他们需要应对不确定性,并以 AI 无法做到的方式与患者及其家人建立信任。我们相信,临床角色将随着 AI 而演变,使临床医生能够自动化常规任务、更早发现疾病、个性化治疗方案,并有可能预防某些疾病。对消费者而言,这将为自我管理和共同决策提供更好的工具。

什么是 AI 编排器?

在生成式AI的背景下,编排器就像一个数字指挥,帮助协调实现复杂任务的多个步骤。在医疗保健领域,鉴于每个决策都关乎重大,编排的作用至关重要。我们的编排器位于底层语言模型之上,确保诊断过程中的每一步都得到系统化处理,降低未来出错的风险,并提供必要的稳定性、一致性和透明度,从而最终赢得用户的信任。

你们为什么研究成本问题?

我们最初想了解AI是否只是为了得出正确诊断而请求过多的诊断检查。我们发现,我们的编排器能够以远低于测试成本的代价得出正确答案。从某些方面来看,这并不令人意外,因为过度诊断检测已被公认为一个普遍存在的挑战,在美国每年造成数百万次不必要的检测。这项工作表明,AI为临床医生和消费者创造了一个机会,能够在降低成本的同时实现更快、更准确的诊断。

来源:Microsoft AI:官方博客 · microsoft.ai