跳到正文
北京时间
原文
The Decoder:AI News(RSS)· Maximilian Schreiner·· 2026-06-18精选AI 评分78

Nature两篇研究:MIRA和AMIE诊断与治疗计划媲美甚至超越医生

AI systems rival doctors in new Nature studies, but one result suggests the tech won't age well

AI 导读

德国团队开发的MIRA智能体在模拟电子病历中操作85,000种选项,500余例急诊诊断准确率88.9%,对比测试(311例)得分87.8%,高于资深专科医生(78.1%)和混合团队(71.1%)。MIRA在阑尾炎(98.6%)和胰腺炎(92.3%)最佳,未发现危险药物交互或剂量错误,性能不受语言影响,代码已公开。谷歌AMIE采用双智能体架构,在100个多访视病例中治疗计划适切率95%(初级保健医生72%),并在药物知识基准RxQA上超过医生。两项研究均警告模拟环境与现实存在差距,实际性能可能更低。

推荐理由

两项 Nature 研究把 AI 诊断推到了和医生掰手腕的水平,但更值得关注的是那个被埋起来的实验:更强的模型一上来,精心搭建的 double-agent 架构几乎归零。医疗 AI 的护城河可能不是架构而是接入院内系统的能力。

正文 · AI 翻译

Image description

发表在《Nature》上的两项新研究表明,专门化的 AI 系统在模拟患者病例中诊断疾病并做出治疗决策的能力与医生相当,有时甚至更胜一筹。这两个系统所运行的基础模型都已过时。

专为医学打造的 AI 程序正越来越接近真正的临床价值。这是同时发表在 Nature 上的两篇论文所传达的结论。德国系统 MIRA 在诊断胰腺癌和肺炎等疾病方面表现优于医生。Google 的系统 AMIE 则给出了更准确的治疗和检查方案。

MIRA 就像一家模拟医院里的医生一样工作

MIRA 代表 Medical Intelligence for Reasoning and Action(用于推理与行动的医疗智能)。它由 TUD Dresden 和 Heidelberg University 等机构开发。与标准聊天工具不同,该系统作为一个自主智能体,在一个封闭的虚拟电子健康记录中运行。根据该研究,MIRA 可以在十一种工具中从超过 85,000 个选项中作出选择。它会采集患者病史,开具实验室检查、微生物学检测和影像检查,解读结果,生成鉴别诊断,并撰写治疗方案,包括处方、手术规划和住院收治。

该团队在来自公开 MIMIC-IV 数据集的 500 多个真实急诊科病例上测试了 MIRA。第二个 AI 智能体扮演患者,仅分享来自实际医疗记录的信息。

在八个疾病类别中,以数据集中记录的诊断结果为基准,MIRA 的正确诊断率达到 88.9%。在直接的头对头对比中,双方在相同条件下处理了 311 个病例的子集。MIRA 得分 87.8%。四位经验丰富的专科医生达到 78.1%。由住院医师和专科医生组成的混合团队达到 71.1%。MIRA 在阑尾炎(98.6%)和胰腺炎(92.3%)上表现最佳。AI 和医生在肺炎(72.4%)和尿路感染(77.6%)上都遇到了更多困难。

研究人员还检查了这些建议的安全性。不知道建议来自 MIRA 还是人类的盲审专科评审员发现,没有危险的药物相互作用,没有肾功能受损患者的错误剂量,也没有高风险的止痛药处方。MIRA 在捕捉患者当前用药方面几乎完美。它在判断患者是否需要住院的问题上也表现出色:没有漏掉任何一个需要住院的病例。即使测试患者只说德语或法语,或表现得特别焦虑,表现也保持稳定。源代码已在 GitHub 上公开。

AMIE 将两个智能体与临床指南配对

Google 的 AMIE 采取了不同的方法:跨多次就诊管理患者。该系统有两个部分。一个对话智能体负责与患者进行快速、友好的对话。第二个智能体在后台工作,更仔细地思考,并将病例与医学指南进行交叉比对。

在一项严格控制的研究中,Google 将 AMIE 与 21 名初级保健医生进行了比较,涵盖 100 个病例、涉及多次就诊。基准采用的是英国 NICE 指南和 BMJ Best Practice 指南。演员通过文字聊天扮演患者。根据该研究,AMIE 在治疗决策上与医生持平,并在方案准确性和指南依从性上胜过医生。在首次就诊时,AMIE 的整体方案在 95% 的病例中被评为适当。对于医生而言,这一数字为 72%。专科评审员和患者演员都更常偏好 AMIE,而非人类医生。

为了测试药物知识,团队构建了一个名为 RxQA 的专用基准,基于两份国家药物处方集,并由执业药师验证。AMIE 在较难的问题上得分高于初级保健医生。不过,这项测试对双方来说都很艰难。即使在较容易的问题上,最高分也仍低于 75%。

两个团队都警告不要急于下结论

作者们明确指出了其发现的局限性。MIRA 对“一小部分但非零”比例的患者推荐了“偏离最佳实践的照护”。模拟患者的回答也可能“比急诊科患者的真实言语更有结构”。而且不能完全排除,免费可获取的 MIMIC-IV 数据集已经是所用模型训练数据的一部分。如果是这样,所测得的性能更像是上限,而非现实估计。作为对照的医生也工作在德国急诊科体系,这与其他国家不同。

AMIE 的开发者称他们的研究是一个“里程碑”,但强调无论是病例选择还是纯文本对话,都不能反映真实的临床环境。该系统展现出“令人期待的能力”,但“尚未准备好投入真实世界应用”。还需要更多工作来解决可能潜入系统隐藏推理步骤中的“潜在推理错误”。

Jakob Kather 的研究团队共同开发了 MIRA,他告诉 Financial Times:“我们正在预览 AI 如何改变医学。”他将这类 AI 智能体比作飞机的自动驾驶仪:“这些系统可以通过接管常规任务来支持和减轻医疗专业人员的负担,但最终责任始终由医生承担。”

独立专家为这股热潮降温

未参与这两项研究的研究人员称赞了其严谨的方法论,但指出这些只是模拟。牛津大学医学社会学教授 Catherine Pope 告诉 FT,这与“日常医疗保健中混乱、复杂、充满人性化的世界还有一定距离。”

爱丁堡大学健康信息学教授 Julie Jacko 表示,报告中提到的许多优势归根结底在于“计划的精确性和完整性”,而非“临床正确性上的明显差异”。该研究“展示的是针对结构化标准的性能表现,而非完全捕捉真实临床决策的复杂性。”

脚手架对弱模型帮助最大,更强的模型则不需要

最发人深省的发现之一,藏在 AMIE 的补充实验里。正如同行评审研究中常见的情况,两个系统都依赖较旧的 AI 模型。AMIE 仍运行在 Google 较旧的 Gemini 1.5 Flash 上。MIRA 使用的是 OpenAI 的 GPT-4o 和 o1-preview。此后,所有这些模型都已被更新的几代所超越。

Google 的研究人员逐一替换各个组件,以弄清究竟是什么在驱动性能:是双智能体架构、指南匹配和专门训练所构成的精巧脚手架,还是仅仅底层的语言模型。

在较旧的 Gemini 1.5 Flash 上,这套专门设置带来了研究所述的大幅性能提升。但当研究人员把同样的设置套用到更新的 Gemini 2.5 Flash 上时,这一优势几乎消失了。

换句话说,这套专门系统通过强制结构化推理、要求模型引用指南并抑制模型幻觉,来弥补较旧模型的弱点。而更强的模型自己就能完成这一切。论文承认,随着基础模型的改进,AMIE 的价值会缩水。事实上,像 Gemini 2.5 Pro、o3 和 GPT-5 这样的更新型通用模型,在 RxQA 药物测试上已经取得了与完整 AMIE 系统“大体相当”的分数。

实际上,AMIE 似乎已经被 AI 发展的速度所超越。这是一种不断重复的模式:围绕语言模型搭建的脚手架会随着更强模型的到来而变得多余,有时是因为脚手架本身会作为训练数据喂给下一代模型。但这并不意味着其背后的理念毫无价值:在编程以及越来越多的其他领域,Claude Code、OpenAI Codex 和 Claude Cowork 这类脚手架工具让模型能够访问工具、上下文和记忆。即便是更强的模型,在这类支持下处理复杂任务时仍会表现更好。但脚手架必须跟上模型性能的步伐,否则最终只会成为累赘。

MIRA 缺乏这类分析。不过,其架构的一部分与其说是为了修补模型的弱点,不如说是为了将 AI 与医院的临床系统连接起来。这部分不会因为模型变得更强而过时。

来源:The Decoder:AI News(RSS) · the-decoder.com