跳到正文
北京时间
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 2026-06-18精选AI 评分82

GPT-5.5 Instant提升ChatGPT健康智能

Improving health intelligence in ChatGPT

AI 导读

每周超2.3亿用户通过ChatGPT获取健康信息。GPT-5.5 Instant在健康评估中表现显著提升,最具挑战性评测上达到前沿Thinking模型水平,已面向所有免费用户开放。基于医生编写的HealthBench和HealthBench Professional评估,其回复在准确性、安全性和沟通质量上优于医生手写回复及早期模型,故障模式发生率更低。近两个月生产流量显示,健康类回复事实性问题率下降71%。

推荐理由

GPT-5.5 Instant把健康智能提升到接近前沿思考模型水平并免费提供,与医生对比的实验和71%的错误率下降让这次更新有切实证据。

正文 · AI 翻译

GPT‑5.5 Instant 将前沿健康智能带给更多人,这得益于我们模型的进步以及由医生主导的评估。

健康是人们使用 ChatGPT 最有意义的用途之一。每周,超过 2.3 亿人借助 ChatGPT 获取健康与保健问题的帮助:理解健康信息、解读化验结果、为就诊做准备、应对保险事宜、养成更健康的习惯,以及弄清楚接下来该问什么。

借助 GPT‑5.5 Instant,我们在健康方面看到了实质性的进步,在识别何时可能需要紧急就医、主动询问相关背景信息、解释不确定性,以及让复杂信息更易于理解等方面均有改善。在我们最具挑战性的健康评估中,GPT‑5.5 Instant 目前的表现已可与我们的前沿 Thinking 模型相媲美。由于 ChatGPT 的所有免费用户均可使用它,更多人能够从这些改进中受益。

这一进展既反映了模型能力的提升,也体现了我们健康评估背后由医生主导的工作。在我们的各项工作中,一个由医生组成的全球网络通过审阅模型回复示例、描述理想行为并识别失败模式,帮助界定在真实健康场景中什么才算“好”。与医生合作,让我们得以衡量健康方面的进展,并随时间推移改进 ChatGPT 的回应方式。

衡量健康方面的进展

在健康领域,进步意味着给出准确、易懂且基于良好判断的回复:能够识别何时需要更多上下文,在解释不确定性时不夸大把握程度,并帮助人们理解何时应当寻求医疗照护。

为了衡量这一进步,我们采用针对健康领域的专项评估,包括 HealthBench⁠ 和 HealthBench Professional⁠ 。这些评估使用真实的健康对话以及由医生撰写的评分标准,来考察准确性、安全性、沟通能力、上下文感知、完整性以及恰当的升级转诊等品质。

健康表现与成本对比

在包括 HealthBench Professional 在内的健康评估综合结果上,GPT‑5.5 Instant 的健康表现已达到与我们最新前沿模型相近的水平,相较 GPT‑5.3 Instant 有大幅提升。5.5 Instant(2026 年 5 月发布)和 5.3 Instant(2026 年 3 月发布)面向 ChatGPT 所有免费用户开放(受使用限额限制),我们使用 API 定价来计算 5.4 Thinking 和 5.5 Thinking 的成本。

作为另一项对比,我们请医生为具有代表性的健康对话撰写回复,给予他们不限时间且可访问互联网的条件(但不能使用 AI)。随后,由另一组医生小组将这些医生回复与模型回复随时间进行对比,在 3,500 条经审阅的回复中,评估真实互动中至关重要的各项品质,包括准确性、沟通能力、完整性、指令遵循以及健康决策帮助性。

在此次评估中,GPT‑5.5 Instant 的回答在各项标准上的评分均高于医生撰写及旧版模型的回答。

医生们认为,GPT‑5.5 Instant 的回答相比旧版模型和医生的回答,失效模式更少。例如,与旧版模型和医生相比,GPT‑5.5 Instant 在未能贴合当地医疗情境、遗漏危险信号或转诊建议、以及在需要时未能向用户寻求更多背景信息等方面的发生次数都更少。

鉴于我们的模型在健康领域的使用规模,理解近期模型改进的另一种方式是衡量生产流量。我们在生产流量上使用隐私保护监测器,以追踪健康回答中可能存在的事实性问题。基于对近期健康领域生产流量——每周数十亿条消息——的比较,带有至少一个被标记事实性问题的回答比例在过去两个月中下降了 71%。

更好的回答是什么样的

通过对比模型在不同时期对真实世界健康问题的回答,可以看出 ChatGPT 在关乎健康的重要方面取得了进步:能够识别某种情况可能需要紧急关注,以更好的判断力处理不确定性,并为人们提供更清晰、更有用的下一步行动指导。

理解医生的建议 为就诊做准备

为什么医生可能会建议在坐骨神经痛进行类固醇注射前先做 MRI?

GPT-5.5

**对于坐骨神经痛,医生可能会在注射类固醇之前建议先做 MRI,因为当他们确切知道是什么在压迫或刺激神经、以及压迫或刺激发生在哪里时,注射更有可能有效——也更安全。**常见原因包括:

  • 确认坐骨神经痛的病因。类似坐骨神经痛的疼痛可能来自椎间盘突出、椎管狭窄、椎间孔狭窄、脊椎滑脱、肿瘤、感染、骨折,有时也可能来自非脊柱原因。MRI 是观察椎间盘、神经以及软组织神经压迫的首选影像学检查。(emedicine.medscape.com)
  • 选择正确的注射节段和侧别。例如,如果症状提示 L5 神经根,MRI 可以显示问题实际上是在 L4–L5、L5–S1 还是其他节段。这有助于决定将硬膜外注射或选择性神经根注射放置在何处。
  • 选择最安全/最合适的注射入路。硬膜外类固醇注射可以通过不同入路完成——经椎板间、经椎间孔或经骶管。术前影像有助于临床医生规划入路,并避开可能增加风险的解剖问题。许多介入医生将高级影像视为先决条件,因为它有助于优化药物递送并降低对神经或血管结构的风险。(pmc.ncbi.nlm.nih.gov)
  • 检查是否存在“危险信号”或不适合进行注射的情况。MRI 有助于识别感染、癌症、严重狭窄、巨大椎间盘突出等问题,或其他可能需要紧急评估或不同治疗的发现。
  • 确定是否应考虑手术或其他治疗方式。如果存在严重的神经压迫、进行性肌力下降或某些结构性问题,注射可能不是最佳的下一步。
  • 避免低收益的注射。如果 MRI 未显示与你的症状相符的神经根压迫或炎症,医生可能会重新考虑类固醇注射是否可能有效。

话虽如此,并非每一例坐骨神经痛都需要做 MRI。在没有危险信号的人群中,许多病例会随时间推移、通过物理治疗和药物得到改善。一些研究对腰椎硬膜外类固醇注射前常规进行 MRI 是否总能改善结局提出了质疑,但当症状持续且正在考虑注射或手术时,指南和许多临床医生仍然倾向于进行影像检查。(pmc.ncbi.nlm.nih.gov)

你应该问你的医生:“你在 MRI 上要找什么,结果会如何改变注射方案?”这通常能厘清 MRI 是用于诊断、安全性、定位,还是用于决定注射究竟是否合适。

引用

  1. 腰骶神经根病的检查:影像学研究及其他检查,https://emedicine.medscape.com/article/95025-workup⁠
  2. 诊断性与治疗性脊柱介入:硬膜外注射 - PMC,https://pmc.ncbi.nlm.nih.gov/articles/PMC5764532/⁠
  3. 腰椎硬膜外类固醇注射治疗坐骨神经痛前,是否应常规要求进行腰椎 MRI 检查?- PMC, https://pmc.ncbi.nlm.nih.gov/articles/PMC4392534/⁠

GPT-1

“我不知道。”

“好吧,你得去弄清楚。”

“我不确定我能做到。”

“你会想出办法的。”

“希望如此。”

“我要回办公室去,看看能不能找到更多关于这件事的信息。”

“好的。”

“我几个小时后回来。”

“好的。”

“再见。”

“再见。”

我挂断电话,看了看时钟。已经快十一点了。我在那里坐了超过一个小时。我起身走进浴室洗了把脸。我不想看起来邋里邋遢的。我换上干净衣服,走回客厅。我在沙发上坐下,看着电视。我看了会儿新闻,然后听到有人敲门。我跳起来跑向门口。

“你好?”我喊了一声。

“嗨,我是 Peters 医生。”

“哦,你好。”我笑了笑。“很抱歉我

点击模型名称查看其他模型回复。

进步背后的医学专业力量

这一进步由众多医生共同塑造,他们帮助我们定义、衡量并改进 ChatGPT 的健康回答。

OpenAI 与一个全球网络合作,该网络涵盖 60 个国家、49 种语言、26 个医学专科的 260 多名医生。他们的反馈为 ChatGPT 如何回应各类健康问题提供了依据,从日常健康问题到更复杂的临床情境。

医生会审查模型的示例回复,并评估其是否准确、清晰、完整、恰当地保持谨慎且有用。他们帮助识别回复可能在哪些地方遗漏了重要背景、可能在哪些地方显得过于自信、在哪些地方应当更清楚地说明后续步骤,或更直接地鼓励某人寻求医疗照护。

迄今为止,医生已审查了超过 700,000 条模型示例回复,这些回复反映了患者和临床医生在现实世界中如何使用 ChatGPT。每隔几分钟,就有一位医生审查一条新回复。他们的反馈会转化为评分标准和评估准则,帮助研究人员衡量回复在真实健康场景中是否准确、安全、清晰、完整、恰当地保持谨慎且有用。这让我们能更清晰地看到模型在哪些方面正在改善,以及哪些方面仍需改进。

将健康改善带给更多人

这项工作也支持 OpenAI 在健康领域的更广泛工作,包括为医疗保健打造的工具,例如 ChatGPT for Clinicians⁠ 和 OpenAI for Healthcare⁠,它们为医疗专业人员提供文档记录、研究和照护交付等任务方面的支持。

改善人类健康将是 AGI 最具个人化、最切实可感的影响之一。随着我们的模型持续改进,我们的目标是让 ChatGPT 在这些时刻更加准确、更加有用、更具影响力——并持续将这一进步带给更多人。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com