跳到正文
北京时间
原文
OpenAI:官网动态(RSS · 排除企业/客户案例)·· 6 天前精选AI 评分63

OpenAI 联合 80 多位心理健康专家发布开放基准 MentalHealthBench

Introducing MentalHealthBench

AI 导读

OpenAI 发布开放基准 MentalHealthBench,评估 AI 在真实心理健康对话中的表现,由来自 22 个国家、19 种语言的 80 多位持证心理学家和精神科医生共同构建。

推荐理由

原文给出基准的构建方法、评分权重设计和开放发布方式,研究者可据此复现或扩展心理健康方向的模型评测。

正文 · AI 翻译

一个与 80 多位持证心理健康专家共同开发的开放基准,用于评估 AI 在真实心理健康对话中的回复。

人们会就许多种话题求助于 AI:处理一段艰难的关系、应对日常压力、支持自己关心的人,或决定如何应对某个棘手处境。这些对话需要准确性、务实的判断力,以及对个人自主性的尊重。每周有超过十亿人使用 ChatGPT,我们的研究聚焦于帮助模型以审慎体贴的方式回应广泛多样的需求,并将人们的安全与福祉放在首位。

鉴于紧急场景对安全的重要性,该领域此前对 AI 的大多数评估主要聚焦于这类场景,并使用宽泛的预设标准来衡量成功与否。这留下了一片空白:人们无从了解模型在各类心理健康对话中的整体表现如何,其回复在多大程度上契合专家针对每种情境给出的指导——而不只是看它们是否避免了不被允许的回复。评估模型如何处理这些不同情境,对于构建能够切实支持人们长期福祉与安全的 AI 至关重要。

媒体内容 · 前往原文查看
“心理健康存在于一个连续谱上,从蓬勃良好到日常压力再到急性危机。与处于这一谱系各位置的人互动的 AI 系统,需要同时扎根于临床科学与真实生活经验——不仅要识别一个人处于连续谱上的哪个位置,还要知道在任何一个位置上该如何恰当回应。”
——Arthur Evans 博士,美国心理学会首席执行官

我们推出 MentalHealthBench,这是一个全新的开放基准,用于衡量 AI 系统在真实心理健康对话中的回应表现。MentalHealthBench 由来自 22 个国家的 80 多位持证心理健康专家组成的全球团队共同创建。它评估模型在关键心理健康行为方面的能力,例如安全性、主动了解背景、尊重用户自主权,以及在适当时候提供可操作的指导。我们将其公开发布,以便其他研究人员能够审查其方法、运行自己的评估,并在此基础上继续推进工作。

MentalHealthBench 上的结果显示,AI 系统在帮助人们应对心理健康状况方面正在稳步提升。虽然 ChatGPT 不能替代治疗或专业护理,但基于专家洞见的评估结果帮助我们衡量 AI 模型在以下方面取得的进展:能够以共情的方式回应、促进身心健康,并引导人们寻求现实世界中的支持,例如 本地危机热线或他们信任的人。

在所有情境中支持心理健康

涉及身心健康、生活建议或其他心理健康场景的对话,在主题、紧迫程度和文化背景上可能差异极大。MentalHealthBench 旨在捕捉这些真实场景和用户画像的广度。我们利用隐私保护技术,创建了能够准确反映 AI 在心理健康领域真实使用模式的合成心理健康对话。部分场景还包含合成用户的相关背景信息——例如近期家人离世——以便我们评估模型是否会利用这些背景信息来适当调整其回应。

媒体内容 · 前往原文查看

MentalHealthBench

心理健康对话摘要的可视化,涵盖 MentalHealthBench(1)、OpenAI 用于 System Cards 的内部心理健康基准(2),以及一系列外部基准(3)——展示了该评估的广泛覆盖范围。

MentalHealthBench 包含涉及成年人、青少年、照护者和临床医生的场景,覆盖多种语言和地区。这些对话涵盖多个主题,并覆盖了完整的严重程度谱系:

  • 非急性——可能包含一定情绪成分的日常对话。

  • 高急性——表明存在更严重心理健康问题或显著痛苦的对话,但并非紧急情况。

  • 紧急情况——涉及心理健康紧急迹象或需要紧急现实世界支持的即时安全问题的对话。

媒体内容 · 前往原文查看

MentalHealthBench 覆盖的场景。这些场景的组合旨在测试模型响应,并不代表这些话题在 ChatGPT 中出现的频率。

与专家合作构建

在我们此前面向临床医生、为 HealthBench 和 HealthBench Professional⁠,⁠ 所开展的工作基础上,我们与自己的心理健康专家队列密切合作,开发了 MentalHealthBench。该队列由 80 多位持证心理学家和精神科医生组成,分布在 22 个国家,使用 19 种语言,涵盖近 20 个心理健康亚专科。

这些专家负责阅读每一段合成对话,并针对模型对最后一条用户消息的回复,制定一份详细的评分标准清单。每一条标准都针对模型回复的某一个方面,例如是否提出了正确的问题,或是否给出了尽可能好的建议。每条标准都带有从 -10 到 +10 的权重:正分奖励有益行为,负分惩罚有害行为,而数值越大的标准表明其在该对话情境中的临床重要性越高。

每段对话都至少由三位专家审阅,我们只保留至少两位专家达成一致、且未被第三位专家否定的标准。因此,基准中的最终评分标准反映了关于模型在每个情境中应如何回复的共识判断。对于每段对话,我们使用自动评分器 GPT‑5.6 Sol,依据专家撰写的标准来评估模型回复。论文详细描述了评分过程和评估设置。

媒体内容 · 前往原文查看
媒体内容 · 前往原文查看
“作为一名执业精神科医生,我经常听到患者如何使用 ChatGPT 这类工具来更好地理解自己的心理健康,并更深入地参与自身的照护。将我的临床经验带入这项工作,让我能够走出医院贡献力量——帮助确保这项技术赋能于人,同时以心理健康应得的关怀与责任来对待它。”
——Kevin La Moureaux 博士

模型表现

我们在 MentalHealthBench 上评估了多种模型。以下结果展示了这些模型在整个数据集上的表现。该评估衡量的是,模型的回复是否展现出专家为每个场景所确定的全部理想行为,同时避免不太可取的行为。

媒体内容 · 前往原文查看

近期前沿模型在 MentalHealthBench 上的表现。误差线显示 95% 置信区间。*各提供商最新评估的模型(截至 2026 年 9 月 23 日)。

该基准涵盖不同紧急程度的对话。这让我们能够了解模型在日常心理健康场景以及需要现实世界支持的更紧急心理健康危机中的表现。

媒体内容 · 前往原文查看

* 各提供商最新评估的模型(截至 2026 年 9 月 23 日)。

基准中的对话代表了四类用户:成年人、13-17 岁的青少年、照护者和临床医生。对于青少年角色,我们通过系统消息明确说明该用户年龄在 13-17 岁之间。这一方法旨在适用于各个模型提供商,尽管它可能无法涵盖各个产品内置的所有防护措施。涉及青少年角色的对话由具备青少年心理健康专业知识的临床医生进行审查,以帮助评估回复是否适合青少年的独特需求。

媒体内容 · 前往原文查看

* 各提供商最新评估的模型(截至 2026 年 9 月 23 日)。

MentalHealthBench 还支持对模型行为进行多维度测量。总体得分可以分解为模型在心理健康方面十个行为维度上的表现。这些行为由心理健康专家定义,旨在捕捉模型表现中的细微差异。总体得分相近的模型在这些行为上可能各有不同的优势。

媒体内容 · 前往原文查看

得分已按各行为的理论范围进行归一化。* 各提供商最新评估的模型(截至 2026 年 9 月 23 日)。

这种细粒度的测量可以帮助研究人员沿着可解释的模型行为识别改进领域。例如,我们看到,随着模型越来越先进,模型恰当寻求上下文的能力有所提升。这些改进反映了 OpenAI 和其他模型提供商在改善模型处理心理健康对话方式方面的投入。

理解用户对心理健康的看法

除了 MentalHealthBench,我们还开展了一项独立分析,将专家指导与人们在 AI 支持中发现有帮助的内容进行比较。我们想检验那些被专家评为高分的回复,是否仍可能让用户感到冷漠或没有帮助。通过比较用户和专家对模型回复的评分以及他们撰写的标准,我们可以量化双方观点在哪些地方一致、存在分歧或相互补充。该基准的最终评分标准基于专家共识;这项独立分析并未改变这些标准。

我们与 44 位曾使用 AI 获得心理健康或情感支持的成年人合作,他们代表 16 个国家和 14 种语言。参与者对合成对话的模型回复进行评分,并撰写标准来描述有帮助的支持应该是什么样子。他们的评审仅限于非急性对话,以避免让他们接触到可能令人痛苦的高危材料。

用户视角突出了人们在 AI 支持中看重的、而专家指导中较少强调的品质,尤其是实用的后续步骤和语气。专家则更强调收集相关背景信息,并谨慎解读模棱两可的情境。这一比较让我们更全面地了解人们在支持中看重什么,以及这些偏好与临床指导之间的关系。

让更好的心理健康评估成为共享资源

MentalHealthBench 为专家、研究人员和开发者提供了一个共享工具,用于评估 AI 在各类心理健康场景中提供的支持是否安全、有用。通过将其公开,我们邀请社区审视其方法、找出既有模型中的不足,并努力改进未来的模型。没有任何基准能够涵盖一次私人对话中所有重要的方面,但我们希望 MentalHealthBench 有助于为 AI 如何支持人们树立更高的标准。

我们也在支持 AI 与心理健康领域的其他努力,包括通过为新研究提供资助、与Partnership on AI共同召集专家,以及协助 Transluce 的心理健康评估等互补性的独立工作。

在这项研究之外,我们还加强了 ChatGPT 的回应在敏感对话中的表现,扩大了危机资源的获取渠道,并新增了Trusted Contact,以便在人们陷入困境时联系他们信任的人。我们还推出了ChatGPT for Teens,为年轻用户提供额外保护。

MentalHealthBench 是我们努力方向的一部分,旨在让 AI 帮助数百万人度过艰难时刻、巩固他们的人际关系,并过上更健康、更充实的生活。

来源:OpenAI:官网动态(RSS · 排除企业/客户案例) · openai.com