OpenAI联手80名专家发布心理健康基准

OpenAI 9 月 23 日发布开放评测基准 MentalHealthBench,用来衡量大模型在心理健康对话里的回应质量。题目和评分标准由 22 个国家和地区的 80 多名持证心理学家、精神科医生共同编写,覆盖近 20 个细分专科,这些专家合计使用 19 种语言。

基准包含 1215 段合成对话,配套 5262 条专家撰写的评分细则。每段对话至少经过三名专家审阅,每条细则按临床重要性赋予 -10 到 +10 的权重:把用户往伤害方向引的回答会拿负分,正确识别紧急情况并给出合适求助路径的回答接近满分。

题目怎么分布

按紧急程度分三档:日常情绪和压力类对话占 53.5%,存在严重心理健康隐患的高风险对话占 18.2%,涉及即时人身安全的紧急情况占 28.3%。

按提问者身份分:成年人 68.1%,13 到 17 岁青少年 21.2%,临床从业者 5.8%,照护者 4.9%。评分维度集中在四项行为上,分别是安全、主动了解背景、尊重用户自主权、给出可执行的建议。

非英语对话里,公开资料列出的有西班牙语 105 段、印地语 54 段、阿拉伯语 34 段、葡萄牙语 29 段。

各家模型的成绩

OpenAI 公布的分数如下(按任务截断后计分):

模型得分
GPT-6 Astra57.3%
GPT-6 Sol53.9%
Claude Opus 5.552.4%
GPT-6 Luna50.2%
GPT-4o(2025 年 3 月版)32.1%
Gemini 2.5 Pro29.5%

表里另有两个参照分数。知道评分细则后专门写出的回答能拿 99.0%,说明满分可达;专家在不看细则的情况下亲手写的回答只有 38.5%,低于表里四款新模型。一种可能的解释是,细则对“回答里是否覆盖了某项要点”打分,而人在真实对话中不会面面俱到。OpenAI 在公告里仍强调,ChatGPT 不能替代专业治疗。

美国心理学会 CEO Arthur Evans 为这套基准站台:

“Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience.”

心理健康是一条连续的光谱,在这条光谱上与人对话的 AI 系统,既要有临床科学作底,也要懂真实的生活经验。

局限写在了公告里

OpenAI 自己列了几条限制:没有哪套基准能覆盖私人对话的全部细节;不同语言之间的分数差异只能描述,无法把语言因素和紧急程度、话题、文化背景、用户身份拆开来看。另一个外界容易注意到的点是,出题方和榜首是同一家公司,Gemini 那一栏用的也还是 2.5 Pro,没有换成谷歌当前的主力型号。

放到中文用户这边看

这份榜单里没有任何一款国产模型。公开列出的非英语样本里也没有提到中文对话的数量,中文场景下各家模型表现如何,目前没有数据。

国内做 AI 陪伴和情感类应用的公司,可以参考的是它的框架:MentalHealthBench 把青少年单列、把紧急情况的比重提到近三成,每条细则都带正负权重。数据集开放之后,国内厂商如果愿意,可以自己翻译题目、找本地临床专家重写细则,跑一遍自家模型。有没有公司去做、做了会不会公布,要看接下来几个月。

参考来源:OpenAI 官方公告、Unite.AI、CocoLoop、Crypto Briefing、Investing.com;核对对话数量、评分细则条数、紧急程度与用户身份占比及各模型得分口径。