OpenAI攜80位專家推出心理健康評測基準

OpenAI於9月23日發布開放評測基準「MentalHealthBench」,用來衡量大型語言模型在心理健康對話中的回應品質。題目與評分標準由來自22個國家與地區、逾80位持照心理師與精神科醫師共同編寫,涵蓋近20個次專科,這些專家合計使用19種語言。

此評測基準包含1215段合成對話,搭配5262條由專家撰寫的評分細則。每段對話至少經過三位專家審閱,每條細則依臨床重要性給予-10到+10的權重:把使用者導向傷害方向的回答會被扣分,能正確辨識緊急狀況並提供適當求助管道的回答則接近滿分。

題目怎麼分布

依緊急程度分為三個等級:日常情緒與壓力相關對話占53.5%,存在嚴重心理健康疑慮的高風險對話占18.2%,涉及立即人身安全的緊急狀況占28.3%。

依提問者身分區分:成人占68.1%,13到17歲的青少年占21.2%,臨床從業人員占5.8%,照顧者占4.9%。評分面向集中在四項行為:安全性、主動了解背景、尊重使用者的自主權、給出可執行的建議。

非英語對話中,公開資料列出的有西班牙語105段、印地語54段、阿拉伯語34段、葡萄牙語29段。

各家模型的成績

OpenAI公布的分數如下(依任務截斷規則計分):

模型得分
GPT-6 Astra57.3%
GPT-6 Sol53.9%
Claude Opus 5.552.4%
GPT-6 Luna50.2%
GPT-4o(2025年3月版)32.1%
Gemini 2.5 Pro29.5%

表中另有兩個參考分數。事先知道評分細則、專門為此撰寫的回答可拿到99.0%,顯示滿分並非不可能;專家在不看細則的情況下親手寫出的回答只有38.5%,低於表中四款新模型。一種可能的解釋是,細則評的是「回答是否涵蓋了某個要點」,而人在真實對話中不會面面俱到。OpenAI在公告中仍強調,ChatGPT無法取代專業治療。

美國心理學會(APA)執行長Arthur Evans為這套基準背書:

"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."

大意是:心理健康是一條連續的光譜,在這條光譜上與人互動的AI系統,必須同時立足於臨床科學與真實的生活經驗。

公告裡寫明的局限

OpenAI自己列出了幾項限制:沒有任何一套基準能涵蓋私人對話的全部細節;不同語言之間的分數差異只能描述,無法把語言因素與緊急程度、話題、文化背景、使用者身分拆開來看。外界容易留意到的另一點是,出題方與榜首是同一家公司,而Gemini那一欄用的仍是2.5 Pro,並未換成Google目前的主力型號。

放到中文使用者的角度來看

這份榜單裡沒有任何一款中國製模型。公開列出的非英語樣本中,也沒有提到中文對話的數量,中文情境下各家模型的表現如何,目前並無數據可循。

投入AI陪伴與情感類應用的中國企業,可以參考的是它的整體框架:MentalHealthBench把青少年獨立列出、把緊急狀況的比重拉高到將近三成,每條細則都附帶正負權重。資料集公開後,中國廠商如果願意,可以自行翻譯題目、找當地臨床專家重寫細則,再拿自家模型跑一遍。會不會有廠商這麼做、做完會不會公布結果,要看接下來幾個月的動向。

參考來源:OpenAI官方公告、Unite.AI、CocoLoop、Crypto Briefing、Investing.com;已核對對話數量、評分細則條數、緊急程度與使用者身分占比,以及各模型得分口徑。