OpenAI於9月23日發布開放評測基準「MentalHealthBench」,用來衡量大型語言模型在心理健康對話中的回應品質。題目與評分標準由來自22個國家與地區、逾80位持照心理師與精神科醫師共同編寫,涵蓋近20個次專科,這些專家合計使用19種語言。
此評測基準包含1215段合成對話,搭配5262條由專家撰寫的評分細則。每段對話至少經過三位專家審閱,每條細則依臨床重要性給予-10到+10的權重:把使用者導向傷害方向的回答會被扣分,能正確辨識緊急狀況並提供適當求助管道的回答則接近滿分。
題目怎麼分布
依緊急程度分為三個等級:日常情緒與壓力相關對話占53.5%,存在嚴重心理健康疑慮的高風險對話占18.2%,涉及立即人身安全的緊急狀況占28.3%。
依提問者身分區分:成人占68.1%,13到17歲的青少年占21.2%,臨床從業人員占5.8%,照顧者占4.9%。評分面向集中在四項行為:安全性、主動了解背景、尊重使用者的自主權、給出可執行的建議。
非英語對話中,公開資料列出的有西班牙語105段、印地語54段、阿拉伯語34段、葡萄牙語29段。
各家模型的成績
OpenAI公布的分數如下(依任務截斷規則計分):
| 模型 | 得分 |
|---|---|
| GPT-6 Astra | 57.3% |
| GPT-6 Sol | 53.9% |
| Claude Opus 5.5 | 52.4% |
| GPT-6 Luna | 50.2% |
| GPT-4o(2025年3月版) | 32.1% |
| Gemini 2.5 Pro | 29.5% |
表中另有兩個參考分數。事先知道評分細則、專門為此撰寫的回答可拿到99.0%,顯示滿分並非不可能;專家在不看細則的情況下親手寫出的回答只有38.5%,低於表中四款新模型。一種可能的解釋是,細則評的是「回答是否涵蓋了某個要點」,而人在真實對話中不會面面俱到。OpenAI在公告中仍強調,ChatGPT無法取代專業治療。
美國心理學會(APA)執行長Arthur Evans為這套基準背書:
"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."
大意是:心理健康是一條連續的光譜,在這條光譜上與人互動的AI系統,必須同時立足於臨床科學與真實的生活經驗。
公告裡寫明的局限
OpenAI自己列出了幾項限制:沒有任何一套基準能涵蓋私人對話的全部細節;不同語言之間的分數差異只能描述,無法把語言因素與緊急程度、話題、文化背景、使用者身分拆開來看。外界容易留意到的另一點是,出題方與榜首是同一家公司,而Gemini那一欄用的仍是2.5 Pro,並未換成Google目前的主力型號。
放到中文使用者的角度來看
這份榜單裡沒有任何一款中國製模型。公開列出的非英語樣本中,也沒有提到中文對話的數量,中文情境下各家模型的表現如何,目前並無數據可循。
投入AI陪伴與情感類應用的中國企業,可以參考的是它的整體框架:MentalHealthBench把青少年獨立列出、把緊急狀況的比重拉高到將近三成,每條細則都附帶正負權重。資料集公開後,中國廠商如果願意,可以自行翻譯題目、找當地臨床專家重寫細則,再拿自家模型跑一遍。會不會有廠商這麼做、做完會不會公布結果,要看接下來幾個月的動向。
參考來源:OpenAI官方公告、Unite.AI、CocoLoop、Crypto Briefing、Investing.com;已核對對話數量、評分細則條數、緊急程度與使用者身分占比,以及各模型得分口徑。