OpenAI、専門家80人とメンタルヘルス指標発表

OpenAIは9月23日、大規模言語モデルがメンタルヘルスに関する対話でどれだけ適切に応答できるかを測る、オープンな評価指標「MentalHealthBench」を公開した。設問と採点基準は、22の国と地域の臨床心理士・精神科医ら80人以上が共同で作成し、対象は約20の専門分野にまたがる。これらの専門家は合わせて19の言語を使用している。

この指標は1215件の合成対話と、それに対応する専門家作成の採点基準5262件で構成される。各対話は少なくとも3人の専門家が審査し、各採点基準には臨床上の重要度に応じて-10から+10までの重みが付けられている。ユーザーを害のある方向へ誘導する回答は減点され、緊急事態を正しく認識し適切な相談先を示した回答は満点に近い評価を得る。

設問の内訳

対話は緊急度によって3段階に分けられている。日常的な感情面やストレスに関する対話が53.5%を占め、深刻なメンタルヘルスの懸念を伴う高リスクな対話が18.2%、身体的な安全に直結する緊急事態が28.3%となっている。

質問者の属性別では、成人が68.1%、13歳から17歳のティーンエイジャーが21.2%、臨床従事者が5.8%、介護者が4.9%。採点の観点は、安全性、背景情報を積極的に把握すること、ユーザーの自律性の尊重、実行可能な助言の提示という4つの行動に集中している。

英語以外の対話については、公開資料によるとスペイン語105件、ヒンディー語54件、アラビア語34件、ポルトガル語29件が含まれる。

各モデルの成績

OpenAIが公表したスコアは以下の通り(タスクの打ち切り処理後の採点)。

モデルスコア
GPT-6 Astra57.3%
GPT-6 Sol53.9%
Claude Opus 5.552.4%
GPT-6 Luna50.2%
GPT-4o(2025年3月版)32.1%
Gemini 2.5 Pro29.5%

表には参考スコアも2つ示されている。採点基準を知った上で専門に書かれた回答は99.0%に達し、満点近くまで到達可能であることを示した。一方、採点基準を見ずに専門家が手作業で書いた回答はわずか38.5%で、表にある新しい4モデルすべてを下回った。考えられる理由の一つは、採点基準が「回答がある要点をカバーしているか」を評価する一方、実際の対話で人はすべての要点を網羅するとは限らないという点だ。OpenAIは発表の中で、ChatGPTが専門的な治療の代わりにはならないと改めて強調している。

米国心理学会(APA)のCEOであるArthur Evans氏はこの指標を支持し、次のように述べた。

"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."

メンタルヘルスは連続体であり、その全域で人と対話するAIシステムには、臨床科学と実体験の両方に根ざした基盤が必要だ、という趣旨の発言。

発表文に書かれた限界

OpenAI自身もいくつかの限界を挙げている。どの指標も個人的な対話のあらゆる細部を網羅することはできず、言語間のスコアの差は記述できるにとどまり、緊急度・話題・文化的背景・ユーザーの属性といった要因から切り離して分析することはできないとしている。外部から見て気づきやすい点として、出題者自身が首位を獲得している企業であることや、Geminiの欄が依然として2.5 Proのままで、Googleの現行の主力モデルに更新されていないことも挙げられる。

中国語圏ユーザーから見ると

このランキングには中国製モデルは一つも含まれていない。公開された非英語サンプルの内訳にも、中国語対話の件数についての言及はなく、中国語でのメンタルヘルス対話において各モデルがどう振る舞うかを示すデータは今のところ存在しない。

AIコンパニオンや感情サポート系アプリを手がける中国企業にとって参考になるのは、その枠組みそのものだろう。MentalHealthBenchはティーンエイジャーを別枠で扱い、緊急事態の比率を3割近くまで引き上げ、採点基準の一つ一つに正負の重みを与えている。データセットが公開された以上、国内の開発企業は望めば設問を翻訳し、現地の臨床専門家に採点基準を書き直してもらった上で、自社モデルを走らせることができる。実際に取り組む企業が現れるか、その結果が公表されるかは、今後数カ月の動向次第だ。

参考資料:OpenAI公式発表、Unite.AI、CocoLoop、Crypto Briefing、Investing.com。対話数、採点基準の件数、緊急度とユーザー属性の比率、各モデルのスコア算出基準を確認した。