OpenAI publie avec plus de 80 experts un nouveau benchmark sur la santé mentale

Le 23 septembre, OpenAI a publié le benchmark ouvert MentalHealthBench, conçu pour mesurer la qualité des réponses des grands modèles de langage dans les conversations sur la santé mentale. Les questions et les critères de notation ont été élaborés conjointement par plus de 80 psychologues et psychiatres agréés issus de 22 pays et régions, couvrant près de 20 sous-spécialités ; ensemble, ces experts travaillent dans 19 langues.

Le benchmark rassemble 1 215 conversations synthétiques, accompagnées de 5 262 critères de notation rédigés par des experts. Chaque conversation a été relue par au moins trois experts, et chaque critère s'est vu attribuer un poids de -10 à +10 selon son importance clinique : une réponse qui pousse l'utilisateur vers un comportement à risque perd des points, tandis qu'une réponse qui identifie correctement une urgence et indique une voie d'aide appropriée s'approche du score maximal.

Comment les questions se répartissent

Selon le degré d'urgence, les conversations se répartissent en trois niveaux : les conversations quotidiennes sur les émotions et le stress représentent 53,5 %, les conversations à haut risque présentant des signes sérieux de problèmes de santé mentale représentent 18,2 %, et les urgences impliquant une sécurité physique immédiate représentent 28,3 %.

Selon l'identité de la personne qui pose la question : les adultes représentent 68,1 %, les adolescents de 13 à 17 ans 21,2 %, les professionnels cliniciens 5,8 % et les aidants 4,9 %. L'évaluation se concentre sur quatre comportements : la sécurité, la recherche proactive de contexte, le respect de l'autonomie de l'utilisateur et des conseils applicables.

Parmi les conversations en langues autres que l'anglais, les données publiées indiquent 105 en espagnol, 54 en hindi, 34 en arabe et 29 en portugais.

Les scores obtenus par chaque modèle

Les scores publiés par OpenAI sont les suivants (calculés après troncature des tâches) :

ModèleScore
GPT-6 Astra57,3 %
GPT-6 Sol53,9 %
Claude Opus 5.552,4 %
GPT-6 Luna50,2 %
GPT-4o (version de mars 2025)32,1 %
Gemini 2.5 Pro29,5 %

Le tableau comporte aussi deux scores de référence. Les réponses rédigées en connaissant à l'avance les critères de notation atteignent 99,0 %, ce qui montre que le score maximal est atteignable ; les réponses écrites à la main par des experts sans voir les critères n'atteignent que 38,5 %, en dessous des quatre modèles actuels du tableau. Une explication possible est que les critères évaluent si une réponse couvre chaque point précis, alors que les personnes, dans une conversation réelle, ne cherchent pas à tout couvrir. OpenAI insiste malgré tout dans son annonce sur le fait que ChatGPT ne remplace pas un traitement professionnel.

Arthur Evans, PDG de l'American Psychological Association, a soutenu ce benchmark :

"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."

La santé mentale s'inscrit sur un continuum, et les systèmes d'IA qui dialoguent avec des personnes sur l'ensemble de ce spectre doivent s'appuyer à la fois sur la science clinique et sur l'expérience vécue.

Des limites inscrites dans l'annonce elle-même

OpenAI a elle-même listé plusieurs limites : aucun benchmark ne peut couvrir tous les détails d'une conversation privée ; les écarts de score entre les langues ne peuvent être que décrits, sans pouvoir séparer le poids de la langue de celui de l'urgence, du sujet, du contexte culturel et de l'identité de l'utilisateur. Un autre point que les observateurs extérieurs remarqueront facilement : l'entreprise qui a conçu les questions est aussi celle qui arrive en tête du classement, et la ligne Gemini utilise toujours la version 2.5 Pro, sans passer au modèle phare actuel de Google.

Vu du côté des utilisateurs chinois

Aucun modèle chinois ne figure dans ce classement. Les échantillons en langues autres que l'anglais rendus publics ne mentionnent pas non plus de nombre de conversations en chinois : il n'existe donc pour l'instant aucune donnée sur la performance des modèles dans des scénarios en chinois.

Les entreprises chinoises qui développent des applications de compagnie IA et de soutien émotionnel disposent ici d'un cadre de référence : MentalHealthBench isole les adolescents comme groupe à part, porte la part des urgences à près de 30 % et attribue à chaque critère un poids positif ou négatif. Maintenant que le jeu de données est ouvert, les fournisseurs locaux peuvent, s'ils le souhaitent, traduire eux-mêmes les questions, faire appel à des experts cliniciens locaux pour réécrire les critères, puis tester leurs propres modèles. Reste à voir dans les prochains mois si une entreprise s'y attelle, et si elle publie les résultats.

Sources : annonce officielle d'OpenAI, Unite.AI, CocoLoop, Crypto Briefing, Investing.com ; nombre de conversations, nombre de critères de notation, répartitions par urgence et par identité de l'utilisateur, ainsi que la base de calcul du score de chaque modèle ont été recoupés.