OpenAI lanza junto a más de 80 expertos un nuevo benchmark de salud mental

El 23 de septiembre, OpenAI publicó el benchmark abierto MentalHealthBench, creado para medir la calidad de las respuestas de los modelos de lenguaje en conversaciones sobre salud mental. Las preguntas y los criterios de evaluación fueron elaborados conjuntamente por más de 80 psicólogos y psiquiatras con licencia de 22 países y regiones, y cubren casi 20 subespecialidades; en conjunto, estos expertos trabajan en 19 idiomas.

El benchmark incluye 1.215 conversaciones sintéticas, acompañadas de 5.262 criterios de evaluación redactados por expertos. Cada conversación fue revisada por al menos tres expertos, y cada criterio recibió un peso de -10 a +10 según su importancia clínica: una respuesta que empuja al usuario hacia el daño pierde puntos, mientras que una respuesta que reconoce correctamente una emergencia y señala una vía adecuada de ayuda se acerca a la puntuación máxima.

Cómo se distribuyen las preguntas

Según el nivel de urgencia, las conversaciones se dividen en tres niveles: las conversaciones cotidianas sobre emociones y estrés suman 53,5%, las conversaciones de alto riesgo con indicios graves de problemas de salud mental suman 18,2%, y las emergencias que implican seguridad física inmediata suman 28,3%.

Según la identidad de quien pregunta: los adultos representan el 68,1%, los adolescentes de 13 a 17 años el 21,2%, los profesionales clínicos el 5,8% y los cuidadores el 4,9%. La evaluación se centra en cuatro comportamientos: seguridad, indagación proactiva del contexto, respeto a la autonomía del usuario y consejos que se puedan poner en práctica.

Entre las conversaciones en idiomas distintos del inglés, los datos publicados indican 105 en español, 54 en hindi, 34 en árabe y 29 en portugués.

El resultado de cada modelo

Las puntuaciones publicadas por OpenAI son las siguientes (calculadas tras el truncamiento de las tareas):

ModeloPuntuación
GPT-6 Astra57,3%
GPT-6 Sol53,9%
Claude Opus 5.552,4%
GPT-6 Luna50,2%
GPT-4o (versión de marzo de 2025)32,1%
Gemini 2.5 Pro29,5%

La tabla incluye además dos puntuaciones de referencia. Las respuestas escritas conociendo de antemano los criterios de evaluación alcanzaron 99,0%, lo que muestra que la puntuación máxima es alcanzable; las respuestas que los propios expertos escribieron a mano sin ver los criterios solo llegaron a 38,5%, por debajo de los cuatro modelos actuales de la tabla. Una posible explicación es que los criterios evalúan si la respuesta cubre cada punto concreto, mientras que las personas en conversaciones reales no intentan cubrir todos los puntos. Aun así, OpenAI insiste en el anuncio en que ChatGPT no sustituye un tratamiento profesional.

Arthur Evans, CEO de la American Psychological Association, respaldó este benchmark:

"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."

La salud mental existe en un continuo, y los sistemas de IA que conversan con personas a lo largo de ese espectro necesitan basarse tanto en la ciencia clínica como en la experiencia vivida.

Los límites que la propia OpenAI reconoce

OpenAI enumeró ella misma varias limitaciones: ningún benchmark puede cubrir todos los detalles de una conversación privada; las diferencias de puntuación entre idiomas solo se pueden describir, sin poder separar el peso del idioma de la urgencia, el tema, el contexto cultural y la identidad del usuario. Otro punto que los observadores externos notarán con facilidad es que la empresa que redactó las preguntas es también la que encabeza la clasificación, y la fila de Gemini sigue usando la versión 2.5 Pro, sin actualizarse al modelo principal actual de Google.

La perspectiva de los usuarios chinos

Ningún modelo chino aparece en esta clasificación. Tampoco las muestras en otros idiomas publicadas mencionan una cifra de conversaciones en chino, así que por ahora no hay datos sobre cómo se comportan los modelos en escenarios en chino.

Las empresas chinas que desarrollan aplicaciones de compañía de IA y apoyo emocional sí tienen aquí un marco de referencia: MentalHealthBench separa a los adolescentes como grupo propio, eleva la proporción de emergencias a casi un 30% y asigna a cada criterio un peso positivo o negativo. Ahora que el conjunto de datos está abierto, los proveedores locales pueden, si lo desean, traducir las preguntas por su cuenta, incorporar expertos clínicos locales para reescribir los criterios y poner a prueba sus propios modelos. Si alguna empresa lo hace, y si publica los resultados, es algo que se verá en los próximos meses.

Fuentes: anuncio oficial de OpenAI, Unite.AI, CocoLoop, Crypto Briefing, Investing.com; se contrastaron el número de conversaciones, la cantidad de criterios de evaluación, las proporciones por urgencia e identidad del usuario, y la base de puntuación de cada modelo.