Am 23. September veröffentlichte OpenAI den offenen Benchmark MentalHealthBench, der misst, wie gut große Sprachmodelle in Gesprächen über psychische Gesundheit antworten. Fragen und Bewertungskriterien wurden gemeinsam von mehr als 80 approbierten Psycholog:innen und Psychiater:innen aus 22 Ländern und Regionen erstellt und decken knapp 20 Fachrichtungen ab; die Expert:innen arbeiten zusammen in 19 Sprachen.
Der Benchmark umfasst 1.215 synthetische Gespräche mit insgesamt 5.262 von Expert:innen verfassten Bewertungskriterien. Jedes Gespräch wurde von mindestens drei Expert:innen geprüft, und jedes Kriterium erhielt je nach klinischer Bedeutung eine Gewichtung von -10 bis +10: Eine Antwort, die Nutzer:innen in Richtung Schaden lenkt, bekommt Minuspunkte, während eine Antwort, die einen Notfall richtig erkennt und einen passenden Weg zur Hilfe aufzeigt, nahe an der Höchstpunktzahl liegt.
Wie sich die Fragen verteilen
Nach Dringlichkeit gibt es drei Stufen: alltägliche Gespräche über Gefühle und Stress machen 53,5 % aus, risikoreiche Gespräche mit ernsten Anzeichen für psychische Probleme 18,2 % und akute Notfälle mit unmittelbarer Gefahr für die körperliche Sicherheit 28,3 %.
Nach Identität der fragenden Person: Erwachsene machen 68,1 % aus, Jugendliche im Alter von 13 bis 17 Jahren 21,2 %, klinisches Fachpersonal 5,8 % und pflegende Angehörige 4,9 %. Die Bewertung konzentriert sich auf vier Verhaltensweisen: Sicherheit, aktives Erfragen von Kontext, Respekt vor der Autonomie der Nutzer:innen und umsetzbare Ratschläge.
Bei den nicht-englischen Gesprächen listen die veröffentlichten Daten 105 auf Spanisch, 54 auf Hindi, 34 auf Arabisch und 29 auf Portugiesisch.
Wie die einzelnen Modelle abschnitten
Die von OpenAI veröffentlichten Werte (nach Kürzung der Aufgaben berechnet):
| Modell | Ergebnis |
|---|---|
| GPT-6 Astra | 57,3 % |
| GPT-6 Sol | 53,9 % |
| Claude Opus 5.5 | 52,4 % |
| GPT-6 Luna | 50,2 % |
| GPT-4o (Version März 2025) | 32,1 % |
| Gemini 2.5 Pro | 29,5 % |
Die Tabelle enthält außerdem zwei Referenzwerte. Antworten, die in Kenntnis der Bewertungskriterien gezielt verfasst wurden, erreichten 99,0 % und zeigen damit, dass die Höchstpunktzahl erreichbar ist; von Expert:innen ohne Kenntnis der Kriterien von Hand geschriebene Antworten kamen dagegen nur auf 38,5 % – weniger als alle vier aktuellen Modelle in der Tabelle. Eine mögliche Erklärung: Die Kriterien bewerten, ob eine Antwort jeden einzelnen Punkt abdeckt, während Menschen in echten Gesprächen nicht darauf aus sind, jeden Punkt abzuhaken. OpenAI betont in der Ankündigung dennoch, dass ChatGPT keine professionelle Behandlung ersetzen kann.
Arthur Evans, CEO der American Psychological Association, unterstützt den Benchmark:
"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."
Psychische Gesundheit bewegt sich auf einem Kontinuum, und KI-Systeme, die mit Menschen über dieses gesamte Spektrum hinweg interagieren, brauchen ein Fundament sowohl aus klinischer Wissenschaft als auch aus gelebter Erfahrung.
Grenzen, die in der Ankündigung selbst stehen
OpenAI nennt selbst mehrere Einschränkungen: Kein Benchmark kann jedes Detail eines privaten Gesprächs abbilden; Unterschiede in den Punktzahlen zwischen Sprachen lassen sich nur beschreiben, aber nicht in die Anteile von Sprache, Dringlichkeit, Thema, kulturellem Hintergrund und Nutzeridentität zerlegen. Ein weiterer Punkt, der Außenstehenden leicht auffällt: Das Unternehmen, das die Fragen gestellt hat, führt zugleich die Rangliste an, und die Gemini-Zeile verwendet weiterhin 2.5 Pro statt Googles aktuellem Spitzenmodell.
Der Blick auf chinesische Nutzer:innen
In dieser Rangliste taucht kein chinesisches Modell auf. Auch in den veröffentlichten nicht-englischen Stichproben wird keine Zahl für chinesischsprachige Gespräche genannt, es gibt also bislang keine Daten dazu, wie die Modelle in chinesischsprachigen Szenarien abschneiden.
Chinesische Unternehmen, die KI-Begleiter und emotionale Support-Apps entwickeln, können sich am Rahmen des Benchmarks orientieren: MentalHealthBench führt Jugendliche als eigene Gruppe, hebt den Anteil von Notfällen auf fast 30 % an und gibt jedem Kriterium ein positives oder negatives Gewicht. Nachdem der Datensatz offen zugänglich ist, können heimische Anbieter die Fragen selbst übersetzen, lokale klinische Expert:innen die Kriterien neu schreiben lassen und ihre eigenen Modelle damit testen. Ob das jemand tut und ob die Ergebnisse veröffentlicht werden, zeigt sich erst in den kommenden Monaten.
Quellen: offizielle Ankündigung von OpenAI, Unite.AI, CocoLoop, Crypto Briefing, Investing.com; abgeglichen wurden Gesprächszahl, Anzahl der Bewertungskriterien, Anteile nach Dringlichkeit und Nutzeridentität sowie die Bewertungsgrundlage der einzelnen Modelle.