OpenAI merilis tolok ukur terbuka bernama MentalHealthBench pada 23 September untuk mengukur seberapa baik model bahasa besar merespons percakapan seputar kesehatan mental. Pertanyaan dan rubrik penilaiannya disusun bersama lebih dari 80 psikolog dan psikiater berlisensi dari 22 negara dan wilayah, mencakup hampir 20 subspesialisasi, dengan para pakar ini menggunakan total 19 bahasa.
Tolok ukur ini terdiri dari 1.215 percakapan sintetis yang dipasangkan dengan 5.262 kriteria penilaian buatan pakar. Setiap percakapan ditinjau oleh minimal tiga pakar, dan setiap kriteria diberi bobot kepentingan klinis dari -10 hingga +10: jawaban yang mengarahkan pengguna ke arah yang membahayakan akan kehilangan poin, sementara jawaban yang berhasil mengenali situasi darurat dan menawarkan jalur bantuan yang tepat mendapat skor mendekati maksimal.
Bagaimana pertanyaan terbagi
Percakapan dibagi menjadi tiga tingkat urgensi: percakapan emosi dan stres sehari-hari mencakup 53,5%, percakapan berisiko tinggi dengan masalah kesehatan mental serius sebesar 18,2%, dan situasi darurat yang menyangkut keselamatan fisik langsung sebesar 28,3%.
Berdasarkan identitas penanya: orang dewasa 68,1%, remaja usia 13 hingga 17 tahun 21,2%, tenaga klinis 5,8%, dan pengasuh 4,9%. Penilaian berfokus pada empat perilaku: keamanan, secara aktif menggali konteks, menghormati otonomi pengguna, dan memberikan saran yang bisa langsung dijalankan.
Di antara percakapan non-bahasa Inggris, rincian yang dipublikasikan mencakup 105 percakapan berbahasa Spanyol, 54 berbahasa Hindi, 34 berbahasa Arab, dan 29 berbahasa Portugis.
Skor masing-masing model
OpenAI mempublikasikan skor berikut (dihitung setelah pemotongan tugas):
| Model | Skor |
|---|---|
| GPT-6 Astra | 57,3% |
| GPT-6 Sol | 53,9% |
| Claude Opus 5.5 | 52,4% |
| GPT-6 Luna | 50,2% |
| GPT-4o (versi Maret 2025) | 32,1% |
| Gemini 2.5 Pro | 29,5% |
Dua skor acuan lain turut ditampilkan. Jawaban yang ditulis khusus dengan mengetahui kriteria penilaian mencapai 99,0%, menunjukkan skor sempurna memang bisa dicapai. Jawaban yang ditulis langsung oleh pakar tanpa melihat kriteria hanya meraih 38,5%, lebih rendah dari keempat model baru di atas. Salah satu penjelasan yang mungkin adalah kriteria tersebut menilai apakah sebuah jawaban mencakup poin tertentu, sementara dalam percakapan nyata orang jarang mencakup semua poin sekaligus. Pengumuman OpenAI tetap menegaskan bahwa ChatGPT bukan pengganti terapi profesional.
CEO American Psychological Association, Arthur Evans, mendukung tolok ukur ini:
"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."
Intinya: kesehatan mental berada pada satu rentang berkelanjutan, dan sistem AI yang berinteraksi dengan orang di sepanjang rentang itu perlu berpijak pada ilmu klinis sekaligus pengalaman hidup nyata.
Keterbatasan yang ditulis dalam pengumuman
OpenAI sendiri mencantumkan beberapa keterbatasan. Tidak ada tolok ukur yang bisa mencakup seluruh nuansa percakapan pribadi, dan perbedaan skor antarbahasa hanya bisa dideskripsikan, tidak bisa dipisahkan secara bersih dari tingkat urgensi, topik, latar belakang budaya, atau identitas pengguna. Hal lain yang mudah disadari pihak luar: pembuat pertanyaan dan model dengan skor tertinggi berasal dari perusahaan yang sama, dan baris Gemini masih memakai 2.5 Pro, bukan model andalan Google saat ini.
Dilihat dari sisi pengguna berbahasa Mandarin
Tidak ada satu pun model buatan Tiongkok yang muncul di papan peringkat ini. Sampel non-bahasa Inggris yang dipublikasikan juga tidak menyebutkan berapa banyak percakapan berbahasa Mandarin yang disertakan, sehingga saat ini belum ada data tentang bagaimana performa model-model tersebut dalam percakapan kesehatan mental berbahasa Mandarin.
Bagi perusahaan Tiongkok yang mengembangkan aplikasi pendamping AI dan dukungan emosional, yang layak dijadikan rujukan adalah kerangka kerjanya: MentalHealthBench memisahkan remaja sebagai kelompok tersendiri, menaikkan porsi situasi darurat hingga hampir 30%, dan memberi bobot positif atau negatif pada setiap kriteria penilaian. Kini setelah kumpulan datanya dibuka, pengembang lokal bisa menerjemahkan pertanyaannya, melibatkan pakar klinis setempat untuk menulis ulang kriterianya, lalu menguji model mereka sendiri jika mau. Apakah ada perusahaan yang melakukannya, dan apakah hasilnya akan dipublikasikan, baru akan terlihat dalam beberapa bulan ke depan.
Sumber: pengumuman resmi OpenAI, Unite.AI, CocoLoop, Crypto Briefing, Investing.com; telah diperiksa silang untuk jumlah percakapan, jumlah kriteria penilaian, proporsi urgensi dan identitas pengguna, serta dasar penilaian setiap model.