OpenAI가 9월 23일 대형언어모델이 정신건강 관련 대화에서 얼마나 적절하게 응답하는지 측정하는 개방형 벤치마크 MentalHealthBench를 공개했다. 문항과 채점 기준은 22개국의 공인 심리학자·정신과 전문의 80여 명이 공동으로 작성했으며, 약 20개 세부 전문분야를 다루고 이들 전문가는 총 19개 언어를 사용한다.
이 벤치마크는 합성 대화 1215건과 이에 대응하는 전문가 작성 채점 기준 5262개로 구성된다. 각 대화는 최소 세 명의 전문가가 검토했고, 각 채점 기준에는 임상적 중요도에 따라 -10에서 +10까지 가중치가 부여됐다. 사용자를 해로운 방향으로 이끄는 답변은 감점되고, 위기 상황을 정확히 인지하고 적절한 도움 경로를 제시한 답변은 만점에 가까운 점수를 받는다.
문항 구성
대화는 긴급도에 따라 세 단계로 나뉜다. 일상적인 감정·스트레스 관련 대화가 53.5%를 차지하고, 심각한 정신건강 우려가 있는 고위험 대화가 18.2%, 신체적 안전이 직결된 위급 상황이 28.3%를 차지한다.
질문자 유형별로는 성인이 68.1%, 13~17세 청소년이 21.2%, 임상 종사자가 5.8%, 보호자가 4.9%다. 채점은 안전성, 배경 정보를 적극적으로 파악하는지, 사용자의 자율성을 존중하는지, 실행 가능한 조언을 제공하는지 등 네 가지 행동에 집중된다.
영어 외 대화 가운데 공개된 자료에는 스페인어 105건, 힌디어 54건, 아랍어 34건, 포르투갈어 29건이 포함돼 있다.
모델별 성적
OpenAI가 공개한 점수는 다음과 같다(과제 절단 처리 후 채점).
| 모델 | 점수 |
|---|---|
| GPT-6 Astra | 57.3% |
| GPT-6 Sol | 53.9% |
| Claude Opus 5.5 | 52.4% |
| GPT-6 Luna | 50.2% |
| GPT-4o(2025년 3월 버전) | 32.1% |
| Gemini 2.5 Pro | 29.5% |
표에는 참고용 점수 두 개도 함께 제시됐다. 채점 기준을 미리 알고 그에 맞춰 작성한 답변은 99.0%에 달해 만점에 가까운 점수가 가능함을 보여줬다. 반면 채점 기준을 보지 않고 전문가가 직접 작성한 답변은 38.5%에 그쳐, 표에 있는 최신 모델 네 개보다 모두 낮았다. 가능한 설명 중 하나는 채점 기준이 답변이 특정 요점을 다뤘는지를 평가하는 반면, 실제 대화에서 사람은 모든 요점을 빠짐없이 다루지는 않는다는 점이다. OpenAI는 발표에서 ChatGPT가 전문적인 치료를 대체할 수 없다는 점을 다시 강조했다.
미국심리학회(APA) CEO인 Arthur Evans는 이 벤치마크를 지지하며 다음과 같이 말했다.
"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."
정신건강은 하나의 연속선상에 있으며, 그 전 범위에서 사람과 대화하는 AI 시스템은 임상 과학과 실제 삶의 경험 모두에 뿌리를 두어야 한다는 취지의 발언이다.
발표문이 밝힌 한계
OpenAI 스스로도 몇 가지 한계를 언급했다. 어떤 벤치마크도 사적인 대화의 모든 세부사항을 다룰 수는 없으며, 언어 간 점수 차이는 설명할 수는 있어도 긴급도·주제·문화적 배경·사용자 유형 같은 요인과 분리해 분석할 수는 없다고 밝혔다. 외부에서 눈에 띄기 쉬운 또 다른 지점은, 문항을 만든 곳과 1위를 차지한 곳이 같은 회사라는 점, 그리고 Gemini 항목이 여전히 2.5 Pro로 남아 있어 구글의 현재 주력 모델로 교체되지 않았다는 점이다.
중국어권 사용자 관점에서 보면
이 순위표에는 중국산 모델이 하나도 포함돼 있지 않다. 공개된 비영어권 샘플 내역에도 중국어 대화 건수에 대한 언급이 없어, 중국어 정신건강 대화에서 각 모델이 어떻게 반응하는지에 대한 데이터는 현재로서는 없다.
AI 컴패니언이나 감정 지원 앱을 만드는 중국 기업들이 참고할 만한 것은 이 벤치마크의 틀 그 자체다. MentalHealthBench는 청소년을 별도로 분류하고, 위급 상황의 비중을 30%에 가깝게 끌어올렸으며, 채점 기준 하나하나에 양수·음수 가중치를 부여했다. 데이터셋이 공개된 이상 국내 개발사들은 원한다면 문항을 번역하고 현지 임상 전문가에게 채점 기준을 다시 작성하게 한 뒤 자사 모델을 직접 테스트할 수 있다. 실제로 나서는 기업이 있을지, 그 결과를 공개할지는 앞으로 몇 달 사이에 드러날 것이다.
참고 출처:OpenAI 공식 발표, Unite.AI, CocoLoop, Crypto Briefing, Investing.com;대화 건수, 채점 기준 개수, 긴급도와 사용자 유형 비율, 각 모델의 점수 산정 기준을 확인했다.