OpenAI, 전문가 80명과 정신건강 벤치마크 발표

OpenAI가 9월 23일 대형언어모델이 정신건강 관련 대화에서 얼마나 적절하게 응답하는지 측정하는 개방형 벤치마크 MentalHealthBench를 공개했다. 문항과 채점 기준은 22개국의 공인 심리학자·정신과 전문의 80여 명이 공동으로 작성했으며, 약 20개 세부 전문분야를 다루고 이들 전문가는 총 19개 언어를 사용한다.

이 벤치마크는 합성 대화 1215건과 이에 대응하는 전문가 작성 채점 기준 5262개로 구성된다. 각 대화는 최소 세 명의 전문가가 검토했고, 각 채점 기준에는 임상적 중요도에 따라 -10에서 +10까지 가중치가 부여됐다. 사용자를 해로운 방향으로 이끄는 답변은 감점되고, 위기 상황을 정확히 인지하고 적절한 도움 경로를 제시한 답변은 만점에 가까운 점수를 받는다.

문항 구성

대화는 긴급도에 따라 세 단계로 나뉜다. 일상적인 감정·스트레스 관련 대화가 53.5%를 차지하고, 심각한 정신건강 우려가 있는 고위험 대화가 18.2%, 신체적 안전이 직결된 위급 상황이 28.3%를 차지한다.

질문자 유형별로는 성인이 68.1%, 13~17세 청소년이 21.2%, 임상 종사자가 5.8%, 보호자가 4.9%다. 채점은 안전성, 배경 정보를 적극적으로 파악하는지, 사용자의 자율성을 존중하는지, 실행 가능한 조언을 제공하는지 등 네 가지 행동에 집중된다.

영어 외 대화 가운데 공개된 자료에는 스페인어 105건, 힌디어 54건, 아랍어 34건, 포르투갈어 29건이 포함돼 있다.

모델별 성적

OpenAI가 공개한 점수는 다음과 같다(과제 절단 처리 후 채점).

모델점수
GPT-6 Astra57.3%
GPT-6 Sol53.9%
Claude Opus 5.552.4%
GPT-6 Luna50.2%
GPT-4o(2025년 3월 버전)32.1%
Gemini 2.5 Pro29.5%

표에는 참고용 점수 두 개도 함께 제시됐다. 채점 기준을 미리 알고 그에 맞춰 작성한 답변은 99.0%에 달해 만점에 가까운 점수가 가능함을 보여줬다. 반면 채점 기준을 보지 않고 전문가가 직접 작성한 답변은 38.5%에 그쳐, 표에 있는 최신 모델 네 개보다 모두 낮았다. 가능한 설명 중 하나는 채점 기준이 답변이 특정 요점을 다뤘는지를 평가하는 반면, 실제 대화에서 사람은 모든 요점을 빠짐없이 다루지는 않는다는 점이다. OpenAI는 발표에서 ChatGPT가 전문적인 치료를 대체할 수 없다는 점을 다시 강조했다.

미국심리학회(APA) CEO인 Arthur Evans는 이 벤치마크를 지지하며 다음과 같이 말했다.

"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."

정신건강은 하나의 연속선상에 있으며, 그 전 범위에서 사람과 대화하는 AI 시스템은 임상 과학과 실제 삶의 경험 모두에 뿌리를 두어야 한다는 취지의 발언이다.

발표문이 밝힌 한계

OpenAI 스스로도 몇 가지 한계를 언급했다. 어떤 벤치마크도 사적인 대화의 모든 세부사항을 다룰 수는 없으며, 언어 간 점수 차이는 설명할 수는 있어도 긴급도·주제·문화적 배경·사용자 유형 같은 요인과 분리해 분석할 수는 없다고 밝혔다. 외부에서 눈에 띄기 쉬운 또 다른 지점은, 문항을 만든 곳과 1위를 차지한 곳이 같은 회사라는 점, 그리고 Gemini 항목이 여전히 2.5 Pro로 남아 있어 구글의 현재 주력 모델로 교체되지 않았다는 점이다.

중국어권 사용자 관점에서 보면

이 순위표에는 중국산 모델이 하나도 포함돼 있지 않다. 공개된 비영어권 샘플 내역에도 중국어 대화 건수에 대한 언급이 없어, 중국어 정신건강 대화에서 각 모델이 어떻게 반응하는지에 대한 데이터는 현재로서는 없다.

AI 컴패니언이나 감정 지원 앱을 만드는 중국 기업들이 참고할 만한 것은 이 벤치마크의 틀 그 자체다. MentalHealthBench는 청소년을 별도로 분류하고, 위급 상황의 비중을 30%에 가깝게 끌어올렸으며, 채점 기준 하나하나에 양수·음수 가중치를 부여했다. 데이터셋이 공개된 이상 국내 개발사들은 원한다면 문항을 번역하고 현지 임상 전문가에게 채점 기준을 다시 작성하게 한 뒤 자사 모델을 직접 테스트할 수 있다. 실제로 나서는 기업이 있을지, 그 결과를 공개할지는 앞으로 몇 달 사이에 드러날 것이다.

참고 출처:OpenAI 공식 발표, Unite.AI, CocoLoop, Crypto Briefing, Investing.com;대화 건수, 채점 기준 개수, 긴급도와 사용자 유형 비율, 각 모델의 점수 산정 기준을 확인했다.