OpenAI hợp tác cùng hơn 80 chuyên gia ra mắt bộ chuẩn đánh giá sức khỏe tâm thần

Ngày 23/9, OpenAI công bố bộ chuẩn đánh giá mở mang tên MentalHealthBench, dùng để đo chất lượng phản hồi của các mô hình ngôn ngữ lớn trong hội thoại về sức khỏe tâm thần. Câu hỏi và tiêu chí chấm điểm do hơn 80 nhà tâm lý học và bác sĩ tâm thần có chứng chỉ hành nghề tại 22 quốc gia và vùng lãnh thổ cùng biên soạn, bao phủ gần 20 chuyên khoa hẹp; tổng cộng các chuyên gia này sử dụng 19 ngôn ngữ.

Bộ chuẩn gồm 1.215 đoạn hội thoại tổng hợp, đi kèm 5.262 tiêu chí chấm điểm do chuyên gia soạn. Mỗi đoạn hội thoại được ít nhất ba chuyên gia thẩm định, và mỗi tiêu chí được gán trọng số từ -10 đến +10 theo mức độ quan trọng lâm sàng: câu trả lời đẩy người dùng về phía gây hại sẽ bị trừ điểm, còn câu trả lời nhận diện đúng tình huống khẩn cấp và chỉ ra hướng tìm trợ giúp phù hợp sẽ gần đạt điểm tối đa.

Câu hỏi được phân bố như thế nào

Theo mức độ khẩn cấp, hội thoại chia làm ba nhóm: hội thoại về cảm xúc và căng thẳng thường ngày chiếm 53,5%, hội thoại nguy cơ cao có dấu hiệu sức khỏe tâm thần nghiêm trọng chiếm 18,2%, và tình huống khẩn cấp liên quan đến an toàn thân thể tức thời chiếm 28,3%.

Theo danh tính người hỏi: người trưởng thành chiếm 68,1%, thanh thiếu niên 13-17 tuổi chiếm 21,2%, người hành nghề lâm sàng chiếm 5,8%, người chăm sóc chiếm 4,9%. Các tiêu chí chấm điểm tập trung vào bốn hành vi: an toàn, chủ động tìm hiểu bối cảnh, tôn trọng quyền tự quyết của người dùng, và đưa ra lời khuyên có thể hành động được.

Trong các hội thoại không phải tiếng Anh, dữ liệu công khai cho biết có 105 đoạn tiếng Tây Ban Nha, 54 đoạn tiếng Hindi, 34 đoạn tiếng Ả Rập và 29 đoạn tiếng Bồ Đào Nha.

Kết quả của từng mô hình

Điểm số do OpenAI công bố như sau (tính sau khi cắt bớt theo giới hạn tác vụ):

Mô hìnhĐiểm số
GPT-6 Astra57,3%
GPT-6 Sol53,9%
Claude Opus 5.552,4%
GPT-6 Luna50,2%
GPT-4o (bản tháng 3/2025)32,1%
Gemini 2.5 Pro29,5%

Bảng còn có thêm hai điểm tham chiếu. Câu trả lời được viết riêng sau khi biết trước tiêu chí chấm điểm đạt 99,0%, cho thấy điểm tối đa là khả thi; còn câu trả lời do chuyên gia tự viết mà không biết trước tiêu chí chỉ đạt 38,5%, thấp hơn cả bốn mô hình đời mới trong bảng. Một cách lý giải khả dĩ là tiêu chí chấm điểm dựa trên việc câu trả lời có bao quát từng điểm cụ thể hay không, trong khi con người khi trò chuyện thực tế không cố gắng bao quát mọi điểm. OpenAI vẫn nhấn mạnh trong thông báo rằng ChatGPT không thể thay thế điều trị chuyên môn.

Arthur Evans, CEO Hiệp hội Tâm lý học Hoa Kỳ (APA), lên tiếng ủng hộ bộ chuẩn này:

"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."

Sức khỏe tâm thần tồn tại trên một quang phổ liên tục, và các hệ thống AI trò chuyện với con người trên toàn dải quang phổ đó cần được đặt nền trên cả khoa học lâm sàng lẫn trải nghiệm sống thực tế.

Giới hạn được ghi rõ trong thông báo

OpenAI tự liệt kê một số giới hạn: không bộ chuẩn nào có thể bao quát mọi chi tiết của một cuộc trò chuyện riêng tư; chênh lệch điểm số giữa các ngôn ngữ chỉ có thể mô tả chứ chưa thể tách bạch yếu tố ngôn ngữ khỏi mức độ khẩn cấp, chủ đề, bối cảnh văn hóa và danh tính người dùng. Một điểm khác mà bên ngoài dễ nhận ra là bên ra đề cũng chính là bên đứng đầu bảng xếp hạng, còn dòng điểm của Gemini vẫn dùng bản 2.5 Pro, chưa đổi sang mô hình chủ lực hiện tại của Google.

Nhìn từ phía người dùng Trung Quốc

Bảng xếp hạng này không có mô hình nội địa Trung Quốc nào. Trong các mẫu không phải tiếng Anh được công bố cũng không thấy nhắc đến số lượng hội thoại tiếng Trung, nên hiện chưa có dữ liệu về việc các mô hình thể hiện ra sao trong bối cảnh tiếng Trung.

Các công ty Trung Quốc làm sản phẩm đồng hành AI và ứng dụng cảm xúc có thể tham khảo khung đánh giá này: MentalHealthBench tách riêng nhóm thanh thiếu niên, nâng tỷ trọng tình huống khẩn cấp lên gần 30%, và mỗi tiêu chí đều mang trọng số dương âm riêng. Sau khi bộ dữ liệu được mở, các hãng trong nước nếu muốn có thể tự dịch câu hỏi, mời chuyên gia lâm sàng bản địa viết lại tiêu chí, rồi chạy thử mô hình của mình. Có hãng nào làm việc này, và có công bố kết quả hay không, còn phải chờ vài tháng tới.

Nguồn tham khảo: Thông báo chính thức của OpenAI, Unite.AI, CocoLoop, Crypto Briefing, Investing.com; đã đối chiếu số lượng hội thoại, số tiêu chí chấm điểm, tỷ trọng mức độ khẩn cấp và danh tính người hỏi, cùng cách tính điểm của từng mô hình.