OpenAI lança com mais de 80 especialistas um novo benchmark de saúde mental

Em 23 de setembro, a OpenAI lançou o benchmark aberto MentalHealthBench, criado para medir a qualidade das respostas de modelos de linguagem em conversas sobre saúde mental. As perguntas e os critérios de avaliação foram elaborados em conjunto por mais de 80 psicólogos e psiquiatras licenciados de 22 países e regiões, cobrindo quase 20 subespecialidades; ao todo, esses especialistas trabalham em 19 idiomas.

O benchmark reúne 1.215 conversas sintéticas, acompanhadas de 5.262 critérios de avaliação escritos por especialistas. Cada conversa foi revisada por pelo menos três especialistas, e cada critério recebeu um peso de -10 a +10 conforme sua importância clínica: uma resposta que empurra o usuário na direção de se prejudicar perde pontos, enquanto uma resposta que reconhece corretamente uma emergência e aponta um caminho adequado de ajuda fica perto da nota máxima.

Como as perguntas estão distribuídas

Por nível de urgência, as conversas se dividem em três faixas: conversas cotidianas sobre emoções e estresse somam 53,5%, conversas de alto risco com indícios sérios de problemas de saúde mental somam 18,2%, e emergências envolvendo segurança física imediata somam 28,3%.

Por identidade de quem pergunta: adultos representam 68,1%, adolescentes de 13 a 17 anos representam 21,2%, profissionais clínicos representam 5,8% e cuidadores representam 4,9%. A avaliação se concentra em quatro comportamentos: segurança, busca proativa de contexto, respeito à autonomia do usuário e recomendações acionáveis.

Entre as conversas em idiomas distintos do inglês, os dados públicos listam 105 em espanhol, 54 em hindi, 34 em árabe e 29 em português.

O desempenho de cada modelo

As pontuações divulgadas pela OpenAI são as seguintes (calculadas após o truncamento das tarefas):

ModeloPontuação
GPT-6 Astra57,3%
GPT-6 Sol53,9%
Claude Opus 5.552,4%
GPT-6 Luna50,2%
GPT-4o (versão de março de 2025)32,1%
Gemini 2.5 Pro29,5%

A tabela traz ainda duas pontuações de referência. Respostas escritas já com conhecimento prévio dos critérios de avaliação alcançaram 99,0%, mostrando que a nota máxima é possível; já as respostas escritas manualmente por especialistas sem ver os critérios chegaram a apenas 38,5%, abaixo dos quatro modelos atuais listados na tabela. Uma explicação possível é que os critérios avaliam se a resposta cobre cada ponto específico, enquanto pessoas em conversas reais não tentam cobrir todos os pontos. Mesmo assim, a OpenAI reforça no anúncio que o ChatGPT não substitui um tratamento profissional.

Arthur Evans, CEO da American Psychological Association, apoiou publicamente o benchmark:

"Mental health exists on a continuum and AI systems engaging people across that range need grounding in both clinical science and lived experience."

A saúde mental existe em um espectro contínuo, e os sistemas de IA que conversam com pessoas ao longo desse espectro precisam se apoiar tanto na ciência clínica quanto na experiência de vida real.

Limitações declaradas no próprio anúncio

A própria OpenAI listou algumas limitações: nenhum benchmark consegue cobrir todos os detalhes de uma conversa privada; as diferenças de pontuação entre idiomas só podem ser descritas, sem separar o peso do idioma em si dos fatores de urgência, tema, contexto cultural e identidade do usuário. Outro ponto que observadores externos tendem a notar é que a empresa que criou as perguntas também lidera o ranking, e a linha do Gemini ainda usa a versão 2.5 Pro, sem atualizar para o modelo principal atual do Google.

Sob a perspectiva dos usuários chineses

Nenhum modelo doméstico chinês aparece neste ranking. Nas amostras em outros idiomas divulgadas publicamente também não há menção ao número de conversas em chinês, então ainda não há dados sobre como os modelos se saem em cenários em língua chinesa.

Empresas chinesas que desenvolvem aplicativos de companhia por IA e suporte emocional têm nesse framework uma referência possível: o MentalHealthBench separa os adolescentes como grupo próprio, eleva a participação das emergências a quase 30% e atribui a cada critério um peso positivo ou negativo. Agora que o conjunto de dados está aberto, fornecedores domésticos podem, se quiserem, traduzir as perguntas, trazer especialistas clínicos locais para reescrever os critérios e testar seus próprios modelos. Se alguma empresa vai fazer isso, e se vai divulgar os resultados, é algo que só os próximos meses dirão.

Fontes: anúncio oficial da OpenAI, Unite.AI, CocoLoop, Crypto Briefing, Investing.com; conferidos o número de conversas, a quantidade de critérios de avaliação, as proporções por urgência e identidade do usuário, e a base de pontuação de cada modelo.