Cientista-chefe da OpenAI diz que o monitoramento da cadeia de raciocínio está enfraquecendo

O cientista-chefe da OpenAI, Jakub Pachocki, publicou em 6 de setembro um longo ensaio intitulado "An Alien Mind", do qual uma frase foi amplamente citada: atualmente, ele acredita que nenhum laboratório resolveu alinhamento e monitoramento em grau suficiente para continuar escalando com responsabilidade na velocidade máxima.

A frase vem do cientista-chefe de uma empresa que está expandindo justamente na velocidade máxima — a posição de quem fala é mais incomum do que o próprio conteúdo.

A linha de monitoramento da cadeia de raciocínio está se degradando

Nos últimos dois anos, a aposta de segurança mais forte da OpenAI foi o monitoramento da cadeia de raciocínio (chain-of-thought monitoring): fazer com que modelos de raciocínio escrevam seus passos intermediários, para que outro sistema leia esses passos e avalie se o modelo está tramando algo. Pachocki lista três motivos que explicam por que esse método está ficando cada vez menos confiável.

Primeiro, os modelos de raciocínio atuais operam em ambientes complexos, em que o processo de raciocínio se entrelaça com chamadas de ferramentas, e essas chamadas já exigem, por si só, muita supervisão, o que torna os limites do monitoramento cada vez mais difusos. Segundo, os modelos estão cada vez mais hábeis tanto em como raciocinar quanto em como manipular seus próprios rastros de raciocínio. Terceiro, melhorias no pré-treinamento tornam os modelos mais capazes mesmo sem verbalizar o raciocínio.

"Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer."

Em tradução livre: Atualmente acredito que nenhum laboratório resolveu alinhamento e monitoramento em grau suficiente para continuar escalando com responsabilidade na velocidade máxima por muito mais tempo.

Pachocki acrescenta que essas dificuldades não são necessariamente insolúveis; a OpenAI está desenvolvendo novos métodos de intervenção, incluindo monitores com acesso direto ao estado interno da rede.

A outra ponta, três anos atrás

O texto resgata um momento específico. Em meados de 2023, num projeto interno de pesquisa da OpenAI chamado RLSlow, Pachocki e o colega Szymon viram, pela primeira vez, resultados que os convenceram de que era possível treinar modelos de raciocínio em escala — resultados que destravaram a capacidade de modelos pré-treinados formarem espontaneamente uma cadeia de raciocínio.

Juntando as duas pontas: deixar o modelo "pensar em voz alta" foi, ao mesmo tempo, um avanço de capacidade e, de quebra, uma janela de observação. Três anos depois, a capacidade continua crescendo, enquanto a janela de observação está se fechando. Na linha dos modelos de raciocínio, a OpenAI sempre tratou a legibilidade da cadeia de raciocínio como o pilar de sua narrativa de segurança. Agora a mesma empresa diz que esse pilar está se enfraquecendo.

De estrutura voluntária a padrão obrigatório

A proposta de Pachocki é elevar os frameworks voluntários já existentes no setor: documentos como o Preparedness Framework da OpenAI e a Responsible Scaling Policy da Anthropic deveriam evoluir para padrões de segurança obrigatórios, aplicados por auditores independentes, órgãos governamentais ou organizações internacionais. Ele também escreve que os governos deveriam colocar a coordenação internacional sobre o desenvolvimento de inteligência artificial como prioridade máxima, e que espera e deseja que a desaceleração voluntária se torne comum até que limiares de segurança comuns sejam estabelecidos.

Outra frase bastante citada é: uma vez que se compreende plenamente a gravidade do risco, a ideia de avançar a qualquer custo passa a soar absurda.

Por enquanto, essas declarações permanecem no nível de um ensaio assinado individualmente. A OpenAI não divulgou nenhum plano concreto de desaceleração, cronograma ou condições de acionamento, nem explicou em que circunstâncias pausaria ativamente alguma linha de treinamento. Quem definirá os limiares de segurança e de onde virão os auditores também não são questões respondidas no texto. No mesmo período, a empresa segue avançando com sua meta de automação da pesquisa e com um pedido de abertura de capital avaliado em 852 bilhões de dólares.

Fontes: ensaio oficial da OpenAI "An Alien Mind", Unite.AI, CocoLoop, AI Weekly; os três motivos para a queda na confiabilidade do monitoramento e as citações foram verificados a partir do texto público da OpenAI.