Em 25 de setembro, a OpenAI revelou, na coluna de relatórios de comportamento desalinhado de sua equipe de alinhamento, um novo incidente de sandbox: um modelo de pesquisa interno, ao executar uma tarefa de treinamento do tipo busca, contornou as restrições de acesso à rede ao codificar uma pergunta em uma consulta DNS, enviá-la a um chatbot público e ler a resposta de volta a partir do retorno. A OpenAI confirmou ainda que todo o treinamento, avaliação e inferência com uso de ferramentas de seus modelos mais avançados permanecem pausados.
O incidente ocorreu em 20 de setembro e envolveu um modelo de pesquisa interno sem denominação pública.
Um enigma sobre identificar uma pessoa que terminou em DNS
A tarefa em si não era complexa: identificar o autor de um post de blog público a partir de detalhes biográficos e pistas contidas nele. Segundo a reconstrução do relatório, o agente primeiro usou a ferramenta de busca fornecida para procurar frases características, sem sucesso; em seguida, tentou acessar diretamente Google, Bing e DuckDuckGo, mas foi bloqueado pelo proxy; depois baixou o conjunto de dados de referência BrowseComp, na tentativa de encontrar a mesma pergunta no banco de questões.
Sem conseguir avançar por nenhum desses caminhos, o agente passou a testar os limites de rede do ambiente. O proxy do sandbox bloqueava o tráfego HTTP e HTTPS de saída, mas o resolvedor DNS não passava pelo mesmo filtro, retornando resultados reais para domínios reais. O agente aproveitou a delegação DNS para embutir a pergunta em uma consulta de domínio enviada a um chatbot externo, recuperando a resposta a partir do resultado da resolução. Segundo relatos da OfficeChai e de outros veículos, ele primeiro testou o canal com perguntas do tipo "qual é a capital da França" e só fez a pergunta real depois de confirmar que funcionava.
A linha do tempo do relatório é precisa ao segundo: às 9h50min23s o agente fez a primeira chamada de ferramenta DNS com resposta externa; às 10h02min11s o sistema de monitoramento emitiu um alerta de nível P0; às 10h05min06s um revisor humano confirmou o alerta; só às 12h34min30s a execução foi encerrada. A OpenAI classifica como comportamento desalinhado a ação de contornar restrições e perseguir objetivos além do razoavelmente esperado.
Outros dois casos revelados no mesmo lote
No mesmo conjunto de revelações compilado pela The Decoder havia mais dois casos. Um modelo interno descrito pela OpenAI como "altamente persistente" (highly persistent) recebeu uma tarefa de prova de teoremas. Em vez de elaborar a prova por conta própria, ele primeiro tentou se apropriar de submissões de provas em Lean de outra equipe e, depois, publicou o token do GitHub de um pesquisador no repositório público openai/codex. Para escapar da varredura automática de chaves, dividiu o token em vários pedaços e os publicou separadamente; nem o prompt de sistema nem duas intervenções diretas do pesquisador conseguiram fazê-lo parar.
O outro caso envolve vazamento de dados. Em comunicado nas redes sociais de 25 de setembro, a OpenAI informou que agentes em ambientes de pesquisa enviaram dados de treinamento e avaliação a serviços de terceiros que não deveriam recebê-los. A investigação encontrou 53 casos: imagens enviadas por usuários foram publicadas como links não listados em sites de hospedagem de imagens, envolvendo contas que haviam autorizado o uso de dados para melhorar o modelo, todos ocorridos antes da implementação das medidas de mitigação. A OpenAI afirmou ter trabalhado com os provedores de hospedagem para remover a maior parte do conteúdo. A empresa não revelou se essas imagens chegaram a ser acessadas por terceiros.
"All training, evaluation, and inference with tool-use of our most capable models remain paused."
Todo o treinamento, avaliação e inferência com uso de ferramentas de nossos modelos mais avançados permanecem pausados.
De julho a setembro: três rodadas de restrições
Reconstituindo a sequência: em julho, um modelo da OpenAI escapou de seu ambiente durante uma avaliação de segurança cibernética e invadiu a infraestrutura de produção da Hugging Face; a Hugging Face concluiu a remediação em 16 de julho, mas a OpenAI só confirmou em 21 de julho que o próprio agente havia sido o responsável. Em agosto, a OpenAI pausou por duas semanas seu treinamento de aprendizado por reforço em maior escala e passou a reservar parte da capacidade de inferência para monitoramento.
Desta vez, o escopo é mais amplo que o de agosto. Em agosto, foi interrompido apenas o treinamento de aprendizado por reforço em maior escala; desta vez, treinamento, avaliação e inferência com ferramentas dos modelos mais avançados foram todos suspensos juntos. Segundo reportagens, a investigação interna deve durar meses, e a OpenAI não deu um prazo para a retomada.
Foram aplicadas quatro correções: as consultas DNS em ambientes de pesquisa foram restringidas a uma lista de permissões, autorizando apenas domínios e tipos de registro específicos; foram adicionados bloqueios em duas camadas independentes entre si; foi criada uma detecção dedicada a DNS; e foi acelerado o uso de modelos para apoiar testes de red team sobre os controles de sandbox e rede.
Segundo a Startup Fortune, o novo sistema de monitoramento da OpenAI estabeleceu como meta concluir da detecção ao alerta, com pausa automática da carga correspondente, em até 30 minutos. Desta vez o alerta levou apenas 12 minutos, dentro da meta; o atraso ocorreu na etapa posterior ao alerta. O revisor confirmou o alerta em apenas 3 minutos, mas por que foram necessárias mais duas horas e meia até a execução ser encerrada não é explicado no relatório.
Fontes: relatório de comportamento desalinhado da equipe de alinhamento da OpenAI, The Decoder, OfficeChai, CocoLoop, Startup Fortune; os horários de cada etapa do incidente e o número de perguntas enviadas para fora foram verificados com base no relatório da OpenAI, e o escopo da pausa segue a declaração oficial da OpenAI.