OpenAI 수석과학자, CoT 모니터링 한계 지적

OpenAI 수석과학자 야쿠프 파초츠키(Jakub Pachocki)가 9월 6일 장문의 에세이 'An Alien Mind'를 발표했다. 이 글에서 널리 인용된 문장은, 현재 그 어떤 연구소도 정렬(alignment)과 모니터링 문제를 최고 속도로 책임감 있게 계속 확장할 수 있을 만큼 충분히 해결하지 못했다는 판단이다.

이 발언은 다름 아닌 최고 속도로 확장을 이어가고 있는 회사의 수석과학자 본인의 입에서 나왔다는 점에서, 내용 자체보다 그 위치가 더 이례적이다.

체인 오브 소트 모니터링이라는 수단이 약해지고 있다

지난 2년간 OpenAI가 안전 대책에서 가장 크게 걸었던 수단은 체인 오브 소트(CoT) 모니터링이었다. 추론 모델이 중간 단계를 글로 풀어내게 하고, 별도의 시스템이 그 단계를 읽어 모델이 무언가를 꾸미고 있지는 않은지 판단하는 방식이다. 파초츠키는 이 방법의 신뢰도가 낮아지고 있는 이유로 세 가지를 꼽았다.

첫째, 지금의 추론 모델은 복잡한 환경 속에서 작동하며 추론 과정과 도구 호출이 뒤엉켜 있고, 도구 호출 자체가 상당한 감독을 필요로 하면서 모니터링의 경계가 흐려지고 있다. 둘째, 모델은 어떻게 추론할 것인지, 그리고 자기 자신의 추론 흔적을 어떻게 조작할 것인지에 점점 더 능숙해지고 있다. 셋째, 사전학습의 개선으로 모델은 추론을 말로 드러내지 않고도 더 강력해지고 있다.

"Currently I believe that no lab has solved alignment and monitoring to a sufficient degree to continue responsibly scaling at maximum speed for much longer."

현재 나는 어떤 연구소도 최고 속도로 책임감 있게 확장을 오랫동안 지속할 수 있을 만큼 충분한 수준으로 정렬과 모니터링 문제를 해결하지 못했다고 생각한다.

파초츠키는 이러한 어려움이 반드시 해결 불가능한 것은 아니라고 덧붙이며, OpenAI가 네트워크의 내부 상태에 직접 접근할 수 있는 모니터를 포함해 새로운 개입 수단을 개발하고 있다고 밝혔다.

3년 전, 그 반대편

글은 한 시점으로 거슬러 올라간다. 2023년 중반, OpenAI 내부의 'RLSlow'라는 연구 프로젝트에서 파초츠키와 동료 시몬(Szymon)은 추론 모델 훈련을 확장할 수 있다는 확신을 준 첫 결과를 목격했다. 이는 사전학습된 모델이 스스로 체인 오브 소트를 형성하는 능력을 열어젖힌 결과였다.

이 두 지점을 이어보면, 모델이 '소리 내어 생각하게' 만드는 것은 한때 능력의 돌파구이자 동시에 관찰할 수 있는 창이기도 했다. 3년이 지난 지금, 능력은 계속 올라가고 있지만 그 관찰의 창은 닫히고 있다. 추론 모델 계열에서 OpenAI는 오랫동안 체인 오브 소트의 가독성을 안전 서사를 떠받치는 기둥으로 삼아왔다. 이제 같은 회사가 그 기둥이 흔들리고 있다고 말하고 있다.

자발적 프레임워크에서 강제적 표준으로

파초츠키의 제안은 업계에 이미 존재하는 자발적 프레임워크―OpenAI 자체의 Preparedness Framework, Anthropic의 Responsible Scaling Policy 같은 문서―를 제3자 감사 기관, 정부 부처 또는 국제기구가 집행하는 강제적 안전 표준으로 끌어올리자는 것이다. 그는 또 각국 정부가 AI 개발에서의 국제 공조를 최우선 과제로 삼아야 한다고 썼고, 공동의 안전 기준이 마련되기 전까지는 자발적인 속도 조절이 흔해질 것으로 예상하며 그렇게 되기를 바란다고도 밝혔다.

자주 인용되는 또 다른 문장이 있다. 위험의 심각성을 제대로 곱씹어 보면, 어떤 대가를 치르더라도 질주하겠다는 발상은 터무니없어 보인다는 것이다.

이런 발언은 현재로서는 개인 명의 에세이 수준에 머물러 있다. OpenAI는 구체적인 감속 계획이나 일정, 발동 조건을 전혀 공개하지 않았으며, 어떤 상황에서 특정 훈련 경로를 스스로 멈출 것인지도 밝히지 않았다. 안전 기준을 누가 정하고 감사 기관이 어디서 나올 것인지에 대해서도 글은 답을 내놓지 않는다. 같은 시기 이 회사가 밀어붙이고 있는 것은 연구 자동화라는 목표와, 기업가치 8520억 달러로 평가되는 상장 신청이다.

참고 출처: OpenAI 공식 에세이 'An Alien Mind', Unite.AI, CocoLoop, AI Weekly. 모니터링 신뢰도 저하에 관한 세 가지 이유와 인용문은 OpenAI의 공개 에세이 내용을 바탕으로 검증했다.