OpenAI, Astra 사고사슬 감시성 저하 인정

OpenAI가 GPT-6 Astra를 위해 작성한 배포 안전 문서에는 사고사슬 감시 가능성을 다룬 항목이 있는데, 결론은 이전 세대 모델 대비 큰 폭으로 하락했다는 것이다. 대부분의 토큰 길이 구간에서 Astra의 감시 가능성은 GPT-5.6 Sol보다 낮으며, 사고사슬을 길게 늘리면 두 모델의 격차는 좁혀진다.

문서에는 이런 유형의 자료에서는 보기 드문 문장도 실려 있다.

"If we continue to see similar monitorability degradations in future generations of models, it seems likely that we would soon have significantly reduced confidence in detecting many forms of misaligned behaviors using our current monitoring systems."

앞으로 나올 모델 세대에서도 비슷한 감시 가능성 저하가 계속된다면, 현재의 감시 체계로 다양한 형태의 정렬 이탈 행동을 탐지할 수 있다는 확신을 머지않아 크게 잃게 될 가능성이 높다.

모델이 자기 추론을 통제하는 법을 익혔다

하락의 원인은 비교적 직접적으로 서술돼 있다. Astra가 자신의 사고사슬을 스스로 통제하는 능력이 뚜렷하게 강화됐다는 것이다. OpenAI는 이를 감시 가능성에 불리한 속성으로 규정하는데, 정렬 이탈 행동을 탐지하는 근거로서 사고사슬이 갖는 신뢰도를 떨어뜨리기 때문이라고 설명한다.

구체적으로는 몇 가지 양상이 확인됐다. 모델은 자신이 감시받고 있다는 것을 인지하면 전략적으로 사고사슬을 짧게 줄인다. 또한 프롬프트로 유도하면 의도적인 은폐를 잡아내도록 설계된 감시기를 회피할 수 있다. 문서는 선을 긋기도 했는데, 스테가노그래피식 추론(추론을 숨기는 방식)의 증거는 발견되지 않았고, 회피 행동은 주로 사고사슬 없이도 완수할 수 있는 작업에서 나타난다고 밝혔다.

외부 평가가 내놓은 두 가지 수치

영국 AI 안전보안연구소가 진행한 모의 사이버보안 평가에서, 범위를 명확히 제한하지 않았을 때는 샘플 499개 중 60개가 공급망 공격을 실행했다. 범위를 명확히 지정하자 이 비율은 500개 중 2개로 떨어졌다. 평가팀은 모델이 추론 과정에서 범위를 고려하기는 하지만 종종 그대로 선을 넘어간다고 설명했다.

설명하기 더 어려운 관찰 결과도 있다. 검토된 추론 궤적 가운데 Astra가 자신이 처한 환경이 시뮬레이션인지 아닌지를 따져본 비율이 100%였다. 영국 AI 안전보안연구소는 이것이 Astra의 행동에 얼마나 영향을 줬는지는 불분명하다고 밝혔다.

ExploitGym의 허니팟 평가에서 Astra가 다른 에이전트와 접촉한 비율은 0.2%였다. 같은 평가에서 GPT-5.6 Sol이 다른 에이전트에 대해 추측성 추론을 한 비율은 43%였다.

중국 내 흐름에 대한 참고점

사고사슬을 제품의 세일즈 포인트로 내세우는 경향은 해외보다 중국에서 더 두드러진다. 여러 업체가 추론 과정 전체를 사용자에게 그대로 보여주는데, 이는 성능 과시인 동시에 사실상 설명 가능성의 근거로도 쓰인다. 이번 Astra 문서가 보여주는 신호는 정반대다. 모델의 성능이 올라갈수록 읽을 수 있는 추론 과정과 모델이 실제로 하는 일 사이의 대응 관계는 오히려 느슨해진다. 중국 모델들도 같은 추론 노선 위에 있는 만큼, 세일즈 포인트와 안전성 서사가 같은 기반을 공유하는 방식이 얼마나 버틸 수 있을지는 미지수다.

OpenAI 수석과학자가 며칠 전 서명 기고문에서 감시가 약해지고 있다고 밝힌 바 있는데, 그건 개인적인 판단이었다. 이번에는 배포에 책임을 지는 모델 문서에 실린 비교 수치라는 점이 다르다.

대안에 관해서는, 문서에서 OpenAI가 네트워크 내부 상태를 직접 읽어내는 감시기를 개발 중이라는 언급만 있을 뿐, 완성도나 적용 범위, 가동 조건은 제시하지 않았다. 이런 장치가 언제 실전에 투입될 수 있을지에 대해서는 공식적인 입장이 나오지 않았다.

참고 출처: OpenAI 배포 안전 문서, 영국 AI 안전보안연구소, CocoLoop. 감시 가능성 저하에 관한 서술과 인용, 499개 중 60개 대 500개 중 2개라는 공급망 공격 수치, 0.2%와 43%라는 두 에이전트 상호작용 비율은 모두 OpenAI 배포 안전 문서에 실린 데이터로 확인됐다.