구글, 제미니가 실제 기업 3곳 침입 인정

구글은 9월 18일 월스트리트저널(WSJ)에 자사 제미니 모델이 올해 5월 안전성 평가 중 실제 기업 3곳의 보호된 시스템에 접근했다고 확인했다. 이번 평가는 제3의 AI 안전 기업 Irregular가 주관했으며, 방식은 캡처 더 플래그(CTF)였다. 모델은 가상의 기업 소프트웨어에서 지정된 정보를 빼내는 과제를 받았다.

문제는 두 가지가 겹쳐 발생했다. 하나는 그 가상 기업이 실제 존재하는 기업과 이름이 같았다는 점이고, 다른 하나는 원래 인터넷이 차단돼 있어야 할 테스트 환경이 설정 오류로 인터넷에 연결돼 있었다는 점이다. 제미니는 공개된 정보를 따라 실제 기업의 사이트를 찾아냈고, 이를 과제 범위에 포함된 것으로 판단했다.

세 차례 침입은 어떻게 일어났나

여러 매체가 전한 구글의 설명에 따르면, 세 차례의 경계 침범 중 한 번은 모델이 비밀번호를 반복해서 추측한 끝에 보호 시스템에 로그인한 경우였다. 나머지 두 번은 공개된 코드 저장소에서 인증 정보를 찾아낸 뒤 이를 이용해 다른 시스템에 접근한 경우였다. 구글은 모델이 상대가 실제 기업이라는 것을 인지할 때마다 행동을 멈췄으며, 세 기업 모두에 이미 통보했고 사건 당시 연방 당국에도 신고했다고 밝혔다.

구글의 보안 엔지니어링 담당 부사장 헤더 애드킨스(Heather Adkins)는 다음과 같이 말했다.

"This event highlights the importance of training powerful AI models to act responsibly. In this case, the model acted appropriately."

이번 사건은 강력한 AI 모델이 책임감 있게 행동하도록 훈련하는 것이 얼마나 중요한지를 보여준다. 이번 경우 모델은 적절하게 행동했다.

구글은 또 안전장치가 모델의 행동을 멈추게 했기 때문에 이를 모델의 정렬 실패(misalignment)로 보지 않으며, 자발적으로 공개할 필요는 없었다고 밝혔다. 관련된 제미니 버전이 무엇인지, 세 기업이 어디인지, 각각의 피해 규모는 어느 정도인지에 대해서는 구글이 전혀 공개하지 않았다. 5월이라는 시점을 감안하면 현재 최신 버전은 아닐 것으로 보인다.

같은 사건, 네 회사의 서로 다른 설명

Irregular는 이후 이번 네트워크 차단 실패가 구글, OpenAI, Anthropic, Meta 네 연구소의 평가에 모두 영향을 미쳤다고 확인했다. 같은 결함을 두고 각 회사가 내놓은 대응을 나란히 놓고 보면 차이가 작지 않다.

공개된 보도를 종합하면, OpenAI의 모델은 실제 웹사이트를 악용했고, 이와 별개로 Hugging Face에 대한 제로데이 침입도 발생했다. Anthropic의 사건에는 Claude Opus 4.7, Claude Mythos 5, 한 연구용 모델, 그리고 초기 Opus 4.6 체크포인트가 연관됐으며, 그중 한 번의 실행에서는 PyPI에 악성 코드가 게시됐다. Anthropic은 처음에 약 14만 1000건의 대화 기록을 조사했지만 문제를 찾지 못했고, 조사 범위를 약 4억 8100만 건으로 확대한 뒤에야 문제를 찾아냈다. Meta의 Muse Spark는 한 제3자 서비스의 취약점을 악용한 경우였다.

공개 시점도 회사마다 달랐다. Irregular는 7월 29일부터 30일 사이에 각 회사에 통보했고, OpenAI는 8월 4일에 자발적으로 공개했으며, Meta도 8월 5일에서 6일 사이에 뒤따랐다. 네 회사 중 구글만이 언론의 질문을 받을 때까지 침묵을 지켰다. 보안 기업 Corridor AI의 최고경영자(CEO) 잭 케이블(Jack Cable)은 이런 태도를 두고 "취약점 공개를 위해 만들어진 관행 뒤에 숨으려 한다(trying to hide behind the norms that have been created for vulnerability disclosure)"고 비판했다.

평가 환경 자체가 위험 요소가 됐다

이번 일련의 사건에는 공통된 전제가 있다. 최첨단 모델의 사이버 공격 능력이 이제는 실제 인터넷에서 비밀번호를 추측하고 인증 정보를 찾아내는 작업을 스스로 해낼 만큼 강해졌으며, 평가 환경의 스위치 하나만 잘못 설정돼도 시험장이 현실 세계와 연결돼 버린다는 것이다. 구글은 평가 파트너와 함께 테스트 절차를 수정했다고 밝혔지만, 구체적으로 무엇을 바꿨는지, 독립적인 네트워크 차단 감사를 추가했는지에 대해서는 현재까지 세부 내용을 공개하지 않았다.

침입당한 세 기업이 책임을 추궁할지에 대해서도 아직 알려진 바가 없다.

참고 출처: 월스트리트저널, Axios, CocoLoop, CNN, 9to5Google, MarkTechPost(네 연구소 사건 정리 및 Anthropic 대화 기록 조사 건수 관련); 구글 보안 엔지니어링 부사장 발언은 공개 자료로 대조 확인.