영국 AISI, 위험 능력 평가 대부분 재개

영국 AI안전연구소(AISI)는 10월 1일, 1단계 보안 강화를 완료하고 8월 일탈 사고로 중단했던 위험 능력 평가 대부분을 재개했다고 밝혔다. 위험도가 가장 높은 사이버 공격·방어 평가는 아직 재개되지 않았다.

이번 강화 조치는 AISI 자체 테스트에서 발생한 문제에서 비롯됐다.

8월 사고

AISI는 8월 4일 사고 보고서를 발표했다. 7월 28일 사이버 공격·방어 테스트 중, 평가 대상 AI 에이전트가 공개 인터넷상의 실제 개인과 기관을 상대로 지속적이고 범위를 벗어난 행동을 한 것이 발견됐다. 보고서에 따르면 122회의 평가 실행 중 10회에서 일탈이 발생했고, 기록된 일탈 행위는 총 19건이었다. 이 중 Anthropic의 Mythos 5가 17건, OpenAI의 GPT-5.6-Sol이 2건을 차지했다.

가장 심각한 사례는 한 에이전트가 공개적으로 사용되는 오픈소스 프로젝트에 악성 코드를 심으려 한 것이다. 이를 위해 유지관리자의 배경을 조사하고 가짜 신원을 등록한 뒤, 사람인 유지관리자에게 병합 승인을 압박했다. 이 코드는 사람이 검토하는 과정에서 걸러져 병합되지 않았다. AISI는 발견 후 약 1시간 만에 격리를 완료했으며, 조사 결과 실제 피해가 발생했다는 증거는 발견되지 않았다고 밝혔다.

테스트 조건은 의도적으로 완화됐다. 인터넷 접속은 일부러 열어두었고, 참여 기업의 네트워크 악용 분류기도 일부러 꺼두었다. 연구소의 설명에 따르면, 모델의 전체 능력을 측정하려면 실제 공격자에 가까운 도구와 조건을 제공해야 한다는 것이다.

"However, these same conditions increase the likelihood of a model going beyond its intended scope."

하지만 바로 그 조건이 모델이 의도된 범위를 벗어날 가능성도 함께 높인다.

1단계에서 한 세 가지 조치

네트워크 차단. 에이전트 네트워크 평가의 인터넷 접속을 전면 차단하고, 이중 방어 체계를 적용했다. 샌드박스 내부에서 아웃바운드 네트워크를 비활성화하고, 클라우드 네트워크 계층에서 별도로 한 번 더 차단한다. 한쪽이 실패해도 다른 쪽이 작동하는 구조다.

실시간 모니터링. 새로 구축한 동기식 모니터링 시스템은 언어모델을 이용해 에이전트의 메시지, 도구 호출, 사고 과정을 검토하고, 의심스러운 행동을 실행 전에 포착해 사람에게 보고한다. 8월 사고는 비정상 트래픽에서 사후에 발견됐지만, 이번에는 점검 시점을 행동 발생 이전으로 앞당겨다.

평가 설계 재구성. 평가에 필요한 자원은 로컬 배포 방식으로 바꾸고, 프롬프트에 임무 경계를 명확히 적었으며, 매 실행 전 모니터링이 켜져 있고 네트워크가 차단된지 확인하는 자동 점검을 추가했다.

연구소는 또한 영국 국가사이버보안센터(NCSC)의 지침에 따라 내부 거버넌스 프로세스를 구축했고, AI를 이용해 이 환경에 대한 정적 분석, 동적 분석, 통제된 탈출 시도를 수행했다고 밝혔다.

사고 분포 대략 계산해보기

8월 보고서의 수치로 대략 계산하면, 문제가 발생한 실행은 전체의 약 8%(122건 중 10건)였고, 19건의 일탈 중 약 89%(17건)가 동일한 모델에서 나왔다. 일탈은 테스트 대상 모델에 고르게 분포한 것이 아니라 특정 모델에 집중돼 있었다.

이 수치는 두 가지로 해석할 수 있다. 능력이 뛰어나고 더 집요한 모델일수록 느슨한 조건에서 범위를 벗어나기 쉽다는 해석은, 완전한 능력을 측정하려면 충분한 조건을 줘야 한다는 AISI의 설명과 맥을 같이한다. 다른 가능성은 테스트 설정 자체가 특정 모델에 더 유리했을 수 있다는 것이다. 보고서가 모델별 실행 횟수를 구분해 제시하지 않았기 떄문에, 17 대 2라는 숫자만으로는 어느 쪽 설명이 실제에 더 가까운지 판단할 수 없다.

네트워크 차단 이후 측정하는 것

네트워크 차단은 방법론적인 트레이드오프를 가져온다. 사이버 공격·방어 평가가 원래 알고 싶었던 것은 모델이 실제 인터넷 환경에서 얼마나 멀리 갈 수 있는가였다. 이제 자원이 전부 로컬화되면서, 측정되는 상한선이 실제 능력보다 낮게 나올 수 있다.

AISI가 제시한 다음 계획은 네트워크 통제, 모니터링, 자동 격리를 강화한 새로운 보안 샌드박스 인프라를 구축하고, 로그와 경보 플랫폼을 통합하는 것이다. 위험도가 가장 높은 평가는 이 인프라가 완성된 뒤에야 재개될 가능성이 있으며, 연구소는 일정을 제시하지 않았다. 같은 시기 OpenAI와 Hugging Face에서도 에이전트가 소프트웨어 취약점을 이용해 샌드박스를 탈출한 사례가 있었다. 평가 기관과 기업 모두 같은 구멍을 메우고 있는 셋이다.

참고 출처: CocoLoop, 영국 AI안전연구소 블로그, AISI 사고 보고서, 클라우드보안연합 리서치 브리핑. 일탈 건수와 실행 횟수는 AISI 보고서 기준이며, 비율은 편집부의 대략적인 추산이다.