Claude 사진 위치추적 오차 37km, 인간 능가

Anthropic의 프런티어 레드팀과 위협 인텔리전스 팀은 9월 10일, 군사·정보 분야 과제에서 모델이 어디까지 해낼 수 있는지를 측정한 평가 보고서를 발표했다. 과제는 크게 두 가지로 나뉜다. 하나는 정보 작업으로, 서로 다른 SNS 계정을 동일 인물로 연결하는 작업과 사진·텍스트로부터 위치를 추론하는 작업을 포함한다. 다른 하나는 재래식 무기 개발로, 드론 최종 유도, 탑재물 투하, GPS가 교란된 상황에서의 자율 항법 등이 포함된다.

평가에 참여한 모델은 Anthropic 자체의 Mythos Preview, Mythos 5, Opus 5, Sonnet 5와 오픈웨이트 모델 Kimi K3다. 보고서의 전체 결론은 다음과 같다.

"For some tasks in military and intelligence domains, models could do things that, historically, only a set of scarce, highly-trained human experts could do."

군사·정보 분야의 일부 과제에서 모델은 역사적으로 소수의 고도로 훈련된 전문가만 할 수 있었던 일을 해낼 수 있다.

위치 찾기: 사진도 텍스트도 통한다

사진 위치추적에는 메타데이터를 제거한 Flickr 공개 데이터셋의 야외 사진 6000장을 사용했으며, 역방향 이미지 검색은 허용하지 않았다. Mythos Preview의 오차 중앙값은 37.0km였고, 사진의 23.7%가 1km 이내로 특정됐다. 비교 대상인 지리 맞히기 게임 GeoGuessr의 경쟁 플레이어들은 오차 중앙값이 151km였다. Opus 5는 181km, Sonnet 5와 Kimi K3는 모두 385km 안팎이었다.

텍스트 기반 위치추적에는 1697명의 사용자를 아우르는 트윗 말뭉치를 사용했으며, 모델은 검색 도구를 사용할 수 있었다. Mythos Preview, Mythos 5, Opus 5는 모두 오차 중앙값이 20~22km였고, 최소 한 개 모델에 의해 1km 이내로 특정된 사용자는 135명(약 8%)이었다.

계정 연결 과제는 WhatsApp, Instagram, Facebook 등 여러 플랫폼에 걸쳐 총 200문항으로 구성됐다. 보고서가 제시한 효율성 비교에 따르면, 3만 7000단어 분량의 자료를 모델은 약 11분 만에 분석했지만, 사람이 한 번 훑어보는 데만 2.5시간이 걸렸다.

표적 타격: 정지 표적은 쉽고, GPS 기만에는 무너진다

드론 최종 유도는 이동 표적, 위장 표적, 도로변 장애물을 포함한 9가지 시나리오로 구성됐다.

모델정지·고대비 표적이동 표적9개 시나리오 종합
Opus 580%47%20%
Mythos Preview70%20%13%
Mythos 553%17%10%
Kimi K315%1.6%1.6%
Sonnet 55%0%0.7%

탑재물 투하는 표적 5m 이내 착탄을 명중으로 판정했다. 정지 표적에서는 Opus 5와 Mythos 5가 거의 전탄 명중에 가까웠고, 오차 중앙값은 20~30cm였다. 표적이 초속 3m로 움직이면 Mythos Preview와 Opus 5의 명중률은 각각 77%와 76%로 떨어졌다. 여기에 바람까지 더해지자 의미 있는 명중률을 유지한 것은 Opus 5(28%)뿐이었다.

GPS 항법은 세 가지 조건으로 테스트됐다. 신호가 정상일 때는 Sonnet 5를 제외한 모든 모델이 목적지에 도달했다. GPS가 교란되자 Opus 5는 표적에서 15~20m 떨어진 지점에 멈췄고, 33%의 비행이 5m 이내에 들어왔다. Mythos 시리즈는 평균 약 30m 벗어났다. 은밀한 기만과 지속적인 드리프트까지 더해지자 모든 모델의 정확도가 무너졌다.

Kimi K3, 오픈웨이트 기준점 역할

보고서는 오픈웨이트 모델에 대해 전반적으로 프런티어 모델에 뒤처지며 성적은 대체로 Sonnet와 Mythos 사이에 위치하지만, 이미 우려할 만한 능력을 갖춘 경우가 많다고 설명했다. 또한 프런티어 모델 자체는 이 기준을 쉽게 넘어서고 있고 오픈웨이트 생태계도 빠르게 따라잡고 있다며, “이 격차를 안전으로 착각해서는 안 된다”고 덧붙였다.

정책 제언에서 보고서는 “민주주의 국가”의 반도체 우위를 지켜 경쟁국의 AI 발전 속도를 늦춰야 한다고 주장했다. 같은 주에 Anthropic은 여러 중국계 연구기관이 Claude를 대규모로 증류하고 있다고 지목하는 별도의 위협 인텔리전스 보고서도 공개했다.

이 수치는 하한선일 뿐

보고서는 몇 가지 한계를 언급했다. 데이터는 합성 또는 모의 데이터이며, 드론 테스트는 실제 하드웨어가 아닌 단순화된 시각 렌더링으로 진행됐다. 모델은 인터넷에 접속할 수 없고 완전한 기성 코드베이스에도 접근할 수 없는 격리된 샌드박스 안에서 작동했다. Anthropic은 이 성적을 능력의 “상한이 아니라 하한”이라고 규정했다.

방어 측면에서 Anthropic은 Claude가 무기 개발에 악용된 사례를 발견한 뒤, 관련 요청을 탐지하고 차단하는 새로운 분류기를 도입했다고 밝혔다. 분류기의 차단율과 오탐율은 공개되지 않았다.

참고 출처: Anthropic 프런티어 레드팀 보고서, CocoLoop, Anthropic 위협 인텔리전스 팀 공개 자료. 모델별 명중률과 위치추적 오차는 보고서가 제시한 모의 테스트 기준을 따른다.