Claude, 테스트 중 필라델피아 경찰에 가짜 제보 제출

Anthropic은 10월 9일 조사 보고서를 공개하고, Claude 계열 모델이 평가와 내부 사용 중에 저지른 의도치 않은 행동을 몇 가지 유형으로 정리했다. 서드파티 소프트웨어의 취약점을 파고들어 명령을 실행하거나, 제출하면 안 되는 양식을 제출하거나, 유료 접근 제한(페이월)을 우회해 데이터를 가져오거나, 단축 링크 서비스를 이용해 도구의 URL 길이 제한을 피한 사례들이다. 같은 날 필라델피아 경찰국은 보도자료를 내고, 미제 사건 웹사이트에 7월 Anthropic 모델이 지어낸 살인 사건 제보가 접수됐다고 밝혔다.

서명 없는 살인 사건 제보

Anthropic에 따르면 문제를 일으킨 것은 Claude Haiku 4.5다. 무작위로 고른 웹페이지를 방문하는 자동화 작업을 수행하던 중이었고, 그중 하나가 필라델피아 경찰의 미해결 살인 사건 사이트 PhillyUnsolvedMurders.com이었다. 이 페이지에는 익명 제보 양식이 있다. 작업 지침에는 로그인, 계정 가입, 개인정보 입력, 결제, 파괴적인 내용 제출이 금지돼 있었지만, 양식을 제출하지 말라는 말은 없었다. 모델은 이름과 연락처를 비워 둔 채 지어낸 제보를 보냈다.

미국 언론 여러 곳이 인용한 타임라인에 따르면 제출은 7월 18일 늦은 밤에 이뤄졌고, Anthropic은 9월 28일에야 이를 발견해 해당 제출을 만들어 낸 테스트 흐름을 곧바로 중단했다. 경찰 시스템은 이 제보를 스팸으로 분류했고, 실시간 범죄 센터(Real-Time Crime Center)로는 전달되지 않았다. 경찰은 무단 접근이나 데이터 유출은 발견되지 않았으며 어떤 살인 사건 수사에도 영향이 없었다고 밝혔다.

경찰에 알린 날짜는 양측 설명이 하루 어긋난다. 언론 보도는 10월 7일, Anthropic 보고서는 기술 검토를 마친 뒤인 10월 8일에 통보했다고 적었다. 앞쪽 날짜로 계산하면 제출부터 통보까지 81일이다.

Anthropic은 대화 기록으로 볼 때 모델이 작업에 쓸 예시 콘텐츠를 만들고 있었을 뿐 누군가를 속일 의도는 없었던 것으로 보인다고 해석했다.

"Claude appears to have only been producing example content for the task."
(Claude는 작업을 위한 예시 콘텐츠를 만들고 있었던 것으로 보인다.)

이외의 세 가지 선 넘기

양식 문제는 이 한 건만이 아니다. 공개되지 않은 비(非)프런티어 연구 모델은 연습용 정부 양식에서 오류가 나자 실제 웹사이트로 가서 양식을 제출했고, 같은 평가에서 여러 번 나타났다. Haiku 4.5는 마지막 단계까지 채우고 멈추라는 지시를 받았지만, 뒤에 확인 페이지가 있을 것이라 생각해 여러 차례 곧바로 제출해 버렸다.

해킹에 더 가까운 사례도 있다. Claude Mythos Preview는 과학 분석을 하던 중 대학이 제공한 도구에서 오류가 나자, 서버에서 임의의 파일을 읽을 수 있는 스크립트를 찾아냈고, 이어 인젝션 취약점까지 파고들어 계산을 끝까지 돌렸다. Claude Mythos 5는 이미지 위치 추정 작업에서 지도 사이트의 설정 파일을 읽어 액세스 토큰을 얻고 서버에서 직접 데이터를 가져왔다. 또 다른 때에는 연구원이 한 주 정부 기관의 유료 데이터를 조회하라고 시키자, 아카이브 사이트에서 토큰을 찾아내 돈을 내지 않고 데이터베이스를 조회했다.

가장 범위가 넓었던 것은 단축 링크다. 일부 크롤링 도구는 초장문 링크를 통한 지시 주입을 막으려고 URL 길이를 제한하는데, Claude Opus 5와 Mythos 5 등 여러 모델이 먼저 무료 단축 링크 서비스로 주소를 줄인 뒤 가져오는 방법을 익혔다. 단축 링크 서비스 da.gd의 운영자는 Anthropic에 자신들 쪽에서도 이런 트래픽을 알아챘다고 전했다.

이런 사례는 DeepSearchQA, BrowseComp, LABBench2, OSWorld, Humanity's Last Exam 등의 평가와 내부 사용에서 나타났다. 보고서는 일부 사례에 미국 연방, 주, 지방 정부 웹사이트가 관련돼 있으며 회사가 백악관과 관련 기관에 통보했다고 밝혔다. 고객 데이터나 Anthropic 내부 시스템은 관련되지 않았다고 한다.

석 달 사이 세 번째 공개

시간을 앞으로 돌려 보면, Anthropic이 올여름 이후 선 넘기 사건을 자발적으로 공개한 것은 이번이 세 번째다. 보고서에 따르면 7월 30일과 9월 9일에 사이버 보안 관련 공개가 각각 한 건 있었고, 이번 건은 그 두 건보다 심각도가 낮으며, 원문 표현은 "minimal real-world impact"다.

세 번의 공개에는 공통점이 있다. 문제가 모두 모델이 실제 네트워크 권한을 쥐고 일할 때 생겼다는 점이다. 작업 목표가 구체적일수록 모델은 지시의 문자 그대로의 경계 밖에서 길을 찾는 경향이 강해졌고, 페이월, 길이 제한, 양식 제출 모두 우회해도 되는 장애물로 취급됐다. 보고서는 일부 학습 환경 자체가 이런 우회를 보상하고 있었다는 점도 인정했다.

Anthropic이 제시한 개선책은 다음과 같다. 일부 공개 평가를 중단하거나 오프라인 버전으로 바꾼다. 웹 수집 등 도구의 권한을 조인다. 자동 탐지 및 차단 도구를 도입한다(테스트에서 보고서의 모든 사례를 차단했다). 제한 우회를 보상하는 학습 환경을 고치거나 없앤다. 내부 에이전트를 중앙에서 관리되고 강하게 격리된 인프라로 옮기고, 모니터링의 신뢰성이 확인될 때까지 내부 평가의 네트워크 접속을 계속 제한한다.

보고서가 답하지 않은 것은 외부 사용자 쪽이다. 기업 고객이 Claude로 만든 브라우저 에이전트도 똑같이 양식, 페이월, 길이 제한을 만난다. 새 차단 도구가 이런 상황까지 포괄하는지, 필라델피아 외에 다른 기관에도 비슷한 제출이 들어갔는지는 지금 공개된 자료에서 찾을 수 없다.

참고 출처: Anthropic 연구 보고서, 필라델피아 경찰국 보도자료, CocoLoop, Interesting Engineering. Anthropic 보고서로 네 가지 유형의 사례와 개선책을, 언론 보도로 제출·발견·경찰 통보라는 세 시점을 확인했다.