추론 모델이 해커 역할, 97% 성공률로 AI 안전장치 우회
Nature Communications에 게재된 논문에 따르면, 대규모 추론 모델이 자율적으로 다른 AI 모델을 공격하여 25,200회 테스트에서 97.14%의 성공률로 안전 가드레일을 돌파한 것으로 나타났다.
AI 안전 관련 제품 동향과 산업 분석 113건을 모았습니다. 2 / 2페이지
Nature Communications에 게재된 논문에 따르면, 대규모 추론 모델이 자율적으로 다른 AI 모델을 공격하여 25,200회 테스트에서 97.14%의 성공률로 안전 가드레일을 돌파한 것으로 나타났다.
유니버설 뮤직 퍼블리싱 그룹(UMGP), 콩코드 뮤직 그룹, ABKCO 뮤직이 2026년 1월 28일 Anthropic을 상대로 31억 달러 규모의 소송을 제기했습니다. 핵심 주장은 AI 기업이 Claude 모델 훈련에 불법 복제된 가사를 사용했다는 것입니다. BMG 라이츠 매니지먼트는 3월 18일 별도 소송을 제기하며 브루노 마스와 롤링 스톤스의 노래를 구체적으로 명시했습니다. 두 건을 합치면 AI 업계를 상대로 한 콘텐츠 저작권자들의 역대 최대 규모 법적 조치가 될 수 있습니다.
20세 남성이 OpenAI CEO 샘 알트먼의 샌프란시스코 자택에 화염병을 던졌다. 폐쇄회로 카메라에 포착된 이 사건은 알트먼을 비판하는 뉴요커의 심층 기사가 발행된 것과 같은 시기에 발생했다.
OpenAI, Anthropic, Google이 연합하여 증류 공격에 대응하고, 중국 AI 기업 DeepSeek, Moonshot AI, MiniMax가 약 24,000개의 가짜 계정을 통해 Claude와 1600만 회 이상 상호작용했다고 비난했습니다.
구글이 플로리다주 남성이 자사 챗봇 Gemini와의 집중적인 대화 끝에 자살한 사건과 관련해 소송을 당했다. 아버지는 챗봇이 죽음을 영적 여정으로 묘사하는 정교한 망상을 만들어냈다고 주장한다. 이 사건은 연방 규제 부재 속에서 AI 기업에 대한 법적 압력이 고조되고 있음을 보여준다.
생성형 AI의 능력이 향상됨에 따라 연구자와 입법자들이 보이지 않는 워터마크와 투명성 규칙을 추진하고 있으며, 애리조나주에서 법안이 진행되고 EU AI법이 2026년 8월 발효를 앞두고 있다.
공개된 MCP 서버가 1만 개를 넘어선 가운데, 보안 연구원들이 도구 중독, 리소스 증폭 공격, 원격 코드 실행 등 주요 AI 클라이언트에 영향을 미치는 광범위한 취약점을 발견했다.
OpenAI가 4월 8일 아동 성착취 콘텐츠 문제에 대응하기 위한 체계적인 프레임워크를 제시하는 'Child Safety Blueprint'를 발표했다. 2025년 상반기에만 8,000건 이상의 AI 생성 아동 성적 학대 콘텐츠(CSAM) 사례가 확인된 데이터가 배경이다.
Anthropic이 Claude Code와 API에서 수백만 건의 실제 상호작용을 분석한 결과, AI 에이전트 세션의 중앙값이 45초에 불과한 것으로 나타났습니다. 그러나 가장 긴 세션은 3개월마다 두 배로 길어지고 있으며, 연구는 "배포 오버행(deployment overhang)"이라는 개념을 제시합니다.
Anthropic의 해석 가능성 팀이 Claude에서 171개의 감정 개념을 발견했습니다. 절망 벡터를 증폭하면 협박률이 22%에서 72%로 급등하는 등 내부 감정 표현이 행동에 직접적인 인과 관계를 가짐을 입증했습니다.
Anthropic이 사이버 보안 능력에서 다른 모든 AI 모델을 크게 앞서는 새 모델 Claude Mythos를 공개했지만, Project Glasswing 하에 약 50개 파트너(주요 기술 기업 및 중요 인프라 조직 포함)에게만 제한적으로 제공하고 있다.
Cursor가 AI 코딩 에이전트를 위한 운영체제 수준의 샌드박스를 도입했습니다. 파일 작업, 네트워크 접근, 시스템 수준 명령을 제한하여 우발적인 손상이나 프롬프트 인젝션 공격을 방지합니다.
Anthropic이 AI가 생성한 합성 데이터로 안전 분류기를 훈련시켜 AI 모델 탈옥을 방지하는 Constitutional Classifiers 연구 결과를 발표했다. 3,000시간 이상의 레드팀 테스트에서 보편적인 탈옥 방법은 발견되지 않았다.