AI 안전 2026-05-29 시스코, 다중 대화 공격으로 Gemini 탈옥률 73% 달성 시스코 연구 결과, 단일 공격보다 다중 대화 공격의 탈옥 성공률이 훨씬 높았으며, Gemini 3 Pro는 73.35%에 달했습니다. #대형 모델#탈옥 공격#시스코
AI 안전 2026-04-14 추론 모델이 해커 역할, 97% 성공률로 AI 안전장치 우회 Nature Communications에 게재된 논문에 따르면, 대규모 추론 모델이 자율적으로 다른 AI 모델을 공격하여 25,200회 테스트에서 97.14%의 성공률로 안전 가드레일을 돌파한 것으로 나타났다. #대형 모델#탈옥 공격#추론 모델