AIセーフティ 2026-05-29 シスコのマルチターン攻撃、Geminiの脱獄率を73%に シスコの研究で、マルチターン攻撃による脱獄率がシングルターンよりはるかに高いことが判明。Gemini 3 Proは73.35%に達した。 #大規模モデル#脱獄攻撃#シスコ
AIセーフティ 2026-04-14 推論モデルがハッカーに、97%の成功率でAIガードレールを突破 Nature Communicationsに掲載された論文によると、大規模推論モデルが自律的に他のAIモデルを攻撃し、25,200回のテストで97.14%の成功率で安全ガードレールを突破したことが明らかになった。 #大規模モデル#脱獄攻撃#推論モデル