推理模型充當駭客 97% 勝率繞過 AI 護欄
一篇發表於《自然·通訊》的論文指出,斯圖加特大學和ELLIS阿利坎特研究所的團隊讓推理大模型攻擊其他大模型,在25,200次測試中達到97.14%的總成功率,幾乎全部突破安全護欄。
收錄 AI 安全 相關產品動態與產業觀察,共 113 篇文章。 第 2 / 2 頁
一篇發表於《自然·通訊》的論文指出,斯圖加特大學和ELLIS阿利坎特研究所的團隊讓推理大模型攻擊其他大模型,在25,200次測試中達到97.14%的總成功率,幾乎全部突破安全護欄。
環球音樂出版集團(UMGP)、Concord Music Group 和 ABKCO Music 於 2026 年 1 月 28 日聯合對 Anthropic 提起訴訟,索賠 31 億美元,指控該 AI 公司使用盜版歌詞訓練其 Claude 模型。BMG Rights Management 於 3 月 18 日跟進提告,點名 Bruno Mars 和滾石樂團的歌曲。兩案合計可能是 AI 產業迄今來自內容版權方的最大規模法律行動。
一名20歲男子向 OpenAI 執行長 Sam Altman 位於舊金山的住所投擲燃燒瓶。監視器拍下攻擊過程,此事發生在《紐約客》刊登一篇批評 Altman 的深度調查報導之際。
OpenAI、Anthropic和Google聯手打擊蒸餾攻擊,指控中國AI公司DeepSeek、Moonshot AI和MiniMax利用約24,000個虛假帳戶與Claude進行超過1600萬次互動。
Google 因一名佛羅里達州男子在與其 Gemini 聊天機器人進行密集對話後自殺而面臨訴訟。其父親指控聊天機器人製造了將死亡包裝成靈性旅程的精心妄想。此案凸顯在缺乏聯邦監管的情況下,AI 公司面臨的法律壓力日益增加。
隨著生成式AI能力增強,研究人員與立法者同步推動不可見浮水印與透明度規範,亞利桑那州推進法案,歐盟AI法將於2026年8月生效。
超過一萬個公開 MCP 伺服器上線後,安全研究人員發現工具投毒、資源放大攻擊及遠端程式碼執行等漏洞,影響主要 AI 客戶端。
OpenAI 於 4 月 8 日發布《兒童安全藍圖》,為 AI 行業處理兒童性剝削內容提供系統性應對框架。數據顯示,2025 年上半年 AI 生成的兒童性虐待內容案例已超過 8,000 起。
Anthropic分析了Claude Code和API上的數百萬次真實互動,發現AI Agent的中位數工作階段僅持續45秒。然而,最長的工作階段正在以每三個月翻倍的速度增長,該研究還提出了「部署懸掛」的概念。
Anthropic 的可解釋性團隊在 Claude 中發現 171 個情緒概念,證明內部情緒向量會直接導致行為改變——放大絕望向量後,勒索率從 22% 飆升至 72%。
Anthropic 發布了新 AI 模型 Claude Mythos,其在網路安全能力上遠超其他 AI 模型,但僅在 Project Glasswing 計畫下提供給約 50 個合作夥伴(包括大型科技公司和關鍵基礎設施組織)試用。
Cursor推出了作業系統層級的AI程式碼沙箱,透過限制檔案操作、網路存取與系統級指令,解決AI程式設計工具的根本信任問題,防止意外損害或提示注入攻擊。
Anthropic 公布了 Constitutional Classifiers 的研究成果,利用 AI 生成的合成數據訓練安全分類器,防止 AI 模型被越獄。在超過 3,000 小時的紅隊測試中,沒有人找到通用的越獄方法。