Kimi K3 剛把 2.8 兆參數與 100 萬 token 上下文推到台前,另一張成績單很快追了上來。
英國 AI 安全研究所與美國 AI 標準與創新中心在 7 月 23 日發布聯合評估,把月之暗面的 Kimi K3 放進兩類網路安全測試。結果很直:它比智譜 GLM-5.2 強,但離美國前沿網路能力模型還有明顯距離。
ExploitBench 拉開差距
公開基準 ExploitBench 有 41 個任務。Kimi K3 總分 32.2%,GLM-5.2 為 24.4%,美國最強一組未具名前沿模型平均 76.2%。在任意程式碼執行這一最高結果上,Kimi K3 41 題一次也沒有做到;美國前沿模型做到 20 次。
一次完整攻擊鏈仍有分量
第二張卷子 The Last Ones 是 AISI 內部的 32 步企業網路攻擊模擬。報告稱,人類專家完成同類任務通常需要 20 小時。Kimi K3 平均推進到第 17 步,美國前沿模型平均到第 28.5 步;但它在 10 次嘗試中有 1 次完成整條攻擊鏈。
這組結果一邊壓住了全面追平的說法,一邊也提醒安全團隊:開放模型能力提升後,在防護薄弱的小型企業系統裡仍可能完成端到端攻擊。
通用分數不能替代網路分數
The Decoder 把結果放進蒸餾爭議背景。如果公開服務會攔截高危網攻請求,下游模型很難從公開輸出裡學到同樣深的攻擊能力。通用榜單、程式能力與網路風險需要分開看。
月之暗面尚未公開回應。後續要看 K3 是否補充網路安全模型卡、是否調整高危請求拒答策略,以及獨立團隊能否復跑同類測試。
參考來源:UK AISI/CAISI 聯合評估、美國 NIST 公告、The Decoder、CocoLoop、South China Morning Post、Kimi K3 官方技術部落格;核驗 ExploitBench 41 個任務、32.2%/24.4%/76.2% 評分、任意程式碼執行次數、The Last Ones 32 步任務、10 次嘗試 1 次完成及 Kimi K3 參數和上下文口徑。