Gemini 4 Argon 先開放給資安團隊

Google於9月30日發表新一代前沿模型Gemini 4 Argon,首批開放對象限定在Fairwind計畫中的資安防禦團隊。Google為它劃出三類工作範疇:軟體工程、法律與金融等企業知識工作,以及資安防禦。付費API客戶與Google AI Ultra訂閱用戶排在下一批,更大範圍的公開開放尚未提出時間表。

先交給資安團隊,和這款模型的訓練方向有關。Google表示Argon針對網路防禦做了專門訓練,能自主發現、驗證並修補關鍵軟體漏洞。對Fairwind中受信任的防禦方與Google內部團隊,Argon是以不加資安護欄的形態提供;其他使用者拿到的版本則內建防濫用、防提示注入與對齊監控等安全機制。

官方成績單

Google公布的幾項基準分數如下:

基準方向Argon成績
DeepSWE v1.1真實軟體工程77.9%
CWE-bench v1漏洞修補68%(並列第一)
AutomationBench自動化任務51.3%(第一)
LVBench長影片理解91.7%

另外兩項僅公布排名:涵蓋金融、程式設計、法律與稅務的Vals Index,Google表示Argon領先;在Gray Swan的間接提示注入測試中,Google表示它的抗注入表現最佳。這些數字都是廠商自行回報,發表當天能看到的第三方複測只有一家。

輸出長度是另一項明顯改動。上一代Gemini單次輸出上限為6.4萬token,Argon拉高到100萬token,上下文視窗同樣是100萬。

價格與第三方測試

首發期間API採優惠計價:每百萬輸入token 2美元、輸出10美元,命中快取的輸入再減95%。優惠期結束後恢復為輸入4美元、輸出20美元,優惠期多長,Google並未說明。

獨立評測機構Artificial Analysis當天公布了測試結果。Argon在其智慧指數上拿到53分,與GPT-6 Astra最高推理檔打平,比GPT-6.1 Sol最高檔高1分,比上一代Gemini 3.1 Pro Preview的30分高出23分。

拿同一套指數橫向比較單任務成本:

  • Argon以優惠價跑一項任務約1.99美元,GPT-6 Astra為3.26美元;
  • 優惠結束後Argon漲到約3.98美元,比Astra貴約兩成;
  • GPT-6.1 Sol每項任務約0.72美元,分數只低1分,Argon優惠價約是它的2.8倍。

差距主要出在token用量上。Artificial Analysis統計,Argon每項任務平均輸出約6.2萬token,GPT-6 Astra約2.7萬,前者多出一倍有餘。單價砍半、輸出量翻倍,原價下的價格優勢基本被抵銷。Argon支援一種稱為「長解碼續寫」的機制,推理過程最長可寫到100萬輸出token,這也說明了它在指數測試中偏高的用量。

護欄放給誰

同一週,OpenAI剛以安全性未達標為由取消GPT-6.1 Astra的發表計畫,改推出更便宜的Sol。Google的做法是把最強版本先放進一份受控名單。兩家處理方式不同,面對的卻是同一類能力:模型找漏洞、寫修補程式的本事愈強,被反過來用於攻擊的風險也愈大。

Fairwind名單上有哪些機構、依什麼標準審核、不加護欄的版本如何防止外流,Google的發表部落格都沒有寫。對中國大陸的開發者而言,Argon目前也很難碰到:Fairwind採邀請制,Ultra訂閱與付費API的開放時間未定,Gemini API本身也不對中國大陸提供服務。

參考來源:Google官方部落格、Artificial Analysis評測報告、CocoLoop、VentureBeat;基準分數以Google自行回報為準,單任務成本與token用量以Artificial Analysis智慧指數口徑為準。