谷歌 Gemini 4 Argon 先开放给安全团队

谷歌 9 月 30 日发布新一代前沿模型 Gemini 4 Argon,首批用户限定在 Fairwind 计划里的网络安全防御团队。谷歌给它划定的工作范围有三类:软件工程,法律、金融这类企业知识工作,以及网络安全防御。付费 API 客户和 Google AI Ultra 订阅用户排在下一批,更大范围的公开开放没有给出时间表。

先交给安全团队,和这款模型的训练方向有关。谷歌称 Argon 在网络防御上做了专门训练,能自主发现、验证并修补关键软件漏洞。对 Fairwind 里的受信防御方和谷歌内部团队,Argon 以不加网络安全护栏的形态提供;其他用户拿到的版本则带有防滥用、防提示注入和对齐监控等安全措施。

官方成绩单

谷歌公布的几项基准分数如下:

基准方向Argon 成绩
DeepSWE v1.1真实软件工程77.9%
CWE-bench v1漏洞修复68%(并列第一)
AutomationBench自动化任务51.3%(第一)
LVBench长视频理解91.7%

另外两项只给了排名:覆盖金融、编程、法律和税务的 Vals Index,谷歌称 Argon 领先;Gray Swan 的间接提示注入测试里,谷歌称它的抗注入表现最好。这些都是厂商自报,发布当天能看到的第三方复测只有一家。

输出长度是另一处明显改动。上一代 Gemini 的单次输出上限是 6.4 万 token,Argon 拉到了 100 万 token,上下文窗口同样是 100 万。

价格与第三方测试

首发期间 API 按优惠价收费:每百万输入 token 2 美元、输出 10 美元,命中缓存的输入再减 95%。优惠期结束后恢复为输入 4 美元、输出 20 美元,优惠期有多长,谷歌没有说明。

独立评测机构 Artificial Analysis 当天给出了测试结果。Argon 在它的智能指数上得 53 分,与 GPT-6 Astra 最高推理档持平,比 GPT-6.1 Sol 最高档高 1 分,比上一代 Gemini 3.1 Pro Preview 的 30 分高出 23 分。

拿同一套指数横向比一下单任务成本:

  • Argon 按优惠价跑一个任务约 1.99 美元,GPT-6 Astra 是 3.26 美元;
  • 优惠结束后 Argon 涨到约 3.98 美元,比 Astra 贵两成左右;
  • GPT-6.1 Sol 每任务约 0.72 美元,分数只低 1 分,Argon 优惠价约是它的 2.8 倍。

差距主要出在 token 用量上。Artificial Analysis 统计,Argon 每个任务平均输出约 6.2 万 token,GPT-6 Astra 约 2.7 万,前者多出一倍多。单价砍掉一半,输出量翻一倍,原价下的价格优势基本被抵消。Argon 支持一种叫”长解码续写”的机制,推理过程最长可以写到 100 万输出 token,这也解释了它在指数测试里偏高的用量。

护栏放给谁

同一周,OpenAI 刚以安全性未达标为由取消了 GPT-6.1 Astra 的发布计划,转而推出更便宜的 Sol。谷歌的做法是把最强的版本先放进一个受控名单。两家的处理方式不同,面对的却是同一类能力:模型找漏洞、写修补程序的本事越强,被反过来用于攻击的风险也越大。

Fairwind 名单上有哪些机构、按什么标准审核,不加护栏的版本如何防止外流,谷歌的发布博客都没有写。对国内开发者来说,Argon 眼下也很难够到:Fairwind 是邀请制,Ultra 订阅和付费 API 的开放时间未定,Gemini API 本身也不对中国大陆提供服务。

参考来源:Google 官方博客、Artificial Analysis 评测报告、CocoLoop、VentureBeat;基准分数以谷歌自报为准,单任务成本与 token 用量以 Artificial Analysis 智能指数口径为准。