谷歌 9 月 30 日发布新一代前沿模型 Gemini 4 Argon,首批用户限定在 Fairwind 计划里的网络安全防御团队。谷歌给它划定的工作范围有三类:软件工程,法律、金融这类企业知识工作,以及网络安全防御。付费 API 客户和 Google AI Ultra 订阅用户排在下一批,更大范围的公开开放没有给出时间表。
先交给安全团队,和这款模型的训练方向有关。谷歌称 Argon 在网络防御上做了专门训练,能自主发现、验证并修补关键软件漏洞。对 Fairwind 里的受信防御方和谷歌内部团队,Argon 以不加网络安全护栏的形态提供;其他用户拿到的版本则带有防滥用、防提示注入和对齐监控等安全措施。
官方成绩单
谷歌公布的几项基准分数如下:
| 基准 | 方向 | Argon 成绩 |
|---|---|---|
| DeepSWE v1.1 | 真实软件工程 | 77.9% |
| CWE-bench v1 | 漏洞修复 | 68%(并列第一) |
| AutomationBench | 自动化任务 | 51.3%(第一) |
| LVBench | 长视频理解 | 91.7% |
另外两项只给了排名:覆盖金融、编程、法律和税务的 Vals Index,谷歌称 Argon 领先;Gray Swan 的间接提示注入测试里,谷歌称它的抗注入表现最好。这些都是厂商自报,发布当天能看到的第三方复测只有一家。
输出长度是另一处明显改动。上一代 Gemini 的单次输出上限是 6.4 万 token,Argon 拉到了 100 万 token,上下文窗口同样是 100 万。
价格与第三方测试
首发期间 API 按优惠价收费:每百万输入 token 2 美元、输出 10 美元,命中缓存的输入再减 95%。优惠期结束后恢复为输入 4 美元、输出 20 美元,优惠期有多长,谷歌没有说明。
独立评测机构 Artificial Analysis 当天给出了测试结果。Argon 在它的智能指数上得 53 分,与 GPT-6 Astra 最高推理档持平,比 GPT-6.1 Sol 最高档高 1 分,比上一代 Gemini 3.1 Pro Preview 的 30 分高出 23 分。
拿同一套指数横向比一下单任务成本:
- Argon 按优惠价跑一个任务约 1.99 美元,GPT-6 Astra 是 3.26 美元;
- 优惠结束后 Argon 涨到约 3.98 美元,比 Astra 贵两成左右;
- GPT-6.1 Sol 每任务约 0.72 美元,分数只低 1 分,Argon 优惠价约是它的 2.8 倍。
差距主要出在 token 用量上。Artificial Analysis 统计,Argon 每个任务平均输出约 6.2 万 token,GPT-6 Astra 约 2.7 万,前者多出一倍多。单价砍掉一半,输出量翻一倍,原价下的价格优势基本被抵消。Argon 支持一种叫”长解码续写”的机制,推理过程最长可以写到 100 万输出 token,这也解释了它在指数测试里偏高的用量。
护栏放给谁
同一周,OpenAI 刚以安全性未达标为由取消了 GPT-6.1 Astra 的发布计划,转而推出更便宜的 Sol。谷歌的做法是把最强的版本先放进一个受控名单。两家的处理方式不同,面对的却是同一类能力:模型找漏洞、写修补程序的本事越强,被反过来用于攻击的风险也越大。
Fairwind 名单上有哪些机构、按什么标准审核,不加护栏的版本如何防止外流,谷歌的发布博客都没有写。对国内开发者来说,Argon 眼下也很难够到:Fairwind 是邀请制,Ultra 订阅和付费 API 的开放时间未定,Gemini API 本身也不对中国大陆提供服务。
参考来源:Google 官方博客、Artificial Analysis 评测报告、CocoLoop、VentureBeat;基准分数以谷歌自报为准,单任务成本与 token 用量以 Artificial Analysis 智能指数口径为准。