谷歌 DeepMind 于 9 月 2 日发布 Gemini 3.8 Flash。按官方模型卡的说法,它建立在 3.7 Flash 之上,改进集中在软件工程和智能体知识工作流两块。距离员工内测版被曝光只隔了几天。
规格没有大改:输入上下文最高 100 万 token,单次输出上限 6.4 万 token,知识截止到 2026 年 3 月,部分领域仍停在 2025 年 1 月。分发渠道一次铺开,Gemini 应用、AI Studio、Gemini API、Gemini Enterprise Agent Platform、Google AI Mode 和编程工具 Antigravity 都能用上。模型支持可调的努力等级,让开发者自己在质量、成本和延迟之间找平衡点。
同一张表里的两副面孔
官方对比表把 3.8 Flash 和 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra 摆在一起,看点在价格和跑分的错位。
3.8 Flash 沿用推广价,每百万输入 token 0.75 美元、输出 3.75 美元;Claude Opus 5 是 5 美元和 25 美元,中间隔着六倍多。这个价差下,两者在 Terminal-bench 2.1 上是 89.4 比 89.1,基本咬平;CharXiv 图表推理 86.2 比 83.7、HLE-Verified 54.9 比 54.4、金融分析师任务 61.4 比 58.6、Harvey 法律工作流 10.0 比 6.7,都是 3.8 Flash 在前,长视频理解 87.8 比 75.4 拉得更开。
把任务拉长,画面就翻了过来。Terminal-bench 4.0 考察更通用的智能体能力,Opus 5 拿到 51.8,3.8 Flash 只有 19.1;智能体操作电脑的 OSWorld-2.0 是 75.4 比 59.0;衡量知识工作的 GDPVal-AA v2 Elo 分,1824 比 1545。DeepSWE 这类长周期软件工程任务上,74.0 比 71.0,差得不算多但方向一致。
规律挺清楚:任务越短、越接近单轮判断,价格档位的影响越小;任务越长、越需要模型自己维持状态和纠错,档位差距就重新拉开。粗算一笔账,同样跑完一条中等复杂度的编码流水线,3.8 Flash 的推理开销大概是 Opus 5 的六分之一,成绩差在一个百分点以内;换成要连续操作几十步的智能体流程,省下的钱会被失败重试吃掉多少,得自己试过才知道。
对 3.7 Flash 的提升倒是实打实。DeepSWE 从 65.3 到 71.0,Terminal-bench 4.0 从 11.2 到 19.1,OSWorld 从 50.6 到 59.0,生物研究工作流的困难档从 43.4 跳到 56.5。几周一版的节奏下,这个幅度不算小。
用户比公告先知道
官方模型卡挂出来之前,开发者社区里已经有人察觉不对:网页版和 Antigravity 里还标着 3.7 Flash 的模型,被问到”你是什么模型”时回答自己是 3.8 Flash。也有人正用着,模型选择器里突然多出一行 3.8 Flash,努力等级默认选了 High。
静默换模型在前沿实验室是常规操作,能在真实负载下先跑一轮,出问题随时切回去。代价落在使用者这边:同一个模型名下的行为在某个时刻变了,提示词效果、token 消耗、输出风格都可能跟着变,这些通常不会写进任何更新日志。对按 token 结算的团队来说,账单上的波动来得比公告早。
社区第一批测试用的还是老办法:让模型一次生成太阳系动画,或者画一只鹈鹕的 SVG。这类测试谈不上科学,胜在门槛低、好坏一眼能看出来,官方跑分出来之前往往是唯一的参照。风评也没统一,有人夸有人骂,跟每次模型更新一样。
便宜是有期限的
模型卡列了几条已知限制:偶发的响应缓慢和超时还在;努力等级调高时模型会为了拉性能多花 token,实际成本未必按标价线性走。安全方面官方称整体与 3.7 Flash 相当,人工红队确认达到儿童安全的上线门槛,非英语场景的安全指标有轻微回落。
价格那栏底下还有一行小字:3.7 和 3.8 Flash 的推广价 12 月 31 日截止,明年 1 月 1 日起恢复到每百万输入 1.5 美元、输出 7.5 美元,正好翻倍。这份性价比表,四个月后要重算一遍。
参考来源:Google DeepMind 模型卡、CocoLoop、谷歌官方性能对比表、开发者社区讨论;上下文长度、输出上限、知识截止与分发渠道以模型卡核对,各项跑分与每百万 token 单价取自官方对比表。