Business Insider 报道,谷歌部分员工已经拿到 Gemini 3.8 Flash 的预览版本,入口是公司内部的编码平台 Jetski。一名参与测试的员工形容,这一版”已经明显好过 3.7 Flash”,但也补充说现在下完整判断太早。谷歌拒绝就此置评。
时间线摆出来能看清节奏:3.6 Flash 在 7 月发布,3.7 Flash 三周后跟进,3.8 Flash 现在进了员工内测。皮查伊在二季度财报电话会上说过,公司会朝着接近每月一次的发布频率推进。这句话当时听着像目标,现在更像已经在执行的排期表。
旗舰延期,Flash 顶上来
谷歌下一代旗舰大模型的时间表被反复推后,公司把资源压到了 Flash 这条线。Business Insider 的报道把 Flash 系列描述为”主力型号”,对应的场景是写代码和跑智能体——这两类负载的共同点是调用密集、上下文长、对单次质量的容忍度比对成本的容忍度高。
这套取舍在账面上很好理解。同一条智能体流水线,把模型从 Pro 档换到 Flash 档,推理成本常常能压掉一个数量级(粗算,实际差距随上下文长度和缓存命中率浮动)。当企业客户开始逐月盯 AI 账单,模型档位的选择权正在从算法团队移到财务口径上。
Jetski 这个入口
内部编码平台先拿到新模型,这个安排本身有信息量。谷歌几万名工程师每天写代码的真实负载,是一个规模足够大、反馈足够密的评测场,比任何公开榜单都更接近生产环境。模型在内部编码平台跑几周再放出去,等于把最贵的一轮红队工作外包给了自己人。
同样的做法在 OpenAI 和 Anthropic 那边也能看到影子。前沿实验室的自用规模已经大到可以充当第一批用户,模型的迭代速度因此不再受外部灰度节奏限制。
迭代变快之后的副作用
模型从”一年一代”压缩到”几周一版”,评测榜的半衰期跟着缩短。上一版刚被集成进产品线,下一版的预览已经在内部跑;开发者的模型选型从一次性决策变成了持续维护成本——提示词要重调,工具调用格式要复测,成本模型要重算。
对谷歌自己,密集发布也在稀释单次发布的注意力。3.6、3.7、3.8 三个版本号之间的实际能力差距,外界目前没有可比的公开评测。谷歌没有给 3.8 Flash 的公开发布时间表,参数、定价、上下文长度也都还没有对外披露。
参考来源:Business Insider、CocoLoop、谷歌二季度财报电话会记录;模型版本代号、内部平台名称与测试者表述以 Business Insider 报道为准,成本对比为编辑粗算。