谷歌 7 月 21 日一次放出三款 Flash 系列模型,表面看是 Gemini 家族又添新成员。把价格、速度和用途放在一起看,动作更直接:Google 正把 Agent 和企业应用从“谁分数最高”拉回“谁能便宜、快、稳地跑很多次”。
这次上新绕开了单一旗舰模型叙事。Gemini 3.6 Flash 面向综合能力,Gemini 3.5 Flash-Lite 面向低价和高吞吐,Gemini 3.5 Flash Cyber 则把安全任务单独拆出来。同一家公司在一天内把通用、低成本、安全三条线分开定价,说明模型竞争已经进入工作负载细分阶段。
低价模型承担高频调用
Google 官方博客称,新版 Flash-Lite 的实时输出速度比上一代快 17%,在独立基准中达到约 350 tokens/s。DeepMind 模型页还列出另一组成本口径:3.5 Flash-Lite 输入价格为每百万 token 0.30 美元,输出价格为每百万 token 2.50 美元。
这组数字的阅读方式很重要。开发者做聊天机器人时,会关心一次回答好不好;做 Agent、浏览器自动化、客服路由和批量文档处理时,要看上千次小调用能不能压住延迟和账单。一个模型如果便宜但慢,Agent 会卡在工具调用链上;如果快但贵,企业很难把它铺进日常流程。
Gemini 3.6 Flash 走另一条线。Google 称它相对 3.5 Flash 在编码、Agentic 任务和多模态理解上更强,DeepMind 页面列出的价格为每百万 token 1.50 美元输入、7.50 美元输出。它更像日常主力模型,Flash-Lite 则负责把边缘任务和高频任务吃掉。
安全模型被单独拿出来卖
第三款 Flash Cyber 更像这次发布的钩子。Google 没把它当通用聊天模型推,官方定位指向网络安全场景,包括安全分析、漏洞研究、恶意软件分析和事件响应。
安全任务和普通办公任务的评价口径不同。模型要读日志、看代码、解释告警,还要在不确定证据里控制误报和漏报。DeepMind 页面列出 Flash Cyber 在 CTI-MCQ、CTI-RCM、MARS-EVAL、CyberSecEval 等安全相关评测里的成绩,Google 还说它在多项安全基准上相比 3.5 Flash 有最高 65% 的提升。
这个数字不能泛化成“所有网络安全任务强 65%”。它对应的是 Google 列出的安全基准口径,应用到企业 SOC、代码审计或红队场景时,还要看数据源、工具接入、权限边界和人工复核流程。
Google CEO Sundar Pichai 今年曾给过一个更大的背景判断:
“The opportunity with AI is as big as it gets.”
放到这次产品线上,机会不只在更大的旗舰模型。安全团队、客服团队、设计工具和开发工具都在把模型嵌进工作流,模型公司必须回答更细的问题:哪种任务用哪种模型,预算烧在哪里,失败时谁兜底。
客户要的是三角平衡
Google 在模型页放了 Figma 的评价。Figma 工程负责人 Vincent van der Meulen 说:
“When evaluating models for Figma Make, we look for a balance of quality, speed, and cost.”
这句话很适合解释 Flash 系列的方向。企业采购模型时,已经很少只问榜单第一名。设计工具、代码助手、表格分析、客服质检都要在质量、速度和成本之间找平衡。Gemini 3.6 Flash、3.5 Flash-Lite 和 Flash Cyber 的分工,就是把这个三角关系产品化。
对中文开发者更现实的一层是 API 账单。国内团队经常把一个 Agent 流程拆成搜索、读取、规划、调用工具、改写输出、检查结果等步骤。每一步都用旗舰模型,体验可能不错,成本和延迟会很快失控。Flash-Lite 这类模型的价值,在于给这些低风险、高频、可复核步骤提供便宜算力。
安全模型也有参照意义。国内企业做私有化 AI 安全助手时,常把通用大模型接进告警平台或代码库,再用提示词硬控。Google 单独推出 Flash Cyber,说明安全场景开始从“通用模型加提示词”走向“专门模型加流程约束”。
还要看真实负载
这次发布留下的验证指标很具体。第一,Flash-Lite 的 350 tokens/s 是独立基准口径,真实应用还要看上下文长度、工具调用、网络延迟和并发限流。第二,Flash Cyber 的 65% 提升来自安全 benchmark,企业落地要看误报率、漏报率和人工复核成本。第三,Gemini 3.6 Flash 如果要成为主力模型,需要在编码、多模态和 Agent 任务里证明单位成本优势。
Google 这次没有只推一个更强模型,重点放在把不同负载拆成不同产品。大模型市场的下一轮竞争,很可能在账单、延迟、安全边界和工作流适配里展开。谁能把这些参数讲清楚,谁才有机会进入企业每天反复运行的系统。
参考来源:Google 官方博客、Google DeepMind 模型页、Axios、Business Insider、Artificial Analysis、CocoLoop;核验三款 Flash 模型用途、tokens/s 速度口径、每百万 token 定价、安全 benchmark 提升幅度、客户引语与模型可用性。