Google三款Flash模型改打成本戰

Google 7 月 21 日一次推出三款 Flash 系列模型,表面看是 Gemini 家族更新。把價格、速度和用途放在一起看,動作更直接:Google 正把 Agent 和企業 AI 從單純比模型分數,拉回到成本、延遲和工作負載分工。

Gemini 3.6 Flash 面向綜合能力,Gemini 3.5 Flash-Lite 面向低價和高吞吐,Gemini 3.5 Flash Cyber 則針對資安任務。同一家公司把通用、低成本、資安三條線分開定價,說明模型競爭進入工作負載細分階段。

低價模型承擔高頻呼叫

Google 表示,新版 Flash-Lite 的即時輸出速度比上一代快 17%,在獨立基準中約達 350 tokens/s。DeepMind 模型頁列出的價格為每百萬輸入 token 0.30 美元、每百萬輸出 token 2.50 美元。

一般聊天看回答品質;Agent、客服路由、瀏覽器自動化和批量文件處理,要看上百上千次小呼叫能否壓住延遲和帳單。便宜但慢會卡住流程,快但貴則難以進入日常生產。

資安模型被單獨拉出來

Flash Cyber 是這次發布中最有辨識度的一款。Google 沒把它當一般聊天模型推,而是寫明針對安全分析、漏洞研究、惡意軟體分析和事件回應。

DeepMind 頁面列出 CTI-MCQ、CTI-RCM、MARS-EVAL、CyberSecEval 等結果,Google 稱它在部分資安基準上相對 3.5 Flash 最高提升 65%。這個數字對應的是公開基準口徑,進企業 SOC、程式碼審計或紅隊流程時,仍要看誤報、漏報和人工複核成本。

Google CEO Sundar Pichai 曾說,AI 帶來的機會大到不能再大。

客戶買的是三角平衡

Google 模型頁引用了 Figma 工程負責人 Vincent van der Meulen 的說法:評估 Figma Make 的模型時,他們會看品質、速度和成本的平衡。

這句話很能解釋 Flash 系列。設計工具、程式碼助手、表格分析、客服質檢不需要每一步都用同一個模型。低風險、高頻、可複核的步驟用便宜模型,敏感任務再切到更強模型,才是可持續的企業部署方式。

真實負載還要驗證

Flash-Lite 的 350 tokens/s 是基準口徑,實際應用會受上下文長度、工具呼叫、網路延遲和並發限制影響。Flash Cyber 的 65% 提升也來自指定資安 benchmark,企業落地仍要測誤報率、漏報率和人工成本。

Google 這次沒有只推更強模型,而是把不同負載拆成不同產品。下一輪模型競爭,很可能在帳單、延遲、資安邊界和工作流適配中展開。

參考來源:Google 官方部落格、Google DeepMind 模型頁、Axios、Business Insider、Artificial Analysis、CocoLoop;核驗三款 Flash 模型用途、tokens/s 速度口徑、每百萬 token 定價、資安 benchmark 提升幅度、客戶引語與可用性。