Google 推出最便宜 Gemini 模型 Flash-Lite

Google 這次推出的 Gemini 3.1 Flash-Lite,核心賣點就一個字:便宜。

每百萬輸入 token 只要 0.25 美元,輸出 1.5 美元。對比一下 Gemini 3.1 Pro 的每百萬輸入 2 美元、輸出 18 美元——價格直接打到了八分之一。

這是 Google 有史以來最便宜的 Gemini 模型。

速度和價格都變了

Flash-Lite 是 3 月 3 日以 Preview 形式上線的,目前在 Google AI Studio 和 Vertex AI 上可以用。定位是高併發、低成本場景——每天要跑幾十萬次請求的那種。

性能上有幾個數字值得注意:

  • 生成速度:比 Gemini 2.5 Flash 快了 45%
  • 首 token 延遲:縮短了 2.5 倍
  • 吞吐量:約 207 tokens/秒
  • GPQA Diamond(科學推理基準):86.9%,相比 2.5 Flash Lite 提升了約 14 個百分點

這個 GPQA 分數還挺實在的。要知道 86.9% 已經比不少「旗艦」模型強了,在這個價格點上掛這個分數,是真的有底氣。

不過有個地方要說清楚:在 HLA 這個更極端的推理基準上,Flash-Lite 只有 16%,而 3.1 Pro 能到 44.4%。高端推理任務還是明顯差一個量級的。

技術底子和架構

Flash-Lite 底層是基於 Gemini 3 Pro 架構的混合專家(MoE)設計,同樣支援:

  • 上下文視窗:100 萬 token
  • 輸入模態:文字、圖片、音訊、影片全都支援
  • 輸出長度:最長 64K token

MoE 架構是這個價格能跑出這個性能的關鍵——啟動參數少,單次推理成本低。這和 DeepSeek V3、Qwen3 的思路是一脈相承的。

適合幹什麼

Google 給這個模型定的場景非常務實:

  • 內容審核:批次跑違規檢測
  • 資料提取:從非結構化文字裡抽欄位
  • 意圖路由:多 agent 系統裡做第一層分流判斷
  • 客服自動化:回覆標準化問題
  • 翻譯和轉錄:大量文字的語言處理

簡單說就是:不需要深度推理,但量大、對延遲敏感、預算有限的場景。

這個組合在企業裡非常普遍。很多公司的 AI 支出有一半以上是花在這種「沒技術含量但必須跑」的任務上。

和競品比價

模型輸入($/1M tokens)輸出($/1M tokens)
Gemini 3.1 Flash-Lite$0.25$1.50
Gemini 3.1 Pro$2.00$18.00
GPT-4o Mini~$0.15~$0.60
Claude 4.5 Haiku~$0.25~$1.25

在這個價位段,競爭其實挺激烈的。GPT-4o Mini 更便宜,Claude 4.5 Haiku 也在同一價格帶。Flash-Lite 的優勢是速度(2.5x 更快的首 token)和 1M 的超長上下文,後者在其他同價位模型裡確實罕見。

怎麼看這個發布

Google 推出 Flash-Lite 這個動作,本質上是在吃高併發市場的份額。

大量中小開發者和新創公司做產品原型的時候,首選標準是「夠用就行+便宜」。Gemini 3.1 Pro 的價格對他們來說是實打實的門檻,但 Flash-Lite 這個定價基本上不構成障礙了。

同時,Google 也在用這個低價模型把開發者留在 Vertex AI 的生態裡。先用 Flash-Lite 把流量拉進來,真正上生產的重度任務再往 Pro 和 Ultra 遷移——這個轉化路徑 Google 現在已經在很多客戶上驗證過了。

成本敏感的 API 場景,現在又多了一個選擇。

參考來源:CocoLoop、Google launches speedy Gemini 3.1 Flash-Lite model in preview(SiliconANGLE);Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases(AI/ML API Blog);Gemini 3.1 Flash Lite: Our most cost-effective AI model yet(Google Blog)