Google 這次推出的 Gemini 3.1 Flash-Lite,核心賣點就一個字:便宜。
每百萬輸入 token 只要 0.25 美元,輸出 1.5 美元。對比一下 Gemini 3.1 Pro 的每百萬輸入 2 美元、輸出 18 美元——價格直接打到了八分之一。
這是 Google 有史以來最便宜的 Gemini 模型。
速度和價格都變了
Flash-Lite 是 3 月 3 日以 Preview 形式上線的,目前在 Google AI Studio 和 Vertex AI 上可以用。定位是高併發、低成本場景——每天要跑幾十萬次請求的那種。
性能上有幾個數字值得注意:
- 生成速度:比 Gemini 2.5 Flash 快了 45%
- 首 token 延遲:縮短了 2.5 倍
- 吞吐量:約 207 tokens/秒
- GPQA Diamond(科學推理基準):86.9%,相比 2.5 Flash Lite 提升了約 14 個百分點
這個 GPQA 分數還挺實在的。要知道 86.9% 已經比不少「旗艦」模型強了,在這個價格點上掛這個分數,是真的有底氣。
不過有個地方要說清楚:在 HLA 這個更極端的推理基準上,Flash-Lite 只有 16%,而 3.1 Pro 能到 44.4%。高端推理任務還是明顯差一個量級的。
技術底子和架構
Flash-Lite 底層是基於 Gemini 3 Pro 架構的混合專家(MoE)設計,同樣支援:
- 上下文視窗:100 萬 token
- 輸入模態:文字、圖片、音訊、影片全都支援
- 輸出長度:最長 64K token
MoE 架構是這個價格能跑出這個性能的關鍵——啟動參數少,單次推理成本低。這和 DeepSeek V3、Qwen3 的思路是一脈相承的。
適合幹什麼
Google 給這個模型定的場景非常務實:
- 內容審核:批次跑違規檢測
- 資料提取:從非結構化文字裡抽欄位
- 意圖路由:多 agent 系統裡做第一層分流判斷
- 客服自動化:回覆標準化問題
- 翻譯和轉錄:大量文字的語言處理
簡單說就是:不需要深度推理,但量大、對延遲敏感、預算有限的場景。
這個組合在企業裡非常普遍。很多公司的 AI 支出有一半以上是花在這種「沒技術含量但必須跑」的任務上。
和競品比價
| 模型 | 輸入($/1M tokens) | 輸出($/1M tokens) |
|---|---|---|
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 |
| Gemini 3.1 Pro | $2.00 | $18.00 |
| GPT-4o Mini | ~$0.15 | ~$0.60 |
| Claude 4.5 Haiku | ~$0.25 | ~$1.25 |
在這個價位段,競爭其實挺激烈的。GPT-4o Mini 更便宜,Claude 4.5 Haiku 也在同一價格帶。Flash-Lite 的優勢是速度(2.5x 更快的首 token)和 1M 的超長上下文,後者在其他同價位模型裡確實罕見。
怎麼看這個發布
Google 推出 Flash-Lite 這個動作,本質上是在吃高併發市場的份額。
大量中小開發者和新創公司做產品原型的時候,首選標準是「夠用就行+便宜」。Gemini 3.1 Pro 的價格對他們來說是實打實的門檻,但 Flash-Lite 這個定價基本上不構成障礙了。
同時,Google 也在用這個低價模型把開發者留在 Vertex AI 的生態裡。先用 Flash-Lite 把流量拉進來,真正上生產的重度任務再往 Pro 和 Ultra 遷移——這個轉化路徑 Google 現在已經在很多客戶上驗證過了。
成本敏感的 API 場景,現在又多了一個選擇。
參考來源:CocoLoop、Google launches speedy Gemini 3.1 Flash-Lite model in preview(SiliconANGLE);Gemini 3.1 Flash Lite Review 2026: Pricing, Benchmarks, Features & Best Use Cases(AI/ML API Blog);Gemini 3.1 Flash Lite: Our most cost-effective AI model yet(Google Blog)