二月底,Google DeepMind 發表了 Gemini 3.1 Pro。發表後有一個數字在開發者社群中廣為流傳:在目前追蹤的 18 個主要 benchmark 中,3.1 Pro 拿下了 12 個第一。
更值得關注的是 ARC-AGI-2——這項測試專門設計來評估模型解決「從未見過的新邏輯題」的能力,防止模型死記硬背訓練數據過關。3.1 Pro 在這上面跑出了 77.1%。
推理能力翻倍究竟意味著什麼
Google 官方表示 3.1 Pro 的推理能力比 Gemini 3 Pro 提升了 2 倍以上。
這句話聽起來模糊,但結合 ARC-AGI-2 的成績來看是有說服力的。ARC-AGI 每次出全新題目,要求模型看幾個例子就能歸納出規律並應用——無法靠背答案,只能靠真正的推理。
2 倍提升,大致對應的是:給一個複雜的多步驟問題,模型能自己拆解、推導、驗證,不需要你在 prompt 中手把手引導。加入了新的 MEDIUM 檔位 Thinking Level(之前只有開關兩檔),現在可以控制推理深度——不是每個任務都需要最深的推理,可按需調節。
技術規格
上下文和輸出:
- 上下文視窗:100 萬 token
- 最大輸出:65K token
支援的輸入格式:
- 文字和程式碼
- 圖片(單次最多 3000 張,每張最大 7MB)
- 音訊(最長 8.4 小時)
- 影片(含音訊約 45 分鐘,純影片約 1 小時)
- PDF(每次最多 3000 頁,單檔最大 50MB)
100 萬 token 能裝什麼?大概是一個大型程式碼倉庫的全部程式碼,或者 900 頁 PDF,或者 8.4 小時的播客音訊。把整個專案丟進去然後直接問問題,現在是真的可以操作了。
實用功能
除了推理能力,3.1 Pro 加了幾個實用的東西:
- Grounding with Google Search:回答時可以即時搜尋,減少知識截止日期帶來的問題
- 程式碼執行:模型可以直接執行程式碼驗證結果,不只是生成程式碼
- Finance 和 Spreadsheet 專項優化:這兩個 agentic 場景有專門調校過
- RAG Engine 整合:連接企業知識庫更方便
還支援批次預測,長上下文任務使用快取的話成本會低很多。
定價
| 項目 | 價格 |
|---|---|
| 輸入 | $2.00/M token |
| 輸出 | $12.00/M token |
| Reasoning 模式輸入 | $12.00/M token |
| 快取讀取 | $0.20/M token |
| 快取寫入 | $0.38/M token |
跟 Claude Opus 4.6($15/$75)相比便宜很多,和 GPT-5.4 Pro 接近。如果大量使用快取,長上下文任務的成本會壓得比較低。
目前是公開預覽版,知識截止日期是 2025 年 1 月。
但綜合第一還不是它
說實話:在綜合 benchmark 排行上,GPT-5.4 Pro 的得分是 92(BenchLM.ai),Gemini 3.1 Pro 是 87,Claude Opus 4.6 是 85。
贏了 12/18 的單項測試,但某些關鍵能力維度上還是差一點。特別是程式設計任務,Claude Opus 4.6 的 SWE-bench 表現仍然更強。
Google 在推理和多模態處理上交出了這張答卷,但全面第一還不是。
值不值得切換過來
如果你的業務主要是:
- 長文件處理(合約、報告、程式碼庫審查)
- 多模態輸入(同時處理圖片+文字+音訊)
- 成本預算有限但需要接近 Opus 等級的推理能力
3.1 Pro 是一個認真的選項,性價比有競爭力。
但如果核心需求是寫程式碼、做 agent,Claude 還是更成熟。Google 在這次發表裡能交出 77.1% 的 ARC-AGI-2,說明推理能力是真的在進步,不是刷分。但要完全取代 Claude 和 GPT-5.4,還差那麼一點距離。
參考來源:Google's new Gemini Pro model has record benchmark scores — again(TechCrunch);CocoLoop、Gemini 3.1 Pro: A smarter model for your most complex tasks(Google DeepMind Blog);Gemini 3.1 Pro Preview Model Specs, Costs & Benchmarks(Galaxy.ai);Gemini 3.1 Pro | Google Cloud Vertex AI Documentation