Google 推出 Gemini 2.5 Pro,主打推理能力

去年 3 月底,Google 釋出了 Gemini 2.5 Pro,官方說法是「迄今最智慧的模型」。

這種說法每家都會喊,但這次 Gemini 2.5 Pro 的跑分確實有亮點:

數學與科學推理

  • AIME 2024:92.0%
  • AIME 2025:86.7%
  • Humanity's Last Exam:18.8%(未使用工具的模型中最高)

最後這項測試由數百位領域專家出題,專門用來測試「人類知識邊界」,能拿到將近兩成的正確率相當驚人。

程式碼與多模態

  • LiveCodeBench:競賽級程式設計排名第一
  • MMMU:84.0%(多模態推理)
  • WebDevArena Elo:1443(排行榜第一)

上下文能力

標配 100 萬 token 上下文(可擴展至 200 萬),支援文字、音訊、圖片、影片等多模態輸入。整個程式碼倉庫可直接輸入理解,無需分段。

Gemini 2.5 Pro 是一個「thinking model」——回答之前會先進行內部推理。這個設計思路與 OpenAI 的 o 系列、DeepSeek R1 一脈相承,但 Google 的實現在多模態場景下表現更均衡。

不過實際使用中有個問題被反覆提及:回應速度。深度推理意味著更長的等待時間,在需要快速互動的場景下體驗會打折扣。這也是所有 thinking model 共同面臨的取捨。

LMArena 上 Elo 得分為 1470,比發布前直接漲了 24 分,維持排行榜領先。Google 在 AI 領域被唱衰了很久,這次算是用產品力回應了批評。

參考來源:CocoLoop、VentureBeat 報導、Google 官方發布