去年 3 月底,Google 釋出了 Gemini 2.5 Pro,官方說法是「迄今最智慧的模型」。
這種說法每家都會喊,但這次 Gemini 2.5 Pro 的跑分確實有亮點:
數學與科學推理
- AIME 2024:92.0%
- AIME 2025:86.7%
- Humanity's Last Exam:18.8%(未使用工具的模型中最高)
最後這項測試由數百位領域專家出題,專門用來測試「人類知識邊界」,能拿到將近兩成的正確率相當驚人。
程式碼與多模態
- LiveCodeBench:競賽級程式設計排名第一
- MMMU:84.0%(多模態推理)
- WebDevArena Elo:1443(排行榜第一)
上下文能力
標配 100 萬 token 上下文(可擴展至 200 萬),支援文字、音訊、圖片、影片等多模態輸入。整個程式碼倉庫可直接輸入理解,無需分段。
Gemini 2.5 Pro 是一個「thinking model」——回答之前會先進行內部推理。這個設計思路與 OpenAI 的 o 系列、DeepSeek R1 一脈相承,但 Google 的實現在多模態場景下表現更均衡。
不過實際使用中有個問題被反覆提及:回應速度。深度推理意味著更長的等待時間,在需要快速互動的場景下體驗會打折扣。這也是所有 thinking model 共同面臨的取捨。
LMArena 上 Elo 得分為 1470,比發布前直接漲了 24 分,維持排行榜領先。Google 在 AI 領域被唱衰了很久,這次算是用產品力回應了批評。
參考來源:CocoLoop、VentureBeat 報導、Google 官方發布