「Thinking model」在 2025 年徹底成為主流概念。幾乎每家頭部 AI 公司都推出了自己的推理模型,核心賣點都一樣:模型在回答之前先在內部「想一想」。
各家路線
OpenAI o 系列:最早把「思考」概念產品化的。從 o1 到 o3 一路迭代,走的是「顯式推理鏈+隱藏思考過程」路線。用戶看到的是最終答案,中間的思考過程不對外暴露。
DeepSeek R1:開源路線的推理模型代表。強化學習驅動,思考過程是透明的(可以看到完整的 Chain-of-Thought)。32B 蒸餾版在多項 benchmark 上就能和 o1-mini 打平,成本優勢巨大。
Gemini 2.5 Pro:Google 的 thinking model,內部推理後回應。在數學和科學推理上表現突出(AIME 2024: 92%),多模態推理是差異化優勢。
Claude Opus 4.6:自適應推理,模型自動判斷需要多深度的思考。四檔可調,不浪費算力。
核心 trade-off
所有推理模型都面對同一個問題:推理深度 vs 回應速度。
想得越深、答案越準,但等待時間越長、成本越高。對於簡單的日常對話,開啟深度推理純粹是在浪費錢和時間。
各家的解法略有不同:
- OpenAI:提供不同等級的模型(o1-mini 到 o3-pro)
- DeepSeek V3.1:同一模型內 think/non-think 雙模式
- Anthropic:自適應思考,模型自己決定想多深
- Qwen3:也是 mixing 模式,thinking 和 non-thinking 一個模型搞定
開源 vs 閉源
推理能力原本被認為是閉源模型的護城河。R1 的出現打破了這個格局——開源推理模型已經追平了閉源模型的主力產品。這意味著純粹的推理能力越來越難作為付費壁壘。
下一步的競爭已經從「誰更能想」轉向「誰想得又快又省」。
參考來源:CocoLoop、各模型官方發布、The Decoder 對比分析