DeepSeek 開源推理模型 R1

今年 1 月,DeepSeek 把 R1 推理模型直接開源了,社群的反應很直接:沒想到開源這邊已經卷到這個程度了。

先看硬指標:

  • AIME 數學競賽:77.5 分
  • MATH-500:96.2 分
  • Codeforces 程式設計:94 百分位
  • MMLU:0.849

這幾個數字放在一起看,基本上和 OpenAI 的 o1 打了個五五開。數學、程式碼、邏輯推理,三項全能選手。

但更讓人意外的是蒸餾版。R1-Distill-Qwen-32B,一個 32B 參數的「小號」蒸餾模型,在好幾個 benchmark 上直接超過了 o1-mini。32B 參數就能追平甚至反超閉源推理模型,這對小團隊和獨立開發者來說簡直是天降福利——消費級顯卡就能跑起來。

R1 的推理方式走的是結構化 Chain-of-Thought 路線。在長上下文場景下,它會展現出很明顯的「規劃→執行→反思→修正」這套流程。128K 的上下文視窗給了足夠空間讓推理鏈完整展開,不用擔心中間被截斷。

從產業角度往大了說,R1 的真正衝擊在於定價邏輯。以前閉源模型的溢價很大程度上靠的是「推理能力護城河」——你想用好的推理模型就得付費。現在這道牆被 R1 捅了個大窟窿,閉源廠商拿什麼來維持定價優勢?光靠品牌和生態嗎?

這個問題在接下來幾個季度會越來越尖銳。

參考來源:CocoLoop、InfoQ DeepSeek R1 發布報導、Hugging Face 模型頁面