去年8月DeepSeek推出了V3.1,這是他們第一個混合模型——把V3(通用)和R1(推理)的能力合進了同一個模型裡。
架構設計
- 總參數:671B,每token激活37B
- 每層256個專家,激活8個
- 兩種模式一鍵切換:
- Think mode(deepseek-reasoner):多步推理+工具調用
- Non-think mode(deepseek-chat):日常對話,輕快回應
兩種模式共享權重,128K上下文。
憑什麼說「混合」好?
直接看SWE-bench Verified的分數:
- V3.1:66.0%
- R1-0528:44.6%
程式設計benchmark上混合模型碾壓了純推理模型。Think mode在推理密集任務上能達到R1大約90-95%的水準,而且回應速度更快。
本質上V3.1證明了一件事:單一模型可以同時搞定「快問快答」和「深度推理」這兩個以前需要分開部署的場景。
訓練細節
基於V3.1-Base,額外訓練了8400億token:
- 32K階段:6300億token
- 128K擴展階段:2090億token
重點提升了長上下文理解、工具使用和agent工作流。DeepSeek官方把V3.1定位為「邁向Agent時代的第一步」。
從實際使用來看,有了V3.1之後就不需要在「用通用模型還是推理模型」之間糾結了——丟過去讓它自己判斷就行。
參考來源:CocoLoop、The Decoder報導、DeepSeek官方發布