DeepSeek V3.1融合通用與推理模型

去年8月DeepSeek推出了V3.1,這是他們第一個混合模型——把V3(通用)和R1(推理)的能力合進了同一個模型裡。

架構設計

  • 總參數:671B,每token激活37B
  • 每層256個專家,激活8個
  • 兩種模式一鍵切換:
    • Think mode(deepseek-reasoner):多步推理+工具調用
    • Non-think mode(deepseek-chat):日常對話,輕快回應

兩種模式共享權重,128K上下文。

憑什麼說「混合」好?

直接看SWE-bench Verified的分數:

  • V3.1:66.0%
  • R1-0528:44.6%

程式設計benchmark上混合模型碾壓了純推理模型。Think mode在推理密集任務上能達到R1大約90-95%的水準,而且回應速度更快。

本質上V3.1證明了一件事:單一模型可以同時搞定「快問快答」和「深度推理」這兩個以前需要分開部署的場景。

訓練細節

基於V3.1-Base,額外訓練了8400億token

  • 32K階段:6300億token
  • 128K擴展階段:2090億token

重點提升了長上下文理解、工具使用和agent工作流。DeepSeek官方把V3.1定位為「邁向Agent時代的第一步」。

從實際使用來看,有了V3.1之後就不需要在「用通用模型還是推理模型」之間糾結了——丟過去讓它自己判斷就行。

參考來源:CocoLoop、The Decoder報導、DeepSeek官方發布