DeepSeek V3.1, 범용 모델과 추론 모델 통합

지난 8월, DeepSeek은 V3.1을 출시했습니다. 이는 회사의 첫 번째 하이브리드 모델로, V3(범용)와 R1(추론)의 기능을 하나의 모델에 통합한 것입니다.

아키텍처 설계

  • 총 파라미터: 671B, 토큰당 활성화 파라미터: 37B
  • 레이어당 256개 전문가, 8개 활성화
  • 원클릭 전환 가능한 두 가지 모드:
    • Think 모드(deepseek-reasoner): 다단계 추론 + 도구 호출
    • Non-think 모드(deepseek-chat): 일상 대화, 빠른 응답

두 모드는 가중치를 공유하며, 컨텍스트 윈도우는 128K입니다.

"하이브리드"가 효과적인 이유

SWE-bench Verified 점수를 직접 살펴보겠습니다:

  • V3.1: 66.0%
  • R1-0528: 44.6%

코딩 벤치마크에서 하이브리드 모델은 순수 추론 모델을 압도했습니다. Think 모드는 추론 집약적 작업에서 R1의 약 90-95% 수준의 성능을 달성하면서 응답 속도는 더 빠릅니다.

본질적으로 V3.1은 한 가지를 증명합니다: 단일 모델이 "빠른 질의응답"과 "심층 추론"을 모두 처리할 수 있다는 점, 즉 이전에는 별도로 배포해야 했던 시나리오를 하나로 해결할 수 있다는 것입니다.

훈련 세부 사항

V3.1-Base를 기반으로 추가로 8400억 개의 토큰이 훈련에 사용되었습니다:

  • 32K 단계: 6300억 개 토큰
  • 128K 확장 단계: 2090억 개 토큰

주요 개선 사항은 긴 컨텍스트 이해, 도구 사용 및 에이전트 워크플로우에 중점을 두었습니다. DeepSeek은 공식적으로 V3.1을 "에이전트 시대를 향한 첫 걸음"으로 규정하고 있습니다.

실용적인 관점에서 보면, V3.1이 있으면 더 이상 범용 모델과 추론 모델 사이에서 고민할 필요가 없습니다. 작업을 모델에 넘기고 스스로 판단하게 하면 됩니다.

출처: CocoLoop, The Decoder 보도, DeepSeek 공식 발표