지난 12월 DeepSeek은 V3를 출시했습니다. 이 모델이 경쟁사들을 가장 불편하게 만든 것은 성능이 아니라 비용이었습니다.
아키텍처 먼저
V3의 핵심 설계는 Mixture of Experts입니다:
- 총 파라미터 수: 671B
- 토큰당 실제 활성화: 37B
- 레이어당 256개 전문가, 매번 8개 선택
256명의 전문 의사가 있고, 진료 때마다 가장 관련성 높은 8명만 불러내는 것과 같습니다. 파라미터 수는 많지만 계산 비용은 통제 가능합니다. 이것이 MoE의 핵심입니다.
벤치마크 점수
- MMLU: 87.1% (GPT-4o 수준)
- MATH-500: 90.2%
- Codeforces: 51.6 백분위
- GPQA Diamond: 59.1%
이 성적은 2025년 말 기준 오픈소스 모델 중 최상위권에 해당합니다.
550만 달러로 최고 모델 훈련
V3의 훈련 비용은 약 550만 달러였습니다. 같은 기간 미국 기업들은 비슷한 규모의 모델을 훈련하는 데 수억 달러를 썼습니다. 이 숫자가 공개되자 업계 전체가 반성하기 시작했습니다: DeepSeek이 너무 절약한 것인가, 아니면 다른 기업들이 너무 낭비한 것인가?
비용 절감 비결은 다음과 같습니다:
- FP8 혼합 정밀도 훈련으로 메모리 대역폭 요구량 절반 감소
- 스팟 인스턴스 전략적 활용으로 컴퓨팅 비용 70% 절감
- MoE 아키텍처 자체가 자연스러운 컴퓨팅 절약 장치
중요한 이유
V3 출시 한 달 후, DeepSeek은 R1을 발표했습니다. 이 두 모델은 함께 한 가지를 증명했습니다: 최첨단 AI 연구에 반드시 수십억 달러를 쏟아부을 필요는 없다는 것입니다. 글로벌 AI 경쟁 구도에서 이 신호는 어떤 단일 벤치마크보다 중요합니다.
출처: CocoLoop, DeepSeek V3 기술 보고서, BentoML 기술 가이드