DeepSeek의 저비용 대규모 모델 훈련 분석

DeepSeek의 비용 관리 수준은 업계에서 전설적인 존재가 되었습니다:

  • V3 훈련 비용: 약 550만 달러
  • R1 GPU 사용료: 약 29만 4천 달러

같은 기간 미국 기업들이 유사한 규모의 모델 훈련에 책정한 예산은 1억~10억 달러입니다. 최소한 한 자릿수 차이가 납니다.

비용 절감 비결

1. FP8 혼합 정밀도 훈련

훈련 정밀도를 FP32/FP16에서 FP8로 낮추면 메모리 대역폭 요구량이 절반으로 줄어듭니다. 대부분의 연산 병목 현상은 메모리 대역폭에 있기 때문에 매우 정확한 조치입니다.

2. Spot 인스턴스의 전략적 활용

컴퓨팅 비용이 70% 절감됩니다. Spot 인스턴스는 언제든지 회수될 수 있지만, DeepSeek의 훈련 프레임워크는 충분한 체크포인트와 내결함성 설계로 이에 대응합니다.

3. MoE 아키텍처의 자연스러운 연산 절약

671B 파라미터 모델은 추론당 37B 파라미터만 활성화합니다. 파라미터 수는 용량과 성능을 보장하고, 희소 활성화는 비용을 관리 가능하게 합니다.

신기술: mHC

올해 1월 DeepSeek은 새로운 방법인 Manifold-Constrained Hyper-Connections (mHC)를 공개했습니다. 핵심 논문에는 창업자 량원펑이 공동 저자로 서명했습니다.

이 방법이 하는 일: 모델 내부에 여러 정보 흐름을 생성하고, 각 혼합 단계에서 엄격한 수학적 제약 조건으로 총 정보량 보존을 보장합니다. 테스트 결과 3B에서 27B 파라미터 규모에서 mHC가 안정적인 훈련을 가능하게 한 반면, 제약이 없는 버전은 자주 불안정했습니다. 훈련 오버헤드는 6-7%만 증가하여 대규모 모델에서는 거의 무시할 수준입니다.

일부 분석가들은 mHC 논문을 "놀라운 돌파구"라고 평가하며 DeepSeek의 차세대 주력 모델의 기반 기술이 될 수 있다고 말합니다.

OpenAI의 CEO 자신도 DeepSeek의 R1 운영 비용이 OpenAI의 동급 모델보다 20~50배 저렴하다고 인정했습니다.

출처: CocoLoop, Computerworld 보도, 사우스차이나모닝포스트 분석