오늘(4월 24일), DeepSeek이 V4를 출시했습니다.
블룸버그의 헤드라인은 "1년 만에 다시 실리콘밸리를 뒤흔들다"였습니다. 과장인지 여부는 차치하고, 이번 발표는 실제로 두 가지 모델을 함께 내놓은 것입니다:
- V4-Pro: 총 파라미터 1.6조, 활성화 49B, 100만 토큰 컨텍스트 지원
- V4-Flash: 총 파라미터 2840억, 활성화 13B, 동일하게 100만 토큰 컨텍스트 지원
두 모델 모두 MIT 라이선스로 오픈소스화되었으며, 가중치는 HuggingFace에 직접 업로드되었습니다.
먼저 벤치마크
경쟁 프로그래밍 Codeforces 레이팅에서 V4-Pro는 3206을 기록했습니다. GPT-5.4는 3168점이었습니다 — 어제 GPT-5.5로 교체된 클로즈드소스 플래그십 모델입니다.
오픈소스 모델이 경쟁 프로그래밍에서 따라잡았습니다.
기타 수치:
| 벤치마크 | V4-Pro 점수 |
|---|---|
| LiveCodeBench | 93.5% |
| HMMT 2026 수학 경시대회 | 95.2% |
| IMOAnswerBench | 89.8% |
| MMLU-Pro | 87.5% |
하지만 모든 항목에서 이긴 것은 아닙니다. SWE-bench Pro(실제 소프트웨어 엔지니어링 작업)는 55.4%였고, Kimi K2.6은 58.6%를 기록했습니다. 경쟁 프로그래밍에서는 이겼지만 엔지니어링 실무에서는 3%포인트 뒤졌습니다.
DeepSeek 공식 입장: "DeepSeek-V4-Pro-Max는 오픈소스 모델 중 지식 능력에서 획기적인 돌파구를 마련했으며, 현재 최강의 오픈소스 모델로서의 입지를 확고히 했습니다."
가격: 수준 차이
이것이야말로 주목할 만한 부분입니다.
| 버전 | 표준 입력 | 캐시 히트 입력 | 출력 |
|---|---|---|---|
| V4-Flash | $0.14/M | $0.028/M | $0.28/M |
| V4-Pro | $1.74/M | $0.145/M | $3.48/M |
어제 GPT-5.5가 출시되었으며, 표준 출력은 $30/M, Pro는 $180/M입니다. Claude Opus 4.7의 출력은 $75/M입니다.
V4-Pro의 출력은 $3.48/M입니다.
GPT-5.5 표준판보다 8.6배, Claude Opus 4.7보다 21배 저렴합니다.
이는 할인이 아니라 수준 차이입니다. 대량 호출이 필요한 팀에게 이 차이는 제품의 수익성을 결정할 수 있는 숫자입니다.
이렇게 저렴할 수 있는 이유: 아키텍처
V4는 하이브리드 어텐션 메커니즘(CSA + HCA)을 도입했습니다. Compressed Sparse Attention은 전역 의존성을 처리하고, Heavily Compressed Attention은 지역 정보를 처리하며, 조합하여 사용됩니다.
100만 토큰 장문 컨텍스트 시나리오에서 V4-Pro는 V3.2 대비 27%의 추론 연산량과 10%의 KV 캐시만 필요로 합니다.
동시에 세 가지 개선 사항이 적용되었습니다:
- FP4 + FP8 혼합 정밀도 학습. 전문가 계층은 FP4, 기타 파라미터는 FP8 사용
- Manifold-Constrained 하이퍼커넥션으로 잔차 신호 전파 강화
- Muon 옵티마이저로 수렴 속도 및 학습 안정성 향상
사전 학습 데이터는 32T 토큰을 초과합니다.
이러한 효율성은 파라미터 조정이 아니라 아키텍처 설계를 통한 연산량 압축 덕분이며, 그 결과가 가격에 반영된 것입니다.
타이밍이 흥미롭다
GPT-5.5는 어제, DeepSeek V4는 오늘 출시되었습니다.
이 두 사건이 겹치면서 기업 사용자들은 재계산을 강요받고 있습니다. 성능 격차는 여전히 존재하지만, 가격 격차는 진지하게 고려해야 할 수준에 도달했습니다. 특히:
- 대량 호출 팀의 경우: $3.48 대 $30의 출력 비용은 아키텍처 선택을 결정할 수 있는 숫자
- 오픈소스가 필요한 경우: MIT 라이선스, 가중치 공개, 사설 배포에 장애물 없음
- 중국 기업 사용자의 경우: DeepSeek은 규정 준수 및 데이터 주권에 대한 우려가 적음
지난달 텐센트와 알리바바가 DeepSeek에 대한 투자를 논의 중이며, 평가액이 200억 달러를 초과할 것이라는 보도가 있었습니다. 3년간 VC를 거절해온 회사가 자금 조달 이야기를 시작했다는 점에서, V4 출시는 단순한 제품 이정표일 뿐만 아니라 자금 조달 전 역량 증명을 위한 움직임으로 보입니다.
이 가격 우위를 규모로 전환할 수 있을지는 6개월 후에 답이 나올 것입니다.
출처: DeepSeek-V4-Pro Model Card (HuggingFace, deepseek-ai, 2026년 4월 24일); DeepSeek V4 Released: Open-Source 1.6T MoE, 1M Context (ofox.ai, 2026년 4월 24일); CocoLoop; DeepSeek Unveils Newest Flagship AI Model a Year after Upending Silicon Valley (Bloomberg, 2026년 4월 24일)