DeepSeek V4 Pro가 더 구체적인 API 단계로 들어갔다. 8월 13일 DeepSeek 가격 문서에는 deepseek-v4-pro의 모델 버전이 DeepSeek-V4-Pro-0813으로 표시됐다.
같은 표에는 1M token 컨텍스트, 최대 384K token 출력, JSON Output, Tool Calls, Responses API, Anthropic API 지원이 함께 적혀 있다. Pro의 동시성 제한은 500으로, Flash의 2500보다 훨씬 낮다.
긴 출력은 곧 비용 문제다
“We plan to raise the overall pricing for DeepSeek API services in the near future, with a significant increase expected.”
공식 경고문은 이 업데이트를 실무적인 사건으로 만든다. 384K 출력은 긴 코드베이스 분석, 문서 묶음 검토, 마이그레이션 계획, 에이전트 워크플로에 유용하지만 출력 토큰이 늘면 청구액도 커진다.
Pro는 Flash보다 비싸고 좁다
중국어 가격표 기준 V4 Pro는 100만 tokens당 캐시 히트 입력 0.025위안, 캐시 미스 입력 3위안, 출력 6위안이다. V4 Flash는 각각 0.02위안, 1위안, 2위안이다. 캐시 미스 입력과 출력은 Pro가 Flash의 3배다.
7월 31일 업데이트 로그에서 Flash 0731은 Terminal Bench 2.1 82.7, Cybergym 76.7 등 에이전트 지표를 이미 제시했다. Pro라는 이름만으로 모든 일반 작업을 옮길 이유는 아직 부족하다.
1.6T 모델은 선별적으로 써야 한다
Hugging Face 모델 카드와 OpenRouter 설명은 V4 Pro를 총 1.6T 파라미터, 활성 49B 파라미터, 1M token 컨텍스트의 MoE 모델로 설명한다. 큰 모델인 만큼 지연 시간, 처리량, 예산을 함께 봐야 한다.
단기 확인 포인트는 명확하다. DeepSeek가 V4 Pro-0813 별도 보고서를 내는지, 제3자 벤치마크가 Preview와 Flash 0731을 구분하는지, 가격 인상 이후에도 장문맥 비용 경쟁력이 유지되는지다.
출처: DeepSeek API 모델 및 가격 문서, DeepSeek API 변경 로그, 차오뉴스, Hugging Face DeepSeek-V4-Pro 모델 카드, CocoLoop, OpenRouter; DeepSeek-V4-Pro-0813 버전, 1M 컨텍스트, 384K 최대 출력, 위안화 및 달러 가격 범위, 동시성 제한, V4 Flash 비교 가격, 1.6T 총 파라미터와 49B 활성 파라미터를 확인.