Fireworks AI가 DeepSeek-V4.1-Flash에 대한 벤치마크 데이터를 공개했다. 결론은 한 문장으로 요약된다. 에이전트 코딩 작업에서 이 모델은 GPT-6 Astra와 같은 정확도 구간에 들어가면서도, 작업당 비용은 15배 낮다는 것이다.
먼저 점수를 보자. DeepSWE의 pass@1 지표에서 DeepSeek-V4.1-Flash는 74.34%, GPT-6 Astra는 74.12%, Gemini 3.8 Flash는 73.83%, Claude Opus 5는 73.65%를 기록했다. 네 모델이 0.69퍼센트포인트 구간에 몰려 있어 누가 1위인지를 따지는 것은 큰 의미가 없다. Terminal-Bench 2.1에서는 DeepSeek이 86.5%, Astra가 87.5%로 Astra가 소폭 앞섰다.
계산해 보면 이렇다
Fireworks가 제시한 작업당 비용은 DeepSeek-V4.1-Flash 0.430달러, Gemini 3.8 Flash 2.362달러, GPT-6 Astra 6.524달러, Claude Opus 5 11.838달러다. DeepSeek을 기준으로 하면 나머지 세 모델은 각각 5.5배, 15배, 28배 비싸다.
이 배수를 실제 예산에 대입해 보자. 10명 규모의 엔지니어링 팀이 하루 1인당 20개의 에이전트 코딩 작업을 처리하고, 한 달 근무일을 22일로 잡으면 월간 작업 수는 4400건이다. DeepSeek으로 처리하면 월 비용은 약 1892달러, Astra로 처리하면 약 28706달러다. 한 달 차이는 약 2만 6800달러, 연간으로는 약 32만 달러에 이른다. 어디까지나 추정치이며 실제 작업의 토큰 분포는 벤치마크와 완전히 같지 않겠지만, 자릿수 자체는 이 정도 규모다.
HLE에서는 격차가 반대로 벌어진다
같은 데이터셋에는 반대 방향의 격차도 있다. Humanity's Last Exam 항목에서 DeepSeek-V4.1-Flash는 34.52%, GPT-6 Astra는 50.40%로 15.88퍼센트포인트 차이가 난다. 코딩 작업에서의 대등한 성적이 이런 고난도 종합 추론 문제로는 이어지지 않는다.
Fireworks는 Oracle Router라는 수치도 함께 제시했다. 두 모델을 조합했을 때 이론상 점수는 54.80%다. 이는 상한값이며, 어떤 문제를 어느 모델에 맡길지 사전에 판단할 수 있다는 전제가 깔려 있다. 실제 라우팅 시스템은 그런 정보를 갖고 있지 않다. 이 수치는 두 모델의 약점이 서로 겹치지 않는다는 것을 보여줄 뿐, 실제로 배포 가능한 방안을 뜻하지는 않는다.
아키텍처 쪽 이야기
모델 자체는 552B 파라미터 규모의 MoE로, 입력과 출력의 활성화량을 분리했다. 입력 쪽은 8B, 출력 쪽은 16B가 활성화된다. KV 캐시 변경은 더 직접적이다. HBM 사용량은 이전 세대의 4분의 1로, SSD 사용량은 8분의 1로 줄었다.
비용 우위의 근거는 여기서 나온다. 에이전트 코딩 작업은 컨텍스트가 길고 턴 수가 많아, 단발성 질의응답보다 KV 캐시 비용이 차지하는 비중이 훨씬 크다. 캐시의 메모리와 디스크 사용량을 각각 4분의 1, 8분의 1로 줄이면 같은 하드웨어에서 더 많은 동시 요청을 처리할 수 있고, 그래야 0.43달러라는 가격이 성립한다. 이는 단순한 가격 정책만으로 나온 숫자가 아니다.
이 수치의 출처
분명히 짚어야 할 부분이 있다. 이 벤치마크는 Fireworks AI가 직접 공개한 것이고, DeepSeek-V4.1-Flash는 같은 회사의 플랫폼에서 판매되고 있다. 평가하는 쪽과 판매하는 쪽이 같은 회사라는 뜻이다. DeepSeek 측은 이 수치를 확인해 주지 않았고, 독립적인 제3자의 재현 결과도 아직 없다.
벤치마크 선택 자체도 결론에 영향을 준다. DeepSWE와 Terminal-Bench 2.1 모두 엔지니어링 성격이 강한 코딩 작업 위주로, 실제 개발 업무와의 중첩도는 나쁘지 않다. 하지만 다른 벤치마크나 작업 분포로 바꿨을 때도 네 모델이 0.69퍼센트포인트 구간 안에 머무를지는 이 데이터만으로는 답할 수 없다. 배수 관계로 참고하는 것은 괜찮지만, 이를 모델 능력의 최종 서열로 받아들이는 것은 무리다.
참고 출처: Fireworks AI 기술 블로그, CocoLoop; DeepSWE, Terminal-Bench 2.1, HLE 점수와 작업당 비용, 모델 아키텍처 수치는 원문 블로그와 하나하나 대조했으며, 10인 팀의 월간 지출은 추정치다.