오픈소스 추론 프레임워크 vLLM 팀은 Inferact와 함께 10월 7일 기술 블로그를 공개하고, DeepSeek-V4.1-Flash를 위해 진행한 일련의 추론 최적화를 소개했다. 에이전트형 워크로드를 모방한 테스트에서 저동시성 상황에서는 속도가 1.9배 빨라졌고, 사용자별 출력 속도를 초당 150토큰으로 제한한 조건에서는 전체 처리량이 5.3배 늘었다.
테스트에 사용된 워크로드는 SemiAnalysis의 AgentX 벤치마크로, 팀은 이를 다회차 대화, 긴 컨텍스트, 프리픽스 캐시 적중률을 유지하는 세션 어피니티 등 에이전트형 서비스 상황을 대표하는 것으로 보고 있다. 저지연 구성은 4way 텐서 병렬 처리에 FlashInfer를 결합했고, 고처리량 구성은 2way 데이터 병렬 처리와 전문가 병렬 처리를 결합했다.
모델 자체의 특징
블로그 설명에 따르면 V4.1 Flash는 인과적 인코더-디코더 구조를 쓰며 총 40개 레이어 중 20번째 레이어가 디코더용 전역 KV를 계산한다. 생성 단계에서는 토큰당 약 160억 개 파라미터가, 프리필 단계에서는 약 80억 개 파라미터가 활성화된다. 전역 KV 캐시는 압축되어 레이어 간에 공유되며 FP4 정밀도에서 토큰당 약 890바이트다. 이 외에도 가장 최근 128개 위치를 포함하는 슬라이딩 윈도우 KV가 있으며, 이는 압축 없이 FP8로 저장된다.
캐시가 이렇게 작다는 것은 직접적인 결과를 낳는다. 전체 벤치마크를 실행하는 동안 KV 캐시를 메모리나 디스크로 오프로드할 필요가 없었다는 점이다. 긴 컨텍스트를 다루는 에이전트형 작업에서는 오프로드가 지연의 주요 원인 중 하나가 되는 경우가 많다.
여덟 가지 최적화 중 효과가 큰 항목들
팀은 여덟 가지 변경 사항을 나열했는데, 그중 효과가 가장 두드러진 것은 다음과 같다.
- 경계 제한 슬라이딩 윈도우 재계산: 프리픽스 캐시가 적중하면 가장 최근 128개 토큰만 다시 계산하고 CUDA Graph와 결합한다. 이를 통해 첫 토큰까지의 시간이 약 30% 줄었고, 약 10만 토큰 규모의 컨텍스트에서는 거의 70% 줄었다. V4.1에서는 기본적으로 켜져 있으며
--no-swa-bounded-replay로 끌 수 있다. - 희소 MQA 스코어링 커널: 512K 컨텍스트에서는 기존 구현보다 14~23배 빠르지만 8K에서는 1.2배에 그친다. 전체 디코딩 기준으로는 약 3~6%의 개선으로 이어진다.
- NVFP4 어텐션: 이전 FP8 방식에 비해 KV 캐시를 45% 줄이고, 해당 단계를 약 1.45배 빠르게 한다.
- Engram 조회: 비동기 프리페치와 투명 거대 페이지를 결합해 조회 속도를 최대 약 10배 높인다.
그 외 몇 가지는 연산자 퓨전에서 나왔다. 혼합 전문가(MoE) 라우팅의 여러 단계를 하나의 커널로 합쳐 중간 배치 크기에서 1.18~1.31배, mHC 관련 커널은 GB200에서 TileLang 버전보다 1.14~1.51배 빨라졌다.
정확도 측면에서는 GSM8K와 GPQA로 비교를 진행했고, 품질 저하는 "무시할 수 있는 수준"이며 표준오차의 약 1.5배 이내라고 밝혔다. 블로그는 다른 작업에 대한 평가 결과는 추가로 제시하지 않았다.
중국 내 배포에서 얼마나 적용 가능한가
이 수치들은 모두 엔비디아 Blackwell 플랫폼에서 나온 것이다. 미국의 수출 규제로 중국 내 기관은 GB200, GB300 같은 칩을 구하기 어렵고, NVFP4도 Blackwell 전용 데이터 포맷이어서 관련 효과를 H20이나 자국산 가속기에서 그대로 재현할 수는 없다.
옮겨갈 수 있는 부분은 주로 스케줄링과 캐시 계층에 있다. 경계 제한 슬라이딩 윈도우 재계산, 세션 어피니티, KV 캐시 오프로드 생략 등은 특정 하드웨어에 대한 의존도가 상대적으로 약하고 코드가 이미 vLLM 메인 브랜치에 반영돼 같은 모델을 쓰는 팀은 버전만 올리면 적용할 수 있다. 각 커널 통합의 진행 상황은 vLLM GitHub 이슈 #57448에서 종합적으로 추적되고 있다. 자국산 칩에서 실제로 얼마나 빨라지는지는 아직 제3자가 검증한 바 없다.
참고 출처: vLLM 공식 기술 블로그, CocoLoop, SemiAnalysis AgentX 벤치마크 설명. 블로그 데이터는 각 최적화의 속도 향상 배수, 테스트 하드웨어, 병렬 구성을 기준으로 검증했다.