vLLM Tingkatkan Throughput DeepSeek V4.1 Flash 5,3x

Tim vLLM, framework inferensi open source, bersama Inferact merilis blog teknis pada 7 Oktober yang menjelaskan serangkaian optimasi inferensi yang mereka bangun untuk DeepSeek-V4.1-Flash. Dalam pengujian yang mensimulasikan beban kerja agentic, tim mengukur peningkatan kecepatan 1,9x pada konkurensi rendah, dan peningkatan throughput 5,3x saat kecepatan output per pengguna dibatasi pada 150 token per detik.

Beban kerja yang digunakan adalah benchmark AgentX dari SemiAnalysis, yang dianggap tim sebagai representasi skenario layanan agentic — percakapan multi-turn, konteks panjang, dan session affinity yang menjaga tingkat hit prefix cache. Konfigurasi latensi rendah menggunakan tensor parallelism 4-arah dengan FlashInfer; konfigurasi throughput tinggi menggunakan data parallelism 2-arah yang digabung dengan expert parallelism.

Karakteristik model itu sendiri

Menurut blog tersebut, V4.1 Flash menggunakan arsitektur encoder-decoder kausal dengan total 40 layer, di mana layer ke-20 menghitung global KV yang digunakan decoder. Setiap token mengaktifkan sekitar 16 miliar parameter saat generate, dan sekitar 8 miliar saat prefill. Global KV cache dikompresi dan dibagikan antar-layer, menghasilkan sekitar 890 byte per token pada presisi FP4; ada juga sliding-window KV cache terpisah yang mencakup 128 posisi terbaru, disimpan tanpa kompresi dalam FP8.

Cache yang sekecil ini membawa konsekuensi langsung: selama keseluruhan pengujian benchmark, tidak diperlukan offload KV cache ke memori atau disk. Pada tugas agentic dengan konteks panjang, offload sering menjadi salah satu sumber utama pelambatan latensi.

Beberapa optimasi utama dari delapan perubahan

Tim mencantumkan delapan perubahan; beberapa di antaranya memberikan dampak paling besar:

  • Bounded sliding-window replay: saat terjadi prefix-cache hit, sistem langsung menghitung ulang 128 token terbaru, dipasangkan dengan CUDA Graph. Ini memangkas waktu time-to-first-token sekitar 30%, dan hampir 70% pada konteks sekitar 100 ribu token. Fitur ini aktif secara default di V4.1 dan bisa dimatikan dengan --no-swa-bounded-replay.
  • Sparse MQA scoring kernel: 14 hingga 23x lebih cepat dibanding implementasi awal pada konteks 512K, tapi hanya 1,2x lebih cepat pada 8K — setara dengan peningkatan sekitar 3% hingga 6% untuk decoding end-to-end.
  • NVFP4 attention: memperkecil KV cache 45% dibanding skema FP8 sebelumnya, dan mempercepat langkah terkait sekitar 1,45x.
  • Pencarian Engram: prefetching asinkron dengan transparent huge pages mempercepat pencarian hingga sekitar 10x.

Beberapa perubahan lain berasal dari operator fusion: menggabungkan beberapa langkah routing mixture-of-experts ke dalam satu kernel memberi peningkatan 1,18 hingga 1,31x pada ukuran batch menengah, sementara kernel terkait mHC berjalan 1,14 hingga 1,51x lebih cepat dibanding versi TileLang di GB200.

Dari sisi akurasi, tim melakukan perbandingan pada GSM8K dan GPQA dan menyebut penurunan kualitas "dapat diabaikan", dengan selisih sekitar 1,5 standard error. Blog tersebut tidak membagikan hasil evaluasi pada task lain.

Seberapa relevan untuk deployment di Tiongkok

Semua angka ini berasal dari platform Blackwell milik Nvidia. Akibat pembatasan ekspor AS, lembaga di Tiongkok sulit mendapatkan chip seperti GB200 dan GB300, dan NVFP4 juga merupakan format data eksklusif Blackwell — sehingga peningkatan terkait tidak bisa direproduksi langsung di chip H20 atau akselerator buatan domestik.

Bagian yang bisa dipindahkan terutama ada di lapisan scheduling dan caching. Bounded sliding-window replay, session affinity, dan menghindari offload KV cache relatif tidak terikat erat pada hardware tertentu, dan kodenya sudah masuk ke main branch vLLM — tim yang menjalankan model yang sama cukup upgrade versi untuk mendapatkannya. Progres berbagai integrasi kernel dilacak secara terpusat di GitHub issue #57448 milik vLLM. Belum ada pihak ketiga yang mengukur seberapa besar peningkatan nyata pada chip domestik.

Sumber: blog teknis resmi vLLM, CocoLoop, dokumentasi benchmark AgentX dari SemiAnalysis; data pada blog diverifikasi terhadap angka peningkatan kecepatan, hardware pengujian, dan konfigurasi parallelism yang disebutkan.