vLLM讓DeepSeek V4.1 Flash吞吐量衝高5.3倍

開源推理框架vLLM團隊與Inferact在10月7日發布技術部落格,介紹他們為DeepSeek-V4.1-Flash打造的一整套推理最佳化。在模擬智能代理工作負載的測試中,低併發情境下速度提升1.9倍;若把單一使用者的輸出速度限制在每秒150個token,整體吞吐量則提升5.3倍。

測試使用的是SemiAnalysis的AgentX基準,團隊將其視為具代表性的智能代理服務情境:多輪對話、長上下文,以及維持前綴快取命中率的session affinity(會話親和性)。低延遲設定採用4卡張量平行加FlashInfer,高吞吐量設定則採用2路資料平行加專家平行。

模型本身的特色

根據部落格描述,V4.1 Flash採用因果編碼器-解碼器架構,共40層,其中第20層負責計算解碼器所需的全域KV。生成階段每個token會啟動約160億個參數,預填階段則約80億個。全域KV快取經過壓縮並跨層共享,在FP4精度下每個token約890位元組;另外還有一段滑動視窗KV,涵蓋最近128個位置,以FP8格式未壓縮儲存。

快取這麼小帶來一個直接的結果:整輪基準測試下來,完全不需要把KV快取卸載到記憶體或硬碟。在處理長上下文的智能代理任務時,卸載往往是拖慢延遲的主要原因之一。

八項最佳化中的幾個重點

團隊列出了八項改動,其中效益最明顯的幾項是:

  • 有界滑動視窗重算:遇到前綴快取命中時,直接重新計算最近128個token,並搭配CUDA Graph。這讓首個token的延遲降低約30%,在約10萬token的上下文中,延遲降幅更接近70%。這項功能在V4.1上預設開啟,可用--no-swa-bounded-replay關閉。
  • 稀疏MQA評分核心:在512K上下文下比原始實作快14到23倍,但在8K時只快1.2倍,換算到端到端解碼約提升3%到6%。
  • NVFP4注意力機制:KV快取比先前的FP8方案縮小45%,對應環節速度提升約1.45倍。
  • Engram查表:搭配非同步預取與透明大分頁,查詢速度最快可提升約10倍。

另外幾項則來自運算子融合:把混合專家路由的多個步驟合併進單一核心,在中等批次下提升1.18到1.31倍;mHC相關核心在GB200上比TileLang版本快1.14到1.51倍。

精準度方面,團隊在GSM8K與GPQA上做了對照測試,表示品質損失「可忽略」,差距在約1.5個標準誤差以內。部落格並未提供其他任務上的評測結果。

中國大陸部署能用上多少

這些數字全部來自NVIDIA的Blackwell平台。受美國出口管制影響,中國大陸機構很難取得GB200、GB300這類晶片,NVFP4也是Blackwell專屬的資料格式,相關效益沒辦法在H20或大陸自製加速卡上直接重現。

能夠移植的部分主要集中在排程與快取層。有界滑動視窗重算、session affinity、不卸載KV快取這幾項與硬體的綁定較弱,程式碼已經併入vLLM主線,使用同一模型的團隊只要升級版本就能取得。各項核心整合的進度,vLLM集中在GitHub第57448號issue追蹤。大陸晶片上實際能提升多少,目前還沒有第三方測試過。

參考來源:vLLM官方技術部落格、CocoLoop、SemiAnalysis AgentX基準說明;部落格數據已核對各項最佳化的提速倍數、測試硬體與平行配置。