オープンソースの推論フレームワークvLLMのチームは、Inferactとともに10月7日に技術ブログを公開し、DeepSeek-V4.1-Flash向けに実施した一連の推論最適化を紹介した。エージェント型ワークロードを模したテストでは、低並行時の速度が1.9倍に、1ユーザーあたりの出力速度を1秒150トークンに制限した条件では全体のスループットが5.3倍に向上したという。
テストに使われた負荷はSemiAnalysisのAgentXベンチマークで、チームはこれをエージェント型サービスの典型的なシナリオ——複数ターンの対話、長いコンテキスト、プレフィックスキャッシュのヒット率を保つセッションアフィニティ——として扱っている。低レイテンシ構成は4ウェイのテンソル並列にFlashInferを組み合わせ、高スループット構成は2ウェイのデータ並列とエキスパート並列を組み合わせたものだ。
モデル自体の特徴
ブログの説明によると、V4.1 Flashは因果エンコーダー・デコーダー構造を採用し、合計40層のうち第20層がデコーダー用のグローバルKVを計算する。生成時は1トークンあたり約160億パラメータ、プリフィル時は約80億パラメータが活性化される。グローバルKVキャッシュは圧縮され層間で共有されており、FP4精度では1トークンあたり約890バイト。これに加えて直近128ポジションをカバーするスライディングウィンドウKVがあり、こちらはFP8で非圧縮のまま保存される。
キャッシュがこれだけ小さいことには直接的な意味がある。ベンチマークを通してKVキャッシュをメモリやディスクにオフロードする必要がなかったのだ。長いコンテキストを扱うエージェント型タスクでは、オフロードがレイテンシ悪化の大きな原因の一つになりやすい。
8項目の最適化のうち効果が大きかったもの
チームは8つの変更点を挙げており、その中でも効果が目立ったのは以下の項目だ。
- 境界付きスライディングウィンドウ再計算:プレフィックスキャッシュがヒットした際、直近128トークンだけを再計算し、CUDA Graphと組み合わせる。これにより最初のトークンが出るまでの時間が約30%短縮され、約10万トークンのコンテキストではほぼ70%短縮された。V4.1ではデフォルトで有効になっており、
--no-swa-bounded-replayで無効化できる。 - スパースMQAスコアリングカーネル:512Kコンテキストでは元の実装より14〜23倍速いが、8Kでは1.2倍にとどまる。エンドツーエンドのデコード全体では約3〜6%の改善につながる。
- NVFP4アテンション:従来のFP8方式に比べてKVキャッシュを45%削減し、対応する処理を約1.45倍高速化する。
- Engramルックアップ:非同期プリフェッチと透過的ヒュージページにより、検索が最大で約10倍速くなる。
ほかにも演算子融合による改善がある。Mixture-of-Expertsのルーティングの複数ステップを1つのカーネルにまとめたことで中規模バッチで1.18〜1.31倍、mHC関連のカーネルはGB200上でTileLang版より1.14〜1.51倍速くなった。
精度についてはGSM8KとGPQAで比較を行い、品質の低下は「無視できる程度」で、差は標準誤差の約1.5倍以内だとしている。ブログではこれ以外のタスクでの評価結果は示されていない。
中国国内での展開にどこまで使えるか
これらの数値はすべてNvidiaのBlackwellプラットフォームによるものだ。米国の輸出規制により、中国の機関はGB200やGB300のようなチップを入手しにくく、NVFP4もBlackwell専用のデータ形式であるため、関連する効果はH20や国産アクセラレータでは直接再現できない。
一方、スケジューリングとキャッシュ層にある部分は移植しやすい。境界付きスライディングウィンドウ再計算、セッションアフィニティ、KVキャッシュのオフロード回避といった項目は特定のハードウェアへの依存が比較的弱く、コードはすでにvLLMのメインブランチに取り込まれているため、同じモデルを使うチームはバージョンアップするだけで利用できる。各カーネル統合の進捗はvLLMのGitHub issue #57448に集約されている。国産チップでの実際の高速化効果は、まだ第三者による検証がない。
参考資料:vLLM公式技術ブログ、CocoLoop、SemiAnalysis AgentXベンチマーク資料。ブログのデータについて、各最適化の高速化倍率、テストハードウェア、並列構成を確認した。