vLLM giúp DeepSeek V4.1 Flash tăng thông lượng 5,3 lần

Nhóm phát triển khung suy luận mã nguồn mở vLLM, cùng với Inferact, đã công bố một bài viết kỹ thuật vào ngày 7/10, giới thiệu một loạt tối ưu suy luận họ thực hiện cho DeepSeek-V4.1-Flash. Trong các bài kiểm tra mô phỏng tải công việc dạng tác nhân (agent), tốc độ tăng 1,9 lần ở mức đồng thời thấp; khi giới hạn tốc độ đầu ra của mỗi người dùng ở 150 token mỗi giây, thông lượng tổng thể tăng 5,3 lần.

Tải thử nghiệm sử dụng bộ chuẩn AgentX của SemiAnalysis, được nhóm coi là đại diện cho các dịch vụ dạng tác nhân: hội thoại nhiều lượt, ngữ cảnh dài, và duy trì mức độ khớp phiên (session affinity) để đạt tỷ lệ trúng cache tiền tố (prefix cache) cao. Cấu hình độ trễ thấp dùng song song tensor trên 4 card kèm FlashInfer; cấu hình thông lượng cao dùng song song dữ liệu 2 chiều kèm song song chuyên gia (expert parallelism).

Đặc điểm của mô hình

Theo bài viết, V4.1 Flash dùng kiến trúc bộ mã hóa-giải mã nhân quả (causal encoder-decoder) gồm 40 lớp, trong đó lớp thứ 20 chịu trách nhiệm tính ra KV toàn cục dùng cho bộ giải mã. Ở giai đoạn sinh token, mỗi token kích hoạt khoảng 16 tỷ tham số; ở giai đoạn tiền điền (prefill) là khoảng 8 tỷ. Bộ nhớ đệm KV toàn cục được nén và chia sẻ giữa các lớp, ở độ chính xác FP4 chỉ khoảng 890 byte mỗi token; ngoài ra còn có một cửa sổ trượt KV riêng che 128 vị trí gần nhất, lưu ở FP8 không nén.

Bộ nhớ đệm nhỏ như vậy mang lại một kết quả trực tiếp: suốt toàn bộ bài kiểm chuẩn, không cần đẩy bộ nhớ đệm KV ra RAM hay ổ đĩa. Trong các tác vụ tác nhân có ngữ cảnh dài, việc đẩy ra ngoài (offload) thường là một trong những nguyên nhân chính làm chậm độ trễ.

Những điểm nổi bật trong 8 hạng mục tối ưu

Nhóm liệt kê tám thay đổi, trong đó vài hạng mục mang lại lợi ích rõ rệt nhất:

  • Phát lại giới hạn theo cửa sổ trượt (sliding window bounded replay): khi gặp cache tiền tố trúng, hệ thống tính lại trực tiếp 128 token gần nhất, kết hợp CUDA Graph, giúp giảm độ trễ token đầu tiên khoảng 30%. Với ngữ cảnh khoảng 100.000 token, độ trễ token đầu tiên giảm gần 70%. Tính năng này được bật mặc định trên V4.1, có thể tắt bằng cờ --no-swa-bounded-replay.
  • Nhân tính điểm MQA thưa (sparse MQA): nhanh hơn cách triển khai gốc 14 đến 23 lần ở ngữ cảnh 512K, chỉ nhanh hơn 1,2 lần ở 8K, quy ra toàn bộ quá trình giải mã khoảng 3% đến 6%.
  • Attention NVFP4: bộ nhớ đệm KV nhỏ hơn 45% so với phương án FP8 trước đó, tốc độ ở phần này tăng khoảng 1,45 lần.
  • Tra bảng Engram: kết hợp tải trước bất đồng bộ và trang nhớ lớn minh bạch (transparent huge pages), tốc độ tra cứu nhanh nhất tăng khoảng 10 lần.

Vài hạng mục khác là hợp nhất toán tử: gộp nhiều bước định tuyến của hỗn hợp chuyên gia (MoE) vào một nhân duy nhất, nhanh hơn 1,18 đến 1,31 lần ở lô vừa; các nhân liên quan đến mHC trên GB200 nhanh hơn phiên bản TileLang từ 1,14 đến 1,51 lần.

Về độ chính xác, nhóm đã đối chiếu trên GSM8K và GPQA, cho biết tổn hao chất lượng là "không đáng kể" (negligible), chênh lệch nằm trong khoảng 1,5 sai số chuẩn. Bài viết không đưa ra thêm đánh giá trên các tác vụ khác.

Mức độ áp dụng được trong triển khai tại Trung Quốc

Toàn bộ các số liệu này đều đến từ nền tảng Blackwell của Nvidia. Do lệnh kiểm soát xuất khẩu của Mỹ, các tổ chức tại Trung Quốc rất khó tiếp cận những card như GB200, GB300; NVFP4 cũng là định dạng dữ liệu chỉ có trên Blackwell, nên các lợi ích liên quan không thể tái lập trực tiếp trên H20 hay các chip gia tốc trong nước.

Phần có thể chuyển giao được chủ yếu nằm ở tầng lập lịch và bộ nhớ đệm. Phát lại theo cửa sổ trượt, khớp phiên, không đẩy KV ra ngoài — những kỹ thuật này gắn với phần cứng ít hơn, mã đã được đưa vào nhánh chính của vLLM, nên các nhóm dùng cùng mô hình chỉ cần nâng cấp phiên bản là có được. Tiến độ tích hợp từng nhân được vLLM theo dõi tập trung tại issue số 57448 trên GitHub. Mức tăng tốc thực tế trên chip trong nước hiện vẫn chưa có bên thứ ba nào kiểm chứng.

Nguồn tham khảo: blog kỹ thuật chính thức của vLLM, CocoLoop, mô tả bộ chuẩn AgentX của SemiAnalysis; dữ liệu trong blog đã được xác minh về các mức tăng tốc, phần cứng thử nghiệm và cấu hình song song.