Tencent mở mã khung tăng tốc suy luận

Tencent Hunyuan ngày 29/7 đã mở mã AngelSpec. Đây không phải mô hình chat mới cho người dùng phổ thông, mà là khung huấn luyện drafter cho speculative decoding trong suy luận mô hình lớn.

Phạm vi công bố

First Financial xác nhận Tencent đồng thời công bố trọng số và mã huấn luyện MTP, DFly drafter cho Hy3-A21B. Kho GitHub cho biết AngelSpec v0.1.0 hỗ trợ MTP và block-parallel speculative decoding training.

Báo cáo kỹ thuật viết: “We release the AngelSpec framework to support training and extending these speculative-decoding methods.” Nói đơn giản, drafter được đưa từ thử nghiệm rời rạc thành một công cụ có thể huấn luyện, đổi cấu hình và đánh giá.

Các con số có điều kiện

Trên Hy3-A21B, DFly được báo cáo tăng average accepted length khoảng 30%, đạt throughput trung bình cao nhất ở concurrency 4-64, và tăng tốc end-to-end 1,98-2,40 lần so với decoding tự hồi quy. So với DFlash, throughput cao hơn 10,5-11,8%.

Benchmark trên GitHub ghi rõ throughput offline dùng HY3-295B-A21B, TP=8, temperature 1, mỗi ô gồm ba cửa sổ 120 giây. Tải live D-cut được ghi là 8x H20, concurrency 2-64.

Ý nghĩa

Với Agent, sinh mã và ngữ cảnh dài, chi phí chịu ảnh hưởng lớn từ độ trễ, mức dùng GPU và độ ổn định khi nhiều người cùng truy cập. Nếu bên ngoài tái lập được kết quả này, cạnh tranh mô hình Trung Quốc sẽ chuyển mạnh sang hệ thống suy luận.

Nguồn: First Financial, Tencent AngelSpec GitHub, arXiv:2607.25852, CocoLoop, Hugging Face; kiểm chứng phạm vi mở mã, throughput offline Hy3-A21B TP=8, tải live 8x H20, concurrency 4-64, trọng số drafter và giấy phép Apache 2.0.