SGLang tăng tốc MiniMax-H3 gấp 1,95 lần không mất chất lượng
LMSYS thử nghiệm SGLang Diffusion trên 8 card H200: đường không mất mát nhanh hơn Diffusers 1,95 lần, mức 6,24 lần phải đánh đổi bằng chất lượng hình ảnh.
5 bài đã kiểm chứng về tối ưu suy luận, sản phẩm và diễn biến ngành.
LMSYS thử nghiệm SGLang Diffusion trên 8 card H200: đường không mất mát nhanh hơn Diffusers 1,95 lần, mức 6,24 lần phải đánh đổi bằng chất lượng hình ảnh.
SGLang và Ant Group giảm độ trễ mỗi token của Ling-3.0-flash ở mức đồng thời 1 tới 77% trên bốn GPU Blackwell.
Ant, Alibaba và nhóm SGLang giữ trọng số đã lượng tử hóa thường trực trong bộ nhớ GPU, rút thời gian khởi động lại mô hình nghìn tỷ tham số từ 8,8 phút xuống còn 32 giây.
LMSYS công bố loạt tối ưu trên SGLang giúp DeepSeek-V4-Pro chạy trên chip H20 tại Trung Quốc tiệm cận B300, khoảng cách giải mã đơn batch chỉ còn 1,42 lần.
NVIDIA công bố Nemotron-Labs-Diffusion, mô hình hỗ trợ ba chế độ giải mã, tăng thông lượng lên tới 6 lần so với Qwen3-8B mà vẫn duy trì độ chính xác.