SGLang讓MiniMax-H3無損提速1.95倍
LMSYS用8張H200實測MiniMax-H3推理效能,SGLang無損路徑比Diffusers快up to 1.95倍,犧牲SSIM畫質最高可到6倍。
收錄 推理優化 相關產品動態與產業觀察,共 5 篇文章。
LMSYS用8張H200實測MiniMax-H3推理效能,SGLang無損路徑比Diffusers快up to 1.95倍,犧牲SSIM畫質最高可到6倍。
SGLang與螞蟻Ling Infra團隊在4張Blackwell顯示卡上,把Ling-3.0-flash單一請求的生成延遲從3.33毫秒降到0.78毫秒。
螞蟻集團與SGLang團隊打造Weight Cache Daemon,讓量化後的權重常駐GPU記憶體,將Ling-2.6-1T的重啟時間從8.8分鐘壓縮到約32秒。
LMSYS 團隊公開 DeepSeek-V4-Pro 服務端最佳化數據,在中國特規卡 H20 上,單批解碼與旗艦卡 B300 的差距已縮小到 1.42 倍。
NVIDIA的Nemotron-Labs-Diffusion在單一模型中支援三種解碼模式,吞吐量最高可達Qwen3-8B的6倍,同時維持準確度。