SGLangがMiniMax-H3を無損失で1.95倍高速化
LMSYSがH200×8基でMiniMax-H3の推論性能を検証。SGLangの無損失パスはDiffusers比で最大1.95倍高速、さらに画質を犠牲にすれば最大6倍まで伸びる。
推論最適化に関する製品動向と業界分析を全5件掲載しています。
LMSYSがH200×8基でMiniMax-H3の推論性能を検証。SGLangの無損失パスはDiffusers比で最大1.95倍高速、さらに画質を犠牲にすれば最大6倍まで伸びる。
SGLangとAnt Ling Infraが4基のBlackwellでLing-3.0-flashの生成速度を3.33msから0.78msに短縮した経緯をまとめた。
Ant GroupとSGLangチームが量子化済みの重みをGPUメモリに常駐させる仕組みを開発、Ling-2.6-1Tの再起動時間を8.8分から約32秒に短縮した。
LMSYSがDeepSeek-V4-Proの推論最適化データを公開。中国向けH20チップでの単一バッチ復号速度が、フラッグシップB300比1.42倍まで縮小した。
NVIDIAが発表したNemotron-Labs-Diffusionは、3つのデコードモードを1つのモデルで実現し、Qwen3-8B比で最大6倍のスループットを達成。