SGLang percepat MiniMax-H3 1,95x tanpa kehilangan kualitas
LMSYS menguji MiniMax-H3 di 8x H200: jalur lossless SGLang 1,95x lebih cepat dari Diffusers, sementara tingkat agresif bisa sampai 6x dengan mengorbankan SSIM.
5 artikel terverifikasi tentang optimasi inferensi, produk, dan perkembangan industri.
LMSYS menguji MiniMax-H3 di 8x H200: jalur lossless SGLang 1,95x lebih cepat dari Diffusers, sementara tingkat agresif bisa sampai 6x dengan mengorbankan SSIM.
SGLang dan tim Ling Infra Ant Group memangkas TPOT permintaan tunggal Ling-3.0-flash dari 3.33 ms menjadi 0.78 ms di 4 GPU Blackwell.
Ant Group dan tim SGLang membangun Weight Cache Daemon yang menyimpan bobot terkuantisasi tetap di memori GPU, memangkas waktu restart Ling-2.6-1T dari 8,8 menit menjadi sekitar 32 detik.
Tim LMSYS merilis data optimasi serving DeepSeek-V4-Pro: gap decoding single-batch antara chip H20 versi Tiongkok dan flagship B300 kini hanya 1,42 kali.
NVIDIA merilis Nemotron-Labs-Diffusion, model dengan tiga mode decoding yang meningkatkan throughput hingga 6× dibanding Qwen3-8B tanpa mengorbankan akurasi.