SGLang accélère MiniMax-H3 de 1,95 fois sans perte de qualité
LMSYS teste SGLang Diffusion sur 8 cartes H200 : la voie sans perte est 1,95 fois plus rapide que Diffusers, et le palier à 6,24 fois exige un compromis sur la qualité d'image.
5 articles vérifiés sur optimisation d'inférence, les produits et le secteur.
LMSYS teste SGLang Diffusion sur 8 cartes H200 : la voie sans perte est 1,95 fois plus rapide que Diffusers, et le palier à 6,24 fois exige un compromis sur la qualité d'image.
SGLang et Ant Group réduisent la latence par token de Ling-3.0-flash à concurrence 1, jusqu'à 77 % sur quatre GPU Blackwell.
Ant, Alibaba et l'équipe SGLang gardent les poids quantifiés en mémoire GPU et font passer le redémarrage d'un modèle de mille milliards de paramètres de 8,8 minutes à 32 secondes.
LMSYS montre, via des optimisations sur SGLang, comment DeepSeek-V4-Pro sur la H20 de Nvidia pour la Chine se rapproche de la B300, l'écart de décodage n'étant plus que de 1,42 fois.
NVIDIA dévoile Nemotron-Labs-Diffusion, un modèle avec trois modes de décodage qui multiplie le débit par 6 par rapport à Qwen3-8B tout en maintenant la précision.