SGLang beschleunigt MiniMax-H3 verlustfrei um das 1,95-Fache
LMSYS testet SGLang Diffusion auf 8 H200-Karten: Der verlustfreie Pfad ist 1,95-mal schneller als Diffusers, für das 6,24-Fache muss man Bildqualität eintauschen.
5 geprüfte Beiträge zu Inferenzoptimierung, Produkten und Branchenentwicklungen.
LMSYS testet SGLang Diffusion auf 8 H200-Karten: Der verlustfreie Pfad ist 1,95-mal schneller als Diffusers, für das 6,24-Fache muss man Bildqualität eintauschen.
SGLang und Ant Group senken die Token-Latenz von Ling-3.0-flash bei Nebenläufigkeit 1 auf vier Blackwell-GPUs um bis zu 77 Prozent.
Ant, Alibaba und das SGLang-Team lassen quantisierte Gewichte im GPU-Speicher liegen und drücken den Neustart eines 1T-Modells von 8,8 Minuten auf 32 Sekunden.
LMSYS zeigt mit SGLang-Optimierungen, wie DeepSeek-V4-Pro auf Nvidias China-Chip H20 nahe an die B300-Leistung heranrückt – beim Decoding liegt die Lücke nur noch beim Faktor 1,42.
NVIDIA stellt Nemotron-Labs-Diffusion vor, ein Modell mit drei Decodierungsmodi, das den Durchsatz im Vergleich zu Qwen3-8B um das bis zu 6-fache steigert und dabei die Genauigkeit hält.