SGLang acelera MiniMax-H3 1,95 veces sin perder calidad
LMSYS prueba SGLang Diffusion en 8 tarjetas H200: la ruta sin pérdidas es 1,95 veces más rápida que Diffusers, y el nivel de 6,24 veces exige sacrificar calidad de imagen.
7 artículos verificados sobre optimización de inferencia, productos y movimientos del sector.
LMSYS prueba SGLang Diffusion en 8 tarjetas H200: la ruta sin pérdidas es 1,95 veces más rápida que Diffusers, y el nivel de 6,24 veces exige sacrificar calidad de imagen.
SGLang y Ant Group reducen la latencia por token de Ling-3.0-flash con concurrencia 1 hasta un 77% en cuatro GPU Blackwell.
Ant, Alibaba y el equipo de SGLang mantienen los pesos cuantizados en la memoria de la GPU y reducen el reinicio de un modelo de un billón de parámetros de 8,8 minutos a 32 segundos.
LMSYS muestra, con optimizaciones sobre SGLang, cómo DeepSeek-V4-Pro en la H20 de Nvidia para China se acerca a la B300, con una brecha de decodificación de solo 1,42 veces.
Liquid AI publica nuevos checkpoints de la serie LFM2.5 en formato GGUF Q4_0, entrenados con el método QAD, recuperando hasta el 97% de la precisión original en BF16.
NVIDIA presenta Nemotron-Labs-Diffusion, un modelo con tres modos de decodificación que multiplica hasta por 6 el rendimiento frente a Qwen3-8B sin sacrificar precisión.
Google Research presenta TurboQuant, que combina los algoritmos PolarQuant y QJL para comprimir la memoria del KV Cache durante la inferencia de modelos grandes al menos 6 veces sin necesidad de reentrenamiento, logrando hasta 8 veces más velocidad en GPU H100.