SGLang deixa o MiniMax-H3 1,95 vez mais rápido sem perder qualidade
LMSYS testa o SGLang Diffusion em 8 placas H200: o caminho sem perdas é 1,95 vez mais rápido que o Diffusers, e o patamar de 6,24 vezes exige trocar por qualidade de imagem.
5 artigos verificados sobre otimização de inferência, produtos e movimentos do setor.
LMSYS testa o SGLang Diffusion em 8 placas H200: o caminho sem perdas é 1,95 vez mais rápido que o Diffusers, e o patamar de 6,24 vezes exige trocar por qualidade de imagem.
SGLang e Ant Group reduzem a latência por token do Ling-3.0-flash com concorrência 1 em até 77% em quatro GPUs Blackwell.
Ant, Alibaba e a equipe do SGLang mantêm os pesos quantizados na memória da GPU e reduzem o reinício de um modelo de um trilhão de parâmetros de 8,8 minutos para 32 segundos.
A LMSYS mostra, com otimizações no SGLang, como o DeepSeek-V4-Pro na H20 da Nvidia para a China se aproxima da B300, reduzindo a diferença na decodificação para 1,42 vez.
A NVIDIA lançou o Nemotron-Labs-Diffusion, um modelo com três modos de decodificação que aumenta a taxa de transferência em até 6× em relação ao Qwen3-8B, mantendo a precisão.