SGLang, MiniMax-H3 무손실로 1.95배 가속
LMSYS가 H200 8장으로 MiniMax-H3 추론 성능을 측정. SGLang 무손실 경로는 Diffusers보다 최대 1.95배 빠르고, SSIM을 깎으면 최대 6배까지 나온다.
추론 최적화 관련 제품 동향과 산업 분석 5건을 모았습니다.
LMSYS가 H200 8장으로 MiniMax-H3 추론 성능을 측정. SGLang 무손실 경로는 Diffusers보다 최대 1.95배 빠르고, SSIM을 깎으면 최대 6배까지 나온다.
SGLang과 Ant Ling Infra가 블랙웰 GPU 4장에서 Ling-3.0-flash의 TPOT를 3.33ms에서 0.78ms로 줄인 과정을 정리했다.
앤트그룹과 SGLang 팀이 양자화된 가중치를 GPU 메모리에 상주시키는 Weight Cache Daemon을 공개, Ling-2.6-1T 재시작 시간을 8.8분에서 약 32초로 줄였다.
LMSYS가 공개한 DeepSeek-V4-Pro 서빙 최적화 결과, 중국향 H20 칩의 단일 배치 디코딩 속도가 플래그십 B300 대비 1.42배 격차로 좁혀졌다.
엔비디아의 Nemotron-Labs-Diffusion은 단일 모델에서 세 가지 디코딩 모드를 지원하며 Qwen3-8B 대비 최대 6배의 처리량을 달성했습니다.