SGLang 把 MiniMax-H3 无损提速 1.95 倍
编辑精选 同样的去噪步数、同样的 8 卡 H200,换个推理运行时就快近一倍,这部分提速一分画质都没掉。再往上的 6.24 倍要拿 SSIM 换,0.76 已经是肉眼能看出差别的区间,那一档更适合筛构图而非出成片。 LMSYS 团队 8 月
收录 推理优化 相关 AI 新闻、产品动态和产业观察。 本页收录 5 篇已发布文章。
编辑精选 同样的去噪步数、同样的 8 卡 H200,换个推理运行时就快近一倍,这部分提速一分画质都没掉。再往上的 6.24 倍要拿 SSIM 换,0.76 已经是肉眼能看出差别的区间,那一档更适合筛构图而非出成片。 LMSYS 团队 8 月
编辑精选 并发为 1 的时候,卡住模型的常常是 CPU 那一侧的等待,显卡反倒闲着。SGLang 与蚂蚁把这些等待逐个拆掉,单请求每个 token 的耗时从 3.33 毫秒压到 0.78 毫秒。 SGLang 团队和蚂蚁 Ling Infr
编辑精选 蚂蚁与 SGLang 团队把量化后的权重常驻显存、让新进程零拷贝映射过去,省掉每次重启都要重做一遍的读盘和量化。模型越大,推理侧的成本账就越往运维那头挪。 8 月 21 日,蚂蚁 Ling 基础设施团队、阿里和 SGLang 团队
编辑精选 同一个 1.6 万亿参数模型,在特供卡和旗舰卡之间的单批解码差距被压到 1.42 倍。这组数字的分量不在跑分,在于它给被限卡的部署方标出了工程能补多少、补不动的又是哪一段。 LMSYS 团队公开了一组 DeepSeek V4 Pr
5月20号,英伟达Nemotron Labs甩了篇论文加权重。 这次发的不是一个"再大一点的模型",是一个 新的解码方式 ——叫Nemotron Labs Diffusion。3B、8B、14B三个规格,base、instruct、visi