LMSYS 团队 8 月 27 日放出一份 MiniMax-H3 的推理性能报告,测试环境是 8 张 NVIDIA H200,每张 141GB 显存,跑的是 SGLang Diffusion 框架。参数固定在 1344×768 分辨率、24 FPS、50 步去噪,分别出 5 秒和 10 秒两种时长,对照组是 Diffusers。
结论分两层。第一层是不掺水的:
“SGLang’s dense, lossless path is 1.85–1.95× faster than Diffusers with no approximation: the same denoising work, on a faster runtime.” (SGLang 的稠密无损路径比 Diffusers 快 1.85 到 1.95 倍,没有做任何近似:同样的去噪计算量,跑在更快的运行时上。)
文生视频动画这条链路上,无损档比 Diffusers 快 1.87 到 1.95 倍;帧列表转视频那条快 1.91 到 1.95 倍。两条路径都接近翻倍,且 SSIM 严格等于 1.0000——像素级完全一致。
三层加速叠起来才有 6 倍
报告把提速拆成三块,每块的性质不一样。
融合算子是纯工程活儿。SGLang 把 AdaLN 更新、门控残差、SwiGLU 激活,以及带 3D RoPE 的 QK RMSNorm 合进同一个 kernel,减少显存来回搬运。单个算子的隔离测试提速在 2.00 到 12.16 倍之间,落到端到端就是前面那个 1.95 倍。这一层不改任何计算结果。
Cache-DiT 开始动近似了:相邻去噪步之间复用缓存结果,用残差差分阈值决定复不复用,保守档阈值 0.04,激进的 stride 档 0.08。保守档在两条链路上分别拿到 2.65 倍和 2.99 倍,SSIM 掉到 0.90 和 0.94 一线。
SubBlock 稀疏注意力最激进:块稀疏路由器在第 10 步之后削减参与计算的 KV 块,稀疏度设 0.75 或 0.80。它和 Cache-DiT stride 叠在一起,文生视频拿到 4.90 到 5.72 倍,帧列表转视频拿到 5.64 到 6.24 倍。
6 倍那一档的画面代价
代价全写在 SSIM 上,而且两条链路的表现分得很开。帧列表转视频这条抗造:稀疏度 0.75 叠 stride,10 秒片段的 SSIM 还有 0.9202,5 秒的 0.8629。文生视频这条掉得狠,同样配置只剩 0.7834 和 0.7713,稀疏度提到 0.80 更是跌到 0.7584。
SSIM 0.76 是什么概念?粗略讲,结构还在、构图还在,但纹理、细节和高频部分已经和原始输出对不上,放大看得出来。有首帧或关键帧约束的帧列表转视频之所以掉得少,也在这里——模型本来就被条件帧钉住了,稀疏化能损失的自由度不多。
换算成钱更直观。八卡 H200 的按需租用价,市面上大致落在每卡每小时两到三美元的区间,一台机器跑一小时接近二十美元(粗算,各家云厂和合约期差异不小)。无损档快 1.95 倍,等于同样一小时能出接近两倍的片子,单条成本砍到五成出头——这一半是白拿的,不用任何画质去换。再往上的档位省的是同一笔钱,但要在 SSIM 上做减法,账划不划算取决于这批片子是拿去交付还是拿去筛选。
按这组数据摊开来看,实际用法应该分三档:出成片走无损,白拿 1.95 倍;需要平衡就上 Cache-DiT 保守档,2.65 到 2.99 倍,SSIM 0.90 以上一般能接受;筛构图、跑预览用 SubBlock 0.75 那一档,六倍速度换一个”看得出大概”的画面,反正筛完还要重出。
几条要留意的边界
报告自己划了范围。测的只有三种加速手段,量化和渐进式分辨率这类同样常见的有损方法没进来。计时口径排除了服务启动、预热、HTTP 轮询和文件下载,也就是说这些倍数是纯推理侧的,端到端体感会打折。SubBlock 那一套还有硬性前提:只对长的非因果注意力生效,BF16、head dimension 128、序列长度不低于 4096。测试数据实际采集于 8 月 18 日,报告晚了九天才发。
把这件事放回 H3 的时间线上看,模型七月底开权重,一个月后第三方推理栈就把无损档做到近两倍——开源模型的真实价值往往不在发布当天的跑分,而在权重公开之后有多少人愿意为它写 kernel。
参考来源:LMSYS 工程博客、CocoLoop、SGLang 项目文档;按 8 卡 H200、1344×768、24 FPS、50 步去噪的同一组配置核验各档提速倍数与 SSIM 口径。