LMSYS團隊8月27日發布一份MiniMax-H3的推理效能報告,測試環境是8張NVIDIA H200,每張顯存141GB,跑的是SGLang Diffusion框架。參數固定在1344×768解析度、24FPS、50步去噪,分別產出5秒與10秒兩種長度的影片,對照組是Diffusers。
結論分成兩層。第一層是完全不摻水的:
「SGLang的稠密無損路徑,在沒有做任何近似的情況下,比Diffusers快1.85到1.95倍:同樣的去噪運算量,跑在更快的執行環境上。」
在文字生成影片這條管線上,無損檔比Diffusers快1.87到1.95倍;在影格列表轉影片這條管線上,快1.91到1.95倍。兩條路徑都接近翻倍,而且SSIM嚴格等於1.0000——像素層級完全一致。
三層加速疊起來才有6倍
報告把提速拆成三塊,各層的性質都不一樣。
融合運算子純粹是工程活。SGLang把AdaLN更新、閘控殘差、SwiGLU激活函數,以及帶3D RoPE的QK RMSNorm整合進同一個kernel,減少記憶體來回搬運的次數。單一運算子的隔離測試提速落在2.00到12.16倍之間,換算到端到端就是前面那個1.95倍。這一層完全不改變任何運算結果。
Cache-DiT開始動用近似手法:相鄰去噪步驟之間直接複用快取結果,用殘差差異是否低於閾值來決定要不要複用。保守檔閾值設0.04,更積極的「stride」檔設0.08。保守檔在兩條管線上分別拿到2.65倍和2.99倍,SSIM則掉到0.90和0.94左右。
SubBlock稀疏注意力是最激進的一招:區塊稀疏路由器從第10步之後開始削減參與運算的KV區塊,稀疏度設在0.75或0.80。它跟Cache-DiT的stride檔疊加使用,文字生成影片可以拿到4.90到5.72倍,影格列表轉影片則拿到5.64到6.24倍。
6倍檔位的畫質代價
代價全反映在SSIM上,而且兩條管線的表現差很多。影格列表轉影片這條路徑比較扛得住:稀疏度0.75疊加stride,10秒片段的SSIM仍有0.9202,5秒片段也有0.8629。文字生成影片這條路徑掉得比較兇,同樣的設定只剩0.7834和0.7713,稀疏度拉到0.80更是跌到0.7584。
SSIM 0.76大概是什麼概念?粗略來說,結構跟構圖都還在,但材質、細節和高頻部分已經跟原始輸出對不上,放大就看得出來。影格列表轉影片之所以掉得比較少,是因為它通常有首格或關鍵影格的條件限制,模型本來就被這些條件影格釘住,稀疏化能損失的自由度自然比較少。
換算成成本會更直觀。8張H200的隨用隨付租賃價,市面上大致落在每張每小時2到3美元之間,一台機器跑滿一小時大概接近20美元(這只是粗估,各家雲端業者和合約條件差異不小)。無損檔快1.95倍,等於同樣一小時能多出將近一倍的成片量,單條成本直接砍到五成出頭——這一半是完全白拿的,不用犧牲任何畫質去換。再往上的檔位省的錢是一樣的邏輯,但代價要從SSIM裡扣,划不划算得看這批影片是要拿去交付,還是拿去篩選構圖。
照這組數據來看,實際用法大概可以分三檔:正式出成片就走無損檔,1.95倍是白撿的;需要在速度和畫質間找平衡,就上Cache-DiT保守檔,2.65到2.99倍,SSIM 0.90以上一般都能接受;篩構圖、跑預覽就用SubBlock 0.75那一檔,用6倍速度換一個「大概看得出來」的畫面,反正篩完之後還是要重新出一次成片。
幾個要留意的前提
報告自己也劃了範圍。這次只測了這三種加速手法,量化、漸進式解析度這類同樣常見的有損方法都沒有納入。計時口徑排除了服務啟動、暖機、HTTP輪詢和檔案下載的時間,也就是說這些倍數都是純推理端的數字,實際端到端體感會打些折扣。SubBlock還有硬性前提:只對長的非因果注意力機制生效,而且要求BF16、head dimension為128、序列長度不低於4096。測試數據實際採集於8月18日,報告則晚了九天才發布。
把這件事擺回H3的時間軸來看會更有意思。模型七月底開源釋出權重,一個月後就有第三方推理框架把無損檔做到接近兩倍速——開源模型的真正價值,往往不在發布當天的跑分,而在權重公開之後,有多少人願意為它動手寫kernel。
參考來源:LMSYS工程部落格、CocoLoop、SGLang專案文件;均以8張H200、1344×768、24FPS、50步去噪的相同組態,核對各檔位的提速倍數與SSIM數值。