NVIDIA 8 月 24 日公布一組 Vera Rubin NVL72 的早期測試數據:在代理式工作負載上,每百萬瓦輸送量達到上一代 GB300 NVL72 的 30 倍,單位 token 成本降到約三十五分之一。數據下方附註一行說明——結果仍待 SemiAnalysis 覆核。
測試跑的是 SemiAnalysis 的 AgentX 負載,取材自真實的代理式程式設計軌跡,而非實驗室裡的合成請求。被拿來跑分的模型有五個:Kimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Pro,清一色開源權重,其中四個來自中國團隊。這份名單本身透露了一件事:衡量新一代推論機架好不好用,NVIDIA 選的參照系是開發者手上正在跑的開源模型。
口徑為什麼落在「每百萬瓦」
傳統的世代比較習慣用尖峰算力或單卡效能,這一次 NVIDIA 把分母換成了電。
原因在負載結構。按 OpenRouter 的統計,一次代理式請求消耗的 token 量是普通對話請求的 15 倍——代理程式要查資料庫、要檢索資料、要喚起子代理,多輪推論之間還得拖著越滾越長的上下文。當單次任務的 token 消耗抬高一個數量級,卡住擴容的往往是變電站能供上來的百萬瓦數,GPU 數量反倒排在後面。
NVIDIA 給出的縱向參照是:GB300 NVL72 在 DeepSeek V4 Pro 上的每百萬瓦輸送量,已經是 Hopper 架構的 15 倍。Vera Rubin 在此基礎上再乘一次。
拆開來看,30 倍不是來自單一環節。DSX MaxLPS 這組供電與散熱技術讓同樣的百萬瓦預算內能多部署 40% 的 GPU,相當於先把分母攤薄;NVLink 6 把封包速率抬高到現成乙太網路方案的 10 倍、延遲壓到三分之一;再往上是一整套軟硬體協同——分離式服務、分散式 KV 快取、專家並行運算。這些手段各自貢獻一段乘數,疊加起來才是最終那個數字。
一筆粗略試算
按官方口徑粗略試算一下,這個倍數落到帳面上是什麼量級。
假設一座 100 百萬瓦的推論叢集,電價按每度 0.5 元人民幣估算,滿載跑一年電費約 4.4 億元人民幣。如果每百萬瓦輸送量真的提升 30 倍,同樣這筆電費買到的 token 產出會翻三十倍;反過來看,要產出同樣多的 token,電費能壓到原本的三十分之一。至於 35 倍的 token 成本降幅——它比 30 倍的輸送量提升略高,差額來自機架自身的能效改善,與產出總量增加是兩回事。
這類粗略試算有明顯的失真之處:真實機房不會滿載跑滿一年,PUE、閒置率、模型混合部署都會把倍數往下拉。但它至少說明了 NVIDIA 為什麼要把這個口徑擺到最前面。對已經拿到電力配額、卻還在排隊等新增變電容量的資料中心營運方來說,每百萬瓦產出比總算力更接近「產能」這個概念。
覆核之前該記住的幾件事
這組數字目前是廠商自測。SemiAnalysis 的評測還沒出結果,NVIDIA 自己也把它標註為早期測量。
限定條件同樣要看清楚。30 倍對應的是代理式程式設計軌跡,屬於長上下文、高 token 密度的場景,正好落在 Vera Rubin 的架構優勢區間裡;換成短對話、圖像生成或者批次嵌入,倍數不會是這個數。跨世代宣稱與實際交付之間存在落差,是這個產業的老規律,Hopper 到 Blackwell 那一輪就演過一遍。
"Agentic AI workloads consume 15x more tokens than a simple chat request."
代理式 AI 負載的 token 消耗是普通對話請求的 15 倍。
把這條時間線拉長一點會更清楚:Dell 已經在拿 Vera Rubin 伺服器對外報推論價格,SpaceX 計畫明年把 NVL72 機架送上軌道測試太空 AI 運算。硬體還沒大規模鋪開,圍繞它的帳已經算了好幾輪。真正能驗證 30 倍的,是第三方覆核之後各家自己機房裡跑出來的數字。
參考來源:NVIDIA 官方技術部落格、SemiAnalysis AgentX 基準測試說明、CocoLoop、OpenRouter 用量統計;每百萬瓦輸送量倍數、token 成本降幅與 40% GPU 部署密度均按官方口徑核對,電費推算為編輯部粗略試算。