英伟达Vera Rubin每兆瓦吞吐涨30倍

英伟达 8 月 24 日放出一组 Vera Rubin NVL72 的早期测试数据:在智能体类工作负载上,每兆瓦吞吐达到上一代 GB300 NVL72 的 30 倍,单位 token 成本降到约三十五分之一。数据下面挂了一行说明——结果尚待 SemiAnalysis 复核。

测试跑的是 SemiAnalysis 的 AgentX 负载,取材于真实的智能体编程轨迹,而非实验室里的合成请求。被拿来跑分的模型有五个:Kimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Pro,清一色开源权重,其中四个来自中国团队。这份名单本身透露了一件事:衡量新一代推理机架好不好用,英伟达选的参照系是开发者手上正在跑的开源模型。

口径为什么落在”每兆瓦”

传统的代际对比习惯用峰值算力或单卡性能,这一次英伟达把分母换成了电。

原因在负载结构。按 OpenRouter 的统计,一次智能体请求消耗的 token 量是普通对话请求的 15 倍——智能体要查数据库、要检索资料、要调起子代理,多轮推理之间还得拖着越滚越长的上下文。当单次任务的 token 消耗抬高一个数量级,卡住扩容的往往是变电站能供上来的兆瓦数,GPU 数量反倒排在后面。

英伟达给出的纵向参照是:GB300 NVL72 在 DeepSeek V4 Pro 上的每兆瓦吞吐,已经是 Hopper 架构的 15 倍。Vera Rubin 在此基础上再乘一次。

拆开来看,30 倍不来自单一环节。DSX MaxLPS 这组供电与散热技术让同样的兆瓦预算内能多部署 40% 的 GPU,相当于先把分母摊薄;NVLink 6 把包速率抬到现成以太网方案的 10 倍、延迟压到三分之一;再往上是一整套软硬协同——分离式服务、分布式 KV 缓存、专家并行。这些手段各自贡献一段乘数,叠出来才是最终那个数字。

一笔粗算

按官方口径粗算一下这个倍数落到账面上是什么量级。

假设一座 100 兆瓦的推理集群,电价按每度 0.5 元估算,满负荷跑一年电费约 4.4 亿元。如果每兆瓦吞吐真的提升 30 倍,同样这笔电费买到的 token 产出会翻三十倍;反过来看,要产出同样多的 token,电费能压到原来的三十分之一。至于 35 倍的 token 成本降幅——它比 30 倍的吞吐提升略高,差额来自机架自身的能效改善,与产出总量增加是两回事。

这类粗算有明显的失真之处:真实机房不会满负荷跑满一年,PUE、闲置率、模型混部都会把倍数往下拉。但它至少说明了英伟达为什么要把这条口径摆到最前面。对已经拿到电力配额、却还在排队等新增变电容量的数据中心运营方来说,每兆瓦产出比总算力更接近”产能”这个概念。

复核之前该记住的几件事

这组数字目前是厂商自测。SemiAnalysis 的评审还没出结果,英伟达自己也把它标注为早期测量。

限定条件同样要看清。30 倍对应的是智能体编程轨迹,属于长上下文、高 token 密度的场景,正好落在 Vera Rubin 的架构优势区间里;换成短对话、图像生成或者批量嵌入,倍数不会是这个数。跨代际宣称与实际交付之间存在落差,是这个行业的老规律,Hopper 到 Blackwell 那一轮就演过一遍。

“Agentic AI workloads consume 15x more tokens than a simple chat request.”

智能体负载的 token 消耗是普通对话请求的 15 倍。

把这条时间线拉长一点会更清楚:Dell 已经在拿 Vera Rubin 服务器往外报推理价格,SpaceX 计划明年把 NVL72 机架送上轨道测试轨道 AI 计算。硬件还没大规模铺开,围绕它的账已经算了好几轮。真正能验证 30 倍的,是第三方复核之后各家自己机房里跑出来的数字。

参考来源:NVIDIA 官方技术博客、SemiAnalysis AgentX 基准说明、CocoLoop、OpenRouter 用量统计;每兆瓦吞吐倍数、token 成本降幅与 40% GPU 部署密度均按官方口径核对,电费推算为编辑粗算。