AMD 追 DeepSeek 新模型,每美元性能差 14.8 倍

SemiAnalysis 9 月 13 日发帖称,在 CUDA 侧的 vLLM 支持 DeepSeek V4.1 Flash 两天之后,AMD 才放出自家的 DeepSeek V4.1 Flash 镜像。镜像本身开箱即用,功能没有缺项。差距出在性价比:按这家机构的测算,同一个模型跑在 AMD 硬件上,每美元性能比 H200 差最多 14.8 倍,比 B200 和 B300 差最多 42 倍。

SemiAnalysis 给出的解释是生态。英伟达与其开发者社区的协作让 CUDA 路径在模型发布第一天就完成优化,这家机构把开发者规模写成 600 万。

两天差在哪

新模型发布后的头几天,推理侧的工作量集中在算子适配、量化路径选择和调度器调参。vLLM、SGLang 这类推理框架的主干开发力量长期围绕 CUDA 打转,模型厂商自己做的参考实现也大多先跑通 CUDA。AMD 侧要等主干合入之后再做一轮移植和验证,两天的时间差是这条链路的常态结果。

DeepSeek V4.1 Flash 是 9 月初开始内测、随后正式发布的一代模型,结构上与此前几代不同。结构变动越大,移植成本越高,第一天的性能差距也就被拉得越开。

同一个量级三周前就测过

把时间往前推三周,SemiAnalysis 在 8 月 24 日发过一套叫 AgentX 1.0 的基准,专门测长上下文智能体推理。那套测试用了 393 条脱敏的 Claude Code 调用轨迹,上下文超过 100 万 token,投入的算力在 1000 张卡以上、约 2 兆瓦功耗,预算写的是 300 万美元以上。

那次的结论分模型看:Qwen3.5 在 SGLang 上,90 tok/s/user 档位英伟达比 AMD 好 20 倍以上;GLM 5.3 在 150 tok/s/user 档位,英伟达的成本效率高出约 5 倍;B300 的 FP4 路径相比 H100 每美元性能提升 12 倍。同一份材料里还写了一句更难堪的话:AMD 的 ATOM 栈在整个阿里巴巴只有一个小型广告业务单元在用。

三周前的 5 倍到 20 倍,与这次的 14.8 倍到 42 倍,量级对得上。区别在于,AgentX 测的是已经稳定运行一段时间的模型,这次测的是发布头两天的新模型,冷启动阶段的差距被拉得更开。

硬件本身不是瓶颈

MI355X 的纸面参数并不落后。SemiAnalysis 在 8 月那份材料里提过一个说法:在某些档位上,就算 AMD 的芯片白送,按每 token 成本算也赢不了,直到 vLLM 和 SGLang 那侧追上来为止。8 月 21 日之后,由于 vLLM 上来自 Inferact 和英伟达的一批优化,B200 的每美元性能反超了 MI355X。

对买卡的人来说,这套数字的读法是:采购决策的变量从峰值算力移到了软件栈成熟度和新模型的适配时延。一家推理服务商如果要在新模型发布当天上线,AMD 这条路的两天差就是两天没有收入。

口径上要小心的地方

14.8 倍和 42 倍都是 SemiAnalysis 的单方数据,AMD 没有回应,也没有第三方复现。每美元性能这个指标对卡价假设极其敏感,二手 H200 与全新 B300 的市价差可以把倍数拉到任何方向。这家机构此前的基准报告公开过测试方法和成本模型,这次的推文没有附带完整方法说明。

AMD 的软件栈这两年一直在追。追的速度能不能跑赢英伟达每代新硬件的优化投入,要看下一款结构大改的模型发布时,两边的镜像差几天。

参考来源:SemiAnalysis、CocoLoop、vLLM 项目公开记录;每美元性能倍数与 AgentX 基准的算力投入规模均按 SemiAnalysis 自述口径记录,未经第三方复现。