AMD追新版DeepSeek,每美元效能差14.8倍

SemiAnalysis於9月13日發文指出,在CUDA陣營的vLLM支援DeepSeek V4.1 Flash兩天之後,AMD才釋出自家的DeepSeek V4.1 Flash映像檔。映像檔本身開箱即用,功能沒有缺項。差距出在CP值:按這家機構的測算,同一個模型跑在AMD硬體上,每美元效能比H200差最多14.8倍,比B200和B300差最多42倍。

SemiAnalysis給出的解釋是生態系。輝達與其開發者社群的協作,讓CUDA路徑在模型發布第一天就完成最佳化,這家機構把開發者規模寫成600萬人。

兩天差距從何而來

新模型發布後的頭幾天,推論端的工作量集中在運算子適配、量化路徑選擇和排程器調校。vLLM、SGLang這類推論框架的主線開發力量長期圍繞CUDA打轉,模型廠商自己做的參考實作也大多先跑通CUDA。AMD這邊要等主線合併之後才能進行一輪移植與驗證,兩天的時間差是這條鏈路的常態結果。

DeepSeek V4.1 Flash是9月初開始內測、隨後正式發布的一代模型,架構上與先前幾代不同。架構變動幅度越大,移植成本越高,第一天的效能差距也就被拉得越開。

三週前就測過同一量級的差距

把時間往前推三週,SemiAnalysis在8月24日發布過一套名為AgentX 1.0的基準測試,專門測長上下文智慧代理推論。那套測試用了393條去識別化的Claude Code呼叫軌跡,上下文超過100萬token,投入的運算資源在1000張GPU以上、耗電約2百萬瓦,預算寫的是300萬美元以上。

那次的結論依模型而異:Qwen3.5在SGLang上,90 tok/s/user檔位輝達比AMD好20倍以上;GLM 5.3在150 tok/s/user檔位,輝達的成本效率高出約5倍;B300的FP4路徑相比H100每美元效能提升12倍。同一份資料裡還寫了一句更難堪的話:AMD的ATOM堆疊在整個阿里巴巴集團只有一個小型廣告事業單位在用。

三週前的5倍到20倍,與這次的14.8倍到42倍,量級對得上。差別在於,AgentX測的是已經穩定運作一段時間的模型,這次測的是發布頭兩天的新模型,冷啟動階段的差距被拉得更開。

硬體本身不是瓶頸

MI355X的紙面規格並不落後。SemiAnalysis在8月那份資料裡提過一個說法:在某些檔位上,就算AMD的晶片白送,按每token成本算也贏不了,直到vLLM和SGLang那邊追上來為止。8月21日之後,由於vLLM上來自Inferact和輝達的一批最佳化,B200的每美元效能反超了MI355X。

對採購方來說,這組數字的解讀是:採購決策的變數已經從峰值算力移到了軟體堆疊成熟度和新模型的適配時延。一家推論服務商如果要在新模型發布當天上線,AMD這條路的兩天差距就等於兩天沒有收入。

解讀時要留意的地方

14.8倍和42倍都是SemiAnalysis單方提供的數據,AMD沒有回應,也沒有第三方複現。每美元效能這項指標對顯卡價格假設極其敏感,二手H200與全新B300的市價差就足以把倍數拉到任何方向。這家機構先前的基準測試報告曾公開過測試方法和成本模型,但這次的貼文並未附上完整的方法說明。

AMD的軟體堆疊這兩年一直在追。追的速度能不能跑贏輝達每一代新硬體的最佳化投入,要看下一款架構大改的模型發布時,兩邊的映像檔差幾天。

參考來源:SemiAnalysis、CocoLoop、vLLM專案公開紀錄;每美元效能倍數與AgentX基準測試的算力投入規模,均按SemiAnalysis自述口徑記錄,未經第三方複現。