SemiAnalysis đăng bài ngày 13/9 cho biết, hai ngày sau khi vLLM ở phía CUDA đã hỗ trợ DeepSeek V4.1 Flash, AMD mới phát hành image DeepSeek V4.1 Flash của riêng mình. Bản thân image này chạy được ngay, không thiếu tính năng nào. Khoảng cách nằm ở hiệu quả chi phí: theo tính toán của tổ chức này, cùng một mô hình chạy trên phần cứng AMD có hiệu năng trên mỗi USD kém H200 tới 14,8 lần, kém B200 và B300 tới 42 lần.
Lời giải thích mà SemiAnalysis đưa ra là hệ sinh thái. Sự phối hợp giữa Nvidia và cộng đồng nhà phát triển của hãng giúp nhánh CUDA được tối ưu ngay từ ngày đầu mô hình ra mắt; tổ chức này ước tính quy mô cộng đồng phát triển ở mức 6 triệu người.
Khoảng cách hai ngày nằm ở đâu
Trong vài ngày đầu sau khi mô hình mới ra mắt, khối lượng công việc ở phía suy luận tập trung vào việc thích ứng toán tử, chọn đường lượng tử hóa và tinh chỉnh bộ lập lịch. Đội ngũ phát triển cốt lõi của các framework suy luận như vLLM, SGLang từ lâu xoay quanh CUDA, và các bản triển khai tham chiếu do chính hãng mô hình làm ra cũng phần lớn chạy được trên CUDA trước. Phía AMD phải đợi nhánh chính được hợp nhất rồi mới làm một vòng chuyển đổi và kiểm chứng, nên độ trễ hai ngày là kết quả thường thấy của chuỗi này.
DeepSeek V4.1 Flash là thế hệ mô hình bắt đầu thử nghiệm nội bộ từ đầu tháng 9 rồi mới phát hành chính thức, có cấu trúc khác với các thế hệ trước. Thay đổi cấu trúc càng lớn, chi phí chuyển đổi càng cao, và khoảng cách hiệu năng trong ngày đầu càng bị kéo giãn.
Cùng mức chênh lệch đã được đo từ ba tuần trước
Lùi lại ba tuần, ngày 24/8 SemiAnalysis từng công bố một bộ benchmark tên AgentX 1.0, chuyên đo suy luận agent với ngữ cảnh dài. Bộ test đó dùng 393 lượt gọi Claude Code đã được ẩn danh, ngữ cảnh vượt 1 triệu token, huy động hơn 1.000 card với công suất khoảng 2 megawatt, ngân sách được ghi là hơn 3 triệu USD.
Kết quả lần đó chia theo từng mô hình: với Qwen3.5 chạy trên SGLang, ở mức 90 tok/s/user, Nvidia vượt AMD hơn 20 lần; với GLM 5.3 ở mức 150 tok/s/user, hiệu quả chi phí của Nvidia cao hơn khoảng 5 lần; đường FP4 của B300 cho hiệu năng trên mỗi USD cao hơn H100 tới 12 lần. Cùng tài liệu đó còn có một câu khó nghe hơn: toàn bộ Alibaba chỉ có một đơn vị quảng cáo quy mô nhỏ đang dùng stack ATOM của AMD.
Mức 5-20 lần của ba tuần trước và mức 14,8-42 lần lần này nằm cùng một bậc độ lớn. Khác biệt là AgentX đo một mô hình đã chạy ổn định một thời gian, còn lần này đo một mô hình mới trong hai ngày đầu phát hành, nên khoảng cách ở giai đoạn khởi động nguội càng bị nới rộng.
Bản thân phần cứng không phải nút thắt
Thông số trên giấy của MI355X không hề thua kém. Trong tài liệu hồi tháng 8, SemiAnalysis từng nêu một nhận định: ở một số mức, dù chip AMD có cho không thì tính theo chi phí trên mỗi token vẫn không thắng nổi, cho tới khi vLLM và SGLang bắt kịp. Sau ngày 21/8, nhờ một loạt tối ưu từ Inferact và Nvidia đưa lên vLLM, hiệu năng trên mỗi USD của B200 đã vượt qua MI355X.
Với người mua card, cách đọc những con số này là: biến số trong quyết định mua sắm đã chuyển từ hiệu năng đỉnh sang độ chín của software stack và độ trễ thích ứng với mô hình mới. Với một nhà cung cấp dịch vụ suy luận muốn lên sóng ngay ngày mô hình mới ra mắt, khoảng cách hai ngày của AMD đồng nghĩa hai ngày mất doanh thu.
Những điểm cần thận trọng về số liệu
Cả hai con số 14,8 lần và 42 lần đều là dữ liệu một phía từ SemiAnalysis, AMD chưa phản hồi và cũng chưa có bên thứ ba tái lập. Chỉ số hiệu năng trên mỗi USD rất nhạy với giả định về giá card; chênh lệch giá thị trường giữa H200 cũ và B300 mới có thể kéo tỷ lệ này theo bất kỳ hướng nào. Các báo cáo benchmark trước đây của tổ chức này từng công khai phương pháp đo và mô hình chi phí, nhưng bài đăng lần này không kèm theo mô tả phương pháp đầy đủ.
Software stack của AMD hai năm qua vẫn liên tục đuổi theo. Tốc độ đuổi có vượt được tốc độ đầu tư tối ưu hóa của Nvidia cho mỗi thế hệ phần cứng mới hay không, sẽ phải chờ xem lần tới khi một mô hình có cấu trúc thay đổi lớn ra mắt, image của hai bên còn cách nhau bao nhiêu ngày.
Nguồn tham khảo: SemiAnalysis, CocoLoop, hồ sơ công khai của dự án vLLM; các số liệu về tỷ lệ hiệu năng trên mỗi USD và quy mô tính toán trong benchmark AgentX đều được ghi lại theo công bố của SemiAnalysis, chưa qua tái lập bởi bên thứ ba.