DeepSeek V4 chạy trên chip Huawei

DeepSeek sắp phát hành V4, nhưng lần này điều đáng chú ý nhất không phải tham số mô hình lớn đến đâu, mà là nó chạy trên chip nào.

Theo The Information, DeepSeek V4 sẽ chạy trên chip Ascend 950PR của Huawei. Đây là mô hình AI tiên tiến đầu tiên được xây dựng riêng cho kiến trúc chip nội địa Trung Quốc.

Trước hết, hãy xem xét bản thân mô hình

Thông số kỹ thuật của V4 rất ấn tượng:

Tham số Giá trị
Tổng số tham số Khoảng 1 nghìn tỷ (kiến trúc MoE)
Tham số kích hoạt khi suy luận Khoảng 37 tỷ
Cửa sổ ngữ cảnh 1 triệu token
Điểm SWE-bench 81%

Logic sử dụng kiến trúc MoE giống V3: 1 nghìn tỷ tham số được lưu trữ, nhưng mỗi lần suy luận chỉ kích hoạt 37 tỷ. Chi phí vận hành thực tế gần hơn với mô hình dày đặc 37 tỷ tham số, nhưng khả năng có thể chạm đến mức nghìn tỷ tham số. Giá API sau khi huấn luyện là 0,30 USD/triệu token, rẻ hơn một bậc so với dòng GPT.

Đa phương thức cũng đã được tích hợp: V4 hỗ trợ xử lý gốc văn bản, hình ảnh và tạo video.

Tại sao vấn đề chip Huawei lại quan trọng?

Các mô hình trước đây của DeepSeek, bao gồm V3 và R1, đều được huấn luyện trên NVIDIA A100/H100 (hoặc ít nhất là sử dụng hệ sinh thái CUDA). V4 là lần đầu tiên được xây dựng hoàn toàn dựa trên kiến trúc CANN của Huawei.

Thông số kỹ thuật phần cứng của Ascend 950PR:

  • Sức mạnh tính toán: FP8 1 PFLOPS / FP4 2 PFLOPS
  • Băng thông kết nối: 2 TB/s
  • Quy trình sản xuất: Quy trình N+3 của SMIC (hiệu suất gần mức 5nm)
  • Được tích hợp trên card tăng tốc Atlas 350 của Huawei

Để V4 có thể chạy trên chip này, DeepSeek đã hợp tác với Huawei và Cambricon để viết lại một lượng lớn mã cấp thấp, với mục tiêu hoàn toàn vượt qua hệ sinh thái CUDA của NVIDIA.

Phân tích của TrendForce cho rằng nếu lần này thành công, đường ống phát triển của DeepSeek có thể đạt được sự độc lập thực chất với CUDA trong vòng một đến hai năm.

Alibaba, ByteDance, Tencent đều đang tranh giành chip Huawei

Phản ứng của thị trường rất trực tiếp: Alibaba, ByteDance và Tencent đã đặt hàng tổng cộng hàng trăm nghìn chip Ascend từ Huawei. Nhu cầu tăng vọt, giá chip của Huawei đã tăng khoảng 20%.

Huawei có kế hoạch sản xuất khoảng 600.000 chip Ascend 910C vào năm 2026, gấp đôi so với năm 2025, với tổng công suất Ascend đạt 1,6 triệu chip.

Nghĩ theo cách khác: Nếu DeepSeek V4 chạy tốt trên chip Huawei, các nhà sản xuất AI trong nước sẽ có một con đường thay thế khả thi thực tế – không còn phụ thuộc hoàn toàn vào NVIDIA nữa. Điều này có ý nghĩa lớn hơn đối với toàn bộ chuỗi công nghiệp so với bản thân V4.

Nhưng chip Huawei có thực sự tốt không?

Thành thật mà nói, đây vẫn còn là một ẩn số.

Các con số sức mạnh tính toán lý thuyết của Ascend 950PR có vẻ tốt, nhưng hiệu quả huấn luyện phân tán và suy luận thực tế, so với hệ sinh thái H100 của NVIDIA, vẫn chưa có dữ liệu xác minh trên quy mô lớn. V4-Lite hiện đang được thử nghiệm nội bộ trên các nút API, các nhà phát triển phản hồi rằng tốc độ suy luận đã tăng 30% và khả năng truy xuất ngữ cảnh cũng được cải thiện rõ rệt – nhưng điều này diễn ra trong một môi trường được tối ưu hóa đặc biệt.

Thử thách thực sự là: Sau khi phiên bản chính thức của V4 ra mắt, hiệu suất có ổn định như quảng cáo hay không?

Nếu chạy tốt, đây sẽ là một minh chứng thực sự cho con đường độc lập phần cứng AI của Trung Quốc. Nếu chạy không tốt, điều đó chỉ cho thấy hướng đi độc lập là đúng, nhưng thời gian vẫn chưa đủ.

Dự kiến phiên bản chính thức của V4 sẽ được phát hành vào giữa tháng 4, hãy chờ xem kết quả.

Nguồn tham khảo: CocoLoop, DeepSeek's V4 model will run on Huawei chips, The Information reports (WHBL); Decoding DeepSeek V4: How Huawei's Ascend 950PR Is Powering China's Push to Break CUDA Dependence (TrendForce); DeepSeek V4 points to growing use of Huawei chips in AI models (TechWire Asia); DeepSeek V4 And Tencent's New Hunyuan Model To Launch In April (Dataconomy)