DeepSeek V4 chỉ phát hành một bản preview.
Nhiều người đã không để ý đến điều này. Vào ngày 24 tháng 4, DeepSeek công bố V4 Flash và V4 Pro, nhưng cả hai đều là phiên bản xem trước. Phiên bản chính thức sẽ phải chờ đến nửa cuối năm – và không phải vì mô hình chưa sẵn sàng, mà vì chip của Huawei chưa được sản xuất hàng loạt.
Ngày 26 tháng 4, Bloomberg dẫn nguồn từ tài khoản "Yuyuantantian" trực thuộc CCTV đã tiết lộ nội tình, làm rõ những gì DeepSeek đã làm trong vài tháng qua.
Không phải mô hình chậm, mà là chip chưa đến
Nhóm DeepSeek trong vài tháng qua không tung ra nhiều tính năng mới, mà đang chuyển toàn bộ hệ thống huấn luyện từ NVIDIA sang Huawei Ascend.
Việc này khó hơn nhiều so với việc phát hành một mô hình mới. Hệ sinh thái CUDA đã bám rễ sâu trong giới AI suốt hơn một thập kỷ. Để chuyển quy trình huấn luyện của một mô hình nghìn tỷ tham số từ CUDA sang CANN (Compute Architecture for Neural Networks) của Huawei, cần phải viết lại:
- Thư viện toán tử (matmul, attention, layernorm và hàng trăm kernel khác)
- Điều phối phân tán (thay NCCL bằng HCCL)
- Huấn luyện hỗn hợp độ chính xác (hành vi của FP8, BF16 trên chip mới)
- Checkpointing và khả năng chịu lỗi
Công việc chuyển đổi này không thể hoàn thành trong nửa năm. DeepSeek đã làm xong, nhưng phần cứng vẫn đang chờ.
Ascend 950PR là gì và tại sao phải chờ nó?
DeepSeek thẳng thắn thừa nhận: V4 trong nửa đầu năm 2026 gặp "vấn đề về thông lượng" – nghĩa là mô hình có thể chạy, nhưng không đủ nhanh và ổn định.
Thứ họ chờ là các supernode Ascend 950PR của Huawei được sản xuất hàng loạt với quy mô lớn. 950PR và 950DT là thế hệ chip AI tiếp theo của Huawei sẽ được xuất xưởng vào cuối năm nay, với kiến trúc SuperNode – kết nối nhiều chip bằng liên kết tốc độ cao thành một siêu nút, hiệu suất ngang tầm với NVIDIA NVLink.
Chỉ khi 950PR được triển khai quy mô lớn, DeepSeek V4 bản chính thức mới có thể chạy suy luận toàn phần. Vì vậy, các bản preview V4 Flash và V4 Pro hiện tại về bản chất là hoạt động tiếp thị sản phẩm cho 950PR – trước tiên kể câu chuyện về năng lực mô hình, chờ đến nửa cuối năm khi phần cứng sẵn sàng, ngay lập tức tung bản chính thức ra thị trường.
Phía Huawei cũng đưa ra cam kết tương ứng: toàn bộ dòng sản phẩm Ascend SuperNode đã "tương thích hoàn toàn" với DeepSeek V4, hiệu suất suy luận "cải thiện đáng kể". Bộ phần mềm CANN đã được tối ưu riêng cho V4 trong vài tháng qua. Sự phối hợp giữa hai bên rất chặt chẽ.
"Câu chuyện hai đường ray" của AI Trung Quốc, lần đầu tiên được phơi bày
Điều thú vị nhất ở đây không phải là chi tiết kỹ thuật, mà là câu chuyện.
Trong nửa năm qua, giới AI Trung Quốc có một "hai đường ray" ngầm hiểu:
- Bên ngoài: Các mô hình nguồn mở cạnh tranh về giá, về benchmark, nhấn mạnh tính "độc lập"
- Bên trong: Tài nguyên phần cứng và huấn luyện thực tế vẫn chạy trên NVIDIA
Lần này, DeepSeek đã hợp nhất hai đường ray. Họ gắn chặt hoàn toàn lịch trình phát hành V4 vào năng lực sản xuất chip của Huawei. Đây là điều chưa từng có công ty AI Trung Quốc nào dám làm trước đây – rủi ro hiện hữu:
- Nếu Huawei 950PR bị trì hoãn sản xuất hàng loạt, DeepSeek V4 bản chính thức cũng bị đẩy lùi theo
- Nếu hiệu suất của Ascend không như kỳ vọng, DeepSeek phải chịu hậu quả về danh tiếng "mô hình chạy không nổi"
- Nếu khách hàng muốn dùng bản chính thức V4, họ phải chấp nhận "ràng buộc chip"
Nhưng lợi ích cũng rõ ràng: AI Trung Quốc từ nay có vòng khép kín huấn luyện-suy luận-triển khai hoàn chỉnh không phụ thuộc vào NVIDIA.
Hai mặt của một tấm gương
Câu chuyện này và thương vụ Anthropic ký kết 40 tỷ USD với Google, giống như hai mặt của một tấm gương.
Chủ quyền tính toán, các bên trên toàn cầu đang dùng những cách khác nhau để giành giật – các công ty Mỹ dựa vào xây dựng trung tâm dữ liệu đám mây, ký hợp đồng dài hạn; các công ty Trung Quốc dựa vào gắn kết chip nội địa, điều chỉnh lịch trình phát hành theo đường cong sản xuất. Cuối cùng, tất cả đều muốn đưa "tôi có thể chạy bao nhiêu token trong nửa cuối năm" vào bảng cân đối kế toán.
Việc tài khoản trực thuộc CCTV lần này chủ động tiết lộ nội tình cũng khéo léo về mặt thời điểm. Nửa cuối năm chưa đến, nhưng kỳ vọng thị trường đã được định hình trước – nếu chip Huawei được sản xuất hàng loạt thuận lợi, DeepSeek V4 trở thành sản phẩm tiêu chuẩn; nếu không thuận lợi, toàn bộ câu chuyện AI nội địa Trung Quốc sẽ bị giảm giá.
Ván cược đã mở. Nửa cuối năm sẽ có kết quả.
Nguồn tham khảo: DeepSeek V4 Launch Postponed as Company Prioritizes Domestic Chip Integration (Bloomberg); CocoLoop, Huawei, DeepSeek strengthen China's AI self-reliance with collaboration on V4 model (South China Morning Post); DeepSeek delays V4 launch to tune for Huawei Ascend chips (Newsbytes)