DeepSeek trong việc kiểm soát chi phí đã trở thành huyền thoại trong ngành:
- V3 chi phí huấn luyện: khoảng 5,5 triệu USD
- R1 phí sử dụng GPU: khoảng 294.000 USD
Trong cùng thời kỳ, ngân sách của các công ty Mỹ để huấn luyện mô hình quy mô tương tự là từ 100 triệu đến 1 tỷ USD. Chênh lệch ít nhất một bậc.
Bí quyết tiết kiệm
1. Huấn luyện hỗn hợp độ chính xác FP8
Giảm độ chính xác huấn luyện từ FP32/FP16 xuống FP8, nhu cầu băng thông bộ nhớ giảm một nửa. Hầu hết các nút thắt về sức mạnh tính toán đều nằm ở băng thông bộ nhớ, và biện pháp này rất chính xác.
2. Sử dụng chiến lược Spot Instance
Chi phí tính toán giảm 70%. Spot Instance có thể bị thu hồi bất cứ lúc nào, nhưng khung huấn luyện của DeepSeek đã có đủ checkpoint và thiết kế chịu lỗi để xử lý vấn đề này.
3. Kiến trúc MoE tiết kiệm sức mạnh tính toán tự nhiên
Mô hình 671B tham số, mỗi lần suy luận chỉ kích hoạt 37B. Số lượng tham số đảm bảo dung lượng và khả năng, kích hoạt thưa thớt đảm bảo chi phí được kiểm soát.
Công nghệ mới: mHC
Tháng 1 năm nay, DeepSeek lại công bố một phương pháp mới — Manifold-Constrained Hyper-Connections (mHC), bài báo chính do người sáng lập Lương Văn Phong đồng ký tên.
Phương pháp này thực hiện: tạo nhiều luồng thông tin bên trong mô hình, mỗi bước hỗn hợp đều có ràng buộc toán học nghiêm ngặt để đảm bảo tổng lượng thông tin được bảo toàn. Kết quả thử nghiệm cho thấy, trên quy mô tham số từ 3B đến 27B, mHC đều có thể huấn luyện ổn định, trong khi phiên bản không có ràng buộc thường không ổn định. Chi phí huấn luyện chỉ tăng 6-7%, gần như không đáng kể đối với mô hình lớn.
Có nhà phân tích cho rằng bài báo mHC là "bước đột phá đáng kinh ngạc", và có thể trở thành công nghệ nền tảng cho mô hình chủ lực thế hệ tiếp theo của DeepSeek.
Chính CEO của OpenAI đã thừa nhận: chi phí vận hành R1 của DeepSeek rẻ hơn 20 đến 50 lần so với mô hình cùng cấp của OpenAI.
Nguồn tham khảo: CocoLoop, báo cáo của Computerworld, phân tích của South China Morning Post