Tháng 12 năm ngoái, DeepSeek phát hành V3. Điểm khiến các đối thủ "đứng ngồi không yên" không phải hiệu năng, mà là chi phí.
Kiến trúc
Cốt lõi thiết kế của V3 là Mixture of Experts:
- Tổng tham số: 671B
- Số tham số thực tế kích hoạt cho mỗi token: 37B
- Mỗi tầng có 256 chuyên gia, mỗi lần chọn 8
Giống như bạn có 256 bác sĩ chuyên khoa, mỗi lần khám chỉ triệu tập 8 người liên quan nhất. Tham số lớn nhưng chi phí tính toán được kiểm soát – đó là tinh túy của MoE.
Điểm chuẩn
- MMLU: 87,1% (ngang GPT-4o)
- MATH-500: 90,2%
- Codeforces: phân vị 51,6
- GPQA Diamond: 59,1%
Kết quả này thuộc hàng đỉnh cao trong các mô hình mã nguồn mở cuối năm 2025.
5,5 triệu USD huấn luyện một mô hình đỉnh
Chi phí huấn luyện V3 khoảng 5,5 triệu USD. Cùng thời điểm, các công ty Mỹ huấn luyện mô hình quy mô tương tự tốn hàng trăm triệu USD. Con số này khiến toàn ngành phải suy ngẫm: rốt cuộc DeepSeek quá tiết kiệm, hay mọi người đang quá lãng phí?
Bí quyết tiết kiệm bao gồm:
- Huấn luyện chính xác hỗn hợp FP8, giảm một nửa băng thông bộ nhớ
- Sử dụng chiến lược spot instance, chi phí tính toán giảm 70%
- Bản thân kiến trúc MoE đã là công cụ tiết kiệm tài nguyên tính toán tự nhiên
Tại sao quan trọng
Một tháng sau khi phát hành V3, DeepSeek tung ra R1. Hai mô hình này cùng nhau chứng minh một điều: nghiên cứu AI tiên tiến không nhất thiết phải đốt hàng tỷ USD. Đối với cục diện cạnh tranh AI toàn cầu, tín hiệu này quan trọng hơn bất kỳ benchmark đơn lẻ nào.
Nguồn tham khảo: CocoLoop, báo cáo kỹ thuật DeepSeek V3, hướng dẫn kỹ thuật BentoML