Tháng 8 năm ngoái, DeepSeek đã phát hành V3.1, đây là mô hình lai đầu tiên của họ — kết hợp khả năng của V3 (tổng quát) và R1 (suy luận) vào cùng một mô hình.
Thiết kế kiến trúc
- Tổng tham số: 671B, kích hoạt 37B mỗi token
- Mỗi lớp có 256 chuyên gia, kích hoạt 8 chuyên gia
- Hai chế độ chuyển đổi bằng một nút bấm:
- Think mode (deepseek-reasoner): suy luận nhiều bước + gọi công cụ
- Non-think mode (deepseek-chat): hội thoại hàng ngày, phản hồi nhanh nhẹn
Hai chế độ chia sẻ trọng số chung, ngữ cảnh 128K.
Tại sao "lai" lại tốt?
Hãy nhìn trực tiếp vào điểm số SWE-bench Verified:
- V3.1: 66,0%
- R1-0528: 44,6%
Trên benchmark lập trình, mô hình lai vượt trội so với mô hình suy luận thuần túy. Think mode đạt khoảng 90-95% hiệu suất của R1 trong các tác vụ suy luận chuyên sâu, đồng thời tốc độ phản hồi nhanh hơn.
Về bản chất, V3.1 chứng minh một điều: một mô hình duy nhất có thể xử lý đồng thời cả "hỏi đáp nhanh" và "suy luận sâu" — hai tình huống trước đây cần triển khai riêng biệt.
Chi tiết huấn luyện
Dựa trên V3.1-Base, được huấn luyện thêm 840 tỷ token:
- Giai đoạn 32K: 630 tỷ token
- Giai đoạn mở rộng 128K: 209 tỷ token
Tập trung cải thiện khả năng hiểu ngữ cảnh dài, sử dụng công cụ và quy trình làm việc agent. DeepSeek chính thức định vị V3.1 là "bước đầu tiên hướng tới kỷ nguyên Agent".
Từ góc nhìn sử dụng thực tế, với V3.1, bạn không còn phải đắn đo giữa "dùng mô hình tổng quát hay mô hình suy luận" nữa — cứ đưa cho nó và để nó tự quyết định.
Nguồn tham khảo: CocoLoop, báo cáo của The Decoder, công bố chính thức của DeepSeek