Cuối tháng 9 năm ngoái, DeepSeek âm thầm phát hành V3.2 mà không có nhiều công bố rầm rộ, nhưng phiên bản này mang một thay đổi kiến trúc khá thú vị.
Thay đổi cốt lõi của V3.2 không nằm ở quy mô tham số, mà là cơ chế chú ý. Họ đã tạo ra một thứ gọi là DeepSeek Sparse Attention (DSA), chuyển đổi cơ chế chú ý dày đặc truyền thống thành phiên bản thưa.
Chú ý thưa tiết kiệm ở đâu
Cơ chế chú ý truyền thống có độ phức tạp O(L²) — khi độ dài chuỗi tăng gấp đôi, khối lượng tính toán tăng gấp bốn. Khi cửa sổ ngữ cảnh của bạn kéo dài đến 128K token, chi phí này trở nên rất đáng kể.
Cách thức hoạt động của DSA:
- Đầu tiên, sử dụng Lightning Indexer (độ chính xác FP8) để tính nhanh điểm số tương quan giữa mỗi query và các token trong lịch sử
- Sau đó chỉ chọn Top-k token có liên quan nhất để thực hiện tính toán chú ý
- Độ phức tạp giảm từ O(L²) xuống O(Lk), với k là một số nhỏ cố định
Nói một cách đơn giản, "không phải mọi từ đều cần nhìn tất cả các từ khác, chỉ cần nhìn những từ quan trọng nhất là đủ". Ý tưởng này không mới, nhưng DeepSeek đã hiện thực hóa nó và đưa vào sản xuất.
Hiệu suất: Không tăng đáng kể, cũng không giảm đáng kể
Phải nói thật: benchmark của V3.2 so với V3.1 nhìn chung tương đương, đây không phải là bản phát hành "mạnh hơn".
| Nhiệm vụ | Kết quả V3.2 |
|---|---|
| MMLU-Pro | 85,0 |
| AIME 2025 | 89,3 |
| Codeforces Rating | 2121 (tăng từ 2046) |
| GPQA/HLE suy luận | Giảm nhẹ |
Khả năng lập trình thực sự được cải thiện, điểm Codeforces tăng từ 2046 lên 2121, một mức tăng đáng kể. Tuy nhiên, benchmark suy luận giảm nhẹ do "số lượng token suy luận được tạo ra giảm" — đây là một trong những cái giá của chú ý thưa, chuỗi suy nghĩ được tạo ra ngắn hơn.
Vì vậy, V3.2 là một sự đánh đổi giữa hiệu quả và khả năng, chứ không phải là một sự vượt trội toàn diện.
Giá rẻ mới là điểm bán hàng
Giá: Đầu vào $0,28/M, Đầu ra $0,42/M.
Cache hit: $0,028/M, rẻ hơn 90% so với cache miss.
So sánh ngang hàng:
| Mô hình | Đầu vào (/M) | Đầu ra (/M) |
|---|---|---|
| GPT-5 | $1,25 | $10 |
| Claude Sonnet 4 | $3 | $15 |
| DeepSeek V3.2 | $0,28 | $0,42 |
So với GPT-5, chênh lệch chi phí gần 5 lần. Đây không phải là mô hình mạnh nhất về hiệu suất, nhưng nếu kịch bản của bạn là các ứng dụng gọi API số lượng lớn và nhạy cảm về chi phí, thì tỷ lệ giá/hiệu năng của V3.2 thực sự không có đối thủ.
Cửa sổ ngữ cảnh 128K token, trọng số trên Hugging Face, giấy phép MIT, tự do thương mại.
Chi tiết kiến trúc
DSA được nhúng trong nền tảng Transformer, chạy dưới chế độ MQA của MLA. Suy luận chủ yếu được tối ưu hóa cho cụm GPU H800, hiệu suất thực tế trên các phần cứng khác có thể khác biệt, DeepSeek cho biết đang tiến hành xác thực trên phạm vi rộng hơn.
Giai đoạn huấn luyện sử dụng GRPO học tăng cường thống nhất, kết hợp căn chỉnh suy luận, tuân theo hướng dẫn và nhiệm vụ agent vào một quy trình huấn luyện duy nhất.
Cách nhìn nhận vấn đề này
V3.2 không phải là mô hình "thông minh hơn", mà là mô hình "tiết kiệm hơn".
Cơ chế chú ý thưa là một sự đánh đổi về mặt kỹ thuật — hy sinh một chút khả năng suy luận để đổi lấy việc tiết kiệm đáng kể chi phí tính toán, và sau đó phản ánh trực tiếp sự tiết kiệm này vào giá API.
Đối với các nhà phát triển ứng dụng, hướng đi này thiết thực hơn việc chạy đua benchmark. Không phải mọi kịch bản đều cần mô hình mạnh nhất, nhưng mọi startup đều quan tâm đến chi phí API.
Cách tiếp cận của DeepSeek trong vấn đề này khác với OpenAI và Anthropic — những công ty sau có xu hướng phát hành mô hình mạnh nhất trước, sau đó từ từ tối ưu hóa chi phí. DeepSeek thì hạ chi phí xuống trước, kéo lượng người dùng lên, sau đó tạo sự khác biệt trên cơ sở đó.
Chiến thuật này đã quen thuộc trong ngành công nghệ Trung Quốc, nhưng việc nó có thể thành công trong lĩnh vực mô hình lớn vẫn là điều đáng chú ý.
Nguồn tham khảo: CocoLoop, DeepSeek V3.2-Exp Release: Pricing, API Costs, Context Window & Benchmarks (llm-stats.com); DeepSeek V3.2 Exp Model Specs, Costs & Benchmarks (Galaxy.ai); Top 10 Cheapest Providers for DeepSeek V3.2 in 2026 (DEV Community)