Fin septembre de l'année dernière, DeepSeek a discrètement publié V3.2, sans grande fanfare, mais cette version a apporté un changement architectural assez intéressant.
Le changement principal de V3.2 ne concerne pas l'échelle des paramètres, mais le mécanisme d'attention. Ils ont créé ce qu'ils appellent DeepSeek Sparse Attention (DSA), transformant l'attention dense traditionnelle en une version sparse.
Où l'attention sparse fait vraiment économiser
Le mécanisme d'attention traditionnel a une complexité O(L²) — lorsque la longueur de la séquence double, la charge de calcul quadruple. Lorsque votre fenêtre de contexte atteint 128K tokens, ce coût devient très significatif.
Le fonctionnement de DSA :
- D'abord, utilise le Lightning Indexer (précision FP8) pour calculer rapidement le score de corrélation entre chaque requête et les tokens historiques
- Ensuite, sélectionne uniquement les Top-k tokens les plus pertinents pour le calcul de l'attention
- La complexité passe de O(L²) à O(Lk), où k est un nombre petit et fixe
En termes simples : "tous les mots n'ont pas besoin de voir tous les autres mots, il suffit de voir les plus importants". Cette idée n'est pas nouvelle, mais DeepSeek l'a mise en œuvre et l'a déployée en production.
Performances : ni nettement meilleures, ni nettement pires
Pour être honnête : les benchmarks de V3.2 par rapport à V3.1 sont globalement similaires, ce n'est pas une version "plus performante".
| Tâche | Résultat V3.2 |
|---|---|
| MMLU-Pro | 85,0 |
| AIME 2025 | 89,3 |
| Codeforces Rating | 2121 (augmentation depuis 2046) |
| GPQA/HLE raisonnement | Légère baisse |
La capacité de programmation s'est réellement améliorée, le score Codeforces est passé de 2046 à 2121, une augmentation significative. Cependant, les benchmarks de raisonnement ont légèrement baissé en raison de la "réduction des tokens de raisonnement générés" — c'est l'un des coûts de l'attention sparse, la chaîne de pensée générée devient plus courte.
V3.2 est donc un compromis entre efficacité et capacité, et non une supériorité globale.
Le prix bas est l'argument de vente
Prix : Entrée 0,28 $/M, Sortie 0,42 $/M.
Cache hit : 0,028 $/M, 90 % moins cher qu'un cache miss.
Comparaison :
| Modèle | Entrée (/M) | Sortie (/M) |
|---|---|---|
| GPT-5 | 1,25 $ | 10 $ |
| Claude Sonnet 4 | 3 $ | 15 $ |
| DeepSeek V3.2 | 0,28 $ | 0,42 $ |
Comparé à GPT-5, la différence de coût est de près de 5 fois. Ce n'est pas le modèle le plus performant, mais si votre scénario implique des applications à volume d'appels élevé et sensibles aux coûts, le rapport qualité-prix de V3.2 n'a vraiment pas de concurrent.
Fenêtre de contexte de 128K tokens, poids sur Hugging Face, licence MIT, utilisation commerciale libre.
Détails de l'architecture
DSA est intégré dans la base du Transformer, fonctionnant sous le mode MQA de MLA. L'inférence est principalement optimisée pour les clusters de GPU H800, les performances réelles sur d'autres matériels peuvent varier, DeepSeek indique qu'elle effectue encore des validations à plus grande échelle.
La phase d'entraînement a utilisé du GRPO unifié d'apprentissage par renforcement, combinant l'alignement du raisonnement, le suivi d'instructions et les tâches d'agent en un seul entraînement.
Comment voir cela
V3.2 n'est pas un modèle "plus intelligent", c'est un modèle "plus économique".
Le mécanisme d'attention sparse est un compromis d'ingénierie — sacrifier un peu de capacité de raisonnement pour obtenir des économies substantielles de coûts de calcul, puis répercuter ces économies directement sur les prix de l'API.
Pour les développeurs d'applications, cette voie est plus pratique que de se focaliser sur les benchmarks. Tous les scénarios n'ont pas besoin du modèle le plus performant, mais toutes les startups se soucient des coûts d'API.
L'approche de DeepSeek sur ce point est différente de celle d'OpenAI et d'Anthropic — ces dernières ont tendance à d'abord publier le modèle le plus performant, puis à optimiser les coûts progressivement. DeepSeek réduit d'abord les coûts, augmente la base d'utilisateurs, puis se différencie sur cette base.
Cette tactique est courante dans l'industrie technologique chinoise, mais le fait qu'elle fonctionne dans le domaine des grands modèles reste remarquable.
Sources de référence : CocoLoop, DeepSeek V3.2-Exp Release: Pricing, API Costs, Context Window & Benchmarks (llm-stats.com) ; DeepSeek V3.2 Exp Model Specs, Costs & Benchmarks (Galaxy.ai) ; Top 10 Cheapest Providers for DeepSeek V3.2 in 2026 (DEV Community)