En août dernier, DeepSeek a publié V3.1, son premier modèle hybride — qui intègre les capacités de V3 (général) et R1 (raisonnement) dans un seul modèle.
Conception architecturale
- Paramètres totaux : 671B, activation de 37B par token
- 256 experts par couche, activation de 8
- Deux modes commutables en un clic :
- Think mode (deepseek-reasoner) : raisonnement en plusieurs étapes + appel d'outils
- Non-think mode (deepseek-chat) : conversation quotidienne, réponses légères et rapides
Les deux modes partagent les poids, contexte de 128K.
Pourquoi "hybride" est-il meilleur ?
Regardons directement les scores SWE-bench Verified :
- V3.1 : 66,0 %
- R1-0528 : 44,6 %
Sur le benchmark de programmation, le modèle hybride surpasse le modèle de raisonnement pur. Le Think mode atteint environ 90-95 % du niveau de R1 sur les tâches intensives en raisonnement, avec une vitesse de réponse plus rapide.
Essentiellement, V3.1 prouve une chose : un seul modèle peut gérer à la fois les "questions-réponses rapides" et le "raisonnement approfondi" — deux scénarios qui nécessitaient auparavant un déploiement séparé.
Détails de l'entraînement
Basé sur V3.1-Base, 840 milliards de tokens supplémentaires ont été entraînés :
- Phase 32K : 630 milliards de tokens
- Phase d'extension 128K : 209 milliards de tokens
L'accent a été mis sur l'amélioration de la compréhension du contexte long, de l'utilisation d'outils et des workflows d'agent. DeepSeek positionne officiellement V3.1 comme "le premier pas vers l'ère des Agents".
D'un point de vue pratique, avec V3.1, il n'est plus nécessaire de choisir entre "utiliser un modèle général ou un modèle de raisonnement" — il suffit de lui confier la tâche et de le laisser décider.
Source de référence : CocoLoop, reportage de The Decoder, publication officielle de DeepSeek