En décembre dernier, DeepSeek a publié V3. Ce qui a le plus déstabilisé la concurrence n'est pas la performance, mais le coût.
Architecture
Le cœur de la conception de V3 est Mixture of Experts :
- Paramètres totaux : 671B
- Paramètres réellement activés par token : 37B
- 256 experts par couche, 8 sélectionnés à chaque fois
C'est comme avoir 256 médecins spécialistes, mais à chaque consultation, seuls les 8 plus pertinents sont sollicités. Beaucoup de paramètres, mais un coût de calcul maîtrisé – c'est l'essence du MoE.
Résultats des benchmarks
- MMLU : 87,1 % (niveau GPT-4o)
- MATH-500 : 90,2 %
- Codeforces : 51,6e percentile
- GPQA Diamond : 59,1 %
Ces résultats placent V3 parmi les meilleurs modèles open source de fin 2025.
5,5 millions de dollars pour entraîner un modèle de pointe
Le coût d'entraînement de V3 est d'environ 5,5 millions de dollars. À la même période, les entreprises américaines dépensaient des centaines de millions de dollars pour entraîner des modèles d'échelle comparable. Ce chiffre a poussé toute l'industrie à réfléchir : DeepSeek est-elle trop économe, ou tout le monde gaspille-t-il trop ?
Les secrets de cette économie incluent :
- L'entraînement en précision mixte FP8, qui réduit de moitié la demande en bande passante mémoire
- L'utilisation stratégique d'instances spot, réduisant le coût de calcul de 70 %
- L'architecture MoE elle-même est un économiseur naturel de ressources de calcul
Pourquoi c'est important
Un mois après la sortie de V3, DeepSeek a publié R1. Ensemble, ces deux modèles démontrent essentiellement une chose : la recherche de pointe en IA ne nécessite pas forcément de brûler des milliards de dollars. Pour le paysage mondial de la concurrence en IA, ce signal est plus important que n'importe quel benchmark pris isolément.
Source de référence : CocoLoop, rapport technique DeepSeek V3, guide technique BentoML