Analyse des coûts d'entraînement des grands modèles de DeepSeek

DeepSeek est devenu une légende du secteur en matière de contrôle des coûts :

  • V3 coût d'entraînement : environ 5,5 millions de dollars
  • R1 frais d'utilisation GPU : environ 294 000 dollars

Dans le même temps, les budgets des entreprises américaines pour entraîner des modèles d'échelle similaire se situaient entre 100 millions et 1 milliard de dollars. Un écart d'au moins un ordre de grandeur.

Astuces d'économie

1. Entraînement en précision mixte FP8

En réduisant la précision d'entraînement de FP32/FP16 à FP8, la demande en bande passante mémoire est réduite de moitié. La plupart des goulots d'étranglement de calcul se situent au niveau de la bande passante mémoire, et cette réduction est très ciblée.

2. Utilisation stratégique des instances Spot

Le coût de calcul est réduit de 70 %. Les instances Spot peuvent être récupérées à tout moment, mais le framework d'entraînement de DeepSeek dispose de suffisamment de points de contrôle et de mécanismes de tolérance aux pannes pour gérer ce problème.

3. L'architecture MoE économise naturellement la puissance de calcul

Le modèle de 671B paramètres n'active que 37B à chaque inférence. Le nombre de paramètres garantit la capacité et les performances, tandis que l'activation éparse maintient les coûts sous contrôle.

Nouvelle technologie : mHC

En janvier dernier, DeepSeek a dévoilé une nouvelle méthode — Manifold-Constrained Hyper-Connections (mHC), dont l'article principal est co-signé par le fondateur Liang Wenfeng.

Cette méthode crée de multiples flux d'information au sein du modèle, chaque étape de mélange étant soumise à des contraintes mathématiques strictes garantissant la conservation de la quantité totale d'information. Les résultats des tests montrent que, sur des échelles de paramètres de 3B à 27B, mHC permet un entraînement stable, tandis que la version sans contraintes est souvent instable. Le coût d'entraînement n'augmente que de 6 à 7 %, ce qui est presque négligeable pour les grands modèles.

Certains analystes qualifient l'article sur mHC de "percée étonnante", qui pourrait devenir la technologie de base de la prochaine génération de modèles phares de DeepSeek.

Le PDG d'OpenAI lui-même a reconnu que le coût d'exploitation du R1 de DeepSeek est 20 à 50 fois moins cher que le modèle équivalent d'OpenAI.

Source de référence : CocoLoop, rapport de Computerworld, analyse du South China Morning Post