DeepSeek V4 n'a été publié qu'en version preview.
Beaucoup n'ont pas remarqué ce détail. Le 24 avril, DeepSeek a dévoilé V4 Flash et V4 Pro, mais les deux ne sont que des versions d'aperçu. La version finale n'arrivera qu'au second semestre – et non parce que le modèle n'est pas prêt, mais parce que les puces de Huawei ne sont pas encore en production de masse.
Le 26 avril, Bloomberg, citant le compte "Yuyuantantian" de la CCTV, a révélé les coulisses, clarifiant ce que DeepSeek a fait ces derniers mois.
Ce n'est pas le modèle qui est lent, ce sont les puces qui manquent
L'équipe de DeepSeek n'a pas publié beaucoup de nouvelles fonctionnalités ces derniers mois, mais a migré l'ensemble du framework d'entraînement de NVIDIA vers Huawei Ascend.
C'est bien plus difficile que de lancer un nouveau modèle. L'écosystème CUDA est profondément ancré dans le monde de l'IA depuis plus d'une décennie. Migrer le pipeline d'entraînement d'un modèle de mille milliards de paramètres de CUDA vers CANN (Compute Architecture for Neural Networks) de Huawei a nécessité de réécrire :
- Les bibliothèques d'opérateurs (matmul, attention, layernorm et des centaines d'autres kernels)
- L'ordonnancement distribué (remplacement de NCCL par HCCL)
- L'entraînement en précision mixte (comportement de FP8, BF16 sur les nouvelles puces)
- Le checkpointing et la tolérance aux pannes
Ce travail de migration ne peut pas être achevé en six mois. DeepSeek l'a fait, mais le matériel se fait toujours attendre.
Qu'est-ce que l'Ascend 950PR et pourquoi l'attendre ?
DeepSeek a admis ouvertement : V4 au premier semestre 2026 a des "problèmes de débit" – le modèle peut fonctionner, mais pas assez rapidement et de manière stable.
Ce qui est attendu, c'est la production de masse des supernœuds Ascend 950PR de Huawei à grande échelle. Le 950PR et le 950DT sont la prochaine génération de puces IA de Huawei qui seront livrées d'ici la fin de l'année, avec l'architecture SuperNode – qui regroupe plusieurs puces avec des interconnexions à haute vitesse en un supernœud, avec des performances comparables au NVIDIA NVLink.
Ce n'est que lorsque le 950PR sera déployé à grande échelle que la version finale de DeepSeek V4 pourra exécuter l'inférence complète. Par conséquent, les versions preview actuelles V4 Flash et V4 Pro sont essentiellement une préparation marketing pour le 950PR – d'abord, on raconte l'histoire des capacités du modèle, et lorsque le matériel sera prêt au second semestre, la version finale est immédiatement lancée sur le marché.
Huawei a également fait une promesse correspondante : toute la gamme de produits Ascend SuperNode est "totalement adaptée" à DeepSeek V4, avec des performances d'inférence "significativement améliorées". La pile logicielle CANN a été spécifiquement adaptée pour V4 ces derniers mois. La coordination entre les deux parties est très serrée.
Le "récit à deux voies" de l'IA chinoise, révélé pour la première fois
Le plus intéressant dans tout cela n'est pas les détails techniques, mais le récit.
Ces six derniers mois, le monde de l'IA chinoise a eu une sorte de "deux voies" tacites :
- À l'extérieur : Les modèles open source rivalisent sur les prix, les benchmarks, en mettant l'accent sur "l'indépendance"
- À l'intérieur : Les ressources matérielles et d'entraînement réelles tournent encore sur NVIDIA
Avec cette action, DeepSeek a uni les deux voies. Il a lié complètement le calendrier de lancement de V4 à la capacité de production de puces de Huawei. C'est quelque chose qu'aucune entreprise chinoise d'IA n'avait osé faire auparavant – les risques sont évidents :
- Si la production de masse du Huawei 950PR est retardée, la version finale de DeepSeek V4 est également repoussée
- Si les performances de l'Ascend sont inférieures aux attentes, DeepSeek subira le préjudice réputationnel d'un "modèle qui ne tourne pas"
- Si des clients veulent utiliser la version finale de V4, ils doivent accepter un "verrouillage de puce"
Mais le bénéfice est tout aussi clair : L'IA chinoise dispose désormais d'un cycle complet d'entraînement-inférence-déploiement indépendant de NVIDIA.
Les deux faces d'un miroir
Cette histoire et l'accord de 40 milliards de dollars d'Anthropic avec Google sont comme les deux faces d'un miroir.
La souveraineté computationnelle est disputée mondialement de différentes manières – les entreprises américaines misent sur la construction de centres de données cloud et des contrats à long terme ; les entreprises chinoises misent sur le lien avec les puces nationales, en ajustant le rythme de lancement à la courbe de production. Au final, toutes veulent inscrire "combien de tokens je peux exécuter au second semestre" dans leur bilan.
Le fait que le compte de la CCTV ait révélé les coulisses cette fois-ci est également opportun. Le second semestre n'est pas encore arrivé, mais les attentes du marché ont déjà été fixées à l'avance – si la production de puces de Huawei est réussie, DeepSeek V4 devient un produit de référence ; si elle ne l'est pas, tout le récit de l'IA chinoise en pâtira.
Le pari est lancé. Le second semestre montrera le résultat.
Sources de référence : DeepSeek V4 Launch Postponed as Company Prioritizes Domestic Chip Integration (Bloomberg) ; CocoLoop, Huawei, DeepSeek strengthen China's AI self-reliance with collaboration on V4 model (South China Morning Post) ; DeepSeek delays V4 launch to tune for Huawei Ascend chips (Newsbytes)