Le 28 août, Tencent a publié et rendu open source Hunyuan Hy4 preview, doté de 770 milliards de paramètres au total, dont 49 milliards activés par token, avec une fenêtre de contexte native de 1 048 576 tokens. Les poids du modèle sont disponibles sous licence Apache 2.0 sur Hugging Face, ModelScope et GitCode, et le modèle est également accessible via TokenHub de Tencent Cloud, OpenRouter, ainsi que les propres produits de Tencent, WorkBuddy/CodeBuddy, Yuanbao et ima. Tencent le positionne comme « une version précoce de l'itération Hy4 », avec un discours officiel affirmant qu'il se situe « fermement dans le premier peloton des modèles open source ».
D'après la fiche du modèle, Hy4 preview est un MoE typiquement très épars : sur 78 couches, une seule est une couche FFN dense, les 77 autres passant par un routage d'experts, avec 256 experts routés plus 1 expert partagé par couche, chaque token sélectionnant 8 experts routés. La largeur de la couche cachée est de 6144, le vocabulaire compte 120 832 éléments. La partie attention utilise une attention éparse à portes (gated sparse attention) avec IndexCache, compressant les requêtes à 2048 dimensions et les paires clé-valeur à 512, combinée à 4 flux résiduels iHC. Côté déploiement, vLLM et SGLang sont pris en charge, avec le décodage spéculatif MTP activé par défaut.
Derrière le taux d'activation de 6,4 %, un calcul de puissance de calcul
49 milliards divisés par 770 milliards donnent un taux d'activation d'environ 6,4 %. Ce chiffre est la clé pour comprendre toute la tarification du modèle : le nombre total de paramètres détermine le coût en mémoire et en chargement, tandis que le volume activé détermine le calcul réel par token. Tencent a creusé un écart de plus de 15 fois entre les deux, pour obtenir une grille tarifaire somme toute raisonnable : entrée à 6 yuans par million de tokens (environ 0,834 dollar), sortie à 18 yuans (environ 2,501 dollars), et 0,3 yuan en cas de cache hit.
Ce niveau de prix se situe dans la moyenne au sein du camp open source chinois. GLM-5.3-Flash, publié la même semaine, affiche un prix d'entrée aussi bas que 0,075 dollar par million de tokens, soit onze fois moins que Hy4 preview, mais il s'agit d'une version légère avec seulement 18 milliards de paramètres activés ; Hy4 preview vise des tâches plus lourdes, comme la lecture de code sur plusieurs fichiers ou l'analyse croisée de documents. Les deux modèles ne jouent pas dans la même catégorie, comparer leurs prix directement n'a donc guère de sens.
La véritable variable de coût se cache dans le contexte d'un million de tokens. Remplir intégralement une entrée avec un million de tokens coûte, au prix catalogue, environ 6 yuans, et redescend à 0,3 yuan après un cache hit — le prix en cache ne représente qu'un vingtième du prix d'origine. Cette remise dit essentiellement aux développeurs : traitez le contexte long comme un espace de travail permanent, plutôt que de le retransmettre à chaque fois.
Comment lire ces 0,07 point d'écart
Le résultat du test à l'aveugle publié par Tencent : 163 experts internes ont évalué 203 tâches d'ingénierie. Hy4 preview obtient une moyenne de 2,99 points (sur 4), GLM-5.3 atteint 2,92 et Kimi K3, 2,94.
L'écart de points est faible, mais la répartition des victoires et défaites est plus parlante. Face à GLM-5.3, Hy4 preview gagne 46,8 %, fait match nul 12,8 % et perd 40,4 % ; face à Kimi K3, il gagne 51,2 %, fait match nul 7,9 % et perd 40,9 %. Le taux de défaite tourne autour de 40 % dans les deux confrontations, ce qui signifie que sur près de la moitié des tâches concrètes, l'adversaire a fait mieux. Les trois modèles sont très proches, aucun ne se détache nettement.
Deux réserves ne peuvent être passées sous silence : les juges sont des experts internes de Tencent, et le jeu de tâches a lui aussi été choisi par Tencent — ce type de test à l'aveugle auto-organisé comporte naturellement un avantage du terrain. Avec un échantillon de 203 tâches, un écart de 0,05 à 0,07 point n'a qu'une portée statistique assez limitée.
Les benchmarks publics permettent une comparaison plus fiable : SWE-bench Multilingual 82,9, SWE-bench Pro 65,7, Terminal-Bench 2.1 atteint 85,4, GPQA Diamond 92,3, HLE avec outils 55,4. SWE-bench Pro reste la catégorie où tous les modèles perdent le plus de points, et 65,7 se situe actuellement dans le peloton de tête des modèles open source.
Le pari des tâches longues
Tencent affiche sans détour l'axe principal du modèle : ingénierie logicielle de longue haleine, analyse bureautique multi-fichiers, développement de jeux vidéo et recherche scientifique. Le modèle propose deux modes de raisonnement, high et no_think — le premier pour les scénarios nécessitant de longues chaînes de raisonnement, le second pour économiser des tokens.
Un exemple présenté par l'entreprise comme vitrine est le problème tridimensionnel de Blaschke-Lebesgue : le modèle a fait passer la borne inférieure du volume de 0,380799 à 0,41104, soit environ 2 % de moins que la conjecture du tétraèdre de Meissner, à 0,41986. La force de conviction de ce genre d'exemple reste limitée, car il s'agit d'une démonstration soigneusement choisie, mais la direction est claire : Tencent veut faire entrer Hy4 preview dans les flux de travail de recherche, pas seulement le laisser dans une fenêtre de chat.
Pour les développeurs chinois, l'impact concret est d'avoir une option supplémentaire. GLM-5.3, Kimi K3 et DeepSeek-V4-Pro occupent déjà largement le terrain du contexte long en open source ; Hy4 preview s'y fraie un chemin grâce à la licence permissive Apache 2.0 et au service d'inférence tout prêt de Tencent Cloud. Ce point sur la licence est particulièrement décisif — nombre de modèles open source chinois assortissent leur diffusion de clauses restreignant l'usage commercial, alors qu'Apache 2.0 permet aux entreprises de modifier, déployer et revendre directement le modèle, sans négocier de licence à part.
En définitive, une preview reste une preview. Tencent n'a donné aucun calendrier pour la version officielle de Hy4, ni précisé quel écart séparera cette préversion de la version finale.
Sources: blog technique de Tencent Hunyuan, fiche modèle Hugging Face, ITHome, CocoLoop, DataLearner ; les paramètres du modèle, la méthodologie du test à l'aveugle et les prix de l'API ont été vérifiés à partir de la fiche modèle officielle et de la page tarifaire, la conversion des prix étant une estimation approximative basée sur le prix catalogue.