Tencent Hunyuan a publié AngelSpec le 29 juillet en open source. Le projet vise la couche d'inférence des grands modèles, via l'entraînement de drafters pour speculative decoding.
Ce qui est publié
First Financial confirme que les poids et le code d'entraînement des drafters MTP et DFly pour Hy3-A21B sont aussi disponibles. Le dépôt GitHub présente AngelSpec v0.1.0 comme compatible avec MTP et block-parallel speculative decoding training.
Le rapport technique indique : “We release the AngelSpec framework to support training and extending these speculative-decoding methods.” Autrement dit, le drafter devient un composant que l'on peut entraîner, configurer et évaluer.
Des chiffres cadrés
Sur Hy3-A21B, DFly augmenterait l'average accepted length d'environ 30%, atteindrait le meilleur throughput moyen entre concurrency 4 et 64, et offrirait une accélération end-to-end de 1,98 à 2,40x face au décodage autorégressif. Face à DFlash, le throughput progresserait de 10,5% à 11,8%.
Le benchmark GitHub précise que le throughput offline utilise HY3-295B-A21B, TP=8, temperature 1 et trois fenêtres de 120 secondes par cellule. La charge live D-cut est indiquée en 8x H20, concurrency 2-64.
Pourquoi cela compte
Pour les Agents, le code et les longs contextes, la latence, l'usage GPU et le comportement en charge pèsent directement sur le coût. Si les gains sont reproduits, la compétition chinoise des modèles se déplacera vers l'ingénierie d'inférence.
Sources : First Financial, Tencent AngelSpec GitHub, arXiv:2607.25852, CocoLoop, Hugging Face ; vérification du périmètre publié, throughput offline Hy3-A21B TP=8, charge live 8x H20, concurrency 4-64, poids drafter et licence Apache 2.0.