Tencent Hunyuan hat AngelSpec am 29. Juli als Open-Source-Projekt veröffentlicht. Das Framework trainiert Drafter für speculative decoding und zielt auf die Inferenzschicht großer Modelle.
Umfang der Veröffentlichung
First Financial bestätigte, dass auch MTP- und DFly-Draftergewichte sowie Trainingscode für Hy3-A21B veröffentlicht wurden. Das GitHub-Repository beschreibt AngelSpec v0.1.0 als Framework für MTP und block-parallel speculative decoding training.
Der technische Bericht formuliert: “We release the AngelSpec framework to support training and extending these speculative-decoding methods.” Damit wird der Drafter zu einer trainierbaren und messbaren Systemkomponente.
Messwerte mit Kontext
Auf Hy3-A21B erhöht DFly laut Bericht die durchschnittliche akzeptierte Länge um etwa 30%, erreicht bei Concurrency 4 bis 64 den höchsten durchschnittlichen Durchsatz und beschleunigt gegenüber autoregressivem Decoding um 1,98 bis 2,40x. Gegenüber DFlash liegt der Durchsatz 10,5% bis 11,8% höher.
Das GitHub-Benchmark trennt die Bedingungen: Offline-Durchsatz nutzt HY3-295B-A21B, TP=8, Temperature 1 und drei 120-Sekunden-Fenster pro Zelle. Live-D-cut-Traffic ist als 8x H20 mit Concurrency 2-64 gekennzeichnet.
Warum es zählt
Bei Agents, Codegenerierung und langen Kontexten bestimmen Latenz, GPU-Auslastung und Tail-Verhalten schnell die Rechnung. Falls Dritte die Zahlen reproduzieren, verschiebt sich der Wettbewerb von Modellgröße zu Inferenztechnik.
Quellen: First Financial, Tencent AngelSpec GitHub, arXiv:2607.25852, CocoLoop, Hugging Face; geprüft wurden Veröffentlichungsumfang, Hy3-A21B TP=8 Offline-Durchsatz, 8x H20 Live-Setup, Concurrency 4-64, Draftergewichte und Apache-2.0-Lizenz.