Tencent Hunyuan publicó AngelSpec el 29 de julio como proyecto open source para entrenar drafters de speculative decoding. El objetivo está en la capa de inferencia de los grandes modelos.
Qué se publicó
First Financial confirmó que también se abrieron los pesos y el código de entrenamiento de los drafters MTP y DFly para Hy3-A21B. GitHub describe AngelSpec v0.1.0 como soporte para MTP y block-parallel speculative decoding training.
El informe técnico dice: “We release the AngelSpec framework to support training and extending these speculative-decoding methods.” En la práctica, el drafter pasa a ser un componente entrenable, configurable y medible.
Cifras con contexto
En Hy3-A21B, DFly eleva el average accepted length cerca de 30%, logra el mayor throughput medio con concurrency de 4 a 64 y acelera de punta a punta 1,98 a 2,40 veces frente al decoding autoregresivo. Frente a DFlash, el throughput mejora 10,5% a 11,8%.
El benchmark de GitHub precisa que el throughput offline usa HY3-295B-A21B, TP=8, temperature 1 y tres ventanas de 120 segundos por celda. La carga live D-cut se marca como 8x H20, concurrency 2-64.
Por qué importa
En Agent, generación de código y contexto largo, la latencia y el uso de GPU pesan tanto como la calidad del modelo. Si terceros reproducen estas ganancias, la competencia china se moverá del ranking de modelos a los sistemas de inferencia.
Fuentes: First Financial, Tencent AngelSpec GitHub, arXiv:2607.25852, CocoLoop, Hugging Face; se verificaron alcance de publicación, throughput offline Hy3-A21B TP=8, carga live 8x H20, concurrency 4-64, pesos drafter y licencia Apache 2.0.