A Tencent Hunyuan lançou o AngelSpec em 29 de julho como projeto open source para treinar drafters de speculative decoding. A meta é acelerar a inferência de grandes modelos.
O que foi aberto
A First Financial confirmou que a empresa também publicou pesos e código de treinamento dos drafters MTP e DFly para Hy3-A21B. O GitHub diz que o AngelSpec v0.1.0 suporta MTP e block-parallel speculative decoding training.
O relatório técnico afirma: “We release the AngelSpec framework to support training and extending these speculative-decoding methods.” Em termos práticos, o drafter vira uma peça treinável, configurável e avaliável.
Números com escopo
No Hy3-A21B, o DFly teria elevado o average accepted length em cerca de 30%, alcançado o maior throughput médio em concurrency 4 a 64 e entregue aceleração end-to-end de 1,98 a 2,40 vezes sobre decoding autoregressivo. Frente ao DFlash, o throughput subiu 10,5% a 11,8%.
O benchmark do GitHub informa que o throughput offline usa HY3-295B-A21B, TP=8, temperature 1 e três janelas de 120 segundos por célula. A carga live D-cut aparece como 8x H20, concurrency 2-64.
Por que importa
Em Agent, geração de código e contexto longo, latência, uso de GPU e estabilidade multiusuário pesam tanto quanto capacidade do modelo. Se terceiros reproduzirem os ganhos, a disputa chinesa em IA avançará para sistemas de inferência.
Fontes: First Financial, Tencent AngelSpec GitHub, arXiv:2607.25852, CocoLoop, Hugging Face; verificados escopo da abertura, throughput offline Hy3-A21B TP=8, carga live 8x H20, concurrency 4-64, pesos drafter e licença Apache 2.0.