Em 28 de agosto, a Tencent lançou e abriu o código do Hunyuan Hy4 preview, com 770 bilhões de parâmetros no total, dos quais 49 bilhões são ativados por token, e janela de contexto nativa de 1.048.576 tokens. Os pesos do modelo foram disponibilizados sob a licença Apache 2.0 no Hugging Face, ModelScope e GitCode, além de estarem disponíveis no TokenHub da Tencent Cloud, no OpenRouter e nos próprios produtos da Tencent, WorkBuddy/CodeBuddy, Yuanbao e ima. A Tencent posiciona o modelo como "uma versão inicial da iteração do Hy4", com o discurso oficial de que ele está "firmemente no primeiro escalão dos modelos de código aberto".
Segundo o model card, o Hy4 preview é um MoE tipicamente esparso: das 78 camadas, apenas 1 é uma camada FFN densa, e as outras 77 passam por roteamento de especialistas, com 256 especialistas roteados mais 1 especialista compartilhado por camada, e cada token seleciona 8 especialistas roteados. A largura da camada oculta é 6144, e o vocabulário tem 120.832 itens. A parte de atenção usa atenção esparsa com portão (gated sparse attention) com IndexCache, comprimindo as consultas (query) para 2048 dimensões e os pares chave-valor para 512, combinados com 4 fluxos residuais iHC. No lado da implantação, há suporte para vLLM e SGLang, com decodificação especulativa MTP ativada por padrão.
Por trás da taxa de ativação de 6,4% há uma conta de poder computacional
49 bilhões divididos por 770 bilhões dão uma taxa de ativação de cerca de 6,4%. Esse número é a chave para entender toda a precificação do modelo: o total de parâmetros determina o custo de memória e carregamento, enquanto o volume ativado determina o custo computacional real por token. A Tencent abriu uma diferença de mais de 15 vezes entre os dois, resultando numa tabela de preços não muito cara: entrada a 6 yuans por milhão de tokens (cerca de US$ 0,834), saída a 18 yuans (cerca de US$ 2,501), e acerto de cache a 0,3 yuan.
Esse patamar de preço fica no meio-termo entre os modelos de código aberto chineses. O GLM-5.3-Flash, lançado na mesma semana, tem preço de entrada tão baixo quanto US$ 0,075 por milhão de tokens, um onze avos do Hy4 preview, mas trata-se de uma versão leve com apenas 18 bilhões de parâmetros ativados; o Hy4 preview mira tarefas mais pesadas, como leitura de código entre arquivos e análise entre documentos. Os dois não competem na mesma categoria, e comparar preços diretamente não faz muito sentido.
A verdadeira variável de custo está no contexto de 1 milhão de tokens. Preencher uma entrada inteira com um milhão de tokens custa, pelo preço de tabela, cerca de 6 yuans; após um acerto de cache, cai para 0,3 yuan — o preço com cache é apenas um vigésimo do preço original. Esse desconto praticamente diz aos desenvolvedores: tratem o contexto longo como um espaço de trabalho permanente, em vez de retransmiti-lo toda vez.
Como interpretar essa diferença de 0,07 ponto
O resultado do teste cego divulgado pela Tencent: 163 especialistas internos avaliaram 203 tarefas de engenharia. O Hy4 preview obteve média de 2,99 pontos (de um total de 4), o GLM-5.3 ficou com 2,92 e o Kimi K3 com 2,94.
A diferença de pontos é pequena, mas a distribuição de vitórias e derrotas traz mais informação. Contra o GLM-5.3, o Hy4 preview venceu em 46,8%, empatou em 12,8% e perdeu em 40,4%; contra o Kimi K3, venceu em 51,2%, empatou em 7,9% e perdeu em 40,9%. A taxa de derrotas fica em torno de 40% em ambos os confrontos, ou seja, em quase metade das tarefas concretas o adversário se saiu melhor. Os três modelos ficam muito próximos, sem que nenhum se destaque claramente.
Duas limitações não podem ser ignoradas: os avaliadores são especialistas internos da Tencent, e o conjunto de tarefas também foi escolhido pela Tencent — esse tipo de teste cego autoorganizado tem, naturalmente, um viés de "vantagem de casa". Com uma amostra de 203 tarefas, uma diferença de 0,05 a 0,07 ponto tem significância estatística bastante limitada.
Os benchmarks públicos permitem uma comparação mais confiável: SWE-bench Multilingual 82,9, SWE-bench Pro 65,7, Terminal-Bench 2.1 chega a 85,4, GPQA Diamond 92,3, HLE com uso de ferramentas 55,4. O SWE-bench Pro é sempre a categoria em que todos os modelos perdem mais pontos, e 65,7 está atualmente no primeiro escalão entre os modelos de código aberto.
Aposta em tarefas de longo prazo
A Tencent deixa claro o foco principal do modelo: engenharia de software de longo prazo, análise de escritório entre arquivos, desenvolvimento de jogos e pesquisa científica. O modelo oferece dois modos de raciocínio, high e no_think — o primeiro para cenários que exigem cadeias longas de raciocínio, o segundo para economizar tokens.
Um exemplo apresentado oficialmente como vitrine é o problema tridimensional de Blaschke-Lebesgue — o modelo elevou o limite inferior do volume de 0,380799 para 0,41104, cerca de 2% abaixo da conjectura do tetraedro de Meissner, de 0,41986. O poder de convencimento desse tipo de exemplo é limitado, por ser uma demonstração cuidadosamente escolhida, mas a direção é clara: a Tencent quer levar o Hy4 preview para dentro dos fluxos de trabalho de pesquisa, não apenas mantê-lo na caixa de chat.
Para os desenvolvedores chineses, o impacto prático é ter mais uma opção. GLM-5.3, Kimi K3 e DeepSeek-V4-Pro já ocupam bastante espaço no segmento de contexto longo de código aberto; o Hy4 preview entra apoiado na licença permissiva Apache 2.0 e no serviço de inferência pronto da Tencent Cloud. Esse ponto da licença é especialmente importante — muitos modelos de código aberto chineses trazem cláusulas de restrição comercial, enquanto a Apache 2.0 significa que empresas podem modificar, implantar e vender diretamente, sem precisar negociar uma licença à parte.
No fim das contas, uma versão preview continua sendo uma preview. A Tencent não deu um cronograma para a versão oficial do Hy4, nem disse o quanto ela vai diferir desta versão preliminar.
Fontes: blog técnico da Tencent Hunyuan, model card no Hugging Face, ITHome, CocoLoop, DataLearner; os parâmetros do modelo, a metodologia do teste cego e os preços da API foram verificados a partir do model card oficial e da página de preços, e a conversão de preços é uma estimativa aproximada com base no preço de tabela.