Em 9 de setembro, a Tencent Hunyuan lançou em código aberto o AuK, modelo de geração e edição de voz. O código está na organização Tencent-Hunyuan no GitHub, os pesos foram publicados simultaneamente no Hugging Face e no ModelScope, e o relatório técnico tem o número arXiv 2609.08936.
O posicionamento do modelo não é o de mais um TTS. Ele reúne, em um único ponto de entrada, tarefas que antes ficavam espalhadas em dezenas de modelos especializados na cadeia de voz: com uma instrução em linguagem natural mais um áudio de referência, especificando o que precisa ser feito, o modelo devolve o áudio já editado.
Dezenas de tarefas, um único ponto de entrada
A documentação oficial divide as tarefas em seis categorias. No lado da geração ficam a conversão texto-para-voz zero-shot e o TTS guiado por instruções; a edição se divide em três camadas — a camada de conteúdo altera as palavras faladas e as letras de música, a camada acústica ajusta tom, velocidade de fala e volume, a camada paralinguística muda emoção, timbre, sotaque e sons não verbais, incluindo transformar uma fala normal em sussurro; no lado do processamento ficam redução de ruído, remoção de reverberação, separação de música e extração de um locutor-alvo.
Antes, cada uma dessas tarefas correspondia basicamente a um modelo separado. Uma equipe de dublagem precisava instalar um sistema de TTS, para mudar a emoção precisava de outro conversor de timbre, para remover ruído de fundo precisava de mais um modelo de separação — formato de áudio, taxa de amostragem e versões de dependências dos três eram diferentes entre si, e boa parte do esforço de engenharia ia para costurar tudo isso. A abordagem do AuK é transformar a instrução em uma interface unificada, deixando o modelo decidir sozinho qual caminho seguir.
O codificador usa o Qwen2.5-Omni-3B como base do modelo multimodal. Além da API em Python, o repositório também traz uma interface Gradio e nós para o ComfyUI, ambos pontos de entrada comuns na comunidade de áudio e vídeo em código aberto hoje em dia. Os exemplos no vídeo de demonstração estão em chinês e inglês.
Onde o AuK-Flash ganha velocidade
O AuK-Flash é uma versão rápida destilada do modelo base, com NFE fixo em 4 e CFG igual a 0. Segundo a empresa, a destilação ocorre em duas etapas: primeiro, uma inicialização de consistência em nível de trajetória coloca o modelo estudante de poucos passos em funcionamento; depois, o treinamento passa para um objetivo DMD desacoplado e roteado por tarefa, com a tarefa de separação supervisionada à parte por uma regressão sobre previsões limpas.
Para quem usa, esses detalhes significam o seguinte: os modelos de voz baseados em difusão convencionais precisam de dezenas de passos de amostragem a cada geração, além de rodar um ramo incondicional extra para preservar a qualidade; o AuK-Flash elimina esses dois custos, ao preço de uma qualidade que apenas "se aproxima" da do modelo professor, em vez de igualá-la. O número divulgado pela empresa é uma aceleração de 4,5 vezes em tempo real, sem divulgar a perda correspondente em métricas objetivas.
Comparado a outros modelos abertos do setor
A densidade de modelos de voz em código aberto lançados este ano não é pequena. A Mistral lançou um modelo de voz de 4B, comparado em benchmarks ao ElevenLabs; o Qwen3.5-Omni, da Alibaba, une texto, áudio e vídeo em um único modelo e oferece clonagem de voz; a própria Hunyuan já havia liberado antes o modelo base Hy4 e um framework de aceleração de inferência.
A diferença do AuK não está nos números de benchmark, mas na palavra "edição". O foco principal dos modelos citados é a geração — dado um texto, produzir voz; metade das funções do AuK consiste em receber um áudio já existente para editá-lo, preservando ao final o timbre e o ritmo do locutor original. São dois problemas de engenharia distintos, e o segundo exige uma consistência mais rigorosa, além de se aproximar mais do fluxo real de pós-produção.
A licença MIT merece um destaque à parte. Ela permite uso comercial, modificação e redistribuição, desde que a atribuição seja mantida — mais permissiva do que as licenças personalizadas que acompanham muitos modelos abertos chineses. Para equipes pequenas que querem incorporar capacidade de voz a um produto, os termos da licença às vezes pesam mais na escolha do que o número de parâmetros.
A empresa ainda não divulgou números de WER, similaridade de locutor ou MOS em comparação com outros modelos; o repositório traz uma tabela comparando o desempenho nas quatro categorias de geração, edição, aprimoramento e separação, mas os números específicos precisam ser reproduzidos por conta própria. A alegação de que o modelo já nasce líder vem, por ora, de relatos da comunidade, e ainda não há avaliação independente de terceiros que a confirme.
Fontes: repositório e relatório técnico do Tencent-Hunyuan/AuK, CocoLoop, página do artigo no Hugging Face; número de parâmetros, licença e taxa de aceleração foram conferidos conforme a descrição oficial do repositório, os números de avaliação não foram verificados de forma independente.