El 9 de septiembre, Tencent Hunyuan publicó en código abierto AuK, un modelo de generación y edición de voz. El código está en la organización Tencent-Hunyuan de GitHub, los pesos se subieron simultáneamente a Hugging Face y ModelScope, y el informe técnico lleva el número arXiv 2609.08936.
El posicionamiento de este modelo no es el de otro TTS más. Reúne en un único punto de entrada tareas que antes estaban repartidas entre una decena de modelos especializados a lo largo de la cadena de voz: con una instrucción en lenguaje natural más un audio de referencia que precisa qué hay que hacer, el modelo devuelve el audio ya editado.
Una decena de tareas, un único punto de entrada
La documentación oficial divide las tareas en seis categorías. En el lado de la generación están la conversión de texto a voz zero-shot y el TTS guiado por instrucciones; la edición se divide en tres capas: la capa de contenido cambia las palabras pronunciadas y las letras de canciones, la capa acústica ajusta el tono, la velocidad de habla y el volumen, y la capa paralingüística modifica la emoción, el timbre, el acento y los sonidos no verbales, incluyendo convertir el habla normal en susurro; en el lado del procesamiento están la reducción de ruido, la eliminación de reverberación, la separación de música y la extracción de un hablante objetivo.
Antes, cada una de estas tareas correspondía básicamente a un modelo independiente. Un equipo de doblaje tenía que instalar un sistema de TTS, para cambiar la emoción necesitaba otro conversor de timbre, y para eliminar el ruido de fondo hacía falta todavía otro modelo de separación; el formato de audio, la frecuencia de muestreo y las versiones de dependencias de los tres diferían entre sí, y buena parte del esfuerzo de ingeniería solía dedicarse a encadenarlos. El enfoque de AuK es convertir la instrucción en una interfaz unificada, dejando que el propio modelo decida qué camino seguir.
El codificador usa Qwen2.5-Omni-3B como base del modelo multimodal. Además de una API en Python, el repositorio incluye una interfaz Gradio y nodos para ComfyUI, ambos puntos de entrada habituales en la comunidad actual de audio y vídeo de código abierto. Los ejemplos del vídeo de demostración están en chino e inglés.
Dónde gana velocidad AuK-Flash
AuK-Flash es una versión rápida destilada del modelo base, con NFE fijo en 4 y CFG en 0. Según la descripción oficial, la destilación se realiza en dos etapas: primero, una inicialización de consistencia a nivel de trayectoria pone en marcha al modelo estudiante de pocos pasos; después, el entrenamiento pasa a un objetivo DMD desacoplado y enrutado por tarea, con la tarea de separación supervisada aparte mediante una regresión sobre predicciones limpias.
Para quien lo usa, estos detalles significan lo siguiente: los modelos de voz basados en difusión convencionales necesitan decenas de pasos de muestreo en cada generación, además de ejecutar una rama incondicional adicional para mantener la calidad; AuK-Flash se ahorra ambos costes, al precio de una calidad que solo "se aproxima" a la del modelo maestro, sin igualarla. La cifra que da la compañía es una aceleración de 4,5 veces en tiempo real, sin publicar la pérdida correspondiente en métricas objetivas.
Frente a otros modelos abiertos de este terreno
La densidad de modelos de voz de código abierto este año no es baja. Mistral publicó un modelo de voz de 4B, comparado en pruebas con ElevenLabs; Qwen3.5-Omni, de Alibaba, integra texto, audio y vídeo en un solo modelo y admite clonación de voz; la propia Hunyuan ya había liberado antes el modelo base Hy4 y un framework de aceleración de inferencia.
La diferencia de AuK no está en las puntuaciones de referencia, sino en la palabra "edición". La línea principal de los modelos mencionados es la generación: a partir de un texto, producir voz; la mitad de las funciones de AuK consiste en tomar un audio ya existente para editarlo, manteniendo al final el timbre y el ritmo del hablante original. Son dos problemas de ingeniería distintos, y el segundo exige una consistencia más estricta, además de estar más cerca del flujo real de posproducción.
La licencia MIT merece mención aparte. Permite uso comercial, modificación y redistribución, siempre que se mantenga la atribución, algo más permisivo que las licencias personalizadas que acompañan a no pocos modelos abiertos chinos. Para equipos pequeños que quieren incorporar capacidades de voz a un producto, las condiciones de la licencia a veces pesan más en la elección que el número de parámetros.
La compañía aún no ha publicado cifras de WER, similitud de hablante o MOS frente a otros modelos; el repositorio incluye una tabla comparativa de rendimiento en las cuatro categorías de generación, edición, mejora y separación, pero las cifras concretas hay que reproducirlas por cuenta propia. La afirmación de que nace liderando la categoría procede, por ahora, de comentarios de la comunidad, y todavía no hay una evaluación independiente de terceros que la respalde.
Fuentes: repositorio e informe técnico de Tencent-Hunyuan/AuK, CocoLoop, página del artículo en Hugging Face; el número de parámetros, la licencia y la tasa de aceleración se han contrastado con la descripción oficial del repositorio, las cifras de evaluación no han sido verificadas de forma independiente.