El 28 de agosto, Tencent lanzó y abrió el código de Hunyuan Hy4 preview, con 770.000 millones de parámetros en total, de los cuales se activan 49.000 millones por token, y una ventana de contexto nativa de 1.048.576 tokens. Los pesos del modelo se publicaron bajo licencia Apache 2.0 en Hugging Face, ModelScope y GitCode, y también están disponibles en TokenHub de Tencent Cloud, en OpenRouter y en los propios productos de Tencent, WorkBuddy/CodeBuddy, Yuanbao e ima. Tencent lo presenta como "una versión temprana de la iteración de Hy4", con el mensaje oficial de que se mantiene "firmemente en el primer nivel de los modelos de código abierto".
Según la ficha del modelo, Hy4 preview es un MoE típicamente disperso: de 78 capas, solo 1 es una capa FFN densa, y las otras 77 pasan por enrutamiento de expertos, con 256 expertos enrutados más 1 experto compartido por capa, y cada token selecciona 8 expertos enrutados. El ancho de la capa oculta es de 6144 y el vocabulario tiene 120.832 elementos. La parte de atención usa atención dispersa con compuerta (gated sparse attention) con IndexCache, comprimiendo las consultas a 2048 dimensiones y los pares clave-valor a 512, junto con 4 flujos residuales iHC. En el despliegue admite vLLM y SGLang, con decodificación especulativa MTP activada por defecto.
Detrás de la tasa de activación del 6,4% hay una cuenta de cómputo
49.000 millones entre 770.000 millones da una tasa de activación de aproximadamente el 6,4%. Esa cifra es la clave para entender todo el esquema de precios del modelo: el total de parámetros determina el costo de memoria y de carga, mientras que el volumen activado determina el cómputo real por token. Tencent ha separado ambos valores por más de 15 veces, a cambio de una lista de precios no demasiado cara: entrada a 6 yuanes por millón de tokens (unos 0,834 dólares), salida a 18 yuanes (unos 2,501 dólares), y acierto de caché a 0,3 yuanes.
Ese nivel de precio se sitúa en la gama media dentro del bloque de código abierto chino. GLM-5.3-Flash, lanzado la misma semana, tiene un precio de entrada tan bajo como 0,075 dólares por millón de tokens, once veces menos que Hy4 preview, pero se trata de una versión ligera con solo 18.000 millones de parámetros activados; Hy4 preview apunta a tareas más pesadas, como leer código entre varios archivos o analizar varios documentos a la vez. Los dos no compiten en la misma categoría, así que comparar precios directamente tiene poco sentido.
La verdadera variable de costo está en el contexto de 1 millón de tokens. Llenar por completo una entrada con un millón de tokens cuesta, según el precio de lista, unos 6 yuanes; tras un acierto de caché, baja a 0,3 yuanes: el precio con caché es solo una veinteava parte del precio original. Ese descuento le dice, en esencia, a los desarrolladores: traten el contexto largo como un espacio de trabajo permanente, en lugar de retransmitirlo cada vez.
Cómo leer esa diferencia de 0,07 puntos
El resultado de la prueba a ciegas que dio a conocer Tencent: 163 expertos internos evaluaron 203 tareas de ingeniería. Hy4 preview obtuvo un promedio de 2,99 puntos (sobre 4), GLM-5.3 quedó en 2,92 y Kimi K3 en 2,94.
La diferencia de puntos es mínima; la distribución de victorias y derrotas aporta más información. Frente a GLM-5.3, Hy4 preview ganó el 46,8%, empató el 12,8% y perdió el 40,4%; frente a Kimi K3, ganó el 51,2%, empató el 7,9% y perdió el 40,9%. La tasa de derrotas ronda el 40% en ambos enfrentamientos, es decir, en casi la mitad de las tareas concretas el rival lo hizo mejor. Los tres modelos están muy igualados, sin que ninguno se despegue claramente.
Hay dos limitaciones que no se pueden pasar por alto: los jueces son expertos internos de Tencent y el conjunto de tareas también lo eligió Tencent, por lo que este tipo de prueba a ciegas autoorganizada tiene, de forma natural, ventaja de local. Con una muestra de 203 tareas, una diferencia de 0,05 a 0,07 puntos tiene una significancia estadística bastante limitada.
Los benchmarks públicos permiten una comparación más fiable: SWE-bench Multilingual 82,9, SWE-bench Pro 65,7, Terminal-Bench 2.1 alcanza 85,4, GPQA Diamond 92,3, HLE con herramientas 55,4. SWE-bench Pro es siempre la categoría donde todos los modelos pierden más puntos, y 65,7 está actualmente en el grupo de cabeza entre los modelos de código abierto.
Apuesta por las tareas de largo aliento
Tencent deja clara la dirección principal de este modelo: ingeniería de software de largo aliento, análisis de oficina entre archivos, desarrollo de videojuegos e investigación científica. El modelo ofrece dos modos de razonamiento, high y no_think: el primero para escenarios que requieren cadenas de razonamiento largas, el segundo para ahorrar tokens.
Un ejemplo que la propia compañía presenta como vitrina es el problema tridimensional de Blaschke-Lebesgue: el modelo elevó la cota inferior del volumen de 0,380799 a 0,41104, a unos 2% de la conjetura del tetraedro de Meissner, que es de 0,41986. El poder de convicción de este tipo de ejemplos es limitado, por tratarse de una demostración cuidadosamente escogida, pero la dirección es clara: Tencent quiere que Hy4 preview entre en los flujos de trabajo de investigación, no que se quede solo en la ventana de chat.
Para los desarrolladores chinos, el impacto práctico es tener una opción más. GLM-5.3, Kimi K3 y DeepSeek-V4-Pro ya han ocupado buena parte del terreno del contexto largo en código abierto; Hy4 preview se abre paso gracias a la licencia permisiva Apache 2.0 y al servicio de inferencia ya disponible en Tencent Cloud. El tema de la licencia es especialmente clave: no pocos modelos de código abierto chinos incluyen cláusulas de restricción comercial, mientras que Apache 2.0 implica que las empresas pueden modificarlo, desplegarlo y venderlo directamente, sin necesidad de negociar una licencia aparte.
Al final, una versión preview sigue siendo una preview. Tencent no ha dado un calendario para la versión oficial de Hy4, ni ha dicho cuánto diferirá esta versión preliminar de la definitiva.
Fuentes: blog técnico de Tencent Hunyuan, ficha del modelo en Hugging Face, ITHome, CocoLoop, DataLearner; los parámetros del modelo, la metodología de la prueba a ciegas y los precios de la API se verificaron con la ficha oficial del modelo y la página de precios; la conversión de precios es una estimación aproximada basada en el precio de lista.