Qwen3.8-Flash-Next se lanza esta noche con arquitectura adelantada de Qwen4

La comunidad ModelScope ha publicado una página de anuncio para Qwen3.8-Flash-Next, con una cuenta atrás que apunta a las 23:00 del 26 de agosto (UTC+8); la versión estándar y la versión FP8 se abrirán para descarga al mismo tiempo. El repositorio homónimo en Hugging Face solo tiene una frase de descripción: A Preview of the Qwen4 Architecture.

La configuración de parámetros filtrada en la página de anuncio es la siguiente: 125 000 millones de parámetros principales, más 51 000 millones adicionales de embeddings N-gram, con 6000 millones activados por token. El modelo se posiciona como un MoE multimodal; según la compañía, está construido sobre la arquitectura de próxima generación Qwen4, y se libera con antelación el avance de la arquitectura para preparar a la comunidad ante la llegada de la serie Qwen4.

La tasa de activación se comprime por debajo del 5%

De los 125 000 millones, solo se activan 6000 millones, lo que arroja una tasa de activación, calculada de forma aproximada, inferior al 5%. Como referencia, los modelos MoE dispersos habituales en el sector durante los últimos dos años suelen situarse entre el 5% y el 10%; Flash-Next empuja la dispersión un escalón más abajo.

Se trata de una configuración claramente orientada a reducir el coste de inferencia. El consumo de VRAM de un MoE depende del total de parámetros, mientras que el volumen de cómputo depende de los parámetros activados: los 125 000 millones de pesos deben caber en la VRAM, pero cada pasada hacia adelante solo recorre la ruta de 6000 millones. Desde el punto de vista del despliegue, esto significa que el umbral de capacidad de la GPU no baja, pero el umbral de potencia de cómputo y latencia sí baja considerablemente. Con la versión FP8, el consumo de peso puede recortarse aproximadamente a la mitad de nuevo. El "Flash" del nombre probablemente aluda justo a esto.

Algo poco habitual en la tabla de parámetros es el bloque de 51 000 millones de embeddings N-gram, listado por separado de los parámetros principales. Las estructuras de tipo embedding suelen basarse sobre todo en tablas de consulta y no participan en el cálculo matricial capa por capa; si Flash-Next sigue este camino, esos 51 000 millones serían más una inversión que cambia VRAM por rendimiento que un coste de cómputo adicional. La implementación exacta solo podrá confirmarse cuando esta noche se publiquen la model card y los archivos de configuración.

Por qué lleva el número "3.8" pero la arquitectura de Qwen4

El nombre resulta extraño, pero la lógica es coherente. No es la primera vez que Qwen coloca una vista previa "Next" al final de la serie 3.x; la fórmula es siempre la misma: tomar el método de enrutamiento, la variante de atención y la pila de entrenamiento de la próxima generación, probarlos en un modelo de tamaño medio y publicarlos en abierto, para que la comunidad adapte primero las herramientas antes de que llegue la versión grande oficial.

El beneficio es muy práctico. Que un modelo de código abierto pueda ser asimilado directamente el día de su lanzamiento por frameworks como vLLM, SGLang o llama.cpp determina en gran medida su curva de adopción durante las dos primeras semanas. Cuando la arquitectura incorpora nuevos operadores o nuevos métodos de enrutamiento, la adaptación suele alargarse semanas. Unsloth ya ha anunciado que está trabajando en soporte "day-zero", siguiendo justamente este camino: trasladar el coste de tiempo de la adaptación de la arquitectura del día de lanzamiento de Qwen4 a hoy mismo.

Ese repositorio en Hugging Face ya contaba, antes de su apertura, con 1299 personas que habían pulsado para recibir notificación, una cifra nada baja para un repositorio vacío que ni siquiera tiene todavía model card.

Qué observar después de esta noche

La información de la página de anuncio se detiene en la cantidad de parámetros; varios indicadores clave siguen sin revelarse: la longitud de contexto, qué modalidades cubre el sistema multimodal, si la licencia seguirá siendo Apache 2.0 y, lo más importante, los resultados de las pruebas de rendimiento.

La estrategia de Alibaba en código abierto durante el último año ha sido tratar los pesos como puerta de entrada al ecosistema, y también se han liberado los pesos de los modelos de nivel Max. Con Flash-Next, la hoja de ruta se adelanta todavía más: se publica la arquitectura antes incluso de que el modelo esté maduro. Para los equipos locales que trabajan en despliegue de inferencia y ajuste fino, las primeras 48 horas después de las 23:00 de esta noche se anticipan bastante ajetreadas.

Fuentes: página del modelo en ModelScope, repositorio de Hugging Face, CocoLoop, Decrypt, discusión de la comunidad en Hacker News; la configuración de parámetros y la hora de apertura se basan en la información mostrada en la página del modelo, y la tasa de activación es un cálculo aproximado a partir de los parámetros públicos.