Qwen3.8-Max lidera el ranking de programación con un precio de solo 1/4 del segundo puesto

El equipo de Qwen de Alibaba actualizó su modelo insignia, Qwen3.8-Max, a la versión 0902, sumando una nueva ronda de post-entrenamiento centrada en programación y tareas profesionales de oficina. En el ranking general de programación frontend de Code Arena, esta versión obtuvo 1691 puntos, situándose en primer lugar, 22 puntos por encima de la versión anterior.

Otra cifra que Alibaba dio a conocer al mismo tiempo deja aún más clara la posición que persigue: el precio medio combinado de la nueva versión es de unos 5 dólares por millón de tokens, mientras que el segundo y el tercer puesto del ranking cuestan 20 y 12 dólares respectivamente.

22 puntos y 15 dólares

La diferencia entre los primeros puestos del ranking ya era pequeña. Entre los 1691 puntos y la versión anterior hay solo 22 puntos, una diferencia que en las evaluaciones ciegas hechas por humanos suele ser alcanzada por la competencia en una o dos semanas. Lo que realmente marca la distancia está en la columna de al lado: en la misma tarea de programación frontend, cambiar al modelo que ocupa el segundo puesto multiplica la factura por cuatro.

Según informes públicos, el precio de la API de la nueva versión es de 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida. Si se hace el cálculo inverso a partir del precio medio oficial de 5 dólares (una estimación aproximada), los tokens de salida tendrían que representar cerca de las tres cuartas partes del uso total para llegar a esa cifra de 5. Esta proporción no es extraña en tareas de programación frontend: el contexto del prompt suele tener solo unos cientos de líneas, mientras que el modelo devuelve páginas enteras de código de componentes; la salida consume de forma natural la mayor parte. Este precio medio de 5 dólares está calculado según la estructura real de uso de 'escribir código'; si se cambia a tareas como el resumen de documentos largos, con entrada pesada y salida ligera, el precio efectivo sería aún más bajo.

Para los equipos chinos, esta referencia de precios es bastante clara. En el último año, las empresas que han incorporado la programación mediante agentes a su producción solían atascarse en el departamento financiero: si el modelo escribe bien o no dejó de ser el problema hace tiempo; lo que cuenta es si una factura diaria de millones de tokens puede aprobarse. Igualar la puntuación de los primeros puestos y recortar el precio a una cuarta parte pesa más en la decisión de compra que sumar 22 puntos por sí solo.

2,4 billones de parámetros, 95.000 millones en acción

Detrás de la versión 0902 está la base Qwen3.8-2.4T-A95B. Del total de 2,4 billones de parámetros, cada pasada hacia adelante activa solo unos 95.000 millones, siguiendo la típica ruta de MoE (mezcla de expertos) disperso: de 512 expertos, cada token activa 11, de los cuales 10 se enrutan y 1 es un experto compartido.

Las decisiones estructurales también favorecen las tareas largas. El modelo tiene 23 capas, alternando Gated DeltaNet y Gated Attention, con un contexto nativo de 262.144 tokens, ampliable a cerca de 1,01 millones. Combinar atención lineal y atención con compuerta es una dirección que varios equipos chinos dedicados a contextos largos han seguido en los últimos seis meses, con un objetivo directo: reducir el consumo de memoria e inferencia de los contextos largos hasta un nivel comercialmente viable; de lo contrario, un contexto de un millón es solo una cifra bonita en la ficha técnica.

La proporción de activación también explica de dónde salen los 5 dólares. Los 2,4 billones de parámetros totales determinan la capacidad de conocimiento del modelo, mientras que los 95.000 millones activados determinan cuánta 'electricidad' cuesta cada llamada. Con este grado de dispersión, el costo de inferencia por unidad es naturalmente mucho menor que el de un modelo denso de escala equivalente.

La interfaz ya llega a toda la línea de productos propia

La nueva versión ya puede invocarse directamente desde el servicio API de la plataforma Qwen AI, y al mismo tiempo se ha integrado en Qwen Office, Qoder y la app Qwen. Clientes empresariales, desarrolladores y usuarios comunes quedaron habilitados de una sola vez, sin ventana de lanzamiento gradual.

Alibaba posiciona esta versión como 'más adecuada para tareas complejas reales de empresas, investigación científica y tareas de ciclo largo', y afirma que el modelo 'ha establecido un nuevo techo global' en razonamiento de múltiples pasos, uso de herramientas y generación de aplicaciones de extremo a extremo. La segunda parte es discurso del fabricante, pero la primera, sobre 'tareas de ciclo largo', sí encaja con las dos decisiones técnicas: el contexto de 1,01 millones y la activación dispersa. Solo cuando se puede cargar de una vez toda una base de código sin disparar el costo tiene sentido hablar de que el modelo trabaje de forma continua durante horas.

La forma de nombrar también revela el ritmo. Qwen3.8-Max usa la fecha como número de subversión, lo que muestra que Alibaba sigue un ritmo de iteración de pasos pequeños y rápidos en la línea Max de código cerrado: la generación del modelo no cambia, pero las capacidades se van acumulando de forma continua. Desde que 3.6-Max pasó a ser de código cerrado, el papel de la serie Max se separó del de la serie Flash, de código abierto: una se encarga de dominar los rankings y los presupuestos empresariales, la otra de expandir el ecosistema de desarrolladores. Esta vez, la versión 0902 reduce el precio a una cuarta parte de la cabeza del ranking, lo que aprieta un poco más esa división de funciones entre ambas líneas.

Fuentes: Anuncio oficial de Alibaba Qwen, CocoLoop, página del ranking de programación frontend de Code Arena, ITHome, ficha del modelo en Hugging Face; los datos de 1691 puntos y el aumento de 22 puntos, los precios medios de 5/20/12 dólares por millón de tokens, y los 2,4 billones de parámetros totales con 95.000 millones de parámetros activados fueron verificados uno por uno.