El modelo de 27B de Alibaba iguala los resultados de su propio modelo de 397B

El 22 de abril, el equipo de Qwen publicó un nuevo modelo en Hugging Face. Con 27 mil millones de parámetros, arquitectura Dense y licencia Apache 2.0, el modelo se llama Qwen3.6-27B.

En la publicación de lanzamiento, enumeraron las puntuaciones de los benchmarks. SWE-bench Verified: 77,2 puntos. Junto a eso, también colocaron la puntuación de Qwen3.5-397B-A17B: 76,2 puntos.

Un modelo Dense de 27B, en un benchmark de programación, venció al propio modelo MoE insignia de 397B.

Esto no es accidental; hay razones específicas detrás.

Por dónde empieza a fallar MoE

La arquitectura MoE (Mezcla de Expertos) ha sido la solución principal para escalar modelos grandes en los últimos dos años. La lógica es simple: el número total de parámetros es grande, pero en cada inferencia solo se activa una pequeña parte de los "expertos", por lo que el cómputo real es relativamente controlable.

Qwen3.5-397B tiene 397 mil millones de parámetros en total, activando 17 mil millones en cada inferencia. Qwen3.6-27B activa los 27 mil millones de parámetros completos en cada inferencia: en términos de cómputo es similar, pero la forma es completamente diferente.

La inferencia de la arquitectura Dense es más consistente y predecible. MoE tiene un cierto grado de aleatoriedad en el enrutamiento: diferentes entradas pueden activar diferentes combinaciones de expertos, lo que puede acumular desviaciones en tareas de cadena larga.

En tareas como la generación de código, la estabilidad es crucial. Quieres "acertar en cada paso", no "bueno en promedio pero a veces desviarse".

En Terminal-Bench 2.0, el modelo de 27B obtuvo 59,3 puntos, mientras que el modelo de 397B solo obtuvo 52,5. En SkillsBench, la brecha fue aún mayor: 48,2 frente a 30,0.

Modelo Escala de parámetros SWE-bench Terminal-Bench SkillsBench
Qwen3.6-27B 27B Dense 77,2 59,3 48,2
Qwen3.5-397B-A17B 397B MoE 76,2 52,5 30,0

En las tres pruebas, el modelo de 27B ganó.

Qué es Thinking Preservation

Qwen3.6-27B añadió un mecanismo llamado "Thinking Preservation", que merece una mención aparte.

En diálogos de múltiples turnos, el modelo conserva un resumen del proceso de razonamiento anterior, y en el siguiente turno no necesita razonar desde cero — continúa directamente sobre los resultados del pensamiento del turno anterior.

Esto es muy útil en flujos de trabajo de Agentes. Un Agente que debe completar una tarea de diez pasos no debería perder los resultados del análisis de los primeros tres pasos en el cuarto paso; deberían continuar como contexto. Esto reduce la generación de tokens redundantes y también disminuye la "deriva de olvido" en tareas largas.

Este diseño va en dirección opuesta al mecanismo de enrutamiento de MoE: MoE expande parámetros horizontalmente, mientras que Thinking Preservation optimiza la transmisión de estado verticalmente. Los dos enfoques resuelven problemas en diferentes niveles.

Se puede ejecutar en hardware de consumo

Este es otro valor práctico de este modelo.

La versión completa de Qwen3.5-397B requiere 807 GB de espacio de almacenamiento. La versión cuantizada también necesita varios cientos de GB; para ejecutarla se necesita un servidor con múltiples GPU, algo que la mayoría de los desarrolladores comunes no tienen.

Qwen3.6-27B:

  • Versión completa: 55,6 GB
  • Versión GGUF cuantizada: 16,8 GB
  • Se puede ejecutar en una sola RTX 4090, velocidad de aproximadamente 25 tokens/segundo
  • MacBook M4 Max no es problema

La ventana de contexto predeterminada es de 262.144 tokens, ampliable a 1 millón. Licencia Apache 2.0, sin restricciones comerciales.

Esto ha reducido significativamente la barrera para la implementación local. Equipos de ingeniería que desean implementar un Agente de programación en una red interna, sin enviar código a APIs en la nube — antes, este camino significaba usar modelos de código abierto deficientes o comprar servidores GPU costosos. Ahora hay una opción.

Qué significa esto para MoE

El momento de este lanzamiento de Alibaba es interesante. Qwen3.6-27B se lanzó unos días después de Qwen3.6-Max (la versión propietaria insignia) — uno muestra la capacidad máxima para atraer clientes comerciales, el otro es para la comunidad de desarrolladores. Dos piernas, sirviendo a diferentes grupos.

Pero la pregunta más grande es: Si un modelo Dense de 27B ya puede competir de igual a igual con Claude Opus 4.5 en codificación de agente, ¿en qué dimensión se librará la próxima competencia?

En Terminal-Bench, el modelo de 27B empata con Claude Opus 4.5, mientras que el precio de la API de Opus 4.5 supera los 15 dólares estadounidenses por millón de tokens. Qwen3.6-27B es de código abierto y se puede implementar por cuenta propia.

Las ganancias incrementales de los benchmarks son cada vez menores. Los usuarios comienzan a preocuparse más por la latencia, el costo y la posibilidad de implementación local.

Esta tendencia es favorable para los modelos de código abierto y presiona a los servicios de API cerrados.

El próximo paso es ver cómo reaccionan Kimi, DeepSeek y MiniMax.

Fuente de referencia: CocoLoop, Qwen3.6-27B: Flagship-Level Coding in a 27B Dense Model (Simon Willison's Blog); Alibaba's Qwen3.6-27B Beats 397B Model in Coding Tasks (AI Daily Post); Qwen3.6-27B (Hacker News)