Primero, este número: SWE-bench Pro 53,5 vs 50,9.
El primero corresponde a Qwen3.6-27B, un modelo de 27B parámetros, lanzado como código abierto el 22 de abril bajo licencia Apache 2.0. El segundo es de Qwen3.5-397B, un modelo de 397B parámetros con arquitectura de mezcla de expertos (MoE), anteriormente el modelo insignia de Alibaba.
Un modelo pequeño de 27 mil millones de parámetros que vence a un modelo grande de casi 40 mil millones de parámetros activados en una prueba de ingeniería de software no es algo menor.
Thinking Preservation: Este es el punto clave
Sinceramente, la historia de "menos parámetros, más potencia" ya se ha visto varias veces en este sector. El rendimiento de Qwen3.6-27B no proviene de la arquitectura central, sino de una nueva función: Thinking Preservation (Conservación del Razonamiento).
Hay un problema ignorado en los LLM de código abierto: cuando un Agent ejecuta tareas de múltiples pasos, el proceso de razonamiento de cada paso se descarta. El modelo tiene que inferir desde cero cada vez, en lugar de reutilizar cadenas cognitivas ya establecidas.
El enfoque de Qwen3.6-27B es mantener los "rastros de razonamiento" de mensajes históricos como contexto persistente:
"retiene y aprovecha los rastros de razonamiento de mensajes históricos a lo largo de toda la conversación en lugar de descartar el razonamiento previo, mejorando la eficiencia en flujos de trabajo de agente de múltiples pasos"
En términos simples: el modelo recuerda cómo pensó antes, en lugar de reiniciarse cada vez.
En tareas de codificación agénticas, esta diferencia es evidente. Al procesar el mismo repositorio de código, la diferencia de rendimiento entre un modelo que recuerda las conclusiones de razonamiento de la ronda anterior y uno que no las recuerda es grande. SWE-bench Pro, al ser una prueba que se ejecuta en repositorios de código reales, amplifica esta ventaja.
Panorama completo de puntuaciones
No solo en SWE-bench, Qwen3.6-27B tiene un rendimiento integral:
| Prueba | Qwen3.6-27B | Comparación |
|---|---|---|
| SWE-bench Pro | 53,5 | vs Qwen3.5-397B MoE: 50,9 |
| Terminal-Bench 2.0 | 59,3 | Empatado con Claude Opus versión insignia |
| AIME26 (Matemáticas) | 94,1 | vs Qwen3.5-27B: 92,6 |
| QwenWebBench | 1487 | vs Qwen3.5-27B: 1068 (+39%) |
| SkillsBench Promedio | 48,2 | 77% de mejora respecto al modelo de la generación anterior del mismo tamaño |
| GPQA Diamond | 87,8 | vs Qwen3.5-27B: 85,5 |
La mejora del 77% en SkillsBench merece una mención aparte. Esta prueba mide capacidades generales entre dominios. El salto de Qwen3.5-27B a Qwen3.6-27B no es un pequeño ajuste, sino una reestructuración a nivel de sistema.
Ventana de contexto
Soporte nativo de 262.144 tokens (aproximadamente 200.000 caracteres chinos), ampliable a 1.010.000 tokens usando YaRN.
Para escenarios que requieren procesar repositorios de código largos o documentos extensos, esta ventana de contexto es suficiente.
Qué significa el código abierto
Licencia Apache 2.0, sin restricciones de uso comercial.
Para las empresas, esto es más práctico que los números de rendimiento: un modelo de 27B parámetros tiene un costo de implementación local mucho menor que uno de 397B, pero obtiene puntuaciones más altas en tareas principales – esta combinación es muy atractiva para empresas que quieren construir capacidad de IA propia. Piense: una GPU de consumo ya puede ejecutar 27B, mientras que 397B requiere al menos varias GPU de alto rendimiento.
Por eso el número del 77% en SkillsBench es tan importante: no solo es más fuerte en código, sino que las capacidades generales han mejorado de forma integral – esa es la verdadera premisa para reemplazar modelos grandes.
El panorama de esta semana
Esta semana, coincidentemente, OpenAI lanzó GPT-5.5 y Alibaba lanzó Qwen3.6-27B.
Viendo ambos juntos: el modelo cerrado insignia busca "más rápido y con menos tokens", mientras que el modelo abierto pequeño busca "usar menos parámetros para obtener mejores resultados". Las direcciones son diferentes, pero ambos están comprimiendo el espacio del otro.
Lo próximo que podría ser trastocado no es necesariamente una empresa específica, sino la suposición de que "se necesita un modelo grande para ejecutar bien el código".
Fuente de referencia: CocoLoop, Alibaba Qwen Team Releases Qwen3.6-27B: A Dense Open-Weight Model Outperforming 397B MoE on Agentic Coding Benchmarks (MarkTechPost)