El 16 de abril, el equipo Qwen de Alibaba publicó Qwen3.6-35B-A3B como código abierto bajo la licencia Apache 2.0, sin ninguna restricción comercial.
Este modelo es interesante: tiene 35B parámetros en total, pero durante la inferencia solo activa 3B. Utiliza la arquitectura de Mezcla de Expertos (MoE) con una relación de dispersión computacional de 12:1 – con un rendimiento cercano al de un modelo grande de 35B, pero con un costo operativo de 3B.
En SWE-bench Verified (prueba de corrección de issues reales de GitHub), alcanzó un 73,4 %, mientras que Gemma 4-31B, publicado como código abierto por Google en el mismo período, solo obtuvo un 52,0 %, una diferencia de 21 puntos porcentuales.
Por qué es importante la arquitectura
Primero, hablemos de la lógica de diseño de MoE.
En un modelo denso normal, al procesar un token, todos los parámetros participan en el cálculo. Un modelo de 35B parámetros requiere 35B de cómputo para cada token.
MoE es diferente. Divide los parámetros en muchos "expertos" (experts), activando solo una parte cada vez. El mecanismo de enrutamiento de Qwen3.6-35B-A3B llama solo al grupo de expertos correspondiente a 3B parámetros para procesar cada token, pero el modelo completo acumula la capacidad de conocimiento representada por 35B parámetros.
El resultado: velocidad de inferencia y uso de memoria a escala de 3B, capacidad de resolución de problemas a escala de 35B.
En una RTX 4090, la velocidad supera los 120 tokens/segundo. Un MacBook Pro M4/M5 con 64 GB de RAM puede ejecutarlo directamente. Después de la cuantización Q4_K_M, ocupa aproximadamente 21 GB, lo que cabe en una tarjeta gráfica de consumo común.
Esto significa mucho para la implementación local: antes, para ejecutar un modelo de programación de vanguardia en código abierto, se necesitaba al menos una A100 o varias RTX 4090; ahora, una sola tarjeta gráfica de consumo es suficiente.
Comparación numérica con otros modelos
vs. Google Gemma 4-31B:
| Prueba | Qwen3.6-35B | Gemma 4-31B |
|---|---|---|
| SWE-bench Verified | 73,4 % | 52,0 % |
| Terminal-Bench 2.0 | 51,5 % | 42,9 % |
| MCPMark (llamada de herramientas) | 37,0 % | 18,1 % |
| GPQA (razonamiento general) | 86,0 % | 84,3 % |
| AIME26 (competencia de matemáticas) | 92,7 % | 89,2 % |
En la llamada de herramientas (MCPMark), Qwen3.6 es más del doble que Gemma 4. Este escenario de prueba se corresponde directamente con el rendimiento en tareas reales de Agente, siendo incluso más cercano al uso real que SWE-bench.
QwenWebBench (tareas web) obtuvo 1397 ELO, una mejora del 43 % con respecto a la generación anterior.
vs. Claude Sonnet 4.5:
Según la evaluación de The Decoder, en benchmarks puros de programación, ambos modelos están prácticamente empatados, con la diferencia dentro del margen de error. En diálogos de estilo asistente y conversaciones generales, Claude sigue liderando.
Detalles del código abierto y disponibilidad
Los pesos del modelo están disponibles en Hugging Face (Qwen/Qwen3.6-35B-A3B) y ModelScope, y son compatibles con Transformers, vLLM (>=0.19.0), SGLang (>=0.5.10) y KTransformers.
Admite dos modos:
- Modo Thinking: similar a un modelo de razonamiento, pensamiento profundo en varios pasos, conservando el proceso de razonamiento para diálogos posteriores
- Modo Fast: salida directa, adecuado para diálogos y tareas ligeras
La ventana de contexto nativa es de 262 144 tokens, que se puede extender a más de 1 millón con la extensión YaRN.
La API también se puede invocar a través de Alibaba Cloud Model Studio (nombre "Qwen3.6 Flash") o mediante implementación propia.
Análisis
Este es el tercer paso de Alibaba en la dirección del código abierto. Primero, el lanzamiento de Qwen3 básico como código abierto (licencia Apache), luego el lanzamiento de la versión empresarial cerrada Qwen3.6-Plus, y luego el lanzamiento de Qwen3.6-35B-A3B como código abierto, una versión especializada en programación de alto rendimiento.
Cada paso es muy claro: primero construir la comunidad y la base de desarrolladores, luego monetizar con la versión cerrada, y luego usar la versión de código abierto para profundizar el ecosistema.
El resultado del 73,4 % en SWE-bench de Qwen3.6-35B-A3B, ¿en qué nivel se encuentra entre todos los modelos de código abierto? Actualmente, entre los modelos de código abierto, solo DeepSeek V4 y este son dignos de mención, y entre los modelos cerrados, Claude Sonnet 4.5 también está en ese rango. Un modelo MoE que se puede ejecutar localmente alcanzar esta puntuación realmente ha cambiado algo.
Por supuesto, una puntuación alta en SWE-bench no significa que funcione bien en producción. El rendimiento real de los Agentes de programación también depende de la gestión del contexto, la recuperación de errores y la estabilidad en flujos largos – todo esto no está en el benchmark. Pero el punto de partida está establecido, vale la pena probarlo seriamente.
Fuente de referencia: CocoLoop, Alibaba's open model Qwen3.6 leads Google's Gemma 4 across agentic coding benchmarks (The Decoder); Qwen3.6-35B-A3B: 73.4% SWE-Bench, Runs Locally (Build Fast with AI); Qwen3.6-35B-A3B Complete Review: Alibaba's Open-Source Coding Model (DEV Community)