Decision-1 de Microsoft se basa en Qwen 9B

El 9 de octubre, Microsoft presentó en su publicación técnica Command Line el Microsoft-Decision-1, un modelo dedicado solo a las "preguntas de opción múltiple": enrutamiento, clasificación, ordenación, validación y control de flujos de trabajo. Firma el texto Achint Srivastava, vicepresidente de ingeniería de software de la oficina del director de tecnología de Microsoft. El modelo ya está disponible en Microsoft Foundry y también se ha integrado en OpenRouter.

Su salida es muy estrecha. Quien lo invoca entrega primero un conjunto fijo de opciones, el modelo devuelve para cada una una probabilidad calibrada y el software ejecuta el resultado directamente. Admite preguntas de sí o no, opción múltiple, puntuación y puntuación según una rúbrica (rubric); redactar textos largos o razonar de forma compleja no entra en su cometido.

Los resultados que declara Microsoft

Microsoft afirma que Decision-1 logró la mayor precisión en una comparación de 36 pruebas de referencia con cerca de 150.000 preguntas, con una latencia P50 de aproximadamente 1/35 de la de GPT-6 Sol. El artículo pone un ejemplo: en un proceso que encadena 20 decisiones, si cada una tarda 100 milisegundos más, toda la cadena se ralentiza 2 segundos.

En cuanto a la estabilidad, al perturbar una misma solicitud de 8 formas distintas, la tasa media de cambio de decisión fue del 1,3 %; si solo se reformulaban, invertían o barajaban las opciones, la tasa de cambio fue cero. El principio que Microsoft fijó para esta prueba es:

"Equivalent inputs should produce equivalent decisions." (Entradas equivalentes deben producir decisiones equivalentes.)

Las pruebas de seguridad abarcaron 11 referencias y 5.250 solicitudes, entre ellas contenido dañino, jailbreak e inyección de prompts, pero el texto no ofrece tasas de rechazo.

Hay varios datos del uso interno. El equipo de investigación de Xbox lo empleó para procesar más de diez mil comentarios de usuarios, con una calidad equiparable a la de GPT-6 Sol, una velocidad más de 14 veces superior y un coste más de 200 veces menor; el equipo de Copilot midió una calidad equiparable a la de GPT-5.6 Luna y una velocidad 100 veces superior. Todo ello procede de mediciones propias de Microsoft. El artículo no enumera cuáles son las 36 pruebas ni la precisión concreta en cada una, y por ahora no existe ninguna reproducción de terceros. En cuanto a qué modelo quedó en segundo lugar y cuánto más lento es, el texto original de Microsoft y la versión en chino ofrecen relatos que no coinciden; conviene atenerse a las actualizaciones oficiales posteriores.

El precio sigue al uso

El precio es de 0,042 dólares por millón de tokens de entrada, con salida gratuita, lo que, según la conversión de ITHome, equivale a unos 0,28 yuanes. La salida de las llamadas de decisión suele constar de apenas unos pocos tokens y el dinero se va sobre todo en el contexto de entrada; esta tarifa encaja con el uso real.

En las aplicaciones, este tipo de modelo suele colocarse delante del modelo grande: primero decide a qué modelo debe ir una solicitud y por qué flujo debe seguir, o juzga si el resultado de un paso del agente es aceptable, y luego determina el siguiente paso. Hasta ahora esos juicios los hacía casi siempre de pasada un modelo grande de propósito general; sustituirlo por un modelo especializado, pequeño y rápido ahorra latencia y coste de llamadas.

La base viene de Qwen

El artículo contiene una frase de peso: Decision-1 se postentrenó (post-training) sobre Qwen3.5-9B, el modelo abierto de Alibaba. Microsoft añade que más adelante trasladará el mismo método a otras bases y menciona expresamente los modelos propios de Microsoft AI (MAI) y los de OpenAI.

Para los desarrolladores de China, esta información puede leerse desde tres ángulos. Primero, los pesos abiertos de Qwen han entrado en un producto oficial de Microsoft, que en el anuncio deja constancia expresa de su procedencia. Segundo, para los equipos que quieran construir algo parecido, el camino queda prácticamente a la vista: tomar un modelo abierto de la clase de 9B, postentrenarlo en torno a "opciones fijas más probabilidades calibradas" y obtener el resultado en una sola pasada. Tercero, el propio Decision-1 no tiene pesos abiertos, así que en China solo se puede usar mediante las interfaces de Foundry u OpenRouter; en cambio, su base, Qwen3.5-9B, sí puede descargarse directamente.

Este año Microsoft ha ido lanzando varios modelos propios de la familia MAI. Decision-1 arranca apoyándose en una base abierta externa; si los resultados se mantendrán tras el cambio a una base MAI, dependerá de los datos que se publiquen con la próxima versión.

Fuentes: artículo de Microsoft en Command Line, CocoLoop, ITHome; el número de pruebas de referencia, el múltiplo de latencia y el precio por millón de tokens se contrastaron según el criterio de medición propio de Microsoft.