Le 9 octobre, Microsoft a présenté dans sa publication technique Command Line le Microsoft-Decision-1, un modèle qui ne fait que des « questions à choix » : routage, classification, classement, validation et pilotage de flux de travail. L'article est signé Achint Srivastava, vice-président de l'ingénierie logicielle au bureau du directeur technique de Microsoft. Le modèle est disponible sur Microsoft Foundry et a aussi été intégré à OpenRouter.
Sa sortie est très étroite. L'appelant fournit d'abord un ensemble fixe d'options, le modèle renvoie pour chacune une probabilité calibrée, et le logiciel exécute directement le résultat. Il prend en charge les questions oui/non, les choix multiples, la notation et la notation selon une grille d'évaluation (rubric) ; rédiger de longs textes ou raisonner de façon complexe ne fait pas partie de son rôle.
Les résultats annoncés par Microsoft
Microsoft affirme que Decision-1 obtient la meilleure précision dans une comparaison portant sur 36 benchmarks et près de 150 000 questions, avec une latence P50 d'environ 1/35 de celle de GPT-6 Sol. L'article donne un exemple : dans un processus qui enchaîne 20 décisions, si chacune prend 100 millisecondes de plus, toute la chaîne ralentit de 2 secondes.
Côté stabilité, lorsqu'une même requête était perturbée de 8 façons différentes, le taux moyen d'inversion de la décision était de 1,3 % ; en se contentant de reformuler, d'inverser ou de mélanger l'ordre des options, ce taux tombait à zéro. Le principe que Microsoft a fixé pour ce test est le suivant :
« Equivalent inputs should produce equivalent decisions. » (Des entrées équivalentes doivent produire des décisions équivalentes.)
Les tests de sécurité couvrent 11 benchmarks et 5 250 requêtes, dont des contenus nuisibles, des jailbreaks et des injections de prompt, mais le texte ne donne pas de taux de refus.
Plusieurs séries de chiffres proviennent des essais internes. L'équipe de recherche de Xbox l'a utilisé pour traiter plus de dix mille retours d'utilisateurs, avec une qualité comparable à celle de GPT-6 Sol, une vitesse plus de 14 fois supérieure et un coût plus de 200 fois inférieur ; l'équipe Copilot a mesuré une qualité comparable à celle de GPT-5.6 Luna et une vitesse 100 fois supérieure. Tout cela provient de mesures faites par Microsoft elle-même. L'article ne précise ni le nom des 36 benchmarks ni la précision obtenue pour chacun, et aucune reproduction par un tiers n'existe pour l'instant. Quant à savoir quel modèle arrive en deuxième position et de combien il est plus lent, le texte original de Microsoft et la reprise en chinois ne concordent pas ; mieux vaut s'en remettre aux mises à jour officielles ultérieures.
Une tarification calquée sur l'usage
Le prix est de 0,042 dollar par million de tokens en entrée, sortie gratuite, soit environ 0,28 yuan d'après la conversion d'ITHome. La sortie d'un appel de décision ne compte souvent que quelques tokens, et l'argent part surtout dans le contexte d'entrée ; cette grille correspond donc bien à l'usage réel.
Dans les applications, ce type de modèle se place généralement en amont du grand modèle : il détermine d'abord à quel modèle confier une requête et quel flux lui faire suivre, ou juge si le résultat d'une étape d'un agent est acceptable, avant de décider de la suite. Ces jugements étaient jusqu'ici le plus souvent rendus au passage par un grand modèle généraliste ; les confier à un petit modèle spécialisé et rapide permet d'économiser de la latence et des frais d'appel.
La base vient de Qwen
Une phrase de l'article pèse lourd : Decision-1 a été post-entraîné (post-training) sur Qwen3.5-9B, le modèle ouvert d'Alibaba. Microsoft ajoute qu'elle transposera ensuite la même méthode à d'autres bases, en citant les modèles maison de Microsoft AI (MAI) et ceux d'OpenAI.
Pour les développeurs chinois, cette information se lit sous trois angles. D'abord, les poids ouverts de Qwen sont entrés dans un produit officiel de Microsoft, qui en indique expressément la provenance dans son annonce. Ensuite, pour les équipes qui voudraient construire quelque chose de comparable, le chemin est à peu près dévoilé : prendre un modèle ouvert de classe 9B, le post-entraîner autour du principe « options fixes plus probabilités calibrées » et obtenir le résultat en une seule passe avant. Enfin, Decision-1 lui-même n'a pas de poids ouverts ; en Chine, on ne peut l'utiliser que via les interfaces de Foundry ou d'OpenRouter, tandis que sa base, Qwen3.5-9B, peut être téléchargée directement.
Cette année, Microsoft a déjà lancé successivement plusieurs modèles maison de la famille MAI. Decision-1 démarre en s'appuyant sur une base ouverte externe ; savoir si les performances se maintiendront après le passage à une base MAI dépendra des chiffres de la prochaine version.
Sources : article de Microsoft dans Command Line, CocoLoop, ITHome ; le nombre de benchmarks, le multiple de latence et le prix par million de tokens ont été recoupés selon la méthode de mesure propre à Microsoft.