Microsoft Decision-1 basiert auf Qwen 9B

Microsoft hat am 9. Oktober in seinem Technikmagazin Command Line Microsoft-Decision-1 vorgestellt, ein Modell, das ausschließlich „Multiple-Choice“ beherrschen soll: Routing, Klassifikation, Ranking, Validierung und Workflow-Steuerung. Als Autor ist Achint Srivastava genannt, Vice President für Software Engineering im Büro des Chief Technology Officer von Microsoft. Das Modell ist auf Microsoft Foundry verfügbar und wurde auch in OpenRouter eingebunden.

Seine Ausgabe ist bewusst schmal. Der Aufrufer legt zunächst eine feste Menge an Optionen vor, das Modell liefert für jede Option eine kalibrierte Wahrscheinlichkeit, und die Software führt das Ergebnis direkt aus. Unterstützt werden Ja/Nein-Fragen, Mehrfachauswahl, Bewertungen und Bewertungen nach einem Raster (Rubric); lange Texte zu schreiben oder komplex zu schlussfolgern gehört nicht zu seinen Aufgaben.

Die von Microsoft selbst gemeldeten Ergebnisse

Nach Angaben von Microsoft erzielt Decision-1 in einem Vergleich über 36 Benchmarks mit knapp 150.000 Aufgaben die höchste Genauigkeit, bei einer P50-Latenz von rund einem Fünfunddreißigstel der von GPT-6 Sol. Der Beitrag nennt ein Beispiel: Reiht ein Prozess 20 Entscheidungen aneinander und kostet jede 100 Millisekunden mehr, wird die gesamte Kette um 2 Sekunden langsamer.

Zur Stabilität: Wurde dieselbe Anfrage auf 8 verschiedene Arten gestört, kippte die Entscheidung im Schnitt in 1,3 Prozent der Fälle. Wurden die Optionen nur umformuliert, invertiert oder in ihrer Reihenfolge vertauscht, lag die Kipprate bei null. Das Prinzip, das Microsoft für diesen Test aufstellt, lautet:

„Equivalent inputs should produce equivalent decisions.“ (Gleichwertige Eingaben sollen gleichwertige Entscheidungen hervorbringen.)

Die Sicherheitstests umfassten 11 Benchmarks und 5.250 Anfragen, darunter schädliche Inhalte, Jailbreaks und Prompt Injection; Ablehnungsraten nennt der Beitrag jedoch nicht.

Aus der internen Erprobung liegen mehrere Zahlen vor. Das Xbox-Forschungsteam verarbeitete damit mehr als zehntausend Nutzerrückmeldungen: Die Qualität entsprach GPT-6 Sol, bei über 14-fachem Tempo und mehr als 200-fach niedrigeren Kosten. Das Copilot-Team maß eine Qualität auf dem Niveau von GPT-5.6 Luna bei 100-fachem Tempo. All das stammt aus Microsofts eigenen Messungen. Welche 36 Benchmarks es genau sind und wie hoch die Genauigkeit jeweils ausfällt, führt der Beitrag nicht auf, und unabhängige Reproduktionen gibt es bislang nicht. Welches Modell auf Platz zwei liegt und um wie viel langsamer es ist, schildern Microsofts Originaltext und die chinesische Wiedergabe widersprüchlich; maßgeblich sollten spätere offizielle Aktualisierungen sein.

Die Preisgestaltung folgt dem Einsatz

Der Preis beträgt 0,042 US-Dollar pro Million Eingabe-Token, die Ausgabe ist kostenlos; nach der Umrechnung von ITHome sind das etwa 0,28 Yuan. Die Ausgabe von Entscheidungsaufrufen umfasst oft nur wenige Token, das Geld fließt vor allem in den Eingabekontext. Dieses Preismodell passt also zur tatsächlichen Nutzung.

Solche Modelle sitzen in Anwendungen meist vor dem großen Modell: Sie beurteilen zunächst, an welches Modell eine Anfrage gehen und welchem Ablauf sie folgen soll, oder ob das Ergebnis eines Agentenschritts brauchbar ist, und entscheiden dann über den nächsten Schritt. Diese Urteile übernahm bisher meist nebenbei ein universelles Großmodell; ein kleines, schnelles Spezialmodell spart dabei Latenz und Aufrufkosten.

Die Basis stammt von Qwen

Ein Satz im Beitrag hat Gewicht: Decision-1 wurde auf Alibabas offenem Qwen3.5-9B nachtrainiert (Post-Training). Microsoft kündigt zudem an, dieselbe Methode später auf andere Basismodelle zu übertragen, und nennt dabei die selbst entwickelten Modelle von Microsoft AI (MAI) sowie Modelle von OpenAI.

Für Entwickler in China lässt sich diese Information unter drei Gesichtspunkten lesen. Erstens: Die offenen Gewichte von Qwen sind in ein reguläres Microsoft-Produkt eingegangen, und Microsoft nennt die Herkunft in der Ankündigung ausdrücklich. Zweitens: Wer Ähnliches bauen will, findet den Weg im Wesentlichen offengelegt vor: ein offenes Modell der 9B-Klasse nehmen, es rund um das Prinzip „feste Optionen plus kalibrierte Wahrscheinlichkeiten“ nachtrainieren und das Ergebnis in einem einzigen Vorwärtsdurchlauf erhalten. Drittens: Decision-1 selbst hat keine offenen Gewichte; in China bleibt nur der Zugang über die Schnittstellen von Foundry oder OpenRouter. Die Basis Qwen3.5-9B lässt sich dagegen direkt herunterladen.

Microsoft hat in diesem Jahr bereits mehrere eigene MAI-Modelle nacheinander vorgestellt. Decision-1 startet zunächst auf einer externen offenen Basis; ob die Ergebnisse nach dem Wechsel auf eine MAI-Basis gehalten werden, zeigen erst die Zahlen der nächsten Version.

Quellen: Microsofts Beitrag in Command Line, CocoLoop, ITHome; Anzahl der Benchmarks, Latenzfaktor und Preis pro Million Token wurden nach Microsofts eigenem Messansatz abgeglichen.