Microsoftは10月9日、自社の技術媒体「Command Line」でMicrosoft-Decision-1を発表した。ルーティング、分類、ランキング、検証、ワークフロー制御といった「選択」に特化したモデルだ。署名は、同社CTO室のソフトウェアエンジニアリング担当バイスプレジデント、Achint Srivastava氏。モデルはMicrosoft Foundryに登録され、OpenRouterにも対応している。
出力の範囲は意図的に絞られている。呼び出し側が固定の選択肢を渡すと、モデルは各選択肢に対して較正済みの確率を返し、ソフトウェアはその結果をそのまま実行できる。はい/いいえ、多肢選択、スコアリング、評価基準(ルーブリック)に基づく採点に対応する。長文の執筆や複雑な推論は、このモデルの守備範囲ではない。
Microsoftが自己申告する成績
Microsoftによると、Decision-1は36のベンチマーク、約15万問の比較で最高精度を記録し、P50遅延はGPT-6 Solの約35分の1だという。記事には例も挙げられている。20個の判断を連ねたフローで、1回ごとに100ミリ秒余計にかかれば、チェーン全体では2秒遅くなる。
安定性については、同一のリクエストに8種類の摂動を加え、判断が反転した割合は平均1.3%。選択肢の言い換え、反転、並べ替えだけの場合、反転率は0だった。Microsoftはこのテストの原則を次のように定めている。
「Equivalent inputs should produce equivalent decisions.(等価な入力は等価な判断を生むべきだ。)」
安全性テストは11のベンチマーク、5250件のリクエストが対象で、有害コンテンツ、ジェイルブレイク、プロンプトインジェクションなどを含む。ただし、記事には拒否率は示されていない。
社内トライアルの数字もいくつかある。Xbox研究チームは1万件を超えるユーザーフィードバックの処理に使い、品質はGPT-6 Solと同等、速度は14倍以上、コストは200分の1以下だったという。Copilotチームの測定では、品質はGPT-5.6 Lunaと同等で、速度は100倍だった。これらはいずれもMicrosoftの自社テストによるものだ。36のベンチマークの名称や具体的な精度は記事に載っておらず、現時点で第三者による再現もない。2位のモデルがどれで、どれだけ遅いのかについては、Microsoftの原文と中国語での紹介記事で説明が食い違っており、公式の続報を待つ必要がある。
価格は使い方に合わせた設計
価格は入力100万トークンあたり0.042ドル、出力は無料。IT Homeの換算では約0.28元になる。判断系の呼び出しは出力が数トークンにとどまることが多く、費用の大半は入力側のコンテキストにかかる。この料金体系は実際の使われ方と噛み合っている。
こうしたモデルは、アプリケーション内では大規模モデルの前段に置かれるのが一般的だ。リクエストをどのモデルに回すか、どのフローに流すかを判断したり、エージェントの各ステップの出力が合格かどうかを見極めて次の動きを決めたりする。これまでこうした判断は汎用の大規模モデルが片手間にこなすことが多かったが、小型で高速な専用モデルに置き換えれば、遅延と呼び出し費用を減らせる。
基盤はQwen
記事の中に、重みのある一文がある。Decision-1は、Alibabaがオープンソース公開しているQwen3.5-9Bをポストトレーニングして作られたという。Microsoftはさらに、今後は同じ手法を他の基盤にも移していくとして、Microsoft AI(MAI)の自社モデルとOpenAIのモデルを挙げた。
中国の開発者にとって、この情報は三つの角度から読める。第一に、Qwenのオープンウェイトが Microsoftの正式な製品に採用され、Microsoftが発表文で出典を明記したこと。第二に、同種のものを作りたいチームにとって、道筋がほぼ見えたこと。9B級のオープンソースモデルを用意し、「固定の選択肢と較正済み確率」を軸にポストトレーニングすれば、1回のフォワードパスで結果が得られる。第三に、Decision-1自体は重みが公開されておらず、中国から使うにはFoundryまたはOpenRouterのAPI経由に限られる点。一方、その基盤であるQwen3.5-9Bは直接ダウンロードできる。
Microsoftは今年、MAIの自社モデルを相次いで投入してきた。Decision-1は外部のオープンソース基盤からスタートしており、MAI基盤に切り替えた後も成績を維持できるかどうかは、次期版で公表される数字次第だ。
参考資料:Microsoft Command Line 発表記事、CocoLoop、IT Home。ベンチマーク数、遅延倍率、100万トークンあたりの価格はMicrosoftの自社測定ベースで確認。