微軟Decision-1底座是千問9B

微軟 10 月 9 日在自家技術刊物 Command Line 上發表 Microsoft-Decision-1,這是一個專做「選擇題」的模型:路由、分類、排序、驗證、工作流程控制。署名作者是微軟技術長辦公室的軟體工程副總裁 Achint Srivastava。模型已在 Microsoft Foundry 上架,也接入了 OpenRouter。

它的輸出範圍很窄。呼叫端先給一組固定選項,模型針對每個選項給出一個經過校準的機率,軟體拿到結果後直接執行。是/否、多選、評分、依評分細則(rubric)打分都支援;撰寫長文、處理複雜推理不在它的分工之內。

微軟自行公布的成績

微軟表示,Decision-1 在 36 項基準測試、近 15 萬道題目的比較中準確率最高,P50 延遲約為 GPT-6 Sol 的 1/35。文章舉了個例子:一條流程串接 20 個決策,每個多花 100 毫秒,整條鏈就慢 2 秒。

穩定性方面,同一個請求施加 8 種擾動,決策平均翻轉率為 1.3%;只改寫、反轉或打亂選項順序時,翻轉率為 0。微軟替這項測試訂下的原則是:

「Equivalent inputs should produce equivalent decisions.」(等價的輸入應當得到等價的決策。)

安全測試涵蓋 11 項基準、5250 筆請求,類型包括有害內容、越獄與提示注入,但文中並未提供拒絕率。

內部試用也有幾組數據。Xbox 研究團隊用它處理一萬多則使用者回饋,品質與 GPT-6 Sol 相當,速度快 14 倍以上,成本低 200 倍以上;Copilot 團隊測得品質與 GPT-5.6 Luna 相當,速度快 100 倍。這些都來自微軟自行測試,36 項基準各自叫什麼、具體準確率多少,文章並未列出,目前也沒有第三方重現。至於排名第二的是哪個模型、慢多少,微軟原文與中文轉述的說法對不上,請以官方後續更新為準。

定價貼著用法走

價格是每百萬輸入 token 0.042 美元,輸出免費,依 IT之家的換算約合 0.28 元人民幣。決策類呼叫的輸出往往只有幾個 token,錢主要花在輸入的上下文上,這套定價與實際用法相符。

這類模型在應用程式裡通常放在大模型前面:先判斷一則請求該交給哪個模型、走哪條流程,或是判斷智慧代理(agent)某一步的產出合不合格,再決定下一步。這些判斷原本多半由通用大模型順手處理,換成小而快的專用模型,省下的是延遲與呼叫費用。

底座來自千問

文中有一句話分量不輕:Decision-1 是在阿里巴巴開源的 Qwen3.5-9B 上做的後訓練。微軟還說,之後會把同一套方法移植到其他底座上,點名了 Microsoft AI(MAI)的自研模型和 OpenAI 的模型。

對中國的開發者來說,這則消息可以從三個面向來看。第一,千問的開源權重進入了微軟的正式產品,而且微軟在發表文中寫明了出處。第二,想做同類產品的團隊,路徑基本上攤開了:找一個 9B 等級的開源模型,圍繞「固定選項加校準機率」做後訓練,單次前向傳遞就能出結果。第三,Decision-1 本身沒有開放權重,在中國要用只能走 Foundry 或 OpenRouter 的介面;它的底座 Qwen3.5-9B 倒是可以直接下載。

微軟今年已陸續推出多款 MAI 自研模型。Decision-1 先借外部開源底座起步,等換到 MAI 底座之後成績能否維持,要看下一版公布的數據。

參考來源:微軟 Command Line 發表文、CocoLoop、IT之家;依微軟自行測試的口徑核對基準數量、延遲倍數與每百萬 token 價格。