微軟與Hugging Face聯合發布了AI Agent評測框架ThinkingBox,以及配套的基準測試ThinkingBox-Bench。它的評分依據是AI Agent完成工作之後,後台資料庫裡實際變成什麼樣子,AI Agent自己回報「已完成」的那段文字並不算數。
這套基準包含507個有狀態的業務流程任務,分布在五個產業:零售98個、車險100個、旅遊104個、數位銀行104個、顧問服務101個。每個任務都在乾淨的後端上獨立跑20次,用可執行的檢查腳本核對資料庫的最終狀態與副作用,例如該改的欄位有沒有改對,有沒有順手改動不該碰的紀錄。
團隊在部落格裡把問題歸納成一句話:
"The Agent Said It Was Done. The Database Disagreed."
(AI Agent說做完了,資料庫不這麼認為。)
18個模型的成績
參與測試的是18個模型,涵蓋閉源與開源權重。按「20次全部通過」統計,Claude Opus 5.5與Claude Opus 5並列第一,各穩定解決241題,佔比47.53%;GPT-6 Astra以231題、45.56%排第三。也就是說,表現最好的模型,在超過一半的任務上都做不到每次正確。
覆蓋面最廣的是Kimi-K3:507題裡有476題至少答對過一次,比例93.89%。但它二十次全對的只有68題。同一個模型,按pass@20來看幾乎無所不能,按穩定性來看卻排在後段,兩個數字差了七倍。
失敗原因的統計更具體。在79,853次「正常跑完但結果錯誤」的嘗試裡,77.61%寫錯了欄位值,43.30%造成了預期外的副作用(兩者可以同時出現)。團隊判斷,大約八成失敗出在工具呼叫這一環,例如參數傳錯、呼叫順序不對;推理本身出錯的比例反而小。
團隊還給出了「每個可靠任務的成本」,也就是在20次執行中穩定完成一個任務平均要花多少錢:GPT-5.4是6.80美元,GPT-6 Astra是7.45美元,Claude Opus 5.5是7.80美元。舊世代的GPT-5.4在這一項反而排在新模型前面。
跟現有的AI Agent基準比較
用多次執行來衡量穩定性,ThinkingBox並非首創。Sierra在2024年發布的τ-bench就提出過pass^k指標,要求模型在同一任務上連續k次都成功,當時涵蓋零售與航空兩個場景。ThinkingBox的差異在於規模與判定方式:任務數擴增到507個、產業擴增到五個,並且把副作用單獨列為失敗條件。在τ-bench的計算方式裡,AI Agent多改了一筆無關紀錄未必會被扣分。
本站先前報導過柏克萊的Vero基準,那套測試讓AI Agent完成43個軟體專案,目前最好的成績是做完27個,衡量的是「一次能做多大的事」。ThinkingBox的問題方向正好相反:任務本身不難,看的是同一件事交給它二十遍,會不會有一遍出錯。在企業流程裡,後者往往更致命,一次改錯保單金額或轉帳欄位,補救成本遠高於一次沒做完。
怎麼用
程式碼以MIT授權開源,基準資料採用CDLA-Permissive-2.0,OpenEnv環境為BSD-3-Clause,可以透過Hugging Face上的OpenEnv介面直接執行。本地部署需要Docker與Typesense管理狀態,工具透過MCP伺服器提供,另外要設定三個模型端點:受測的AI Agent、模擬使用者、評判模型。
模擬使用者與評判都由模型扮演,這一環本身也會帶入誤差。部落格沒有單獨公開評判模型與人工標註的一致率,在這項數據出來之前,各模型之間一兩個百分點的差距不宜過度解讀。參與專案的還有來自匹茲堡大學、加州大學爾灣分校、西北大學與哥倫比亞大學的實習生。
參考來源:Hugging Face部落格、Microsoft Research、CocoLoop、Sierra τ-bench論文;各模型通過題數、失敗類型比例與單任務成本均以ThinkingBox團隊公布的口徑為準。