マイクロソフトとHugging Faceは、エージェント評価フレームワーク「ThinkingBox」と、それに対応するベンチマーク「ThinkingBox-Bench」を共同で公開した。採点の根拠は、エージェントが作業を終えた後にバックエンドのデータベースが実際どう変化したかであり、エージェント自身が「完了しました」と報告する文章は採点対象にならない。
このベンチマークは、状態を持つ業務プロセスのタスク507件で構成され、5つの業界に分散している。小売98件、自動車保険100件、旅行104件、デジタルバンキング104件、コンサルティング101件。各タスクはクリーンなバックエンド上で独立に20回実行され、実行可能な検証スクリプトがデータベースの最終状態と副作用を照合する。変更すべきフィールドが正しく変わったか、触れるべきでないレコードを不用意に変更していないか、といった点を確認する。
チームはブログでこの問題を一文にまとめている。
"The Agent Said It Was Done. The Database Disagreed."
(エージェントは「完了した」と言ったが、データベースはそう認めなかった。)
18モデルの成績
参加したのは18モデルで、クローズドモデルとオープンウェイトモデルの両方が含まれる。「20回すべて成功」という基準で見ると、Claude Opus 5.5とClaude Opus 5が同率1位で、いずれも241問を安定して解き、割合は47.53%。GPT-6 Astraは231問、45.56%で3位につけた。つまり、最も成績の良いモデルでも、半数以上のタスクで毎回正解することはできていない。
最も網羅率が高いのはKimi-K3で、507問のうち476問で少なくとも一度は正解しており、割合は93.89%。しかし20回すべてで正解したのは68問にとどまる。同じモデルでもpass@20で見るとほぼ全能に見えるが、安定性で見ると後方に位置する。両者の数字には7倍の差がある。
失敗要因の集計はさらに具体的だ。「正常に実行を終えたが結果が間違っていた」79,853回の試行のうち、77.61%はフィールドの値を誤って書き込んでいた。43.30%は意図しない副作用を引き起こしていた(両方が同時に起きることもある)。チームの分析では、失敗の約8割はツール呼び出しの段階、たとえばパラメータの渡し間違いや呼び出し順序の誤りに起因しており、推論そのものの誤りが占める割合はむしろ小さい。
チームはさらに「信頼できるタスク1件あたりのコスト」、つまり20回の実行で1タスクを安定して完了させるのに平均いくらかかるかを示している。GPT-5.4は6.80ドル、GPT-6 Astraは7.45ドル、Claude Opus 5.5は7.80ドル。旧世代のGPT-5.4が、この指標では新しいモデルより上位に来ている。
既存のエージェント・ベンチマークとの比較
複数回の実行で安定性を測る手法自体は、ThinkingBoxが最初ではない。Sierraが2024年に公開したτ-benchは、同一タスクでk回連続して成功することを求めるpass^k指標を提唱しており、当時は小売と航空の2シナリオを対象としていた。ThinkingBoxが異なるのは規模と判定方法だ。タスク数を507件、業界を5つに拡大し、副作用を独立した失敗条件として扱っている。τ-benchの基準では、エージェントが関係のないレコードを余分に変更しても、必ずしも減点対象にはならなかった。
本サイトは以前、バークレー発のVeroベンチマークを取り上げた。これはエージェントに43件のソフトウェアプロジェクトを完成させるテストで、これまでの最高成績は27件の完成だった。あちらが測るのは「一度にどれだけ大きな仕事をこなせるか」である。ThinkingBoxの問いはその逆だ。個々のタスク自体は難しくなく、同じ仕事を20回任せたときに一度でも失敗するかどうかを見ている。企業の業務プロセスでは、後者の失敗のほうが深刻になりやすい。保険金額や振込先フィールドを一度誤って書き換えてしまえば、未完成のまま終わるよりもはるかに復旧コストが高くつく。
どう使えるか
コードはMITライセンスでオープンソース化されており、ベンチマークデータはCDLA-Permissive-2.0、OpenEnv環境はBSD-3-Clauseで提供される。Hugging Face上のOpenEnvインターフェースを通じて直接実行できる。ローカルで動かす場合はDockerとTypesenseで状態を管理する必要があり、ツールはMCPサーバー経由で提供される。さらに、テスト対象のエージェント、模擬ユーザー、採点モデルという3つのモデルエンドポイントを設定する必要がある。
模擬ユーザーと採点役はいずれもモデルが担うため、この部分自体が誤差の原因になり得る。ブログでは、採点モデルの判定と人間のアノテーションとの一致率は個別に公開されていない。この数字が出るまでは、モデル間の1〜2ポイント程度の差を過度に解釈すべきではない。プロジェクトにはピッツバーグ大学、UCアーバイン、ノースウェスタン大学、コロンビア大学のインターン生も参加している。
参考資料:Hugging Faceブログ、Microsoft Research、CocoLoop、Sierra τ-bench論文。各モデルの通過数、失敗タイプの割合、タスク単価は、いずれもThinkingBoxチームが公表した基準に基づく。