Googleの研究チームは10月1日、arXivに論文を提出し、エージェントの検証フレームワーク「VeriHarness」を公開した。コードはGitHubでApache 2.0ライセンスのもと同時に公開されている。同フレームワークが取り組む課題は具体的だ。エージェントが数十ステップに及ぶ長時間タスクを実行し、表やレポート、編集済みファイルを提出したとき、その出来を誰が正しいと判断するのかという問題である。
VeriHarnessの手法は、回答を生成したモデル自身に検証を担わせるというものだ。同じ問題を同一モデルに複数回独立して実行させ、得られた複数の結果を並べて比較し、「意見の相違」と「意見の一致」の2つに分けてそれぞれ処理する。
二つの検証ルート
一つ目は意見の相違への対処だ。複数の結果が結論で食い違う場合、検証担当は再びタスク環境に戻って証拠を探す。元のファイルを開き直したり、表の該当セルを確認したりし、環境内で確認できる事実を使って誤った主張を排除していく。
二つ目は意見の一致への対処だ。複数の結果が一致していても、フレームワークはそのまま通過させない。あえて結論を覆せる証拠を積極的に探し、同時にすべての実行がタスクの同じ要件を見落としていないかも確認する。論文の前提は、複数回の実行が同じ答えに達したとしても、その答えが正しいとは保証されない、という点だ。モデルが毎回同じミスを繰り返す可能性は十分にある。
二つのルートが終わると、裁定の段階に入る。最も出来の良い結果をベースに選び、見つかった証拠に基づいて修正を加え、必要なら全体をやり直し、それでも解消できなかった問題は別途記録する。フレームワークは検証担当にワークスペースや証拠収集ツール、再利用可能な「検証スキル」のセットを与えており、論文によればこれらのスキルは失敗のフィードバックをもとに自己改善できるという。
何をテストし、どれだけ向上したか
評価は5つの長時間ワークスペース系ベンチマークを対象とする。APEX-Agents、Workspace-Bench Lite、WorkBuddy Bench、SpreadsheetBench 2、JobBenchで、いずれもオフィス文書や表、応募書類などファイルの提出を求める課題が中心だ。生成と検証は同一モデルで行い、Gemini 3.5 FlashとClaude Opus 4.8の2モデルをテストした。いずれもVertex AI経由で呼び出している。
論文とREADMEによれば、VeriHarnessは5つのベンチマークすべてで「選択スコア」が1位となり、比較対象には単発生成や従来のLLM-as-a-Verifier系の手法が含まれる。証拠に基づく修正を加えた結果、単発生成と比べてGemini 3.5 Flashは平均6.2点、Claude Opus 4.8は平均6.4点向上した。
チームはまた、Hugging Face上で約2万6000件の実行履歴を公開した。両モデルが5つのベンチマークで各問題を10回ずつ実行したもので、レンダリングされた実行過程、提出ファイル、採点結果が付属する。ベンチマークの入力や正解データは公開されていない。論文によれば、このデータセットの作成には10万ドル以上を要したという。
「複数回実行して多数決」とどう違うか
モデルを複数回実行して多数決を取るのは、業界で一般的な精度向上策だ。コストが低く実装も容易で、短い一問一答では効果がはっきり出る。だが長時間タスクに持ち込むと二つの問題が生じる。提出物がファイルである場合、単純に多数決を取ることができない。そして複数の結果が一致している場合、多数決はその共通の誤りをそのまま残してしまう。VeriHarnessの二つのルートは、この二つの問題にそれぞれ的を絞っている。
もう一つよくある手法は、モデルを審査員役にして複数の結果を読ませ、そのまま採点させるというものだ。この方法は審査役の読解と判断に依存し、環境へ戻って確認することはない。VeriHarnessは「主張が環境内で見つかる証拠によって裏付けられるか」を中心に置いており、その代わり検証自体がツールを呼び出しトークンを消費するエージェント的なタスクになる。論文は検証工程が生成工程に対してどれだけ余分なコストになるかの数値は示していない。企業がこのコストを算出したい場合、現時点では自分たちで測定するしかない。
本誌は以前、Microsoftの「ThinkingBox」ベンチマークを報じたことがある。同じタスクを20回繰り返して実行し、エージェントの結果がどれだけ安定しているかを見るものだ。両者の方向性は一致している。長時間タスクでは単発の成績の参考価値は限られており、複数回の実行間の差異そのものが一つの信号になる。一方は安定性を測るために使い、もう一方は誤りを見つけるために使う。
今すぐ使えるのか
READMEによれば、動作環境はLinuxで、Python 3.10以上、Node.js 22.19以上、Docker、そして非特権ユーザーネームスペースが必要だという。基盤はオープンソースの「pi」ランタイム上で動作し、piが対応するモデルプロバイダーであればどれでも接続できる。プロジェクトページにはこうも書かれている。
「これはGoogleが公式にサポートする製品ではありません。」
つまり現時点では研究用コードであり、Googleは保守を約束していない。論文でテストされた2モデルはいずれも各社の最新世代ではなく、Gemini 4やOpus 5.5に置き換えた場合に向上幅がどれだけ残るかは著者らもテストしていない。この部分は第三者による再現を待つしかない。
参考資料:arXiv論文「VeriHarness: Scaling Agentic Verification for Long-Horizon Tasks」、Google Research GitHubプロジェクトページ、CocoLoop、Hugging Faceデータセットページ。論文とREADMEで5つのベンチマーク名、2モデルの平均向上点数、約2万6000件の実行履歴、動作環境の要件を確認した。