微软和 Hugging Face 联合发布了智能体评测框架 ThinkingBox 及配套基准 ThinkingBox-Bench。它评分的依据是智能体干完活之后,后台数据库里实际变成了什么样,而智能体自己汇报”已完成”的那段文字不算数。
基准包含 507 个有状态的业务流程任务,分布在五个行业:零售 98 个、车险 100 个、旅行 104 个、数字银行 104 个、咨询 101 个。每个任务在干净的后端上独立跑 20 次,用可执行的检查脚本核对数据库终态和副作用,比如该改的字段改没改对、有没有顺手改了不该动的记录。
团队在博客里把问题概括成一句话:
“The Agent Said It Was Done. The Database Disagreed.” (智能体说做完了,数据库不这么认为。)
18 个模型的成绩
参测的是 18 个模型,闭源和开源权重都有。按”20 次全部通过”统计,Claude Opus 5.5 和 Claude Opus 5 并列第一,各稳定解决 241 题,占 47.53%;GPT-6 Astra 以 231 题、45.56% 排第三。也就是说,表现最好的模型,在一半以上的任务上做不到次次正确。
覆盖面最广的是 Kimi-K3:507 题里有 476 题至少做对过一次,比例 93.89%。可它 20 次全对的只有 68 题。同一个模型,按 pass@20 看几乎全能,按稳定性看排在后面,两个数字差了七倍。
失败原因的统计更具体。在 79853 次”正常跑完但结果错误”的尝试里,77.61% 有字段值写错,43.30% 造成了意料之外的副作用(两类可以同时出现)。团队判断,约八成失败出在工具调用环节,比如参数传错、调用顺序不对,推理本身出错的比例反而小。
团队还给出了”每个可靠任务的成本”,即在 20 次运行中稳定完成一个任务平均要花多少钱:GPT-5.4 为 6.80 美元,GPT-6 Astra 为 7.45 美元,Claude Opus 5.5 为 7.80 美元。老一代的 GPT-5.4 在这一项上排在新模型前面。
跟已有的智能体基准比
用多次运行衡量稳定性,ThinkingBox 并非首创。Sierra 在 2024 年发布的 τ-bench 就提出过 pass^k 指标,要求模型在同一任务上连续 k 次都成功,当时覆盖零售和航空两个场景。ThinkingBox 的区别在规模和判定方式:任务数扩到 507 个、行业扩到五个,并且把副作用单独列为失败条件。在 τ-bench 的口径里,智能体多改了一条无关记录未必会被扣分。
本站此前报道过伯克利的 Vero 基准,那套测试让智能体完成 43 个软件项目,最好的成绩是做完 27 个,衡量的是”一次能做多大的活”。ThinkingBox 的问题方向相反:任务本身不难,看的是同一件事交给它二十遍,会不会有一遍出错。企业流程里,后者往往更要命,一次改错保单金额或转账字段,补救成本远高于一次没做完。
怎么拿来用
代码以 MIT 许可开源,基准数据采用 CDLA-Permissive-2.0,OpenEnv 环境为 BSD-3-Clause,可以通过 Hugging Face 上的 OpenEnv 接口直接跑。本地部署需要 Docker 和 Typesense 管理状态,工具通过 MCP 服务器提供,另外要配三个模型端点:被测智能体、模拟用户、评判模型。
模拟用户和评判都由模型扮演,这一环本身也会引入误差。博客没有单独披露评判模型与人工标注的一致率,这部分数据出来之前,各模型之间一两个百分点的差距不宜过度解读。参与项目的还有来自匹兹堡大学、加州大学尔湾分校、西北大学和哥伦比亚大学的实习生。
参考来源:Hugging Face 博客、Microsoft Research、CocoLoop、Sierra τ-bench 论文;各模型通过题数、失败类型比例与单任务成本均以 ThinkingBox 团队公布口径为准。