产品简介
ThinkingBox 是微软与 Hugging Face 在 2026 年 10 月 3 日联合发布的智能体评测沙箱,配套的基准叫 ThinkingBox-Bench。它评判一个智能体的方式很直接:不看它最后说了什么,也不数它调了几次工具,而是看它跑完之后后台数据库里留下了什么。
507 个任务覆盖零售、车险、旅行、数字银行和咨询五类企业工作流。每个任务定义好起始后端状态、用户目标、可用的 MCP 工具和领域策略,然后从完全一致的干净状态出发独立跑 20 次,每次都是隔离的 MCP 会话,两次尝试之间不共享任何数据库行或工具缓存状态,这才是 20 次对比有意义的前提。跑完之后由副作用提取器算出真正改动了什么,再由确定性判定器比对要求的终态:任何能产出正确结果的轨迹都算通过,写错、漏写、多写都算不过。507 个任务中 477 个只看状态,剩下 30 个额外加一道二元量规,处理像「有没有告知客户这个结果不作保证」这类没有干净数据库值的要求。
官方给出的动机案例很能说明问题:一个售后智能体处理延迟配送,九次工具调用看着都对,退款政策也读对了,工单被标成已解决,但快递异常其实还没关掉、客户真正问的问题也没有回答。只检查工具调用或最后一句话的评测会给它满分,数据库不同意。
沙箱和数据集都放在 Hugging Face 上,harness 走 MIT 许可,数据集走 CDLA-Permissive-2.0,基准通过 OpenEnv 接口提供,每跑完一集返回一个二元的通过与不通过奖励。
核心功能
- 以终态数据库状态判定:判定器比对的是跑完之后数据库里真正留下的状态与副作用,接受任何能产出正确结果的轨迹,写错字段、多出效果、缺少效果都判不过
- 每个任务独立重跑 20 次:每次尝试拿到隔离的 MCP 会话与全新初始化的状态,两次尝试不共享数据库行或缓存的工具状态,让 20 次之间的比较站得住
- 模拟用户持有私有上下文:预订号、偏好或出生日期这类信息由模拟用户持有,只有被问到时才释放,逼着智能体主动补全缺失信息
- 五类企业工作流:507 个任务分布在零售、车险、旅行、数字银行与咨询,其中 477 个纯状态判定,30 个额外加回答量规
- 失败原因分类:官方把失败分成工具使用 79.9%、状态更新写错 10.3%、用户问题未解决完 7.0%、完全没有触发状态变更动作 2.9%,其中工具使用多数是可重试的失败
- OpenEnv 接口与本地自跑:基准通过 OpenEnv 提供,在 Linux 与 WSL 上用 Python 3.11+、uv 与 Docker 可自行部署;同一个接口也能接进训练流程,只是官方发布的适配器面向评测
适合谁用
以下类型的用户会特别受益于 Microsoft ThinkingBox:
- 要在上线前验证智能体是否真的把业务状态改对的工程团队
- 想看同一任务多次运行一致性的模型评测者,单次通过率与 20 次全过率会给出两个不同的名次
- 研究工具调用失败恢复、前置条件校验与空查询处理的团队
- 需要按「可靠完成一个任务」而不是「单次成功」来算成本的人,官方把每次运行成本折算成了每个可靠任务的成本
优点亮点
- 判定基于可执行的终态检查,477 个任务不依赖对智能体回答的主观评分
- 20 次独立重跑给出一致性维度,Kimi-K3 解决过 93.89% 的任务却只有 68 个(13.41%)在 20 次里全过,这个差异单次评测看不到
- harness 走 MIT、数据集走 CDLA-Permissive-2.0,代码与数据都能直接拿去用
- 通过 OpenEnv 接口提供,评测与训练可以共用同一套环境定义
- 官方如实标注任务是按企业模式合成重建、其中的客户不是真实数据,并说明成本数字取自 2026 年 9 月 20 日 OpenRouter 快照的未折扣标价,是比较指数而不是云账单
价格与方案
harness 以 MIT 许可开放,基准数据集以 CDLA-Permissive-2.0 开放,两者都可以在 Hugging Face 获取,自行运行不产生许可费用。运行需要自备模型端点,承担智能体、模拟用户与判定器三个角色,一个端点可以同时扮演三者,官方称这是最简单的起步方式。环境要求 Linux 或 WSL、Python 3.11 以上、uv 与 Docker,并需要检出固定版本的数据仓库。
总结与建议
ThinkingBox 最值得看的地方,是把评测口径从「模型说了什么」挪到了「数据库里剩下什么」。这个挪动带来的是硬结论:12 个模型的 121,680 次有效试验中 79,853 次没通过可执行检查,而这些失败里有 67.24% 是干净收尾的,状态改了、工具没有报错、表面一切正常。按这个口径,18 个模型没有一个能在超过一半的任务上做到 20 次全对,Claude Opus 5 与 5.5 各自 241 个(47.53%),Opus 5.5 的单次通过率更高(67.16%)但可靠任务数没有增加。
对做智能体的人来说,失败分类比榜单名次更实用:79.9% 的失败归在工具使用上,多数是可重试的失败而不是推理错误。官方也提醒这些是可观测标签而非因果解释,并且他们还没有实测过任何改进手段在这个基准上能带来多少提升。
版本演进
- ThinkingBox 与 ThinkingBox-Bench 发布 (2026-10-03):微软与 Hugging Face 联合发布智能体评测沙箱 ThinkingBox 与基准 ThinkingBox-Bench,507 个有状态企业工作流覆盖零售、车险、旅行、数字银行与咨询,每个任务从干净状态独立跑 20 次,以终态数据库状态与副作用做可执行判定。12 个模型的 121,680 次有效试验中 79,853 次未通过,67.24% 的失败在改动状态后干净收尾且没有工具报错;失败样本里 77.61% 写错字段、43.30% 多出效果、25.36% 缺少效果。18 模型榜上 Claude Opus 5.5 以 67.16% 单次通过率居首,Kimi-K3 是开源权重最强(57.37%)但只有 68 个任务 20 次全过。harness 走 MIT、数据集走 CDLA-Permissive-2.0,基准通过 OpenEnv 接口提供