ChengRang
EN

Microsoft ThinkingBox 新增

AI 搜索研究 开源

微软与 Hugging Face 联合发布的智能体评测沙箱,507 个有状态企业工作流每个跑 20 次,用终态数据库状态与副作用做可执行判定,而不是看模型说了什么

智能体评测 基准测试 状态判定 MCP 开源工具
访问 Microsoft ThinkingBox 官网

免责声明:测评内容仅代表编辑个人观点和使用体验,不构成任何商业推荐或投资建议。产品信息和价格可能随时变动,请以官方最新信息为准。

产品简介

ThinkingBox 是微软与 Hugging Face 在 2026 年 10 月 3 日联合发布的智能体评测沙箱,配套的基准叫 ThinkingBox-Bench。它评判一个智能体的方式很直接:不看它最后说了什么,也不数它调了几次工具,而是看它跑完之后后台数据库里留下了什么。

507 个任务覆盖零售、车险、旅行、数字银行和咨询五类企业工作流。每个任务定义好起始后端状态、用户目标、可用的 MCP 工具和领域策略,然后从完全一致的干净状态出发独立跑 20 次,每次都是隔离的 MCP 会话,两次尝试之间不共享任何数据库行或工具缓存状态,这才是 20 次对比有意义的前提。跑完之后由副作用提取器算出真正改动了什么,再由确定性判定器比对要求的终态:任何能产出正确结果的轨迹都算通过,写错、漏写、多写都算不过。507 个任务中 477 个只看状态,剩下 30 个额外加一道二元量规,处理像「有没有告知客户这个结果不作保证」这类没有干净数据库值的要求。

官方给出的动机案例很能说明问题:一个售后智能体处理延迟配送,九次工具调用看着都对,退款政策也读对了,工单被标成已解决,但快递异常其实还没关掉、客户真正问的问题也没有回答。只检查工具调用或最后一句话的评测会给它满分,数据库不同意。

沙箱和数据集都放在 Hugging Face 上,harness 走 MIT 许可,数据集走 CDLA-Permissive-2.0,基准通过 OpenEnv 接口提供,每跑完一集返回一个二元的通过与不通过奖励。

核心功能

适合谁用

以下类型的用户会特别受益于 Microsoft ThinkingBox:

优点亮点

价格与方案

harness 以 MIT 许可开放,基准数据集以 CDLA-Permissive-2.0 开放,两者都可以在 Hugging Face 获取,自行运行不产生许可费用。运行需要自备模型端点,承担智能体、模拟用户与判定器三个角色,一个端点可以同时扮演三者,官方称这是最简单的起步方式。环境要求 Linux 或 WSL、Python 3.11 以上、uv 与 Docker,并需要检出固定版本的数据仓库。

总结与建议

ThinkingBox 最值得看的地方,是把评测口径从「模型说了什么」挪到了「数据库里剩下什么」。这个挪动带来的是硬结论:12 个模型的 121,680 次有效试验中 79,853 次没通过可执行检查,而这些失败里有 67.24% 是干净收尾的,状态改了、工具没有报错、表面一切正常。按这个口径,18 个模型没有一个能在超过一半的任务上做到 20 次全对,Claude Opus 5 与 5.5 各自 241 个(47.53%),Opus 5.5 的单次通过率更高(67.16%)但可靠任务数没有增加。

对做智能体的人来说,失败分类比榜单名次更实用:79.9% 的失败归在工具使用上,多数是可重试的失败而不是推理错误。官方也提醒这些是可观测标签而非因果解释,并且他们还没有实测过任何改进手段在这个基准上能带来多少提升。

版本演进

分类
AI 搜索研究
价格
开源
标签
智能体评测 · 基准测试 · 状态判定
官网