一句话:多数智能体评测还在「听它说什么」,微软这套新基准改成了「查它留下了什么」
评测一个智能体干得好不好,惯常做法是看它说了什么、调了哪些工具、最后有没有报个错。10 月 3 日,微软联合 Hugging Face 发布了一套叫 ThinkingBox 的评测环境与配套的 ThinkingBox-Bench 基准,思路很不一样:它不在乎对话文本漂不漂亮,只在乎智能体在后台数据库里留下的记录对不对。换句话说,它把评测从「看表演」变成了「查账本」。这套东西已经在 Hugging Face 上开源,代码走 MIT,基准数据走 CDLA 许可。它要补的,正是当前智能体评测里一个常被忽略的盲区:一个 agent 可能把每句话都说得滴水不漏,工具调用也零报错,但业务系统里的数据其实是错的。
它怎么评:给一个初始状态,跑二十遍,再查账
ThinkingBox-Bench 包含 507 个合成的业务工作流任务,覆盖零售、差旅、保险等领域。每个任务都会设定一个起始的后台状态、一个用户目标、一组 MCP 工具,以及一套业务规则,然后让同一个智能体从完全相同的干净状态独立跑 20 次。跑完之后,一个「副作用抽取器」去推导系统实际改变了什么,再由确定性判定把它和要求的终态做比对。其中 477 个任务只看状态是否达标,另有 30 个会额外加回答维度的评分。微软强调,所有任务都是按企业模式合成重建的,里面的客户不是真人。这种「跑很多遍、看终态」的设计,天生比「跑一遍、看回答」更能暴露不稳定性。
最扎心的发现:失败的长相,是「看起来一切正常」
在覆盖 12 个模型、共 121,680 次有效试验的消融里,论文统计到 79,853 次失败尝试,而其中 67.24% 是以「没有最终工具错误」的状态干净收尾的——也就是说,智能体自己觉得干完了,外部也看不到报错,但后台数据其实是错的。进一步拆解,77.61% 的这类失败是字段值写错,43.30% 多出了不该有的副作用,25.36% 漏掉了本应完成的改动。论文还指出,约五分之四的失败被归到「工具处理」而非「推理」,并说明这是可观察的标签而非因果结论。这层意思很关键:一个 agent 可能不是不会想,而是工具用错了、字段填歪了,却没人听见它出错。
单次过关不等于靠谱:排名会因「一致性」而反转
ThinkingBox 还顺手戳破了「能做一次」和「能稳定做」之间的差距。按单次尝试打分,论文里 Claude Opus 5.5 以 67.16% 居首,略微领先 Claude Opus 5 的 66.50%,领先的开源权重模型 Kimi-K3 为 57.37%。但按「20 次全过」的口径,Kimi-K3 虽然一次性解出了 476 个任务,却只在 68 个上做到二十遍全对;Claude Opus 5.5 则稳稳在 241 个任务上二十遍全过。这个反差说明,单看「解出过几次」会高估一个模型的可用性——对真要上生产的团队,二十遍全对的那 241 个任务,远比「曾经做成过」更有参考价值。成本侧,按可信任务计,GPT-5.4 最便宜(128 个全过任务约 6.80 美元),GPT-6 Astra 为 231 个约 7.45 美元,Opus 5.5 为 241 个约 7.80 美元;论文特意说明这是比较性指数,不是真实云账单。
增量认知:评测的标尺,正在从「对话」挪向「状态」
ThinkingBox 的价值不只在那个 67% 的数字,而在于它把行业评测的注意力往「终态正确性」拉了一把。过去我们太习惯用对话质量、工具调用是否报错来替代理想结果,结果养出一批「话术满分、落库全错」的 agent。对一个真正在企业系统里干活的智能体,它留下的记录才是事实。这套基准对其他团队的可迁移动作很直接:在自己内部评测里,把「执行后的数据库状态」当成一等公民,而不只是看模型自述完成没完成。当然它也有局限——任务是合成的、客户是虚构的,且「二十遍全过」描述的是这批试验,不等于对未来可靠性的保证。
边界:合成基准,别当成真实账单或真实生产
如实交代:ThinkingBox-Bench 的 507 个任务全部是合成重建,模拟的是企业模式而非某家公司的真实系统;成本数字来自某个时间点的价格快照,且论文明确说是比较指数而非实际云费。它衡量的是「在给定规则下留下正确状态」的能力,并不覆盖所有业务风险,比如长周期里的权限漂移、对抗性诱导。把它当作评测思路的升级,比当作选型的最终标尺更合适。真正要让它有用,是把它接进团队自己的任务分布,而不是只看公开榜单那个排名。
结语
智能体评测正在经历一次视角的切换:从「它说得对不对」转向「它做完之后,系统里留下的东西对不对」。ThinkingBox 用一个让人不安的数字提醒行业——大多数失败并不喧哗,它们安静地、无报错地,把错误写进了数据库。能听见这种安静的失败,才是评测开始成熟的样子。