一次迟到的「工具使用」评测补课

大模型智能体能不能用好工具,是 2026 年行业最在意的能力之一。但评测这块长期有个缺口:多数工具调用基准要么用模拟环境,要么把工具清单喂到模型嘴边,考的是「给四选一你会不会挑」。Scale AI 在 2026 年 5 月提交、后更新到 v3 的 MCP-Atlas(arXiv 2602.00933)想补的正是这个缺口——它把评测搬进 36 个真实在跑的 MCP 服务器、220 个真实工具,让模型自己从一堆语义相近的选项里找出该用的那个,再跨服务器把多步工作流拼起来。论文由 Scale AI 与新加坡国立大学的研究者联合发布,代码已在 GitHub 开源(scaleapi/mcp-atlas)。

1000 个任务,不告诉你用哪个工具

基准包含 1000 个由人类专家编写并核验的自然语言任务,横跨 36 个真实 MCP 服务器与 220 个工具。关键设计在于:任务提示不指定服务器、不指定工具、也不指定参数。模型得先读懂请求,再从一批语义上都说得通的「干扰项」里挑出真正相关的 2 到 8 个工具,然后跨多个服务器把多步流程编排出来。每个任务启用 6 到 37 个工具,其中只有少数相关,其余都是合理但错误的近邻。这把评测从「调用」拉到「发现、选择与编排」——恰好是生产环境里最容易被忽略、也最容易翻车的那段能力。任务平均对应 4.7 条原子事实声明(范围 1 到 23),为后面的打分埋下伏笔。

打分方式变了:从「答对没有」到「覆盖了多少事实」

MCP-Atlas 的打分用的是 claim-level rubric:把最终答案对照从工具输出中提炼出的原子事实声明逐条判定,而不是和单一标准答案做严格匹配。好处是明显的——只要一条轨迹最终拿到了被事实支撑的结果,即便走的工具调用顺序和参考答案不同,也能拿分。这种「以答案为中心」的打分,把结果与模型的啰嗦程度、文风解耦。也正因为口径变了,读分数时必须看阈值:论文 v3 给出的顶分 82.2%(Muse Spark)是在 0.75 claim-coverage 阈值下测得的,意思是答案只需覆盖约四分之三的必需事实即算通过。早一代 2025 年的排行榜用二元匹配,当时 GPT-5 以 44.5% 领先,中位模型仅 23.9%——两个数字都出自同一团队,但测的是不同的问题与不同的任务集,不能拿来直接比。

63.3% 的失败是认知,不是机械

这版基准里值得写进工程手册的,是那套 11 类诊断分类法。它把失败拆成「工具调用失败」与「认知失败」两类:前者是参数拼错、工具选错、不会恢复错误;后者是任务理解偏差、事实捏造、综合错误、约束违反、过早收尾。在约 6900 个被诊断的失败里,63.3% 落在认知侧,只有 36.7% 是工具调用侧。换句话说,瓶颈不在 MCP 传输、不在重试、也不在工具文档,而在模型对自己已经拿到的证据能不能正确推理。较新的模型几乎消灭了「过早收尾」(GPT-5.5 仅 3.6%、Claude Opus 4.7 仅 3.8% 的失败源于此),却换来了更高的「错误综合」率(GPT-5.5 为 19.8%、Claude Opus 4.7 为 25.0%)——智能体现在能跑完整个流程,却可能在把证据拼成结论时出错。那个 82.2% 之外的约 18% 缺口,几乎全是认知层面的。

梯队结构与 82.2% 这个数字怎么读

在 20 个来自 6 家厂商的前沿模型上,论文观察到清晰的三层梯队结构:头部梯队(Muse Spark 82.2%、Claude Opus 4.7 79.1%、Gemini 3.1 Pro Preview 78.2%、Claude Opus 4.6 76.8%、GLM-5.1 75.6%、GPT-5.5 75.3%)在 0.75 覆盖阈值下超过 75%;第二梯队(GPT-5.4 70.6%、Gemini 3 Pro Preview 70.3%、Claude Opus 4.5 69.8%、Claude Sonnet 4.6 69.5%、GPT-5.2 67.6%)落在 67% 到 71%;其余为第三梯队。需要说明,公开 Scale Labs 排行榜之后已更新到 30 个条目、顶分抬到 88.1%(Muse Spark 1.1),所以写文章引用时应把 82.2% 明确为「v3 论文给出的结果」,而非当下排行榜上限。此外,诊断存在 judge 依赖:换用不同的评审模型,绝对通过率会整体平移——任何排行榜分数都部分取决于谁在打分。

对做 MCP 智能体的团队意味着什么

把结论落到工程上,MCP-Atlas 指向几个具体动作。其一,下一波工具调用能力的提升,大概率不来自更好的工具路由,而来自「claim-aware 的停止准则」——让智能体知道什么时候已经收集到足够证据;以及把最终答案对照已收集的工具输出做轨迹级校验。其二,评测要分两层看:工具调用成功率与最终事实覆盖率不是一回事,后者才是用户感知的「对不对」。其三,给智能体一堆语义相近的工具时,发现与选择能力是独立且可训练的短板,值得单独造数据练。MCP-Atlas 还刻意保留 500 个任务的私有拆分以保护排行榜完整性,公开 500 个任务、容器化 harness 与 claim 评估器,让社区能复现与扩展。

结语

MCP-Atlas 的价值,不在又给模型排了一次座次,而在它把工具调用评测的矛头从「调得对不对」悄悄拨向「想得对不对」。63.3% 的认知失败占比,是一记提醒:当工具越来越好接、传输越来越稳,智能体的天花板更多卡在推理而非工程。对做 MCP 智能体的团队,这份基准最该带走的,是把「证据够不够、综合对不对」当成一等公民来评测与优化。