评测方法论:为什么需要长程可靠性
「长程任务可靠性」指智能体在包含多步决策、工具调用与状态依赖的任务上,从头到尾不偏离目标的概率。它与单轮问答或单文件改动的难度不在同一量级:每一步的微小错误会沿链路累积,最终任务失败率远高于单步失败率。
- TAU-bench:模拟客服/后台场景,用户与 Agent 多轮交互并触发工具调用,以任务最终是否解决为指标。
- WebArena:在自托管的电商、论坛、Git、CMS 副本上执行 812 个自然语言任务,以终态是否达成衡量。
- OSWorld:在真实 Ubuntu/Windows/macOS 桌面应用上执行 369 个任务,基于执行结果评测(execution-based)。
三者共同的关键指标是任务成功率(success rate),并各自给出人类基线。人类基线的存在,使「Agent 离可用还有多远」可被量化,而非停留在营销话术。
本评测数据截止 2026 年 9 月,来源为公开榜单与基准论文。榜单条目为模型/系统级(如 Claude Opus 4.5、GPT-5.2),并非单一封装产品;同一底层模型经不同 Agent 框架包装后成绩会浮动。分数仅作能力边界参考,不代表某款产品的实测交付结果。
TAU-bench:工具调用型多步任务
TAU-bench 把任务设计成「用户提出需求 → Agent 调用工具(查库、改单、退款)→ 用户追加约束」的多轮闭环,考验的是工具编排与长上下文一致性。
| 模型 / 系统 | TAU-bench 成功率 | 时间 |
|---|---|---|
| MiniMax M2 | 77.2% | 2025-10 |
| Claude Opus 4.5 | 70.2% | 2025-11 |
| Gemini 3 Pro | 65.8% | 2025-11 |
该基准更贴近「后台业务 Agent」的真实形态:任务不是一次性函数调用,而是带状态、可被打断、需要回滚的会话。当前头部模型已站上 65%–77% 区间,但仍有约四分之一任务无法端到端解决。
WebArena:Web 操作智能体
WebArena 评测 Agent 在浏览器里「点链接、填表单、跨页导航」的能力,覆盖电商、社交、协作编程、CMS 四类站点。
| 模型 / Agent | WebArena 成功率 | 时间 |
|---|---|---|
| Claude Code + GBOX MCP | 68.0% | 2025-10 |
| OpenAI CUA | 58.1% | 2025-01 |
| Google Project Mariner | ~52.4% | 2025 |
| Browser-Use(开源) | ~51.2% | 2025 |
| 人类参考 | ~78% | — |
值得注意:Claude Code 以「+ GBOX MCP」的形态登上 WebArena 榜单(68.0%),说明编码 Agent 经工具扩展后也能承担 Web 操作任务。Web 任务整体已逼近人类基线,但弹窗、验证码、页面幻觉仍是高频失败点。
OSWorld:全桌面 GUI 智能体
OSWorld 是难度更高的全桌面基准:任务涉及真实表格、图像编辑、终端等跨应用工作流,基于执行结果评测。OSWorld-Verified(2025 年 7 月)修复了 300+ 问题并支持 AWS 并行化加速评测。
| 模型 / Agent | OSWorld 成功率 | 时间 |
|---|---|---|
| Claude Opus 4.6 | 72.7% | 2026-02 |
| Claude Sonnet 4.6 | 72.5% | 2026-02 |
| Agent S(Simular) | 72.6% | 2025-12 |
| Claude Sonnet 4.5 | 61.4% | 2025-09 |
| GPT-5.2 | 38.2% | 2026-02 |
| 人类参考 | 72.36% | — |
桌面级任务在 2026 年初才由头部模型逼近人类基线(约 72%)。但 OSWorld-Human 的研究显示,即便成功,Agent 平均也多花 1.4–2.7 倍于人类的步骤——效率差距仍然显著。
横向对比与关键发现
| 基准 | 任务形态 | 头部成功率 | 人类基线 | 难度信号 |
|---|---|---|---|---|
| TAU-bench | 多轮工具调用 | 77.2%(MiniMax M2) | 未统一公布 | 状态一致性 |
| WebArena | Web 操作 | 68.0%(Claude Code+GBOX) | ~78% | 动态页面/验证码 |
| OSWorld | 全桌面 GUI | 72.7%(Claude Opus 4.6) | 72.36% | 跨应用/步骤效率 |
其一,Web 任务已进入高成功率区间(头部逼近人类),但桌面与后台长程任务仍处爬坡期。其二,成功率与「步骤效率」脱节——OSWorld 上 Agent 即便做对,也常多花一倍步骤,真实成本被低估。其三,同一模型经不同 Agent 框架包装成绩浮动明显,选型应看「框架 + 模型 + 工具」组合,而非单看模型基准。
对编码智能体的启示
SWE-bench 等代码基准衡量「改对代码」,而 TAU-bench/WebArena/OSWorld 衡量「办成事」。两者能力并不等价:一个在 SWE-bench 上高分的产品,未必能在多步业务流里稳定收口。对编码 Agent 而言,启示是:
- 用 SWE-bench 粗筛编码能力,用 TAU-bench 类任务验证「带状态多步」可靠性。
- 工具生态(MCP)直接决定 WebArena 类成绩——Claude Code + GBOX MCP 即为例证。
- 长程复合错误率(行业实测多步任务可达三成量级)是生产部署的核心障碍,需用护栏与评测压制。
选型决策矩阵
| 你的场景 | 优先看 | 建议 |
|---|---|---|
| 后台业务/客服 Agent | TAU-bench 类多步 | 重工具编排与状态一致性,配 input/output guardrail |
| Web 自动化 | WebArena + MCP 生态 | 选工具生态丰富的框架,关注动态页面鲁棒性 |
| 桌面/跨应用 RPA | OSWorld | 关注步骤效率与失败自愈,非仅成功率 |
| 编码为主 | SWE-bench + 长程验证 | 用框架+模型组合实测,勿单看模型分 |