能力评测 2026-09-14 30 分钟阅读 进阶

长程任务智能体可靠性评测:TAU-bench × WebArena × OSWorld 横评

为什么「会写代码」不等于「能办事」— 用三大基准拆解智能体在多步任务上的成功率边界

摘要

SWE-bench 衡量的是「改对一段代码」,而真实业务里 Agent 要的是「跑完一整条多步流程」。本文基于 TAU-bench(工具调用型用户模拟)、WebArena(Web 操作)、OSWorld(全桌面 GUI)三大公开基准,量化评测长程任务智能体的可靠性边界,给出公开榜单数据与选型建议。数据截止 2026 年 9 月,榜单为模型/系统级,非单一产品级。

评测方法论:为什么需要长程可靠性

「长程任务可靠性」指智能体在包含多步决策、工具调用与状态依赖的任务上,从头到尾不偏离目标的概率。它与单轮问答或单文件改动的难度不在同一量级:每一步的微小错误会沿链路累积,最终任务失败率远高于单步失败率。

三者共同的关键指标是任务成功率(success rate),并各自给出人类基线。人类基线的存在,使「Agent 离可用还有多远」可被量化,而非停留在营销话术。

⚠️ 数据声明

本评测数据截止 2026 年 9 月,来源为公开榜单与基准论文。榜单条目为模型/系统级(如 Claude Opus 4.5、GPT-5.2),并非单一封装产品;同一底层模型经不同 Agent 框架包装后成绩会浮动。分数仅作能力边界参考,不代表某款产品的实测交付结果。

TAU-bench:工具调用型多步任务

TAU-bench 把任务设计成「用户提出需求 → Agent 调用工具(查库、改单、退款)→ 用户追加约束」的多轮闭环,考验的是工具编排与长上下文一致性。

模型 / 系统 TAU-bench 成功率 时间
MiniMax M2 77.2% 2025-10
Claude Opus 4.5 70.2% 2025-11
Gemini 3 Pro 65.8% 2025-11

该基准更贴近「后台业务 Agent」的真实形态:任务不是一次性函数调用,而是带状态、可被打断、需要回滚的会话。当前头部模型已站上 65%–77% 区间,但仍有约四分之一任务无法端到端解决。

WebArena:Web 操作智能体

WebArena 评测 Agent 在浏览器里「点链接、填表单、跨页导航」的能力,覆盖电商、社交、协作编程、CMS 四类站点。

模型 / Agent WebArena 成功率 时间
Claude Code + GBOX MCP 68.0% 2025-10
OpenAI CUA 58.1% 2025-01
Google Project Mariner ~52.4% 2025
Browser-Use(开源) ~51.2% 2025
人类参考 ~78% —

值得注意:Claude Code 以「+ GBOX MCP」的形态登上 WebArena 榜单(68.0%),说明编码 Agent 经工具扩展后也能承担 Web 操作任务。Web 任务整体已逼近人类基线,但弹窗、验证码、页面幻觉仍是高频失败点。

OSWorld:全桌面 GUI 智能体

OSWorld 是难度更高的全桌面基准:任务涉及真实表格、图像编辑、终端等跨应用工作流,基于执行结果评测。OSWorld-Verified(2025 年 7 月)修复了 300+ 问题并支持 AWS 并行化加速评测。

模型 / Agent OSWorld 成功率 时间
Claude Opus 4.6 72.7% 2026-02
Claude Sonnet 4.6 72.5% 2026-02
Agent S(Simular) 72.6% 2025-12
Claude Sonnet 4.5 61.4% 2025-09
GPT-5.2 38.2% 2026-02
人类参考 72.36% —

桌面级任务在 2026 年初才由头部模型逼近人类基线(约 72%)。但 OSWorld-Human 的研究显示,即便成功,Agent 平均也多花 1.4–2.7 倍于人类的步骤——效率差距仍然显著。

横向对比与关键发现

基准 任务形态 头部成功率 人类基线 难度信号
TAU-bench 多轮工具调用 77.2%(MiniMax M2) 未统一公布 状态一致性
WebArena Web 操作 68.0%(Claude Code+GBOX) ~78% 动态页面/验证码
OSWorld 全桌面 GUI 72.7%(Claude Opus 4.6) 72.36% 跨应用/步骤效率
📊 三个结论

其一,Web 任务已进入高成功率区间(头部逼近人类),但桌面与后台长程任务仍处爬坡期。其二,成功率与「步骤效率」脱节——OSWorld 上 Agent 即便做对,也常多花一倍步骤,真实成本被低估。其三,同一模型经不同 Agent 框架包装成绩浮动明显,选型应看「框架 + 模型 + 工具」组合,而非单看模型基准。

对编码智能体的启示

SWE-bench 等代码基准衡量「改对代码」,而 TAU-bench/WebArena/OSWorld 衡量「办成事」。两者能力并不等价:一个在 SWE-bench 上高分的产品,未必能在多步业务流里稳定收口。对编码 Agent 而言,启示是:

选型决策矩阵

你的场景 优先看 建议
后台业务/客服 Agent TAU-bench 类多步 重工具编排与状态一致性,配 input/output guardrail
Web 自动化 WebArena + MCP 生态 选工具生态丰富的框架,关注动态页面鲁棒性
桌面/跨应用 RPA OSWorld 关注步骤效率与失败自愈,非仅成功率
编码为主 SWE-bench + 长程验证 用框架+模型组合实测,勿单看模型分

核心发现

参考来源

  1. Steel.dev — AI Agent Benchmark Results(leaderboard.steel.dev,公开榜单聚合,2026-09 检索)
  2. AI Wiki — Computer-use agent(aiwiki.ai,OSWorld/WebArena 方法与人类基线数据)
  3. CodeSOTA — Web & Desktop Agents(codesota.com,OSWorld/WebArena 任务定义与榜单)
  4. O-mega — Top 10 Agentic Evals: Benchmarking Actionable AI(o-mega.ai,WebArena 方法论)
  5. Xie et al. — OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments(NeurIPS 2024)
  6. CMU & Scale — WebArena / TAU-bench 原始论文与公开排行榜