📊 评测基准

AgentBench(智能体综合能力基准)

别名:AgentBench智能体基准OS/DB/Web 智能体Agent 评测综合能力
分类📊 评测基准
阅读时间⏱️ 15 分钟
更新时间📅 2026-07-16
条目编号ENC-BENCH-07-agentbench
AgentBench 是面向 LLM Agent 的综合评测基准,覆盖操作系统、数据库、知识图谱、网页、卡片游戏、家居、数字游戏、LLM 八大真实环境任务,考察 Agent 在多样化场景下的真实执行力。

关键要点 ✦

基准构成

AgentBench 设计 8 个真实可执行环境:操作系统(Linux bash)、数据库(SQL)、知识图谱、网页浏览、卡片游戏、家居自动化、数字游戏与 LLM 对话。每个环境提供可交互的接口,Agent 必须发出真实动作(命令、查询、点击)才能得分,而非仅生成文本答案。

评测维度

它刻意区分两件事:底层模型能力(换模型看表现差异)与Agent 框架能力(同一模型换框架看差异)。这种分离让研究能定位瓶颈到底在「脑子」还是「手脚」。

意义与局限

AgentBench 首次把 Agent 评测从「答题正确率」推进到「环境任务完成率」,暴露了当时模型在长程规划、错误恢复上的短板。局限是环境搭建重、成本高,且随模型进步需不断更新任务以免「刷分饱和」。

🎯 应用场景

模型选型对比
横向比较不同底座在真实环境的 Agent 表现。
框架能力评估
固定模型,比不同 Agent 框架的执行力。
能力短板诊断
定位长程任务中的规划与恢复薄弱点。

✅ 最佳实践

  • 评测时区分模型与框架贡献,避免混淆结论
  • 关注长程任务完成率而非单步正确率
  • 定期更新任务防止基准饱和失真
  • 结合真实环境指标(耗时/成本)综合判断

🔮 未来展望

AgentBench 类「真实环境基准」将扩展更多生产场景(如代码仓库、企业 SaaS),并与成本/安全指标联合评分,推动 Agent 评测从「能不能做」走向「值不值得做」。

📖 相关条目

🛠️ 相关产品

🏷️ 标签AgentBenchAgent 评测基准多环境智能体OS Agent