AgentBench(智能体综合能力基准)
别名:AgentBench智能体基准OS/DB/Web 智能体Agent 评测综合能力
| 分类 | 📊 评测基准 |
| 阅读时间 | ⏱️ 15 分钟 |
| 更新时间 | 📅 2026-07-16 |
| 条目编号 | ENC-BENCH-07-agentbench |
AgentBench 是面向 LLM Agent 的综合评测基准,覆盖操作系统、数据库、知识图谱、网页、卡片游戏、家居、数字游戏、LLM 八大真实环境任务,考察 Agent 在多样化场景下的真实执行力。
关键要点 ✦
- AgentBench 用 8 类真实环境任务考察 Agent 真实执行力
- 涵盖 OS/DB/Web/知识图谱/游戏等,强调「动手」而非答题
- 区分「模型能力」与「Agent 框架能力」两维度
- 暴露了当时主流模型在长程任务上的明显短板
- 是 Agent 研究从「聊天」走向「操作」的里程碑基准
基准构成
AgentBench 设计 8 个真实可执行环境:操作系统(Linux bash)、数据库(SQL)、知识图谱、网页浏览、卡片游戏、家居自动化、数字游戏与 LLM 对话。每个环境提供可交互的接口,Agent 必须发出真实动作(命令、查询、点击)才能得分,而非仅生成文本答案。
评测维度
它刻意区分两件事:底层模型能力(换模型看表现差异)与Agent 框架能力(同一模型换框架看差异)。这种分离让研究能定位瓶颈到底在「脑子」还是「手脚」。
意义与局限
AgentBench 首次把 Agent 评测从「答题正确率」推进到「环境任务完成率」,暴露了当时模型在长程规划、错误恢复上的短板。局限是环境搭建重、成本高,且随模型进步需不断更新任务以免「刷分饱和」。
🎯 应用场景
模型选型对比
横向比较不同底座在真实环境的 Agent 表现。
框架能力评估
固定模型,比不同 Agent 框架的执行力。
能力短板诊断
定位长程任务中的规划与恢复薄弱点。
✅ 最佳实践
- 评测时区分模型与框架贡献,避免混淆结论
- 关注长程任务完成率而非单步正确率
- 定期更新任务防止基准饱和失真
- 结合真实环境指标(耗时/成本)综合判断
🔮 未来展望
AgentBench 类「真实环境基准」将扩展更多生产场景(如代码仓库、企业 SaaS),并与成本/安全指标联合评分,推动 Agent 评测从「能不能做」走向「值不值得做」。
📖 相关条目
🛠️ 相关产品
🏷️ 标签AgentBenchAgent 评测基准多环境智能体OS Agent