为什么传统大模型榜单管不住智能体

过去衡量大模型,看的是 MMLU、GSM8K 这类静态知识与时序预测准确率。它们测的是「某一刻输出的对不对」,而智能体要的是「在动态环境里规划、调用工具、改外部文件、跨长时间保持状态」的能力。一个语言准确率很高的模型,可能在多步数据库查询里彻底失败;静态测试也抓不到智能体在跑了几轮后丢失目标、或把冲突上下文塞进提示词窗口的运行时错误。行业在 2026 年明显转向行为式、执行式评估,正是因为部署系统(如 GPT-6 Astra、Z.ai 等)需要跨复杂多步工作流持续监控,而传统榜单给不出这类信号。

五维定义:把「什么是智能体」说清

9 月 10 日,Mia Lassiter 与 Brinnae Bent 向 arXiv 提交综述《Defining AI Agents: A Compendium of Criteria, Metrics, and Benchmarks》,主张「agent」一词长期缺乏标准定义,导致评估、比较与复现都靠临时拼凑。论文把智能体拆成五个可度量维度:环境交互(感知并作用于外部环境的能力)、学习适应(基于经验更新行为)、自主度(无需人类干预的程度)、目标导向(追求显式或隐式目标)、时间连贯(跨时间保持一致身份、记忆与规划)。每个维度下,作者梳理现有评估方法的缺口与不一致,并给出一个公开数字资源 Agent Compendium,用于组织并延展这些评估方法。

这五个维度价值在于:它把「智能体到不到位」从一句感想,变成可逐项打分的清单。单智能体与多智能体研究都能借同一套坐标对话,沟通与复现因此更系统。论文同时被 cs.AI 与 cs.MA(多智能体系统)收录,说明它想同时服务两类社区。

DAREBench:按工作负载画像测,而非单一总分

同一天附近的 arXiv 预印本 DAREBench(编号 2609.06059)把「标准化」往前推到可运行基准。它建在一个共享的 OpenClaw 执行环境上,从二十二个源基准挑选并改写出 233 个任务,按输入模态与执行形态排成二乘三的工作负载矩阵,并用统一的契约式协议加基于证据的打分审计来做评估。论文报告了对 23 个商业 API 模型与 12 个本地开源权重模型共 7587 次模型—任务运行的实测:没有任何单一模型在所有工作负载组都占优;文本与多模态任务呈现不同的准确率—成本权衡;本地开源权重在若干组有竞争力,但整体仍落后于前沿商业模型。

结论很克制也很有用:选模型不该看一个总分,而要看工作负载画像、部署形态与准确率—成本权衡。这对企业的启示是,采购智能体能力要先定义自己的任务分布,再去匹配基准里对应的工作负载组,而不是追排行榜冠军。

Artificial Analysis Intelligence Index v4.3:把 SaaS 真环境搬进榜单

Artificial Analysis 在 Intelligence Index v4.3 里加入面向智能体工作流的基准,包括 AutomationBench-AA(在 Gmail、Sheets、Slack、Salesforce、Zendesk、Jira、HubSpot 等模拟 SaaS 环境里测任务完成度,并统计不触发护栏的完成占比)、Terminal-Bench v4.0(更严的 66 任务终端操作)、AA-Briefcase(面向多周知识工作的私有评测)。其意图是减少「刷榜」——用更真实、私有的长时任务,逼迫模型展现真实推理而非钻评估漏洞。

在 v4.3 结果里,通用智能指数由 Claude Fable 5.1 与 GPT-6 Astra 领跑;AutomationBench-AA 则由 DeepSeek V4.1 Flash 与 GPT-6 Astra 居前。这类细分榜单的价值,是让「哪个模型擅长跨应用办事」变得可比较,而不再是厂商自说自话。

标准化对企业的实际意义

三股力量叠在一起,指向一个趋势:智能体评估正从各写各的 Demo,走向可对齐的方法论与可复现的基准。对采购方,这意味着可以把「要测什么」从拍脑袋变成清单——按五维定义自查能力缺口,用 DAREBench 式工作负载矩阵对齐任务分布,用 AutomationBench 式真环境基准核对跨应用完成度。对监管方,标准化定义也是把「自主智能体风险」写进治理框架的前提;CSIS 一份关于定义混乱拖累治理的报告,正是同一担忧的注脚。

结语

智能体评估的标准化不是学术点缀,而是产业从概念验证走向生产的地基。五维定义给「什么是智能体」立坐标,DAREBench 给「怎么比」建可运行基准,Intelligence Index v4.3 给「在真环境里行不行」补证据。当评估能复现、能对齐、能按工作负载画像选模型,企业才敢把智能体放进核心流程。对开发者,建议现在就把评估驱动开发(每次改提示词、换模型或改工具定义都跑回归套件)当成标配,而非上线后的补丁。