一个被用得太宽、却没人能说清的词

「智能体」在 2026 年已经变成了一个包罗很广的标签。它既被用来称呼一个能自动回复工单的客服机器人,也被用来称呼一个能连续工作数小时、自己规划步骤、自己调用工具、自己检查结果的系统。这两者之间的差距,比「自行车」和「卡车」还大,但它们共享同一个词。

这种模糊带来的是连锁问题。评测无法比较——一个基准测的是「回答质量」,另一个测的是「多步任务的最终状态」,两者的分数放在一起没有意义;研究无法复现——论文说「我们的智能体在任务上表现更好」,但读者不知道它的自主程度、是否保留记忆、是否允许失败重试;采购无法判断——供应商说自己的产品是「智能体」,采购方却没有一份清单可以逐项核对。

一篇新综述直接把这个模糊性当作研究问题。论文的出发点很直接:人工智能领域里「智能体」这个词缺乏标准定义,这妨碍了评估、比较与可复现性。它的做法不是给出一个更权威的定义,而是把「智能体性」拆成五个可以分别考察的维度,并为每个维度整理现有的指标、基准与评估框架。

需要说明边界:这是一篇综述性论文,它本身不产生新的实验结果,其贡献在于梳理与组织;综述对现有方法的归类难免带有作者视角,五个维度的划分也并非仅有的解法。论文未公开完整的文献筛选标准与纳入排除规则,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

五个维度分别在看什么

论文提出的五个维度是:环境交互、学习与适应、自主性、目标导向行为、时间一致性。把它们逐一展开,能看出这套划分的逻辑。

环境交互,指的是系统是否以及如何感知并作用于外部环境。这是最基础的维度,也是最容易被含糊处理的——一个只接收用户文本的聊天界面,与一个能读取文件、调用 API、执行代码的系统,在环境交互上的差距是本质性的。

学习与适应,指的是系统能否从交互中改变自己的行为。这里的关键区分是「在推理时利用反馈」与「在部署后持续改进」,两者常被混为一谈。一个能在本次任务中根据错误重试的系统,并不等于一个能从历史任务中沉淀经验、在下一次做得更好的系统。

自主性,指的是在多大程度上由系统而非人来做决定。这个维度天然是连续的,从「每一步都要人确认」到「设定目标后完全自主」,中间有大量中间状态。论文强调这一维度的价值在于让讨论具体化:说一个系统「自主」,不如说清它在哪些环节自主、哪些环节需要人介入。

目标导向行为,指的是系统是否围绕一个目标组织行动,而非仅仅响应单次输入。它区分的是「问答」与「办事」:前者在给出回答后任务结束,后者需要在多步动作之间保持目标不变。

时间一致性,指的是系统在较长时间跨度上能否保持行为与状态的连贯。这个维度常被忽略,却是长任务的关键——一个在十步之内表现良好的系统,在后续步骤中是否还记得最初的约束、是否还遵守同一套边界,是两回事。

一个公开索引,试图解决「查不到」的问题

论文的另一半贡献是一个名为 Agent Compendium 的公开数字资源,它把综述中识别出的评估方法组织起来并做了扩展。这个设计的意图很实际:让研究者与工程团队在需要评估某个能力时,能查到有哪些现成的指标与基准可用,而不是从零设计或凭印象选一个。

这类索引的价值往往被低估。在实际工作中,团队选择评测方法的方式常常是「找一个看起来相关的榜单」,而榜单测的维度与团队真正关心的问题未必一致。如果有一份按维度组织的索引,团队就能先明确自己想测哪个维度,再去找对应的工具,顺序反过来,误差会小很多。

论文也明确列出了自己的目的:支持更可复现的研究、更清晰的沟通,以及更系统地研究人工智能体。这三个目标其实是同一个问题的三个侧面——当大家用同一个词指代不同的东西时,研究无法累积,沟通充满误解,系统性研究无从谈起。

定义这件事,为什么在采购场景里更关键

学术上的定义之争听起来抽象,但它在采购与合规场景里有非常具体的后果。

如果一份需求文档写「采购一套智能体系统」,供应商可以交付一个能自动回复的问答工具,也可以交付一个能自主编排多步任务、调用内部系统的执行系统,两者都能满足字面要求,但成本与风险完全不同。反过来,如果需求文档按维度拆开——需要环境交互到什么程度、是否要求跨会话记忆、自主性上限设在哪里、是否要求长任务的约束保持——那么验收标准就变得可检验,争议空间大幅缩小。

这一点与近期其他方向的进展形成了呼应。行业里已经出现了针对智能体全生命周期信任评估的开放框架,也有面向企业自动化场景、带精确真值的生成式企业资产基准。它们与这篇综述的目标一致:把「智能体」从一个营销词汇,还原成一组可以被逐项检验的能力描述。

中立思辨

需要辩证看待几件事。其一,综述提出的五个维度是一套有用的组织方式,但它并非从实证中推导出的单一解,不同研究者可能提出不同数量的维度,读者不宜把它当作标准。其二,维度划分得越细,跨系统比较的难度反而越高:五维评分如何加权、不同维度之间是否存在权衡,论文没有给出答案,而这些正是实践中必须解决的问题。其三,论文不产生新实验,因此它梳理的现有方法中,哪些经得起复现、哪些存在已知缺陷,仍需读者自行核查原始文献。其四,公开索引的长期价值取决于维护——这类资源如果停止更新,会很快从「有用」变成「误导」,而其可持续性通常依赖社区投入,这一点在论文中体现有限。其五,把定义问题形式化,有助于评测与采购,但也可能反过来收窄视野:真正的能力突破往往出现在既有维度之外,过早用五维框架框住讨论,存在遗漏新维度的风险。其六,对多数工程团队而言,完整按五维做评估的成本不低,更现实的做法是先明确自家业务最在意的一到两个维度,把评估资源集中投在那里。

趋势研判

短期看,这类梳理会先被评测与采购场景采纳,因为那里的沟通成本最高、最需要共同语言;中期看,随着智能体进入受监管行业,「自主性上限」「时间一致性」这类维度可能从学术概念变成合规要求的一部分——监管需要可检验的边界,而边界需要先有定义;长期看,定义之争的终局可能不是某个统一标准,而是一组彼此承认差异、但共享同一套描述语言的分层定义:面向消费者的、面向企业的、面向关键基础设施的,各自有不同的门槛,但都说得清自己在说什么。

对正在做技术选型或需求编写的团队,一个立刻可用的做法是把「智能体」这个词从文档里删掉,换成对行为的描述:它需要读什么、能写什么、允许自主到哪一步、失败了谁来接管。把这几句写清楚,比任何定义都更能减少后续的返工。