在智能体的技术栈里,评测长期处在一个尴尬的位置:它不直接产生能力,也不直接带来收入,却决定了其他所有环节能否被改进。当模型能力趋于接近、场景复杂度快速上升时,这个位置正在发生变化——9 月 10 日前后发生的两件事,可以放在一起看。
一件事:评测公司拿到大额融资
据公开报道,阿里巴巴集团拟领投 AI 训练与基准测试初创公司 UniPat AI 的 3 亿美元融资,投后估值约 25 亿美元,腾讯与红杉中国等原有投资者参与。公司成立于 2025 年末,创始人李宽此前在阿里巴巴通义 AI 实验室从事后训练分析、数据合成与强化学习相关工作,公司业务聚焦于为 AI 模型设计真实场景的测试与评估工具,并生成训练及评测数据,提供给研究人员与企业。
需要说明的是,这则融资消息目前来自公开报道,交易的具体条款、股权结构与合作细节尚未有更完整的官方披露,投后估值的口径也有待确认。
另一件事:把基准测试开源,同时把成本降下来
同期,阿里国际站开源了面向真实电商场景的 Agent 基准测试,并披露通过优化模型路由使 Token 成本降低约 50%。这两条信息放在一起看,构成了一个相当完整的「评测观」。
开源基准测试的价值,在于把评测从各家自说自话变成可对照。过去,智能体产品的效果宣称往往缺少共同标尺:任务定义不同、成功标准不同、数据不可见,导致横向比较几乎无法进行。一个面向真实业务场景的公开基准,至少能让「完成任务的比例」与「完成任务的成本」这两件事被放在同一张表上。
而 Token 成本降低 50% 这个数字,揭示的是评测与优化的直接联系。模型路由优化——也就是按任务难度把请求分派给不同能力与价位的模型——之所以能大幅降本,前提是系统能够判断「这个任务有多难」。而判断任务难度这件事,本质上依赖评测能力:没有对任务分布的量化认识,路由策略就只能靠猜。
为什么评测在智能体时代变得更关键
在单轮对话的时代,评测的对象是输出质量,可以用人工打分或模型互评来近似解决。但智能体的评测对象变成了「一段过程」:它是否正确拆解了任务、是否选对了工具、是否在失败后重试而不是绕路、是否在长链路中保持了一致的目标。这类指标很难靠人工逐条打分覆盖,必须依赖自动化的、可复现的评测框架。
与此同时,评测的难度也在上升。一个智能体任务往往有多个可接受的解法,简单的「结果对错」判定会误伤合理的替代路径;而如果只看结果不看过程,又会漏掉那些「碰巧成功」的案例——在长链路任务里,这种偶然性正是最需要被识别的风险。
更现实的一层原因是成本。当智能体的单位任务需要数十次模型调用时,成本优化成为产品能否成立的前提,而成本优化的每一个决策(用哪个模型、压缩到什么程度、重试几次)都需要评测数据来支撑。评测因此从「上线前的验收环节」变成了「运行中的决策依据」。
从配套环节到基础设施的三个信号
把近期的动作放在一起,可以看到三个信号。其一是资本层面:评测类公司开始拿到与其收入规模不成比例的大额融资,说明投资方把它看作基础设施而非工具。其二是开源层面:主要厂商愿意把基准测试开源,意味着它们判断「评测标准的公共性」带来的生态收益高于保留私有基准的竞争收益。其三是产品层面:成本优化与评测被放在同一个发布里讲,说明在真实项目里这两件事已经被视为同一个工程问题。
中立思辨
需要保持辩证的视角。其一,基准测试天然存在被「刷分」的风险:一旦某个基准成为事实标准,针对它做优化的收益就会高于提升通用能力,最终可能让基准失去区分度——这在通用大模型评测中已经反复出现。其二,真实业务场景的基准涉及企业数据与业务逻辑,开源版本能覆盖的范围必然有限,公开基准与企业内部评测之间的落差需要被正视。其三,评测公司的商业模式建立在「数据可以出售」的前提上,但训练与评测数据的合规边界、以及客户是否愿意让核心业务数据参与其中,都存在现实约束。其四,模型路由降本 50% 属于企业自述数字,其统计口径与任务分布未完整披露,不同业务结构下的效果差异可能很大。其五,UniPat 融资的交易细节与业务进展,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
趋势研判
短期,评测能力会成为智能体项目的隐性门槛——能清楚量化自己任务分布与成本的团队,才能在模型选择与架构决策上占据主动;中期,行业可能出现一批通用的智能体评测基准,但真正形成壁垒的会是企业内部的私有评测集,因为它直接对应业务成败;长期,评测与优化会合并为一个连续的工程循环,而不是两个分离的阶段,「能测」与「能改」将越来越难以分开。
对开发团队的务实建议是:不要等到项目上线才建立评测。在写下最初一行智能体代码时,就同时准备三样东西——一组覆盖真实任务分布的评测用例、一份记录每次运行的 Token 与延迟日志、以及一套判断「过程是否合理」的检查规则。评测不是验收工具,它是让优化有方向的可靠依据;在没有度量之前,任何关于「更聪明」的说法都只是感觉。