一个长期被当成配套工作的环节

智能体领域的评测长期处于一种尴尬位置:所有人都引用榜单,但很少有人把评测本身当成基础设施来建设。模型团队自己写脚本、自己选题目、自己报分数,评测集与执行环境高度绑定在各自的仓库里,换个框架就要重写一遍。结果是两个后果同时出现——横向比较缺乏共同底座,而评测结论也难以复现。

arXiv 上的两篇工作正在尝试改变这一点。《Harbor Adapters and Harbor-Index: Infrastructure and a Curated Meta-Dataset for Large-Scale Agentic Evaluation》把评测框架与元数据集分开处理,前者解决「怎么跑」,后者解决「考什么」。与此同时,Vercel 官方发布了一份实践指南,演示如何把 Terminal-Bench 以及 Harbor Hub 上的任意基准放进云端沙箱执行。截至目前,Harbor-Index 的题目构成细节、长期维护机制与完整的排行榜口径,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

Harbor 解决的是「怎么跑」

Harbor 最初由 Terminal-Bench 团队构建,定位是开源的评测执行框架(harness)。它的核心抽象并不复杂:一个评测运行需要准备任务环境、启动被测智能体、对结果打分,而这三件事在传统做法里往往耦合在同一个脚本里。

Harbor 的做法是把它们拆开。据 Vercel 的官方指南,Harbor Hub 目前注册了 274 个数据集,涵盖 Terminal-Bench、SWE-bench、tau3-bench、OSWorld 等不同方向的基准,而所有数据集都通过同一条命令 harbor run 执行。任务镜像只构建一次,之后每次试验直接从缓存镜像启动;改动任务才会触发重建。多容器的 Docker Compose 任务同样支持——首次运行时在沙箱内安装 Docker 并打快照,后续试验从快照启动。

更值得注意的是凭证处理的设计。指南明确写到,任务自身的网络规则会传递到沙箱防火墙,以「公开」「无网络」或「主机名白名单」三种模式在虚拟机外部强制执行;凭证注入会把密钥附加到匹配的出站请求上,因此密钥本身不会进入沙箱。这一条在评测场景里很关键——评测代码通常需要调用外部模型 API,把密钥留在容器内意味着任何被测智能体理论上都能读到它。

执行环境也做成了可插拔。指南演示的路径是把每次试验放进独立的 Vercel Sandbox 微虚拟机,而 Harbor 本身并不绑定某一家沙箱供应商。框架还内置了一个 oracle 智能体,它不调用任何模型,只是重放任务自带的参考解法,用于验证环境配置是否正确。这个设计的实际价值容易被低估:在讨论模型分数之前,先确认「题目本身是能过的」,否则测出来的可能是环境问题而不是能力问题。

Harbor-Index 解决的是「考什么」

如果 Harbor 是执行引擎,Harbor-Index 就是它推荐的题库。据公开信息,Harbor-Index 由 82 道高难度题目构成,属于「元数据集」性质的策展集合,官方称已有 8 套模型与框架组合参与测试,其中 GPT-5.5 搭配 Codex 的通过率为 28.0%。

28.0% 这个数字需要放在正确的坐标系里理解。同期公开的 SWE-bench Verified 成绩普遍在 74% 至 79% 区间,Terminal-Bench 2.0 的早期直接模型分数在 52% 至 58%,而更新一代的模型加框架组合已经推过 80%。也就是说,同一批模型在不同题目集上的分数可以相差几十个百分点,差距的来源不是模型变聪明或变笨,而是任务类型不同:仓库内的补丁修复是单次、无状态、有明确判据的工作,而跨数十条命令的长程终端任务要求规划、执行、发现偏移、恢复、验证并知道何时停止。

这个落差本身构成一个判断依据。评测社区近两年反复观察到一个现象:模型在单一产出物上的表现持续改善,但在需要维持长程正确性的任务上改善缓慢。Harbor-Index 把 82 道题单独策展出来,本质上是在饱和基准之外保留一块「还没被攻克」的区域。

榜单本身也在移动

要读懂这类评测,还必须理解一个容易被忽略的事实:榜单的口径在变。以 Terminal-Bench 为例,据公开资料,4.0 版本把任务集调整为 66 道容器化专业任务,为每次智能体运行给出八小时超时,修正了 19 道题,并移除了 8 道因饱和、拒答、公开解法或质量与平台问题而失效的题目;每道题运行五次,排行榜报告带 95% 置信区间的解决率。公开资料同时说明,因为任务集与资源规则同时变化,4.0 的分数不能与 3.0 或 2.x 直接比较。

同样地,SWE-bench 方向在 2026 年出现了明显的饱和讨论,头部成绩进入 90% 区间后,分数上升更多反映的是评测集被逐步适配,而非能力等比提升。这也是为什么「元数据集」与「多数据集统一执行」这两件事要一起做:单一榜单会饱和,但一组持续策展、口径透明、可被第三方重跑的题目集合,衰减速度会慢得多。

这条线索与本栏目此前关注的另一项评测工作形成呼应。MERIT 记忆评测用 23440 条轨迹、约 42.57 美元的实际成本,比较了「写时更新」与「嵌入检索」两条记忆路线,并指出一个关键区分:检索到不等于照做。评测成本开始被公开报价、评测口径开始被逐条说明,说明这个环节正在从「附属品」变成「公共设施」。

中立思辨

需要冷静看待评测基础设施化的价值与边界。其一,统一执行框架降低了横向比较的门槛,但并不能自动解决可比性问题——同一道题在不同模型、不同采样次数、不同超时设置下的结果仍不可直接并列,读者需要看配置而不是看名次。其二,274 个数据集听起来丰富,但数据集的质量与维护状态差异很大,注册数量不等于可用数量。其三,Harbor-Index 仅 82 道题,规模小意味着单题权重高、置信区间宽,适合作为趋势信号而非精确定量结论。其四,官方公布的 28.0% 来自 8 套组合的小样本测试,组合数量有限,不宜外推为「某模型不行」。其五,沙箱供应商可插拔带来便利,也带来环境差异——不同微虚拟机的 CPU、内存、网络策略与文件系统行为会影响长程任务结果,跨环境复现需要额外的控制变量。其六,凭证注入不进沙箱是良好实践,但它保护的是评测方密钥,并不能阻止被测智能体在获得授权工具后做出越界行为,这与本批次另一篇报道涉及的事件属于不同层面的问题。其七,评测基础设施本身也是竞争场,谁定义题目、谁解释结果,会实质影响行业叙事,因此第三方可复跑能力比框架功能更值得关注。

趋势研判

短期,评测的重心会继续从「单一榜单」转向「可组合的执行框架加策展题库」,团队选型时会开始追问「这个分数是在什么环境、跑了几次、用什么判据得出的」;中期,评测可能像 CI 一样成为工程流程的固定环节,企业会用自有任务集建立内部基准,而不是只依赖公开榜单;长期,如果评测环境与凭证管理实现标准化,第三方复跑会变得廉价,行业对「自报分数」的容忍度会下降,公开可验证的结果将成为默认要求。

对工程团队来说,一个当下就能做的判断是:你手上那套评测脚本,换一个框架、换一个沙箱、换一个模型,是否需要重写?如果答案是肯定的,那么你拥有的是一次性实验,而不是一套可以持续使用的评测能力。