80 多个基准,终于有了统一接口
2026 年 9 月 3 日提交的论文 Harbor Adapters 与 Harbor-Index(arXiv 2609.04298,作者 Lin Shi 等 120 人)指向一个长期被忽视的工程问题:智能体基准越来越多,但环境各异、接口各套、集成碎片化,导致跨模型、跨基准的公平、可复现、可扩展评测很难做。论文给出三块贡献:其一是 Harbor Adapters,一套把 80 多个现有基准统一迁移到「可评测任意智能体」的标准框架的适配器,并经严格代码审查与等价性实验验证;其二是大规模评测,在 8 个横跨能力梯队的模型上跑 54 个基准,每个模型分别用 Terminus-2 与三种原生 harness 之一,使模型能力与失败模式的分析广度超过以往;其三是 Harbor-Index,一个从适配后全集里精炼出的 82 项高难、高多样、高质量任务集。
Harbor-Index:82 题的「贵但能跑」回归集
Harbor-Index 的 82 项任务来自 29 个基准,经过难度筛选、AI 与人工双重审计、以及「审计—修正」迭代打磨。它的设计目标是:在保留大规模智能体评测所需的挑战性与覆盖面的同时,把计算成本压到可承受——给团队一个精简的回归套件,用来检查改了模型或智能体栈之后性能有没有变好,而不必每次把全集跑一遍。论文把适配器、评测结果、深度分析与 Harbor-Index 全部开源,让社区能审计、扩展、打磨这套评测流程。
冷现实:没有一套配置破 30%
最抓眼球的数字,是能力水位本身。在被评测的所有「模型—harness」组合里,无一超过 30% 的通过率;得分最高的配置 GPT-5.5 配 Codex 也只到 28.0%。这既可以被读成「当前智能体能力的真实上限」,也可以被读成「起点」——取决于你多善意地看待数据。但更稳的结论是:在规划、工具使用、与复杂环境交互这几件事上,即便强系统也仍然吃力。对行业,这记提醒很直接——在把智能体塞进生产之前,先承认它在结构化长任务上的真实水位,比追逐单点演示分数更有用。
工程价值:把模型失败和 harness 失败分开
Harbor 的主要贡献不在又一张排行榜,而在它暴露了智能体评测的「工程层」。一个通用适配器能降低接入新基准的成本,并帮研究者把失败来源切成三块:模型本身、harness、工具集成与环境设置。对开发者,Harbor-Index 是一个紧凑的回归套件——改了模型或 agent 栈,跑这 82 题就能看出有没有退步,而不必每次搬出全集。对做评测基础设施的人,它把「基准碎片化」这个隐性成本摆上了台面:以前要比跨系统结果,得每次 heroic 地重建测试环境。
和九月这波评测热放一起看
把 Harbor 放回 2026 年 9 月这波评测研究里,脉络更清楚:ττ-Bench 考「智能体能造智能体吗」,AgentJudgeBench 考「LLM 评审员可靠吗」,SwarmBench 考「多智能体编排过程好不好」,DAREBench 把 agenticness 标准化,而 Harbor 解决「怎么在同一套基础设施下公平比所有基准」。它们合起来说明一件事——智能体赛道的重心,正从「谁的分数高」转向「分数怎么来的、能不能复现、评测本身可不可信」。评测基础设施,成了继模型与框架之后第三块必争之地。
边界与定位
当然,Harbor 不是终点。基准在目标、环境、成功标准上仍各不相同,82 题的集合无法代表所有真实工作流;它最好被当作可复现的基础与对更广测试的补充,而非智能体智能的单一终局度量。论文 v2 于 9 月 9 日更新,说明作者也在随反馈打磨。对采购与选型,Harbor-Index 的价值不在「28% 很低所以别用」,而在它提供了一把可复现的尺——同一把尺,才能看清不同模型、不同 harness 到底差在哪。
结语
Harbor Adapters 与 Harbor-Index 对评测评测者的工程层做了系统化梳理。它用 80 多个基准的统一接口、54 个基准的八模型大考、以及「无一破 30%」的冷数字,给行业一面镜子:智能体评测的碎片化正在被解决,而当前系统的真实水位也比单点演示诚实得多。在评测成为第三块必争之地的当下,能复现、能分离失败来源,比一个数字本身更值钱。