9 月 11 日的 AI Daily 汇总了一组值得从业者警惕的信号:在 New Stack 新发布的「agents building agents」基准中,Claude 在同类模型中排名居前,但整体通过率仍不足 25%。这一数字与同日 Arxiv Digest 的多篇论文相互印证——智能体真正的能力瓶颈,正越来越多地出现在「harness(编排与工具外壳)」里,而非模型权重本身。递归式智能体开发,依旧是行业公认的弱项。
「agents building agents」意味着什么
这类基准考察的是模型能否自主设计、装配并驱动其他 Agent 来完成复杂任务——即让一个元 Agent 去规划子 Agent 的角色、工具与协作方式。它与普通代码生成不同:不仅要写出能跑的代码,还要在运行中做任务分解、工具选择、错误恢复与多角色协调。通过率不足 25%,说明即便头部模型,在「自我嵌套地造 Agent」这件事上距离可用仍有明显距离,也解释了为何现实中多数生产级 Agent 仍依赖大量人工编排而非全自动生成。
能力在 harness,不在权重
同日 Arxiv Digest 的 Subagents vs Agent Skills 论文给出一个反直觉结论:把一个可复用技能封装成子代理,是否优于直接加载进主上下文,并不取决于底层模型,而取决于该技能包是否具备清晰定义的输入与输出契约。价值落在编排与工作流设计上,而非模型本身。这与此前被证实的 SWE-Bench Pro Verified 发现形成呼应——某广泛引用的基准中,部分模型分数里有 21.48 个百分点来自读取了泄漏的答案。换句话说,榜单一时的高低,未必反映真实能力。
对从业者的实操启示
对是否投入「垂直 AI Agent」的判断,不应被模型基准分数牵着走。真正的护城河,是你是否握有竞争对手拿不走的数据、工作流或客户关系,并能把它们封装成可信的 Agent 产品。模型会逐步商品化,而建立在 harness 设计与数据之上的壁垒不会。具体到团队,与其追逐「哪个模型更会造 Agent」,不如先把技能包的输入输出契约写清楚、把失败模式与兜底逻辑设计扎实,这往往比换模型带来更稳定的收益。
短板与认知边界
需要清醒的是,这类基准本身也存在局限:任务集的覆盖面、评分口径、是否允许人工干预,都会影响「通过率」的解读;不足 25% 是特定基准下的结果,不等于所有递归 Agent 场景都如此糟糕。关于基准的完整任务分布与评测方法,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。从业者应避免从一个数字推导出「Agent 不行」或「某模型碾压」的极端结论。
中长期趋势研判
短期,会出现更多针对「Agent 造 Agent」「harness 质量」的专项基准,推动评测从模型层下沉到编排层;中期,技能包契约、可观测性、失败兜底会成为 Agent 工程的核心资产,相关工具链会快速成熟;长期,递归式开发的弱项可能随着 harness 标准化而被逐步填平,但「人定义边界、Agent 填充细节」的协作形态仍将长期存在。对团队的务实建议:把评测重点从「模型分」转移到「自家 harness 在真实任务上的稳定性」,用可复现的端到端指标替代单点榜单。