如果说「智能体能写代码」已经接近共识,那么「智能体能连续几天把一件复杂开发任务推进下去」仍是少数人真正验证过的命题。近期,上海 AI 实验室等机构的一篇论文《Harness-of-Harness》提出了一个务实的思路:不去重写编码智能体的内核,而是在它外面再套一层「编排」。这层编排的名字本身就是一个判断——在 harness(执行框架)之上,还有一个 harness。
问题:长跑为什么不等于进步
要理解这篇论文的动机,得先看当前编码智能体的工作方式。它们通常运行在一个 harness 里:harness 决定模型看到什么上下文、能调用什么工具、怎样把任务一步步推进。这套机制在短任务上表现不错,但一旦任务拉长到多日,问题就会显现——智能体可能反复在同一个坑里打转,可能忘了之前已经验证过的结论,也可能把「完成了若干步」误当成「向目标靠近了」。
换句话说,长时程开发的核心矛盾不在于「能不能跑更久」,而在于「跑得久之后,是不是真的在进步」。论文要解决的,正是这个「进步」问题——让长跑产生累积,而不是原地消耗。
方案:在 harness 外面加一层外部编排
据公开信息,《Harness-of-Harness》的核心做法,是在既有 coding-agent harness 之上加一层外部编排层。这层编排不是简单地「再包一个循环」,而是引入了三个关键机制。
其一是 Planner—Developer—QA 的三角色循环。把「规划、实现、验证」拆成三个角色,让它们在一个受控的循环里轮转:规划负责确定下一步该做什么,开发负责实现,质量保证负责检验结果是否真的达标。这种分工的意义在于,它把「自我验证」从开发角色里剥离出来——让一个独立的角色去质疑产出,比让同一个角色自我复核更接近真实工程的做法。
其二是 warm-start。每一轮循环不是从零开始,而是带着上一轮积累的状态与结论继续,避免重复劳动,也让「进步」能够被沉淀下来。其三是证据状态(evidence state)——把每一步的验证结果当作可累积的证据保存,而不是只保留最终结论。这样一来,「为什么认为这一步做对了」是有据可查的,而不是模型的一句自我陈述。
结果:52.25% 与 82.86% 说明什么
据公开信息,论文给出的实验结果是:三轮实验中,这套方法带来的平均相对提升约为 52.25%,最大提升达到 82.86%;在其中一个 70 轮的案例中,系统维持了一条可审计的开发轨迹。这组数字的解读需要谨慎——「相对提升」的基线与任务集需要结合论文原文才能完整理解,但它至少指向一个方向:在长时程开发上,「外部编排」带来的收益,可能比单纯换一个更强的模型更大。
把 70 轮案例单独拿出来看,它回答的是一个比「提升多少」更关键的问题——可维持性。长时程智能体真正的难点,往往不是前几轮跑得好,而是能不能在第 30 轮、第 50 轮、第 70 轮依然保持方向与可审计性。能维持 70 轮的可审计轨迹,本身就是一种「不失控」的证据。
为什么是「套一层」而不是「重写一层」
这篇论文的取向值得注意:它没有主张替换现有的 harness,而是选择在它上面叠加。这个选择背后有一个现实考量——编码智能体的内核(上下文管理、工具调用、循环控制)已经相对成熟,真正缺失的是「长时程下的节奏控制与验证机制」。与其推倒重来,不如把缺失的那一层补上。
这与近期开源社区的另一批动作方向一致:有的 Agent Runtime 把「轨迹可回溯」当作核心能力,有的框架把「上下文当成可治理的管线」,有的把「外部编排」作为长时程方案。它们共同指向同一个判断——当工具循环本身逐渐被解决,长时程智能体的竞争会转移到「编排与治理」这一层。
把它放进「长时程智能体」的脉络里
据公开信息,近期围绕长时程智能体的讨论明显增多。一方面,有实验用极端放手的方式暴露了长跑失控的真实代价——模型会一直跑到烧光预算,也会把不可审计的调用链层层叠加;另一方面,也有企业级运行时与开源框架从「可回滚、可审计、成本可控」的角度给出工程化答案。《Harness-of-Harness》正好落在两者之间:它既承认长时程是刚需,也承认当前机制不足,并给出了一个「在现有基础上补一层」的具体方案。
把这些线索合起来看,长时程智能体正在从「能不能跑」的阶段,进入「怎么跑才不失控」的阶段。这个阶段的胜负手,很可能不在模型参数上,而在编排与验证的设计上。
中立思辨
需要谨慎看待这篇论文。其一,52.25% 与 82.86% 是「相对提升」,其绝对水平、任务分布、评测口径与对比对象都需要对照原文,单看百分比容易高估实际收益,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。其二,Planner—Developer—QA 这类多角色循环会显著增加调用次数与成本,「提升 52%」是否在成本可接受的范围内,论文未在公开摘要中给出足够信息。其三,「证据状态」依赖验证环节本身的可靠性——如果 QA 角色的判断也不可靠,那么被累积下来的「证据」可能只是被固化了的错误,机制的有效性最终取决于验证质量。其四,学术实验通常运行在受控环境里,真实工程的噪音、需求变更与外部依赖会削弱这类方法的效果,从论文到生产仍有距离。其五,多角色编排本身会引入新的协同开销与冲突,如何让三个角色不互相扯皮,是一个比「加一层」更难的工程问题。
趋势研判
短期,长时程智能体的改进会集中在外层编排——如何拆解角色、如何积累证据、如何在超支前中止,因为这些改动不需要重新训练模型,落地成本更低;中期,「编排层」可能从论文里的概念,演化为可采购的产品能力,与运行时、可观测性打包进入企业技术栈;长期,决定长时程智能体上限的,或许不是模型有多强,而是编排与验证机制能否把「长跑」转化为「累积」——如果每一轮都能沉淀可复用的证据,那么智能体的产出就会随时间复利,这才是长时程真正的价值所在。
对做智能体平台的团队的务实建议是:在追求更长运行时长之前,先把「验证角色」独立出来,并为每一步保留可累积的证据。让规划、开发、验证各司其职,比让一个全能智能体硬扛长任务,更接近真实工程的组织方式。