先把这件事说清楚
2026 年 9 月 11 日,英伟达 NVLabs(Han Song 带领的 Efficient AI 团队)开源了一套名为 SoL-Pi 的工具,采用 MIT 许可证,代码托管在 GitHub 的 NVlabs 组织下。它的名字拆开看是「Scaling Auto-Research Loops for Efficient Agent Harnesses」,直译过来是「用可扩展的自动研究循环,做高效的智能体执行框架」。
需要先澄清一个容易被标题误导的点:SoL-Pi 不是一套新的 Agent Harness,而是装在既有 Harness 之上的一层效率增强件。它选择的对象是开源项目 Pi——一个从 OpenClaw 生态走出来、后被 Earendil 收购、GitHub 星标已破十万的第三方 Agent 执行框架。安装方式据官方说明只需一行命令,把 SoL-Pi 挂到现有的 Pi 上即可生效。截至目前,SoL-Pi 在 Pi 之外的其他 Harness 上的适配进度、长期维护计划与社区贡献路线,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。
Harness 为什么值得被单独优化
要理解这件事的价值,先要接受一个近半年被反复验证的判断:决定一个编程智能体干得好不好的,不只是模型权重,还有包在模型外面的那层执行框架。Harness 负责组织工具调用、上下文、执行反馈与任务流程,让模型能够读文件、改代码、跑测试,并根据结果决定下一步。
问题出在任务变长这件事上。编程智能体的任务从补几行代码,发展到跨仓库修复,再到持续数小时的自主工作。任务一长,那些平时不起眼的浪费就会累积:改完文件,明明下一步就是跑测试,模型却要再推理一轮才发起调用;一个大文件早就读过,后续每次请求仍然把它整段带上;几千行日志里真正影响决策的可能只有几行,昂贵的模型却要从头读到尾。
递归自我改进(RSI)同样绕不开这笔开销。每让系统尝试改进一次,都要消耗 Token,失败的方案照样计费。英伟达这条线的思路很直接:既然自我改进本身很贵,那就先把「改进的账单」压下来,让同样的预算能跑更多次实验。
让 AI 当研究员:152 个想法只活下 4 个
SoL-Pi 的四个核心机制不是人拍脑袋想出来的,而是由一条自动研究流水线筛出来的。据官方与多家技术媒体的拆解,流程大致分四步。
先搭实验场。团队构建了 535 个可执行的训练环境,其中 495 个来自真实的 GitHub issue 与 pull request 配对,另外 40 个是带验证器的合成任务。这些环境的作用是让候选方案真的跑起来,而不是停留在纸面推理。
再让 AI 提想法。自动研究循环从 152 个候选优化方向起步,由 Agent 分析 Pi 的运行轨迹、提出修改方案、动手改代码、跑实验、核对结果。中间还叠了两道筛子:基于轨迹的收益预估,以及由评审 Agent 复核的 AI 自撰实验。
最后做留出验证。只有那些在未见过的任务上依然成立的方案才会被保留。结果是 152 个方向里只有 4 个活了下来,换算下来大约是四十分之一。这个「搜索产出率」本身就是一个有信息量的数字——它诚实地告诉后来者,跑同类自动研究循环大概要准备多少预算。
活下来的四个机制,都是省钱的选择
四个机制各自对应一类重复开销,思路都不复杂,但都是人工写 Harness 时未必会专门去测的细节。
Action Fusion(动作融合)。编辑完文件后,把紧接着要跑的测试或运行命令折进同一次工具调用,而不是拆成两次。每省掉一次往返,就等于省掉一整轮模型交互:重新发送累积上下文、重新解码响应、重新进入循环。
Online Context Compact(在线上下文压缩)。不再等到上下文窗口快满了才压缩,而是在每个子任务完成的边界上判断「现在压缩是否划算」。压缩的时机从一个由容量触发的应急动作,变成一个有语义含义的决策。
ObservationPack(观测打包)。不要把体积巨大的工具返回结果每一轮都重新塞进上下文。改为保留一个索引,真正需要时再按需取回对应的片段。
Evidence-Preserving Reducer(保证据归约)。把长日志交给更便宜的模型做摘要,再逐条核对摘要里引用的证据是否确实来自原始日志。这个机制与前三个的区别在于,它不只是省钱——普通的日志摘要是有损的,而「逐条核对引用」这一步才让它变得可以安全地据以行动,避免把幻觉一路传播给昂贵的模型。
英伟达给这个方向起的说法是「Efficiency for Efficiency」:更便宜的 Harness 让自动研究循环更便宜,于是同样的预算能买更多实验,进而找出更便宜的 Harness,形成一个自我强化的循环。
省了多少:数字与口径
按官方与媒体转述的口径,效果可以分两档看。与底座 Pi 相比,SoL-Pi 少用 45% 到 49% 的 Token,成本降低大约三分之一,平均得分保留约 94%。与 Codex、Claude Code 各自的原生 Harness 相比,节省幅度更大:Token 少 35% 到 64%,按 API 标价计算的成本低 50% 到 54%。在研究型工作负载下,团队给出的换算是一小时省下 8.75 到 13.5 美元。
另有一个值得注意的对照:在 EdgeBench 上,SoL-Pi 搭配 GPT-5.6 Sol 的得分高于原生 Codex Harness。也就是说,在部分基准上,「换一层更省钱的框架」并没有以牺牲成绩为代价。
省钱的代价写在另一张榜上
但收益不是没有成本。在 Terminal-Bench 4 的 63 个 CPU 任务里,SoL-Pi 解出 15 个,而 Codex 和原版 Pi 都是 18 个。这个差距指向一个具体的能力面:长链路任务的完成率。省下来的 Token 来自砍掉重复调用与压缩上下文,而被牺牲的恰恰是那些需要持续多步、反复试探才能收尾的任务。
把这些数字放在一起看,SoL-Pi 的定位就比较清楚了——它是一层「在多数任务上省很多、在少数长任务上让一点」的优化件,而不是一个全面提升的方案。研究团队从 152 个候选里只留下 4 个,也从侧面说明这条路的边界已经被自己摸到:不是所有 Harness 优化都能既省 Token 又保成绩。
为什么是英伟达,为什么选 Pi
这件事的行业含义,可能比它的技术细节更值得关注。一家芯片厂商下场做 Agent Harness 的效率层,说明 Agent 执行层已经被纳入芯片厂商的优化半径。模型负责推理,Harness 负责把工具、上下文与执行反馈组织起来,而当 Harness 的效率直接决定单位任务的 Token 消耗时,它就成了影响算力需求与推理成本的一个变量。
选 Pi 而不是自研 Harness,也有现实原因。Pi 在第三方 Agent 执行框架里已经接近事实基准件的地位,用它做底座,省去了从零建立生态的成本,也让优化结果更容易被社区直接复用。与此同时,英伟达另一条线 Nemotron 3.5 Lightning 专攻工具调用,两条线合起来,它在 Agent 执行层的分工意图已经比较清楚:一层管模型侧的工具调用能力,一层管执行侧的效率。
中立思辨
需要冷静看待几件事。其一,四十分之一的搜索产出率虽然诚实,但也意味着这类自动研究循环的门槛不低,中小团队自建的成本可能高于收益。其二,45% 到 64% 的节省幅度来自英伟达自己的实验环境与口径,第三方复现尚未出现,实际业务里的节省比例会因任务分布而异。其三,长链路完成率的下降是一个需要认真对待的取舍,对以长任务为主的团队来说,省下的 Token 可能换不回任务成功率。其四,四个机制的技术门槛都不高,真正稀缺的是「知道该测什么」的评估体系与耐心,这解释了为什么先做出来的是有大规模实验能力的机构。其五,效率层的价值高度依赖底座 Harness 的稳定性,如果 Pi 本身发生大版本变化,这层增强件的适配成本会随之上升。其六,把「效率」作为优化目标与把「成绩」作为优化目标是两件事,SoL-Pi 证明了前者可以单独推进,但它并没有回答「两者能否同时最大化」。
趋势研判
短期,Agent Harness 的效率会成为一个被公开比较的指标,类似过去模型比 Token 价格、比上下文长度那样,出现更多围绕「单位任务成本」的评测口径;中期,如果自动研究循环被证明可复用,Harness 的迭代速度可能快过模型迭代,团队之间的差距会更多体现在评估体系而非模型选型上;长期,芯片厂商、模型厂商与框架方会在 Agent 执行层形成新的分工,谁的 Harness 被更多底座采用,谁就更接近推理需求的分发入口。
对工程团队来说,一个实用的动作是:在讨论换更聪明的模型之前,先量一量自己 Harness 的浪费在哪。改完代码就顺手跑测试、读过的大文件不要重复携带、长日志先归约再核对——这些动作不需要新模型,只需要把执行框架当成一件需要被设计的产品。