当前最强的 AI 编程 Agent 能在真实代码库中连续执行数小时的复杂任务。但拉长到"自主科学研究"的周期——提出假设、设计实验、分析结果、调整方向——一个根本性的短板暴露了出来:单点能干,并不等于整体能积累。
科学研究是反复试错的过程。研究者试一个方向,看结果,把教训带进下一次尝试。这个"把失败经验带到下一轮"的能力,正是当前 AI Agent 最欠缺的。
2026年6月25日,中国人民大学高瓴人工智能学院与微软研究院联合发布了 Arbor 框架(arXiv: 2606.11926),并已全面开源。它的核心创新是"假设树精炼"(Hypothesis Tree Refinement, HTR)机制——把 AI 的每次实验挂在一棵不断生长的树上,让策略、代码、证据和洞察跨周期保留下来。失败不再被丢弃,而是变成下一轮探索的起点。
一、从"一次完成"到"持续积累":Arbor 的核心设计
Arbor 的设计始于一个观察:当前的编码 Agent(如 Codex、Claude Code)擅长单次任务执行,但无法在长周期的科研流程中积累经验。当需要连续多次提出假设、验证、总结教训、调整方向时,Agent 的每次尝试几乎是"独立事件"——上一次失败的信息很少能影响下一次决策。
研究团队把这个问题形式化为"自主优化"(Autonomous Optimization, AO):给 Agent 一个初始代码库、一个目标和一套评估器,让它在不需要人类逐步干预的情况下,通过反复实验持续改进成果。
Arbor 的回答是一套两层架构:
长寿的协调器(Coordinator):负责管理整棵假设树——决定往哪个方向扩展、哪些分支应该剪掉、哪些洞察可以合并。它的工作循环包含六个步骤:观察当前树状态、构思新的子假设、选择要执行的叶子节点、派发给执行器、回传实验证据和洞察、做出继续/剪枝/合并的决策。
短期的执行器(Executor):各自在隔离的 git worktree 中验证一个叶子假设,修改代码、运行评估,最终提交结构化报告——包含分数、事实结果、洞察和分支引用。执行器是"用完即走"的,它们不会污染主干。
这种分工的精妙之处在于:探索性的代码改动被锁在隔离分支中,主干始终保持干净。假设树只记录与决策相关的证据,不会被大量工具调用日志撑爆。
二、把"失败"变成"资产":假设树的生长逻辑
在 Arbor 的假设树中,每个节点绑定了四样东西:一个假设、对应版本的代码库、实验证据、提炼出的洞察(insight)。
靠近根的节点是宽泛的研究方向(如"提高检索覆盖率"),越往下越具体,到叶子节点就是可直接执行的修改方案。从宽到窄的层次,使得探索变成渐进式细化,而非一堆扁平的独立尝试。
当一个叶子假设被验证失败后,它的节点不会被简单丢弃。相反,失败的洞察会沿着路径向上回传,变成对后续假设构思的"负面约束"。例如,如果"约束验证器"这条路尝试过但效果有限,这条信息会被抽象成"瓶颈可能在证据覆盖而非验证标准"的更高层洞察,指导后续方向选择。
Arbor 的合并(Merge)关卡尤为关键:候选分支必须先用留出的测试评估器证明自己比当前最优方案更好,才能被合并进主干。这种机制确保了每一次合并都代表可验证的进步,而非假设性的改进。
三、六道真实研究任务全胜:平均增益 2.5 倍
研究团队构建了一套包含六道真实研究任务的 AO 任务集,覆盖三大类科研场景:
- 模型训练:Architecture Design(神经网络架构设计)、Optimizer Design(优化器设计)
- Harness 工程:BrowseComp(搜索评测框架)、Terminal-Bench 2.0(终端任务)
- 数据合成:Math-Reasoning(数学推理数据)、Search-Agent(搜索 Agent 数据)
与 Codex 和 Claude Code 的对照测试中,Arbor 在六道题的留出测试(held-out test)上全部取得最佳成绩:
- Architecture Design 将 loss 从 1.098 降至 1.028,相对改进 6.38%(Codex: 1.37%,Claude Code: 5.92%)
- BrowseComp 准确率从 45.33% 提升至 67.67%,绝对提升 22.34 个百分点(Codex: +4.67,Claude Code: +8.00)
- Math-Reasoning pass gap 提升 19.79,为 Codex 的近 4 倍
- Optimizer Design 训练步数从 3325 压缩至 3237.5
六道题的平均相对增益,Arbor 是 Codex 和 Claude Code 的 2.5 倍以上。值得注意的是,同样的控制器、同样的树深度、同样的搜索预算,跨任务都能稳定获胜——说明增益来自搜索过程本身的结构化设计,而非针对特定任务的调优。
在 MLE-Bench Lite 上搭配 GPT-5.5,Arbor 的 Any Medal(任意奖牌)成绩达到 86.36%,Gold(金牌)达到 77.27%,均为目前对比中的最高值。
四、不是靠"砸算力":结构化搜索比长时间执行更值钱
面对出色成绩,一个自然的疑问是:是不是 Token 消耗更多?研究团队专门审计了成本数据:Arbor 在六道任务上的 Token 消耗为 2021 万到 4319 万,与 Codex 和 Claude Code 处于同一量级。预算被用于维护竞争假设、运行隔离执行、对比证据、更新搜索树,而非单纯的多采样。
消融实验进一步揭示了"树结构"和"洞察回传"各自的价值。在 MLE-Bench Lite 上:
- 完整 Arbor:Any Medal 81.82%
- 拆掉树结构(w/o tree):降至 63.64%
- 关掉洞察回传(w/o insight feedback):降至 54.54%
一个反直觉的发现是:留着树但关掉洞察回传,比直接把树拆掉还差。空有结构没有语义记忆,等于把实验按文件夹归了类,但没有任何信息能告诉你下一步该往哪走。树结构和洞察回传必须协同工作——一个负责保存竞争假设,一个负责把局部失败转化为全局约束。
研究团队还验证了 Arbor 的跨任务迁移能力。将 BrowseComp 上优化过的搜索外壳直接迁移到两个未见过的任务(HLE 和 DeepSearch QA)上,准确率分别从 25.50% 提升至 31.50%、从 61.00% 提升至 69.00%。这说明 Arbor 学到的是搜索流程层面的通用设计调整,而非对特定评测集的过拟合。
五、自主科研 Agent 的新范式
Arbor 的发布标志着 AI 自主科研能力迈出了从"工具辅助"到"结构化探索"的关键一步。它验证了一个核心理念:让 AI Agent 做科研的瓶颈,不在于单次执行能力有多强,而在于如何把每一次尝试变成下一次的台阶。
当然,Arbor 也有其当前局限性。团队坦诚指出,Arbor 擅长将已有方向精细化,但不擅长从零提出与现有树弱关联的全新构想。在 Architecture Design 任务中,后期单旋钮调参的收益递减,研究者能看出需要更大的算法动作,但这个动作仍需要人类的判断来给出。自主科研的"0 到 1"创造力突破,仍需进一步探索。
作为一个与具体模型解耦的开源框架,Arbor 在使用 Gemini-3-Flash、Claude Opus 4.6 和 GPT-5.5 三种骨干模型时均能带来改进,表现出良好的模型适用性。这意味着研究社区可以在自己选择的底层模型基础上,直接使用 Arbor 框架来增强 Agent 的科研能力。
在 AI Agent 从"工具"迈向"协作者"的时代,Arbor 给了行业一个有价值的提示:让 Agent 记住它走过的弯路,可能比让 Agent 跑得更快更有意义。