自动科研(auto-research)想做的是把应用机器学习的实验循环——提假设、写代码、训练、评测——交给智能体自己跑。可真要在长程上反复迭代,卡住大家的往往不是模型够不够聪明,而是「执行得对不对」:一次改动可能悄悄泄漏了留出集数据、漏了归一化、断了梯度,或把训练 / 评测开关接错,昂贵的一轮跑完才发现是空转,错误还跨轮累积。9 月提交的论文 RankEvolve(arXiv 2609.39551)给了一套把「执行可靠性」当成一等公民的自动科研框架,结论对做编码智能体的团队很有参考价值。

RankEvolve 的自动科研闭环EOP 状态机声明阶段 / 闸门 / 分支 / 循环meta-harness把 Codex / Claude Code 当节点互审与互修节点互相检查、修补对方产出知识层跨迭代沉淀(含负面结果)长程自动科研的瓶颈不是模型多聪明,而是「跑对没」——执行可靠性才是那根弦
图 1|RankEvolve 用一份可执行操作协议(EOP)把科研循环钉成状态机,再用 meta-harness 把 Codex 与 Claude Code 这类黑盒编码智能体当作会互审、互修的执行图节点,并把发现(含失败)沉淀进知识层。

RankEvolve 的骨架有两层。其一是可执行操作协议(EOP):把科研循环声明成带阶段、闸门、分支与循环的状态机,运行时强制编译后的状态机走,不让智能体自由发挥到一半跑偏。其二是 meta-meta-harness:它把 Codex、Claude Code 这类黑盒编码智能体产品,当作执行图上的节点来用,而且让这些节点互相审查、互相修补对方的产出。换句话说,不是「用一个更强的智能体写完所有代码」,而是「用多个异构智能体当互审同伴」——一个写、另一个查、再一个修。在此基础上还有一层知识层,把每轮发现(包括负面结果)跨迭代沉淀,避免重复踩坑。

数字上,它在预算匹配的评测里给出干净的结果:把多个编码智能体异构组合(而非只用单一产品基线),全部 oracle 执行准确率从最佳单产品的 45.8% 抬到 62.5%(paired +16.7 个百分点,95% 置信区间 6.6–26.7),但静默严重缺陷率仍有约 10.4%,说明组合能显著降错、却还没到「可全撤人审」的程度。在开源 HSTU 推荐模型上的 12 轮部署里,它把 MovieLens-20M LARGE 的 NDCG@10 较已发表锚点抬了约 4.48%、BASE 抬了约 2.80%;换到 LitGPT 的迁移切分上,异构组合效果同样复现(+12.5 个百分点)。

放到工程实践,RankEvolve 给的启示很具体:别把自动科研当成「调一个强模型」,而要把它当成「搭一个带闸门的执行系统」。EOP 把循环钉成状态机,是为了让智能体在长程里不跑偏;meta-harness 把多个编码智能体当互审节点,是为了用「多样性」对冲「单点的错觉」——一个模型自信写错的代码,另一个模型更可能拦下来。对正在做编码智能体的团队,这意味着把精力投向流程编排与验证回路,而不是无限堆上下文长度。验证器与知识层同样关键:前者在每轮结束时判定这轮到底有没有空转,后者把踩过的坑跨轮记住,避免重复交学费。

异构组合把执行准确率从 45.8% 抬到 62.5%(预算匹配评测)单产品最佳基线45.8执行准确率异构组合62.5+16.7 个百分点残留风险静默严重缺陷率约 10.4%,仍需人审兜底在开源 HSTU 推荐模型上,12 轮部署把 NDCG@10 较已发表锚点抬了约 4.48%
图 2|在预算匹配的评测里,把多个编码智能体异构组合(而非只用单一产品),全部 oracle 执行准确率从 45.8% 升到 62.5%( paired +16.7 个百分点,95% 置信区间 6.6–26.7),但静默严重缺陷仍有约一成。

这背后最该被记住的一句话是:长程自动科研的瓶颈是执行可靠性,不是模型智力。过去大家总想着换更大模型、堆更多上下文,RankEvolve 却证明,把「多个会互审的编码智能体」当成可控的执行图,比单押一个更聪明的模型更稳。它和这两年「元推理把控制抽出来」「上下文工程管住活窗口」是同一股潮流——都在认真处理长程智能体的可靠性与控制,而不是只追单点能力。

局限也要摆正。论文仍是预印本,实验集中在推荐排序这类有清晰指标的领域,结论往「任意科研循环」外推还需更多证据;异构组合虽把执行准确率抬到 62.5%,但一成多的静默严重缺陷提醒我们,人审兜底短期不能撤。对做编码智能体与自动研发的团队,RankEvolve 给的务实启发是:与其赌单个超级智能体一次写对,不如把流程钉成状态机、让多个智能体互审互修,并把失败(含负面结果)当资产存起来——可靠性来自结构,不来自某个模型的一时聪明。