自动科研(auto-research)想做的是把应用机器学习的实验循环——提假设、写代码、训练、评测——交给智能体自己跑。可真要在长程上反复迭代,卡住大家的往往不是模型够不够聪明,而是「执行得对不对」:一次改动可能悄悄泄漏了留出集数据、漏了归一化、断了梯度,或把训练 / 评测开关接错,昂贵的一轮跑完才发现是空转,错误还跨轮累积。9 月提交的论文 RankEvolve(arXiv 2609.39551)给了一套把「执行可靠性」当成一等公民的自动科研框架,结论对做编码智能体的团队很有参考价值。
RankEvolve 的骨架有两层。其一是可执行操作协议(EOP):把科研循环声明成带阶段、闸门、分支与循环的状态机,运行时强制编译后的状态机走,不让智能体自由发挥到一半跑偏。其二是 meta-meta-harness:它把 Codex、Claude Code 这类黑盒编码智能体产品,当作执行图上的节点来用,而且让这些节点互相审查、互相修补对方的产出。换句话说,不是「用一个更强的智能体写完所有代码」,而是「用多个异构智能体当互审同伴」——一个写、另一个查、再一个修。在此基础上还有一层知识层,把每轮发现(包括负面结果)跨迭代沉淀,避免重复踩坑。
数字上,它在预算匹配的评测里给出干净的结果:把多个编码智能体异构组合(而非只用单一产品基线),全部 oracle 执行准确率从最佳单产品的 45.8% 抬到 62.5%(paired +16.7 个百分点,95% 置信区间 6.6–26.7),但静默严重缺陷率仍有约 10.4%,说明组合能显著降错、却还没到「可全撤人审」的程度。在开源 HSTU 推荐模型上的 12 轮部署里,它把 MovieLens-20M LARGE 的 NDCG@10 较已发表锚点抬了约 4.48%、BASE 抬了约 2.80%;换到 LitGPT 的迁移切分上,异构组合效果同样复现(+12.5 个百分点)。
放到工程实践,RankEvolve 给的启示很具体:别把自动科研当成「调一个强模型」,而要把它当成「搭一个带闸门的执行系统」。EOP 把循环钉成状态机,是为了让智能体在长程里不跑偏;meta-harness 把多个编码智能体当互审节点,是为了用「多样性」对冲「单点的错觉」——一个模型自信写错的代码,另一个模型更可能拦下来。对正在做编码智能体的团队,这意味着把精力投向流程编排与验证回路,而不是无限堆上下文长度。验证器与知识层同样关键:前者在每轮结束时判定这轮到底有没有空转,后者把踩过的坑跨轮记住,避免重复交学费。
这背后最该被记住的一句话是:长程自动科研的瓶颈是执行可靠性,不是模型智力。过去大家总想着换更大模型、堆更多上下文,RankEvolve 却证明,把「多个会互审的编码智能体」当成可控的执行图,比单押一个更聪明的模型更稳。它和这两年「元推理把控制抽出来」「上下文工程管住活窗口」是同一股潮流——都在认真处理长程智能体的可靠性与控制,而不是只追单点能力。
局限也要摆正。论文仍是预印本,实验集中在推荐排序这类有清晰指标的领域,结论往「任意科研循环」外推还需更多证据;异构组合虽把执行准确率抬到 62.5%,但一成多的静默严重缺陷提醒我们,人审兜底短期不能撤。对做编码智能体与自动研发的团队,RankEvolve 给的务实启发是:与其赌单个超级智能体一次写对,不如把流程钉成状态机、让多个智能体互审互修,并把失败(含负面结果)当资产存起来——可靠性来自结构,不来自某个模型的一时聪明。