多智能体系统的常见做法是「设计期编排」:在动手前就把工作流、角色与通信协议固定下来,运行时照章执行。但人类科学家做研究时,往往会在进行中临时协调分工——谁擅长哪块、谁补哪块,边做边调。arXiv 10 月 1 日提交的新稿《Can AI Scientists Coordinate at Runtime?》(编号 2610.00980)问的正是这个问题:AI 科学家能否也在运行时自行协调?论文提出的 Runtime Agent Coordination(RAC),把「动态组队」从人类科学家的本能,变成了可评估的工程机制。
背景:从固定工作流到运行时协调
当下的 AI-scientist 系统(如 Agent Laboratory、EvoScientist、ARK)大多沿用设计期编排:角色与流程在启动前就定好。这种方式稳定、可复现,但也有明显短板——它假设任务结构在事先就看得清,而真实科研往往中途才暴露该谁来补哪一块。人类研究者的做法恰恰相反:在运行中根据进展重新分配工作、调整分工。RAC 想填补的,正是这道「运行时协调」的空缺。
方法:执行期选 agent、给契约、做验证
RAC 的做法是在执行过程中,从既有的 AI-scientist 主机中选择合适的 agent,为它分配一份带作用域的工作契约,并基于产物做验证。验证信息会驱动后续 agent,但不阻塞状态转移,也不丢弃中间产物——这点很关键,因为它保留了并行探索的灵活度,又避免了「为了协调而拖慢一切」。这种「边跑边选、选完即验」的闭环,比事先写死流程更贴合真实科研里的不确定性。论文在 ResearchClawBench 上做了单种子探索评估,跨越 Agent Laboratory、EvoScientist 与 ARK 三套主机,且保持各主机的模型、工具与权限不变,只在预算上做主机级别的校准。
结果:运行时选择有效,但加机制未必总增益
评估设置了四种累积条件:原生执行、运行时通信、运行时选择、以及在前者基础上再加契约与验证。结论有两层。其一是运行时选择对每个主机都给出了最高的平均得分,说明「在执行中临时选对人」确实有效。其二是叠加契约与验证后,平均得分反而回落,且回落幅度依赖主机——也就是说,协调机制不是加得越多越好,在受限预算下,过度协调可能拖累表现。这一发现把「动态编排优于固定工作流」的笼统论断,落到了有边界的实证上。对构建者而言,这意味着协调粒度本身也是要被优化的对象,而非越多越保险。
意义:把争论落到实证
RAC 的价值,不只是提出一个协调协议,而是把「动态编排 vs 固定工作流」这场长期争论,推进到可以量化比较的阶段。它提醒构建者:运行时选择是有效的杠杆,但协调机制本身有成本,盲目堆叠契约与验证可能适得其反。这与近期另一股共识——「编排本身就是一种需要专门打磨的技能」——方向一致:会协调的 system,比单纯堆更多 agent 更重要。它需要被放进预算与主机差异的语境里读,而非当成放之四海皆准的结论。
结语
AI 科学家能不能在运行时自行协调?这篇论文的回答是:能,而且运行时选择确实带来增益;但协调不是免费的,机制叠加有天花板。对多智能体系统的设计者而言,真正的功课是找到那个「刚好够」的协调粒度,而不是把所有可能的治理层层叠上去。RAC 的实证已经把这一点说得很清楚——协调机制必须放进预算与主机差异的语境里读,而不是当作一把万能钥匙。