具身智能的研究,长期围绕一个朴素假设展开:只要把单个端到端模型做得足够大、数据足够多,机器人就能应对一切。但真实的长程任务给出了相反的反馈——当同一个模型既要处理高频的底层感知、又要做高层的规划推理、还要输出细粒度的动作时,逻辑容易混乱,误差会逐步累积。清华团队给出的答案是:不要让一个模型包办一切。

一组值得停留的数字

据公开信息,清华大学深圳国际研究生院智能计算实验室的硕士生方智睿、于清池、陈子扬等,在李秀教授指导下,联合南京理工大学、西安交通大学、西安电子科技大学、哈尔滨工业大学、北京大学与南洋理工大学,推出多智能体异步并发框架 EMERGE-Policy,相关论文于 9 月 10 日更新至 arXiv。

在 Standard LIBERO 基准上,把世界模型作为「想象」技能用于轨迹预演与动作选择后,EMERGE-Policy 取得 99.2% 的平均成功率;换用另一套执行技能后为 98.8%。更关键的是扰动测试:在 LIBERO-Plus 的光照变化、相机位姿突变等场景下,带世界模型的配置达到 93.9% 的完成率,相比单一基础模型提升约 11.7 个百分点。在考察视觉记忆与长程规划的 RoboDojo-Sim 上,其记忆维度得分与成功率同样明显高于同类方案。

把「模型」变成「工具」:统一技能库

据公开说明,这套框架的核心设计是一个统一技能库,它不再把各类主流模型视为相互竞争的替代方案,而是按用途分成三类技能,统一封装成标准接口:操作技能包括 VLA(视觉-语言-动作模型,用于高频精确的末端轨迹与物理控制)、运动原语(负责粗粒度、大范围的运动规划)与 WAM;想象与预测技能引入世界模型,让系统在真正执行动作之前,先把它当作仿真器预演未来的状态;评估与校验技能集成验证器,在动作执行前校验前提条件、执行后校验目标完成度,并在预演阶段为多条候选路径打分筛选。

这个分工的意义在于,它把「谁负责什么」写清楚了。VLA 擅长把看到的画面变成动作,但不擅长长程规划;世界模型擅长预测「这么做会发生什么」,但预测不等于判断对错;验证器擅长判断「做到没有」,但不能生成动作。把它们解耦成工具再统一调度,等于让每种模型只做自己最擅长的那一段,而不是强迫一个模型同时兼顾三种时间尺度。

图结构调度:一个主智能体,三个专职子智能体

据公开说明,系统采用图结构的智能体编排:主智能体是决策与调度中枢,维持全局任务状态,把复杂长程任务拆解为子目标,并通过分层上下文工程屏蔽冗余的低级感知数据,只以结构化接口调用子智能体与工具库。子智能体则运行在相互隔离的上下文环境中,各自处理高密度的专有数据:感知子智能体负责场景的三维边界框与空间语义;验证子智能体实时调用验证器检查目标完成度;监控子智能体则盯住执行过程中的物理异常。

「上下文隔离」这一点值得单独留意。多智能体系统里最常见的失败模式,是让所有子智能体共享一段越来越长的上下文——结果是每个子智能体都被无关信息淹没,成本上升、准确率下降。把每个专职单元放进独立上下文,等于让它们各自只看到与自己相关的那部分信息,这既是效率考虑,也是可靠性考虑。

三层文件记忆:让长程任务「不失忆」

据公开说明,为保证长程任务不丢失状态,系统引入了三层文件级记忆:PLAN.md 记录任务图与当前进度;HISTORY.md 追加存储历史观测与工具调用摘要;MEMORY.md 动态修正并更新环境事实。当上下文达到上限时,系统会自动触发记忆整合,压缩历史,以维持超长时序下的稳定运行。

这套设计与近期软件智能体领域的记忆工程思路高度一致。无论是把外部状态拆成信念、进度、经验三类,还是坚持「用文件承载记忆、用编辑规则保证正确」,指向的都是同一个判断:长程任务的瓶颈往往不在模型的推理能力,而在它能否把「已经发生过什么」准确地保存下来,并在需要时可靠地取回。EMERGE-Policy 把这一点做成了文件级、可检查、可压缩的机制,而不是埋在模型权重里的隐性记忆。

真机实验:一次「被打断」的叠纸杯

据公开说明,团队在真实机械臂上部署了一个高难度任务——多层纸杯叠放。机器人需要把桌面上的纸杯依次倒扣、定位,并精准堆成三层金字塔。在 100 次标准真机实验中,系统展现出很高的完成度;而在人为破坏(把叠好的纸杯拆毁)、纸杯尺寸变化 5% 至 15%、颜色变化以及相机视角变动等干扰下,凭借分支栈恢复与工具库的在线重规划,成功率仍保持在 85% 至 94%。

这组抗干扰数据,比干净环境下的成功率更能说明问题。真实世界里,「任务做到一半被破坏」是常态而非例外;一个只能从头再来或直接失败的系统,很难承担实际工作。EMERGE-Policy 的做法是保留中间状态、在工具层重新规划,这与长时程软件智能体强调的「留证—验证—修正」是同一种工程直觉。

放进「系统级智能」这条线看

据公开信息,近期围绕智能体架构的讨论,正在从「单点能力」转向「系统编排」。有研究把编排层套在编码智能体外层以提升长时程表现;有企业方案把 Harness 做成统一控制平面;也有团队把记忆管理训练成可学习的能力。EMERGE-Policy 的价值在于,它把这套「系统大于组件」的思路,从数字世界搬到了物理世界,并给出了可复现的开源实现与真机结果。

值得注意的是,论文团队把这项工作总结为对「我们需要怎样的具身智能系统架构」的回答——而不是「我们需要多强的机器人模型」。这个提问方式的转变本身就有信号意义:当单模型的边际收益开始递减,系统架构就会成为下一个竞争焦点。

中立思辨

需要辩证看待这项研究。其一,论文所报成绩均为团队自报,测试条件、基线配置与评测口径需要对照原文与开源代码判断,不宜直接外推为「已可全面替代端到端方案」,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。其二,多智能体异步并发的代价是复杂度:主智能体、三个子智能体、三类技能工具、三层记忆叠加在一起,系统的调试、监控与故障定位难度远高于单模型方案,工程落地门槛不低。其三,世界模型作为「仿真器」的预演质量,直接决定了「想好了再做」是否可靠——若预演与实际偏差较大,打分筛选反而可能把系统引向错误路径。其四,真机实验的 100 次测试与 85% 至 94% 的抗干扰成功率,是在特定任务与特定硬件上取得的,不同机器人构型与任务分布下的表现仍需验证。其五,三层文件记忆在单任务场景下表现良好,但在多任务并行、多机器人协作时,文件级状态的并发写入与一致性如何保证,是尚未充分讨论的问题。其六,把 VLA、世界模型、验证器统一封装为工具,需要为每类模型设计标准化接口,这类接口一旦频繁变动,维护成本会显著上升。

趋势研判

短期,「多智能体 + 工具库」会成为具身智能系统设计的主流范式之一,因为它绕开了单模型难以兼顾多时间尺度的结构性难题;中期,世界模型、验证器与记忆机制可能像今天的感知模块一样,被标准化为可替换的组件,形成具身智能的「中间件层」;长期,决定具身系统上限的,或许不再是某一类模型的能力,而是系统能否把不同能力的组件可靠地组织起来——当「编排」比「单点」更重要时,具身智能的竞争焦点也会随之转移。

对做具身智能的团队的务实建议是:在急着换更大的端到端模型之前,先审视系统的分工设计——感知、规划、执行、验证是否被明确拆开,每类模型是否只做自己最擅长的那一段,中间状态是否被可靠地保存下来。这项研究用一组真机数据说明,这些看似架构层面的细节,可能比模型规模更直接地决定机器人能否把任务做完。