9月7日,宇树科技发布一段全球首次由世界模型实时驱动的全自主人形机器人格斗视频。机器人摆脱预设程序与人工遥控,依托自研的 UnifoLM-X2-1.0 世界-动作大模型,实时感知对手姿态、预判变化并自主完成攻防。这不再是「后空翻」式的炫技,而是一次真实的动态对抗。
一、格斗是表象,世界模型才是内核
宇树在公告中强调,本次突破的关键在瞬时规划、决策和动态交互执行。拆开看,是机器人先把「对手在做什么、接下来可能做什么」建进一个内部世界模型,再据此决定自己的走位、出拳与防守。感知、预测、决策、执行被打通成一个闭环——这正是具身智能一直想啃下的硬骨头。
二、从「会动」到「会应变」
过去的人形机器人演示,多是既定编舞式动作;一旦环境可变、对手不可预测,系统往往失灵。搏击场景把不确定性拉满:没有两次出拳完全相同,没有固定的应对脚本。能让机器人在这种高压交互里稳住,说明其运动控制与世界建模已经越过演示门槛,进入「可应变」区间。
三、为什么这件事分量重
具身智能的终极考场不是舞台,而是真实世界里的复杂任务——搬运、救援、协作、服务。搏击只是最抓眼球的压力测试,它验证的是「在对抗中保持决策」的能力。一旦这种能力被证伪为噱头、被证成为范式,差距只在「任务定义」这一层。宇树用最硬核的方式,把世界模型推到了台前。
四、距离落地仍有距离
视频不等于产品,演示不等于规模部署。功耗、可靠性、安全边界、与真实工况的适配,都还需工程化打磨。但方向已经清晰:具身智能的竞争,正在从「谁的动作更丝滑」转向「谁的世界模型更准」。