做地图的公司,也能做机器人「大脑」吗?7 月 22 日,阿里巴巴旗下高德给出肯定回答:宣布 ABot 具身智能体系完成全栈升级,一口气发布 ABot-N1、ABot-M0.5、ABot-ER、ABot-AgentOS、ABot-C0 五款模型,覆盖机器人导航、操作、决策、记忆与运动控制全环节,并宣称在 17 项基准测试中取得 SOTA。这不仅是一次模型发布,更像是高德把多年来在地图、定位、路径规划上积累的能力,系统性地转译成了机器人的具身智能底座。

一、从地图公司到机器人公司?高德的具身转身

高德的入场方式很特别。它不是从零造一个通用机器人大模型,而是把「让Agent理解空间、规划路径、安全行动」这套在导航场景里被千锤百炼的能力,迁移到机器人身上。机器人要解决的「我在哪、怎么去、怎么动」三大问题,本质上与地图 App 规划一条不堵车的路线同源。区别只在于:地图服务的是人眼与手机屏幕,具身模型服务的是机械臂、轮式底盘与四足躯干。高德把这套空间理解能力封装为具身基座模型,等于把一个高频验证过的成熟能力,嫁接到了尚处早期的具身赛道。

二、五款模型各司其职:导航、操作、决策、系统、运动

五款模型构成了一条清晰的分工链。通用导航基座 ABot-N1 采用快慢双系统架构:慢系统负责长程逻辑推理,快系统负责实时运动控制,并用视觉判断修正导航偏差,在点位导航、目标导航、指令跟随等任务中取得领先成绩,室外导航成功率达 92.9%。通用操作基座 ABot-M0.5 把机器人的移动与操作拆为两条动作流,提升长程任务里的协同能力,在 RoboCasa-365 测试中复杂任务表现较前代 SOTA 提升 20.4%、基础任务提升 10.6%。具身大脑 ABot-ER 负责从感知到行动的决策;ABot-AgentOS 把规划、调用、执行、验证解耦,以插件式 Skill 适配人形、四足、轮式等不同形态机器人,并支持跨任务、跨时间的多模态记忆;ABot-C0 则专注四足机器人的运动控制,把上层决策转译为具体动作。从「看懂空间」到「迈出脚步」,高德试图把具身智能的每一层都握在自己手里。

三、闭环逻辑:世界模型 + 数据回流 + 记忆调度

五款模型背后,是一套自我喂养的闭环。高德称 ABot 通过世界模型、具身基座模型与 Agent 架构之间的数据回流,形成从仿真训练、物理交互到记忆调度的完整循环。简单说,机器人在仿真里练、在真实里跑、把跑出来的经验沉淀进记忆,再反哺下一次决策——这正是今年 WAIC 上被反复提及的「自进化」思路在具身侧的具体落地。ABot-AgentOS 的多模态记忆与插件式 Skill,让这套系统不必为每个新任务从头训练,而是像搭积木一样复用既有能力。对机器人这类数据稀疏、试错成本高的领域,这种「仿真—现实—记忆」的飞轮,比单纯堆参数更要紧。

四、客观看:全栈很美,通用落地仍看真实场景

高德的全栈打法,与腾讯 Hy-Embodied 矩阵、宇树的运动控制积累形成了有趣的对照:一个从空间智能切入、一个从云与模型切入、一个从本体与运动切入。客观说,17 项 SOTA 与 92.9% 的室外导航成功率固然亮眼,但具身智能的终极考题从来不是单项基准,而是「在没人兜底的真实环境里,连续干成一件有用的事」。机器人要面对的是光照突变、地面湿滑、物体堆叠等非标准状况,仿真与实验室数据能走多远,仍需大规模真实部署来验证。高德已表示后续将继续适配更多形态机器人,并用真实任务数据推动迭代——全栈只是起点,能否在工厂、仓储、配送等场景跑出闭环,才是下一关。