世界模型这个词,在 2026 年已经不算新鲜。学术会议、自动驾驶实验室与机器人公司都在谈它,但多数讨论仍停留在「让机器预测下一秒会发生什么」的层面。9 月 9 日至 10 日,高德发布的 ABot-Earth 0.7,把世界模型的讨论往前推了一步——它要解决的不是预测物理规律,而是让 AI「理解一个真实的空间」,并能在其中提前预演。
技术路径:3D 原生,而不是「拼接重建」
据公开信息,ABot-Earth 0.7 采用 3D 原生技术路径,使用涵盖空间、时间等信息的时空数据训练模型,使其建立对三维空间的原生理解,从而端到端一次性生成 3DGS(3D Gaussian Splatting,三维高斯泼溅)格式的城市场景。输入端则可以很简单:一张卫星图像,或一段文字描述。
这个路径与过去二十多年的数字地球技术有本质区别。传统方式主要依赖卫星影像、航拍、街景与点云等数据进行拼接与重建,用户看到的是现实世界被采集之后形成的数字版本,能够观看的位置、路线与角度,也往往受原始采集素材的限制。而 3D 原生意味着模型直接学会了三维空间的结构,可以「生成」而不是「复刻」——这带来的直接结果是:用户可以脱离预设路线,从任意位置进入、自由探索,并获得实时交互反馈。
效率与尺度:一组具体的数字
据公开说明,在一块消费级 GPU 上,生成一片公里级 3D 城市场景约需 10 分钟,效率相比传统方式提升约 1000 倍。尺度上,模型能够在单一体系内贯通从星球到城市、再到街景地标的全尺寸连续生成:在城市级生成中保持路网、街区与建筑群的整体关系;视角推进到地标近景时,进一步还原单体建筑的几何轮廓、立面层次与材质纹理,并达到接近摄影的画质水准。
「消费级 GPU」与「10 分钟」这两个限定词,是这次升级里最具现实意义的部分。世界模型此前多运行在数据中心级算力上,而把生成成本压到单块消费级显卡,意味着这项能力有机会从实验室走向更广泛的应用与开发者。这是 0.7 版本相对 0.5 版本(据公开信息,0.5 于 6 月发布,已构建覆盖 190 多个国家和地区的 3D 地图)最明显的推进:从「大范围 3D 地图」走向「3D 原生生成、自由探索与实时交互」,覆盖范围也扩展到超过 196 个国家和地区。
它为什么是「Agent 的空间底座」
世界模型与智能体的关系,容易被简化成「给机器人做仿真」。但 ABot-Earth 0.7 的定位更宽——据公开信息,它被描述为「AI 理解世界如何连接、如何变化和如何运行的入口」,为预测、模拟与真实场景中的决策提供支持。这个定位把它与智能体的规划、预演能力直接挂上了钩。
原因在于,智能体要完成任务,必须先理解它所处的空间。一个能替用户规划行程的智能体,需要知道目的地内部的结构、动线、视野与约束;一个能替用户做决策的智能体,需要能「提前看一遍」不同选择的后果。世界模型提供的,正是这种「先预演、后行动」的能力。据公开信息,高德把 ABot-Earth 0.7 的能力用进了飞行街景 2.0、导航 Live 与避雷指南等服务:飞行街景 2.0 让用户在出发前自由进入目的地的三维空间;避雷指南通过时空推演提前检查行程中的时间冲突、拥堵与闭店风险;导航 Live 则把实时感知、自然语言交互与导航连接起来,让 AI 在开车、步行、进入景区等不同场景间保持上下文。
「上下文连续性」是隐藏的关键词
在这三项能力里,导航 Live 那句「在不同场景间继续保持上下文」值得单独留意。它触及了智能体在真实世界中一个具体的难题:用户从开车到停车、从步行到进入景区,场景在变、设备在变、交互方式也在变,但用户的意图是连续的。如果每次切换场景都要重新交代一遍需求,智能体就退化成了一个场景内的工具。
而要在场景切换时保持上下文,系统需要一个统一的空间参照——它得知道「用户刚才在哪、现在在哪、接下来要去哪」,以及这些位置之间在空间与时间上的关系。这正是世界模型作为底座的价值:它把空间、时间与现实信息组织在同一个三维世界里,让跨场景的上下文有了共同的坐标系。从这个角度看,世界模型之于空间智能体,类似于记忆系统之于长时程对话智能体——它们解决的都是「连续性」问题。
放进「世界模型」这条线看
据公开信息,近期世界模型的动作相当密集:有团队把它做成具身智能的仿真底座,有企业把它用于仓库物流的实时可交互场景,也有研究把它用于机器人「先预演、后行动」的决策。这些工作的落点不同,但都指向同一个判断——当智能体要在真实或接近真实的环境里行动时,「能预演」比「能推理」更接近问题的本质。
ABot-Earth 0.7 的特别之处在于,它把世界模型与「空间」这一具体维度绑定,并且直接面向普通用户(体验官网已上线)。这让它比纯学术的世界模型更容易被验证,也更容易暴露不足——因为普通用户对「像不像真实世界」有直观判断。对世界模型而言,面向大众的产品化,本身就是一种严格的测试。
中立思辨
需要客观看待这项发布。其一,「效率相比传统方式提升 1000 倍」是与传统重建方式的对比,衡量口径、生成质量与场景复杂度的差异都会影响这一数字的解读,不宜直接外推为「任何场景都快 1000 倍」,目前官方及行业暂未披露更多细节,后续将持续跟进迭代动态。其二,3D 原生生成在视觉与结构上表现亮眼,但「看起来真实」与「可用于决策」是两个层面的问题——如果生成的场景与真实世界存在偏差,基于它做的预演就可能误导决策,模型准确性的验证标准仍需明确。其三,覆盖 196 个国家和地区指的是地理范围,具体到每个区域的生成精度、数据时效与更新频率,可能存在较大差异,用户在使用时应以实际场景为准。其四,把世界模型与商业服务(如扫街榜相关功能)深度绑定,有利于快速落地,但也可能让模型优化偏向特定业务需求,通用性受影响。其五,世界模型的训练依赖海量真实时空数据,这类数据涉及地理信息与隐私,其采集、使用与合规边界,是这类产品长期需要面对的问题。其六,从演示到稳定可用之间,往往还有很长的路——单次生成效果与在高并发、复杂查询下的稳定性,是两回事。
趋势研判
短期,世界模型会在空间智能、具身智能与仿真训练三个方向继续落地,消费级 GPU 可跑会显著降低参与门槛;中期,「空间底座 + 智能体」的组合可能催生一批以「预演」为核心能力的产品——从出行决策到线下服务,从机器人训练到城市规划;长期,决定智能体能否在真实世界中可靠行动的,不是它对语言的理解有多深,而是它对世界的理解有多准——当世界模型把「空间」这一维度补上,智能体离「在真实世界里替人做事」才更近了一步。
对做具身智能与空间智能的团队的务实建议是:把世界模型的评价重心,从「生成得像不像」转向「预演准不准」——先定义清楚「预演结果与真实结果的偏差如何度量」,再去优化模型。毕竟,能生成一个漂亮的虚拟城市,与能基于它做出正确决策,中间隔着的正是智能体落地最关键的那一段路。