📖 产品简介
World Labs Atlas 是李飞飞(ImageNet 发起人、斯坦福 AI 实验室前主任)创办的 World Labs 于 2026 年 9 月 1 日发布的全模态世界模型,被官方称为「全球首个多模态世界模型」。
它把文本、图像、视频、相机位姿与 3D 深度统一进一套「空间上下文」中联合训练(多模态自回归扩散 Transformer),能基于 1–6 张输入图像生成最长 1 分钟、1440p、像素级相机可控的视频,并重建可 360° 漫游的 3D 世界(点云 / 3D Gaussian Splat)。相比 Sora 等「生成即丢弃」的平面视频,Atlas 强调保持场景几何与光照一致性,目标场景是创意 VFX、游戏设计与机器人仿真训练(Real-to-Sim)。
定位
World Labs(李飞飞创办)于 2026-09-01 发布的全模态世界模型
适合人群
影视/VFX 与游戏场景设计
机器人仿真训练数据生成
3D 内容创作者
需要可导航世界的空间计算开发者
支持平台
World Labs 平台、World API(规划中)、创意 VFX / 游戏 / 机器人训练
开源
否
✨ 核心功能
- 单图生成可导航 3D 世界:输入 1–6 张照片即可重建可 360° 漫游、可复访的 3D 空间
- 像素级相机控制:相机位姿作为原生输入,生成最长 1 分钟、1440p 视频,视角任意可控
- 全模态统一:文本/图像/视频/相机位姿/深度在同一「空间上下文」中联合生成
- 机器人训练:用手机视频即可重建真实空间,生成 RGB + 深度观测供仿真机器人训练
- 创意与影视:几张照片还原场景、重绘视频画面,服务 VFX 与游戏设计
⚖️ 优缺点分析
👍 优点
- 被官方称为全球首个多模态世界模型,空间一致性显著优于传统视频生成
- 单图/少样本即可重建 3D,降低机器人仿真数据采集团队成本
- 盲测中相机路径遵循度优于 Gemini Omni Flash、FLUX 等竞品
- 李飞飞团队 + $10 亿+ 融资(英伟达/AMD/Autodesk 等),资源充足
👎 缺点
- 发布时未提供论文、arXiv、模型卡、定价与 GA 日期,信息透明度存疑
- 自测基准未独立复现,对比设置(原生相机轨迹 vs 纯文本)对竞品不公
- 主要瞄准机器人/创意专业场景,消费级可用性与价格尚不明
- 面临 Google DeepMind Genie 3、Nvidia Cosmos 等强竞争
📊 评分详情
功能完整
9
易用程度
7.5
安全可靠
7
性价比
7
💬 用户评价
Atlas 把相机控制从「文字玄学」变成了「像素级精确」,单张照片就能生成可反复进入的 3D 世界——这是通往空间智能、机器人仿真训练的关键一步,但也得等独立复现和定价出来再下结论。
📝 更新日志
-
2026-09-01正式发布World Labs(李飞飞创办)发布 Atlas 全模态世界模型,被称为全球首个多模态世界模型:基于多模态自回归扩散 Transformer,将文本/图像/视频/相机位姿/3D 深度统一在「空间上下文」中联合训练;输入 1–6 张图像即可生成最长 1 分钟、1440p、像素级相机可控视频,并重建可导航 3D 世界(点云/3D Gaussian Splat)。主攻创意 VFX、游戏设计与机器人 Real-to-Sim 训练。发布时未公布定价、GA 日期与 API 端点。来源:World Labs 官方 / SiliconANGLE / 中国证券报 / 腾讯新闻。