← 返回首页
🌐

World Labs Atlas

World Labs(李飞飞创办)

World Labs(李飞飞创办)于 2026-09-01 发布的全模态世界模型

世界模型 视频生成 3D 重建 机器人训练 热门
A
全模态世界模型开创者
⭐⭐⭐⭐⭐

📖 产品简介

World Labs Atlas 是李飞飞(ImageNet 发起人、斯坦福 AI 实验室前主任)创办的 World Labs 于 2026 年 9 月 1 日发布的全模态世界模型,被官方称为「全球首个多模态世界模型」。

它把文本、图像、视频、相机位姿与 3D 深度统一进一套「空间上下文」中联合训练(多模态自回归扩散 Transformer),能基于 1–6 张输入图像生成最长 1 分钟、1440p、像素级相机可控的视频,并重建可 360° 漫游的 3D 世界(点云 / 3D Gaussian Splat)。相比 Sora 等「生成即丢弃」的平面视频,Atlas 强调保持场景几何与光照一致性,目标场景是创意 VFX、游戏设计与机器人仿真训练(Real-to-Sim)。

定位
World Labs(李飞飞创办)于 2026-09-01 发布的全模态世界模型
适合人群
影视/VFX 与游戏场景设计 机器人仿真训练数据生成 3D 内容创作者 需要可导航世界的空间计算开发者
支持平台
World Labs 平台、World API(规划中)、创意 VFX / 游戏 / 机器人训练
开源

核心功能

  • 🌍 单图生成可导航 3D 世界:输入 1–6 张照片即可重建可 360° 漫游、可复访的 3D 空间
  • 🎥 像素级相机控制:相机位姿作为原生输入,生成最长 1 分钟、1440p 视频,视角任意可控
  • 🧩 全模态统一:文本/图像/视频/相机位姿/深度在同一「空间上下文」中联合生成
  • 🤖 机器人训练:用手机视频即可重建真实空间,生成 RGB + 深度观测供仿真机器人训练
  • 🎬 创意与影视:几张照片还原场景、重绘视频画面,服务 VFX 与游戏设计

⚖️ 优缺点分析

👍 优点

  • 被官方称为全球首个多模态世界模型,空间一致性显著优于传统视频生成
  • 单图/少样本即可重建 3D,降低机器人仿真数据采集团队成本
  • 盲测中相机路径遵循度优于 Gemini Omni Flash、FLUX 等竞品
  • 李飞飞团队 + $10 亿+ 融资(英伟达/AMD/Autodesk 等),资源充足

👎 缺点

  • 发布时未提供论文、arXiv、模型卡、定价与 GA 日期,信息透明度存疑
  • 自测基准未独立复现,对比设置(原生相机轨迹 vs 纯文本)对竞品不公
  • 主要瞄准机器人/创意专业场景,消费级可用性与价格尚不明
  • 面临 Google DeepMind Genie 3、Nvidia Cosmos 等强竞争

📊 评分详情

功能完整
9
易用程度
7.5
安全可靠
7
性价比
7

💬 用户评价

Atlas 把相机控制从「文字玄学」变成了「像素级精确」,单张照片就能生成可反复进入的 3D 世界——这是通往空间智能、机器人仿真训练的关键一步,但也得等独立复现和定价出来再下结论。

📝 更新日志

  • 2026-09-01
    正式发布
    World Labs(李飞飞创办)发布 Atlas 全模态世界模型,被称为全球首个多模态世界模型:基于多模态自回归扩散 Transformer,将文本/图像/视频/相机位姿/3D 深度统一在「空间上下文」中联合训练;输入 1–6 张图像即可生成最长 1 分钟、1440p、像素级相机可控视频,并重建可导航 3D 世界(点云/3D Gaussian Splat)。主攻创意 VFX、游戏设计与机器人 Real-to-Sim 训练。发布时未公布定价、GA 日期与 API 端点。来源:World Labs 官方 / SiliconANGLE / 中国证券报 / 腾讯新闻。