9月7日,彭博社援引知情人士称,字节跳动正基于旗下电影级视频生成模型 Seedance,开发一款能随用户声音和动作实时变化的空间视频生成模型。值得注意的细节是,这一项目由创始人张一鸣亲自出面协调跨部门团队与算力资源——一位已淡出日常管理多年的创始人重新下场,本身就说明项目牵涉模型研发、云端算力、Pico 硬件与内容业务的复杂协同。
一、不是「生成一段视频」,而是「生成一个可交互的世界」
与市面上先生成、后播放的视频不同,字节这套系统的目标是实时响应。据多家媒体报道,模型可按需生成约 20 帧/秒的空间视频,端到端延迟控制在 0.05 秒(50 毫秒)左右;用户向前走,视角同步推进,转头时四周场景保持连贯。落地方向直指直播、互动短剧与游戏,并计划适配 Pico 系列 VR 头显。技术路径上,大量空间渲染计算放在云端完成,再把画面串流到终端,借此压低头显本地算力要求。
二、张一鸣的「飞轮」:模型、云、内容、硬件串成一条链
报道将这一项目置于字节整体业务坐标中:短视频巨头想把叙事从隔着屏幕看换成走进画面里。在张一鸣的设想里,空间视频模型是一个驱动生态的飞轮——自研模型拉动云计算需求,云算力又带动 Pico 硬件渗透,抖音与 TikTok 的内容既是训练数据也是分发渠道,完成闭环。这也意味着字节的 AI 优先事项正从文本大模型排名转向视频原生的世界模型:据称世界模型已被列为 2026 年四项 AI 优先事项之首,数据预算达八位数人民币,是其他国内实验室的三到四倍。
三、对标 Google Genie,挑战 Meta 与苹果
这一路线与 Google 2026 年初推出的 Genie 同属视频中心的世界模型谱系——都为 AI Agent 模拟物理环境服务,被李飞飞、LeCun 等视为机器人、自动驾驶与游戏的关键能力。竞争逻辑也很清晰:Meta 的 Quest 受困于内容生态深度,苹果的 Vision Pro 卡在价格。字节用云端生成替代端侧预渲染,把差异化变量从硬件规格转移到模型质量与内容分发,恰好是 Meta 与苹果相对薄弱处。
客观来看,字节在文本大模型仍处国内第二梯队(阿里、DeepSeek、月之暗面更具基准优势),因此集中资源押注视频原生 AI 是其扬长避短的选择。但 50 毫秒延迟、20fps 的测试数据来自媒体援引,尚未经独立复现;发布时间也仍存在调整空间。世界模型能否从演示走向稳定商用,仍取决于云端算力成本与头显渗透率。