2026 年 6 月 1 日,英伟达在台北 GTC 大会上正式发布 Cosmos 3——全球首个完全开源的全模态物理世界基础模型。这款基于 Transformer 混合架构的大模型,将视觉推理、世界生成与动作预测三大能力整合在一个系统中,并同步开放了训练脚本、部署工具和数据集。同场发布的还有 Isaac GR00T 机器人开发平台的全面开放。
如果将大语言模型(LLM)的爆发比作"认知 Agent"的 GPT 时刻,那么 Cosmos 3 的发布,可能就是"物理世界 Agent"的对应节点——当 AI 开始理解物理世界的因果律、空间关系和运动规律时,机器人智能体从"预设程序"走向"自主决策"的技术前提终于就绪。
全模态物理世界模型:Cosmos 3 的技术突破
Cosmos 3 并非传统意义上"更大"的大模型。它的核心创新在于架构设计:采用混合 Transformer 架构,在一个统一框架内同时处理三种类型的任务——视觉推理(理解当前场景)、世界生成(预测场景的下一步演化)、动作预测(生成具体的执行指令)。
这种"三位一体"的设计意味着,Cosmos 3 不需要像传统机器人系统那样,将感知、规划、控制分模块拼装。它是一个端到端的物理世界理解模型,输出结果直接可用于机器人 Agent 的执行层。在英伟达公布的多项基准测试中,Cosmos 3 在 Artificial Analysis、Physics-IQ、PAI-Bench、R-Bench 的世界生成精确性,以及 RoboLab 的机器人任务完成率方面,均取得了领先结果。
更重要的是,英伟达选择将 Cosmos 3 完全开源。模型权重、训练脚本、部署工具和训练数据集一并公开。这种"全栈开源"策略在物理 AI 领域尚属首次——对比来看,此前无论是 Google DeepMind 的 Gemini Robotics 还是 OpenAI 的 Sora,其模型能力和训练方法论均未对外开放。
Isaac GR00T 开放:从模型到机器人的最后一公里
与 Cosmos 3 同步开放的,还有 Isaac GR00T 机器人开发平台。GR00T(Generalist Robot 00 Technology)是英伟达为通用人形机器人构建的底层平台,集成了仿真环境、运动控制、感知堆栈和数据集生成工具。
GR00T 的开放意味着开发者可以从 Cosmos 3 模型中获取物理世界理解能力后,直接在 GR00T 平台上进行仿真训练、策略优化和硬件部署测试。两者的组合形成了一个从"理解物理世界"到"控制物理身体"的完整工具链。
在 GTC 大会现场,英伟达展示了基于 Cosmos 3 + GR00T 的机器人演示:一台通用机械臂在从未见过的桌上物品布局中,自主规划抓取路径、避开障碍物、调整抓取姿态,整个过程未经过任何人为编程或硬编码规则。这种"看到即能操作"的能力,正是 Cosmos 3 赋能后物理世界 Agent 的典型表现。
物理 AI 为什么是"下一个 GPT 时刻"
自 2022 年末 ChatGPT 引爆大模型浪潮以来,AI 行业的核心叙事始终围绕"认知智能"展开——模型能写文章、能编程、能回答问题。但物理世界的智能化进程一直滞后:机器人需要预设程序、工业自动化需要精密标定、自动驾驶需要海量人工标注。根本原因在于,认知 Agent 面对的是"符号世界"(文字、代码、图像),而物理世界 Agent 面对的是"因果世界"(重力、摩擦力、运动学约束),后者对模型的推理要求完全不同。
Cosmos 3 的突破在于,它用数据驱动的方式学习了物理世界的因果规律。用英伟达官方的话来说:"Cosmos 3 不仅仅是在'看'世界,它是在'理解'世界如何运作。"当一个 AI Agent 理解了"杯子离开桌子会掉下来"这样的物理常识,它就不需要针对每种杯子、每张桌子、每种掉法进行分别编程——它可以举一反三。
这种泛化能力的意义在于,它可能从根本上降低机器人 Agent 的部署成本。当前工业机器人部署的主要成本不是硬件,而是针对每个工位、每个场景的定制化编程和调试。如果机器人 Agent 能够自主理解环境并生成动作策略,部署效率将会提升一个数量级。
开源生态的加速效应
Cosmos 3 和 GR00T 的完全开源,将物理 AI 的研发门槛从"国家级实验室"降到了"大学实验室"乃至"个人开发者"级别。此前,物理世界模型的训练需要大规模仿真数据、数千 GPU 的算力、以及昂贵的真实机器人硬件——这些资源只有少数机构能负担。开源之后,全球范围内的研究者、初创公司和中小型企业都可以基于 Cosmos 3 进行二次开发。
这一策略与 Meta 开源 Llama 系列模型对 LLM 生态的催化效应如出一辙。回顾 2023-2024 年,Llama 的开源直接催生了 Alpaca、Vicuna、Mistral 等数十个衍生模型和数千个垂直应用。Cosmos 3 在物理 AI 领域的开源策略,很可能复制同样的大众创新路径。
英伟达官方数据显示,Cosmos 3 发布后 48 小时内,其 Hugging Face 仓库的下载量已超过 10 万次,GitHub 仓库星标数突破 1.2 万。开发者社区的响应速度表明,物理 AI 的"大众化"需求比市场预期的更加强烈。
竞争格局的重新洗牌
Cosmos 3 的发布对当前机器人 Agent 赛道产生了直接冲击。此前,Google DeepMind 的 Gemini Robotics、OpenAI 筹建中的 Robotics 团队、Figure AI 的人形机器人项目,都在各自探索物理 AI 的封闭方案。Cosmos 3 的开源策略迫使这些玩家重新评估自己的技术路线——是继续走封闭路线,还是基于开源生态进行差异化竞争?
结合国内具身智能国标 YD/T 6770 于同一天(6 月 1 日)正式实施,物理世界 Agent 的"标准+开源"双引擎已经启动。标准化降低了选型风险,开源降低了进入门槛,两者叠加的效应可能在 2026 年下半年开始加速显现。
一个值得关注的信号是,英伟达在 GTC 上宣布 Cosmos 3 的后续版本将集成更多模态——包括触觉反馈、声音定位和温度感知。如果"全模态"路线持续推进,物理世界 Agent 的感知范围将超越人类,这可能催生出全新的机器人应用场景。
当然,从开源模型到可靠的商业产品仍有漫长的工程之路要走。Cosmos 3 在仿真环境中的优秀表现是否能在真实工业场景中复现,仍需时间验证。但至少,物理世界 Agent 的"GPT 时刻"已经到来——剩下的,是全球开发者如何接住这颗火种。