一亿美元这个里程碑的位置

据英伟达官方博客与公开报道,总部位于匹兹堡的 Skild AI 在首次商业部署十个月后,年化经常性收入(ARR)突破 1 亿美元。公司联合创始人兼首席执行官 Deepak Pathak 表示,这一节点标志着机器人产业正从演示阶段进入部署阶段。据公开报道,公司 2023 年成立以来累计融资超过 18 亿美元,其中今年 1 月由软银领投的 14 亿美元 C 轮估值超过 140 亿美元,相较七个月前的 45 亿美元翻了三倍以上。

比总收入更值得看的是收入结构。据公开分析,在 Skild 的收入中,移动底盘类应用仅占约 10%,专门的抓取方案约占 4%,主体来自工业操作与专项物理流程。这个分布与行业直觉相反——大众叙事里机器人等同于会走路的形态,但真正付费的是「机械臂把东西装对」。截至目前,公司毛利率、合同期限结构与客户续约率,官方及行业暂未披露更多细节,后续将持续跟进迭代动态。

S1 的核心主张:把演示当规格,而不是当轨迹

据英伟达官方博客与 Skild 的研究说明,S1 是公司近期披露的机器人基础模型,从设计上就是一个上下文学习者:它以一段任务演示视频作为输入,直接执行任务,不更新权重,也不做任务级的后训练。官方称 S1 是较早展示「在预训练期间从未见过的长程任务上具备上下文学习能力」的机器人基础模型,任务时长可达十分钟。

公开材料里有一个细节很能说明这套思路的取向。据 Skild 的研究说明,在一次盆栽测试中,土壤、花盆、浇水壶与植株在晚上 8 时 54 分送到办公室,9 时 16 分开始录制,9 时 22 分录完一段自我视角的人类演示,9 时 27 分 S1 已在硬件上自主执行任务,从演示到自主执行的间隔为 11 分钟。

更值得注意的是模型如何处理不完美的输入。据公开说明,S1 在物体被中途移动时可以调整,能从错误中恢复,能用功能相近的物体替代演示中的物体——在一次测试中,演示里用的是浇水壶,模型用了水杯。官方还提到,模型有时会改进本身就有缺陷的演示,把演示理解为对目标的说明,而不是要照抄的轨迹。这个区别在工程上很重要:如果模型只复现轨迹,操作员的失误会被一并复制;如果模型理解目标,失误反而可能被修正。

66% 与 9%:这组对比需要拆开读

据英伟达官方博客与 Skild 的研究说明,在一项对照研究中,S1 在未见过的多步任务上单步成功率约 66%,而一个语言指令驱动的视觉语言动作策略(VLA)约为 9%,差距被描述为七倍以上。这项对照在相同数据、架构与算力条件下进行,预训练数据规模从 1000 小时到 100000 小时不等,66% 与 9% 是在 100000 小时规模下、于未见长程任务上取得的。

这组数字需要配合其他几组一起看,否则容易得出过于简单的结论。据公开说明,在预训练期间见过的任务上,上下文学习在最大规模下达到 96% 成功率;而在 1000 小时规模下,语言条件策略得分为 53%,上下文学习为 43%——也就是说,在数据量较小时,上下文学习并不占优。此外,Skild 在五个等级的分布偏移下做了评测,在最严苛的条件下(半数动作需要用另一只手臂执行),语言指令策略的退化幅度最高达到上下文策略的三倍。在演示效率方面,官方估算一段上下文视频大致相当于 380 个后训练回合,而收集 380 个长程演示需要 50 至 100 小时遥操作;被对比的后训练基线在 2000 个演示后达到 86% 成功率。

把这些数据连起来,可以得到一个相对克制的判断:上下文学习的优势随数据规模与任务长度而放大,它在小数据与熟悉任务上并无明显优势,而在未见过的长程任务与分布偏移下优势显著。官方同时说明,380 这个数字是在实测点之间插值得到的估计值,属于推导而非直接测量。

产线上到底在装什么

据公开报道,Skild 与英伟达、富士康正在把 Skild Brain 部署到双臂机械臂上,用于英伟达 Blackwell 系统的高精度装配。公开描述的工作流包括拧 16 颗螺丝、安装母排、定位限位块,且需在严格的接触力阈值下完成,同时要能自主适应多个装配阶段中的物理扰动。

这个场景选择很有讲究。数据中心产品的架构版本迭代会改变几何布局,传统自动化方案在每次设计变更时都需要停线数月,重新编写轨迹脚本。而自适应策略可以吸收设计调整。这解释了客户为什么愿意为「能适应变化」付费——节省的不是机器人本身的工时,而是停线成本与工程重写成本。

其他公开的落地场景同样集中在「难」而不是「炫」的地方。据公开报道,住友电装用它自动化线束装配——线缆是柔性可变形物体,传统机器视觉系统在这类任务上表现一直不好;三井物产的餐饮服务公司用它在商用厨房做装盘,该公司每天为日本机构提供约 140 万份餐食,装盘是典型的人力密集瓶颈;G10 Fulfillment 部署抓取与打包机械臂,其首席运营官公开表示仓库产线从人工基线每小时约 50 条提升到约 130 至 140 条;STN 公司则用其做数据中心遥测与设施巡检。

路线之争:软件优先还是垂直整合

Skild 的路线选择是公开的:不生产任何机器人本体,把 Skild Brain 作为云端接口授权给各类硬件,覆盖人形机器人、四足机器人、台式机械臂与移动操作平台。据公开报道,客户已超过 60 家,分布电子装配、物流仓储、巡检安防、餐饮与数据中心运维等场景,富士康、三井物产、住友电装、G10 Fulfillment 等均为其客户。

这条路线与特斯拉、Figure AI 等垂直整合厂商形成鲜明对照。软件优先的好处是可服务多种本体、市场空间更大、不承担硬件制造的重资产与供应链风险;代价是能力受限于合作硬件的传感与执行水平,且需要证明模型能跨本体泛化。公开材料对跨本体泛化的表述目前仍以「覆盖多种形态」为主,具体的跨本体迁移成功率并未披露。

与此相关的一个表态值得记录。据公开报道,两位联合创始人在里程碑公告的配套文章中批评了机器人行业的「演示文化」,认为经过剪辑的视频片段掩盖了从原型 10% 可靠度到量产节拍之间的巨大鸿沟。这个批评在行业内有共鸣,但也需要对称看待——用收入数字证明部署能力是有效的,但收入不等于可靠度,且客户结构集中在少数大型企业时,早期增长的可持续性仍需时间检验。

中立思辨

需要冷静看待这家公司与这条路线。其一,ARR 属于公司口径,未披露合同期限、确认口径与续约率,10 个月破亿的增速在资本市场上确实罕见,但收入质量与可持续性需要更长周期验证。其二,66% 与 9% 的对比来自公司主导的对照研究,虽然条件控制得比较清楚,但属于内部评测,尚无独立第三方复现。其三,单步成功率不是任务完成率——对于包含数十步的长程任务,66% 的单步成功率在链式相乘后,整任务成功率会明显更低,这一点在评估产线可用性时必须换算。其四,S1 目前公开的演示任务集中在装盘、浇花、冲咖啡、套件组装等场景,这类任务的容错空间相对宽松;高精度装配的可用性依赖具体的力控与视觉条件,公开材料未给出产线良率数据。其五,上下文学习在低数据规模下不如语言条件策略这一结果,说明它的优势有明确适用条件,不是普适更优。其六,60 余家客户中的具体部署规模、每家的机械臂数量与持续运行时长未披露,「部署」与「规模化生产使用」之间仍有距离。其七,公司估值在七个月内翻三倍以上,估值增速远超收入增速,隐含了较高的未来预期,一旦落地节奏放缓,调整压力会较大。其八,不造本体的策略回避了硬件风险,但也意味着它对合作硬件的迭代速度没有控制权。

趋势研判

短期,具身智能的竞争指标会从「演示效果」转向「部署规模与单位经济性」,客户名单、机械臂装机量、产线节拍提升等可核验数据会成为融资叙事的主要支撑;中期,如果跨本体泛化被证明可行,「通用大脑加多样本体」的分工模式可能成为主流,硬件厂商与模型厂商的议价关系会重新分配;长期,机器人基础模型的评价标准可能向语言模型靠拢——从「单任务成功率」扩展到「未见任务上的迁移能力、分布偏移下的稳定性与数据效率」,而演示视频的质量将不再是有效的说服工具。

对制造业客户来说,一个务实的评估动作是:不要只看单步成功率,而要问清楚在自家产线的实际节拍与扰动条件下,完整任务的连续成功次数是多少、失败后需要多久恢复。这两个数字决定了它是「能用的产线设备」还是「值得继续观察的技术」。