具身智能这一轮融资里,出现了一个不太一样的标的。据 TechCrunch 9 月 11 日报道,人形机器人数据初创公司 Mecka AI 正接近完成一轮由红杉资本领投的融资,公司估值约 5 亿美元。报道同时提示,本轮融资的具体规模尚未披露,交易条款仍可能发生变化,5 亿美元目前是一个拟议价格,而非已完成的融资。这条新闻的分量不在金额,而在它把一个问题摆到了台面上:当模型能力的差距被逐渐抹平,具身智能真正稀缺的东西是什么。
它做的事:把普通人的日常动作变成训练集
Mecka AI 成立于 2024 年,名字取自虚构的巨型动漫机器人。它的产品逻辑相当朴素:付费请普通人戴上身体传感器、拿起手机,把自己做日常劳动的过程录下来——修车、做咖啡、修家电,在真实环境里完成,按小时计酬。公司随后把这些素材加工成面向机器人模型的数据。
这套模式与遥操作(teleoperation)形成对照。遥操作由人通过设备直接操控机器人完成任务,产生的数据与具体机器的关节与动作高度绑定,采集速度受限于机器人数量、操作员人数与可用工时。Mecka AI 选择让人自己去做,把视频采集的规模上限从「有多少台机器人」改成「有多少人愿意录」,理论上把潜在的数据供给扩展到了数十亿量级。公司方面曾向媒体表示,可用的机器人今天就可以部署,并把集成工作视为产品的一部分而非后续附加项。
据公开信息,公司的技术主张已有部分进入公开研究。EgoVerse 论文把两位创始人列为产业合作方,并致谢 Meta Reality Labs Research、Mecka AI 与 Scale AI 在数据贡献、工程支持、基础设施协助与协作方面的帮助。论文报告的数据规模为 1362 小时人类演示、约 8 万个 episode、1965 项任务、2087 名演示者;项目主页当前列出的快照则为 4003 小时,episode、任务与演示者数量大致相当。论文的结论对这条路线既是支持也是约束:与人类数据协同训练总体上有助于提升机器人策略表现,但有效扩展取决于人类数据与机器人学习目标之间的对齐程度;演示者与场景的多样性也带来了收益。
创始团队:四个没有机器人背景的人
让这笔融资更值得琢磨的,是团队构成。四位创始人中,Josh Gao 与 Mogen Cheng 此前做的是餐厅支付技术,相关创业项目在 2023 年出售;Jason Chong 曾是微软软件工程师,并参与创办链上支付公司 Utopia Labs(后被 Coinbase 收购);Duy Nguyen 早年靠转卖球鞋起步,后来经营 Diamond Agency。四人都没有机械工程或强化学习的传统履历。
据公开报道,他们在确定方向前花了数月阅读机器人论文、走访实验室、联系机器人研究者,最终把「人类演示」定为公司的核心输入。这种「运营假设优先于研究血统」的路径,让公司的说服力更多来自对瓶颈的判断,而不是论文数量。值得注意的是融资节奏:公司曾在 2026 年 6 月宣布合计 6000 万美元的两笔融资(一笔 2500 万美元的 A 轮于 2025 年 11 月完成,另一笔 3500 万美元的追加投资),均由 Framework Ventures 领投,Menlo Ventures、SV Angel、Kindred Ventures 与天使投资人 Ted Xiao 参与,当时公司约 40 名员工。三个月后传出红杉领投、估值约 5 亿美元的消息,说明资本正在抢在品类赢家出现之前占位。
为什么是数据:具身智能的结构性缺口
要理解这笔估值的逻辑,需要回到具身智能的训练困境。语言与多模态模型可以从开放网络拿到海量文本,但一段文本教不会一个双足机械框架如何分配重心,也教不会它如何控制抓握力度。仿真工具提供了物理沙盒,却长期受困于现实差距:策略在仿真里跑得很好,碰到真实门把手的细微摩擦变化就可能失效。这正是所谓 Sim2Real 陷阱的来源。也正因为如此,视觉—语言—动作(VLA)架构成为近年的主流方向,而训练这类模型需要成百万条真实世界的轨迹。
在这条路径上,遥操作精度高但慢且贵,自我视角视频采集则便宜得多,能提供人手与工具交互的密集视觉演示。Mecka AI 的做法,本质上是把当年 Scale AI、Surge、Mercor 在语言模型时代做的事情,复制到物理世界的数据供给上:聚合海量原始人类动作,加上结构化元数据,再以溢价卖给前沿实验室。
质疑也同样清晰。手机与穿戴设备录下的视频,缺少力反馈、扭矩读数与精确的触觉空间追踪——一段拧扳手的视频能显示动作看起来是什么样,却无法记录松开螺栓用了多少牛顿米。把被动视频当作单一燃料,长期可能限制策略在需要精细力控的任务上的表现。此外,公司方面曾向媒体表示预计在 2026 年底达到 1 亿美元的年化收入运行率,这一数字基于已签合同,属预测而非已实现的年度收入;客户身份、定价与已收款金额均未公开,拟议估值在相当程度上仍锚定在尚未完整兑现的合同上。
中立思辨
需要辩证看待这条路线。其一,把数据供给从机器人数量中解放出来,确实是解决规模问题的一条现实路径,但规模与质量并非同一件事,缺少力与触觉维度的数据能否支撑高精度操作,仍需更多公开评测来验证。其二,论文显示人类数据协同训练有效,但效果依赖与机器人学习目标的对齐,这意味着「采集」只是起点,加工与对齐才是壁垒所在。其三,估值在三个月内从 6000 万美元融资规模跃升到 5 亿美元量级,反映的是资本对品类的抢位焦虑,而非对具体公司收入结构的确认,目前融资规模未披露、条款仍可能变化,不宜把拟议估值当作既成事实。其四,创始团队缺少机器人研究履历,既是「从瓶颈出发」的优势,也意味着在需要长期技术积累的环节上更依赖外部合作与人才补充。其五,付费收集人类视频涉及隐私、知情同意与数据使用边界,采集对象覆盖日常劳动场景,相关的合规框架目前仍不清晰。其六,与 Scale AI 等既有数据供应商相比,Mecka AI 同时做采集、处理、评估与部署支持,业务范围更宽,但也更容易在多个环节同时遭遇资源约束。其七,具身智能的落地节奏取决于硬件成本与场景成熟度,数据供给的改善未必能立刻转化为部署量的增长。
趋势研判
短期,机器人训练数据的争夺会继续升温,具备大规模采集能力与加工管线的团队会获得明显溢价;中期,行业的分水岭会从「谁能采到更多数据」转向「谁能把数据对齐到具体机器人的学习目标」,采集、标注、仿真增强与评测将逐步分化成独立的专业环节;长期,数据供给的标准化程度会决定具身智能的扩张速度——如果每家实验室都要自建采集体系,成本将长期居高不下,而如果出现可复用的数据标准与评估口径,整个赛道的迭代节奏会明显加快。对创业团队来说,值得关注的不是估值本身,而是这个品类里是否会出现真正的数据基础设施,而不是又一批依赖单一大客户订单的项目。