资讯🔥8.0

觅蜂姚卯青:具身数据一定会向头部企业收敛

华尔街见闻·2026/9/1 02:14:18🔗 原文

📌 概要

8月31日,上海浦东叠桥路的觅蜂数采工厂,第20000套MEgo无本体数据采集设备下线,交付给京东科技集团。同一场活动上,觅蜂宣布累计生产的无本体数据超过100万小时,并与腾讯Robotics X实验室签署无本体数据业务合作。 觅蜂今年2月成立,MEgo在6月进入量产阶段,在此后三个月里跑出来百万小时数据。 姚卯青在致辞里说,物理AI的数据电网今天立下了第一根电线杆。此后,他用近一个小时回

⚡ 关键要点

  • 8月31日,上海浦东叠桥路的觅蜂数采工厂,第20000套MEgo无本体数据采集设备下线,交付给京东科技集团。同一场活动上
  • 觅蜂今年2月成立,MEgo在6月进入量产阶段,在此后三个月里跑出来百万小时数据。
  • 姚卯青在致辞里说,物理AI的数据电网今天立下了第一根电线杆。此后,他用近一个小时回答了一批行业内真实面对的问题:真机数采

8月31日,上海浦东叠桥路的觅蜂数采工厂,第20000套MEgo无本体数据采集设备下线,交付给京东科技集团。同一场活动上,觅蜂宣布累计生产的无本体数据超过100万小时,并与腾讯Robotics X实验室签署无本体数据业务合作。

觅蜂今年2月成立,MEgo在6月进入量产阶段,在此后三个月里跑出来百万小时数据。

姚卯青在致辞里说,物理AI的数据电网今天立下了第一根电线杆。此后,他用近一个小时回答了一批行业内真实面对的问题:真机数采中心关停怎么看、无本体会不会取代真机、这个行业最后竞争格局会如何。

01 无本体不是替代真机

交流中的第一个问题问的是北京石景山人形机器人数采中心关闭。

姚卯青说这是个例。依据是运营得好的数采工厂仍在满负荷运转,觅蜂自己的真机采集工厂以两班倒的节奏生产数据。最近发布的蚂蚁灵波、小米、智元的Foundation Model都用了数十万小时级别的真机数据,全国数采厂加起来刚好在产这些,其中还有不少达不到标准。

两种数据的关系是分层,不是替代。

无本体数据适合预训练阶段学习通用表征,真机数据适合后训练。具体到某一个任务上做落地,绕不开对应本体的真机数据。

对另外两类数据源,他给的位置更靠后。互联网视频是现阶段的拐杖,在第一人称视角数据不够的时候只能用它获取知识和表征,无本体数据到千万小时以上规模之后可以逐渐扔掉。仿真数据在训练环节占比很小,更多用在评测,原因是成本。仿真需要购买数字资产、建模、调用GPU渲染,而随着无本体设备规模化运营,单小时真实数据的成本已经低于仿真。

觅蜂至今累计的真机数据在几十万小时量级。

02 需求收敛,行业会走向寡头

年初到现在,客户要什么变了。

姚卯青说,年初这件事还比较多样,大家在迭代、试错、收敛,拿手机、运动相机采一采也能卖。到下半年,60FPS、1080P、双目、深度这些指标逐渐成为共识,需求主要由头部客户定义出来。已经有单一客户上来就要一万套设备,国内能做到这个量产规模的公司不多。

数据标准不统一的问题,他的回答是没有解法。

一家模型公司同时用几家供应商的第一视角数据,混合训练的效果很难保证。姚卯青举了自动驾驶的例子,把ISP算法稍微改一下,从CMOS的Raw Data转成RGB图像的这一步,人眼看不出区别,模型训出来可能完全变样。神经网络对数据信号仍然敏感。

他给的唯一解法是集中采买。这也是他观察到的现状,随着几家开始起量,客户放弃了每家都采一点试试的做法,转向集中给一两家独家供。

被追问行业会不会走向寡头分布,他的回答是肯定会。

理由是投入结构。几万套设备是几亿元的量级,背后要存几百PB到上千PB数据,建一个数据中心也是几亿到十亿的投入。这个生意同时吃工程能力、运营能力和资金实力。

验收口径也在交流中被问到。姚卯青说,百万小时是去重后可以上货架售卖的有效数据。片段里的操作信息要有效,不能人在摸鱼;标称60帧的平均帧率至少要到59.98;空间提取的Handpose,做得差的是几厘米,头部客户要求7毫米,有的要5毫米,而且要能通过机械臂和灵巧手编码器读出的真值来校验。

场景分布是另一道门槛。他说很多公司手里的数据一翻全是家居和叠衣服,每个任务只有一两个小时,满足不了头部需求。

判断一家数据公司的成色,他给的答案是:盲目采100万小时不难,重复做同一个工种就可以,但几乎没有价值。要看场景覆盖的多样性,看有没有详尽的质量验证报告,最后看有多少数据被签了验收单、确认了收入。

03 从百万到亿小时,路径是众包

通往AGI需要上亿小时数据,这是姚卯青当天反复提到的量级。从100万到1亿是100倍,他说线性复制这条路走不通,需要找到方式降维打击。

答案是众包。

路径是从集中式走到半集中式,最终到全民众包式。参照物是骑手和网约车,任何人都可以参与,把自己的技能、时间和经验变成可以量化结算的东西。觅蜂已经在测试相关产品。

现在的两万套设备,一部分由觅蜂自持用于众包采集,一部分销售给海内外用户。设备已经不只在专业采集厂和BPO公司手里,社区里的退休人员和宝妈也在贡献数据产能。

无本体的运营难度高于真机数采厂。真机采集是有一片场地、搭一些场景、雇一批人就能可控完成的事情,无本体要做的是设备资产在不同场景、行业和城市之间高效流转,人员规模大得多且需要培训,还要真正进得去那些真实场景。

与上一代数据服务公司的差别也在这里。姚卯青说,Scale AI那一代的标注工作坐在电脑前就能完成,有人有一台性能不错的电脑,培训半天到一天就能上岗。物理AI的链条长得多,场景方要给你场景,进得去还要采得出,采回来还有存储、切片、标注、Handpose提取。客户要在上游一家家找供应商,是非常不友好的过程。觅蜂做的是一站式交钥匙,客户给出需求分布,交付可以直接训模型的数据。

Figure此前发布Index平台并宣布投入10亿美元。姚卯青说不清楚对方实际采集了多少小时,从公开介绍看场景偏家政,觅蜂的布局是在国内覆盖更广的场景。

数据定价目前没有标准价,取决于场景的稀缺性、进入获取的难度和交付时间要求。流通规则也还在形成,行业里有两种模式,一种出售使用权,产权仍归数据方;另一种是买断独享,觅蜂需要把数据从自己的服务器上移除。

这些都还没有定论。姚卯青对行业节奏给出的判断是,未来几年从商业化角度讲,数据是比模型本身更先实现规模化、产业化的行业。模型是开端,但定义终局的是数据。

 

本文来自微信公众号“硬AI”,关注更多AI前沿资讯请移步这里

风险提示及免责条款 市场有风险,投资需谨慎。本文不构成个人投资建议,也未考虑到个别用户特殊的投资目标、财务状况或需要。用户应考虑本文中的任何意见、观点或结论是否符合其特定状况。据此投资,责任自负。