具身智能人形机器人产业观察评论分析· 3508· 约6分钟阅读

百万小时之后,机器人数据开始寡头化

机器人他爹假装能听懂机器人的想法
2026-09-09 06:29 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

觅蜂第20000套MEgo无本体数采设备下线交付京东,累计无本体数据破百万小时。无本体与真机数据分层而非替代,验收标准卷到帧级与毫米级,投入结构决定行业必然走向寡头。VLA暴露长时程短板,WAM融合正在重构硬件价值链,数据闭环成为供应链新护城河。

机器人的「数据电网」,立起了第一根电线杆。

8月31日,上海浦东叠桥路,觅蜂的第20000套MEgo无本体数据采集设备下线,交付给京东科技。同一天,觅蜂宣布累计无本体数据突破100万小时,并与腾讯Robotics X实验室签署合作。这家公司2月才成立,MEgo 6月进入量产,三个月跑出百万小时。

创始人姚卯青在活动上说了句漂亮话:物理AI的数据电网,今天立下了第一根电线杆。

漂亮话背后是产业正在发生的硬变化:数据从「能采就行」卷到帧级验收,模型从VLA走向WAM融合,行业格局从百花齐放滑向寡头收敛。这篇文章拆开讲。

📊 百万小时下线:数据验收卷到帧级

百万小时听着唬人,行业里私下问的第一句往往是:这数怎么算的?

姚卯青的回答很直接——百万小时是去重后可以上货架售卖的有效数据。片段里的操作信息要有效,「不能人在摸鱼」;标称60帧的平均帧率至少要到59.98;空间提取的Handpose,做得差的是几厘米,而头部客户要求7毫米,有的甚至要5毫米,且必须能通过机械臂和灵巧手编码器读出的真值来校验。

这不是抬杠,是需求端倒逼的。年初客户需求还很多样,拿手机、运动相机采一采也能卖;到下半年,60FPS、1080P、双目、深度这些指标逐渐成为共识,需求由头部客户定义。已经有单一客户上来就要一万套设备,国内能做到这个量产规模的公司不多。

验收口径的变化,本质上是数据从「AI饲料」变成「工业品」的信号。工业品的逻辑是:标准可量化、批次可复现、真值可校验。达标的进货架,不达标的连议价资格都没有。据接近头部数采厂的人士透露,全国数采厂产能加起来勉强够几家模型公司消化,其中还有不少达不到标准——有效产能的稀缺,比总产能的数字更重要

🔋 无本体 vs 真机:分层,不是替代

北京石景山人形机器人数采中心关停的消息传出后,「真机数采要凉」「无本体取代真机」的说法流传了一阵。

姚卯青的判断是个例。运营得好的数采工厂仍在满负荷运转,觅蜂自己的真机采集工厂两班倒生产数据。最近发布的蚂蚁灵波小米智元的Foundation Model都用了数十万小时级别的真机数据。他的公司至今累计真机数据也在几十万小时量级。

真正值得记住的是他对四类数据源的排序——这是当下具身智能数据栈最清晰的一张地图:

无本体数据适合预训练阶段学习通用表征,真机数据适合后训练;具体到某一个任务上做落地,绕不开对应本体的真机数据。互联网视频是「现阶段的拐杖」,无本体数据到千万小时以上规模后可以逐渐扔掉。仿真数据占比最小,原因是成本——买数字资产、建模、调GPU渲染,算下来单小时成本已经高于规模化运营的无本体真实数据。

一句话总结这套分层:预训练看规模,后训练看本体,落地绕不开真机。

数据类型训练阶段成本趋势可替代性
互联网视频知识预训练低但信息密度差千万小时级无本体数据可替代
无本体第一视角预训练/通用表征规模化后低于仿真不可被仿真替代
真机遥操数据后训练/任务落地不可替代
仿真数据评测为主资产+渲染成本高企辅助角色

⚠️ VLA不够用了:WAM补上「动作之后的世界」

数据栈变化的另一面,是模型架构的压力测试。

过去两年,VLA(视觉-语言-动作模型)是具身智能「大脑」的主流路线:把感知、语言理解、动作输出连起来,机器人从「看懂」走向「行动」。但2026年以来,纯VLA的局限逐渐暴露。抓一个杯子只要几秒,「打开冰箱、找到牛奶、取出、倒入杯中、放回、关门」却要求模型持续跟踪环境变化。任务链条一拉长,「当前观察—下一动作」的范式就会误差累积,陌生物体、位置变化或一次抓取失败,整条链就断了。

于是方向收敛到WAM(World Action Model,世界动作模型):不仅理解世界当前状态,还要预测动作执行之后环境如何变化,并把这种预测能力和动作生成绑定。具身智能的竞争,正在从「能不能动」转向「能不能理解并预测物理世界」。

架构变化同时在重排硬件价值链:

世界模型要预测「动作之后的世界」,就必须有足够的传感输入去验证预测——3D视觉、触觉、六维力、灵巧手的权重都在上升,而数据采集设备作为整个闭环的源头,价值持续放大。中国供应链的机会,可能从低成本制造延伸到真实世界数据闭环

🧪 学术数据≠真实数据:可解释性成生死线

IJCAI 2026上,TUM的黎子玥抛出一个扎心的问题:模型这么大这么强,为什么还是「上不了路」?

她的核心判断有两句:学术数据和真实数据完全是两回事可解释性成落地「生死线」

这两句话和姚卯青的一个技术细节恰好互为印证。被问到数据标准为什么不统一时,他的回答是「没有解法」,并举了自动驾驶的例子:把ISP算法稍微改一下,从CMOS的Raw Data转成RGB图像这一步,人眼看不出区别,模型训出来可能完全变样。神经网络对数据信号仍然敏感。

这意味着一家模型公司混用几家供应商的第一视角数据,训练效果很难保证。人眼看是同一件事,对模型可能是两个物理世界。

可解释性问题的产业含义在于:当机器人进入工厂、进入家庭,客户不仅要它「做对」,还要在它「做错」时知道为什么。黑盒模型在demo里无所谓,在交付合同里是赔偿条款。这也是为什么头部厂商都强调用编码器真值校验数据——可验证的真值,是黑盒时代里为数不多的可解释性抓手

💰 寡头逻辑:几亿设备、百PB数据,谁玩得起

行业会不会走向寡头?姚卯青被追问时的回答是:肯定会。

理由不是口嗨,是投入结构。几万套设备是几亿元的量级;背后要存几百PB到上千PB的数据,建一个数据中心又是几亿到十亿的投入。这个生意同时吃工程能力、运营能力和资金实力三张牌。

需求端也在做同样的筛选。数据标准没有统一解法,客户就放弃了「每家都采一点试试」的做法,转向集中给一两家独家供货——集中采买是他给出的唯一解法,也是他观察到的现状。已经有单一客户开口就要一万套设备。

一条简化的收敛路径如下:

三个月,从量产到两万台、百万小时、头部客户独家合作——这个节奏本身就是筛选器的说明书。数采这门生意正在复刻所有硬件+数据平台型生意的宿命:前期看谁先起量,后期看谁的成本曲线压得住、资金链扛得住。腰部玩家的窗口,正在从「有没有设备」变成「有没有客户愿意独家押注」。

小结:数据电网的第一次并网

把三件事放在一起看:觅蜂百万小时下线、WAM开始重构大脑、数据验收卷到帧级毫米级——具身智能的竞争,正在从「模型参数竞赛」切换到「数据资产+真值体系+资金规模」的综合战。

数据是新的电网,但电网生意从来不属于大多数人。无本体与真机分层、仿真退居评测、互联网视频谢幕,这条数据栈的排序会在未来一两年内成为行业共识。而共识一旦形成,头部集中只是时间问题。

下一根电线杆立在哪里,取决于谁先把千万小时的无本体数据、满负荷的真机工厂和WAM级的模型闭环跑通。电线杆立起来之前,讲的都是故事;并网之后,剩下的才是生意。