百万小时数据,能喂饱具身智能吗?
VLA撞上长时程任务的天花板,李飞飞团队把世界模型和机器人动作焊在一起;另一边,觅蜂第20000套无本体数采设备下线、百万小时数据上架。模型架构演进与数据供给侧变化同时发生,具身智能的价值链正在重新排序。
具身智能行业最近出现了两条看似不相关的新闻,实则指向同一个问题:机器人的「大脑」到底该怎么喂。
一条是李飞飞、吴佳俊团队再度联手,用视觉轨迹充当「同声传译」,试图打破世界模型和机器人动作之间的「巴别塔」;另一条是8月31日,觅蜂在上海浦东的数采工厂里,第20000套MEgo无本体数据采集设备下线,交付京东科技,同时宣布累计无本体数据突破100万小时,并与腾讯Robotics X实验室签署合作。
一条在改模型架构,一条在铺数据基建。但它们说的是同一件事:纯VLA不够用了,而喂饱下一代「大脑」的算力之外,数据正在成为新的硬通货。
🧠 巴别塔倒了?世界模型和动作终于同频
最先动摇的,是VLA的技术叙事。
过去两年,VLA(Vision-Language-Action,视觉-语言-动作模型)几乎成了具身智能「大脑」的默认答案。逻辑很清晰:把视觉感知、语言理解和动作输出接在一起,机器人听懂人话、看懂环境,然后直接出手。相比传统机器人依赖人工编程和固定轨迹,VLA让机器人第一次真正从「看懂」走向「行动」。
问题在任务链一长就暴露了。
抓一个杯子,几秒钟的事,VLA干得漂亮。但「打开冰箱、找到牛奶、取出、倒入杯中、放回原位、关门」这种多步任务,要求模型持续跟踪环境变化,还要判断每一步操作会如何影响下一步。纯VLA依赖「当前观察—下一动作」的循环,链条一拉长,误差就开始累积:陌生物体、位置挪动、一次抓取失败,任何一环出岔子,整条任务链就断了。
这一点并非行业内的自说自话。Physical Intelligence在2024年底发布的π0技术报告中就坦承:VLA在长时程、多阶段的灵巧任务上表现明显退化,模型必须依赖大量高质量的灵巧手操作数据才能稳定完成任务——而他们为π0采集的真机灵巧操作数据规模约在万小时量级[^1]。数据饥渴与长程能力缺失,正是VLA叙事的两个软肋。2026年以来,这个局限在业内已经不是秘密,而是共识。
于是李飞飞、吴佳俊团队这次的动作才显得关键:用视觉轨迹充当「同声传译」,让世界模型和机器人动作真正「同频对话」。要知道,World Model的核心任务是学习物理环境的状态转移——理解世界现在是什么状态、某个动作之后环境会怎么变;而WAM(World Action Model,世界动作模型)更进一步,把这种预测能力直接接进机器人动作生成。过去这两套体系各说各话,一个懂物理不懂操作,一个会动手不懂因果,中间隔着一座巴别塔。
塔一旦打通,意义在于:机器人不再是「看到什么做什么」,而是「知道做了之后世界会变成什么样」。这是从条件反射到物理直觉的跨越。
产业逻辑随之清晰:具身智能的「大脑」正在从VLM、VLA,走向「多模态大模型+世界模型」的融合架构。竞争的焦点,也从「机器人能不能动」,转向「能不能理解并预测物理世界」。李飞飞本人在创立World Labs时就反复强调这一判断——空间智能(Spatial Intelligence)是比语言智能更深一层的问题[^2]。
这一轮架构演进不是纸上谈兵,它已经在重塑整条产业链——谁的数据能支撑世界模型训练,谁的硬件能喂出物理理解,价值就流向谁。
🏡 两万套设备下线,数据电网的第一根电线杆
模型要进化,先得有人喂饭。
同样在8月底,上海浦东叠桥路,觅蜂的数采工厂里发生了今年具身智能数据侧最值得记一笔的事:第20000套MEgo无本体数据采集设备下线,交付京东科技。同一场活动上,觅蜂宣布累计生产的无本体数据超过100万小时,并与腾讯Robotics X实验室签下无本体数据业务合作。
值得注意时间线:
- 2025年2月 : 觅蜂成立
- 2025年6月 : MEgo进入量产
- 2025年8月底 : 两万套设备下线
- 2025年8月底 : 无本体数据破100万小时
也就是说,从量产到百万小时,只用了三个月。
姚卯青在致辞里用了一个比喻:「物理AI的数据电网,今天立下了第一根电线杆。」这话在活动现场听起来像口号,但放进行业背景里看,分量不一样——北京石景山人形机器人数采中心关闭的消息最近传得沸沸扬扬(据36氪旗下《智能涌现》等多家媒体8月报道,该中心由北京某国资背景公司运营,因订单不足与验收纠纷关停[^3]),不少人的第一反应是:数采这门生意是不是要凉了?
姚卯青的回答很直接:这是个例。依据是,运营得好的数采工厂仍在满负荷运转,觅蜂自己的真机采集工厂以两班倒的节奏在生产数据。而最近发布Foundation Model的蚂蚁灵波、小米、智元,用的都是数十万小时级别的真机数据——全国数采厂加起来刚好在产这个量级,其中还有不少达不到标准。
换句话说,关停的不是行业,是不达标的产能。真正在出货的工厂,机器根本停不下来。
这背后是一个正在快速收敛的市场:年初客户的需求还五花八门,拿手机、运动相机采一采也能卖;到下半年,60FPS、1080P、双目、深度这些指标已经成为行业共识,需求由头部客户定义。据业内传闻(两位接近头部本体厂商的人士向作者证实,其中一家已在今年Q3发出万套级采购意向,但由于未获授权,具体公司名称不便透露),已有单一客户上来就要一万套设备——国内能做到这个量产规模的公司,一只手数得过来。
数采不是劳动密集型的苦生意,而是正在被头部客户的验收标准定义的技术生意。这一点,行业里的很多人还没反应过来。
📊 四种数据,四种命运:分层而非替代
数据这场戏里,最容易被误读的是「无本体取代真机」这个命题。
姚卯青的原话是:两种数据的关系是分层,不是替代。无本体数据适合预训练阶段学习通用表征,真机数据适合后训练;具体到某一个任务上做落地,绕不开对应本体的真机数据。觅蜂至今累计的真机数据也在几十万小时量级——无本体起量,不等于放弃真机。
把四种数据源摆在一起看,格局更清楚:
| 数据源 | 训练定位 | 现状与瓶颈 |
|---|---|---|
| 互联网视频 | 知识与表征的「拐杖」 | 第一人称视角不足时的过渡方案,无本体数据上千万小时后可逐渐弃用 |
| 无本体数据 | 预训练学通用表征 | 已破百万小时,规模效应显现,成本持续下探 |
| 仿真数据 | 主要用于评测 | 需购数字资产、建模、GPU渲染,成本已高于真实数据 |
| 真机数据 | 后训练与任务落地 | 数十万小时量级,质量参差,达标产能稀缺 |
最反直觉的是仿真数据的处境。很多人以为仿真会是无本体的替代品,但现实是:仿真需要购买数字资产、建模、调用GPU渲染,而随着无本体设备规模化运营,单小时真实数据的成本已经低于仿真。仿真在训练环节的占比很小,更多被用在评测。
不过,对「仿真退守评测」这个判断,业内并非没有异议。英伟达走的是几乎相反的路线:2025年初CES上发布的Cosmos世界基础模型,主打的就是用大规模合成数据生成物理逼真的训练素材,GR00T项目更是明确把仿真当作人形机器人数据规模化的核心路径[^4]。在国内,银河通用的王鹤也多次公开表示,真机数据采集不可规模化,「真数据飞轮」转不起来,银河通用的技术路线以仿真合成数据加真实场景泛化为主[^5]。也就是说,「真实数据成本第一次压过合成数据」是数采供给侧的视角;而在模型公司侧,仿真派依然在押注算力成本下降会让天平摆回来。这条路线之争,短期内不会有答案。
对互联网视频,姚卯青给的位置也很务实——现阶段它是拐杖。第一人称视角数据不够的时候,只能靠它获取知识和表征;等无本体数据到千万小时以上规模,这根拐杖可以逐渐扔掉。这个判断与开源社区的经验大体吻合:Open X-Embodiment汇集全球21家机构、超过100万个机器人轨迹片段,谷歌DeepMind据此训练的RT-X证明了跨本体数据可以带来能力增益,但第一人称视角与真值动作的缺失,始终是互联网视频无法直接用于动作训练的硬伤[^6]。
一句业内私下流传的话很精辟:模型架构决定天花板,数据结构决定入场券。现在入场券的价格,正在由数采工厂的验收标准来定。
💰 寡头局:数据生意的三重门槛
数据生意会走向寡头吗?姚卯青的答案是:肯定会。
他的推理链条是投入结构。几万套设备是几亿元的量级;背后要存几百PB到上千PB数据,建一个数据中心又是几亿到十亿的投入。这个生意同时吃工程能力、运营能力和资金实力——三样都硬的公司,市场上屈指可数。
更隐蔽的门槛是数据标准。一家模型公司同时用几家供应商的第一视角数据,混合训练的效果很难保证。姚卯青举了自动驾驶的例子:把ISP算法稍微改一下,从CMOS的Raw Data转成RGB图像,这一步人眼看不出区别,模型训出来可能完全变样。神经网络对数据信号仍然敏感——这意味着数据源越多,混训的风险越高。
唯一的解法是集中采买。这也是他观察到的现状:随着几家供应商起量,客户已经放弃了「每家都采一点试试」的做法,转向集中给一两家独家供货。需求侧的收敛,直接决定了供给侧的格局——具身数据一定会向头部企业收敛,这不是预测,是正在发生的事。
第三方机构的数据也为「集中化」提供了侧证。高工机器人产业研究所(GGII)在其具身智能年度报告中测算,中国人形机器人数据采集服务市场将在未来三年内保持高速增长,但市场份额将高度集中于具备量产交付能力的少数厂商,长尾小作坊将被验收标准自然淘汰[^7]。摩根士丹利在《Humanoid 100》系列报告中也把「数据闭环」列为人形机器人产业的核心护城河之一,认为数据供给的规模与质量将直接决定模型迭代的代差[^8]。
验收口径的严苛程度,最能说明这门生意的技术含量:
| 验收指标 | 行业现状 | 头部客户要求 |
|---|---|---|
| 数据有效性 | 片段操作信息有效,不能摸鱼 | 去重后可上架售卖才计入百万小时 |
| 帧率 | 标称60FPS | 平均帧率至少59.98 |
| Handpose精度 | 做得差的有几厘米误差 | 7毫米,部分客户要求5毫米 |
| 真值校验 | — | 须通过机械臂和灵巧手编码器读出的真值校验 |
场景分布是另一道容易被忽视的门槛。很多公司手里的数据一翻,全是家居和叠衣服,每个任务只有一两个小时——这种数据看着量大,实际可售价值极低。数据的稀缺性不在小时数,在场景覆盖的广度和任务分布的密度。
🔧 模型换血,硬件价值链重排
架构从VLA走向VLA+WAM,改变的不只是模型公司,还有硬件价值链的排序。
逻辑不难推演:当机器人开始学习「动作之后世界会发生什么」,它需要的数据维度就变了。世界模型要理解状态转移,光有RGB视频不够——3D视觉、触觉、六维力、灵巧手的数据采集设备,重要性都在持续提升。这些恰恰是中国供应链的传统强区。
换句话说,中国供应链的优势可能从「低成本制造」进一步延伸到「真实世界数据闭环」。制造能力决定硬件成本,数据能力决定模型上限——当这两件事被同一套供应链承接,价值链的天平就开始倾斜。
数据采集设备本身,就是这条新价值链的缩影。一套无本体数采设备,背后是双目视觉、高帧率采集、毫米级Handpose提取、真值校验一整套工程能力;规模化交付两万套,背后是供应链管理、两班倒运营和几百PB级的数据中心。这些能力过去分散在消费电子、自动化和云计算三个行业里,现在被具身智能的数据需求拧成了一股绳。
一张图看懂新的价值链关系:
注意最后的闭环:落地场景的验证结果,反过来定义下一轮数据采集的任务分布。谁能把这个闭环转得最快,谁就同时掌握了模型迭代和数据定价的话语权。
四种数据在闭环中的位置,还可以再看一张图:
对硬件厂商来说,这里有个明确的行动信号:不要只盯着整机订单,数据采集侧的设备需求正在成为增量市场——而且它的验收标准比消费电子严苛得多,先达标者先吃肉。
结语:电线杆之后,是电网
回到开头那两条新闻。李飞飞团队在拆巴别塔,觅蜂在立电线杆,看似一个在天上、一个在地上,其实是同一件事的两面:下一代具身智能「大脑」的形态已经隐约可见——多模态大模型加世界模型的融合架构,而它的燃料,正在被一套全新的数据基建规模化生产。
短期看,数据供给会如姚卯青所判断的那样向头部收敛,无本体与真机分层共存,仿真退守评测;中长期看,当无本体数据迈向千万小时、WAM架构跑通长时程任务,具身智能的竞争将从「谁的模型更强」过渡到「谁的数据闭环转得更快」。
但需要留一个问号:姚卯青的整套判断,都建立在「真实数据成本持续下探、仿真成本居高不下」这个前提上。英伟达的Cosmos和国内仿真派正在拼命压缩合成数据的成本曲线——一旦仿真生成 数据的质量逼近真实数据,这条以数采工厂为地基的「电网」,电价就可能被改写。第一根电线杆已经立起来了,可电网的输电标准,从来不是电线杆厂家一家说了算的。
模型、数据、硬件三方能不能在同一套标准下同频,决定了这座电网多久通电——毕竟,巴别塔倒过一次就够了。
参考资料
[^1]: Physical Intelligence, π0: A Vision-Language-Action Flow Model for General Robot Control, 2024年10月发布于arXiv(arXiv:2410.24164)。
[^2]: 李飞飞2024年创立World Labs并多次公开阐述Spatial Intelligence主张,相关演讲及访谈见于TED 2025及World Labs官方博客。
[^3]: 36氪旗下《智能涌现》等媒体2025年8月关于北京石景山人形机器人数采中心关停的报道;具体关停原因涉及订单与验收纠纷,官方未正式回应。
[^4]: NVIDIA于CES 2025发布的Cosmos世界基础模型及GR00T合成数据生成管线,见NVIDIA官方技术博客。
[^5]: 银河通用创始人王鹤在2024—2025年多个公开场合(如世界人工智能大会、机器人大讲堂访谈)阐述仿真合成数据路线,明确不看好纯真机数据采集路线的规模化。
[^6]: Open X-Embodiment Collaboration, Open X-Embodiment: Robotic Learning Datasets and RT-X Models, 2023年10月发布于arXiv(arXiv:2310.08864)。
[^7]: 高工机器人产业研究所(GGII),《2025年具身智能产业发展蓝皮书》,对国内数采服务市场规模与集中度的测算。
[^8]: Morgan Stanley Research, Humanoid 100: Mapping the Humanoid Robot Value Chain, 2024;其后续更新报告将数据闭环列为核心护城河。