具身智能人形机器人产业观察评论分析· 3893· 约7分钟阅读

百万小时数据,喂得饱机器人吗?

机器人他爹假装能听懂机器人的想法
2026-09-09 06:29 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

觅蜂数采工厂第2万套设备下线、无本体数据破百万小时,叠加高盛大幅上调人形机器人出货预期、纬钛押注触觉,具身智能竞争重心正从模型demo转向真实世界数据。数据分层、标准收敛、寡头化、触觉补课,构成物理AI落地的四条主线。

8月31日,上海浦东叠桥路,觅蜂第20000套MEgo无本体数据采集设备下线,交付京东科技。同一天,觅蜂宣布累计无本体数据突破100万小时,并与腾讯Robotics X实验室签署数据合作。

这家公司2月才成立,6月量产,三个月跑出百万小时。CEO姚卯青在现场说了一句意味深长的话:物理AI的数据电网,今天立下了第一根电线杆。

这不是一次普通的工厂下线仪式。把这条新闻和高盛同日大幅上调人形机器人出货预期、纬钛机器人李瑞喊出「触觉是必选项」放在一起看,一个清晰的产业判断浮出水面:具身智能的竞争,正在从「谁的模型demo好看」,转向「谁有真实世界数据」和「谁的感知更完整」。

📊 百万小时,是门什么生意

先看故事。今年初,具身智能数据采集还是个杂耍式的行当——拿手机、运动相机采一采,视频也能卖钱。到了8月底,觅蜂的无本体设备三个月量产两万套,单一客户开口就要一万套。

节奏变化之快,超过了大多数人的预期。

数据层面同样凶猛:2月成立、6月MEgo进入量产、8月31日累计无本体数据破100万小时、真机数据做到几十万小时量级。作为参照,最近发布蚂蚁灵波小米智元的Foundation Model,用掉的真机数据也就在数十万小时级别——而全国数采厂加起来的产出刚好在这个量级,其中还有不少达不到上架标准。

这背后是一条产业逻辑:当大模型架构逐渐趋同,数据成了拉开差距的少数变量。谁能稳定、规模化地生产合规数据,谁就站在了物理AI的上游。数采不再是「外包苦力活」,而是带工程壁垒的供给侧生意。

🗺️ 数据分层:无本体取代不了真机

每种数据,都有自己的位置。

交流环节的第一个尖锐问题,来自北京石景山人形机器人数采中心的关闭——真机数采是不是要凉?姚卯青的回应很直接:这是个例。运营得好的数采工厂仍在满负荷运转,觅蜂自己的真机采集工厂两班倒生产数据。

他的核心判断是:两种数据是分层关系,不是替代关系。

无本体数据适合预训练阶段学通用表征;真机数据适合后训练,任何具体任务落地都绕不开对应本体的真机数据。至于另外两类数据源,位置更靠后——互联网视频是现阶段的「拐杖」,第一人称视角数据不够时只能靠它获取知识,等无本体数据规模超过千万小时就可以逐渐扔掉;仿真数据在训练环节占比很小,更多用于评测,因为要买数字资产、建模、调用GPU渲染,成本反而高于规模化后的真实数据。

数据类型训练阶段核心价值当前瓶颈
互联网视频预训练早期知识与表征视角错配,是拐杖
仿真数据评测为主场景可控数字资产与渲染成本高
无本体数据预训练规模化通用表征需千万小时级规模
真机数据后训练任务落地与真值校验产能稀缺,标准严苛

这套分层框架,回答的是行业眼下最焦虑的问题——真机数采中心关停怎么看。答案是:关停的是低效产能,不是这条赛道。真机数据依然是落地环节的硬通货,只是不会被无限扩张成全国几百家小作坊的形态。

🏭 数采这门生意,正在奔向寡头

需求由头部定义,格局由资金决定。

姚卯青观察到,年初客户需求还五花八门,大家边迭代边试错;到下半年,60FPS、1080P、双目、深度这些指标逐渐成为共识——需求收敛,本质上是由头部客户定义出来的。已经有单一客户上来就要一万套设备,国内能做到这个量产规模的公司屈指可数。

数据标准不统一怎么办?他的回答近乎无情:没有解法,唯一解法是集中采买。

逻辑在技术上站得住。一家模型公司同时用几家供应商的第一人称数据混合训练,效果很难保证。他举了自动驾驶的例子:ISP算法稍改一下,从CMOS Raw Data转RGB这一步,人眼看不出区别,模型训出来可能完全变样——神经网络对数据信号依然极度敏感。

而集中化的底气来自投入结构:几万套设备是几亿元量级,背后要存几百PB到上千PB数据,建一个数据中心又是几亿到十亿元。这个生意同时吃工程能力、运营能力和资金实力,天然是寡头土壤。

验收口径更能说明门槛之高:百万小时是去重后可上架售卖的有效数据;操作信息必须有效,不能有人在镜头里摸鱼;标称60帧,平均帧率至少59.98;Handpose空间提取精度,做得差的是几厘米,头部客户要求7毫米,有的要5毫米——而且必须能通过机械臂和灵巧手编码器读出的真值来校验。

场景分布是另一道隐形的墙。很多公司手里的数据一翻全是家居和叠衣服,每个任务只有一两个小场景,多样性根本不够。据接近数采行业的人士观察,客户已经放弃了「每家都采一点试试」的做法,转向集中给一两家独家供货。

📈 高盛上调:机器人从会走到会工作

数据侧的火热,终于等来了需求侧的验证。

同一天,高盛在最新全球物理AI报告中大幅上调人形机器人预测:全球出货量从2026年的7.5万台,增至2030年约89万台,2035年达到约650万台,对应市场规模约1383亿美元。对比旧预测,2030年从25.6万台上调到89万台,2035年更是从140万台直接翻了四倍多——近乎一次预期重估。

年份旧预测出货量新预测出货量市场规模(新)
20267.5万台
203025.6万台约89万台
2035140万台约650万台约1383亿美元

支撑上调的是基础模型的实质进步。高盛援引Epoch数据:主流AI模型综合能力指标ECI从2023年的120多分升至2026年的150多分;METR研究显示,自2019年以来,前沿模型能以50%成功率完成的任务持续时间约每7个月翻一番。

运动控制也在突破。2026年以来,部分人形机器人户外奔跑速度从2—3米/秒提升到5—6米/秒;世界人形机器人运动会上,400米冠军成绩较2025年提高约57%,达到38.15秒;Whole-Body Control开始让机器人边移动边完成上肢操作。

高盛的判断同样冷静:行业竞争重点已从运动展示,转向真实世界数据、机器人基础模型、灵巧操作和系统可靠性。在中国市场,机器人模型正从单一VLA架构,向VLA或VTLA与世界模型、多层Agent结合的体系演进,参数规模从数十亿至200亿向400亿—800亿提升——而高质量、真实、多维数据仍是部署最大瓶颈。率先规模化的场景是物流仓储和汽车制造,不是炫技舞台。

把这一节和前面两节连起来看:高盛上调的每一分预期,最终都要靠数采工厂里一帧一帧采出来的数据来兑现。数据供给侧的寡头化,和需求侧的放量,是同一枚硬币的两面。

✋ 触觉:视觉之后的必选项

数据拼图的最后一块,可能长在手指上。

纬钛机器人CEO李瑞给出的判断是:具身智能仅靠视觉容易撞到天花板,触觉是未来必选项——「上触觉已经不是一个yes or no的问题,而是when的问题。」

这与高盛的硬件判断形成呼应:在决定商业化速度的诸多要素中——灵巧手、手眼脚协同、散热、线束寿命、长期可靠性、Sim-to-Real泛化——灵巧手目前仍没有统一技术路线,是最重要的硬件瓶颈之一。

产业逻辑并不复杂。高复杂度、高随机性环境下,机器人成功率明显下降;当前模型只在稳定、结构化环境里能处理相对简单的任务。而要跨过这道坎,光靠摄像头喂第一人称视频不够——抓一枚鸡蛋和抓一个扳手,视觉信号可以完全一样,力反馈天差地别。当预训练数据规模化、VLA架构成熟之后,多维感知数据(包括触觉)会成为下一轮模型迭代的分水岭。

对数采行业,这同样是增量信号:真值校验、力反馈记录、多模态对齐,都会抬高数据生产的工程门槛——进一步利好有能力吃下全套链路的头部玩家。

小结

一天之内三个信号同频:觅蜂百万小时数据下线、高盛把2035年出货预期翻了四倍多、李瑞宣布触觉时代将至。具身智能的故事正在改写——从「会走路的demo」,变成「会工作的产线工人」,而中间的桥梁是真数据、严标准、硬可靠性。数据电网的第一根电线杆已经立下,接下来比的是谁先把电网铺到千家万户。灵巧手与触觉,很可能是2027年最值得盯的下一个变量。