5万条轨迹,喂得饱人形机器人吗?
宇树上市、机器人大会接订单、Axis发布浏览器端数据引擎AXIS,三件事指向同一个拐点:机器人产业的瓶颈正从硬件转向数据。本文拆解AXIS的数据范式转移,以及从'会跑'到'入职'之间的真实鸿沟。
导语
8月19日,宇树科技敲钟上市,开盘暴涨629.44%;同一天,2026世界机器人大会在北京开幕,300余家企业、2000多件展品挤满会场。热闹到顶点的时候,一家叫Axis Robotics的公司悄悄放出了一个浏览器端数据引擎AXIS——207个操作任务、50129条验证过的Franka轨迹。
三个信号凑在一起,指向同一个判断:机器人产业最贵的东西,正在从机械臂和关节电机,变成数据。身体好造,脑子难喂。这一篇,我们聊聊数据这条暗线。
💰 钱到位了,但钱解决不了所有问题
资本从不迟到,但资本也从不替你干活。
先看热的一面。宇树科技登陆科创板当天,中一签(500股)开盘即有47.46万元收益,总市值冲到4449亿元。业内直呼:具身智能"老大哥"来了。同一周,第二届世界人形机器人运动会在北京开幕,被称为"机器人奥运会",企业拼技术,机器人"秀肌肉"。
再看产业面。工信部副部长辛国斌在世界机器人大会开幕式上给出一组数据:2025年机器人产业规模以上企业营业收入突破3000亿元,近五年年均增速超过20%,今年上半年达到1655亿元,同比增长24.5%。
比数字更重要的是措辞的变化。对比去年,一个清晰的信号浮现:机器人产业正从"秀肌肉"转向"接订单",从供给侧的单向展示,走向产需两端的双向奔赴。
| 指标 | 数值 | 备注 |
|---|---|---|
| 2025年规上企业营收 | 突破3000亿元 | 近五年年均增速超20% |
| 2026上半年营收 | 1655亿元 | 同比增长24.5% |
| 2026大会参展企业 | 300余家 | 展品超2000件 |
| 全球首发黑科技 | 150余件 | 大会现场 |
| 宇树上市首日开盘涨幅 | 629.44% | 总市值4449亿元 |
钱在涌入,订单在落地,聚光灯打得很足。但据多位接近头部整机厂的人士透露,圈内真正焦虑的问题从来不是融资,而是一个更朴素的问题:机器人身体越做越好,可它到底会干什么?
让机器人站起来、走起来、跑起来,如今已不是最大的悬念。真正的悬念是它能不能稳定工作、反复使用、批量生产——从"会跑"到"开智",从"开智"到"入职"。而中间那段路,铺路材料是数据。
🧠 大模型的老剧本,机器人正在重演
模型的能力曲线在爬坡,数据的供给曲线在躺平。
这个剧本,大模型行业已经演过一遍:Transformer架构2017年就有了,但真正引爆是高质量互联网文本语料被吃干净之前的那波暴力缩放。到了今天,互联网文本接近采尽,各家开始抢视频、抢合成数据。
机器人这边,情况更糟。互联网上有全人类的文字,但没有全人类"怎么拧螺丝"的操作数据。机器人操作数据有两个天然短板:一是采集慢,得人守着遥操作设备,一条一条地录;二是采集被锁死在实验室硬件上——你的轨迹是在某型号机械臂、某套相机标定下录的,换台机器、换个环境,迁移成本很高。
结果就是素材里那句话的处境:机器人数据集的增长速度,远远落后于用它们训练的模型。模型在等米下锅。
这正是Axis Robotics发布AXIS的背景。它的核心思路很直白:把演示采集搬进网页浏览器,把所有昂贵的部分(仿真渲染、验证、训练)推到后端GPU。用户打开浏览器就能贡献操作演示,重活儿全部云端化。
产出是可验证的:207个机器人操作任务,50129条经过验证的Franka轨迹。更关键的是效果验证——用AXIS的数据做持续预训练,π0.5在LIBERO-Plus基准上从83.9提升到88.8;而作为对照,一个数据量匹配的RoboCasa365方案只达到57.5。
| 方案 | 数据来源 | LIBERO-Plus得分 |
|---|---|---|
| π0.5 基线 | 原始训练数据 | 83.9 |
| π0.5 + AXIS持续预训练 | 浏览器端真实采集 | 88.8 |
| 数据量匹配的RoboCasa365对照 | 纯仿真合成 | 57.5 |
这组对比的产业含义值得嚼一嚼:同样是补数据,真实演示轨迹带来的增益,远超等量的仿真合成数据。浏览器这个看似"不专业"的采集入口,反而跑赢了精心搭建的仿真管线。
🌐 把采集搬进浏览器,到底动了谁的奶酪
降低门槛这件事,从来没有输家——除了旧门槛本身。
拆一下AXIS的链路,你会看到一个典型的"边缘轻、中心重"架构:
这个闭环里藏着三重产业逻辑:
第一,采集端去专业化。传统遥操作数据采集需要实验室、专业操作员、统一硬件,一条轨迹的成本高得吓人。浏览器把入口压到了"有台电脑就行"的粒度,采集人力池从几百个实验室扩展到潜在的网络规模。
第二,质量不靠人靠流程。50129条轨迹的关键词是"verified"——经过验证。 crowdsourced(众包)数据最大的坑是脏,AXIS把验证环节集中放到后端GPU上做,等于用算力换数据质量。这是用大模型的思路解决大模型式的问题。
第三,硬件锚点依然存在。坦率说,Franka轨迹意味着这批数据仍绑定在特定硬件形态上。浏览器解决了"人在哪"的问题,还没完全解决"机在哪"的问题。跨本体的数据迁移,仍是悬而未决的硬骨头。但从"单实验室单硬件"到"全网单硬件",已经是数量级的跃迁。
注意这个时间线的密度:一周之内,资本(上市)、产业(接订单)、技术(数据引擎)三条线同时动了。这不是巧合,是产业成熟度的共振——硬件侧有了可复制的底盘,商业化侧有了真实的付费方,数据侧才第一次成为"值得单独做一家公司"的事。
有意思的是,同一天蓝箭航天的朱雀三号完成一子级陆地回收,中国民营航天首次实现火箭回收。这两个行业在做同一道题:把一次性消耗品变成可重复使用的资产。火箭回收省的是箭体,数据引擎省的是——每一次采集都要重建的实验室。
⚠️ 从"会跑"到"入职",中间隔着的不只是数据
数据是燃料,但光有燃料的车,还上不了路。
必须泼一盆冷水:AXIS证明了数据范式的可行性,但它证明的是"预训练这条腿",机器人要真正"入职",还有另外几条腿要站稳。
硬核科技的第一条铁律,是要能被反复验证乃至复制推广。朱雀三号的出圈不在于发射成功,而在于"有来有回"——回得来、接得稳,才意味着可重复使用。机器人同理:演示视频里拧得上螺丝,和产线上八小时不间歇拧得上螺丝,是两个物种。稳定工作、反复使用、批量生产,这三关一个都绕不过去。
第二,数据规模与任务覆盖之间不是线性关系。207个任务、5万条轨迹,对于操作技能的预训练是重要增量,但真实工厂里的长尾任务是以万计的。浏览器采集天然偏向"桌面级、轻操作"的任务形态,重负载、高精度、强安全的工业场景,短期内还是得靠专业采集和现场部署。
第三,商业闭环的归属问题。据多位接近人士的说法,整机厂普遍在自建数据团队,数据引擎类公司和整机厂之间,是供应关系还是竞争关系,尚无定论。参照汽车行业:整车厂可以外采电池,但没人外采"整车数据"。数据引擎若想成为新基建,要么证明自己是跨厂商的公共品,要么找到自己的"宁王位置"——做所有整机厂都离不开、又都不愿自己做的那一层。
这张饼图是我的主观估计,但方向上业内有共识:数据和泛化加起来,占了短板的大头。这也解释了为什么一个数据引擎的发布,值得和一家千亿市值公司的上市放在同一篇文章里讨论。
🔮 写在最后:暗线正在变成主线
上一轮比拼谁造得出来,下一轮比拼谁教得会。
回看这三件事:宇树上市,证明资本市场愿意为具身智能定价;机器人大会"接订单",证明产业端愿意为机器人付费;AXIS发布,证明技术社区开始认真解决"教机器人"的规模化问题。
产需两端的"双向奔赴"已经启动,而决定这场奔赴能走多远的,是数据供给能不能跟上模型胃口。浏览器采集不会是终局答案——跨本体迁移、真实物理交互、长尾任务覆盖,坑还很多。但它推开的那扇门是对的:把数据采集的成本,从"实验室级"打到"网页级"。
硬核科技从不相信一夜暴富,也不讲孤胆英雄。朱雀三号的箭体分散在四地制造,机器人的未来同样要靠整机、零部件、数据、算法的产业军团分工推进。2026年下半场,盯住一个指标就够了:谁先把"5万条轨迹"变成"500万条"。
路漫漫其修远兮。但这一次,路至少是往对的方向修的。