人形机器人缺的不是订单,是数据
宇树上市首日暴涨629%让人热血,但WRC上大佬们聊的却是另一件事:具身智能需要千万小时级多模态数据,全球有效积累不足5%。四肢已经练熟,大脑还饿着,数据底座才是2026量产元年的真正胜负手。
2026年世界机器人大会(WRC)结束没几天,行业里最热的两条新闻竟然完美错开了:一条是宇树科技8月19日登陆科创板,开盘涨幅629%,市值一度冲到4449亿元;另一条是同一场大会上,王兴兴、王鹤们罕见地不谈估值、不谈股价,齐刷刷谈起了同一个词——数据。
一边是资本的狂欢,一边是产业界的「大实话」:人形机器人的「四肢」已经渐趋灵活,但「大脑」还严重饿着。行业共识是,实现可用的具身智能至少需要千万小时量级的多模态数据,而当前全球有效积累尚不足需求的5%。
两条新闻放在一起看,恰好勾勒出这个行业的真实处境:钱不缺,产量不缺,缺的是让机器人真正学会干活的那口饭。这篇文章就聊聊,数据缺口到底有多大、谁来填、以及宇树到底会不会成为第二个中石油。
📈 敲钟三天,市值蒸发1600亿:熟悉的配方又来了
大A的记忆只有七年,但它总爱复刻二十年前的剧本。
8月19日,「人形机器人第一股」宇树科技登陆科创板。发行价150.80元,开盘直接被顶到1100元,涨幅629.44%,市值瞬间冲到4449亿元。当日收盘回落至845元,次日股价「深调」18.7%,收报687元,市值2779亿元——两个交易日,从最高点累计回撤37.55%,蒸发约1670亿元。
熟悉的高开、熟悉的暴涨、熟悉的巨额换手、熟悉的次日回撤。大A流传近二十年的那句老段子,「问君能有几多愁,恰似满仓中石油」,主角一夜之间被换成了宇树。
把两场上市首秀摆在一起看,确实形似:
| 维度 | **中石油** 2007年 | **宇树科技** 2026年 |
|---|---|---|
| 上市日期 | 11月5日 | 8月19日 |
| 开盘表现 | 48.6元(全天最高) | 1100元(全天最高) |
| 首日收盘 | 43.96元 | 845元 |
| 换手率 | 51.58% | 85.28% |
| 估值水平 | 发行市盈率22.4倍,开盘约60倍 | 发行市销率高达210倍,开盘动态市盈率一度超800倍 |
| 首日市值巅峰 | 7.48万亿元 | 4449亿元 |
两边都上演了「开盘即巅峰、首日高开低走、机构清仓、散户接棒」的经典剧本。但只要稍微往产业里看一眼,就能发现三处关键错位。
第一是产业属性。中石油是成熟周期能源巨头,上市时增长逻辑基本定型;而宇树站在一个正在从「实验室样机」走向「产线生产力」的新兴赛道入口。第二是时代风向:2026年上半年,我国人形机器人出货量已超4万台,中国企业在全球出货量中占比高达97%——全球每出货100台人形机器人,97台来自中国制造商。第三则是本篇真正的主角:这个赛道眼下最硬的瓶颈,不是资本,不是产能,而是数据。
据多位接近人士的说法,市场现在分裂成两个阵营:一边把宇树看作「继家电、手机、新能源车之后的第四大产业赛道」的旗手;另一边嗅到的是解禁前投机炒作的味道。两边的论据都成立,但都绕不开同一个前提——机器人得真的能干活。
⚠️ 千万小时缺口,全球只攒了不到5%
「有多少高质量数据,就有多少AI能力。」
这是王兴兴在WRC上说的原话。宇树科技正在两头下注:一头用海量真人数据和互联网数据做预训练,另一头靠真实机器人运行数据,让机器适应物理世界。
为什么数据突然成了全场焦点?光轮智能联合创始人兼总裁杨海波给了一组很直白的数字:行业对数据的需求,正从去年的几百、几千小时,跃升到今年的上百万小时,增幅达百倍乃至千倍。他把2026年称为「具身智能数据规模化的元年」。
更麻烦的是,具身智能的数据和大语言模型的数据根本不是一回事。大模型背后是互联网数十年的文本积累,是「现成的矿」;而具身智能面对的是非结构化的物理世界,需要采集视觉、力觉、触觉等多维度交互信息——这些数据没人替你攒过,得一行一行自己采。
用一个表格看清楚这道鸿沟:
| 维度 | 大语言模型 | 具身智能 |
|---|---|---|
| 数据来源 | 互联网数十年文本积累 | 物理世界多模态交互 |
| 数据维度 | 文本为主 | 视觉、力觉、触觉等多维 |
| 需求量级 | 已有海量存量 | 千万小时量级(可用门槛) |
| 当前供给 | 相对充裕 | 全球有效积累不足需求5% |
| 采集方式 | 爬取即可 | 真机采集、遥操作、仿真迁移 |
「量」的匮乏是显性危机,「质」的获取难度更高——这也是财联社记者在WRC现场听到的高频结论。
从产业逻辑上讲,这道缺口决定了具身智能的竞争格局排序:谁的喂数据管道更粗、更便宜、质量更高,谁就先摸到「可用」的门槛。这和当年大模型时代「算力即壁垒」的逻辑一脉相承,只不过这次,壁垒换成了数据采集的工业化能力。
注意最后那个回流闭环——它意味着数据采集不是一次性工程,而是规模化落地之后才能转起来的飞轮。谁先出货量大,谁的飞轮先转,这是个正循环,也是个残酷的马太效应。
🔋 数据争夺战开打:开源、建厂、上桌
认知到位之后,动作比口号来得快。
本届WRC上,「为具身智能构建数据底座」成了与会企业不约而同指向的命题,几路人马几乎同时上桌:
- 京东云具身智能数据生态能力展台正式亮相,互联网大厂的数据基础设施能力开始向机器人行业外溢;
- 优必选等公司已落地规模化数据采集中心,把数据采集当成「工厂」来运营;
- 光轮智能在大会期间发布全球首个十万小时级全模态人类行为开源数据集,直接把家底摊在了桌面上。
尤其值得说的是光轮这一手。在数据即壁垒的行业共识下,把十万小时级数据集开源出来,等于主动降低全行业的入场门槛。这背后是开源生态的经典打法:底座数据人人可用,真正的差异化卷在「质」——也就是财联社报道中点出的那个更难的问题上——以及各家私有的真机运行数据回流。
把当前的几条数据路线摆在一起看:
据业内流传的说法,数据采集中心的单点投入并不低,规模化采集的成本曲线能否快速下探,直接决定了2026年这个「量产元年」的成色。致同发布的《具身智能机器人行业研究》报告也提示,这一进程具有明显的时间窗口属性:真实世界数据的采集效率,与仿真到现实的迁移成功率,均可能对产业路径产生扰动。
翻译成大白话:数据这条腿如果跟不上,前面讲的四万台出货量,可能有相当一部分是「会跳舞但不会干活」的存货,而不是产线生产力。
💡 GPT时刻到底啥时候来?大佬们给出了三个答案
「具身GPT时刻」,是行业憋了两年的一句话,但没人说得清它几点来。
今年WRC的画风变了。大会主题「人机共生,产需共融」,把「产需」放在了「炫技」前面。展馆里,机器人跳舞的展台依然围满观众,但真正吸引专业目光的,是那些在物流仓库、药房货架、工厂产线上「打工」的机器人。一句话总结:具身智能的「表演期」正在落幕,「打工期」正式开场。
在8月20日的「应用牵引」主题论坛上,头部厂商围绕「具身智能何时迎来GPT时刻」给出了一场难得的「大实话」合集。对于GPT时刻的量化标准,三位大佬给出了三个不同答案:
| 人物 | 公司 | GPT时刻门槛 | 时间预判 |
|---|---|---|---|
| 王兴兴 | 宇树科技 | 约80%的陌生场景中完成约80%的任务 | 最快2-3年,慢则5-10年 |
| 王鹤 | 银河通用 | 零样本泛化成功率70%-80%,轻量后训练后可接近100% | — |
| 韩铮 | 苏度科技 | 提出了更高的规模落地标准 | — |
有意思的是分歧本身的含义。王兴兴的「80%场景完成80%任务」是一个场景覆盖口径,王鹤的「零样本泛化70%-80%」是一个泛化能力口径,韩铮则直接把标准抬到「规模落地」层面。三个人吵的不是数字,而是路径:到底先铺量、先练泛化、还是先死磕真实场景的任务完成率?
但无论站哪条路径,收敛点是同一个——泛化瓶颈、数据缺口、落地卡点,是所有人都绕不开的三道坎。而这些头部企业发言被业界评价为「不够华丽,却恰恰是行业最真实的动向」:没有画饼,只有对痛点的直面。
另一个佐证落地节奏的事实是:致同报告指出,随着头部产品在宝马、比亚迪等产线开展常态化实训,人形机器人正加速跨越从「实验室样机」到「产线生产力」的鸿沟。注意「常态化」三个字——不是试点,不是演示,是天天上班。
把拼图拼起来,产业逻辑就清晰了:产线实训产生真机数据,真机数据喂养大脑,大脑变强后接管更多工位,再产生更多数据。数据底座,就是这个飞轮的第一圈推力。
写在最后:钱已经到账,饭还得一口口喂
回头看2026年这个夏天,具身智能行业给出了一个奇特的组合:资本端,宇树上市首日629%的涨幅和随后37.55%的回撤,宣告这条赛道正式进入大A的注视之下;产业端,四万台出货、97%的中国份额、宝马和比亚迪产线上的常态化实训,说明「从样机到量产」的叙事开始兑现。
但真正决定这个行业能走多远的,是WRC上那场不那么性感的集体表态:千万小时的多模态数据缺口、不足5%的全球积累、百倍乃至千倍的需求增幅。四肢已经练熟了,大脑还饿着——京东云、优必选、光轮智能们填坑的速度,将直接决定王兴兴口中那个「2-3年到5-10年」的GPT时刻,落在时间轴的哪一端。
至于宇树会不会成为第二个中石油?数据飞轮转起来之前,谁都别急着下结论。但可以确定的是:这一次,决定股价终局的不是换手率,而是机器人手里的活儿干得漂不漂亮。
数据管够之日,才是故事兑现之时。