人形机器人具身智能产业观察评论分析· 3524· 约6分钟阅读

宇树敲钟之后,具身智能开始卷什么?

机甲战士小时候看高达长大,现在造高达
2026-09-09 00:29 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

从WRC 2026的人形分化、李飞飞Atlas世界模型到Figure的35亿美元算力豪赌,具身智能正从讲故事阶段进入闭环竞争阶段。本文拆解资本锚点、形态路线、数据与算力三场硬仗,判断谁能在模型、本体、零部件之间跑通闭环,谁才是下一阶段真正有价值的公司。

宇树敲钟那天,北京亦庄的空气都是甜的。

2026年8月19日,世界机器人大会开幕当天,宇树科技正式上市,盘中市值一度冲破4000亿元。同一天,展馆里挤着300多家企业、2000多件展品,大模型、本体、零部件、数据公司全到场了。

但逛完全馆,我的判断是:这不是行业的高潮,而是行业「交作业」的开始。过去十年,机器人公司活在实验室和融资新闻里;从这一刻起,它们要回答收入、交付、毛利和规模化。资本锚点钉下之后,真正的分化才刚刚开始。

📈 4000亿锚点,行业开始被要营收

先说一个现场感受:这届WRC没有让所有人「哇」的时刻。

宇树没有把刚刚发布的「超人」搬上台——那台能原地跳高2米、奔跑速度12.66米/秒的怪物,只在PPT和视频里出现。展台上更多是已有产品在解锁新动作:G1打格斗,组合拳、回旋踢、飞踢一套下来,靠全身关节实时协调;个头更大的H2出拳抬腿更有分量感。众擎干脆把八角笼搬进了会场,维他动力用二次元偶像的方式整活。

热闹是真热闹,但很少有人再讲「颠覆性突破」这四个字了。

这背后是资本叙事的切换。看一眼2026年的几个关键节点:

宇树上市,第一次给这个仍处早期的赛道钉下资本锚点;云深处科技进入交易所受理或审核环节;智元机器人确认启动赴港上市流程。一级市场的热,正在向二级市场传导。

传导意味着什么?意味着估值逻辑从「技术想象力」切换到「收入-交付-毛利」三件套。据多位接近一级市场的人士透露,现在投资机构尽调人形机器人公司,第一个问题已经从「模型多先进」变成了「交付多少台、回款周期多长」。

这是好事。被要求赚钱的行业,才配谈产业。

🤖 别再只盯着人形了

形态自由,是具身智能成熟的第一个标志。

过去两年,具身智能的叙事被人形高度占领:跳舞、跑步、打拳、马拉松,所有出圈事件几乎都长着人的样子。但这届WRC传递的信号很明确——「像人」不再只有一种标准答案,巨型、仿生、半人马形态接连出现,而更多公司开始根据真实任务重新设计形态。

最有代表性的是银河通用。它的展台上,轮式、重载和双足三种完全不同形态的机器人,跑的是同一套具身基础大模型。这个细节比任何发布会都有信息量:当大脑和躯体解耦,本体形态就成了「选配」,而不是「信仰」。

维他动力走了反方向:从真实使用场景出发,倒推产品设计,做出了第一款人形机器人Vbot ATOM。一个自上而下,一个自下而上,殊途同归——都在回答「机器人到底为谁干活」。

用产业逻辑串一下:

人形不是错了,而是被「祛魅」了。它仍然是通用性的终极形态,但在物流、巡检、商服这些具体场景里,轮盘比双腿便宜且稳。谁能根据场景选形态,谁就先拿到订单;谁把形态当宗教,谁就先烧完钱。

🧠 李飞飞发牌:几张图换一个世界

数据,是具身智能真正的咽喉。

就在WRC同期,李飞飞团队正式发布首个多模态世界模型Atlas。两个关键词值得划线:一是「从零开始预训练」,不是在既有大模型上微调,而是为空间智能从头造底座;二是「几张图就能构建世界」——少量视觉输入即可重建可交互的三维场景。

这件事的产业含义,比模型本身更重。具身智能最贵的成本不是电机,是数据:真机采集一条抓取轨迹,人工成本加损耗,动辄几百上千元,而具身任务的长尾复杂度决定了,真实数据永远追不上场景变化。世界模型的本质,是把「数据采集」变成「数据生成」——在仿真里穷举物理世界的边缘情况,让机器人先在虚拟里摔一百万次。

顺着这条线看WRC上另一家值得注意的公司帕西尼:它把最初只解决「触觉」的技术方案,扩展成了覆盖全身的感知网络。触觉是视觉补不齐的最后一环——杯子握没握稳、力度是不是大了,只有皮肤知道。视觉世界模型加触觉网络,恰好构成了数据闭环的两条腿:

所以「数据正在从一门算法生意变成一门硬件生意」这个WRC上的提问,答案大概率是「都是」。算法侧拼世界模型的生成能力,硬件侧拼传感器和采集设备——两头都要下重注。

⚡ Figure的算力豪赌

具身智能的尽头是算力生意,至少Figure是这么信的。

2026年9月3日,Figure宣布与AI基础设施公司Nscale达成战略合作:部署英伟达Vera Rubin平台,规模最高达10万块GPU,初始算力承诺35亿美元,目标2027年下半年在得克萨斯州Barstow开始部署,双方还表达了将合作规模扩展至超过60亿美元的意向。

35亿美元是什么概念?按当前人形机器人的成本结构,这笔钱够造好几万台整机。Figure没有把钱花在本体产能上,而是押在了训练底座上。

这个决策要放在行业背景下看。具身大模型的训练消耗正在向语言模型看齐——多模态输入、长时序决策、世界模型预训练,每一项都是吞算力的怪物。据多位接近海外机器人公司的从业者判断,未来两年算力储备会像今天的里程数据一样,成为具身智能公司的核心资产指标。

风险同样明显:算力是沉没成本极高的赌注,如果通用模型的能力曲线放缓,这些GPU就是资产负债表上的重担。但反过来,一旦具身智能迎来自己的「ChatGPT时刻」,没有算力储备的玩家连上牌桌的资格都没有。

中国公司这边路径不同——靠场景和数据密度换算力效率。两条路线谁先跑通,会是未来三年最好的观察样本。

🔧 最后一厘米,胜负在指尖

最不起眼的展位,往往藏着最硬的进展。

自变量在物流分拣场景里,把效率做到了每小时1816件,准确率超过98%。这个数字的含金量要拆开看:物流分拣是典型的「高频+长尾」任务,件形千奇百怪、摆放姿态随机,1816件/小时已经逼近人类熟练工水平,而98%的准确率意味着残次率进入了商业可接受区间——这是「demo能跑」和「能签合同」之间的分界线。

支撑这类表现的,是指尖、关节和电机里那些看不见的进步。这届WRC上,关键零部件的话题被反复提起:关节模组的力矩密度、灵巧手的自由度与寿命、触觉传感的采样精度。行业里管这个叫「最后一厘米」——模型再聪明,执行端差一厘米,商业闭环就差一个数量级。

把整个产业链摊开看:

环节代表玩家关键事实
本体形态银河通用轮式/重载/双足共用一套大模型
场景落地自变量分拣1816件/小时,准确率超98%
感知硬件帕西尼触觉方案扩展为全身感知网络
场景定义本体维他动力从场景倒推出Vbot ATOM
数据与模型李飞飞团队 Atlas从零预训练,几张图构建世界
算力底座Figure×Nscale35亿美元锁定最高10万块GPU

这张表其实是一句话:具身智能的竞争,已经不是单点竞争,而是闭环竞争。模型要喂得饱,本体要扛得住,零部件要省得下,算力要跟得上——缺任何一环,故事就停在故事。

小结

宇树的4000亿市值,是过去十年中国机器人行业最接近资本狂欢的一天,但它更像是行业从「叙事阶段」进入「交付阶段」的发令枪。

形态在分化,数据在重构,算力在豪赌,指尖在较劲。具身智能仍然早期,甚至比很多人期待的更早期——但正因为早期,把模型、本体、零部件和工程能力跑成闭环的公司,才会成为下一阶段真正有价值的公司。2027年Figure的十万块GPU点亮时,这张牌桌上的座次,可能就要重新排了。