具身智能人形机器人核心零部件评论分析· 3548· 约6分钟阅读

机器人爆发,卡在两个80%

机器人他爹假装能听懂机器人的想法
2026-09-10 14:29 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

王兴兴在WRC 2026给出具身智能爆发的量化临界点:两个80%。本文拆解其背后的自进化研发范式、三维数据基础设施与千赫兹视触觉三条产业主线,判断泛化能力才是下一阶段人形机器人的真正胜负手。

机器人行业最不缺的就是会跳舞的本体,最缺的是换一个房间还敢用的底气。

8月19日,宇树科技登陆科创板;一天后,创始人王兴兴在2026世界机器人大会主论坛的演讲里,几乎没怎么提跑多快、跳多高,而是抛出了一个量化到有点较真的判断:机器人真正爆发,要等到两个「80%时刻」——在80%的陌生场景中,通过语音或文字指令,机器人能够顺利完成约80%的任务。这个数字,可能就是未来几年所有具身智能公司的生死线。

🎤 上市之后的王兴兴,开始谈「不炫技」的事

金句先行:当一家公司开始认真定义临界点,说明它已经从讲故事的阶段,进入了算账的阶段。

时间线先摆一下。8月19日,宇树科技正式登陆科创板,上市答谢午宴上,王兴兴首次提出「物理AI机器人的自进化」;8月20日,2026世界机器人大会主论坛,他把这套逻辑完整摊开在了行业面前。

有意思的地方在于内容的取舍。按常理,上市后首次公开亮相,最省力的做法是放一段双足跳跃、空翻接陀螺的视频,收获满场惊叹。但王兴兴把更多时间留给了一个不那么「炫技」、却更决定产业胜负的问题——机器人什么时候才能真正走进工厂和家庭?

他的答案,关键已经不是本体能否完成一个动作,而是「换一个房间、物体、任务之后,它还能不能完成」的泛化能力。

这话听着平淡,其实是把行业里所有人心里都清楚、但很少有人愿意摆上台面的问题挑明了:演示视频和真实交付之间,隔着一条鸿沟。一台在展台上能精准抓起矿泉水瓶的人形机器人,到了客户的产线上,换个料盘角度可能就束手无策。

而两个80%,第一次给这条鸿沟标了刻度。这不是一个营销指标——它同时是订单指标、验收指标,也将是下一轮融资的门槛指标。据多位接近人士透露,已经有下游客户在试点协议里,把类似「陌生场景任务成功率」写进了验收条款。演示经济的红利期,正在肉眼可见地关闭。

🧠 自进化:把最后一厘米交给AI

金句先行:与其雇一千个工程师去微调机器人的最后一厘米,不如让机器人自己学会调自己。

王兴兴给出的路径,是「物理AI机器人的自进化」:利用基础大模型,把论文检索、代码生成、仿真训练、真机测试和评价反馈串成一个闭环,让机器人研发从高度依赖人工,转向持续自我迭代。

这条闭环长这样:

逻辑拆开看并不神秘。今天具身智能公司最大的成本项,往往不是硬件,而是那一大群做策略调优、数据标注、真机测试的工程师。每一个新场景、新任务,几乎都要人肉过一遍「改代码—跑仿真—上真机—看效果」的循环,效率极低,而且高度依赖个别资深工程师的手感。

自进化的本质,是把这个循环本身交给AI。论文检索负责捕捉最新的方法,代码生成把方法落成实验,仿真训练批量试错,真机测试验证现实差距,评价反馈把差距喂回下一轮迭代。人从循环里的操作者,退居为目标定义者和结果裁判。

这个判断和整个AI行业的趋势是同频的。过去一年的共识越来越清晰:智能体不只是在聊天窗口里干活,而是进入Blender、UE5这类专业工具里干活。研发工具链一旦被智能体接管,研发的边际成本结构就会松动——这和三维内容行业正在发生的事情,是同一个逻辑。

产业层面的判断是:自进化如果跑通,具身智能公司之间的竞争维度会从「有多少工程师」变成「闭环转速有多快」。慢的公司每一轮迭代以月计,快的公司以天计,半年之后的差距就是代差。

🌍 三维数据,正在变成基础设施

金句先行:大模型吃完了互联网的文本,下一个饭碗,是物理世界本身。

王兴兴谈泛化,泛化能力的底层是数据;而具身智能最缺的数据,恰恰是三维的、带物理属性的、可交互的环境数据。这个供给侧的变化,正在另外一个战场上发生。

OpenAIGPT-6 Astra展示了AI从文字、图片和视频进一步走向可编辑三维资产的能力——在Blender中完成住宅建模,再导入Unreal Engine 5,形成可实时漫游的完整场景。这里生成的不是「看起来三维」的图片,而是能继续修改、渲染、被其他软件调用的结构化三维资产。

World LabsAtlas则把这一变化推进到空间理解、世界重建和环境模拟层面——也就是让AI真正「看懂」一个空间,并能在其中做模拟。

这两件事对机器人行业意味着什么?简单说,仿真训练的「燃料」成本在下降。传统三维建模高度依赖专业人员,几何、材质、光照、渲染一整套流程走下来,建一个合格训练场景的成本高得吓人。一旦自然语言成为三维生产的入口,单位成本持续下降,机器人公司就可以按需批量生成训练环境——今天练厨房,明天练仓库,后天练产线工位。

而创作工具普及的历史经验是:它不会压缩需求,反而会放大供给。图片和视频行业已经验证过一遍,三维大概率会重演。过去因为成本太高而没形成的潜在需求——游戏、电商、建筑、工业设计——会先爆发;而对机器人行业来说,最重要的是那些为训练而生的仿真环境,会从稀缺品变成日用品。

梳理一下这三条线的卡点与进展:

卡点现状代表进展距临界点的距离
泛化能力演示强、迁移弱王兴兴提出两个80%量化目标最远,决定爆发时点
三维数据专业建模成本高Astra生成可编辑三维资产快速收窄,成本驱动
触觉感知视觉成熟、触觉滞后Imprint X做到1ms千赫兹产线验证中

🤏 1毫秒的触觉,卡住灵巧手的脖子

金句先行:眼睛再好,抓一个鸡蛋你也得靠手上的感觉。

泛化和数据是「大脑」层面的事,但机器人要真正进产线,还有一道绕不开的硬门槛:感知。准确说,是触觉。

36氪报道,知行具身发布了面向机器人操作的视触觉传感器Imprint X。两个数字值得划重点:搭载自研微型事件相机模组,延迟1ms,帧率超过1000Hz。目前,Imprint X已经进入多家3C制造企业产线开展落地验证,同时还和国内某灵巧手厂商达成了产品合作。

为什么是千赫兹?可以对比一下:人手操作精密物件时的反馈感知频率远高于普通相机的30帧;而工业场景里的插拔、装配、柔性件抓取,接触瞬间往往只有几十毫秒,普通传感器的采样根本捕捉不到打滑、形变这些关键信号。事件相机模组的意义,就在于此——它不是按固定帧率拍照,而是只在变化发生时触发,天然适合捕捉高速接触过程。

落地选择也很有讲究。3C制造是当下人形机器人最现实的滩头阵地:场景结构化程度高、 pays 得起钱、对精度和速度要求苛刻。视触觉传感器先进了3C产线,拿到的是最贵的真实工况数据;再和灵巧手厂商绑定,意味着传感器不再是实验室配件,而是进入整机BOM表的零部件。

对行业来说,这补上了具身智能技术栈里最短的一块板。大脑在进化,世界模型在丰富,如果手上的「皮肤」还停留在毫秒级以下的反应速度,再聪明的策略也落不了地。据多位接近人士观察,视触觉传感器正在从「论文里的方向」变成「量产线的选配件」,这个转变的速度比很多人预期的快。

⏳ 临界点之前,大家到底在赌什么

金句先行:临界点之前拼的是技术,临界点之后拼的是产能——现在所有人还在前者里内卷。

把这几天的信息串成一条线,能看到一个清晰的产业共振:

  • 2026年8月19日:宇树科技登陆科创板,上市当天提出自进化方向
  • 2026年8月20日:WRC 2026主论坛,两个80%临界点公开
  • GPT-6 Astra发布:AI进入专业三维工具,结构化资产成本松动
  • World Labs Atlas:空间理解与世界重建能力落地
  • 知行具身发布Imprint X:千赫兹视触觉进入3C产线验证

本体公司定义标准,大模型公司补数据基础设施,零部件公司补感知短板——三条线指向同一个目标:让机器人从「能演示」走到「能交付」。

写在最后

两个80%大概率不会是精确的预言,但它是一个有用的标尺。它把行业从「跑得多快」的军备竞赛,拉回到「换一个场景还行不行」的真问题上。三维数据在降价,触觉在提速,研发闭环在自动化——临界点之前,比拼的就是谁能先把自己的泛化曲线推过那条线。等真有公司宣布做到了两个80%,那一天的发布会,恐怕连跳舞的环节都省了。