机器人爆发,卡在两个80%
王兴兴在WRC 2026给出具身智能爆发的量化临界点:两个80%。本文拆解其背后的自进化研发范式、三维数据基础设施与千赫兹视触觉三条产业主线,判断泛化能力才是下一阶段人形机器人的真正胜负手。
机器人行业最不缺的就是会跳舞的本体,最缺的是换一个房间还敢用的底气。
8月19日,宇树科技登陆科创板;一天后,创始人王兴兴在2026世界机器人大会主论坛的演讲里,几乎没怎么提跑多快、跳多高,而是抛出了一个量化到有点较真的判断:机器人真正爆发,要等到两个「80%时刻」——在80%的陌生场景中,通过语音或文字指令,机器人能够顺利完成约80%的任务。这个数字,可能就是未来几年所有具身智能公司的生死线。
🎤 上市之后的王兴兴,开始谈「不炫技」的事
金句先行:当一家公司开始认真定义临界点,说明它已经从讲故事的阶段,进入了算账的阶段。
时间线先摆一下。8月19日,宇树科技正式登陆科创板,上市答谢午宴上,王兴兴首次提出「物理AI机器人的自进化」;8月20日,2026世界机器人大会主论坛,他把这套逻辑完整摊开在了行业面前。
有意思的地方在于内容的取舍。按常理,上市后首次公开亮相,最省力的做法是放一段双足跳跃、空翻接陀螺的视频,收获满场惊叹。但王兴兴把更多时间留给了一个不那么「炫技」、却更决定产业胜负的问题——机器人什么时候才能真正走进工厂和家庭?
他的答案,关键已经不是本体能否完成一个动作,而是「换一个房间、物体、任务之后,它还能不能完成」的泛化能力。
这话听着平淡,其实是把行业里所有人心里都清楚、但很少有人愿意摆上台面的问题挑明了:演示视频和真实交付之间,隔着一条鸿沟。一台在展台上能精准抓起矿泉水瓶的人形机器人,到了客户的产线上,换个料盘角度可能就束手无策。
而两个80%,第一次给这条鸿沟标了刻度。这不是一个营销指标——它同时是订单指标、验收指标,也将是下一轮融资的门槛指标。据多位接近人士透露,已经有下游客户在试点协议里,把类似「陌生场景任务成功率」写进了验收条款。演示经济的红利期,正在肉眼可见地关闭。
🧠 自进化:把最后一厘米交给AI
金句先行:与其雇一千个工程师去微调机器人的最后一厘米,不如让机器人自己学会调自己。
王兴兴给出的路径,是「物理AI机器人的自进化」:利用基础大模型,把论文检索、代码生成、仿真训练、真机测试和评价反馈串成一个闭环,让机器人研发从高度依赖人工,转向持续自我迭代。
这条闭环长这样:
逻辑拆开看并不神秘。今天具身智能公司最大的成本项,往往不是硬件,而是那一大群做策略调优、数据标注、真机测试的工程师。每一个新场景、新任务,几乎都要人肉过一遍「改代码—跑仿真—上真机—看效果」的循环,效率极低,而且高度依赖个别资深工程师的手感。
自进化的本质,是把这个循环本身交给AI。论文检索负责捕捉最新的方法,代码生成把方法落成实验,仿真训练批量试错,真机测试验证现实差距,评价反馈把差距喂回下一轮迭代。人从循环里的操作者,退居为目标定义者和结果裁判。
这个判断和整个AI行业的趋势是同频的。过去一年的共识越来越清晰:智能体不只是在聊天窗口里干活,而是进入Blender、UE5这类专业工具里干活。研发工具链一旦被智能体接管,研发的边际成本结构就会松动——这和三维内容行业正在发生的事情,是同一个逻辑。
产业层面的判断是:自进化如果跑通,具身智能公司之间的竞争维度会从「有多少工程师」变成「闭环转速有多快」。慢的公司每一轮迭代以月计,快的公司以天计,半年之后的差距就是代差。
🌍 三维数据,正在变成基础设施
金句先行:大模型吃完了互联网的文本,下一个饭碗,是物理世界本身。
王兴兴谈泛化,泛化能力的底层是数据;而具身智能最缺的数据,恰恰是三维的、带物理属性的、可交互的环境数据。这个供给侧的变化,正在另外一个战场上发生。
OpenAI的GPT-6 Astra展示了AI从文字、图片和视频进一步走向可编辑三维资产的能力——在Blender中完成住宅建模,再导入Unreal Engine 5,形成可实时漫游的完整场景。这里生成的不是「看起来三维」的图片,而是能继续修改、渲染、被其他软件调用的结构化三维资产。
World Labs的Atlas则把这一变化推进到空间理解、世界重建和环境模拟层面——也就是让AI真正「看懂」一个空间,并能在其中做模拟。
这两件事对机器人行业意味着什么?简单说,仿真训练的「燃料」成本在下降。传统三维建模高度依赖专业人员,几何、材质、光照、渲染一整套流程走下来,建一个合格训练场景的成本高得吓人。一旦自然语言成为三维生产的入口,单位成本持续下降,机器人公司就可以按需批量生成训练环境——今天练厨房,明天练仓库,后天练产线工位。
而创作工具普及的历史经验是:它不会压缩需求,反而会放大供给。图片和视频行业已经验证过一遍,三维大概率会重演。过去因为成本太高而没形成的潜在需求——游戏、电商、建筑、工业设计——会先爆发;而对机器人行业来说,最重要的是那些为训练而生的仿真环境,会从稀缺品变成日用品。
梳理一下这三条线的卡点与进展:
| 卡点 | 现状 | 代表进展 | 距临界点的距离 |
|---|---|---|---|
| 泛化能力 | 演示强、迁移弱 | 王兴兴提出两个80%量化目标 | 最远,决定爆发时点 |
| 三维数据 | 专业建模成本高 | Astra生成可编辑三维资产 | 快速收窄,成本驱动 |
| 触觉感知 | 视觉成熟、触觉滞后 | Imprint X做到1ms千赫兹 | 产线验证中 |
🤏 1毫秒的触觉,卡住灵巧手的脖子
金句先行:眼睛再好,抓一个鸡蛋你也得靠手上的感觉。
泛化和数据是「大脑」层面的事,但机器人要真正进产线,还有一道绕不开的硬门槛:感知。准确说,是触觉。
36氪报道,知行具身发布了面向机器人操作的视触觉传感器Imprint X。两个数字值得划重点:搭载自研微型事件相机模组,延迟1ms,帧率超过1000Hz。目前,Imprint X已经进入多家3C制造企业产线开展落地验证,同时还和国内某灵巧手厂商达成了产品合作。
为什么是千赫兹?可以对比一下:人手操作精密物件时的反馈感知频率远高于普通相机的30帧;而工业场景里的插拔、装配、柔性件抓取,接触瞬间往往只有几十毫秒,普通传感器的采样根本捕捉不到打滑、形变这些关键信号。事件相机模组的意义,就在于此——它不是按固定帧率拍照,而是只在变化发生时触发,天然适合捕捉高速接触过程。
落地选择也很有讲究。3C制造是当下人形机器人最现实的滩头阵地:场景结构化程度高、 pays 得起钱、对精度和速度要求苛刻。视触觉传感器先进了3C产线,拿到的是最贵的真实工况数据;再和灵巧手厂商绑定,意味着传感器不再是实验室配件,而是进入整机BOM表的零部件。
对行业来说,这补上了具身智能技术栈里最短的一块板。大脑在进化,世界模型在丰富,如果手上的「皮肤」还停留在毫秒级以下的反应速度,再聪明的策略也落不了地。据多位接近人士观察,视触觉传感器正在从「论文里的方向」变成「量产线的选配件」,这个转变的速度比很多人预期的快。
⏳ 临界点之前,大家到底在赌什么
金句先行:临界点之前拼的是技术,临界点之后拼的是产能——现在所有人还在前者里内卷。
把这几天的信息串成一条线,能看到一个清晰的产业共振:
- 2026年8月19日:宇树科技登陆科创板,上市当天提出自进化方向
- 2026年8月20日:WRC 2026主论坛,两个80%临界点公开
- GPT-6 Astra发布:AI进入专业三维工具,结构化资产成本松动
- World Labs Atlas:空间理解与世界重建能力落地
- 知行具身发布Imprint X:千赫兹视触觉进入3C产线验证
本体公司定义标准,大模型公司补数据基础设施,零部件公司补感知短板——三条线指向同一个目标:让机器人从「能演示」走到「能交付」。
写在最后
两个80%大概率不会是精确的预言,但它是一个有用的标尺。它把行业从「跑得多快」的军备竞赛,拉回到「换一个场景还行不行」的真问题上。三维数据在降价,触觉在提速,研发闭环在自动化——临界点之前,比拼的就是谁能先把自己的泛化曲线推过那条线。等真有公司宣布做到了两个80%,那一天的发布会,恐怕连跳舞的环节都省了。