具身智能终于不秀肌肉了?
墨奇机器人15分钟干完七十余个动作的家务长程任务、World Labs发布首个多模态世界模型Atlas、摩尔线程打通具身智能全栈链路——三件事指向同一个判断:具身智能正从抓取演示进入真实交付的前夜,考题已从“能不能动”变成“能不能干完一件事”。
机器人行业最近有点反常:大家不晒抓取视频了。
过去两年,一段机器人稳稳抓起水杯的短视频,足够撑起一轮融资。但现在,据多位一线投资人私下交流,这种几十秒的演示已经“撑不起估值了”。行业的新考题只有一个——长程任务:把一件事从头干到尾,中途不求助、不掉链子。
9月前后,三件事几乎同时发生:成立8个月的墨奇(MORPHI)让机器人用15分钟干完了收客厅、烘衣服、叠衣服的完整家务;李飞飞旗下World Labs发布全球首个多模态世界模型Atlas;摩尔线程在业绩说明会上宣布打通具身智能从数据到端侧部署的完整链路。
三件事,三种角色,指向同一个判断:具身智能,正在从“能动能抓”走向“能干完活”。
🤖 机器人圈的考题变了:别秀,干活
8月19日,世界机器人大会。一台MORPHI KINO机器人当众回答了那道新考题:收拾客厅、检查冰箱、把烘干机里的衣服拿出来、放进新的一批、按下启动键,最后把衣服叠好。
全程约七八十个动作,15分钟,自主完成,没掉链子。
造它的墨奇,成立刚8个月。联合创始人黄青虬1994年生,清华自动化本科、港中文MMLab博士,在华为车BU五年做到智驾AI部门一号位,主导了华为智驾ADS 1.0到4.0的算法突破与量产——这套系统覆盖35家车企、50多款量产车型,搭载量超170万台。离开前他做了一件关键的事:把整个智驾彻底AI化,亲手验证了“用一个AI模型驱动物理系统、做底层控制”这条路走得通。
于是他和同为华为出身的物流老兵高文礼创业,选择几乎全跟同行反着来:
- 不做双足,先做轮式——“智能的上限在手臂”;
- 自研关节,但不做灵巧手——“夹爪就够了”;
- 不堆数据量,坚持质量第一,认为数据比模型架构重要;
- 不追VLA、世界模型这些名词,自研架构叫MoRA,意思是“会推理,能自主”。
最特别的是技术路线:一般机器人是“云端大脑下指令、本地手脚执行”,墨奇把大脑能力直接装进执行层,靠MoRA的端侧System 1能力撑住了15分钟不掉链子。黄青虬的说法很直接:“我们用8个月干了别人两三年干的事。”
产业逻辑很清晰:当抓取不再是壁垒,执行时长的连续性就成了新护城河。今年7月,墨奇宣布融资超10亿元,阿里和腾讯都投了,估值70多亿——资本已经用真金白银投票给了“长程执行”这个单点。
💡 世界模型开天眼:Atlas把2D变3D
机器人要干长活,先得真正看懂世界。这正是Atlas要解的题。
科幻寓言《平面国》里,主角活在2D平面,被3D球体带入空间国才知晓高度的存在。9月2日,World Labs发布的Atlas,被官方称为“全球首个多模态世界模型”,做的就是让AI迎来类似的顿悟:不再满足于生成图片和文字,而是把像素级精确的图像和视频帧重建为3D世界。
底层创新一句话可以说清:用“空间上下文”替换“文本上下文”。传统大模型处理的是文本序列,而Atlas采用多模态自回归扩散Transformer架构,把输入的每张图片、每段视频锚定在三维空间的精确位置,附带相机位姿和深度信息——相当于给AI配了一个带坐标轴和比例尺的三维草稿本。
能力有多离谱?看三个数字:
1. 只需1到6张图片,就能生成最长1分钟的1440p视频,且用户可像导演一样精确规划相机运动轨迹;
2. 传统3D重建要成百上千张照片,Atlas在DTU等公开数据集上重建误差仅25.3‰,优于多个专用模型,曾仅凭2到25张地面照片重建了斯坦福大学整个主方庭,还生成了高空俯瞰的飞行路径;
3. 能把普通手机视频组成多视角系统,做出《黑客帝国》式的“子弹时间”特效。
对具身智能而言,这意味着仿真数据和场景生成的成本曲线可能被重写。机器人训练最缺的就是带物理真实感的3D环境,如果几段手机视频就能重建一个可交互的3D场景,合成数据的供给侧将出现一个全新选项。
🧩 摩尔线程:全功能GPU的具身赌注
有了世界模型和长程模型,还得有算力底座把整条链路跑通。这是摩尔线程押的注。
9月3日,摩尔线程在2026年半年度业绩说明会上给出明确表态:公司已经打通具身智能从合成数据生成、大模型训练、仿真验证到端侧硬件部署的完整链路。
链路里有两个关键落子。其一,全栈具身智能仿真平台MT Lambda;其二,开源了基于MUSA架构的GPU加速物理仿真后端MuJoCo Warp MUSA,并已完成四足机器狗和两足人形机器人的Sim2Real真机验证——仿真里练出来的本事,能在真机上跑,这一步是具身智能工程化最硬的门槛之一。
落地动作也在提速:在无锡设立工业具身智能创新中心,联合生态伙伴共建;同时与国家具身智能应用中试基地成立“具身智能算力与仿真联合实验室”。
为什么一家GPU公司要下这么重的注?摩尔线程的逻辑是:具身智能需要AI计算、物理仿真、图形渲染和端侧推理四件事协同,而“全功能GPU”恰好能一口吃下这四件事——这也是它相对专用芯片的差异化所在。
这背后是国产算力公司的集体转身:当大模型训练算力竞争白热化,具身智能这条“训练+仿真+渲染+端侧”的复合需求链路,为全功能GPU打开了一个增量战场。开源物理仿真后端这一手,明显是在抢具身开发者生态的地基。
📈 落地分水岭:从演示视频到千台交付
把三家玩家放在一起看,一幅完整的产业拼图出现了。
| 公司 | 切入点 | 核心能力 | 落地动作 |
|---|---|---|---|
| 墨奇 | 整机+具身模型 | MoRA长程执行,端侧System 1 | 明年计划交付千台机器人 |
| World Labs | 世界模型 | 空间上下文,稀疏视角3D重建 | Atlas开源生态与数据供给 |
| 摩尔线程 | 算力+仿真 | 全栈链路,Sim2Real真机验证 | 无锡创新中心+中试基地联建 |
时间线也很说明问题:
- 2026年初 : 墨奇成立
- 2026年7月 : 墨奇融资超10亿估值70亿
- 2026年8月19日 : MORPHI KINO长程任务首秀
- 2026年9月2日 : World Labs发布Atlas
- 2026年9月3日 : 摩尔线程披露全栈链路
- 2027年 : 墨奇计划交付千台机器人
半个月内,模型层、世界模型层、算力层同时交卷,这不是巧合,而是产业链在向同一个节点收敛:真实场景交付。
业界流传的一句话很到位:具身智能的上半场比的是谁能动,下半场比的是谁能干完,决赛比的是谁敢报交付量。黄青虬那句“明年交付千台”,才是这条赛道的真正发令枪——演示视频可以NG重来,千台交付在客户产线和家庭里,一个动作都NG不了。
当然,风险也得说清楚:长程任务的可靠性还没有大规模第三方验证,千台交付是目标而非成绩单;世界模型到机器人训练数据的转化路径也还在早期;全栈链路的Sim2Real效果,最终要看真实工况里的良率。
小结:从墨奇的15分钟家务,到Atlas的3D世界重建,再到摩尔线程的全栈链路,具身智能正在完成从“表演型”到“交付型”的关键换挡。2027年的千台交付,将是检验这场换挡的第一个大考——干不完一件事的机器人,故事再好也上不了桌。