具身智能人形机器人核心零部件评论分析· 4030· 约7分钟阅读

具身智能Tier 1,终于上桌了?

机器人他爹假装能听懂机器人的想法
2026-09-09 03:29 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

20余家产业链公司组建中国具身智能Tier 1联盟,李飞飞发布世界模型Atlas,墨奇用端侧MoRA跑通15分钟长程任务——大脑、本体、分工三条线同时生变,具身智能正从单点炫技走向系统协同的产业深水区。

机器人行业最近三件事,得连起来看。

一件是20多家公司凑在一起,成立了「中国具身智能Tier 1产业联盟」;一件是李飞飞的World Labs丢出全球首个多模态世界模型Atlas;还有一件是成立仅8个月的墨奇,用一台轮式机器人干完了15分钟的家务长程任务,估值已到70多亿。

把它们拼在一起看,你会发现一个清晰信号:具身智能正从「单点炫技」走向「系统协同」。汽车工业玩了一百年的Tier 1分工体系,正在被机器人行业连夜抄作业。

📈 20家企业凑局,机器人开始抄汽车作业

先说联盟这事儿。

据36氪消息,由星源智灵心巧手共同发起,联合奥比中光法奥机器人禾赛科技速腾聚创珞石机器人灵猴机器人移远通信鑫精诚等企业,「中国具身智能Tier 1产业联盟」正式成立,成员企业超过20家。

名单覆盖的环节相当完整:具身大脑、灵巧手、语音交互、激光雷达、视觉感知、触觉感知、机械臂、底盘、无线通信、热管理。翻译一下——从「眼耳手脑」到「腿脚血管」,一台具身智能机器人身上的关键器官,这个联盟基本凑齐了。

为什么叫「Tier 1」?这个词是从汽车产业借来的。在汽车工业里,Tier 1是直接向整车厂供货的系统级供应商,比如博世、大陆、采埃孚。它们不是卖零件的,是卖「系统集成能力」的:你出一套刹车方案、一套座舱方案,主机厂拿来就能上车。

机器人行业过去没有这个角色。各家本体厂什么都自己搞——自研关节、自研灵巧手、自研感知,恨不得连螺丝都自己拧。这在小批量阶段没问题,一旦冲交付量,供应链就成了瓶颈。

据多位接近联盟的人士透露,这一轮组局的底层动机很直接:客户(尤其是工业和商业场景客户)要的不是一台「能演示的机器人」,而是一套「能交付、能维护、能上量」的系统。单点再强,拼不成系统就是零。

环节类别代表企业(联盟成员)
大脑与交互星源智、讯飞机器人超脑平台、知行具身
灵巧手与执行灵心巧手、法奥机器人、珞石机器人、灵猴机器人
感知(激光雷达)禾赛科技、速腾聚创、览沃科技
感知(视觉/触觉)奥比中光、福莱新材、华威科、鑫精诚
通信与支撑移远通信、森云智能、泉智博、迈尔微视

这个表本身就是产业逻辑:机器人供应链的「器官清单」已经齐了,缺的是把它们组装成系统的角色。Tier 1联盟,干的就是这件事。

一句业界私下流传的话挺到位:「机器人行业不缺英雄,缺的是把英雄们串起来的施工队。」

🧠 李飞飞发牌:世界模型成了大脑的军备竞赛

金句先放这儿:没有世界模型的大脑,是背题型的学生;有了世界模型的大脑,才是懂物理的实习生。

9月2日,「AI教母」李飞飞旗下的World Labs发布多模态世界模型Atlas,官方称之为「全球首个多模态世界模型」。它不再满足于生成图片和文字,而是能生成像素级精确的图像和视频帧,并将其重建为3D世界。

核心创新一句话:用「空间上下文」(Spatial Context)替换「文本上下文」。Atlas采用多模态自回归扩散Transformer架构,把输入的每张图片和视频都锚定在三维空间中的精确位置,附带相机位姿和深度信息——相当于给模型配了一个带「坐标轴」和「比例尺」的三维草稿本。

几个能力数字值得细看:

  • 只需1到6张图片,就能生成最长1分钟的1440p视频,且用户可精确规划相机运动轨迹;
  • 传统3D重建要成百上千张照片,Atlas在稀疏视角下重建误差仅25.3‰(DTU公开数据集),优于多个专用模型;
  • 一个案例里,它仅凭2到25张地面照片就重建了斯坦福大学整个主方庭,还生成了高空俯瞰的飞行路径。

这对机器人意味着什么?意味着「大脑」第一次有机会在三维空间里真正理解物理法则和几何结构,而不是靠2D画面「看起来合理」来猜。机器人要在真实世界里抓取、避障、导航,缺的恰恰是这种带几何约束的世界理解能力。

当然,也得泼点冷水:Atlas目前展示的是重建与生成能力,距离「装进机器人脑子里实时跑」还有工程距离。但方向已经明牌——具身智能的大脑竞争,正在从「语言理解」升维到「空间理解」。

国内这边,星源智讯飞机器人超脑平台等联盟成员押注的正是具身大脑环节。世界的牌桌和中国供应链的牌桌,正在同一张桌子上对齐。

⚙️ 墨奇反着来:不做人形,先干完一整件事

机器人行业现在最关心的一个问题:它能干完一整件事吗?

几十秒的抓取视频已经撑不起估值了。把一件事从头干到尾——行业叫「长程任务」——成了最新考题。

8月19日,世界机器人大会,一台机器人给出了15分钟的答案:收拾客厅,检查冰箱,把烘干机里的衣服拿出来,放进新的一批,按下启动键,最后把衣服叠好。全程约七八十个动作,自主完成,没掉链子。

造它的公司叫墨奇(MORPHI),成立刚8个月,这台机器叫MORPHI KINO。联合创始人黄青虬1994年生,清华自动化本科、港中文MMLab博士,在华为车BU五年做到智驾AI部门一号位,主导了华为智驾ADS 1.0到4.0的算法突破与量产,管过两百多人。公开信息显示,华为智驾已覆盖35家车企、50余款量产车型,搭载量超170万台。离开前,他完成了整个智驾的AI化,亲手验证了「用一个AI模型驱动物理系统做底层控制」这条路走得通。

于是他和同样出身华为的物流老兵高文礼一起创业,而且几乎每个选择都和同行反着来:

维度主流路线墨奇的选择
本体形态双足人形轮式,「智能的上限在手臂」
末端执行自研灵巧手夹爪,「夹爪就够了」
数据策略堆数据量质量第一,认为数据比架构重要
模型架构追VLA、世界模型名词自研MoRA,按功能命名,会推理能自主
推理位置云端大脑下发指令大脑能力装进执行层,端侧System 1

关键在最后一条:那15分钟没掉链子,靠的就是MoRA模型端侧System 1的能力。黄青虬称之为Agentic-Native路线——「我们用8个月干了别人两三年干的事。」

钱也在快速跟上。今年7月,墨奇宣布融资超10亿元,阿里腾讯都投了,估值70多亿元。团队150多人,明年计划交付千台机器人。

时间线摆出来更直观:

  • 2025年初前后 : 墨奇成立
  • 2025年7月 : 融资超10亿元,阿里腾讯联投,估值70余亿元
  • 2025年8月19日 : MORPHI KINO世界机器人大会首秀,15分钟长程任务跑通
  • 2026年 : 计划交付千台机器人

注意一个细节:墨奇是「反Tier 1」的典型——自研关节、自研模型,垂直整合。而联盟是「正Tier 1」路线——专业分工。两条路现在都拿到了钱和掌声,说明这个阶段还没有标准答案,但都在指向同一个终点:能规模化交付。

⚠️ 冷思考:大脑、本体、分工,三线同时生变

把三条线索收拢一下,具身智能的产业版图其实在三个维度同时松动。

第一,分工维度。汽车工业证明过:当产品复杂度超过单一企业的组织能力边界时,Tier 1分工是必然。机器人正在逼近这个临界点——灵巧手、触觉、激光雷达、机械臂,每个环节的技术深度都不比当年的汽车ECU浅。联盟的出现,本质是产业在主动补组织结构。

第二,大脑维度。World LabsAtlas把「空间上下文」立为范式,墨奇MoRA把推理能力压进端侧执行层。一个往「更懂世界」走,一个往「更快执行」走,殊途同归:机器人的智能必须长在物理世界里,而不是长在聊天窗口里。

第三,考题维度。行业KPI已经从「能抓起来」换成「能干完」。这条考题会自动淘汰一批只会做30秒Demo的公司,也会逼着供应链上的每一个环节回答:你的部件,能支撑15分钟不掉链子吗?

风险当然有。联盟这种组织形式,历史上成功的不多——20多家公司,利益如何对齐、标准如何统一、谁来牵头对接主机厂订单,都是硬骨头。而端侧模型路线要证明的,是「小而准」能否持续打赢「大而慢」。

但至少方向清晰了:2025年的具身智能,比拼的不再是谁能转得最漂亮,而是谁能把整台机器、整条链路、整个交付跑通。

具身智能的故事,正在从「一个人的英雄主义」,切换成「一群人的系统工程」。大脑在进化,本体在分化,分工在成型——三条线拧成一股绳的那天,才是机器人真正上桌干活的那天。

而Tier 1这张桌子的主位,现在还没人坐稳。这,才是2026年最值得盯的悬念。