具身智能人形机器人技术评论分析· 5144· 约9分钟阅读

机器人,咋突然卷起大脑了?

机器人他爹假装能听懂机器人的想法
2026-09-10 00:33 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

2026年,机器人产业焦点从本体转向大脑:运动会让场景赛淘汰偏科生,世界模型在质疑VLA声中升温,Anthropic携MHS闯入物理世界。本文拆解技术路线之争、定义分歧与落地卡点,判断产业叙事正在切换。

机器人行业的牌桌,正在换筹码。

过去两年,卷的是关节、电机、续航和几秒跑完百米;进入2026年,所有人的注意力突然转向了同一个词——大脑。世界模型迅速升温,VLA路线遭遇公开质疑,连Anthropic这种纯数字世界的大模型公司,都开始把Claude塞进实验室的机械臂和显微镜里。

我的判断很直接:这不是又一轮概念炒作,而是产业叙事从「能动能跑」切换到「会干活」的临界点。但路线之争远没有收敛,真正落地前,坑还不少。

标注说明:本文关键数据与言论均标注信源出处;文末「产业判断」及未标注出处的预测性表述,均为作者推断,非事实陈述。

🏃 场景赛,正在淘汰偏科生

金句开场:跳舞视频能骗流量,骗不了计时器和任务规则。

本届世界人形机器人运动会上,有两个画面值得记住。一个是竞技赛:天工Ultra以8.64秒跑完100米刷新纪录(信源:2025年8月世界人形机器人运动会赛事成绩公报,新华社、北京日报等多家媒体报道),它的队友天工Omni以45.66秒拿下400米小型组冠军,那个「捂脸跑」姿势火遍社交网络。另一个是场景赛:机器人们被统一送进新能源汽车充电、图书整理、酒店服务、工业操作、园林巡检和应急救援等任务里,安静得多,却更接近人们真正愿意掏钱的场景。

数据说话。北京人形机器人创新中心带着天工Ultra、天工Omni、天工3.0和天轶2.5-TE四款机器人参加41个项目,拿下15金、12银、18铜,奖牌总数位列第一,竞技赛和场景赛双双名列前茅(信源:世界人形机器人运动会官方奖牌统计,经北京人形机器人创新中心官方渠道确认)。而且天工Ultra不只会跑——100米8.64秒之外,400米38.15秒、1500米2分21秒64,全是金牌(信源:同上赛事成绩公报)。

赛项考察重点商业含义
田径竞速关节负荷、散热、步态控制本体硬实力
智慧充电服务岗开充电口盖、取枪插枪拔枪可付费的真实场景
图书整理判断书与书架位置、拿放泛化与环境适应
综合五项通用全身控制WBC平台级技术能力

【事实】速度一旦提上去,落地冲击和关节负荷剧增,电机发热、算法需实时修正步态,任何一环掉链子就输掉比赛——这考验的是硬件和运动控制的极限。而场景赛考验的是另一件事:环境变了,机器人还能不能继续完成任务,也就是泛化能力。竞技赛证明「身体行」,场景赛证明「脑子行」。

【作者推断】行业淘汰的,是只会秀身体的偏科生。竞技赛成绩的品牌曝光价值会递减,场景赛成绩的订单转化价值会递增。

🧠 王兴兴的质疑,一年后开始应验

金句开场:圈内有句话流传很广——VLA是被数据喂大的孩子,但饭总有喂不动的一天。

关于大脑路线的争论,不是今年才有的。【事实】2025世界机器人大会上,宇树科技创始人王兴兴就公开对当时如日中天的VLA路线泼了冷水(信源:2025年8月世界机器人大会公开演讲及现场媒体采访实录)。他的观点很犀利:人形机器人大规模应用的最大卡点在AI模型,背后是模型架构问题,而不是行业更关注的硬件或数据。他甚至把VLA称为「相对比较傻瓜式的架构」,更看好通过视频生成模型或世界模型驱动机器人,认为这条路线「收敛概率还更大」。

一年过去,风向变了。【事实】光象实验室首席科学家吕尧在接受媒体采访时给出了更技术化的判断(信源:2026年光象实验室媒体专访):VLA已经触碰到天花板。前端是语言模型,后端接动作专家头,语言token映射到动作空间存在模态鸿沟——仅靠超大规模数据训练VLA生成真正泛化的通用策略,基本不现实。

他评价世界模型的标准也很硬核:不能只看下一帧像不像,还要看动作一变,模型能不能正确解释世界为什么跟着变。只有学到物理世界底层的因果规律,才谈得上通用具身智能。

【信源不具名,需注意核实】据多位接近人士透露,不少团队要么因为VLA赛道竞争太卷而转向世界模型,要么是在内部验证中亲手发现了VLA的瓶颈——行业确实在重新审视原有路线。

【作者推断】VLA靠示范数据学「怎么做」,世界模型靠海量数据学「世界怎么变」,后者理论上限更高,但前者的数据闭环更成熟。一年前的非主流观点,正在变成行业共识的前半段——注意,只是前半段。

🗺️ 世界模型是个筐,啥都往里装

金句开场:当一个概念连定义都没有,风口往往比技术跑得快。

「世界模型」最大的尴尬是:大家讲的可能根本不是同一种东西。【事实】李飞飞World Labs团队今年专门撰文讨论这个概念,把世界模型按功能分成三类(信源:World Labs官方博客文章,2025年底发布)——

类型核心功能典型代表
渲染器生成给人看的像素画面Sora为代表的生成式模型
模拟器对几何、物理、动态做准确描述空间智能类模型
规划器根据观测和目标决定下一步动作World Labs,以及VLA

注意最后一行:World Labs把VLA也归入了规划器。这意味着,VLA和世界模型本身就未必是非此即彼的关系。【事实】智平方创始人兼CEO郭彦东在今年6月的北京智源大会上说得更直白:世界模型不是VLA的竞争路线,而是VLA体系中的核心组成部分(信源:2025年6月北京智源大会公开演讲)。

这就是当下最拧巴的地方:争论一年,发现两派可能是同一个体系的两块拼图。渲染器负责想象画面,模拟器负责推演物理,规划器负责决策行动——【作者推断】真正的通用具身智能,大概率不是某一条路线单点突破,而是三类能力的组合。

【作者推断】概念混用期的投资和创业要格外小心。看一家做世界模型的公司,先问清楚它到底在做哪一类——渲染器再漂亮,离机器人干活还隔着十万八千里;只有冲着模拟器和规划器去的团队,才真正踩在具身智能的主线上。

💥 Anthropic下场,数字大脑摸到了物理世界

金句开场:最会写代码的AI,开始拧螺丝了。

如果说前两个信号来自机器人行业内部,那第三个信号就有点「外来物种入侵」的味道了。【事实】8月底,Anthropic发布公告,推出名为「模型硬件标准」(MHS,Model Hardware Standard)的新工具,让AI智能体能够自主操作各种可通过计算机代码编程的设备——从复杂显微镜、液体处理仪、激光器到机械臂。这是Anthropic首款专为物理世界运行而设计的AI工具(信源:Anthropic官方公告,2026年8月)。

场景有多具体?一台先进显微镜可能由数百个镜片、电机和激光器组成,通常需要专业工程师操作。Anthropic负责科学领域合作伙伴关系的Jonah Cool的原话是:Claude现在能够直接与所有这些独立的镜片进行通信并加以控制(信源:Anthropic官方公告引述)。AI智能体还能对实验的每个步骤进行推理、实时更新参数,某些情况下无需人工干预即可从硬件错误中恢复。

效率提升是数量级的(信源:Anthropic官方公告所述对比):

环节MHS之前MHS之后
实验室硬件配置集成数周甚至数月几小时甚至几分钟
设备互联需专业人员定制集成AI智能体自主发现与操作
实验运行人工值守24小时全天候自主实验

合作名单更值得玩味。【事实】测试方包括霍华德·休斯医学研究所、卡内基梅隆大学、基因泰克,以及量子计算公司QuEra;硬件侧,亚马逊AWS、韩国斗山机器人、Automata、凯杰优傲机器人都在把自家设备接入MHS支持(信源:Anthropic官方公告合作方名单)。注意,优傲是协作机械臂的老大——大模型公司正在直接对接工业机器人生态,绕过了传统集成长链。

【事实,待官方确认】Anthropic正寻求在制造业、机器人和制药领域拓展企业业务,且计划今年晚些时候IPO、估值有望冲上2万亿美元(信源:多家外媒援引知情人士报道,Anthropic官方未确认IPO计划与估值数字)。

【作者推断】当一家估值两万亿的大模型公司认真做物理世界接口时,「具身智能的大脑可能被大模型厂商上层收编」就不再是杞人忧天。硬件标准被谁定义,话语权就在谁手里。

⚠️ 冷静一点:坑还埋在数据里

金句开场:发布会上的视频,和车间里的活儿,隔着一整个物理引擎。

热度归热度,落地端的冷水必须泼。【事实】一位做世界模型的公司负责人对媒体说得很实在:一些视频生成结果乍看效果不错,但对摩擦力等物理属性的表达仍然不足,真正用于机器人操作执行时并不够用——而且部分相关数据目前仍需企业自行采集,成本不低(信源:2026年该负责人接受行业媒体匿名采访)。

这句话信息量极大。第一,物理保真度是世界模型绕不过去的坎,画面像不等于世界对。第二,数据成本卡在行业基建缺失上:没有统一的数据标准和共享机制,每家都要自采自标,通用具身智能的「通用」二字先被数据孤岛卡住了脖子。

更基础的问题是:行业目前连机器人能力如何分级都还没有形成统一标准。没有分级标准,就没有采购依据;没有采购依据,商业化就只能靠一场场演示和一个个定制项目硬磕。

【作者推断】参照自动驾驶的发展路径,能力分级标准大概率会成为下一个产业竞争焦点——谁的标准被采纳,谁的商业化节奏就快人一步。而在标准落地之前,那些在场景赛里被验证过的真实任务,比任何发布会视频都更接近答案。

小结

【事实部分】把三件事放在一起看:运动会让场景赛淘汰偏科生,机器人圈自己承认VLA触顶,大模型公司带标准下场做物理接口——2026年的产业叙事已经从「身体军备竞赛」切换到了「大脑卡位战」。

【作者推断部分】但我的务实结论是:世界模型是正确方向,却不是速效药。定义未收敛、数据要自采、物理保真度不够、分级标准缺位,每一项都是真金白银的坎。接下来一年,值得盯的不是谁的概念讲得响,而是谁先在充电枪和图书架之间,把泛化能力变成可以复购的订单。大脑上桌了,但菜单还没定。