具身智能人形机器人投融资评论分析· 175· 约7分钟阅读

具身智能路线之争:VLA已死?

机器人他爹假装能听懂机器人的想法
2026-08-18 21:39 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

Google Gemini Robotics 2 发布、瑞银给出2035年4020亿美元TAM预测、95后创业者穆泽林凭世界模型拿下近5亿融资——三件事指向同一个问题:当VLA路线的泛化瓶颈暴露,具身智能正在从“记忆动作”向“理解物理”艰难转身。

机器人这行,从来不缺热钱,缺的是从客户口袋里掏出来的真金白银。

过去一个月,三件事同时发生:[[Google DeepMind]]发布了[[Gemini Robotics 2]],强调“全身控制”和“多机协作”;[[瑞银]]给出保守预测,2035年具身AI相关市场规模冲到4020亿美元;[[眸深智能]]创始人[[穆泽林]]——一个95后,靠做机器人“大脑”里的世界模型,又拿了近5个亿。

热闹背后,一条清晰的产业裂痕正在浮出水面:VLA(视觉-语言-行动)模型的泛化天花板已现,世界模型被推到台前。但问题是,世界模型自己也只有20%-30%的成熟度。方向可能是对的,路比所有人想的都长。

谷歌亮剑:具身智能的“基座层”竞争开场

想象一个场景:同一间厂房里,一台人形机器人弯腰调整工件角度,一台机械臂同步接管装配,另一台AGV在搬运物料。它们之间没有线缆连接,没有中央控制台发指令,而是靠同一套“智能层”自主协调动作。这是[[Gemini Robotics 2]]宣传视频里最核心的叙事。

据[[IEEE Spectrum]]的Video Friday栏目报道,[[Google DeepMind]]将[[Gemini Robotics 2]]定义为“驱动下一代真正可适应机器人的智能层”。关键词不是“又一个人形机器人”,而是“智能层”。这意味着谷歌不满足于造某款机器人产品,而是在做所有机器人通用的“操作系统级”能力输出。其强调的三个能力点——智能全身控制、高级灵巧操作、多机器人协作——恰好对应了当前具身智能落地最卡脖子的三个环节:运动控制、精细操作、任务协同。

一位长期跟踪谷歌机器人项目的产业人士私下说:“Gemini Robotics系列的意义不在硬件,在站位。谷歌想把机器人版的‘安卓’标准攥在自己手里,这是典型的基础设施打法。”

这个判断有数据支撑。据[[瑞银]]研报,当前AI能力大约每7个月翻倍,远超传统摩尔定律的18-24个月周期。模型能力的跃迁速度,正在让“智能层”的输出成为可能。而这个“智能层”的竞争,本质上是谁来定义机器人与环境交互的通用接口。

产业链正在加速分化:做本体的公司越来越多,但做“智能层”的公司屈指可数。谷歌的入场,等于给整个行业划了一条线——不做智能层的本体厂商,最终可能沦为“铁壳子”。而做智能层的玩家,则要面对谷歌这个降维打击者。

瑞银的4020亿美元账本:硬件仍是最大的确定性

据[[瑞银]]全球财富管理首席投资办公室最新研报,到2035年,人形机器人及自动化相关全球潜在市场规模(TAM)预计达4020亿美元,年复合增长率约11%。这个数字看似激进,但拆开看很有意思。

细分赛道2035年预测规模关键判断
传统及新型自动化硬件约1000亿美元已具备成熟应用场景和付费客户
ADAS(含FSD)约880亿美元汽车产业规模效应推动
人形机器人约400亿美元商业化仍处早期
Robotaxi约400亿美元成本和安全法规是变量
精准农业/手术机器人/eVTOL/智能眼镜约1340亿美元以约23% CAGR扩张

这份账本最值得注意的,不是总量,而是结构:自动化硬件的预测规模是人形机器人的2.5倍。

这跟很多媒体的叙事节奏并不一致。过去两年,人形机器人几乎成了具身智能的代名词,但[[瑞银]]的结论很直白:工厂自动化、仓储物流、农业机械、手术机器人早就有了真实付费客户,AI能力一旦叠加上去,收入转化路径短得多。人形机器人故事性感,但商业化还早。

瑞银在报告里将这一趋势命名为“AI in motion”——AI开始真正作用于现实世界,获得感知、决策和行动能力。背后的推动力不只是技术,还有人口结构变化和制造业回流带来的劳动力缺口。

一位接近瑞银的机构人士透露,这份报告的核心诉求其实是提醒投资者:不要把所有筹码押在单一机器人赛道上。“具身AI是一条产业链,不是几只票。硬件今天赚钱,模型明天赚钱,但你不能只买明天。”

这个判断的产业含义在于:资本市场正在从“看故事”切换到“算账”。能收到钱的硬件和自动化公司,正在成为具身智能投资逻辑里的“压舱石”。

95后创始人拿5亿:世界模型从论文走向回款

聊完巨头和投行,说一个更“接地气”的事。

[[眸深智能]]创始人[[穆泽林]],1995年生,第三次创业,方向是世界模型。据虎嗅独家报道,[[眸深智能]]近日完成近5亿元Pre-A+轮融资,投资方包括深报一本基金、东方证券直投基金、陕西省高新技术产业投资有限公司,以及安宇基金、天盟投资、建元天华等产业资本。老股东创合汇资本、徐汇资本、庚辛资本超额追投。累计融资近10亿元。

一个成立不过一两年的世界模型团队,凭什么?

用[[穆泽林]]自己的话说,他不想做“最好的世界模型”,只想做“最好用的世界模型”。[[眸深智能]]成立当年,经审计的回款收入达到1000万元。这个数字放在机器人行业里不算大,但放在世界模型赛道里,几乎是异类。

虎嗅的报道里有一个细节很关键:眸深在具体场景部署时,仍然需要约10%的真机数据,一次交付周期2-3个月。[[穆泽林]]预计,到2028年这个周期才有可能缩短到2-3周。换句话说,世界模型在今天远远谈不上“开箱即用”,但已经能收到钱了。

多位接近眸深的产业人士向虎嗅透露,[[穆泽林]]团队接单的策略非常克制,现阶段只选择未来可能达到1万台以上部署规模的场景。这跟那些“什么都接、先跑起来”的团队形成鲜明对比。

这个案例背后折射的产业逻辑,是具身智能正在经历从“论文驱动”向“回款驱动”的残酷转型。热钱依旧在进,但投资人开始追问一个问题:你的模型能在客户现场跑通吗?跑通了,客户愿意付第二次钱吗?

VLA vs 世界模型:泛化魔咒与物理理解之争

穆泽林有一个被虎嗅引用、在业内流传甚广的比喻:现在主流的VLA模型更像是在“记忆动作”——让机器人在固定高度的桌子上拿盘子,它可以完成;但桌子降低20厘米,它可能就废了,因为新场景不在训练数据里。

这不是吐槽,是技术路线的分水岭。

VLA(Vision-Language-Action)模型的逻辑是:传感器输入 + 自然语言指令 → 直接映射到动作。它的优势是端到端、见效快,在标准化场景里表现不错。[[瑞银]]的报告也承认,VLA是推动机器人能力跃迁的关键技术。

但问题在于,VLA的泛化能力受限于数据覆盖度。真实世界的物理变化无穷无尽,穷举式采集数据根本不现实。一旦场景参数发生偏移——桌子高度、光照条件、物体材质——模型就可能失效。这在学术上叫分布外泛化(OOD Generalization),在产业上叫“演示视频骗局”。

世界模型试图走另一条路:让机器人理解物理世界的规律,再根据环境变化生成动作,而不是死记硬背动作-场景的映射关系。

但[[穆泽林]]自己也很清醒:目前整个世界模型的成熟度可能只有20%-30%。眸深部署时仍需要真机数据辅助,交付周期以月计算。那些喊出“VLA已死,世界模型才是未来”的极端声音,在产业一线看来,更多是概念炒作。

据多位接近投资机构的人士私下说,现在市场上真正看清楚这一点的投资人并不多,“很多人是在赌方向,不是在看交付周期”。赛道里确实有00后创始人,从实验室出来,讨论的是技术终局,但商业化优先级排很后。穆泽林算是少数从第一天就把回款摆在桌面上的人。

这场路线之争,短期不会有胜负。VLA在结构化场景里继续吃订单,世界模型在复杂场景里打磨泛化能力。真正的分水岭,可能要到2028年——[[穆泽林]]自己给出的交付周期缩短时间点,恰好也是瑞银预测里具身AI开始加速兑现的窗口期。

小结

具身智能正在经历一场意义深远的“地基重铸”。[[Google DeepMind]]押注智能层,[[瑞银]]看重硬件基本盘,[[眸深智能]]用世界模型换回真金白银——三个切面指向同一个判断:这个行业正在从“能不能动”走向“能不能用”,从“演示漂亮”走向“回款真实”。

VLA不会死,它会在结构化场景里长期存在;世界模型也远未成熟,20%-30%的成熟度意味着未来两年仍将是缓慢爬坡期。但对产业而言,最有价值的信号不是谁更“先进”,而是谁先找到愿意重复付费的客户。2028年,或许才是真正的分水岭。

📚 相关资讯本文参考的1条资讯素材