通用机器人,开始叛逃人形叙事
嘴上越来越'通用',身体却越来越分叉——机器人行业正在发生一场 quietly 的架构迁移:通用性不再长在某台人形机器上,而是下沉到跨本体模型与后训练能力中。本文拆解身体分化、模型合流、数据成为战略资产三条主线。
过去一年,机器人行业出现了一个耐人寻味的分裂:发布会上的词越来越'通用',工厂里的机器却越来越不像同一种机器人。
有人换上轮式底盘,有人死守双足;两指夹爪、五指灵巧手、四足底盘,各干各的活。与此同时,另一股力量正悄悄把这些分叉的身体重新焊回去——跨本体模型。灵波科技、Google DeepMind、英伟达在同一个月里交出了各自的答卷。
核心判断一句话:'通用机器人'正在从一种身体,变成一种架构。 通用性不再由某台机器独自承担,而是被拆解到模型、模块和具体身体之间。这场迁移的胜负手,不在关节电机,而在数据和后训练。
🏭 工作在选择身体,而不是身体选择工作
'像人',只回答了第一层问题。
人形机器人最动人的叙事,是人类已经为自己建好了整个世界——楼梯、货架、电梯,全是按人的身体设计的。与其改造环境,不如造一台像人的机器,直接使用人类工具和通道。这个逻辑成立,所以双足赛道一度挤满了玩家。
但机器人真正上岗以后,工作会继续追问:它要搬多重的东西?连续工作多久?地面适不适合轮子?要不要在人身边运行?答案不同,身体就开始分叉。
最典型的案例来自智元。2025年夏天,智元的远征A2-W进入富临精工的工厂搬运周转箱。按照披露数据,首套系统单班可配送1000箱;后续订单计划让近百台A2-W进入两个车间,单班完成近万次搬箱动作。到了2026年,智元董事长邓泰华复盘时给出结论:这个场景的任务成功率、作业节拍和料箱识别泛化性,已经可以满足基础部署要求。
注意,A2-W不是双足方案——这是一个为工厂节拍优化的身体。同样的分化正在门店、仓库和巡检现场同步发生:
| 场景 | 主流身体形态 | 关键约束 |
|---|---|---|
| 工厂搬运 | 轮式底盘+大负载手臂 | 作业节拍、负载、平整地面 |
| 门店/导览 | 人形+灵巧手 | 直接使用人类工具与环境 |
| 巡检/户外 | 四足或轮式 | 复杂地形、续航 |
| 精细上下料 | 定尺寸机械臂+夹爪 | 精度、成本、节拍 |
产业逻辑很清楚:场景是身体的第一设计师。 人形是通用性的'最大公约数',但真实订单会沿着效率、成本、安全三条线,把身体裁剪成最贴合任务的样子。为了一个搬箱任务硬上双足,就像用瑞士军刀切牛排——能切,但没必要。
🧠 身体在分叉,大脑在合流
机器人的通用性,正在从硬件层迁移到模型层。
2026年7月,三件事几乎同时发生。第一,蚂蚁集团旗下灵波科技开源LingBot-VLA 2.0,预训练数据覆盖20种机器人构型。第二,Google DeepMind发布Gemini Robotics 2,让同一套模型控制三种不同的机器人配置。第三,英伟达进一步开放GR00T N1.7的模型权重和训练工作流,基础模型可以通过后训练适配具体的机器人、任务和环境。
| 模型 | 玩家 | 跨本体能力 |
|---|---|---|
| LingBot-VLA 2.0 | 蚂蚁集团灵波科技 | 预训练覆盖20种机器人构型 |
| Gemini Robotics 2 | Google DeepMind | 同一模型控制三种机器人配置 |
| GR00T N1.7 | 英伟达 | 开放权重与训练工作流,后训练适配 |
把这三件事放在一起看,一条新的产业分层正在浮现:
这就是'架构化'的含义:预训练在模型层沉淀跨身体的通用能力,后训练把能力注入具体身体。身体可以千差万别,大脑共享同一个底座。
英伟达的做法尤其值得玩味——开放权重和训练工作流,本质上是在把'后训练'变成行业的公共基础设施。业内人士私下有个说法:机器人公司的护城河,正在从'造得出本体'转移到'后训练跑得通'。一家本体厂商如果没有模型层的能力,未来可能沦为别人架构上的'躯干代工厂'。这个判断未必人人认同,但方向感已经出现。
📊 数据成了战略资产,而且有官方认证
互联网语料快见底了,物理世界数据成了新的矿。
2026年8月18日,据路透社报道,美国国会下属机构USCC(美中经济与安全审查委员会)发布报告称,美国主要AI公司已基本用尽开放互联网资源训练大语言模型,而中国正在系统性地收集国内'无法通过爬虫获取的企业、运营和物理世界数据'——这正是训练面向商业应用、自动驾驶和人形机器人AI工具的关键原料。
报告点名了一个事实:中国先进的制造业和工业机器人生态,为具身AI应用提供了大量高质量数据。中国企业已开始在上海、深圳、北京等城市的数据交易所挂牌专有数据集,而USCC副主席迈克·库肯的表态更直白:'过去五年中,中国已经能够整合数据、寻找标注和精炼数据的方法,并不断收集新数据',他建议美国国会制定国家数据战略,'把数据视为经济资产'。
需要说明的是,该机构的立场偏鹰派,长期研究中国科技的分析人士丹尼斯·西蒙就指出,'在中方看来,该委员会是一个政策参与者,而非中立的事实调查机构'。撇开立场因素,这份报告从对手口中确认了一个产业共识:物理世界数据的采集、标注与精炼能力,是具身智能时代真正的基础设施。
这和上一节的模型合流是同一枚硬币的两面——跨本体预训练需要覆盖20种构型的数据,谁的真实产线在持续产出多构型、多任务的交互数据,谁的预训练底座就更厚。工厂里的每一台机器人,同时也是数据采集器。
🏛️ 政策接住了最后一棒
场景开放,是政府能给的最实在的生产要素。
模型有了,数据有了,还差什么?差的是让技术跑起来、磨出来的地方。2026年7月31日,上海市科学技术委员会印发《上海张江高新技术产业开发区发展'十五五'规划》,几处表述直接对应了前文的产业逻辑:
- 实施 '模力聚申' 行动,推进具身智能技术熟化与实训场建设,加速在制造、物流、零售、康养、家政等场景落地;
- 打通语料汇聚与共享体系,建设科学数据中心、高质量语料公共服务平台;
- 提升智能计算能力,突破光计算、类脑等颠覆性芯片架构,构建超算智算融合、云边端协同的自主算力体系;
- 目标到2030年,三大先导产业工业总产值全市占比保持在80%以上。
看懂这份规划的口径,就知道政策端想干什么:算力、语料、实训场——这三样恰好是单个创业公司最难自建的要素。'实训场'尤其关键,它是把真机数据和场景验证制度化,等于把素材1里富临精工式的单点合作,升级为城市级的公共能力。
有接近张江园区的人士透露,'模力聚申'行动的重点不在发补贴,而在把制造、康养这些国企和事业单位密集的场景真正打开。场景开放一件顶十件,这是业内共识。
把三条线拼起来看:中国路径是场景产数据、数据养模型、模型进场景的闭环;美国那边,USCC的报告正是对这个闭环的焦虑外显。 博弈归博弈,产业事实已经摆在桌面上。
结语:别再问哪台机器人最通用
过去我们习惯问:哪台机器人最通用?这个问题正在过时。
工作把身体拆成了千百种,跨本体模型又试图把它们连回一张网。通用机器人不再是货架上的某一个SKU,而是一套'基础模型+后训练+具体身体'的组合方案——LingBot-VLA 2.0、Gemini Robotics 2和GR00T N1.7在同一个月扎堆出现,不是巧合,是架构迁移到了临界点。
接下来值得盯三件事:跨本体模型的后训练工具链会不会成为新的'安卓时刻';物理世界数据的采集与交易基础设施能铺多快;以及实训场这个新物种,能不能把中国制造业的场景红利,真正转成模型层的能力。身体越分越散,大脑越聚越拢——这场戏,才刚开场。