AI读遍互联网,却不会冲咖啡
感知模型能讲清冲咖啡教程,机械臂却连一次可靠抓取都做不好——经验数据的缺失正卡住具身智能行业。Ropedia发布HOMIE Gen2头戴设备、李飞飞团队打通世界模型与动作、智元强化数据方法论,三条路线共同指向同一件事:让AI从人类真实经历中学过程,而不只是学结果。
AI 读遍互联网,却冲不好一杯咖啡
8 月中旬,新加坡的一场公开演讲上,南洋理工大学副教授、Ropedia 首席科学家刘子纬抛出了一个问题:为什么读过整个互联网的 AI,进了物理世界,却连一杯咖啡都冲不好?
他的答案很直接:"AI 读过一切,却几乎没有经历过任何事情。它从未真正冲过一杯咖啡,自然也不知道该怎么做。"
这不是段子,是当前具身智能行业最真实的一堵墙。感知模型能把冲咖啡教程讲得头头是道,生成式模型能合成一段以假乱真的冲咖啡视频;可一旦真的伸出机械臂,同样的智能常常连一次可靠的抓取都完成不了。能听懂,能想象,就是做不好。
演讲之后不久,由联合创始人兼 CEO陈昭熹与联合创始人兼 CTO洪方舟共同创办的 Physical AI 公司 Ropedia,正式发布了新一代多模态采集系统 HOMIE Gen2——一台约 380g 的头戴设备。行业把宝押在了它身上:让 AI 从人类真实行为中,补上缺失已久的"经验"这一课。
这一波动作不止一家。李飞飞与吴佳俊再度联手,试图打通世界模型与机器人动作之间的"巴别塔";智元则把数据方法论当成夺冠的核心打法。三条路线殊途同归:具身智能的下一场仗,不在模型参数里,而在人类的经历里。
☕ 从"看见世界"到"经历世界"
AI 不缺知识,缺的是过程。
HOMIE Gen2 背后的"经验"思路,可以追溯到刘子纬团队更早的研究 EgoLife:六个人共同生活七天,录下约五十小时的第一视角视频,并同步外部视角、音频、视线与动作。模型要在这些数据里回答的,不是"画面里有什么",而是更接近生活本身的问题——那罐咖啡豆昨天被谁挪去了哪里?上一次冲煮为什么失败?
用他的话说,这是在为物理世界构建"记忆层"。真正的 Physical AI 要能跨越数小时、数天甚至不同的人去推理,这是语言模型从未面对过的时间尺度。
而落到产品上,陈昭熹的说法更形象:"学做一道菜,只看别人做的视频,可能知道最后成品长什么样;但真正亲手做过,才会知道什么时候下锅、该用多大力、食材发生了什么变化。"
这套逻辑直接戳中了现有数据采集范式的软肋。行业目前主流的三条数据路线,各有各的账要算:
| 采集方式 | 代表场景 | 核心问题 |
|---|---|---|
| 互联网视频 | 各类教学、演示视频 | 只有结果,没有力觉、时机与过程 |
| 遥操作 | 机器人直接采集 | 成本高、速度慢,数据受限于台数 |
| 第一视角经验采集 | HOMIE 类头戴设备 | 能同时记录动作、时机与环境变化 |
第一视角路线的价值在于:人类每天自然完成的千万次操作——做饭、整理、搬运——都可以变成机器人的训练素材,而无需每台机器人亲自重做一遍。据多位接近行业的人士私下聊,头部具身智能公司内部评估过,纯靠遥操作把一个通用任务的数据量堆到可用,在成本上几乎不成立。
谁能低成本地收割人类经验,谁就握住了具身智能的数据咽喉。
🌉 打通世界模型与动作的"巴别塔"
有了经验,还得让它听懂"动作"这门外语。
数据只是原料,模型侧同样有一道裂缝:世界模型擅长"想象"物理世界的演化,机器人动作模型擅长"执行",但两者各说各话,中间隔着一座巴别塔。李飞飞与吴佳俊团队的新工作,选择让视觉轨迹充当"同声传译",让世界模型和机器人动作真正"同频对话"。
这件事的产业含义值得展开:
看懂了吗?关键在闭环。世界模型可以低成本地"预演"海量物理场景——相当于机器人在虚拟世界里先摔一万次跤;而视觉轨迹充当翻译层,把"想象中物体如何运动"转译成机械臂可执行的动作序列;真机执行后的失败数据再回流到经验库。
这条链路一旦跑通,意味着机器人训练可以大量脱离真机:真机负责校准,想象负责走量。这在汽车行业有先例——自动驾驶早已靠仿真跑出远超真车里程的训练量。具身智能正在补同一课。
业内流传的一种说法是:世界模型与动作模型的融合,会是未来两年具身智能架构竞争的主战场。李飞飞团队选这个时间点下场,时机耐人寻味。
🏭 数据飞轮的另一种解法
模型很性感,数据很费钱。
再看国内。智元近期被外界总结出了一套"夺冠方法论",其核心打法之一正是数据:不把宝押在单一模型突破上,而是通过量产本体撬动真机数据回流,配合多种采集手段并行的数据工厂,让数据飞轮先转起来。
对比三条路线,你会发现整个行业在做同一道题的不同解法:
- Ropedia / HOMIE Gen2 路线:向人类借经验,用头戴设备把人的日常操作变成机器人教材;
- 李飞飞团队路线:向想象借规模,用世界模型把物理交互在仿真里无限复制;
- 智元路线:向量产借飞轮,用上量本体换真机数据。
三条路线不是替代关系,而是互补关系。据多位接近人士观察,头部玩家内部都已经在做混合数据配比的实验——人类经验数据负责常识与过程,仿真数据负责规模,真机数据负责校准。真正的问题只剩下配比和成本。
而数据采集体这种轻量硬件,恰好卡在了一个甜蜜点上:它不像机器人本体那样重资产,却能以消费电子的成本撬动海量训练素材。这也是为什么越来越多的投资人在私下问同一个问题——具身智能的"英伟达时刻",会不会先出现在数据基础设施层?
卖铲人的生意,往往比挖金子更早赚到钱。
⚠️ 狂热之下,三个必须泼的冷水
经验数据不是灵丹妙药,坑还在前面。
第一,人机差异没人解决干净。人类的手和机械臂的动力学特性完全不同,第一视角录下的"手感",机器人能不能真正迁移过去,目前业界没有定论。380g 的头戴设备能记录动作,但力觉、触觉的保真度仍是硬门槛。
第二,数据质量的评估体系还没建立。机器人领域没有 ImageNet 时刻,各家数据集互不兼容,任务定义五花八门。没有统一基准,"经验"多不多就成了各说各话的营销口径。据行业里流传的吐槽:现在的具身智能数据集,十家有九家的任务无法直接对齐。
第三,隐私与合规是新变量。第一视角设备天然要进入家庭、工厂等真实场景,录下的是人的完整生活流。这类数据怎么脱敏、怎么授权、跨主体使用边界在哪,行业还没有形成共识。可以预见,随着采集规模上量,这会是监管必然介入的领域——从业者在产品设计阶段就该把合规做进去,而不是等出了事再补课。
📌 小结
"AI 读过一切,却没经历过任何事"——刘子纬这句话,可能比过去一年所有具身智能的 demo 视频加起来都更接近行业的真相。
HOMIE Gen2 把经验变成了一台 380g 的头戴设备,李飞飞团队把世界模型和动作翻译成了同一种语言,智元用量产把数据飞轮转了起来。三条路线指向同一个判断:具身智能的竞争,正在从模型参数的军备竞赛,转向人类经验的大规模收割与转化。
接下来的两年,看三件事:经验数据的迁移效率有没有实质突破、行业会不会出现统一的数据基准、以及数据基础设施层会不会跑出独立的公司。谁先补上"经验"这一课,谁就有资格谈通用。
机器人不需要读过互联网,但它必须开始经历世界。