AI读完全网,为啥冲不好一杯咖啡?
具身智能的瓶颈不在模型大小,而在经验数据:AI读过一切却没经历过任何事。Ropedia发布380g头戴设备HOMIE Gen2采集人类真实操作,李飞飞团队用视觉轨迹打通世界模型与机器人动作,TUM研究者则指出学术数据与真实数据是两回事。数据采集、数据对齐、可解释性,正成为具身智能落地的新三关。
8月中旬的新加坡,南洋理工大学副教授、Ropedia首席科学家刘子纬在一场公开演讲上抛出了一个问题:为什么读过整个互联网的AI,进了物理世界,却连一杯咖啡都冲不好?
他的答案很直接:AI读过一切,却几乎没有经历过任何事情。
这句话戳中的,是当下具身智能行业最尴尬的一根刺。大模型的参数越堆越大,Demo越剪越炫,可真到了产线上、厨房里,机械臂依然连一次可靠的抓取都保证不了。这篇文章想聊清楚的,就是这道裂缝从哪来、谁在补、以及钱会往哪流。
🥤 能听懂,能想象,就是做不好
“卡住具身智能的从来不是「想不想得到」,而是「做不做得出来」。
先看一个今天的AI身上随处可见的分裂现场:
- 感知模型,能把冲咖啡的教程讲得头头是道;
- 生成式模型,能合成一段以假乱真的冲咖啡视频;
- 可一旦真的伸出机械臂,同样的智能,常常连杯子都端不稳。
三种能力摆在同一个系统里,就像一个理论满分的实习生——笔试第一,上手第一天就把咖啡机搞炸了。
这不是某个模型的偶然翻车,而是整个具身智能行业的结构性问题。据多位接近头部具身智能公司的人士透露,不少团队内部评估时都默认一个现实:实验室演示的成功率,和客户现场要求的成功率之间,隔着的不是一次调参,而是一整套数据供给方式的缺失。
产业逻辑其实不难拆:互联网文本教给了模型「是什么」,视频教给了模型「看起来是什么」,但没有谁教过模型「手感是什么」——什么时候下锅、该用多大力、食材发生了什么变化。这些信息从未被结构化地记录过,模型自然学不会。
📈 从「看见世界」到「经历世界」
“数据范式正在切换:从「看了什么」到「做了什么」。
补「经验」这一课,刘子纬团队其实早有铺垫。他们做过一个名为EgoLife的项目:六个人共同生活七天,录下约五十小时的第一视角视频,并同步了外部视角、音频、视线与动作。
注意,模型在这些数据里要回答的问题,不是「画面里有什么」,而是更接近生活本身的问题——那罐咖啡豆昨天被谁挪去了哪里?上一次冲煮为什么失败?
用刘子纬的话说,这是在为物理世界构建「记忆层」。真正的Physical AI要能跨越数小时、数天甚至不同的人去推理,这是语言模型从未面对过的时间尺度。
这个思路在演讲后不久落了地。由联合创始人兼CEO陈昭熹与联合创始人兼CTO洪方舟共同创办的Physical AI公司Ropedia,正式发布了新一代多模态采集系统HOMIE Gen2——一台约380g的头戴设备,把「经验采集」做成了可量产的硬件。
陈昭熹有个很形象的说法:学做一道菜,只看别人做的视频,可能知道最后成品长什么样;但真正亲手做过,才知道什么时候下锅、该用多大力、食材发生了什么变化。HOMIE Gen2要做的,就是把这些真实操作中的动作、时机和环境变化完整记录下来,让机器人学到的不只是结果,还有过程。
两条技术路线的差别,可以放进一张表里看:
| 维度 | 传统视频/遥操作数据 | 第一视角经验数据(EgoLife类) |
|---|---|---|
| 记录内容 | 结果与画面 | 动作、时机、视线、环境变化 |
| 时间尺度 | 秒级片段 | 数小时到数天的连续生活流 |
| 学习目标 | 模仿结果 | 理解过程与因果 |
| 数据来源 | 实验室/网络视频 | 人类真实日常行为 |
| 硬件载体 | 遥操作台、机械臂 | 轻量头戴设备(如380g的HOMIE Gen2) |
这条产业链的关系,用一张图就能看明白:
注意最后那条回流线:机器人真实作业的表现,反过来又定义了下一轮数据该采什么。数据闭环,才是具身智能真正的护城河。
🗼 世界模型与动作之间的「巴别塔」
“视觉轨迹,正在充当世界模型和机器人动作之间的「同声传译」。
光有经验数据还不够。具身智能内部还有一层长期没打通的墙:世界模型和机器人动作,说的根本不是同一种「语言」。
世界模型擅长预测「世界接下来会怎么变化」,输出的是视觉层面的想象;机器人策略需要的是「我的关节该怎么动」,输出的是动作序列。两边各说各话,中间缺一个翻译。这就是李飞飞与吴佳俊团队最新工作瞄准的问题——用视觉轨迹充当「同声传译」,让世界模型和机器人动作真正「同频对话」。
翻译一下这个思路的分量:世界模型想象出「杯子从桌面A点移动到B点」的画面,视觉轨迹把这层想象显式地表达成一条空间路径,机器人策略再沿着这条路径生成实际动作。想象、轨迹、动作,三层被一条线串了起来。
这件事和经验数据采集,恰好是互补的两环:
一个补「数据的上游」,一个补「模型的下游」。中间的视觉轨迹,就是那座巴别塔的塔基。
⚠️ 学术数据和真实数据,完全是两回事
“可解释性,正在成为具身智能落地的「生死线」。
数据有了,模型对齐了,就能上路了吗?慕尼黑工业大学的黎子玥在IJCAI 2026上给出的答案,给行业泼了盆清醒的冷水:学术数据和真实数据完全是两回事;可解释性成落地「生死线」。
这句话值得展开说。学术 benchmark 里的「成功」,和客户产线上的「成功」,标准根本不一样。论文里的环境是受控的,光照稳定、物体位姿已知、失败可以重来;真实场景里,一个堆满杂物的工位、一位随手挪动物料的工人,就能让整个指标体系失真。模型为什么这次成功、上次失败?如果说不清楚,客户就不敢签验收单。
这就是为什么可解释性被推到了「生死线」的位置——它不是学术上的加分项,而是商业上的入场券。据多位接近落地项目的人士透露,越是接近付费的客户,问的问题越朴素:出了错,你能不能告诉我错在哪一步?
把当前具身智能落地的三道坎放在一起看,脉络就很清楚了:
- 数据关:模型缺的不是参数,是经历——头戴采集、经验数据正在补这一课;
- 对齐关:世界模型和动作策略说的不是一种语言——视觉轨迹正在做翻译;
- 信任关:真实环境和学术环境是两回事——可解释性决定客户敢不敢买单。
三关过完,具身智能才算真正从「Demo驱动」切换到「交付驱动」。
这条演化路径,时间线大概是这个样子:
🔋 数据采集,正在变成一门好生意
“谁掌握了经验数据的入口,谁就握住了具身智能时代的「油田钻井权」。
从工程师视角看,这轮变化里最值得关注的,其实是「数据采集」这个此前不受待见的环节,正在被硬件重新定义。
HOMIE Gen2的意义不在于那380g的重量本身,而在于它把「采集人类经验」的成本压到了普通人的日常动作可以承载的水平——不需要遥操作台,不需要专业动捕棚,戴着它正常生活和工作,动作、时机、环境变化就被完整记录下来了。采集从「项目制」变成了「日常制」,数据的规模上限完全不同。
对产业链来说,这里藏着一个清晰的分工:
- 上游是轻量采集硬件和多模态传感,拼的是佩戴体验与标定精度;
- 中游是数据引擎与记忆层构建,拼的是对齐、清洗与检索;
- 下游是模型训练与整机落地,拼的是可解释性和交付能力。
(注:以上权重为本篇基于素材逻辑的推演,非实测数据。)
换句话说,未来两年具身智能的估值叙事,很可能不再围绕「谁的模型更大」,而是围绕「谁的经验数据更多、谁的失败能被解释」。数据入口的位置,比模型的位置更稀缺。
小结
回到开头那杯咖啡。AI冲不好它,不是因为不够聪明,而是因为它从未亲手冲过——感知、想象、行动之间的裂缝,本质是一条数据的裂缝。
Ropedia用HOMIE Gen2从人类真实行为里补「经验」,李飞飞、吴佳俊用视觉轨迹打通想象与动作,黎子玥则提醒所有人:真实世界的数据和可解释性,才是落地的生死线。三条线索指向同一个判断:具身智能的下一程,比的不是谁读得多,而是谁经历得多。2026年下半年,值得盯紧的不是又一个大模型发布会,而是经验数据的采集规模和第一份敢写清失败归因的交付合同。