资讯🔥8.0

没有全科优秀,具身模型别想进入百万小时

雷峰网·2026/8/31 09:11:00🔗 原文

📌 概要

原力灵机登顶 RoboDojo:一个专门给机器人"卸妆"的考场。                                                                                                         最近的朋友圈,几乎被机器人运动会和 WRC 2026 上的各种视频刷屏了。 看多了机器人百米冲刺、跳远,再看各个展台叠衣服、冲

⚡ 关键要点

  • 原力灵机登顶 RoboDojo:一个专门给机器人"卸妆"的考场。                            
原力灵机登顶 RoboDojo:一个专门给机器人"卸妆"的考场。

                                                                                                       

最近的朋友圈,几乎被机器人运动会和 WRC 2026 上的各种视频刷屏了。

看多了机器人百米冲刺、跳远,再看各个展台叠衣服、冲咖啡,很容易得出一个结论:机器人时代来了。

然而,如果你不幸参与过这些演示背后动辄几千次的调试与过拟合,你就会清楚这里面的水有多深。

行业内管这种情况叫"Demo 滤镜"。滤镜有多厚?说实话,即使你积累了一些行业知识,在现场盯着看,你也未必分得清:这个演示到底是提前编好的动作,还是模型在实时驱动。

这些信息差,让具身行业多少有些鱼龙混杂。

好在,学术界还留着几面"照妖镜",比如 RoboDojo。

图片

01


一个不许摆拍的考场

这是一个来头不小的权威评测:由香港大学多媒体实验室牵头,联合 UC 伯克利、清华等全球近 20 所顶尖机构,背后是知名仿真基准 RoboTwin 的原班人马。它干的事用一句话概括:给全世界的机器人模型办一场统一高考。

其中,42 道题,考泛化、记忆、精细操作、长程执行、开放语义理解五个科目;另外还有18 道题,考场里摆着三种双臂机器人(ARX X5、Piper 等),灯光、复位流程、部署接口全部统一,评审双盲打分,既看结果也看过程。

翻译一下:不许自带考具,不许挑题,不许摆拍,仿真、真机分开考。

成绩单相当惨烈。截至今年 7 月,仿真榜上 30 多个参评模型里,不乏大家熟悉的 π0.5(Physical Intelligence)、英伟达 GR00T-N1.7、OpenVLA-OFT,全是这个赛道叫得上名号的选手,头部模型的平均成功率只有 8.80%,作为对比,人类专家是 76.03%。

真机榜更惨:头部模型总体成功率 12.8%,人类 100%。最难看的是开放语义任务,成功率只有 1.67%。

1.67% 是什么概念?考 60 次,蒙对 1 次。而同一个考场里的人类,满分。

所以这个榜单暴露的,不是哪家公司不行,而是一个行业级现实:现在的具身模型,绝大多数离落地还很远。

然而最近,RoboDojo 的一家中国具身头部公司:原力灵机。它的通用具身基础模型 DM0.5,以 24.90 的综合得分、19.34% 的平均成功率,双项第一,综合排名登顶。

图片

02


分数之外,先看它干活的样子

从去年底开始,AI 科技评论判断一个具身模型的含金量时,就越来越关注榜单之外的东西,它干活的样子。

毕竟,分数是给人看的,活是给世界干的。

我们特地找到了 DM0.5 的 GitHub 仓库,结果看到了一些让人意外的细节。

先从一个测试视频开始。桌上随机摆着红、绿、蓝三块积木。给你三个杯子,从左到右把它们挨个盖住。等颜色全部遮住,再按红、绿、蓝的顺序,把杯子依次揭开。

听着像逗小孩的。没错,三四岁的小孩确实能轻松完成,顺便还会嫌你无聊。但让机器人来呢?很遗憾,绝大多数"具身大脑"都会当场露馅:不是颜色记错,就是步骤乱套。

因为现在的具身模型,大多和金鱼差不多:走一步,忘一步。

主流 VLA 模型做决策时,只看眼前这一帧,或者最近几帧画面。十秒内的短任务没问题,抓个杯子、按个按钮,靠本能反应够了。但真实世界的活儿几乎都是长程的:做一顿饭半小时,收拾一间屋子一小时,流水线一站一整天。没有记忆,机器人就永远只能活在 10 秒的 Demo 里。

这个"杯子盖积木",正是 RoboDojo 里的一道真题,任务名叫 Cover Blocks,考的就是记忆。 DM0.5 的表现,三个随机种子,DM0.5 全部 100% 通过。

注意,拿满分还有两个附加条件:杯子姿态全程有效,结束后物归原位。也就是说,它不是蒙对了一次开盖顺序,而是稳定走完"观察、记忆、按序执行、善始善终"的完整闭环。如果你是做具身算法的,就知道这个表现有多惊艳。

这个 100% 的含金量,放到榜单里更直观:Memory 维度,DM0.5 拿到 47.74 分、47.44% 的成功率;而全场第二名,只有 13.37 分、12.11%,得分差了 3 倍多,成功率接近 4 倍。

Memory一直是原力灵机的强项。PI的Mem具身记忆架构论文,就引用过原力灵机的MemoryVLA,肯定了其在具身记忆方向的探索。

近期旗舰π0.7论文再度引用该成果。π0.7作为全球泛化顶尖的机器人基础模型,架构基于PI的Mem框架,而MemoryVLA在“小脑记忆”路线的研究,为PI提供重要参考。两次引用,足以证明原力灵机在具身智能记忆领域的能力。而这次按榜单的五维综合评价,Memory 正是 DM0.5 拉开差距、最终登顶的关键科目。

图片

03


治"金鱼病",为什么这么难

可能有读者会问:既然记忆这么重要,为什么这么多公司不去攻克?

首先是贵。把几十秒的历史画面塞进模型,上下文一拉长,计算量暴涨,架构也得重新设计。多数团队的选择是先把短任务跑通,记忆以后再说。

这个剧情其实眼熟。大语言模型的进化史,几乎就是一部上下文长度的扩张史:从几千 token 到十几万、上百万,模型记得住的东西越多,能力就发生一次质变——从陪聊到读论文、写代码、当 Agent。上下文,就是语言模型的记忆。

而如果具身行业因为"贵",一直解决不了大脑的记忆问题,那不管机器人是进工厂还是进家庭,都是个闯祸精。

DM0.5 为什么能把记忆做成杀手锏?我们翻了它的开源论文,找到了相关章节:

简单说,DM0.5 是把记忆从后面临时打的补丁,变成预训练阶段就长进去的原生能力。具体有三招:

第一招在架构。DM0.5 由 4B 的 VLM 多模态主干加 680M 的 Action Expert 组成,中间专门设了一个"上下文抽象层":用高效的信息压缩,让 VLM 在预训练阶段就原生学习历史信息,原生支持最长 60 秒记忆,一套架构通吃可变长的时间窗口。

关键是"原生"两个字:不是把长历史硬塞进去硬算,而是让模型从小学会把历史压缩着用。

第二招在预训练。围绕历史上下文、具身推理、动作监督、数据质量做系统升级,让长程记忆、指令理解、动作连续性、抗干扰作为一个整体长出来,而不是东拼一块、西凑一块。

第三招在微调。针对下游任务的 SFT 里直接加入 20 秒历史观测,把预训练攒下的时序理解能力,真正迁移到考场任务上。

三招的回报,就是 Memory 维度那条接近 4 倍的分差。

图片

04


只会背书,拿不了状元

不过按官方的说法,DM0.5 的登顶并非依赖某一项单点能力,而是预训练与针对性 SFT 共同带来的整体提升。我们在仓库里核对了一圈,确实如此。

LIBERO 综合成功率 99.0%;RoboTwi