资讯🔥8.0

8 位 AI 创业者谈世界模型:生成一切之后,还差一点常识|WRC 2026

雷峰网·2026/8/31 09:13:00🔗 原文

📌 概要

会生成未来,不等于理解世界。     作者丨 吴思梦       编辑丨 岑   峰                                                                                                         2026世界机器人大会的最后一天,一场题为“世界模型到服务人类的现实距离”的论坛对话,将八位分别来自模型、

⚡ 关键要点

  • 会生成未来,不等于理解世界。     作者丨 吴思梦       编辑丨 岑   峰                  
会生成未来,不等于理解世界。

    作者丨吴思梦  

    编辑丨岑   峰

                                                                                                       

2026世界机器人大会的最后一天,一场题为“世界模型到服务人类的现实距离”的论坛对话,将八位分别来自模型、数据、本体、仿真各赛道的创业者拉到了同一张桌子上。

这场对话由刚刚获聘中国电子学会世界模型专委会主任委员的之江实验室主任、阿里云创始人王坚主持。八位对话嘉宾——大晓机器人董事长、商汤科技联合创始人王晓刚,奥比中光创始人、董事长黄源浩,无界动力创始人、CEO张玉峰,跨维智能创始人、CEO贾奎,智澄AI创始人、CEO胡鲁辉,飞渡科技联合创始人、总经理宋彬,蚂蚁灵波科技首席科学家沈宇军,极佳视界联合创始人、首席科学家朱政,均为该专委会委员。

尽管大家都在一个大领域里,但每个人对时代和技术的经历各不相同。王坚请八位嘉宾依次从自身经历出发,畅谈:你们认识的世界模型,到底是什么?

一个小时的讨论围绕三个议题层层递进,从“世界模型到底是什么”开始,到“高质量数据会不会成为不可逾越的成本障碍”结束。有人把它称作生成式AI“皇冠上的明珠”,有人自嘲是“卖铲子的人”,有人把底座能力比作“九年义务教育”,还有人追问属于具身智能的“DeepSeek时刻”何时到来。

但真正让这场对话显出重量的,是那些在比喻之外逐渐浮出的判断:

世界模型不能只停留在“生成得像”,而要跨过模仿学习,去理解物理世界的底层逻辑;数据虽然稀缺,但模型一旦具备真正的理解力,数据依赖或许会急剧下降;落地的路径也并非一步跨进家庭,而是先到工业里练技能,再到商业场景里练泛化,最后才敢叩响家门。更棘手的约束来自工程本身,边缘算力有限,功耗不能无限膨胀,安全机制和熔断设计必须跟上。

八个人从不同赛道出发,最终都指向同一个问题:从生成到理解,中间还差什么?而从垂类到通用,或许才是这场漫长赌局的终局。

以下为本次论坛对话的精编稿,雷峰网基于现场录音转写稿进行了不改原意的编辑整理:

图片

01


议题一:

世界模型,到底不一样在哪?

王坚(主持人,之江实验室主任、阿里云创始人):最近几年世界模型这个词很热。诸位是不是能够从自身的经历,谈一谈你们所认识的世界模型,跟现在其他讲的模型有什么不一样的地方?当前有哪些非常有意思的技术路线?

王晓刚(大晓机器人董事长、商汤科技联合创始人):我们从2024年10月发布了“开悟”世界模型1.0。过去几年,我们认为世界模型的应用经历了几个阶段。第一阶段,世界模型主要用来做数据增强——举一反三、反一百,通过世界模型生成各式各样的数据作为训练数据的补充。第二阶段,世界模型可以作为模拟仿真器,模拟动态世界的动态变化,比如端到端自动驾驶,就在世界模型里通过强化学习不断自身演进进化。第三阶段,就是今天大家更加期待的——World Action Model,把世界模型直接部署到机器人终端的大脑,让它实时驱动本体。

世界模型相比以前的VLA模型,最大的特点是能够对世界的未来状态进行生成和预测。VLA还属于模仿学习,针对特定任务、特定硬件本体,很难期待它做出智能的涌现。它擅长的是静态场景,比如抓取一瓶水,环境不发生变化时预测运动轨迹。但今天的世界模型假设世界在交互过程中不断演化变化,我们一边执行动作,一边对各种可能性、平行空间里未来可能产生的后果做出推理和演绎。所以世界模型要具备理解、生成、预测一体化:一个模型,能够对复杂任务进行拆解,判断执行效果是成功还是失败,完成度是多少;生成对未来世界状态的演绎;预测并控制真机本体——三种能力共享特征。

黄源浩(奥比中光科技集团股份有限公司创始人、董事长):讲世界模型,一般都是跟大语言模型相对的。2022年底GPT出来之后,大家都知道大语言模型效果特别好,过了一阵,逐步有人讲空间智能、讲世界模型。大语言模型只能语音交互,而世界模型能够让机器人具身智能真正帮人类干活,解放的是80亿人类的劳动力。原来的GPT只能诗和远方,不能实地干活。

世界模型是解决这个问题的。我们是做世界模型的数据的——视觉数据,也联合很多触觉数据公司,把数据做到毫秒级硬件同步,给世界模型训练提供养料。我们预测,世界模型跟具身智能的GPT时刻可能很快要到来,而且具身智能的市场可能比数字智能大5倍、10倍。我们卖铲子的就不多说了,听听其他模型专家多说一点。

王坚:你刚才讲具身智能的GPT时刻,是不是能够把它改成具身智能的DeepSeek时刻?

张玉峰(无界动力创始人、首席执行官):我以前在地平线做智能驾驶和智能驾驶芯片。世界模型这个概念存在很久了,对于未来状态的预测本身就是一个泛世界模型。我的联合创始人、CTO夏中谱老师,2011年在中科院自动化所读博时研究的就是model-based reinforcement learning,它本身就是世界模型的雏形——只不过那时比AlphaGo打败世界围棋冠军还早了几年,同学们还愁强化学习怎么找工作。这些年强化学习火了,世界模型更火了。

VLA也好,或者类似的、基于本质上模仿学习的范式,它追求的是数据量足够大、分布足够好情况下的概率分布和肌肉记忆。但对于物理世界的底层逻辑的理解,对于提炼关键信息由此带来的比较好的泛化——few-shot、one-shot、zero-shot的涌现一直没有看到。数据稀缺是一方面,但范式本身也有问题。所以世界模型给大家带来了重新聚焦这个概念的机会,也是希望能够突破模仿学习为底层逻辑的范式限制。

具身智能应该聚焦在什么层面?核心是像人一样:以自身的动作为条件,预测世界的下一个状态;或者为达到某个目的,我们到底该采取什么行动?这是人、还有一些哺乳动物与生俱来的能力。我们不需要、也很难学习对于一个物理世界从可见光到原子各个维度的复杂真实模拟,就像天气预报在未来几年可能依然很不准。但人依赖自己大致正确的世界模型,就已经能够完成很多任务。所以无界动力的技术路线是隐空间世界模型——让很多计算不是发生在像素层面,而是让模型学到潜空间的高维表征,更高效地推理、关联时空的因果。

贾奎(跨维智能创始人、首席执行官):这一波AI热潮,从2017年Transformer之后,我们到大语言模型、图像生成、视频生成、3D生成,到现在聊的世界模型。世界模型是整个这六七年生成式AI到目前为止的一个最高潮。因为我们能生成语言、能生成视频、能生成3D,而世界模型是希望能够完全生成符合三维物理几何绝对正确的世界。从这个角度讲,世界模型是“生成式AI皇冠上的明珠”。

跨维智能比较关注的是:你要能够生成三维物理几何绝对正确的可交互动态环境。这意味着世界模型的隐空间、它的token是要能够定义在正确的时空节点上。这样你不仅能生成机器人末端的正确轨迹任务,还能预测机器人或其他物理智能体对环境发生动态改变后,环境怎么正确地变化。世界模型的上限比LLM、VLM、VLA都要高得多,当然对数据的诉求也非常大。

胡鲁辉(智澄AI创始人、首席执行官):我们公司以通用人工智能作为愿景,很自豪国内率先自研世界模型。从AlexNet到AlphaGo、Transformer到ChatGPT,都是现象级的。下一个人工智能是什么?很有可能就是世界模型。我们已经经历了CV时代、多模态大模型时代,也看到了智能涌现和泛化性。下一个问题,人工智能可能要解决的就是理解物理世界——理解可能是个核心。我原来是Meta背景,我们公司用的是JEPA技术路线。相信世界模型能够在人工智能领域起到AlexNet、Transformer这种颠覆性影响。

宋彬(北京飞渡科技股份有限公司联合创始人、总经理):我们做空间智能和数字孪生方向。这几年我们一直在关注世界模型,也总结了一下——大体可以分为几个流派:有基于像素和视频生成的,有基于物理AI角度的,有基于JEPA的,有最新提出的基于因果的,还有基于循环因果的Loop方法。我们看完之后发现一个共性:第一,AI要具备快速理解世界的能力和生成任务的能力;第二,要具备模拟、仿真和推演能力,这必然涉及物理常识,这是其他大模型比较缺乏的;还要有对空间结构、时空拓扑的理解和推演能力,以及因果能力,尤其做ToB、ToG方向,我们需要强因果关系;第三,就是规划和在物理世界上执行任务的能力。

我把世界模型底座能力比作九年义务教育——小学、初中把我们培养出对物理常识、社会伦理、道德的基本认知。上了初中之后开始特殊训练,有些进职高,有些进高中。世界模型底座也是一样,要有很强的泛化和通用能力。

沈宇军(蚂蚁灵波科技首席科学家):灵波是一家给机器人做大脑的公司。关于世界模型我想说两点。第一,非常开心看到大家逐渐意识到视频这个模态对人工智能的重要性。机器人在现实生活中干活,离不开dynamics——不管是突发状况还是整个交互过程,更多的是动态建模,视频方向可能有比较大的提升。第二,世界模型火、潜力大,但我们更关注的是:模型的发展是不是真的对机器人操作有真实的帮助?如果第二点没法证明,前面视频、时序建模做得再好也是空中楼阁。

朱政(极佳视界联合创始人、首席科学家):极佳视界2023年年初成立,到现在三年半,主要标签就是世界模型。当时是语言模型最火的时候,我花非常多精力给投资人讲什么是世界模型,投资人的反应非常一致:你们是非常优秀的团队,如果愿意做语言模型我一定投,但我实在搞不懂什么是世界模型。经过三年发展,到去年情况有了非常大的改观——很多投资人主动找上门。给大家一个直观的例子:去年这个时候我来WRC,公司估值只有现在的1/50。12个月时间,估值涨了50倍。

图片

02


议题二:服务人类,还差哪几步?

王坚:刚才宇军在谈的时候讲到了服务人类。一谈机器人,大家就会谈到人形机器人。如果世界模型要真正服务人类,它今天应该具备哪些最核心的能力?我们离这个目标还有多远?

王晓刚:具身的世界模型应该具备三个核心能力。第一是生成智能。世界模型的核心就是能够生成对未来世界的推演和预测。但光生成漂亮的视频、像素级的美观,还不能完成跟物理世界的交互。缺的第二能力是物理智能,包括空间智能、空间能力,以及跟物理操作的物体的物理规律、物理属性——包括空间记忆。第三个是认知智能。今天我们在具身里做的还是比较Tabletop的简单动作,未来进入更复杂的场景、进入家庭,很长程复杂的任务怎么分解?怎么对动作执行的完成状态进行判断?这需要认知能力。

最先急缺的是中间的物理智能。为什么漂亮的视频并不意味着学到了物理规律?第一,我们今天学的好多视频不是真实的视频,比如电影特效、科幻的视频。第二,我们非常缺工作当中第一视角交互的视频。除了视频本身,还要有相机位姿、几何信息、物理属性、多视角摄像,只有综合起来,才能把物理智能学好。

黄源浩:一方面模型需要不断进化,另一方面数据特别重要。世界模型有很多类别,一种是从理论上出发设计牛顿力学、各种规则;另一种是喂数料涌现出来的。人刚出生也没学过牛顿定律,但看人家怎么做、模仿学习也能做。两条路径都要走。如果世界模型好了,真正机器人能为人类干脏活、苦活、累活,还得本体——手的执行能力、传感器各方面都得好。先从最需要的方向、最贵的、人类最不愿意干的活去落地,后面泛化性好了、智能高了,再往更多场景渗透。

张玉峰:世界模型要能学到对于物理世界底层逻辑的理解、长程任务的完成、场景泛化的支持。我们的总体思路是用工业来练技能——选定一些有商业价值、有复制性、传统工业自动化不太容易做的场景,比如安全带织布柔性物体的操作,基于世界模型的方法能够预测和快速响应被操作物体的形变。用商业场景练泛化——商业场景体现的是光线、背景变化,比如咖啡店、快餐连锁店,任务相对具象但环境有变化。进家庭现在比较有挑战,因为它把几个挑战的维度全放在一起了。

另外,安全性怎么保障?做L4自动驾驶时,模型端到端和额外的安全机制、冗余机制并存也是非常关键的。还有一点,但凡人机共生,语言交互能力非常关键,模型如何能够把人的一些示教,类似于大人教小孩一样,作为上下文让机器人在实际场景下得到学习。

← 返回资讯流