资讯🔥8.0

TUM 黎子玥:模型这么大这么强,为什么还是「上不了路」?| IJCAI 2026

雷峰网·2026/9/1 02:54:00🔗 原文

📌 概要

学术数据和真实数据完全是两回事;可解释性成落地“生死线”。     作者丨 幸丽娟     编辑丨岑   峰                                                                                                         三年前,正值大模型爆发之年,麦肯锡就曾对全球交通与工业领域的从业者做了一项调研,问

⚡ 关键要点

  • 学术数据和真实数据完全是两回事;可解释性成落地“生死线”。     作者丨 幸丽娟     编辑丨岑   峰      
学术数据和真实数据完全是两回事;可解释性成落地“生死线”。

    作者丨幸丽娟

    编辑丨岑   峰

                                                                                                       

三年前,正值大模型爆发之年,麦肯锡就曾对全球交通与工业领域的从业者做了一项调研,问题很朴素:距离真正的智能化,还有多远?

答案出乎意料地悲观:还要10到20年。

而把时间线拉到现在,模型越来越大、智能体越来越多、时空数据挖掘的论文层出不穷。

现实依旧是,全球没有一座城市长期部署了基于强化学习的交通信号控制系统。那些在顶会上“超越所有SOTA”的预测模型,真正到了城市交通部门手里,他们的答案往往是:“这个方案,我不敢放手用。”

问题的症结在哪里?

在刚刚结束的 IJCAI 2026 Early Career Spotlight(早期职业焦点)演讲中,慕尼黑工业大学 (TUM) W2 教授黎子玥(Ziyue Li)给出了他的答案:

第一,学术研究长期停留在“干净数据”的舒适区,而公共部门面对的,永远是不完整、不规整、不可控的真实数据;

第二,可解释性不是论文里的加分项,而是从实验室走向城市落地的“生死线”。

黎子玥的履历横跨学界与工业界:香港科技大学工业工程与决策分析系博士,现任慕尼黑工业大学W2教授,此前任科隆大学W1教授;曾在斯图加特贝尔实验室、香港地铁、商汤科技辗转于科研与产品之间。他既在KDD、IJCAI、ICLR、NeurIPS等顶会发表大量研究成果,也亲手将研究推向真实部署,亲历过从论文到产品的每一道坎。

他在演讲中,进一步用自己在学界与工业界之间摸爬滚打的经历,凝练出一个他称之为“PDE三角”的框架——感知(Perception)、决策(Decision)、解释性(Explanation),试图弥合学术研究与公共部门落地之间的那道鸿沟。

同时,他还描绘了一条从人工主导走向自动化的技术路径:描述性分析(发生了什么)到诊断性分析(为什么发生),再到预测性分析(将要发生什么),最终抵达规范性分析(应该怎么做)。

这条技术路径,也是一份写给整个AI研究社区的“诊断”指南:当你的模型在基准测试上排名第一,但城市管理者依然不敢按下那个开关时,问题不全在城市管理者身上,也不全在研究社区身上,而在于两者之间缺乏有效的转化机制。

以下是黎子玥教授的演讲分享,AI科技评论根据其演讲内容进行了不改原意的编辑:

TrafficPDE: A Guidebook to Deployable AI-Driven Transportation Systems——Through the Perception-Decision-Explanation Triangle(TrafficPDE:可部署AI驱动交通系统指南——基于感知-决策-解释性“三角”框架)

图片

01

从“DB ”说起:一个研究者的困惑

大家可以看到这个DB的logo吗?在座的各位,有没有人跟德铁(DB)有过struggle的?

所以我觉得这可以成为一个特别好的起点,来聊聊我们如何用机器学习来做这件事,以及结合我过去四到六年在交通领域摸爬滚打的经历,谈一谈我们到底如何为公共部门做出真正有用的研究。

我们启动了一个项目,叫 “DB Delays” (列车延误系统),并且我们做了一个开源平台。你基本上随便输入一个城市,比如柏林,点进去,就能看到所有列车实时的运行轨迹。你点一下那个按钮,从ICE到区域列车(RE),所有车在哪儿、怎么在动,一目了然。

更关键的是,我们一旦知道了过去发生了什么,就能确切地知道这趟车到底晚点了多久。在此基础上,我们就能理解、甚至预测未来可能发生什么。在不同粒度上——从一个州到另一个州,到不同城市,甚至精确到你平时常坐的那趟车。我自己就经常坐火车,我打开这个界面,就能知道:哎,我眼前这趟车,它真的晚点了。

这是我心目中一个真正由AI驱动、数据驱动的智慧城市和智慧交通应该有的样子——一切运转丝滑。但现实是,我们仍然需要一本“指南手册”(Guidebook)来弥合这个差距。我等会儿会重点讲这个差距到底是什么。

我们做了那么多研究,但很多时候,那些花哨的时空数据、智慧交通论文,并没有真正惠及公共部门。

所以我就在想,我在这次“早期职业聚焦”演讲,到底能讲什么值得说的贡献点?我试着从我过去这四到六年在工业界和学界的经验,总结出一点有用的东西。于是我想到了三个字母,不是偏微分方程那个PDE,而是感知(Perception) 决策(Decision)和解释性(Explanation)。这三个模块,或许能凑成一本指南手册。

2023年,麦肯锡曾经做过一个调研,问了不同领域,特别是工业界和交通部门的人:距离真正实现智能化还有多远?

答案是:还要10到20年。

我当时就纳闷了:我们现在有那么多智能体(agentic),模型一个比一个大、一个比一个强,为什么在这个特定应用领域,还得耗这么久?

图片

02

干净数据 vs. 脏数据:

学术界的“舒适区”与真实世界的落差

先看看数据是怎么来的。我先给大家看一个“干净”的版本,稍后我会给大家看一个“脏”的版本。

干净版本就是香港地铁的数据。我们跟香港地铁合作了很多年。香港地铁有一百多个站,每个人在自动售检票系统(AFC)上进站刷一次、出站刷一次。数据库里记录的就是:多少人进来了,多少人出去了。

所以你能拿到每个站点、不同时段的漂亮数据。你能看到特别清晰的周规律——工作日和周末截然不同。再看不同站点,你还能发现很好的空间模式:有些站是早高峰一头独大,有些是晚高峰独大,还有一些是全天比较均衡。

这就是我们领域里常说的“时空机器学习”。这些词很时髦,其实就是怎么把空间和时间上的这种相关性,变成数学公式或者网络结构。

顺便插一句,为什么有些站是早高峰、有些是晚高峰?原因其实就取决于它们到底在城市哪个位置。这个我后面会再提到。

以上说的是数据是怎么来的。那一篇典型的时空交通预测论文长什么样呢?

如 PPT 所示,我们可以看到很漂亮的pipeline,把各种模块往上拼。然后你觉得不够复杂?好,加一层。还不够?再加一层。还不够?继续加。

这基本上就是我们每次审稿时都在看的东西。说真的,我已经看腻了。

模型这边是这样,数据那边呢?没错,右边这个数据图标,就来自我自己的论文,但我今天特意把它拿出来,就是想提出一些批评。你看,我们比了20个数据集、30个模型,不管怎么比,我们的永远是最好的。今天比这个好,明天比那个好。

所以有一天我就在想:如果咱们预测得已经这么准了,为什么路上的问题还是没解决? 这肯定哪儿不对劲。

那调研到底说了什么?差距到底在哪儿?为什么还得10到20年?

他们列了几个关键原因:基础设施准备度、互操作性、数据整合……你仔细看,大量问题都指向数据。再细看数据相关的关键词——可扩展性、实时性、异构数据源、数据质量。

所以我们现在要做的,就是实实在在地去学习怎么搞定这些“脏”数据

图片

03

“PDE三角”框架:

感知、决策、解释性三者平衡