资讯
深度对话:AI for Science 爆发了,但真正的天花板还没到
📌 概要
<figure><img src="https://img.huxiucdn.com/ai/ai-general-cover/202608/30/33537-prod-db-general-1-1788048778699.png?imageView2/1/w/1440/h/810/|imageMogr2/strip/interlace/1/quality/85/format/png" /></fi
<figure><img src="https://img.huxiucdn.com/ai/ai-general-cover/202608/30/33537-prod-db-general-1-1788048778699.png?imageView2/1/w/1440/h/810/|imageMogr2/strip/interlace/1/quality/85/format/png" /></figure>——硅谷101对话前DeepMind科学家曹原,一份不加滤镜的现场纪要8月,谷歌传奇工程师Jeff Dean带着Oriol Vinyals、Sanjay Ghemawat、Quoc Le离开谷歌,创办Discovery Loop,方向是让AI自主做知识发现和自动科研。几乎同一时间,AlphaFold联合创始人......<p><span>本文来自微信公众号:</span><a href="https://mp.weixin.qq.com/s?__biz=MzI0ODI0MTQyNw==&mid=2247484828&idx=1&sn=094a38e90bb35a40409b1a8f277ada1c&chksm=e8f71c205d416732580d68cb8206b8d245613ee6adb26b1aad1c25982d96009c01c5d63794d2#rd" rel="nofollow" style="text-decoration: none;" target="_blank"><span> AI时代仍不辍思考 </span></a><span>,作者:创业思考碎片</span></p><p>——硅谷101对话前DeepMind科学家曹原,一份不加滤镜的现场纪要</p><blockquote><p>8月,谷歌传奇工程师Jeff Dean带着Oriol Vinyals、Sanjay Ghemawat、Quoc Le离开谷歌,创办Discovery Loop,方向是让AI自主做知识发现和自动科研。几乎同一时间,AlphaFold联合创始人、诺奖得主John Jumper去了Anthropic。</p><p>外界读成"一个时代结束,另一个时代开始"。</p><p>《硅谷101》主持人陈茜在旧金山对话了Google DeepMind前资深研究科学家、Unreasonable Labs联合创始人曹原。109分钟里,他把AI for Science(AI4S)拆到底:为什么是此刻爆发、卡在哪一步、天花板在哪、什么时候能商业化、人还剩下什么。</p></blockquote><p>一、三个词,先别混着用</p><p>AI4S和AI4AI,都是把AI模型当成研究员本身,区别只在研究对象。</p><ul class="list-paddingleft-2"><li><p>AI4S:让模型去研究科学问题。</p></li><li><p>AI4AI:让模型去研究AI自己。比如在限定GPU预算下把模型训到最好;比如搜索一个不是Transformer的新架构;比如找一个不依赖反向传播(Backpropagation)的新优化算法。</p></li><li><p>RSI(Recursive Self-Improvement,递归式自我改进):不是任务,是方法。让系统用上一轮的结果不断迭代更新任务和方案,自己把事情越做越好。它可以套在AI4S上,也可以套在AI4AI上。</p></li></ul><p>曹原给了一个最小例子说明AI4AI怎么跑:模型看一遍当前代码库,发现某个参数可能该调高→生成一个提议→自己写代码→丢进沙盒跑实验→读训练结果→决定要不要沿这条路继续→再生成下一步提议。一轮轮下来,性能自己往上走。</p><p>AI4S只是把题目从"模型"换成"科学",方法本质一样。</p><p>二、为什么偏偏是现在</p><p>不是科学突然变简单了,是代码能力和智能体的harness(驾驭系统)先成熟了。</p><p>过去两年,AI最能证明自己的两个能力是数学和编程。等模型能比较可靠地写代码,harness能把工作流一步步串起来,才谈得上让AI去啃更复杂的科学问题。</p><p>曹原拿一个生物实验拆成三步:</p><ol><li><p>根据当前观测,提出下一个假设——这需要推理能力;</p></li><li><p>实验出数据后,自己写代码分析,看是否符合预期——这需要代码能力;</p></li><li><p>数据异常时回溯,判断是提议错了还是分析路径错了——这需要迭代和长期记忆。</p></li></ol><p>科学问题比编程和数学范围更广、更乱,必须等这一整套能力先立住。他的原话是:"现在就是天时地利人和。"</p><p>三、AI适合做什么题</p><p>三个判据:可计算、能被干净地建模、能被快速验证。</p><ul class="list-paddingleft-2"><li><p>问题定义这一步,必须由人来做。"AI目前还做不到说,自己有这个品位去找出合适的问题。"人给出初始问题和提示之后,AI可以搜文献、拆结构、把问题结构化得更清楚,但主要是辅助角色。</p></li><li><p>AlphaFold是范本:给定氨基酸序列→预测三级结构,问题定义极清晰,验证也相对容易。</p></li><li><p>可验证性是迭代速度的标尺。代码写完马上能跑,数学证明很快能查,但新药不到最后上市你很难知道效果;核聚变装置的一次实验代价可能高到无人愿意反复试错。</p></li></ul><p>还有一句底层原则值得记:"如果你没法测量,就没法表征。"曹原说,只要数据能被数学化、格式化,变成字符串、某种模态的表示或Embedding,原则上就可以被表征;真正难的是那些本身无法被测量的东西。</p><p>模型的分工也因此不同:通用模型(GPT、Gemini)是"实验室主管"(Orchestrator),驱动整个科研流程,什么格式的输入都能吃;垂类模型(AlphaFold、GNoME、MatterGen)是"领域专家",只接受特定格式的表征。</p><p>AI在科研里有两种角色:一是Co-Scientist(协同科学家),像Claude Science这种工作台,加速你的实验设计和数据分析,自己不必提出新知识;二是自主发现者,像AlphaEvolve自主发现新算法、AlphaFold生成新的蛋白质结构知识。</p><p>四、真正的瓶颈:验证</p><p>"最难的,对于AI for Science,肯定是verification。它是一个瓶颈,一旦这个瓶颈被打破了,你就可以很快地迭代。"</p><p>对比一下就明白为什么:</p><ul class="list-paddingleft-2"><li><p>代码:写完立刻运行,对不对秒级知道。正因为验证是即时的,用户才敢把整个任务外包给编程智能体——这也是目前唯一能产生指数级增长的AI商业闭环。</p></li><li><p>科学:必须走进物质世界。曹原的框架很干净——宇宙最基本的要素是信息、物质和能量。数学和编程停留在信息层,AI4S的提议和模拟也还在信息层,但真正的科学必须进入湿实验。</p></li></ul><p>他的理想测试是:如果每分钟能拿到一次实验数据,哪怕方法再简单,AI4S就退化成一个数据生成问题——无限生成假设、即时验证、即时后训练。现实里实验成本高、周期长,闭环就慢下来了。</p><p>破局有两条路并行:</p><ol><li><p>自动化实验室(AutoLab/Cloud Lab):流程标准化的交给机器人,甚至可以通过API远程调用。OpenAI把GPT-5接到Ginkgo Bioworks的机器人实验室,让模型提出几千种蛋白质配方、机器人执行、结果回传,曹原称这是目前最有说服力的闭环实验之一。参照系是DeepMind与劳伦斯伯克利合作的A-Lab:17天执行353次实验,57个目标材料中合成出36个。瓶颈在机器人的操作精度和速度。</p></li><li><p>尽量少做物理实验:既然物理实验是瓶颈,就得让每一次实验都更可能命中——原来要跑10次的,能不能跑2次甚至1次。这对模型的推理、对失败经验的记忆和分析提出了更高要求。</p></li></ol><p>于是有了那句关键判断:</p><blockquote><p>"AI4S不是简单地把Science当作AI的一个应用,而是AI and Science。"</p></blockquote><p>要让AI更好地解决科学问题,AI本身的能力和AI与科学结合的能力必须同时加强。</p><p>闭环还有一个常被漏掉的环节——元递归(Meta-recursive)。曹原补充:不只是改进模型和实验流程,还要改进工作流本身,包括什么时候让系统更新自己的代码、如何调整agent harness。这是"闭环之上的闭环"。</p><p>另一个缺口是因果。Causal Modeling本身历史悠久(Judea Pearl、Do-Calculus),但曹原对当前语言模型的评价是两个字:不可靠。模型对因果的理解过度依赖措辞和语序——换一种说法、换一下前后顺序,整体意思没变,结果可能就错了,因为训练数据里通常只有最常见的那一种表述。他的判断是:模型对因果关系的判断,不应该基于语言表述,而应该基于对底层物理过程的建模。这也是他认同Yann LeCun强调world model(世界模型)的原因。</p><p>五、更深的问题:AI的"发现",是排列组合吗</p><p>即便验证瓶颈被打破,还有一关。</p><p>曹原引述诺奖得主、CRISPR先驱Jennifer Doudna的一段采访:被问到是否用AI辅助科研时,Doudna说会用,但AI给出的proposal里,没有一个是我们团队以前不知道的。</p><p>AlphaGo的第37手"神之一手"算不算发现?曹原说:算,它是一个新发现。但它的模式还是把已有内在表征重新排列组合,采样到一条过去不常见的路径。它不代表创造了新的概念。</p><p>那发现一个新概念到底是什么样的过程?他拆成三步:</p><ol><li><p>接收感知输入,观察实验和数据——这只是经验输入;</p></li><li><p>抽象出概念——看到人推车、车向前走,你得先抽象出"力",再把它符号化为F;</p></li><li><p>把概念凝结成公式和理论体系——比如F=ma。</p></li></ol><p>今天的AI4S只是在一定限度内探索已有的表征空间,还不能真正产生全新的理论或知识。</p><p>Unreasonable Labs的解法是在LLM外面加一层"符号主义":用规则把不同领域的人类知识串起来(论文A的概念和论文B的概念是什么关系),作为模型的新"直觉",让它生成原本处在小概率区间的想法。但曹原也不讳言:符号主义不可能替代连接主义,最终可能是98%连接主义+2%符号主义。</p><p>真正的瓶颈被他一句话点破:"在novelty(创新性)和可行性之间取得平衡。"让模型创新很容易——随便采样、给个随机词,它都能生成不一样的想法;难的是这个想法既要新,又要合理、可行、能执行。</p><p>六、天花板:概念抽象是AGI的last mile</p><p>这是整场对话最锋利的一段。</p><p>陈茜问:数学里最优美的部分——抽象出一个新对象,比如从矩阵里抽象出"特征值"——AI能做到吗?</p><p>曹原:我不认为它现在可以做到。</p><p>追问:永远都不行?</p><blockquote><p>"我甚至觉得,抽象概念不是一个可计算过程。"</p></blockquote><p>他的论证很朴素:一个语言模型如果从未接受过数学训练,你给它看三只鹅、四只鸟、五棵树,它不可能自然提取出"数"这个概念——而这个概念可以用于任何物体。原始人看到这些就能开始数数,AI不行。</p><blockquote><p>"概念抽象的过程,可能是AGI的last mile(最后一英里),而这一英里甚至可能永远无法跨越。我认为这个过程甚至不一定具有图灵可计算性。"</p></blockquote><p>他还补了一个哲学视角:古典哲学里的英国经验派(培根、洛克)认为认知完全来自经验——映射到今天,就是大模型:初始是随机的,智能完全由万亿token的经验输入决定。大陆唯理派认为理解世界的方式由大脑的先天结构决定——这对应符号主义的先验结构。康德把两者统一:经验提供材料,但必须有先验结构(时间、空间、因果等范畴)来解释材料,智能才能产生。黑格尔再进一步:概念不是一旦建立就恒定不变,而要在自我否定中持续更新——映射到AI语境,就是Continual Learning,最终的AGI不可能是把所有参数刻死的一个checkpoint。</p><p>不同时代的人用不同的语言,讨论的是同一个问题:人怎样认识世界,知识怎样产生。</p><p>七、数学是最诚实的试金石</p><p>AI for Math的三道坎(以Axiom Math AI、Harmonic AI为代表):</p><ol><li><p>语言模型本身要足够强,能提出可能成立的证明;</p></li><li><p>自动形式化——把自然语言证明翻译成Lean,这一步极难,也是这两家公司砸钱最多的地方;</p></li><li><p>Lean的Mathlib必须足够大——人类已有的定义、定理、引理都得在库里,系统才能组合使用。</p></li></ol><p>Lean是必需的吗?曹原的答案分场景:"如果要一本正经地做数学,做职业数学家级别的数学,就需要Lean。"IMO考察的是创意构造,知识未必深,一两页能写完,自然语言基本可信;但王虹那个级别、上百页的证明,自然语言无法保证正确。</p><p>他讲了Peter Scholze的例子:这位2018年的菲尔兹奖得主,对自己一个重大证明到底对不对都无法确定,和合作者反复讨论也没有结论,最后只能把定理、定义、引理全部人工形式化进Lean——光这一步就花了一两年。直到某天编译通过,整个证明才算被确认。即使是最顶级的数学家,在极复杂的问题上也只能相信严格的逻辑和计算机验证。</p><p>而比"对不对"更麻烦的是"证明过剩"——陶哲轩提到的现象:过去长期无人解出的难题,现在底下堆了几十份AI生成的解答,但没有足够的人类专家有时间逐一验证。</p><p>曹原的回应是一个比喻,我认为是全场最好的一段:</p><blockquote><p>如果去听音乐会,我告诉你钢琴是机器人弹的,每个按键的力度和时长都绝对完美、严格按作曲家要求——你可能还是不想听。</p><p>你想听的不只是音色本身,还有演奏者自发的情感和能让你产生共鸣的东西。</p><p>对科学也一样。证明结果正确当然重要,但如果论证过程没有有意思的、容易被阐释的发现,科学家会觉得就像机器人在弹钢琴。</p></blockquote><p>他举了四色定理:上世纪70年代靠计算机枚举证明,结果肯定是对的,从工具角度可以直接用;但从数学本身的价值看,它未必带来新定理或深刻洞见。一个发现有没有意义,取决于你是从工具角度评判,还是从价值角度评判。</p><p>关于黑盒,他的态度也很实在:单一、边界清晰的任务,黑盒可以接受,就像早期的计算器。但结果正确不等于成本变低——AI写的代码连工程师自己都可能看不懂,维护成本反而更高;而模型本质是随机机器,同一个任务第二次运行可能生成完全不同的代码,这种不确定性会造成严重的信任问题。</p><blockquote><p>"如果AI能完成80%有经济价值的活动,但每项活动都需要人介入验证,那还不如不让AI做。"</p></blockquote><p>八、物理必须走出逻辑世界</p><p>AI for Physics和AI for Math不一样。数学只生活在逻辑空间,在人类定义的一套理想逻辑世界里就能成立;物理必须走出逻辑世界,进入物质世界,最终一定要靠实验验证。</p><p>而人类做发现的方式,靠的是溯因推理(abductive reasoning):苹果掉下来是随机事件,牛顿要做的是反过来问"什么原因导致了它",并让这个解释泛化到其他现象。今天AI做得最好的是演绎推理(给定前提、定理、定义去推导新结论),溯因则需要抽象能力、想象能力和世界模型——"未来很长时间也做不到"。</p><p>不过最前沿的理论物理已经出现AI的痕迹:Edward Witten最近在arXiv发表的论文里,在脚注中说明某一段是Claude帮忙想出来的。</p><p>关于数学的"无用之美",曹原的回答值得一抄:</p><blockquote><p>不管数学、美学、艺术还是哲学,如果只从直接效用看,都可以说是"无用之物"。家里挂一幅画有什么直接用途?可能一点用都没有,但这正是所谓**"无用之大用"**。</p><p>很多最美好的东西都从"无用"开始,从人类的好奇心和对美的追求开始。没有这些,就不可能继续发展物理。</p></blockquote><p>九、三巨头都在押注,但都不是最高优先级</p><table cellpadding="2" cellspacing="1" class="article-table" rules="all" style="text-align: center; width: 100%; border-collapse: collapse;"><thead><tr class="firstRow" style="color: #fff;"><th style="white-space: pre-wrap; background-color: #ee2222; font-weight: normal; line-height: 18px; font-size: 14px; text-align: center; padding: 8px 0;"></th><th style="white-space: pre-wrap; background-color: #ee2222; font-weight: normal; line-height: 18px; font-size: 14px; text-align: center; padding: 8px 0;">布局特点</th><th style="white-space: pre-wrap; background-color: #ee2222; font-weight: normal; line-height: 18px; font-size: 14px; text-align: center; padding: 8px 0;">代表动作</th><th style="white-space: pre-wrap; background-color: #ee2222; font-weight: normal; line-height: 18px; font-size: 14px; text-align: center; padding: 8px 0;">结构性约束</th></tr></thead><tbody style="text-align: center;"><tr style="background-color: #fff; color: #000;"><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">Google/DeepMind</td><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">最早、最广、路径最多</td><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">Alpha系列、Co-Scientist、Gemini for Science、Isomorphic Labs、A-Lab</td><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">Gemini必须先到SOTA,短期商业优先级挤压长期研究</td></tr><tr style="background-color: #fff; color: #000;"><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">OpenAI</td><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">最激进</td><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">GPT-5白皮书、GPT-Rosalind(生物化学垂类)、GPT-5+Ginkgo闭环、2027年自动化AI Scientist目标、Astra数学模型</td><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">产品线过长(广告、硬件、企业版);Kevin Weil离职后AI4S并入Codex,赌通用模型</td></tr><tr style="background-color: #fff; color: #000;"><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">Anthropic</td><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">后发追赶</td><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">Claude Science平台、vibe physics、BioMysteryBench、挖来John Jumper</td><td nowrap="" style="line-height: 18px; font-size: 14px; white-space: pre-wrap; padding: 8px 0;">三家中唯一还没有垂类科学模型;短期优先级是coding与上市</td></tr></tbody></table><p>关于Jeff Dean从谷歌出走,曹原不认同"一个时代结束"的说法,他给了三层解读:</p><ol><li><p>组织层:Gemini启动后走"集中力量办大事"路线,原先各做各题的团队被整合,摩擦不可避免;</p></li><li><p>产品层:年初Gemini 3.1 Pro还在排行榜前列,但过去几个月Anthropic、OpenAI和中国开源公司突飞猛进,3.5/3.6 Flash表现平平,3.x Pro迟迟未发布;</p></li><li><p>方向层:Discovery Loop要做的事,正是数学与编程能力成熟之后的下一个自然延伸。</p></li></ol><p>但谷歌不该被看衰:从底层芯片、基础设施、数据中心、工具链,到模型、人才、数据,再到消费者产品的分发渠道,谷歌全部都有,完全不依赖外部生态。问题不是做不好,是优先级和资源投入需要调整。</p><p>顺带一个判断:Meta引入Alex Wang之后MSL有改善迹象,但**"从0分做到80分"和"从80分做到100分"完全是两回事**——后者难得多,而这正是谷歌现在的位置。</p><p>这恰恰是创业公司的窗口。三家最高优先级都还是编程、商业化和把模型做大,AI4S重要但排不到最前。大公司有innovator's dilemma:一旦挖出明确的商业化路径,就不愿意立刻把资源转走。而RSI和AI4S又是谁都不敢真正落后的战略方向。缝隙就在这里。</p><p>十、时间线:分层商业化,诺奖级二三十年</p><p>商业化不能一刀切,它是分层的:</p><ul class="list-paddingleft-2"><li><p>现在就能卖的:药物开发中的靶点发现、分子结构设计这类中间产物,即使还没有一款完全由AI生成的药上市,这些环节已经可以作为产品或服务商业化。</p></li><li><p>需要时间的:让AI独立做出诺贝尔奖级别的成果。</p></li></ul><p>陈茜追问"很长"是多久,曹原给了一个明确数字:</p><blockquote><p>"如果说让AI独立做出诺贝尔奖级别成果,我觉得至少还需要二三十年。"</p></blockquote><p>理由是:AlphaFold拿了诺奖,但那不是AI自主完成的科学发现。而要让AI走到那一步,还得补上现在严重缺失的能力——不只是凭空创造概念,光是从实验结果中稳定做正向和反向的因果推理、长期记忆(做过无数实验之后怎么提取相关记忆)、持续学习,把这几个前沿问题逐步解决,可能五六年就过去了。</p><p>但AI4S的价值不止于"AI的一个应用":</p><blockquote><p>"科学不应该只是AI的应用,它还应该反过来成为促进AI自身发展的刺激和催化剂。"</p></blockquote><p>一个模型如果能解决极难的科学问题,它在编程、推理等其他问题上应该也能做得更好。</p><p>而AI本身是一种meta technology(元技术),就像一个通用大脑。如果真有能拿诺奖的系统,它一定不只解决科学问题,也可以像代理CEO一样在人类经济活动的各个方面做得更好。</p><p>结语:人的价值在哪里</p><p>节目的最后一句话,我原样留下:</p><blockquote><p>一旦理想中的AI完成自进化,跑通从模型到实验的闭环,将带领人类去到从未达到的高度。</p><p>而那个时候,我们必须要更清楚,人类的价值在哪里——是定义,是验证,是应用,还是拥有最终的审判权。</p></blockquote><p>曹原自己的答案是分层的:定义问题(AI没有这个品位)、验证与评判(正确不等于有价值)、应用,以及最终的价值审判。</p><p>以及他对AI从业者的一句提醒,值得贴在办公桌上:</p><blockquote><p>现在AI的大部分研究和应用,都是自下而上的视角——别人告诉你Transformer有效、Scaling Law还没失效、harness要继续优化,把这些做好就可以发产品。这对短期落地当然重要。</p><p>但在这之外,仍然要有立意更高的研究。要用第一性原理、从上往下思考:智能到底是什么?人类怎样认识世界?有哪些特性是目前AI做不到的?</p><p>AI狂热会不可避免地产生浮躁和比较肤浅的见解。</p></blockquote><p>本文为《硅谷101》陈茜×曹原对谈《对话前DeepMind曹原:AI for Science爆发,一个新时代到来了》的核心观点提炼,内容忠实于对话原文,未作延伸演绎。</p>