大模型下海,车企造人,谁先赚到钱?
OpenAI用GPT-6 Astra宣告AGI时代,本质是数字世界的通用执行器;李飞飞的Atlas世界模型给机器补上物理理解;车企因卖车利润率跌至3.6%集体涌向人形机器人。三条技术线正在合流,谁能先把会干活的智能装进能干活的身体,谁先摸到钱。
导语:同一个月里,OpenAI发布了自称开启AGI时代的GPT-6 Astra,李飞飞交出了世界模型Atlas,而中国车企们——小鹏、比亚迪、奇瑞——正排着队往人形机器人里砸钱。三条原本平行推进的技术线,正在拧成一股绳。这轮合流的背后不是巧合,而是一个朴素的产业判断:大模型会想,机器人能做,中间差的桥,正在被补上。谁先把「会干活的智能」塞进「能干活的身体」,谁先摸到真金白银。
🖥️ Astra 的真正卖点:不是 AGI,是「不用点鼠标了」
AGI这个词,业内早就喊疲了。但OpenAI这回把话说得格外直白。
在一场闭门媒体简报会上,OpenAI联合创始人兼总裁Greg Brockman用一句「Welcome to the AGI era」收尾。按照公司章程的定义,AGI意味着「在大多数有经济价值的工作上超越人类的高度自主系统」。这话从OpenAI自己嘴里说出来,分量不轻——也引发了不少争议性的讨论,但本文更关心另一件事:对企业和普通打工人来说,Astra最实在的卖点,可能跟AGI哲学没什么关系。
OpenAI在宣传片里放了一段上世纪60年代的AI演示做开场,然后笔锋一转:Astra被定位为「计算新时代」的入口——用户,包括员工,从此可以不再碰鼠标、不再敲键盘。
这句话拆开看,信息量很大。
过去几年,各家Agent产品的路数是:想让AI操作一个软件,开发者就得给那个软件写一套专门的API集成。十个应用、十套接口,工程量堆在那里,Agent永远是「演示惊艳、落地稀碎」。而Astra的思路完全不同——它被设计成像人一样使用软件:跨浏览器、跨表格、跨网站、跨桌面应用,直接产出成品文档和演示文稿,执行的是完整的多步骤工作流,而不是「教你怎么做」。
用工程师的话说:这是从「给每扇门配钥匙」变成「给Agent配了一双能开门的手」。
产业逻辑很清楚:OpenAI在抢的不是聊天框,是数字世界的通用执行层。一旦Agent能像人一样遍历软件界面,企业现有IT系统无需改造即可被AI接管——这是个可怕的市场空间。据多位接近头部企业客户的投资人私下透露,大家对Astra真实能力的判断还有分歧,但「数字Agent替代重复性白领操作」这条线,几乎没人再怀疑方向。
不过先把话说透:Astra再能干,它干的还是「数字世界」的活。它写得出PPT,但拧不了螺丝。拧螺丝这件事,得靠另外两拨人。
🌍 李飞飞的 Atlas:给机器人补上「看懂世界」这一课
数字Agent再强,到了物理世界就是睁眼瞎。这是具身智能圈的老难题:机器人的手再灵活,前提是它得先「看懂」眼前的桌子、杯子、流水线。
李飞飞交出的答案,是她的首个多模态世界模型Atlas。这款模型有两个关键标签值得划重点:从零开始预训练、几张图就能构建世界。
先说前者。「从零预训练」意味着Atlas不是在大语言模型上做微调嫁接,而是为空间理解这个任务专门重造了一个底座。世界模型要处理的是三维空间、物体关系、物理规律,这些和大语言模型的文本范式并不天然兼容——李飞飞选择从头建,说明她判断物理世界的理解逻辑必须独立成篇,而不是文本智能的附属品。
再说后者。「几张图就能构建世界」指向的是数据效率——这恰恰是机器人领域最痛的伤口。收集真实世界的数据太贵了:遥操作一条操作轨迹,人工成本高、场景覆盖窄。如果世界模型能从极少量的图像输入中推演出完整的可交互环境,机器人训练就从「现实采集」转向「仿真生成」,成本曲线会被拉出一个陡峭的下坡。
这里可以画一张具身智能的三层技术栈,看看Atlas卡在哪个位置:
Atlas站住的,正是中间那层「世界模型」。它向上承接大模型的推理能力,向下为机器人本体和仿真训练提供空间理解。产业逻辑是:数字智能与物理世界之间,需要一个翻译官——大模型知道「该做什么」,世界模型负责理解「世界长什么样」,本体负责「真的做出来」。
一个耐人寻味的信号:OpenAI在数字执行层高歌猛进的同一时期,物理世界理解层的标杆人物拿出了从零预训练的成果。两件事发生在同一个月,很难说纯属巧合。
🚗 卖车养不活车企了:一场被迫的集体迁徙
上面两拨人谈的是「智能」,而中国车企这波涌向人形机器人的动机,说出来有点心酸:卖车,快养不活自己了。
先看场景。2026年的夏天,中国汽车工业的目光齐刷刷从方向盘转向了两条腿。8月24日,小鹏宣布旗下人形机器人业务完成首轮超9亿美元融资,投后估值突破63亿美元,腾讯与阿里巴巴罕见联手入局。几乎同期,比亚迪首款商用服务人形机器人「小迪」完成真机首秀。奇瑞宣布旗下墨甲机器人全球累计交付突破3000台,其中海外市场占2000台,业务覆盖60多个国家和地区,并已启动IPO筹备。
短时间之内,从奇瑞、小鹏到比亚迪,从理想、小米到蔚来,国内已有十多家主流车企以自研、孵化、投资等方式杀入人形机器人赛道。
为什么这么急?数字不会撒谎。
乘联分会秘书长崔东树8月27日披露的数据显示:2026年1至7月,汽车行业收入60780亿元,利润仅2162亿元,利润率只有3.6%——低于下游工业企业6.5%的平均水平。更刺眼的是年初:1至2月行业利润率一度跌至2.9%,创下近十年最差开局。
落到单车上更狠。2026上半年单车利润数据是这样的:
| 车企 | 利润率 | 单车利润 |
|---|---|---|
| 吉利 | 5.2% | 6389元 |
| 长安 | 0.6%-0.8% | 619-811元 |
| 零跑 | 0.55% | 589元 |
| 更多车企 | 为负 | —— |
翻译一下:一台20万元的车,整车厂净赚不过三四千块。李书福家的吉利已经是「尖子生」,而长安卖一台车赚的钱,不够在北京吃一顿像样的饭。有车企高管私下说了一句大实话:「不追求暴利,但总得先有利润吧。」
新能源汽车渗透率突破50%之后,市场从增量进击转入存量博弈。同质化严重,价格战成了为数不多的武器,而价格战又把利润打到了地板。行业底层逻辑变了:车企手里最值钱的资产,正在从「卖车的牌照和渠道」,变成「大规模精密制造+电机、电池、传感器的供应链整合能力」——这套能力,和造人形机器人的重合度高得惊人。
把时间线摆出来看,这场迁徙的节奏感非常清晰:
另一个值得记住的数字——墨甲机器人的交付结构,海外占了三分之二:
这说明一件事:中国车企造的机器人,不是只能在国内秀肌肉的展品,已经开始在60多个国家和地区接受真实商业环境的检验。这比融资估值更能说明问题。
🔀 三线合流:谁先把智能装进身体
回到开头的判断:这三件事不是三条新闻,是同一件事的三个切面。
OpenAI的GPT-6 Astra证明,通用智能作为「执行器」在数字世界已经跑通逻辑;李飞飞的Atlas在补物理世界的理解层;而中国车企手握的,恰恰是具身智能最稀缺的东西之一——能大规模量产、控制成本、走完交付闭环的制造能力和渠道。墨甲机器人3000台的累计交付、小鹏机器人63亿美元的投后估值、腾讯阿里的联手下注,本质上都是资本在为「物理世界的入口」投票。
把三家的牌摊在一张桌上,格局是这样的:
| 阵营 | 代表 | 核心资产 | 主战场 |
|---|---|---|---|
| 大模型派 | OpenAI GPT-6 Astra | 通用推理与软件操作 | 数字世界执行层 |
| 世界模型派 | 李飞飞 Atlas | 空间理解与仿真生成 | 物理世界认知层 |
| 本体制造派 | 小鹏/比亚迪/奇瑞 | 供应链与量产交付 | 物理世界行动层 |
据多位接近产业的人士观察,接下来12-24个月的竞争焦点,会从「单点能力」转向「整合能力」:大模型派往物理世界探(Agent能力向机器人迁移),制造派往智能层攀(自研或引入VLA与世界模型),世界模型则成为两边的公共桥梁。合流的路径大致会是:
先落地的场景不会是科幻片里的全能管家,而是结构化、重复性强的工业与商用场景——这正好是车企的舒适区,也是墨甲们已经在海外真金白银卖货的地方。
当然,冷水也得泼一句:数字Agent的容错率是「重新跑一遍」,物理世界的容错率是一台几万甚至几十万美元的硬件和可能的人身安全。Atlas这样的世界模型能否在真实产线的复杂光照和遮挡下稳定工作,还需要时间验证;车企造人能否复制造车时代的规模效应,也还是未知数。AGI的口号可以喊,但拧螺丝的活,一步都省不了。
小结
大模型下海,车企造人,看似热闹得像一场叙事炒作,底层其实是三块拼图的同时就位:Astra给了智能一双操作数字世界的「手」,Atlas给了机器一双看懂物理世界的「眼」,车企给了这一切一副能大规模量产的「身体」。三条线合流之处,就是具身智能从融资故事走向收入报表的分水岭。2026年的夏天可能不会被称为「AGI元年」,但很可能会被记住:智能第一次真正开始长出腿来。接下来该盯的指标很朴素——谁先在交付报表上,而不是发布会PPT上,证明这件事。