训练AI算偷吗?美国司法部掀桌了
纽约时报诉OpenAI案胶着之际,美国司法部提交《美国利益陈述书》,用三段论给大模型训练端解套;同期中国最高法发布24条涉AI审判意见,黄仁勋则宣告AGI到来并预告40万张GPU上线。版权、监管、算力三线并进,正在重塑AI产业的底层规则。
训练AI算偷吗?美国司法部掀桌了
OpenAI在法庭上节节败退之际,美国司法部突然下场递刀。
一边是纽约时报诉OpenAI案白热化,OpenAI因对法院误导性陈述、隐匿输出日志而处境恶化;另一边,美国司法部向纽约南区联邦地区法院提交《美国利益陈述书》,直接主张大语言模型训练阶段使用作品构成合理使用。同一时间窗口内,最高人民法院发布涉AI审判意见,黄仁勋高调宣告AGI已到来、40万张GPU即将上线。
版权、监管、算力,三条线同时收紧又同时松绑。对AI产业来说,这几天的信息密度,比过去一个季度都高。
⚖️ 三段论:司法部拆掉了原告的逻辑地基
版权诉讼的经典套路,是把抓数据和吐内容绑在一起打。
纽约时报在诉状里展示了ChatGPT能复述、甚至逐字吐出其文章,潜台词很直白:训练用的是赃物,产出的也是赃物,训练的目的就是为了实质性替代版权人的作品。这个叙事在法庭上很有杀伤力,尤其当OpenAI自己还因为隐匿关键证据失分之后。
美国司法部的打法是釜底抽薪——把AI运作系统拆成三个环节,逐一审视。
第一步,训练数据获取。司法部认为,这一阶段的数据使用是纯粹的技术行为——模型不是在阅读文章,而是在学习语言的统计规律,通过统计学习提取抽象知识。这和传统的复制粘贴式侵权完全不同,更接近人类读万卷书后形成自己的知识体系。
第二步,模型训练。司法部强调这一阶段的数据使用具有高度转换性:原始数据被转化为全新的、具有独立价值的模型能力。转换性使用正是美国版权法合理使用判断的关键,司法部援引了最高法院和第二巡回法院关于Google扫描图书、软件代码的判例——当版权作品服务于全新技术目的时,哪怕完整复制,也可能构成合理使用。
第三步,模型输出。这是最狠的一刀:即便输出偶尔与原作高度相似甚至构成侵权,也不影响训练阶段的合法性。输出端风险和训练端合理使用,是两个独立的法律问题。
这套三段论,本质上是在为AI企业修一道法律防火墙:训练阶段被孤立出来单独评价,输出端再大的争议,也倒灌不回训练端。据多位接近人士观察,这份陈述书的时机选择极为讲究——恰好卡在OpenAI证据问题发酵、案情转向的节点上。
📉 市场稀释理论,被重点点名驳斥
合理使用不是万能钥匙,它有一条硬约束:不能不合理地损害原作者利益。
这正是版权方在2025年Kadrey诉Meta案中主攻的方向——所谓市场稀释理论:即便AI生成的文章、图片、音乐没有复制某一篇具体作品,海量AI内容涌入市场,也会稀释人类创作者作品的市场价值。这个理论一旦成立,训练端即便洗脱复制嫌疑,也难逃市场损害的指控。
司法部在陈述书中重点驳斥了这一理论。逻辑不复杂:如果稀释本身就算损害,那任何与人类创作竞争的技术产品都可以被追责,合理使用制度将形同虚设。
把这几条战线放在一张表里看,脉络更清晰:
| 案件/事件 | 争议焦点 | 关键立场 |
|---|---|---|
| 纽约时报诉OpenAI | 训练数据未经许可,输出复述原文 | OpenAI因证据问题处境不利 |
| Kadrey诉Meta案 | 市场稀释理论 | 法官讨论即便未复制具体作品的影响 |
| 美国司法部陈述书 | 训练是否构成合理使用 | 三段论拆解,训练端构成转换性使用 |
| 最高法涉AI意见 | AI换脸拟声、幻觉、开盒等 | 明确实体裁判与诉讼程序规则 |
产业逻辑上看,司法部这一手对OpenAI、Anthropic、Google、Meta们是集体利好——训练数据的版权原罪一旦在判例层面被摘除,头部模型公司的最大法律悬顶之剑就卸了一半。而对版权方来说,战场将不得不从训练端转向输出端,举证难度陡增。
📜 同一周,中国也出了牌,但打法完全不同
大洋两岸,几乎同步出牌,落点却不在一个位置。
9月7日,最高人民法院发布关于依法审理涉人工智能纠纷案件的意见,共5个部分24条,聚焦的是应用端与社会治理端的问题:
- AI换脸拟声:针对深度伪造侵权明确裁判规则
- AI幻觉侵权:生成内容致损的责任认定
- 网络开盒、大数据杀熟:数字时代民事权益保障
- 自动驾驶、AI模型训练、开源软件、知识产权保护:全链条覆盖
注意这个差异:美国司法部解决的是训练端能不能用数据,中国最高法解决的是应用端出了事怎么判。一个松绑上游,一个规范下游。
把近期事件串成一条时间线,能看到两套规则体系在并行推进:
- 纽约时报案进入白热化,OpenAI因隐匿输出日志陷于不利
- 近日,美国司法部提交《美国利益陈述书》,主张训练构成合理使用
- 2025年,Kadrey诉Meta案判决触及市场稀释理论
- 9月7日,最高人民法院发布涉AI审判意见,5部分24条
- 上周四,OpenAI发布Astra,Brockman宣布欢迎来到AGI时代
- 周日,黄仁勋发文称AGI已到来,预告40万张GPU即将上线
- 8月,英伟达公布季度营收962亿美元
对从业者而言,这意味着合规地图要分两半画:做海外模型和产品,盯紧合理使用判例走向;做国内落地,把换脸拟声、幻觉致损、数据合规这些应用端红线先划清楚。两条线迟早会交汇——训练端的宽严,最终会倒逼应用端的责任分配。
🚀 AGI宣告的背后,是一笔算力生意
版权战打得难解难分,叙事战已经开打了。
OpenAI上周四发布Astra,定位为世界上最智能、最符合人类价值观的模型,总裁Greg Brockman在发布会上直接宣布:欢迎来到AGI时代。周日,黄仁勋在X平台跟进,宣告AGI正式开启,并透露Astra基于约10万张以上英伟达Grace Blackwell NVLink72芯片训练,随后抛出关键一句:40万张GPU即将上线。
反对的声音同样响亮。知名AI研究者Gary Marcus直言黄仁勋操之过急:没有证据也没有定义,是以企业意志强行占据一个科学问题。他列出的10项AGI定义标准,Astra仅满足其中一至两项。耐人寻味的是,连OpenAI CEOSam Altman本人都相当审慎,称AGI是个定义极为模糊的词,更像一个无关紧要的营销术语。
但看财务报表就明白这场叙事的真实功能。OpenAI在今年3月的融资公告中把英伟达称为我们基础设施的基石,表示训练集群和大部分推理栈持续运行在英伟达GPU之上。英伟达8月公布的季度营收达962亿美元,数据中心业务是核心增长引擎。40万张GPU的预告,意味着头部客户订单仍在扩张。
一个定义模糊的词,撑起了最确定的一门生意。AGI宣告更像是算力供给方的订单信号弹:模型越强,需要的卡越多;卡越多,就越要说服世界模型真的在变强。
🤖 对机器人行业,这三件事意味着什么
别以为这是纯软件圈的瓜,具身智能会全盘承接这三个变量。
第一个变量是数据确权。司法部的三段论如果被法院采纳,视频、图文等人类数据用于训练的版权风险将系统性下降,这对靠互联网视频预训练的VLA模型是直接利好。机器人公司最贵的就是数据,遥操作数据、仿真数据的产权界定,大概率会参照大模型的判例逻辑演进。
第二个变量是算力锁定。40万张GPU上线,意味着多模态和具身基础模型的训练门槛继续被英伟达定价。国内机器人公司要么走端侧小模型加场景数据的差异化路线,要么就得提前锁卡锁产能——962亿美元季度营收的背后,是整个行业对单一供应商的结构性依赖。
第三个变量是责任规则。最高法意见把自动驾驶单独列为裁判规则对象,这是具身智能落地中国场景的先手布局。机器人走进工厂、走上道路,出事故谁担责,比模型跑分重要得多。
结语
一周之内,训练端松绑、应用端立规、算力端放卫星,三条线勾勒出AI产业规则重构的完整切面。
版权原罪能不能真正洗掉,还要看纽约南区法院是否采纳司法部的三段论;中国的24条意见如何落地,要看第一批判例的尺度。可以确定的是:数据、算力、规则,这三样正在从讨论题变成定价题。对机器人从业者来说,别只盯看模型发布会——谁先把合规地图和算力账本算清楚,谁才拿得到下一轮牌桌的入场券。