政策标准海外动态产业观察评论分析· 3681· 约7分钟阅读

训练AI算偷吗?美国司法部掀桌了

A
AI编辑团队AI 原创内容
2026-09-08 05:29 发布· 本文由作者与AI协作完成
本内容由人工智能生成,仅供研究参考,不构成投资建议。
💡

纽约时报诉OpenAI案胶着之际,美国司法部提交《美国利益陈述书》,用三段论给大模型训练端解套;同期中国最高法发布24条涉AI审判意见,黄仁勋则宣告AGI到来并预告40万张GPU上线。版权、监管、算力三线并进,正在重塑AI产业的底层规则。

训练AI算偷吗?美国司法部掀桌了

OpenAI在法庭上节节败退之际,美国司法部突然下场递刀。

一边是纽约时报诉OpenAI案白热化,OpenAI因对法院误导性陈述、隐匿输出日志而处境恶化;另一边,美国司法部向纽约南区联邦地区法院提交《美国利益陈述书》,直接主张大语言模型训练阶段使用作品构成合理使用。同一时间窗口内,最高人民法院发布涉AI审判意见,黄仁勋高调宣告AGI已到来、40万张GPU即将上线。

版权、监管、算力,三条线同时收紧又同时松绑。对AI产业来说,这几天的信息密度,比过去一个季度都高。

⚖️ 三段论:司法部拆掉了原告的逻辑地基

版权诉讼的经典套路,是把抓数据和吐内容绑在一起打。

纽约时报在诉状里展示了ChatGPT能复述、甚至逐字吐出其文章,潜台词很直白:训练用的是赃物,产出的也是赃物,训练的目的就是为了实质性替代版权人的作品。这个叙事在法庭上很有杀伤力,尤其当OpenAI自己还因为隐匿关键证据失分之后。

美国司法部的打法是釜底抽薪——把AI运作系统拆成三个环节,逐一审视。

第一步,训练数据获取。司法部认为,这一阶段的数据使用是纯粹的技术行为——模型不是在阅读文章,而是在学习语言的统计规律,通过统计学习提取抽象知识。这和传统的复制粘贴式侵权完全不同,更接近人类读万卷书后形成自己的知识体系。

第二步,模型训练。司法部强调这一阶段的数据使用具有高度转换性:原始数据被转化为全新的、具有独立价值的模型能力。转换性使用正是美国版权法合理使用判断的关键,司法部援引了最高法院和第二巡回法院关于Google扫描图书、软件代码的判例——当版权作品服务于全新技术目的时,哪怕完整复制,也可能构成合理使用。

第三步,模型输出。这是最狠的一刀:即便输出偶尔与原作高度相似甚至构成侵权,也不影响训练阶段的合法性。输出端风险和训练端合理使用,是两个独立的法律问题。

这套三段论,本质上是在为AI企业修一道法律防火墙:训练阶段被孤立出来单独评价,输出端再大的争议,也倒灌不回训练端。据多位接近人士观察,这份陈述书的时机选择极为讲究——恰好卡在OpenAI证据问题发酵、案情转向的节点上。

📉 市场稀释理论,被重点点名驳斥

合理使用不是万能钥匙,它有一条硬约束:不能不合理地损害原作者利益。

这正是版权方在2025年Kadrey诉Meta案中主攻的方向——所谓市场稀释理论:即便AI生成的文章、图片、音乐没有复制某一篇具体作品,海量AI内容涌入市场,也会稀释人类创作者作品的市场价值。这个理论一旦成立,训练端即便洗脱复制嫌疑,也难逃市场损害的指控。

司法部在陈述书中重点驳斥了这一理论。逻辑不复杂:如果稀释本身就算损害,那任何与人类创作竞争的技术产品都可以被追责,合理使用制度将形同虚设。

把这几条战线放在一张表里看,脉络更清晰:

案件/事件争议焦点关键立场
纽约时报诉OpenAI训练数据未经许可,输出复述原文OpenAI因证据问题处境不利
Kadrey诉Meta案市场稀释理论法官讨论即便未复制具体作品的影响
美国司法部陈述书训练是否构成合理使用三段论拆解,训练端构成转换性使用
最高法涉AI意见AI换脸拟声、幻觉、开盒等明确实体裁判与诉讼程序规则

产业逻辑上看,司法部这一手对OpenAIAnthropicGoogleMeta们是集体利好——训练数据的版权原罪一旦在判例层面被摘除,头部模型公司的最大法律悬顶之剑就卸了一半。而对版权方来说,战场将不得不从训练端转向输出端,举证难度陡增。

📜 同一周,中国也出了牌,但打法完全不同

大洋两岸,几乎同步出牌,落点却不在一个位置。

9月7日,最高人民法院发布关于依法审理涉人工智能纠纷案件的意见,共5个部分24条,聚焦的是应用端与社会治理端的问题:

  • AI换脸拟声:针对深度伪造侵权明确裁判规则
  • AI幻觉侵权:生成内容致损的责任认定
  • 网络开盒大数据杀熟:数字时代民事权益保障
  • 自动驾驶AI模型训练开源软件、知识产权保护:全链条覆盖

注意这个差异:美国司法部解决的是训练端能不能用数据,中国最高法解决的是应用端出了事怎么判。一个松绑上游,一个规范下游。

把近期事件串成一条时间线,能看到两套规则体系在并行推进:

  • 纽约时报案进入白热化,OpenAI因隐匿输出日志陷于不利
  • 近日,美国司法部提交《美国利益陈述书》,主张训练构成合理使用
  • 2025年,Kadrey诉Meta案判决触及市场稀释理论
  • 9月7日,最高人民法院发布涉AI审判意见,5部分24条
  • 上周四,OpenAI发布Astra,Brockman宣布欢迎来到AGI时代
  • 周日,黄仁勋发文称AGI已到来,预告40万张GPU即将上线
  • 8月,英伟达公布季度营收962亿美元

对从业者而言,这意味着合规地图要分两半画:做海外模型和产品,盯紧合理使用判例走向;做国内落地,把换脸拟声、幻觉致损、数据合规这些应用端红线先划清楚。两条线迟早会交汇——训练端的宽严,最终会倒逼应用端的责任分配。

🚀 AGI宣告的背后,是一笔算力生意

版权战打得难解难分,叙事战已经开打了。

OpenAI上周四发布Astra,定位为世界上最智能、最符合人类价值观的模型,总裁Greg Brockman在发布会上直接宣布:欢迎来到AGI时代。周日,黄仁勋在X平台跟进,宣告AGI正式开启,并透露Astra基于约10万张以上英伟达Grace Blackwell NVLink72芯片训练,随后抛出关键一句:40万张GPU即将上线。

反对的声音同样响亮。知名AI研究者Gary Marcus直言黄仁勋操之过急:没有证据也没有定义,是以企业意志强行占据一个科学问题。他列出的10项AGI定义标准,Astra仅满足其中一至两项。耐人寻味的是,连OpenAI CEOSam Altman本人都相当审慎,称AGI是个定义极为模糊的词,更像一个无关紧要的营销术语。

但看财务报表就明白这场叙事的真实功能。OpenAI在今年3月的融资公告中把英伟达称为我们基础设施的基石,表示训练集群和大部分推理栈持续运行在英伟达GPU之上。英伟达8月公布的季度营收达962亿美元,数据中心业务是核心增长引擎。40万张GPU的预告,意味着头部客户订单仍在扩张。

一个定义模糊的词,撑起了最确定的一门生意。AGI宣告更像是算力供给方的订单信号弹:模型越强,需要的卡越多;卡越多,就越要说服世界模型真的在变强。

🤖 对机器人行业,这三件事意味着什么

别以为这是纯软件圈的瓜,具身智能会全盘承接这三个变量。

第一个变量是数据确权。司法部的三段论如果被法院采纳,视频、图文等人类数据用于训练的版权风险将系统性下降,这对靠互联网视频预训练的VLA模型是直接利好。机器人公司最贵的就是数据,遥操作数据、仿真数据的产权界定,大概率会参照大模型的判例逻辑演进。

第二个变量是算力锁定。40万张GPU上线,意味着多模态和具身基础模型的训练门槛继续被英伟达定价。国内机器人公司要么走端侧小模型加场景数据的差异化路线,要么就得提前锁卡锁产能——962亿美元季度营收的背后,是整个行业对单一供应商的结构性依赖。

第三个变量是责任规则。最高法意见把自动驾驶单独列为裁判规则对象,这是具身智能落地中国场景的先手布局。机器人走进工厂、走上道路,出事故谁担责,比模型跑分重要得多。

结语

一周之内,训练端松绑、应用端立规、算力端放卫星,三条线勾勒出AI产业规则重构的完整切面。

版权原罪能不能真正洗掉,还要看纽约南区法院是否采纳司法部的三段论;中国的24条意见如何落地,要看第一批判例的尺度。可以确定的是:数据、算力、规则,这三样正在从讨论题变成定价题。对机器人从业者来说,别只盯看模型发布会——谁先把合规地图和算力账本算清楚,谁才拿得到下一轮牌桌的入场券。