一场持续近三年的版权诉讼,正在把微软和OpenAI内部曾经讨论却没有公开展示给外界的另一面摆到法庭上。
2026年9月,美国纽约联邦法院正在审理新闻出版机构针对OpenAI和微软提起的版权诉讼。随着部分此前被遮蔽的诉讼材料解除保密,微软应用科学主管Brent Hecht在内部文件中的一句话成为案件最受关注的内容之一:大规模语言模型把全世界创作者的劳动成果“吸走”,可能会被数百万人视为“一场规模空前、令人震惊的盗窃”,甚至可能是“人类历史上最大规模的劳动盗窃”。
这句话来自微软内部人员,而不是起诉微软和OpenAI的律师创造出来的指控。微软随后回应称,Hecht的说法只是“一名员工的个人观点”,不是法律分析,也不代表微软公司的立场。微软继续坚持,在人工智能模型训练中使用受版权保护的内容属于美国版权法允许的合理使用范围。
但此次解封的材料远不止这一句话。
Hecht在2023年的内部材料中写道,世界各地数以百万计的人最终可能发现,自己创作的文章、图片和其他内容被大型模型大规模吸收,他们当初创作这些内容时并没有打算把作品用于这种用途,也没有因为这种使用得到报酬。微软另一份内部政策材料则警告,生成式人工智能可能严重冲击那些生产训练数据的人所从事的工作。Hecht甚至把大型语言模型描述为一种可能“摧毁自己供应链”的产品。
这种供应链非常简单:记者采访和写作,摄影师拍摄照片,作家写书,程序员编写代码,研究人员发表论文,无数网站和出版机构投入资金生产内容;人工智能公司再利用这些内容训练模型。模型能力越来越强以后,越来越多用户直接从ChatGPT、Copilot等人工智能产品获取答案,不再进入原来生产这些内容的网站。
微软内部把这种局面称为“doom loop”,也就是一种恶性循环。微软自己的分析担心,人工智能产品减少原始网站获得的流量和收入,内容生产机构随之失去继续投入记者、编辑和创作者的经济基础,互联网能够持续生产的高质量内容减少,最终反过来影响下一代人工智能模型能够获得的数据质量。
OpenAI内部文件同样出现了对这种关系的直接描述。
负责ChatGPT业务的OpenAI高管Nick Turley曾在内部材料中把人工智能产品对出版商造成的压力称为“生存威胁”,并写道,这些产品在很大程度上正在取代原来的内容,而且随着人工智能能力提高,这种替代程度还会继续增加。OpenAI一名工程师早在2023年就曾对同事表示,无论把原始文章链接放得多么显眼,用户也不会点击。
OpenAI总裁、联合创始人Greg Brockman的内部信息则进一步触及新闻内容本身。解封材料显示,他曾表示OpenAI模型非常擅长处理新闻内容,并测试过让模型从《纽约时报》文章中间继续生成后续文字。诉讼文件还显示,一名OpenAI研究人员向Brockman提到发现了一种绕过《纽约时报》付费墙的方法时,Brockman回复“ah nice”。这些内容目前属于原告提交给法院、用来支持版权侵权主张的证据,法院尚未据此认定OpenAI实施了版权侵权。
新闻机构提交的文件还披露了人工智能训练数据的规模。诉讼材料称,一个来自Common Crawl的数据集中包含超过200万份来自nytimes.com的文档;OpenAI部分训练数据中还包含大量涉案新闻机构的作品。原告同时指称,微软曾通过包括Project Taxi和Project Mango在内的项目向OpenAI提供数据,OpenAI则曾把GPT-3训练数据交给微软用于评估和产品开发。Project Mango形成的数据集中,据原告文件称至少包括160,903件来自涉案新闻出版机构的独立作品。
这场诉讼真正触及的核心已经超过了几篇新闻文章有没有被复制。
现代大型人工智能模型需要极其庞大的数据。互联网过去二三十年积累的新闻、文学、代码、摄影、百科知识和个人创作,为第一代大规模生成式人工智能提供了近乎现成的知识基础。训练这些模型的公司可以把计算能力、算法、工程人才和巨额资本计入自己的投入,但训练数据中包含的数十亿人多年来投入的劳动究竟应该如何计算价值,至今没有形成统一规则。
OpenAI和微软的法律立场是,模型并不是简单建立一个新闻文章复制数据库,而是利用大量材料学习语言结构和知识关系,再生成新的内容,因此属于具有转化性质的使用。两家公司在纽约联邦法院主张,这种训练行为受到美国版权法“合理使用”原则保护,而且人工智能生成的内容不能简单等同于被训练作品的复制品。美国政府在9月提交给法院的意见中也支持人工智能训练具有高度转化性的观点。
新闻机构则从完全不同的经济关系提出挑战:如果一家企业可以不经过授权吸收数百万篇付费生产的作品,再利用这些作品训练一个能够回答同类问题、概括新闻甚至替代用户阅读原文的商业产品,那么原作品的市场价值和生产者收入可能直接受到影响。合理使用制度中的一个重要判断因素,正是新的使用方式是否会损害原作品的潜在市场。
微软首席执行官萨提亚·纳德拉在证词中承认,聊天机器人正在改变用户获取信息的方法,用户可以直接在AI平台上得到信息,不必再进入原始网站。对于付费墙内容,纳德拉还表示,任何希望把这类内容用于模型训练或信息检索的机构都应该取得许可。微软强调,这些表态讨论的是互联网信息消费方式的变化,并不构成对本案版权问题的法律结论。
这也让微软内部的“最大规模劳动盗窃”说法具有了超出一句内部抱怨的意义。争议已经逐渐集中到生成式人工智能产业最基础的一笔经济账:创造内容的人承担采访、研究、写作、拍摄、出版和维护成本,人工智能公司利用这些内容建立模型,再把模型变成订阅服务、企业软件和云计算业务。如果原内容生产者得不到足够回报,人工智能赖以成长的数据来源本身可能萎缩。
这种矛盾已经开始改变行业。越来越多出版机构选择与人工智能公司签署内容授权协议,让自己的文章进入模型训练或实时搜索系统;另一些出版机构、作家、艺术家和版权持有人则选择诉讼,希望法院划定未经许可训练人工智能的边界。
《纽约时报》与OpenAI、微软之间的案件因此成为美国人工智能版权体系中最重要的案件之一。原告正在寻求简易判决,OpenAI和微软也要求法院接受其合理使用等抗辩。美国纽约南区联邦地区法院法官Sidney H. Stein仍在审理相关申请,截至2026年9月21日,法院尚未作出最终版权责任判决。
人工智能已经把互联网上几十年来积累的人类知识变成可以被即时调用的模型能力。现在进入法院的问题,是这些知识在进入模型之前究竟属于可以自由学习的公共信息,还是包含着必须获得许可和支付成本的劳动成果,以及一家科技公司能否把数百万人的作品转化为自己的核心商业资产而无需逐一获得授权。
微软自己的内部文件已经记录下这种矛盾最尖锐的一种表达——当模型把整个互联网长期积累的劳动一次性吸收进训练系统时,连参与建设这个产业的人,也曾经用“人类历史上最大规模的劳动盗窃”来形容他们看到的风险。

读者评论
0 条评论