点击率最多减少93%的“毁灭循环”生成AI将消灭新闻的日子

点击率最多减少93%的“毁灭循环”生成AI将消灭新闻的日子

当向生成AI提问时,几秒钟内就会得到一个整齐的答案。在其背后,是记者的采访,编辑的审核,摄影师、研究人员、作家、程序员等积累的大量工作。

那么,如果在

中,未经许可收集这些工作来训练AI,而完成的AI又剥夺了原作者的访问权,这算是“学习”还是“盗窃”?

美国《纽约时报》等新闻机构对OpenAI和Microsoft提起的版权诉讼中,原告方的部分简易判决申请书在2026年9月17日被公开。文件中记载的不是外部批评者,而是AI开发内部人员的严厉言辞。

据称,Microsoft应用科学部门的主管布伦特·赫克特在内部文件中将大规模模型吸收全球人类成果的行为描述为史无前例的盗窃,甚至可能是“人类历史上最大的劳动盗窃”。OpenAI负责ChatGPT的尼克·特利也认为,像聊天机器人这样的产品对出版商构成“生存威胁”,并已成为现有服务的替代品。

这些是强烈的言辞。然而,这里首先需要注意的是,此次公开的文件主要是新闻机构引用证据构建的诉讼主张。引用的部分证据资料仍被封存,外部无法完全验证发言的前后关系。因此,这些不是法院认定的确定事实,而应作为原告方的主张及其引用的内部发言来阅读。

即便如此,此次披露的重要性在于,它表明AI企业内外可能存在完全不同的问题意识。


争议的焦点不仅仅是“是否复制”

OpenAI和Microsoft一直主张,将作品用于AI学习的行为不是直接销售原始文章,而是创造新功能的“变革性使用”,符合美国版权法的合理使用。

然而,在合理使用的判断中,不仅重视使用目的和作品性质、使用量,还重视是否侵蚀原作品的市场。在这里,内部发言具有重要性。

根据原告方文件,特利关于AI产品的发言指出,它已经成为新闻的替代品,性能越高,替代性越强。Microsoft的CEO萨提亚·纳德拉在宣誓证词中也承认,用户无需访问原网站即可在AI界面上直接获取信息,聊天机器人在某种意义上替代了网站。

Microsoft向路透社解释称,纳德拉的发言是关于信息搜索和消费方式变化的广泛原则,并非对版权问题的结论。此外,关于赫克特的表述,Microsoft称其为一名员工的个人见解,而非法律分析或公司立场。

也就是说,严厉的内部表述并不立即构成对违法性的自白。而对于原告方来说,这成为被告企业自身预见到“替代”和“市场损害”的证据。诉讼的焦点正在从学习产生新技术的事实转向成品在多大程度上取代了原报道。


高达93%的减少——从“搜索”到“回答”的转变

最具体的数字是点击率的变化。

原告方文件引用了Microsoft的数据,声称在Copilot的回答型搜索中,与传统的Bing搜索相比,纽约时报系网站的点击率下降了87%到93%,Daily News系下降了83%到91%,Ziff Davis系下降了51%到94%。

传统的搜索引擎是将用户引导至信息源的入口。搜索结果中排列着标题和简短描述,想了解更多的人会点击链接。网站通过这些访问获得广告收入或订阅合同。

而回答型AI则读取多个信息源,重新组织成用户想要的形式,并在现场提供结论。其便利之处在于“不需要跟随链接”。AI服务的长处对信息源来说则意味着收入机会的消失。

Microsoft的内部资料据称将这种结构视为“毁灭循环”。AI利用文章,用户不再访问原网站,出版商收入减少,无法投资于采访和编辑。优质的新信息减少,最终AI可参考的高可信度信息也会枯竭。

这不仅是AI与媒体之间的行业争端。支撑AI性能的“知识供应链”正在削弱其上游。今天的AI看起来聪明,是因为人类至今公开的信息丰富。明天是否还能产生同样质量的信息,没有任何保证。


数百万篇文章和两个联合项目

原告方还展示了关于复制规模的新数据。

根据公开文件,OpenAI的中间学习数据集中包含了超过91,692件原告方的作品,来自Common Crawl的数据集中存在超过206万件nytimes.com的文档。据称,Microsoft向OpenAI提供Bing索引数据的项目被称为“Project Taxi”,两家公司共同收集网页文档的项目被称为“Project Mango”,Mango来源的学习数据中至少包含了169,903件原告方的作品。

此外,还引用了OpenAI研究人员在传授绕过纽约时报付费墙的方法时,联合创始人格雷格·布洛克曼的积极回应记录。还有主张称从学习数据中系统性地去除了版权标识。

据称,纳德拉证言表示,如果使用付费墙内的信息进行学习或作为回答依据,则需要许可证,如果知道OpenAI使用了付费文章进行学习,他会利用合同权利要求重新学习。

这里混杂着多个论点。学习公开网页上的文章、违反使用条款或robots.txt进行收集、绕过付费文章的壁垒、将有许可证条件的数据集用于商业学习,以及在回答时再现文章表达,这些在法律上和伦理上并不是同一个问题。

“AI学习都是盗窃”或“学习与人类阅读相同,因此都被允许”这样的二选一无法抓住此事件的核心。需要逐步审视获取了哪些数据、如何获取、用于何处、对原市场产生了怎样的影响。


在社交媒体上爆发的愤怒和对简单化的警惕

此次报道在社交媒体上迅速传播。在X平台上,数字媒体行业协会的代表杰森·金特称,解除黑条的文件内容“令人瞩目”,并指出企业方的人物几乎为原告写了标题。反对生成AI未经授权学习的Ed Newton-Rex也批评称,内部发言与AI企业的抗辩正面冲突。

 

在Reddit的技术社区中,“是否会从Copilot中移除被盗数据”、“AI是由大家的工作构成的,因此利润也应回馈社会”、“大企业的大规模未经授权使用与个人的盗窃被区别对待得太多”等愤怒之声尤为显著。还有质疑AI企业一方面保护自家产品的知识产权,另一方面对学习数据主张广泛合理使用的双重标准。

另一方面,也有反对认为“人类历史上最大”的表述夸大其词,不应与奴隶制等历史上的强制劳动相提并论。此外,现代版权制度本身阻碍了知识共享,将学习与复制视为同一会抑制开源和研究活动的意见也得到确认。

这些是部分社区的代表性反应,并非民意调查。即便如此,讨论的轴心是显而易见的。人们愤怒的不仅仅是文章可能被复制的可能性。更是因为无数人的工作被用作原料创造巨大价值,而这些利益和决策权集中于少数企业。


对日本来说也不是隔岸观火

日本的出版社、报社、创作者、网站运营者也面临同样的问题。

高质量的日语学习数据比英语圈少。因此,经过精心采访和编辑的日语文章和专家解说具有高价值。如果AI搜索普及,网站流量大幅减少,不仅是大企业,地方媒体、专业媒体、个人运营网站可能会首先受到打击。

另一方面,生成AI为小型企业和个人提供了强大的生产手段。翻译、摘要、调查辅助、编程、影像和音乐制作等,其便利性无需否定。重要的不是停止或推进AI,而是在知识创造者和提供AI的企业之间,如何分配对价和选择权。

可考虑的机制包括明确的学习和搜索使用许可证、根据使用量进行分配、设计促使实际访问引用来源、学习数据透明性、拒绝手段的有效性、保持版权标识和出处信息等。如果逐篇合同不现实,可以考虑音乐版权的集中管理或跨行业的标准合同。

但如果许可证制度仅对大企业有利,小媒体和个人创作者将再次被抛在后面。如果过度限制开放知识和非营利研究,将损害创新和表达自由。需要的是将未经授权的大量获取与公共研究、替代原作品的商业服务与引用、批评仔细区分的制度设计。


被问及的不是AI的未来,而是“人类能否继续创造的未来”

此诉讼的结论尚未得出。法院如何判断合理使用,内部发言会被重视到何种程度也尚不清楚。美国政府已提交意见书,支持OpenAI,认为AI学习极具变革性,政策论也重视产业竞争力和市场准入。

即便如此,“人类历史上最大的劳动窃取”这一说法之所以引起关注,原因显而易见。它将围绕生成AI的讨论从数据和版权这些抽象词汇,拉回到那些创造数据的人类的时间和劳动。

AI并不是凭空创造文章。记者去现场,研究人员做实验,作家推敲,开发者编写代码,无数人在网上分享知识。用这些积累制作的工具如果夺走了原工作的收入来源,仅凭便利性无法称为可持续。

真正被问及的不是AI能变得多聪明。即使AI普及后,人类能否继续创造新的知识、报道、文化的社会能否保留下来。



出处URL

※公开文件的描述是原告方的主张,引用的部分证据资料目前仍未公开。被告方的违法性尚未通过司法判断确定。