产品The Verge AI·原文 2026年9月5日

微软提交新证据:Copilot聊天记录中仅少量与新闻作品大幅重合

在应对《纽约时报》和图书作者版权诉讼时,微软提交的法庭文件显示,数百万条Copilot对话中极少出现与新闻作品或书籍的大段重叠。

AI解读:微软正面临来自《纽约时报》、图书作者和调查报道中心的版权诉讼,原告称其AI产品直接复制了受版权保护的内容并与之竞争。微软在最新法庭文件中用数据反驳:在提交的 820 万条Copilot聊天记录中,只有 59,545 条与新闻内容有至少 16 个词的重合,作者诉讼方的专家仅在 212 本书中找到 10 本有匹配。这些数字表明,能被聊天机器人原样输出的内容非常少。对普通读者来说,这意味着AI工具不太可能成为新闻或书籍的替代品;对内容创作者和科技公司,这场官司的结果将决定依赖版权材料训练和运行AI模型是否算合理使用。微软主张,即使少数输出构成复制,也不影响其“转换性使用”的辩护,但《纽约时报》等原告坚持认为这些产品本质上在“窃取”并替代其新闻业。目前案件尚在早期阶段,法官若支持微软的即决判决动议,诉讼会提前结束,否则进入正式庭审。

微软在周五提交的新法庭文件中表示,其Copilot聊天机器人极少逐句复现新闻文章或书籍,更不用说能替代原文的实质性段落。这些文件是微软反击《纽约时报》、图书作者及调查报道中心(Center for Investigative Reporting)版权诉讼的一部分。

在诉讼的证据开示阶段,微软向新闻出版商聘请的专家提供了 820 万条Copilot聊天日志。微软称这些日志是特意挑选的,因为它们“包含了涉及新闻原告网站使用的关键词,因此最有可能包含新闻原告的作品”。分析结果显示,其中 59,545 条日志包含至少 16 个词与用于训练AI模型的新闻内容重合。

具体数据与专家结论

微软称,调查报道中心聘请的专家在数据集中发现了 51 处与该中心作品“大幅重叠”的实例。在作者诉讼中,专家发现,820 万次与Copilot的对话中只有 24 条回复包含至少 30 个匹配词;在接受评估的 212 本书中,仅有 10 本出现任何匹配。

微软认为这些数字支持其立场:将受版权保护的内容用于AI训练数据集应被视为合理使用。尽管Copilot等系统依赖受版权保护的材料,但其用途与原始作品有显著不同。微软总结道,系统偶尔复现文本片段“几乎不削弱LLM训练的转换性目的”。

原告反驳与案件进展

《纽约时报》对微软的结论提出异议。该报首席律师伊恩·克罗斯比(Ian Crosby)在声明中表示:“证据开示中发现的文件和证词只指向一个结论:微软和OpenAI窃取了《纽约时报》的内容,以制造取代其新闻业的商业产品,威胁其业务并损害整个行业。我们期待微软和OpenAI为他们的盗窃行为承担责任。”调查报道中心和作者协会(Authors Guild)未立即回应置评请求。

这些文件是出版商和作者针对微软和OpenAI提起的诉讼的一部分。原告称,被告的产品建立在他们的作品之上,部分通过复制受版权保护的内容直接与他们竞争。新闻出版商和图书作者的诉讼已被合并到一名法官名下审理,尽管原告曾表示反对。微软于周五提交文件,寻求法官作出即决判决,以便在早期阶段结束案件。特朗普政府本周也在《纽约时报》案中提交了利益声明,支持OpenAI。如果法官支持出版商和作者,法律战将继续在法庭进行。

查看原图 · 1200 × 624
查看原图 · 2040 × 1360
查看原图 · 2040 × 1360
查看原图 · 1346 × 1360
查看原图 · 2040 × 1360

信息来源

The Verge AI原始来源