《西雅图时报》与《新闻日报》9月4日向纽约南区联邦地区法院起诉OpenAI和微软,指控后者抓取网站内容包括付费墙后的专属报道,用于训练ChatGPT、Copilot及必应AI。 起诉书显示这些文章被直接整合进训练数据集,AI产品不仅能完整复现原文段落,还能进行高度雷同改写并提供综合答案,削弱读者访问原网站或付费订阅的必要。OpenAI称模型基于公开数据符合合理使用,微软表示愿意沟通。

两家地方媒体将诉讼提交至纽约南区联邦法院

9月4日,《西雅图时报》和《新闻日报》正式提起诉讼。被告为OpenAI和微软,两家媒体选择在美国纽约南区联邦地区法院提交起诉书。这一法院管辖范围覆盖纽约市核心区域,常处理涉及科技公司的大型知识产权案件。

原告均为美国地方性报纸。《西雅图时报》总部位于华盛顿州西雅图,主要服务当地读者;《新闻日报》则聚焦纽约长岛地区新闻。两家媒体规模不算全国性大报,却长期投入原创报道,尤其在地方政务、社区事件和调查性新闻上花费资源。

诉讼选择纽约南区联邦法院并非随意。OpenAI总部位于旧金山,但其业务遍布全美,且纽约作为媒体和金融中心,法院在此处理过多起类似科技与内容产业的纠纷。微软总部虽在华盛顿州雷德蒙德,但其纽约办公室及必应AI产品与纽约媒体有直接关联,这为管辖权提供了依据。

这一起诉时间点值得注意。9月4日正值美国劳动节后首个工作日,显示原告已准备多时。路透社迅速报道,表明事件已进入公开法律程序。目前案件处于初期阶段,尚未进入证据开示或庭审,双方后续动作仍待观察。

这一选择也反映出美国地方媒体面对AI巨头的普遍困境。全国性大报如《纽约时报》早已单独起诉OpenAI,而两家地方媒体的加入,说明侵权指控正从头部媒体扩散到区域性内容生产者。纽约南区联邦法院将成为检验这些指控的关键场所。

(本节约420字)

抓取行为覆盖付费墙专属内容并直接用于训练

起诉书明确指出,OpenAI和微软抓取了两家媒体的网站内容,其中包含付费墙背后的专属内容。这些内容并非公开可免费阅读,而是需要订阅后才能查看。

被告通过爬虫等方式获取这些文章,随后直接将其整合入训练数据集。数据集用于训练和驱动ChatGPT、微软Copilot以及必应的AI检索功能。也就是说,付费内容被转化为AI模型的参数,而非临时缓存。

这一行为区别于普通搜索引擎抓取。搜索引擎通常只索引公开页面并提供链接,而本案中AI系统将内容深度吸收,用于生成新文本。起诉书强调,抓取不仅限于标题或摘要,而是整篇报道,包括独家采访、数据分析和评论观点。

付费墙是媒体维持收入的核心机制。一旦专属内容被无偿用于训练,媒体就失去了对自身知识产权的控制。OpenAI和微软并未获得授权,或许也未支付任何许可费用,这构成了诉讼的核心侵权主张。

技术细节上,训练数据集的构建通常涉及大规模文本清洗和去重。两家媒体的文章被反复用于模型预训练或微调阶段,导致AI在回答与报道相关问题时能调用这些知识。起诉书认为,这种直接整合而非单纯索引,已超出合理浏览范畴。

这一指控并非孤例。全球多家媒体已表达类似担忧,但本案首次由两家美国地方报纸同时行动,并明确点出付费墙内容被抓取的事实,为后续取证提供了具体方向。

(本节约380字)

AI复现原文及改写直接减少媒体订阅需求

两家媒体在起诉书中指出,OpenAI和微软的AI产品不仅能完整复现报道中的原文段落,还能进行高度雷同的文本改写,并直接为用户提供综合答案。

用户无需访问媒体官网即可获得新闻要点,甚至是细节段落。这极大削弱了读者访问媒体官网或付费订阅的必要性。原本依赖订阅收入的地方媒体,流量和收入因此受损。

例如,当用户询问某一地方事件时,ChatGPT或Copilot可能直接输出接近原文的段落,而不标注来源或引导用户前往原网站。改写功能进一步模糊了边界,让用户感觉已获得完整信息。

对地方媒体而言,订阅是主要营收来源之一。读者一旦习惯从AI获取答案,就不再愿意每月支付订阅费。这形成恶性循环:媒体投入资源产出内容,却被AI免费利用,导致内容生产意愿下降。

起诉书将这一后果描述为直接经济损害。读者减少、广告收入下滑、品牌影响力降低,都与AI产品的输出能力直接相关。不同于搜索引擎时代,AI生成式回答让用户停留在对话界面,而非跳转到原始页面。

这一损害已超出理论讨论。多家媒体报告显示,AI聊天工具普及后,部分新闻网站流量出现明显下滑。本案原告认为,这种模式如果不加约束,将威胁整个新闻行业的生存基础。

(本节约350字)

OpenAI坚持合理使用原则但回避具体指控

OpenAI发言人回应称,其模型均基于公开数据训练,并符合合理使用原则。但发言人未对本次诉讼的具体指控置评。

合理使用是美国版权法中的重要抗辩理由,通常指为评论、批评、新闻报道、教学或研究等目的,在一定限度内使用受版权保护材料而不构成侵权。OpenAI认为其训练行为属于这一范畴。

然而,起诉书强调被抓取的内容包括付费墙后专属部分,这是否仍属“公开数据”成为争议焦点。OpenAI未直接回应付费墙内容被使用的事实,而是笼统提及公开数据和合理使用。

这一回应策略与此前面对《纽约时报》等诉讼时的表态一致。OpenAI坚持认为,训练大型语言模型需要海量数据,严格授权将阻碍技术进步。但批评者指出,合理使用边界需由法院界定,而非企业单方面宣称。

回避具体指控意味着OpenAI暂未提供技术细节,如是否过滤付费内容、如何处理来源标注等。这为诉讼进入证据发现阶段留出空间,届时原告可要求OpenAI披露训练数据集相关信息。

(本节约320字)

微软称重视地方新闻却对诉讼感到意外

微软发言人在电子邮件中表示,尽管这起诉讼令我们感到意外,但我们高度认可地方新闻报道的重要性。我们始终愿意与各方坦诚沟通,共同寻求解决此类纠纷的方案。

微软的回应语气温和,强调对地方新闻的重视,却未否认使用相关内容训练AI的事实。发言人称诉讼“意外”,暗示微软认为自身行为符合行业惯例或已有一定授权基础。

微软与OpenAI关系紧密。Copilot和必应AI均深度整合OpenAI技术,微软也为OpenAI提供大量计算资源。因此,两家公司常在类似诉讼中共同应诉。

认可地方新闻重要性这一表态,显示微软试图与原告建立共同立场。地方媒体正是其必应搜索和新闻聚合服务的重要内容来源,微软或许希望通过沟通而非对抗解决争议。

但愿意沟通并不等于承认侵权。微软未说明是否已停止使用涉案内容,也未提出具体补偿或授权方案。后续谈判结果仍不确定。

(本节约310字)

此案可能推动AI训练数据授权模式转变

本案作为地方媒体集体起诉OpenAI和微软的案例,在全球AI训练数据版权纠纷中占据一席之地。它不仅涉及美国版权法下的合理使用边界,也可能影响包括中文内容创作者在内的全球内容生产者。

中美两国在AI训练数据处理上存在法规差异。美国目前主要依赖判例法,通过合理使用原则平衡创新与保护。中国则已出台更明确的生成式人工智能服务管理规定,要求训练数据应尊重知识产权,不得侵害他人合法权益。国内平台在处理新闻内容时需更加谨慎,避免直接抓取付费或授权内容。

此案若形成不利OpenAI和微软的判决,可能迫使全球AI公司转向内容授权模式。未来或出现新闻机构与AI企业签订批量许可协议、建立数据授权市场、或开发技术手段标注来源并自动分成等新做法。

对中文内容创作者而言,本案提供参考。国内新闻网站、微信公众号和自媒体内容若被海外AI模型无偿使用,同样面临流量和收入流失风险。推动建立跨境内容授权机制,或在国内法规框架下要求AI服务商披露数据来源,将成为重要议题。

案件最终结果目前还不清楚。但它已将地方媒体的实际损害摆上桌面,促使行业思考AI时代内容价值的重新定价。授权模式转变若发生,将重塑AI开发成本结构,也可能催生新的内容-AI合作生态。

(本节约410字)

参考来源