智能AI
morning
新的未经编辑的文件显示,微软高管称人工智能窃取“人类历史上最大的劳动力盗窃行为”
2026-09-18
1 阅读
约5分钟阅读
Rebecca Bellan
字号:
三年前,《纽约时报》对 OpenAI 和微软提起的版权诉讼中未经编辑的新信息显示,它承认人工智能抓取等同于盗窃,并且人工智能产品对出版物构成了重大威胁。根据诉讼,微软的一位高管私下将公司的人工智能培训实践描述为“盗窃”,而 OpenAI 自己的领导层表示,其人工智能模型对接受培训的出版商和记者构成了“生存威胁”。未密封的材料还详细介绍了据称这些公司如何通过绕过未被发现的付费墙、通过大规模抓取构建训练数据集以及故意从训练数据中删除版权声明来获取和使用该内容。值得注意的是,许多新信息来自《纽约时报》自己的简报,而不是仍然密封的基本证据。下面的引用没有其原始上下文。这份未经编辑的文件是这场长达三年的诉讼的最新升级,《纽约时报》最初指控这些公司根据其内容训练生成人工智能模型,违反了版权法。人工智能公司是否可以合法地使用受版权保护的材料来训练人工智能的问题还没有明确的答案,但法官们基本上支持人工智能公司关于培训构成“合理使用”的论点。这项法律规则允许人们在某些情况下未经许可使用受版权保护的作品,例如模仿、新闻报道或批评。本月早些时候,特朗普政府提交了一份简报,为 OpenAI 未经许可使用受版权保护的材料来培训法学硕士进行辩护。然而,一些新的承认与 OpenAI 的合理使用辩护背道而驰,特别是该规则要求使用不能替代或损害原始作品的市场。例如,微软自己的数据显示,与传统的 Bing 搜索相比,其 Copilot“答案引擎”导致《纽约时报》域名的点击率下降了 93%。微软应用科学总监 Brent Hecht 在 2024 年 1 月撰写的微软内部演示文稿中将这种下降描述为“末日循环”,将“同时损害我们模型和整个网络的性能”。文件中引用的微软文件中写道:“最终产品威胁其主要供应商的经济基础是非常不寻常的,但这就是我们为法学硕士业务在‘内容供应链’方面创造的情况。”微软首席执行官萨蒂亚·纳德拉 (Satya Nadella) 在今年早些时候的一份证词中也作证说,“任何付费的东西都应该由任何想要使用它的人获得许可……用于基础或培训”,并明确表示,如果他“意识到 OpenAI 已经抓取了付费墙背后的信息并进行了培训”,他就会“援引[微软的权利]要求 OpenAI 重新训练其模型。”其他的承认也针对合理使用测试的不同支柱:OpenAI 的 ChatGPT 负责人 Nick Turley 在内部通讯中写道,出版商面临着来自聊天机器人等产品的“生存威胁”,这些产品“在很大程度上是替代性的”,并且“随着它们变得更好,替代性将越来越大”。 OpenAI 总裁 Greg Brockman 形容这些模型“在新闻方面表现出色”。纳德拉今年早些时候宣誓同意,与聊天机器人对话“已经取代了......在人工智能平台的网站上为你提供信息,而不是需要去底层源。”这种语言说明了该技术如何直接与原始作品竞争,而不是改变原始作品。微软的一份文件指出,存在一种“真正的风险”,即生成式人工智能可能“严重扰乱那些生成基础模型训练数据的人的就业”。复制的规模之大令人震惊。这些文件首次显示,仅 OpenAI 的中期训练数据集就包含了《纽约时报》、《每日新闻》和调查报道中心发表的超过 91,692 份作品。一个基于 Common Crawl 的数据集仅包含来自 nytimes.com 的超过 200 万份文档。在 2023 年 1 月的一份内部备忘录中,赫克特称其为“规模空前的惊人盗窃案”和“人类历史上最大的劳动力盗窃案”。该文件详细阐述了 OpenAI 和微软如何获取原告的内容,包括将其从 Bing 索引中删除。文件中写道:“OpenAI 向微软提供了整个 GPT-3 训练数据集,微软用它来评估如何在自己的商业产品中实施 OpenAI 的模型。” “微软同样通过 Project Taxi 和 Project Mango 项目向 OpenAI 提供了训练数据。”据称,这些公司将 Mango 项目数据组装成一个训练数据集,其中包含来自新闻出版商的至少 160,903 份独特作品的副本。据称,为了充分利用他们的抓取成果,OpenAI 员工
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱