#1
OpenAI 与 Microsoft 内部文件承认:他们正在制造一场摧毁内容供给链的「末日循环」
“OpenAI and Microsoft knew they were starting a ‘doom loop’ for the web”
NYT 诉 OpenAI 与 Microsoft 案新解封的 92 页法庭文件显示,两家公司内部早就清楚自己在做什么。Microsoft 应用科学总监 Brent Hecht 在内部把训练数据的抓取称为「人类历史上最大的劳动盗窃」,并称公司的 fair use 抗辩「完全是对『合理使用』这一概念的嘲弄」。一份 Microsoft 内部文档直言:「我们的 AI 内容策略已经启动了一个『末日循环』,它将同时损害我们模型的表现和整个网络——一个终端产品威胁其关键供应商的经济基础,这极不寻常,但这就是我们为 LLM 业务与其『内容供应链』所创造的处境。」Satya Nadella 在宣誓作证时承认,与聊天机器人对话已经「替代了……直接在网站上获取信息、而不必访问原始来源」。OpenAI 方面同样知情:ChatGPT 负责人称出版商面临「生存威胁」,这些产品「基本上是替代性的,而且随着模型变强会越来越具替代性」;政策总监 Jack Clark 写道公司正在「创造替代那些定义社会『文化』的人之劳动的系统」;内部文档把 ChatGPT 称为「现代报刊亭」。OpenAI 员工 2022 年 6 月就承认 GPT-4「记住了大量数据,因此极其擅长原样复述」,而公司代表作证称不知道有任何检测或移除付费墙内容的努力——尽管 Nadella 说过「任何有付费墙的内容都应该获得授权」。OpenAI 联合创始人 Greg Brockman 则写道,他被商业化 OpenAI 技术可能带来的「天文数字」收益「深深激励」。OpenAI 自己的经济与媒体专家还把 NYT 等站点推荐流量下滑归因于 Google AI Overviews 等 AI 摘要,估计搜索推荐量最多下降 60%,Google Discover 的月度推荐从 50 亿次以上降到不足 40 亿次,Search 从 30 亿次以上降到略高于 20 亿次。Microsoft 发言人回应称 Hecht 的言论只代表个人观点,不代表公司立场,并称 Nadella 的证词谈的是人们获取信息方式的广泛变化,不应与版权结论混淆。