01AI Hot(卡兹克)NYT诉OpenAI案解封文件:微软OpenAI内部承认LLM建立于内容窃取
在《纽约时报》诉OpenAI版权案中,一份此前封存的未删节法庭文件被解封,公开了微软与OpenAI高管的内部表态。文件显示,两家公司高管曾私下承认,大语言模型的训练建立在未经授权大规模抓取的互联网内容之上,微软方面更将其形容为"空前规模的盗窃"。文件同时披露,由于Bing搜索直接呈现生成式答案,被抓取内容的新闻网站来自Bing的点击量下降超过90%,相关高管将此描述为可能摧毁整个开放网络的"末日循环"。此外,文件还显示OpenAI曾通过专门工具绕过《纽约时报》付费墙抓取内容,并曾评估自身模型对新闻出版业构成"存在性威胁"。这批材料使外界首次直接看到两家公司在内部文件中如何描述其数据获取方式及其对内容生态的冲击,对仍在进行的版权诉讼、生成式AI训练数据的合法边界,以及搜索引擎与内容产业的关系判断都将产生重要影响。
原文 ↗