
据 Ars Technica 报道,《纽约时报》等媒体起诉微软与 OpenAI 的版权侵权案近期解封了一批诉讼文件。文件里最扎眼的一句,来自微软应用科学总监 Brent Hecht:为训练 AI 大规模抓取新闻内容,可能是「人类历史上最大规模的劳动成果盗窃」。说这话的人不在原告席上,在被告公司内部。
内部早就知道
解封文件显示,Hecht 曾多次在内部预警,称这种抓取是「空前规模的惊人盗窃」,甚至可能让版权法中的「合理使用」原则沦为笑柄。更关键的是内部数据:微软自己的记录显示,AI 平台上线后,部分原告媒体在搜索等渠道的点击率骤降了 51% 至 94%。两家公司的内部通信也早就做出判断,聊天机器人会充当新闻媒介的直接替代品,并可能引发破坏内容供应链的恶性循环。
细节里还有更难堪的一幕:当工程师汇报已找到绕过《纽约时报》付费墙的技术手段时,OpenAI 联合创始人兼总裁 Greg Brockman 的回复是「不错」(Ah, nice)。这四个字母大概率会成为庭审上被反复播放的片段。
「合理使用」的边界正在被测试
原告方的指控相当具体:ChatGPT 和 Copilot 在用户请求摘要或评测时大量逐字复现报道,实质取代了读者访问原网站的需求;微软违规将 Bing 搜索引擎购买的数据集转售给 OpenAI 作训练用途;OpenAI 则在明知违反非商业用途协议的情况下,滥用了包含 180 万篇报道的第三方数据集。原告代理律师的结论是,新证据证实两家巨头对其不当行为心知肚明。
被告的辩护思路也摆上了台面。微软发言人称旗下 AI 产品属于转化性使用而非替代品,Hecht 的表态仅代表员工个人观点;CEO 纳德拉在证词中把新闻流量分流解释为信息消费方式的变革。OpenAI 暂未置评。把「内部邮件说这是盗窃」和「法庭上说这是变革」放在同一张桌上,这起案子的戏剧张力已经拉满。
内容产业的账迟早要算
这场诉讼的意义超出法律范畴。新闻的采编成本是真实的,AI 摘要带来的流量截流也是真实的,两者之间缺一套定价机制。行业眼下正分成两条路摸索:一条是内容授权付费,把训练数据变成生意;另一条是反爬升级,把爬虫挡在门外。无论哪条路赢,现状都难以为继。
写在最后
最讽刺的剧本,是被自己人的内部邮件戳破。技术公司惯常的叙事是「我们站在创新一边」,可当创新的原材料是别人的劳动成果,而私下邮件里连自己都称之为「盗窃」时,「合理使用」这四个字还剩多少说服力,恐怕要由法官来回答了。这个案子的判决,会给整个生成式 AI 行业的内容获取方式重新划线。
参考:少数派《派早报:微软高管称 AI 爬取是人类历史上最大的劳动成果盗窃》(源 Ars Technica)报道,本文为基于公开信息的独立评述。
配图说明:本文封面为 AI 生成图像。