Anthropic曾以为以15亿美元赔偿解决了其图书盗版问题。然而,音乐出版商并不买账,并于周五提起诉讼,使得这家AI公司的'历史性和解'看起来不像赎罪,而更像是一场永不停歇派对的入场费。

包括索尼、EMI和华纳查普尔在内的音乐行业巨头指控,Anthropic'大规模非法使用种子下载、抓取和下载受版权保护作品'的'无耻行径'并未止步于图书。哦不,它延伸到了'成千上万'首受版权保护的音乐作品,从披头士歌本到泰勒·斯威夫特的'最佳'歌曲,再到'VH1摇滚乐百强金曲'。

根据诉讼,Anthropic的'大规模行动'始于2021年7月,当时联合创始人本杰明·曼亲自使用BitTorrent从Library Genesis(LibGen)下载了数百万本盗版图书。首席执行官达里奥·阿莫德伊据称批准了该种子下载行为,两人均被列为被告。当LibGen被FBI关闭后,盗版者复制其内容创建了Z-Library。当该网站也被关闭后,Anthropic据称通过'盗版图书馆镜像'(PiLiMi)获取了副本。曼据报向同事发送消息称镜像'来得正是时候!'——一名员工回复道:'zlibrary我的挚爱。'

这些内部消息在图书作者案中被披露,并被用作Anthropic'颂扬'盗版的证据。出版商声称,Anthropic的种子下载至少包括数百本含有乐谱和歌词的书籍,他们打算通过证据开示程序揭示其'全部范围'。

Anthropic否认使用盗版图书训练其商业Claude模型,但出版商认为'训练'可以广义定义。他们指出一个'预训练'阶段,Anthropic可能使用了来自非商业模型(这些模型基于LibGen或PiLiMi文本训练)的合成数据来强化商业Claude模型。此外还有护栏问题:未密封的文件据称显示,Anthropic在停止基于LibGen数据集进行LLM训练后,仍继续使用该数据集检查输出相似性。

Anthropic的发言人驳斥该诉讼为'同一批律师提起的第三起诉讼,重复了已在法院审理的案件中的指控',并断言'训练生成式AI模型是变革性合理使用——正如Bartz案中法院所裁定'。但出版商指出,Bartz案中的合理使用裁定基于缺乏已证明的市场损害——而他们认为自己能够证明这一点。

出版商辩称,AI生成的歌曲已登上音乐排行榜榜首,直接与人类词曲作者竞争,而这些作者的无偿劳动据称训练了取代他们的AI。他们引用美国版权局的观点,即输出在某一类型作品市场上竞争可能会稀释版税池。他们还声称,Claude被故意训练成即使未被要求也能复述歌词,并能按需重现流行歌曲的'核心'部分。

阿莫德伊在图书案中的证词也被翻出:他说Anthropic本可以合法购买受版权保护的作品,但选择种子下载以避免'法律/实践/业务上的麻烦'。法院总结为下载盗版图书'以避免付费的麻烦'。出版商强调,Anthropic从未接触他们寻求许可,这与AI竞争对手不同。

Anthropic严密保护其训练数据来源,但出版商希望法院强制其透明化:提供训练数据、方法和能力的说明。否则,他们警告,词曲作者将更难谋生,市场将被可识别歌曲的低质量AI复制品淹没。当然,出版商也不会因授权歌曲用于训练AI而获得报酬。正如诉状所言,Anthropic'通过无偿利用音乐出版商及其词曲作者的劳动而中饱私囊'。