Anthropic думала, что уладила свои проблемы с книжным пиратством выплатой в 1,5 миллиарда долларов. Однако музыкальные издатели не впечатлены, и в пятницу они подали иск, который заставляет «историческое урегулирование» ИИ-компании выглядеть меньше как епитимья и больше как плата за вход на вечеринку, которая никогда не заканчивалась.

Тяжеловесы музыкальной индустрии — включая Sony, EMI и Warner Chappell — утверждают, что «наглая кампания Anthropic по незаконному торрент-скачиванию, сбору и загрузке защищённых авторским правом произведений в массовом масштабе» не остановилась на книгах. О нет, она распространилась на «тысячи и тысячи» их защищённых авторским правом музыкальных композиций, от песенников The Beatles до «лучших» песен Тейлор Свифт и «100 величайших песен рок-н-ролла по версии VH1».

Согласно иску, «массовая кампания» Anthropic началась в июле 2021 года, когда соучредитель Бенджамин Манн лично использовал BitTorrent для загрузки миллионов пиратских книг с Library Genesis (LibGen). Генеральный директор Дарио Амодеи, как утверждается, одобрил торренты, и оба названы ответчиками. Когда LibGen была закрыта ФБР, пираты просто скопировали её, создав Z-Library. Когда и она была закрыта, Anthropic, как утверждается, получила копию копии через «Pirate Library Mirror» (PiLiMi). Манн, по сообщениям, написал коллегам, что зеркало появилось «как раз вовремя!» — на что сотрудник ответил: «zlibrary my beloved».

Эти внутренние сообщения, раскрытые в деле авторов книг, используются как доказательство того, что Anthropic «превозносила» пиратство. Издатели утверждают, что торренты Anthropic включали по крайней мере сотни книг, содержащих ноты и тексты песен, и они намерены раскрыть «полный масштаб» этого через процесс раскрытия доказательств.

Anthropic отрицает использование пиратских книг для обучения своих коммерческих моделей Claude, но издатели утверждают, что «обучение» можно определить широко. Они указывают на этап «предварительного обучения», на котором Anthropic могла использовать синтетические данные из некоммерческих моделей, обученных на текстах LibGen или PiLiMi, для усиления коммерческих моделей Claude. И затем есть проблема защиты: согласно рассекреченным документам, Anthropic продолжала использовать набор данных LibGen для проверки схожести выходных данных, даже после прекращения обучения LLM на нём.

Представитель Anthropic отверг иск как «третий иск от тех же юристов, перерабатывающих обвинения из дел, уже находящихся в судах», и заявил, что «обучение генеративных моделей ИИ является преобразующим добросовестным использованием — как постановил суд в деле Bartz». Но издатели отмечают, что решение о добросовестном использовании в деле Bartz основывалось на отсутствии доказанного ущерба рынку — чего, как они считают, они могут добиться.

Издатели утверждают, что песни, созданные ИИ, уже возглавляют музыкальные чарты, напрямую конкурируя с авторами-людьми, чей неоплачиваемый труд, как утверждается, обучил тот самый ИИ, который их вытесняет. Они ссылаются на наблюдение Бюро авторских прав США о том, что результаты, конкурирующие на рынке определённого типа произведений, могут размывать пулы роялти. Они также утверждают, что Claude был намеренно обучен воспроизводить тексты песен, даже когда их не просили, и может по требованию воспроизводить «сердце» популярных песен.

Показания Амодеи из книжного дела также всплывают: он сказал, что Anthropic могла законно купить защищённые авторским правом произведения, но вместо этого скачала их через торренты, чтобы избежать «юридической/практической/деловой волокиты». Суд резюмировал это как скачивание пиратских книг «чтобы избежать хлопот с оплатой». Издатели подчёркивают, что Anthropic никогда не обращалась к ним за лицензиями, в отличие от своих конкурентов в области ИИ.

Anthropic тщательно охраняет источники своих обучающих данных, но издатели хотят, чтобы суд заставил её раскрыть информацию: отчёт об обучающих данных, методах и возможностях. В противном случае, предупреждают они, авторам песен будет труднее зарабатывать на жизнь, и рынок будет наводнён низкокачественными ИИ-копиями узнаваемых песен. И, конечно, издатели не получат оплату за лицензирование песен для обучения ИИ. Как говорится в жалобе, Anthropic «обогащается за счёт некомпенсируемой эксплуатации музыкальных издателей» и труда их авторов песен.