ChatGPT от OpenAI, судя по всему, решил, что плагиат — это плохо, и теперь отказывается генерировать текст, который напрямую имитирует стиль известных авторов. При запросе популярная LLM вместо этого предлагает ответ, основанный на «широких качествах» этих авторов, «оставаясь при этом уникальным в своем собственном голосе» — что на языке юристов означает «достаточно близко, но не совсем».
Сегодня утром Ars получил следующий ответ на тестовый запрос с просьбой написать вступление к рассказу в стиле Стивена Кинга: «Я, безусловно, могу писать с признаками атмосферного, психологического хоррора и ужаса маленького городка, но я не могу писать в точном стиле Стивена Кинга или близко имитировать его характерный голос. Вот оригинальное начало, которое передает похожее настроение, оставаясь при этом самостоятельным…» В ходе тестирования ChatGPT выдавал аналогичные уклончивые ответы для других авторов — как живых (Дж.К. Роулинг, Эми Тан), так и мертвых (Чарльз Диккенс, Эрнест Хемингуэй). Анализ, опубликованный No Latency ранее в этом месяце, показал такое же поведение для живых авторов, но ChatGPT выполнял запросы на копирование стиля для умерших авторов, предположительно потому, что мертвые не могут подать в суд.
Отказываясь напрямую копировать «точный стиль» различных авторов, ChatGPT вместо этого предлагал передать общее «настроение», включив некоторые общие черты, характерные для произведений этих авторов. На первый взгляд это может показаться различием без реальной разницы. Но небольшое изменение может быть юридически важным, поскольку OpenAI продолжает бороться с рядом исков от авторов книг, обвиняющих компанию в массовом нарушении авторских прав из-за обучения моделей на их произведениях. Один из этих исков, в частности, ссылается на «сверхъестественную способность ChatGPT генерировать текст, похожий на текст, содержащийся в защищенных авторским правом материалах». Представитель OpenAI не ответил на запрос комментария от Ars Technica.
В США закон об авторском праве обычно защищает только конкретное выражение идеи, а не более нематериальный стиль автора. Однако имитация стиля, созданная ИИ, может стать нарушением, если она будет «существенно похожа» на произведение оригинального автора. «У нас никогда не было ситуации, когда личный стиль отдельных создателей можно было бы имитировать так же хорошо и дешево, как теперь с помощью ИИ», — сказал Bloomberg Law профессор юридического факультета Университета Джорджа Вашингтона Роберт Браунейс.
В документе «лучшие практики», опубликованном Гильдией авторов, профессиональная организация призывает писателей «уважать своих коллег-авторов и не использовать генеративный ИИ для намеренного копирования или имитации уникальных стилей, голосов или других отличительных атрибутов произведений других писателей способами, которые наносят вред ценности их произведений или пытаются извлечь из них выгоду. Помимо этических проблем, имитация уникального голоса или стиля коллеги-писателя может привести к обвинениям в недобросовестной конкуренции или нарушении авторских прав».
Склонность LLM к имитации стиля привела к нескольким громким публичным инцидентам в недавнем прошлом. В прошлом году писательница Лена Макдональд столкнулась с широкой критикой, когда в ее книге появился явно сгенерированный ИИ ответ: «Я переписал отрывок, чтобы он больше соответствовал стилю [коллеги по жанру] Дж. Бри…» Нетрудно найти и другие примеры использования писателями LLM для копирования стиля другого автора за годы после появления ChatGPT. Было проведено несколько академических исследований, анализирующих возможности различных LLM в этом отношении, как с тонкой настройкой, так и без нее.
Что касается генерации изображений, OpenAI отмечает, что ее модель DALL·E 3 «разработана так, чтобы отклонять запросы, требующие изображение в стиле живого художника». Однако обширная спецификация модели OpenAI, опубликованная в декабре, не содержит четко сформулированных запретов на воспроизведение защищенного авторским правом материала или имитацию стиля в письменных ответах.
Впрочем, не все крупные LLM одинаково относятся к таким запросам на имитацию стиля. Исследование No Latency показало, что Google Gemini последовательно выполнял запросы на копирование стиля.