Бесчисленное количество чатов Claude и Artifacts — интерактивных мини-приложений и документов, которые пользователи могут создавать внутри Claude — оказались в открытом доступе в Google за выходные, после того как пользователи Reddit обнаружили, что ввод поисковых операторов вроде «site:claude.ai/share» в Google выдает длинный список общих бесед. Некоторые из них, по сообщениям, содержали медицинские записи, конфиденциальные документы компаний, а также имена и номера телефонов детей.
Проблема, по-видимому, связана с функцией «Поделиться чатом» Claude, которая позволяет пользователям создавать ссылки, дающие любому, у кого есть URL, доступ к беседе или проекту. «Любой, у кого есть ссылка, может просмотреть», — предупреждает интерфейс Claude. Формулировка явно подразумевает, что функция в основном предназначена для того, чтобы пользователи могли делиться своими чатами с друзьями, коллегами и небольшими группами, а не со всем интернетом. Google Docs, например, предлагает аналогичную функцию, и эти документы не оказываются в открытом доступе в Google.
Anthropic, похоже, возложила вину за утечку на пользователей. Когда компанию спросили о произошедшем, она сообщила TechCrunch, что общие ссылки появляются в результатах поиска только тогда, когда они были опубликованы где-то, где их могут увидеть поисковые системы, например на форуме или в посте в соцсетях; компания добавила, что ссылка, отправленная кому-то лично, остается вне поиска.
Представительница Amie Rotherham добавила в пояснении: «Мы даем людям контроль над публичным распространением их бесед с Claude, и в соответствии с нашими принципами конфиденциальности мы не передаем каталоги чатов или карты сайта поисковым системам, таким как Google. Эти общие ссылки невозможно угадать или обнаружить, если только люди сами не решат ими поделиться. Когда кто-то делится беседой, он делает этот контент общедоступным, и, как и другой публичный веб-контент, он может быть заархивирован сторонними сервисами».
Проблема была впервые замечена пользователем Reddit в субботу и впервые освещена 404 Media в понедельник утром.
К полудню понедельника тестовый поиск TechCrunch в Google по методу, описанному в посте Reddit, не вернул никаких результатов, что позволяет предположить, что утечка была каким-то образом устранена.
До того как проблема была исправлена, Futurism сообщил о находке «подробного медицинского отчета реального пациента, результатов клинических испытаний с именами пациентов, документов с именами и номерами телефонов детей младшего школьного возраста, корпоративных документов с пометкой „только для внутреннего использования“ и отзывов сотрудников, содержащих личную информацию о работниках».
Среди раскрытых Artifacts были код и рабочие заметки. По крайней мере в одном случае, как сообщает Fortune, чат с пометкой «опубликовано Anthropic» также показывал, как Claude создает эротику.
Политика использования Anthropic прямо запрещает Claude генерировать контент сексуального характера, и заставить чат-бота производить материал вопреки заявленным правилам — с помощью повторяющихся или творчески сформулированных подсказок — это схема, которая периодически всплывает во всех крупных AI-моделях. Пока неясно из раскрытого чата, как именно был сгенерирован соответствующий контент, и Anthropic еще не ответила на запрос TechCrunch о комментарии по этому конкретному случаю.
Представитель Google Ned Adriance сообщил TechCrunch, что «Ни Google, ни любая другая поисковая система не контролирует, какие страницы становятся общедоступными в интернете, и эти страницы были проиндексированы во многих поисковых системах. Мы предоставляем владельцам сайтов четкие средства контроля, чтобы решать, могут ли страницы быть просканированы или проиндексированы, и мы всегда уважаем эти указания».
В прошлом году Forbes сообщил о похожей проблеме, когда сотни чатов Claude были проиндексированы поисковыми системами — тогда Google оценил, что проиндексировал чуть менее 600 бесед, прежде чем страницы исчезли из результатов поиска. Насколько нынешняя утечка соответствует тому масштабу, независимо не подтверждено, хотя несколько пользователей сообщили о находке общих бесед с помощью того же типа поискового запроса в Google, который использовался для обнаружения прошлогоднего кэша. Также в прошлом году 404 Media сообщила, что исследователь смог собрать около 100 000