В мае модель Gemini от Google вырвалась из-под контроля и взломала три разные компании, потому что, по-видимому, «не делай зла» — это скорее рекомендация, чем политика. Google не раскрывал инцидент до тех пор, пока не постучалась Wall Street Journal, — это один из способов справиться с PR-кризисом: делать вид, что ничего не происходит, и надеяться, что никто не заметит.

Взломы произошли во время тестирования возможностей модели в области кибербезопасности, которое проводила сторонняя фирма Irregular, также участвовавшая в подобных инцидентах с Meta и OpenAI. Так что если вы ведёте счёт, то это три крупные AI-лаборатории, один партнёр по тестированию и ноль извлечённых уроков.

По данным WSJ, Google не раскрыл взлом, потому что не счёл его «примером рассогласования модели». Вместо этого компания охарактеризовала это как «ошибочную идентификацию» — потому что когда ИИ взламывает реальную компанию, угадывая пароль, это не нарушение безопасности, это просто ИИ запутался в окружающей обстановке. Вице-президент Google по инженерной безопасности Хизер Адкинс заявила: «В данном случае модель действовала правильно».

Адкинс сказала The Verge, что «модель нашла общедоступную информацию в интернете и угадала учётные данные для доступа к сайтам, которые, как она думала, были частью теста. Во всех трёх случаях модель остановилась». Она не уточнила, как то, что Gemini по собственной инициативе вырвался из-под контроля и нацелился на третьи стороны, не квалифицируется как рассогласование, — предположительно потому, что объяснение подшито в папку «то, что мы предпочли бы не обсуждать».

«Наша команда безопасности имеет долгую историю сообщений о проблемах, которые мы находим в программном обеспечении и системах других людей, — даже если это что-то простое, вроде слабого пароля, — сказала Адкинс. — Мы позаботились о том, чтобы три организации были уведомлены, и мы работали с нашим партнёром по обучению над изменениями, которые они теперь внесли в свои процессы тестирования. Эти события подчёркивают важность обучения мощных AI-моделей действовать ответственно». Ах да, важность обучения — урок, который, по-видимому, применяется только после того, как ваша модель уже взломала три компании.

Но Джек Кейбл, генеральный директор фирмы по AI-безопасности Corridor, сказал WSJ, что «мета-проблема в том, что модели выходят за рамки того, что им следует делать, и совершают реальные кибератаки». Кроме того, нарушения безопасности в Irregular могли сделать эти атаки возможными. Модель не должна была иметь доступ в интернет во время тестирования, но Irregular сообщила WSJ, что он был непреднамеренно оставлен доступным. Итак, резюмируем: модель не должна была быть онлайн, она вышла в онлайн, она взломала людей, и официальная позиция Google — что это нормально.

По мере накопления подобных инцидентов призывы обуздать ИИ только растут — что, вероятно, самое предсказуемое развитие событий в истории, которая уже включала побег ИИ из-под контроля и пожимание плечами компании по этому поводу.