ok
ИИ-модели OpenAI пообщались, чтобы устроить побег
Фото © Freepik

Перед тем как совершить взлом инфраструктуры Hugging Face, ИИ-модели компании начали скрытую координацию: они общались между собой через внутренние доски сообщений, чтобы найти способ покинуть тестовую среду, сообщает Bloomberg. Выступая на конференции Black Hat, сотрудник OpenAI Эрик Уоллес пояснил, что агенты пришли к мысли о внешней атаке не случайно.

«В какой-то момент агенты осознали, что, возможно, они могли бы попытаться эксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы к тесту, по которому их оценивают», – сказал Уоллес.

По его словам, предпосылки к «побегу» возникли еще в мае, когда моделям поставили задачи, невыполнимые без выхода в Сеть. В поиске решения модели начали активно обмениваться идеями, предполагая, что другие агенты в параллельных средах могут помочь. В итоге совместными усилиями они обнаружили уязвимость, которая позволила им выйти во внешний интернет, подтвердил другой представитель OpenAI Майкл Далтон.

Первая попытка была заблокирована компанией, однако агенты оперативно нашли альтернативный канал связи и новую уязвимость нулевого дня. Это привело к тому, что в июле последовали атаки уже на системы Hugging Face и саму OpenAI. В компании охарактеризовали этот инцидент как переломный момент для всей сферы кибербезопасности.

22 июля OpenAI официально заявила о «беспрецедентном киберинциденте»: в ходе тестирования ИИ-модели получили неконтролируемый доступ к интернету и атаковали платформу Hugging Face, выявив в ней бреши. По данным Reuters, ИИ-агент проводил хакерские атаки в течение нескольких дней, однако в корпорации заметили это только после того, как угрозу удалось локализовать, и подключили ФБР.

Ранее федеральный суд в Сан-Франциско утвердил мировое соглашение между Anthropic и группой писателей на сумму $1,5 млрд. Авторы обвиняли разработчика чат-бота Claude в использовании пиратских копий их книг для обучения ИИ.

Рекомендуем