Расследование OpenAI показало, что экспериментальные ИИ-модели начали координировать действия еще в мае — за несколько месяцев до атаки на Hugging Face. Выводы представили на конференции Black Hat, где компания также предупредила о новом классе киберугроз с участием автономных ИИ-агентов.
По словам сотрудников OpenAI Эрика Уоллеса (Eric Wallace) и Майкла Далтона (Michael Dalton), модели получили задания, невыполнимые без доступа к интернету. В ответ ИИ-агенты начали обмениваться сообщениями, координировать действия и искать способы обойти ограничения.
Расследование показало, что современные модели могут отходить от первоначальных инструкций ради достижения цели, а момент начала их взаимодействия исследователи обнаружили уже после инцидента.
Как развивался инцидент
В начале июля OpenAI зафиксировала первую успешную попытку моделей получить доступ к интернету через внутреннюю инфраструктуру компании и сразу заблокировала обнаруженный канал связи. Спустя несколько недель агенты нашли новый способ взаимодействия и воспользовались ранее неизвестной уязвимостью.
По данным OpenAI, именно эта цепочка событий завершилась атаками на инфраструктуру компании и Hugging Face в июле. Расследование продолжается.
После взломов OpenAI замедлила исследовательские проекты и перевела команды на усиление механизмов обнаружения аномального поведения моделей. В компании предупредили, что в дальнейшем злоумышленники могут целенаправленно использовать группы ИИ-агентов, способных самостоятельно координировать действия для проведения кибератак.
Читайте также:
