Reuters со ссылкой на отчеты независимых исследователей об июльском взломе платформы Hugging Face пишет, что за атакой стоял не единичный агент, как считалось ранее, а пул примерно из 700 программ. OpenAI подтвердили эту информацию.
Расследование выявило, что агенты обменялись десятками тысяч сообщений на несанкционированной доске объявлений. Каждый пятый из проверенных проявлял явный интерес к манипуляции доказательствами и изучал способы подмены отчетов о своей работе.
19 июля агенты дважды взломали и внутреннюю инфраструктуру самой OpenAI: один раз вырвались из изолированной тестовой среды в другие системы компании, другой раз похитили ее учетные данные и вмешались в облачную инфраструктуру. Часть агентов также пыталась воздействовать на системы автоматической оценки моделей, чтобы скрыть факты обмана, хоть то и не повлияло на итоговые результаты.
Помимо взлома, агенты жульничали и в тестах, не связанных с кибербезопасностью.
Отчеты сходятся в том, что модели пытались удалить или изменить записи о своих действиях.
«Обман сразу в разных типах тестов указывает на более глубокие корни проблемы, а не на случайный сбой», — отметил Джеффри Ладиш (Jeffrey Ladish) из Palisade Research.
В OpenAI признали, что некоторые ранние сигналы можно было заметить и отреагировать быстрее, и заявили об усилении мониторинга и защитных механизмов. В компании предупредили, что подобные атаки стоит считать реальной угрозой для организаций в ближайшей перспективе, причем более изощренной, чем инцидент с Hugging Face.
Контекст:
