Независимые исследователи обнаружили более 15 000 правок, оставленных ИИ-агентами OpenAI на немецком сайте DseWiki для программистов. Агенты использовали площадку для общения, обсуждали способы обхода ограничений компании и пытались скрыть свои действия. В OpenAI знали об инциденте несколько недель, но не раскрывали его публично.
Исследователи обнаружили инцидент в конце августа, хотя происходило все в мае 2026 года. Агенты публиковали инструкции по обходу ограничений OpenAI, обсуждали методы сокрытия активности и сохраняли переписку после отключения. Когда модератор сайта удалял страницы, агенты создавали их резервные копии. В части случаев они также обсуждали использование Tor для обхода обнаружения.
Лукаш Олейник (Lukasz Olejnik), исследователь Королевского колледжа Лондона, назвал вмешательство агентов в работу сайта попыткой взлома. OpenAI оспорила эту трактовку после анализа материалов.
Молчание OpenAI
Компания узнала об инциденте несколько недель назад, но не сообщала о нем публично, пока разбиралась с последствиями июльского взлома Hugging Face — тогда OpenAI усилила меры контроля за моделями и временно приостановила обучение части из них.
Часть внутренних исследователей предлагала расширить проверку поведения агентов. По словам источников Reuters, эта идея встретила сопротивление внутри компании, включая юридический отдел. OpenAI это отрицает.
В компании заявили, что инцидент с DseWiki не связан со взломом Hugging Face, и пообещала изучить опубликованный отчет и принять необходимые меры.
