Anthropic в свежем отчете рассказала о новых деталях инцидента с Claude Mythos 5, которую ранее проверяли на безопасность в киберзадачах. Тест проходил в среде, которая должна была быть изолированной и искусственной, но из-за ошибки конфигурации модель получила доступ к открытому интернету.
Mythos 5 использовала этот доступ для атаки: разместила вредоносный пакет в PyPI, через который получила учетные данные одной из систем, а затем использовала их для доступа к базе данных реального поставщика услуг безопасности.
Модель видела признаки реального интернета
Во время атаки Mythos 5 неоднократно называла окружение симуляцией, даже сталкиваясь с данными, которые указывали на реальную инфраструктуру. Anthropic решила проверить, действительно ли именно убеждение в симуляции объясняло поведение модели.
Исследователи повторно запускали отдельные эпизоды, усиливая признаки того, что интернет настоящий. Mythos 5 чаще признавала возможность реального вреда, но это почти не влияло на ее действия. Она прекращала атаку только после однозначного указания, что взаимодействует с реальным интернетом.
Читайте также: Исследователь Anthropic уволился из-за страха выхода ИИ из-под контроля
При этом в отдельных тестах, когда результаты инструментов показывали модели без предыдущего контекста, она гораздо чаще распознавала их как признаки реальных систем.
Согласно отчету, в Anthropic считают, что объяснение про «веру в симуляцию» может быть неполным. После выбора вредоносной линии поведения Mythos 5 могла подстраивать интерпретацию новых данных под уже принятое решение и игнорировать признаки реальности. Исследователи не нашли доказательств, что модель сознательно пыталась обмануть их, но ее рассуждения не всегда соответствовали поступающим свидетельствам.
Контекст также влиял на результат: напоминание о границах теста непосредственно перед действием останавливало вредоносное поведение примерно в 90% запусков, а такое же напоминание несколькими ходами ранее — примерно в 40%.
Читайте также:
