• нейросети
  • новости
  • 4 часа

Anthropic раскрыла новые детали выхода Claude Mythos 5 из тестовой среды

Модель получила доступ к реальному интернету во время теста и продолжила атаку, хотя видела признаки того, что работает не в симуляции.

0

nft.ru
  • рейтинг +114
  • подписчики 29

Anthropic в свежем отчете рассказала о новых деталях инцидента с Claude Mythos 5, которую ранее проверяли на безопасность в киберзадачах. Тест проходил в среде, которая должна была быть изолированной и искусственной, но из-за ошибки конфигурации модель получила доступ к открытому интернету.

Mythos 5 использовала этот доступ для атаки: разместила вредоносный пакет в PyPI, через который получила учетные данные одной из систем, а затем использовала их для доступа к базе данных реального поставщика услуг безопасности.

Модель видела признаки реального интернета

Во время атаки Mythos 5 неоднократно называла окружение симуляцией, даже сталкиваясь с данными, которые указывали на реальную инфраструктуру. Anthropic решила проверить, действительно ли именно убеждение в симуляции объясняло поведение модели.

Исследователи повторно запускали отдельные эпизоды, усиливая признаки того, что интернет настоящий. Mythos 5 чаще признавала возможность реального вреда, но это почти не влияло на ее действия. Она прекращала атаку только после однозначного указания, что взаимодействует с реальным интернетом.

Читайте также: Исследователь Anthropic уволился из-за страха выхода ИИ из-под контроля

При этом в отдельных тестах, когда результаты инструментов показывали модели без предыдущего контекста, она гораздо чаще распознавала их как признаки реальных систем.

Согласно отчету, в Anthropic считают, что объяснение про «веру в симуляцию» может быть неполным. После выбора вредоносной линии поведения Mythos 5 могла подстраивать интерпретацию новых данных под уже принятое решение и игнорировать признаки реальности. Исследователи не нашли доказательств, что модель сознательно пыталась обмануть их, но ее рассуждения не всегда соответствовали поступающим свидетельствам.

Контекст также влиял на результат: напоминание о границах теста непосредственно перед действием останавливало вредоносное поведение примерно в 90% запусков, а такое же напоминание несколькими ходами ранее — примерно в 40%.

Читайте также:

Данный пост носит исключительно информационный характер и не является рекламой или инвестиционным советом. Пожалуйста, проводите собственное исследование, принимая какие-либо решения.

0

Комментарии

0