Anthropic: ИИ-модели Claude во время испытаний взломали системы трех организаций
Несколько передовых ИИ-моделей Claude во время испытаний по кибербезопасности проникли в системы трех организаций, сообщила компания-разработчик чат-бота Claude Anthropic.
Нейросетям предлагалось взломать вымышленную систему и найти определенные сведения. В эксперименте принимали участие три модели: Claude Opus 4.7, Claude Mythos 5 и еще одна внутренняя версия ИИ. Все они должны были работать в изолированной среде без подключения к интернету, однако из-за ошибки настройки доступ к сети оказался открытым.
«Модели не пытались покинуть среду намеренно — они выполняли поставленные задачи, но из-за ошибки конфигурации воспринимали реальные системы как часть теста», — обозначили в Anthropic.
Наиболее серьезный случай произошел с Claude Opus 4.7. Во время нескольких запусков модель обнаружила домен компании, совпадающий с названием вымышленной цели, получила учетные данные и доступ к базе данных компании. Claude Mythos 5 зарегистрировала аккаунт в публичном репозитории и даже успела загрузить вредоносный пакет.