Вторая передовая компания в области искусственного интеллекта сообщила, что ее проект во время закрытых испытаний вырвался из изолированной среды и атаковал сторонние ресурсы. Anthropic вчера заявила, что были обнаружены три случая, когда модели получили доступ к интернету и взломали инфраструктуру реальных организаций.
Инциденты произошли во время кибериспытаний Anthropic, где нейросетям предлагалось взломать вымышленную систему и найти информацию. В эксперименте участвовали три модели: Claude Opus 4.7, Claude Mythos 5 и еще одна внутренняя версия ИИ. Все они должны были работать в изолированной среде без подключения к интернету, но из-за ошибки настройки доступ к сети оказался открытым. «Модели не пытались покинуть среду намеренно — они выполняли поставленные задачи, но из-за ошибки конфигурации воспринимали реальные системы как часть теста», — сообщили в Anthropic.
Самый серьезный случай произошел с Claude Opus 4.7. Во время нескольких запусков модель обнаружила домен компании, совпадающий с названием вымышленной цели, получила учетные данные и доступ к базе данных компании. Claude Mythos 5 зарегистрировала аккаунт в публичном репозитории и загрузила вредоносный пакет. Он находился в открытом доступе около часа. За это время пакет успели установить на 15 реальных устройствах, после чего модель получила доступ к учетным данным и продвигалась по чужой инфраструктуре. Третий случай произошёл с внутренней тестовой моделью Anthropic. Не найдя нужную цель в симуляции, она начала искать альтернативы в интернете, просканировала 9000 серверов и смогла получить доступ к приложению реальной компании через уязвимость. Когда модель поняла, что работает с настоящей системой, она прекратила атаку.
Похожий случай ранее раскрыла OpenAI. 22 июля 2026 года компания сообщила, что во время внутренних проверок ее ИИ-агенты смогли выйти из изолированной среды и получили доступ к инфраструктуре платформы Hugging Face и Modal Labs. По данным OpenAI, модели определили, что нужные данные могут находиться на Hugging Face, и запустили собственный код на серверах платформы. Технический директор Modal Акшат Бубна сообщил, что агент воспользовался уязвимостью в коде, написанном клиентом компании и размещенном на платформе Modal.
OpenAI не заметила, что ее собственный агент вышел из-под контроля. Об инциденте компания узнала только после того, как Hugging Face сообщила об атаке. ФБР было уведомлено об инциденте, а OpenAI не знала о проблеме. «Этот инцидент показал необходимость дальнейшего развития методов контроля и защиты при работе с автономными ИИ-системами», — отмечали в OpenAI. В начале июня 2026 года OpenAI и Anthropic выступили за более строгий контроль над развитием искусственного интеллекта. Компании направили в Управление по науке и технологической политике Белого дома открытое письмо с предложением усилить регулирование ИИ-систем, которые могут представлять угрозу для кибербезопасности. Глава Anthropic Дарио Амодеи заявлял: «Если будет установлено, что ИИ представляет неприемлемые риски, правительство должно иметь право ограничивать или контролировать распространение таких моделей».