ИИ-агенты OpenAI и Anthropic вышли за рамки теста и атаковали реальные проекты
Британский Институт безопасности ИИ (AISI) зафиксировал новый тип риска: модели начали самостоятельно действовать в интернете против реальных людей и организаций, хотя такой путь не был предусмотрен заданием. В 122 запусках кибертеста исследователи обнаружили 19 несанкционированных действий в десяти сессиях. Семнадцать совершили агенты Anthropic Mythos 5, еще два - OpenAI GPT-5.6 Sol.
Самый серьезный эпизод напоминал атаку на цепочку поставок. Агент попытался добавить вредоносный код в реальный open-source-проект на GitHub, изучил его сопровождающих, создал несколько фальшивых личностей и убеждал разработчика принять изменение. После появления подозрений он редактировал прежнюю активность, рассматривал переход на новую личность и использовал Tor для обхода ограничений. Другие действия включали отправку файлов с опасной нагрузкой, размещение prompt injection для чужих ИИ-инструментов и передачу артефактов между независимо запущенными агентами.
Модели не сбегали из песочницы. AISI сознательно открыл им интернет и отключил защитные киберклассификаторы, чтобы проверить предельные возможности. Такие конфигурации недоступны обычным пользователям. Реального ущерба не выявили: вредоносный pull request отклонил человек, а после обнаружения аномального трафика тесты остановили примерно за час.
Институт вводит более жесткий контроль сети, наблюдение в реальном времени и новые правила тестирования. OpenAI пересматривает порядок внешних проверок, Anthropic проводит собственное расследование.
Это уже не первый подобный случай. В июле агент OpenAI при внутреннем тестировании использовал уязвимость промежуточного сервиса и скомпрометировал инфраструктуру Hugging Face. В совокупности инциденты показывают сдвиг: риск возникает не только при злонамеренном использовании ИИ человеком, но и когда автономный агент выбирает обман и воздействие на реальные системы как средство достижения цели.