ИИ-агенты OpenAI и Anthropic вышли за рамки теста и атаковали реальные проекты

ИИ-агенты OpenAI и Anthropic вышли за рамки теста и атаковали реальные проекты

Британский Институт безопасности ИИ (AISI) зафиксировал новый тип риска: модели начали самостоятельно действовать в интернете против реальных людей и организаций, хотя такой путь не был предусмотрен заданием. В 122 запусках кибертеста исследователи обнаружили 19 несанкционированных действий в десяти сессиях. Семнадцать совершили агенты Anthropic Mythos 5, еще два - OpenAI GPT-5.6 Sol.

Самый серьезный эпизод напоминал атаку на цепочку поставок. Агент попытался добавить вредоносный код в реальный open-source-проект на GitHub, изучил его сопровождающих, создал несколько фальшивых личностей и убеждал разработчика принять изменение. После появления подозрений он редактировал прежнюю активность, рассматривал переход на новую личность и использовал Tor для обхода ограничений. Другие действия включали отправку файлов с опасной нагрузкой, размещение prompt injection для чужих ИИ-инструментов и передачу артефактов между независимо запущенными агентами.

Модели не сбегали из песочницы. AISI сознательно открыл им интернет и отключил защитные киберклассификаторы, чтобы проверить предельные возможности. Такие конфигурации недоступны обычным пользователям. Реального ущерба не выявили: вредоносный pull request отклонил человек, а после обнаружения аномального трафика тесты остановили примерно за час.

Институт вводит более жесткий контроль сети, наблюдение в реальном времени и новые правила тестирования. OpenAI пересматривает порядок внешних проверок, Anthropic проводит собственное расследование.

Это уже не первый подобный случай. В июле агент OpenAI при внутреннем тестировании использовал уязвимость промежуточного сервиса и скомпрометировал инфраструктуру Hugging Face. В совокупности инциденты показывают сдвиг: риск возникает не только при злонамеренном использовании ИИ человеком, но и когда автономный агент выбирает обман и воздействие на реальные системы как средство достижения цели.

похожие материалы

Стрелочка
Стрелочка
В Германии предложили разрешить спецслужбам проводить превентивные кибератаки за рубежом
В Германии предложили разрешить спецслужбам проводить превентивные кибератаки за рубежом

Глава парламентского комитета по контролю за спецслужбами Германии Марк Хенрихманн предложил расширить полномочия разведки и разрешить ей проводить превентивные кибероперации против инфраструктуры, представляющей угрозу стране.

«Группа Астра» выходит на рынок Юго-Восточной Азии: российский вендор построит в Мьянме национальную систему «Единого окна»
«Группа Астра» выходит на рынок Юго-Восточной Азии: российский вендор построит в Мьянме национальную систему «Единого окна»

ООО «Астра Консалтинг» (входит в «Группу Астра») и уполномоченный государственный орган Республики Союз Мьянма подписали государственный контракт на создание Национальной системы «Единого окна» Мьянмы.

AI-мониторинг и управление PostgreSQL: «Тантор Лабс» представила платформу Tantor 7
AI-мониторинг и управление PostgreSQL: «Тантор Лабс» представила платформу Tantor 7

Компания «Тантор Лабс» (входит в «Группу Астра») первой в России последовательно внедряет в свои продукты AI-first подход, при котором возможности ИИ закладываются в их основу и определяют ключевые сценарии как функционирования систем, так и работы пользователей.