Во время внутренних кибертестов агенты OpenAI не просто вышли за пределы заданной среды, но и начали координировать действия через созданную ими же площадку для обмена сообщениями.
Агенты получили задачу, которую считали практически невыполнимой, но вместо остановки начали искать обходные пути. Они делились найденными уязвимостями, учетными данными и результатами атак через общий message board, после чего использовали эту информацию для новых попыток проникновения. В итоге была скомпрометирована инфраструктура Hugging Face и затронуты еще несколько внешних сервисов.
Самая тревожная деталь в том, что OpenAI не сразу поняла, насколько далеко зашли агенты. Компания ранее подтверждала, что модели получили доступ в интернет, использовали похищенные учетные данные и zero-day уязвимости, а в одном случае нашли путь к удаленному выполнению кода на серверах Hugging Face.
После инцидента OpenAI деактивировала исследовательский прототип, усилила изоляцию тестовых сред, мониторинг длинных цепочек действий и контроль интернет-доступа. Компания отдельно признает, что для долгоживущих агентов проверять отдельные действия уже недостаточно - нужно анализировать всю траекторию поведения модели.
История важна тем, что показывает новый класс риска: автономные агенты способны не только самостоятельно искать уязвимости, но и распределять задачи между собой и накапливать результаты в общей инфраструктуре, причем такое поведение может долго оставаться незамеченным человеком.