OpenAI заявила, что предварительные испытания разрабатываемой модели Astra показали настолько высокий уровень автономных возможностей в сфере кибербезопасности, что компания пока не может исключить достижение моделью уровня Critical - максимального порога киберриска в собственной Preparedness Framework.
К категории Critical относится модель, способная без участия человека находить и создавать работающие эксплойты для zero-day уязвимостей разной степени опасности в защищенных реальных системах. Второй критерий - способность самостоятельно разработать и реализовать новую полноценную стратегию кибератаки на защищенную цель, получив от человека лишь высокоуровневую задачу.
Предыдущие модели компании, включая GPT-5.6 Sol, оценивались на уровне High, то есть ступенью ниже. В случае Astra результаты внутренних тестов и оценки специалистов оказались достаточно серьезными, чтобы OpenAI усилить режим безопасности еще до завершения оценки модели. При этом компания отдельно подчеркнула, что Astra не участвовала в недавнем инциденте с инфраструктурой Hugging Face.
Разработчик вводит для Astra изолированные тестовые среды, ограничения сетевого доступа и подключаемых инструментов, усиленную защиту весов модели, шифрование, дополнительный мониторинг и выполнение кода в песочницах. Внутренние работы с Astra, которые пока не соответствуют новым требованиям безопасности, приостановлены.
Кроме того, OpenAI внедрила постоянный мониторинг рискованных действий во всех агентных сценариях Astra - как при обучении, так и во время тестирования. По заявлению компании, системы контроля анализируют ход рассуждений модели и могут инициировать проверку и остановку потенциально опасной активности. К оценке возможностей Astra планируется привлечь государственные структуры и отдельные организации, занимающиеся безопасностью ИИ.
Ситуация примечательна тем, что разработчик фактически усиливает ограничения не после обнаружения конкретной уязвимости в продукте, а из-за возможностей самой модели. Axios и Reuters также сообщают, что разработка Astra была замедлена на фоне результатов кибертестов.
При этом достижение уровня Critical пока не подтверждено окончательно. OpenAI формулирует вывод осторожнее: текущие результаты достаточно высоки, чтобы компания не могла исключить этот уровень до завершения дополнительных испытаний. Именно поэтому говорить, что Astra уже доказанно способна автономно проводить критические кибератаки, пока некорректно.