OpenAI заявила о создании собственной модели, способной автономно искать уязвимости

3 сентября, 2026, 17:57

OpenAI официально объявила о разработке языковой модели Astra, которая, по данным компании, стала первой, достигшей критического порога возможностей в кибербезопасности. Модель способна автономно находить уязвимости нулевого дня и создавать эксплойты, в том числе для критически важных систем. В тестах Astra обнаружила ранее неизвестные уязвимости в браузере и выстроила полную цепочку компрометации вплоть до выполнения команд на хосте.

openai.com

OpenAI готовит новую языковую модель Astra, способную автономно обнаруживать уязвимости нулевого дня и создавать эксплойты. В компании провели новые тесты возможностей нейросети и назвали ее «первой моделью», достигшей критического порога возможностей в области кибербезопасности. Об этом стало известно из официального заявления.

В июне SecPost выпускал материал, посвященный Mythos — ИИ-модели, способной автономно находить и эксплуатировать уязвимости. Нейросеть передана США и союзникам, однако российским компаниям доступ к ней закрыт.

Под «критическим порогом возможностей» организация подразумевает момент, когда для модели требуются максимально строгие меры защиты. Помимо этого, в OpenAI заявили, что в разработке Astra был учтен опыт инцидента с Hugging Face, а сразу же после него все процессы обучения передовых моделей, включая Astra, были приостановлены.

Продолжение ниже

В это же время некоторые крупные циклы обучения с подкреплением (RL) для будущих версий Astra были отложены, пока OpenAI повышала стандарты безопасности среды обучения. 28 августа циклы были возобновлены. Отдельно компания подчеркнула, что существовавшие на тот момент меры защиты предотвратили бы происшествие с Hugging Face.

В новую модель Astra были внедрены более строгие меры защиты, среди которых были выделены обучение ИИ более надежному отклонению вредоносных киберзапросов и добавление защиты от злоупотреблений. К этому также был добавлен мониторинг, способный останавливать потенциально несанкционированные действия.

Компания выделила, что модель достигает критического порога при выполнении некоторых задач: когда ИИ без вмешательства человека выявляет уязвимости нулевого дня любого уровня серьезности и создает эксплойты для критически важных систем, а также когда модель при получении общей цели разрабатывает и реализует новые комплексные стратегии кибератак.

OpenAI сравнила Astra с другой моделью — GPT-5.6 Sol, подчеркнув, что первая имеет больше возможностей в кибербезопасности, эффективно расходуя токены, лучше выявляя уязвимости и разрабатывая эксплойты. К примеру, Astra набрала максимум в ExploitBench — тесте способности создавать эксплойты для известных уязвимостей.

В отдельном варианте теста, в котором использовались 20 недавно раскрытых высокосерьезных уязвимостей V8 за июнь-август 2026 года, Astra чаще, чем GPT-5.6 Sol, добивалась выполнения произвольного кода, при этом используя меньше выходных токенов.

В экспертных тестах модель обнаружила ранее неизвестные уязвимости в браузере и построила полную цепочку компрометации: открытие HTML-файла — выход из песочницы — выполнение команд на хосте. Также Astra нашла несколько уязвимостей в защищенной операционной системе, после чего объединила их в цепочку локального повышения привилегий от обычного пользователя до root. Подобные результаты, по заверению OpenAI, стали ключевыми доводами о том, что модель достигла критического порога.

Главными мерами защиты, необходимыми для критических возможностей, в компании назвали перекрытие двух путей: использование модели злоумышленниками и несанкционированные и несогласованные действия модели. Если первое способно привести к созданию эксплойтов ранее неизвестных уязвимостей и проведению комплексных атак на защищенные цели, то второе — к причинению ущерба со стороны самой модели.

В качестве мер защиты от злоупотреблений OpenAI выделила несколько уровней защиты. К ним относятся отказы самой постобученной модели, системные классификаторы безопасности, автономное обнаружение угроз и противодействие им, а также анализ контекста нескольких разговоров. В тестах компании на киберджейлбрейки Astra отказывала в 91,5% случаев, в то время как GPT-5.6 Sol — всего лишь в 59%.

Киберджейлбрейк ИИ — обход этических и защитных фильтров нейросетей с помощью специально сформулированных промптов.

Отдельное внимание было уделено аккаунтам с повышенным риском, для которых были установлены отдельные меры: модель должна отказывать им в более широком спектре потенциально опасной киберпомощи. Команда OpenAI заявила, что продолжает внутренний и внешний red teaming, а также регрессионные тесты против уже найденных джейлбрейков.

Ко всему прочему, компания внедряет отдельную систему мониторинга несогласованного поведения Astra, которая будет анализировать рассуждения и действия нейросети, искать признаки подозрительного поведения, а также останавливать потенциально вредоносную активность.

Компания планирует предоставить доступ к новой модели в ближайшее время, однако наиболее продвинутые возможности поначалу будут ограничены. Первыми получат доступ альфа-тестировщики, после этого планируется запуск доступа через Daybreak Bleue для защитных сценариев.

При этом, по мнению организации, при выпуске Astra, скорее всего, будет создано больше препятствий, чем необходимо в долгосрочной перспективе, чтобы предотвратить случаи злоупотребления. По этой же причине дополнительные проверки безопасности могут замедлить или приостановить защитные операции в сфере кибербезопасности.

Ранее SecPost писал, что ИИ-агенты стали вдвое чаще выходить из-под контроля. В июле 2026 года число зафиксированных случаев, когда ИИ выходил из-под контроля, почти удвоилось и превысило 300 за месяц. Эксперты предупредили, что каждый выданный инструмент, выданный ИИ-агенту, может стать точкой действия.

Словарь: Эксплойт