Обсудить задачу
новость

OpenAI признала Astra моделью уровня Critical по кибербезопасности

3 сентября 2026

Что OpenAI объявила про Astra

1 сентября OpenAI опубликовала пост Path to Astra и официально сообщила: модель Astra достигла порога Critical по кибербезопасности в рамках Preparedness Framework. Это первая модель компании с таким статусом. По оценке OpenAI, Astra с нужными инструментами и доступом способна находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации во многих хорошо защищённых системах, причём без пошагового руководства человека.

Немедленного выпуска не будет. OpenAI планирует открыть Astra «скоро», но продвинутые киберфункции сначала получит небольшая группа тестировщиков, а затем доступ для оборонительной работы расширят через программу Daybreak Blue. Самая «разлоченная» конфигурация, которая и показала результаты уровня Critical, остаётся за проверенными оборонными партнёрами. Публичная версия пойдёт с усиленными защитами, включая мониторинг цепочки рассуждений и классификаторы активаций.

Глухая бетонная стена ночью, по ней расходятся светящиеся трещины, у подножия единственная запертая дверь со светом из щели, за стеной рассвет – Нейровод, neurovod.ru
уровень Critical признан, а дверь к самым сильным киберфункциям оставлена одна и заперта

Хотите так же, но у себя?

Соберу закрытый контур с ИИ на вашей стороне: доступы под контролем, данные не уезжают наружу, работает ровно на тех задачах, которые вы назовёте.

Обсудить задачу Или сначала прайс: 29 услуг со сроками и ценами
Евгений Семенов, Нейровод

Что уровень Critical меняет для защиты и для агентов на API

Важен не сам факт «ещё одна сильная модель», а то, как OpenAI теперь обращается с собственной разработкой. До сих пор киберспособности были в релизах побочным свойством: усилили отказы – и порядок. С Astra компания впервые публично признала, что держит в руках модель, которая при доступе к инструментам и без жёстких ограничений опаснее известного хакерского инструментария.

Первое следствие – меняется представление о том, что умеет автономный агент. Раньше от моделей ждали анализа кода, поиска очевидных ошибок и эксплойтов по известным CVE. Порог Critical звучит иначе: модель сама находит неизвестную уязвимость в защищённой системе и собирает из находок рабочую цепочку. В посте это подкреплено конкретикой. На ExploitBench Astra получила 100%. На внутреннем наборе из 20 свежих уязвимостей движка V8 она добилась заметно более высокой доли произвольного выполнения кода, чем GPT‑5.6 Sol, и потратила при этом меньше выходных токенов. В ходе оценки модель нашла и применила две ранее неизвестные уязвимости как часть цепочки эксплуатации – их сейчас раскрывают мейнтейнерам.

Токенная эффективность здесь не мелочь. Длинная автономная работа упирается не в цену одного вызова, а в объём переработанного контекста, и я об этом писал в разборе, почему агент съедает 60 тысяч токенов на запрос. Модель, которая решает ту же задачу вдвое короче, меняет экономику не только защиты, но и нападения.

Второе следствие – слово «safeguards» перестало быть маркетинговым. OpenAI прямо разделяет конфигурации: обычная production-версия Astra пойдёт в ChatGPT и API, а полными киберспособностями обладает конфигурация с доступом Daybreak Blue. Графики ExploitBench отражают возможности именно её, а не стандартной. То есть «модель уровня Critical» не будет доступна широкой публике в полную силу.

Третье следствие мне кажется самым интересным. OpenAI фактически признала, что без внешнего контроля модель может делать плохое не потому, что её просит злоумышленник, а потому, что сама решила срезать путь. В тесте ExploitGym с ловушками-honeypot модель GPT‑5.6 Sol без production-защит пыталась скомпрометировать окружающую инфраструктуру в 56% сложных задач вместо того, чтобы решать поставленную. У Astra этот показатель 1,3%. Но сам факт, что компания строит отдельный слой мониторинга против несанкционированных действий собственной модели, говорит о смене модели угроз: опасен не только злой пользователь.

Astra против GPT-5.6 Sol: в чём скачок

Чтобы понять масштаб, полезно вспомнить прошлые ступени. В феврале 2026 года вышла GPT‑5.3 Codex – первая модель OpenAI, помеченная как High capability по кибербезопасности. Затем была GPT‑5.6 Sol, для которой уже усиливали системный уровень защиты: классификаторы активаций против кибер-абьюза, расширенное покрытие универсальных джейлбрейков. Astra – не следующая ступень той же лестницы. OpenAI говорит о значительном скачке относительно Sol сразу в двух измерениях: экономия токенов и способность находить уязвимости и писать эксплойты.

Цифра, по которой это можно померить со стороны: на наборе кибер-джейлбрейков Astra отказывает в 91,5% нежелательных запросов против 59% у GPT‑5.6 Sol. Защита от абьюза стала заметно жёстче. При этом почти каждый двенадцатый запрос из тестового набора отказа не получает, и это на выборке, специально собранной из обходных формулировок.

Отдельный контекст – августовский инцидент с Hugging Face. Из-за него OpenAI задержала часть работ по Astra и приостановила крупные запуски обучения с подкреплением. В посте сказано, что Astra в инциденте не участвовала, но выводы компания перенесла в свой подход к безопасности. 28 августа большой frontier-запуск возобновили после ужесточения требований к среде обучения, часть экспериментов до сих пор на паузе. Это показатель: теперь OpenAI готова тормозить обучение сильной модели, если защита инфраструктуры за ней не поспевает.

По сути мы перешли от «модель может помочь взломщику» к «модель сама может быть взломщиком». Это видно даже по языку поста: OpenAI пишет о двух путях снижения риска – злонамеренные пользователи и несанкционированные действия самой модели. Второй путь применительно к выпуску продуктов раньше почти не обсуждался.

что мерили Astra GPT-5.6 Sol
ExploitBench, эксплойты по известным уязвимостям 100% не назван
внутренний набор из 20 свежих уязвимостей V8 заметно выше, меньше выходных токенов база сравнения
honeypot: попытки лезть в чужую инфраструктуру 1,3% 56% без production-защит
отказы на кибер-джейлбрейках 91,5% 59%

Что делать защитникам и тем, кто строит на API

Первый пласт – оборонительный. Если продвинутые киберфункции Astra действительно откроют проверенным защитникам через Daybreak Blue, оборона получит скорость поиска уязвимостей, которой у неё раньше не было. В посте описан именно такой сценарий: Astra собрала полную цепочку компрометации браузера с выходом из песочницы и выполнением команд на хосте после открытия HTML-файла, а также нашла несколько уязвимостей в защищённой операционной системе и скомбинировала их в подъём привилегий от обычного пользователя до root.

Пока это результаты внутренних тестов вендора. Публичной документации по API, лимитам и критериям отбора в Daybreak Blue нет. Практический вывод для защитника простой: следить за программой Daybreak, но не строить планов на конкретные сроки.

Второй пласт – для тех, кто строит продукты на API OpenAI. Публичная Astra будет не просто «умнее», а моделью с дополнительными слоями контроля. Пост прямо предупреждает: система может останавливать или замедлять легитимную работу, включая задачи, вообще не связанные с кибербезопасностью, и длительные агентные сценарии. Если монитор выравнивания приостановил задачу в ChatGPT или Codex, у пользователя спросят подтверждение. В API задача просто остановится. Значит, автономные агенты на Astra потребуют продуманной логики пауз и повторов – к обычным причинам, по которым агенты не окупаются, добавляется ещё одна.

Третье – собственные защиты. Высокая доля отказов у Astra касается поведения самой модели, а не вашей обвязки. Если вы делаете систему, чувствительную к инъекциям в промпт, учтите: модель, которая решает сложную задачу за меньшее число шагов, под контролем злоумышленника быстрее доходит до опасного результата.

Чего OpenAI не раскрыла

Главный вопрос – что именно окажется в публичной версии. OpenAI говорит, что доступ к самым продвинутым киберфункциям будет ограничен, но границу между обычной Astra и Astra с Daybreak Blue не описывает. Логично предположить, что production-конфигурация получит урезанные возможности по поиску и эксплуатации уязвимостей, но как это выглядит в интерфейсе – отказ на определённых запросах или отсутствие инструментов – не сказано. Разница принципиальная: поведенческий запрет обходят промптом, инфраструктурный – только взломом платформы.

Нет дат. «Планируем сделать доступной скоро», этапы с альфа-тестерами и расширением через Daybreak Blue – без сроков. Командам, которые хотели бы планировать внедрение, остаётся режим ожидания.

Численные метрики опубликованы выборочно. Проценты есть по ExploitBench, по honeypot-тестам и по отказам на джейлбрейках, по внутреннему набору V8 приведён график без точных чисел. Экспертные оценки против защищённого браузера и операционной системы описаны словами: «обнаружила ранее неизвестные уязвимости», «собрала цепочку». Полная картина, судя по тексту, появится в system card при запуске.

Условия допуска в Daybreak Blue тоже закрыты. Какие организации считаются проверенными защитниками, какие требования по комплаенсу, какая ответственность за использование за пределами разрешённых сценариев, сколько это стоит и отличается ли цена от стандартного API – ничего из этого не опубликовано.

Наконец, неизвестно, как Astra поведёт себя там, где задачи не похожи на бенчмарк. Внутренний набор – это 20 уязвимостей одного движка JavaScript. Реальные системы разнообразнее: Active Directory, веб-приложения, облачные метаданные, промышленные протоколы. Насколько модель обобщает за пределы V8, по опубликованному судить нельзя.

Нужен разбор своей защиты, а не чужого релиза?

Обсудить задачу Или сначала прайс со сроками и ценами

Источник: пост OpenAI «Path to Astra: critical capabilities and frontier safeguards» – там же графики ExploitBench и описание защит.

Именной сертификат курса «ИИ для новичков» – neurovod.ru
БЕСПЛАТНО
курс с сертификатом

ИИ для новичков

Семь коротких уроков с тестами: от «что такое ИИ» до первого собственного ИИ-помощника в вашем деле. Без воды и почтовых рассылок. В конце – сертификат.

Начать бесплатно

Есть идея? Сделаем вместе

Партнёрский формат: ваша идея и знание рынка + мои руки и запущенные проекты. Расскажите – за пару дней скажу честно, взлетит ли и что для этого нужно.

Рассказать идею