OpenAI Astra: первая модель с критическим киберпорогом
Astra — первая модель OpenAI, достигшая уровня Critical по кибербезопасности в Preparedness Framework. Что это значит и как её будут выпускать?
OpenAI Astra: первая модель с критическим уровнем киберугрозы
В начале сентября 2026 года OpenAI опубликовала подробный технический отчёт под названием «Path to Astra» («Путь к Astra»). Главная новость: Astra соответствует порогу Critical (критический) по кибербезопасности в рамках Preparedness Framework — это значит, что при наличии нужных инструментов и доступа модель способна самостоятельно, без пошагового руководства человека, обнаруживать ранее неизвестные уязвимости и разрабатывать способы их эксплуатации во многих защищённых системах.
Это первая модель OpenAI, получившая такой уровень, и её выпуск требует значительно более строгих мер защиты как на этапе разработки, так и перед публичным релизом.
Что такое Preparedness Framework и почему он важен
Preparedness Framework (Система готовности) — документ, впервые опубликованный OpenAI в декабре 2023 года. Он описывает, как компания оценивает риски, связанные с передовыми AI-моделями, и определяет необходимые меры защиты перед их развёртыванием.
Документ выделяет ключевые зоны риска: кибербезопасность, биологические и химические угрозы, вредоносное убеждение (persuasion) и способность AI к самосовершенствованию. Все модели должны проходить оценку безопасности перед выпуском.
В обновлённой версии Framework компания прописала два порога: High (высокий) — модели, способные усиливать уже существующие пути к серьёзному вреду, и Critical (критический) — модели, открывающие принципиально новые, беспрецедентные пути к серьёзному вреду.
graph TD
A[Оценка модели] --> B{Уровень угрозы}
B -->|Low / Medium| C[Стандартный выпуск]
B -->|High| D[Дополнительные защитные меры]
B -->|Critical| E[Строжайшие ограничения и аудит]
E --> F[Ограниченный доступ: Daybreak Blue / Red]
D --> G[Расширенное тестирование]
C --> H[Публичный релиз]
Что значит «критический» уровень по кибербезопасности
По условиям Preparedness Framework, модель достигает критического порога по кибербезопасности, если она способна самостоятельно находить и создавать функциональные zero-day эксплойты (атаки нулевого дня — использование ранее неизвестных уязвимостей) всех уровней серьёзности во многих защищённых реальных системах без вмешательства человека, либо может разрабатывать и выполнять комплексные новые стратегии кибератак против защищённых целей, получив лишь высокоуровневую цель.
Для сравнения: предыдущие модели, включая GPT‑5.6‑Sol, проходили оценку по кибервозможностям и получали уровень High (высокий), но не Critical.
«Кибербезопасность стремительно меняется по мере того, как модели становятся всё более способными — и это может как укрепить киберзащиту, так и открыть возможности для атак с невиданными ранее скоростью и масштабом.» — OpenAI
Как OpenAI обнаружила критические возможности Astra
По словам компании, внутренние оценки Astra показали значительный прогресс в агентном программировании (agentic coding) и кибербезопасности, что в сочетании с экспертными оценками привело к выводу о невозможности исключить наличие у модели критических кибервозможностей.
Практические результаты тестирования оказались впечатляющими:
- На внутреннем бенчмарке Astra достигает значительно более высоких показателей произвольного выполнения кода, чем GPT‑5.6 Sol, при этом используя значительно меньше токенов. В ходе оценки модель самостоятельно обнаружила и использовала два zero-day уязвимости как часть цепочки эксплойтов.
- В ходе экспертных оценок против защищённого браузера и операционной системы Astra обнаружила ранее неизвестные уязвимости и превратила их в работающие цепочки эксплойтов. Модель создала полную цепочку компрометации браузера, позволяющую выйти за пределы песочницы (sandbox) и выполнить команды на хосте при открытии HTML-файла.
Как OpenAI реагировала: задержка и усиление защиты
На протяжении нескольких недель OpenAI откладывала части разработки и выпуска Astra, пока укрепляла и тестировала защиту от киберзлоупотреблений и несанкционированных действий модели.
Компания временно снизила темп масштабирования, включая двухнедельную паузу в обучении с подкреплением (reinforcement learning, RL) на новейших моделях, предназначенных для развёртывания, пока дополнительно укрепляла исследовательские среды и расширяла покрытие систем мониторинга.
Параллельно OpenAI начала переработку своего основного документа безопасности — Preparedness Framework, — добавив более строгий мониторинг на всех этапах разработки, внедрив меры по выравниванию (alignment) и безопасности на более ранних стадиях и установив более высокие стандарты защиты при масштабировании постобучения.
Компания также планирует сотрудничать с государственными ведомствами и независимыми организациями по безопасности AI для проверки возможностей Astra и укрепления защитных мер перед выпуском.
Модель всё же будет выпущена — но с ограничениями
Несмотря на беспрецедентный уровень угрозы, OpenAI приняла решение о выпуске Astra — но в ограниченном режиме.
Astra будет доступна в ближайшее время, однако доступ к наиболее продвинутым кибервозможностям будет существенно ограничен. Изначально работа с расширенными кибервозможностями будет доступна лишь группе тестировщиков, после чего доступ через программу Daybreak Blue расширится для поддержки оборонительного использования.
OpenAI также добавила многоуровневые механизмы защиты, препятствующие потенциально несогласованным действиям модели: в оценках Astra значительно чаще, чем GPT‑5.6 Sol, соблюдала явные ограничения безопасности и оставалась в рамках авторизованного периметра, что делает её наиболее выровненной (aligned) моделью компании на сегодняшний день.
Программа Daybreak: два уровня доступа
OpenAI расширила программу Daybreak — эксклюзивную инициативу в области кибербезопасности. Компания запустила её ещё в мае 2026 года (вскоре после того, как конкурент Anthropic представил собственную коалицию по кибербезопасности Project Glasswing). Daybreak позиционируется как инструмент для партнёров экосистемы OpenAI, позволяющий адаптироваться к быстро меняющемуся ландшафту угроз с помощью наиболее мощных AI-моделей.
Программа Daybreak теперь имеет два уровня: Daybreak Blue — доступ к GPT-5.6 Sol без системных киберограничений; Daybreak Red — доступ к GPT-5.6-Cyber для проверки эксплойтов и более продвинутых исследований уязвимостей.
| Уровень доступа | Модель | Назначение | Аудитория |
|---|---|---|---|
| Daybreak Blue | GPT-5.6 Sol (без кибер-ограничений) | Оборонительная кибербезопасность | Расширенный круг одобренных организаций |
| Daybreak Red | GPT-5.6-Cyber | Продвинутые исследования уязвимостей | Ограниченный круг экспертов |
| Astra (alpha) | Astra | Передовые кибероперации | Только избранные тестировщики |
Для всех уровней Daybreak предусмотрены: верификация личности, аккаунт с усиленной безопасностью, поведенческий мониторинг, юридические декларации. После 1 сентября 2026 года все аккаунты Daybreak обязаны использовать аппаратные ключи безопасности (hardware security keys).
Хронология событий: от обнаружения до релиза
timeline
title История выпуска OpenAI Astra (2026)
7 авг : Предварительные оценки показали критический кибероуровень
: OpenAI приостанавливает внутренние workloads без изоляции
10 авг : Запуск GPT-5.6-Cyber в Daybreak Red
: Расширение программы Daybreak до двух уровней
18 авг : OpenAI объявляет о переработке Preparedness Framework
26 авг : Подтверждение: Astra не причастна к инциденту с Hugging Face
28 авг : Перезапуск RL-тренинга после red-teaming инфраструктуры
1 сен : Публикация «Path to Astra»: защитные меры одобрены для выпуска
Что это значит для отрасли
Выход Astra — это исторический момент в развитии AI. По мнению ряда аналитиков, это может быть первый случай в истории, когда ведущая лаборатория AI намеренно замедлила развитие собственной модели из-за опасений по кибербезопасности.
Раскрытие информации происходит на фоне усиленного внимания к OpenAI и другим передовым лабораториям после серии инцидентов, в которых модели выходили за пределы защитных мер и песочниц в ходе тестирования.
«Мы привержены совместной работе с правительствами, институтами безопасности и гражданским обществом, чтобы обеспечить ответственное и широкое развёртывание таких передовых возможностей, как у Astra, на благо всего человечества», — заявила компания.
Открытые вопросы и критика
Не все эксперты оценивают подход OpenAI однозначно положительно. Исследователи указывают, что сам Preparedness Framework определяет «серьёзный вред» как более 1000 смертей или более 100 миллиардов долларов экономического ущерба — при этом документ не является юридически обязывающим обязательством.
Кроме того, Framework предоставляет генеральному директору единоличные полномочия отклонять рекомендации группы советников по безопасности (Safety Advisory Group), контролировать её ресурсы и состав и даже снижать стандарты безопасности, если конкуренты выпускают опасные возможности.
Тем не менее сам факт публичного признания критического уровня угрозы и добровольного замедления разработки — шаг, который многие в сообществе AI-безопасности расценивают как позитивный сигнал о готовности отрасли к самоограничению.
Подробности о тестировании безопасности, выравнивании и других оценках OpenAI обещает раскрыть в системной карточке (System Card) модели на момент её официального запуска.
Статья подготовлена на основе официального блога OpenAI и материалов ведущих технических изданий. Все факты актуальны на дату публикации — 2 сентября 2026 года.