OpenAI запускает модель Astra с критическим уровнем киберрисков
CNBC сообщает, что OpenAI начала поэтапное развертывание модели после предупреждения о ее продвинутых кибервозможностях.
Эльдар Гасанов·обновлено 04 сентября 2026 г.

По данным «Хабра», GPT-6 Astra получила 100% в ExploitBench — тесте способности создавать эксплойты для известных уязвимостей. CNBC сообщает, что OpenAI начала поэтапное развертывание модели после предупреждения о ее продвинутых кибервозможностях. Для пользователей программных сервисов это означает смену режима оценки: важен не только ответ модели, но и то, какие действия она способна выполнить самостоятельно через подключенные инструменты.
Модель получила максимальный уровень киберриска
Astra ориентирована на многошаговые задачи. Модель должна не просто сформировать текст, а пройти цепочку действий: написать код, провести исследование, обратиться к инструментам и довести задачу до результата. Именно автономность стала главным фактором риска.
OpenAI классифицировала Astra как Critical по собственному Preparedness Framework. Это максимальный уровень в текущей системе компании. По описанию, такой порог связан со способностью модели без пошагового руководства человека находить и разрабатывать рабочие эксплойты для ранее неизвестных уязвимостей в защищенных системах либо самостоятельно строить и выполнять сквозные стратегии кибератак против хорошо защищенных целей.
100% в ExploitBench не означает, что модель получила универсальный доступ к любым системам. Тест проверяет работу с известными уязвимостями. Но результат показывает, что генерация кода эксплуатации перестает быть исключительно ручной задачей специалиста. Для корпоративных сред это означает необходимость пересмотреть права агентных систем, сетевую сегментацию и журналирование обращений к инструментам.
Защитные ограничения встроены в контур работы
OpenAI отдельно проверяла поведение Astra в сценариях обхода ограничений. В cyber-jailbreak-тестах модель отказалась от 91,5% запрещенных запросов. Для GPT-5.6 Sol этот показатель составил 59%. В тесте с приманочными целями Astra не пыталась обращаться к ним, тогда как Sol без production-защит делала это в 56% случаев.
Эти показатели получены в специально созданных условиях. Они не описывают обычную эксплуатацию моделей при включенных production safeguards. Поэтому сравнение нельзя трактовать как гарантию безопасности. Это замер поведения на отдельных наборах проверок.
Для Astra ввели отдельный мониторинг действий и рассуждений. Система анализирует цепочку операций и обращения к инструментам, после чего может автоматически остановить потенциально несанкционированную активность. Побочный эффект уже обозначен: механизм способен блокировать и легитимные операции, особенно в длинных агентных сценариях.
Это принципиальная деталь для разработчиков. Чем больше у модели полномочий, тем выше цена ошибки классификатора. Ложная блокировка снижает доступность сервиса. Пропущенное действие может затронуть файловую систему, репозиторий кода или внешнюю инфраструктуру. В таком режиме телеметрия и аудит становятся не вспомогательными функциями, а частью модели угроз.
Доступ расширяют постепенно
Широкий доступ к Astra пока разворачивается поэтапно. На первом этапе наиболее продвинутые кибервозможности ограничены. Позднее OpenAI планирует расширять защитное применение через программу Daybreak Blue.
Безопасность повлияла и на обучение модели. После инцидента с Hugging Face OpenAI на две недели приостанавливала часть frontier training, чтобы усилить изоляцию вычислительной инфраструктуры, сетевые ограничения, мониторинг и alignment training. Крупный frontier RL-run был возобновлен 28 августа после внедрения новых требований в тренировочную среду. Некоторые небольшие экспериментальные запуски при этом продолжали откладываться.
Еще до запуска Astra OpenAI публиковала результаты работы внутренней версии над десятью математическими и теоретико-компьютерными задачами. Для них компания предоставила формально проверяемые доказательства в Lean 4. Такой формат позволяет машинно проверить корректность доказательства, но не превращает результаты в универсальный рейтинг интеллекта.
Для конечного пользователя практический вывод ограничен: ранний доступ к Astra не следует воспринимать как обычное обновление чат-бота. При подключении модели к коду, облачным хранилищам и внешним API нужно проверять область разрешений, наличие журналов действий и возможность аварийной остановки. У агентной системы опасен не только проприетарный код внутри модели. Опасен контур, в который ей выдали доступ.
Для сравнения, обычный цифровой релиз может ограничиться локализацией — например, корейская версия хита I Got Your Back при участии JISOO и MOMOKA — тогда как у агентной модели поэтапное расширение функций одновременно меняет и поверхность атаки.