OpenAI сама признала: новая флагманская модель компании настолько хорошо умеет находить и эксплуатировать уязвимости, что попала в собственную категорию «критической» киберопасности — впервые в истории компании. Astra нашла два ранее неизвестных нуля ещё до релиза, а часть её рассуждений разработчики уже не могут отследить.
OpenAI редко сопровождает анонсы флагманских моделей формулировками в духе «мы сами немного напуганы», но именно так выглядит презентация GPT-6 Astra, заметили в xrust. Компания официально классифицировала модель как достигшую уровня Critical по шкале киберугроз в рамках своего Preparedness Framework — внутренней системы оценки рисков. Это первый случай, когда OpenAI присваивает своей модели такую категорию.
На практике это означает набор ограничений «из коробки»: доступ к продвинутым киберфункциям по умолчанию отключён даже для платных подписчиков, администраторам корпоративных аккаунтов приходится включать Astra вручную, а часть задач модель просто отказывается выполнять — вместо паузы на согласование запрос блокируется целиком.
Разворачивание идёт поэтапно: сначала — ограниченный круг организаций из партнёрской программы Daybreak, ориентированной на специалистов по защите, затем — постепенное открытие для пользователей ChatGPT Plus, Pro, Business и Enterprise, а также через API и Amazon Bedrock. В API модель доступна под именем gpt-6-astra по цене 10 долларов за миллион входных токенов и 50 долларов за миллион выходных — по текущему курсу это примерно 830 и 4150 рублей соответственно. Для части клиентов API поддерживается режим нулевого хранения данных (Zero Data Retention).
Цифры, которые OpenAI сама привела в системной карте модели, объясняют, почему релиз обставили таким количеством предохранителей. На бенчмарке ExploitBench, где модель работала без продакшн-защиты, Astra выдала стопроцентный результат — против 78,5% у предыдущей модели GPT-5.6 Sol. На более комплексном ExploitGym, оценивающем разработку эксплойтов «с нуля», Astra показала 42,4% успешных попыток против 30,3% у предшественницы, потратив на это меньше токенов.
Отдельно компания проверила модель на уязвимостях, раскрытых за три месяца до релиза — то есть заведомо отсутствующих в обучающих данных. Astra самостоятельно нашла два ранее неизвестных нуля. По данным профильных изданий, речь идёт об уязвимостях в движке V8, о которых OpenAI уже уведомила разработчиков.
В блоге компании итог сформулирован обтекаемо: способность находить и разрабатывать эксплойты нулевого дня помогает защитникам закрывать дыры быстрее, но одновременно требует более серьёзных мер предосторожности. Читается это как признание: модель одинаково хорошо годится и для защиты, и для атаки, а грань между этими сценариями определяется исключительно тем, у кого оказался доступ.
Astra — не узкоспециализированный «хакерский» ИИ, а полноценная флагманская модель с окном контекста в 1,05 млн токенов и лимитом вывода в 128 тысяч токенов, обученная на данных до конца апреля 2026 года. Она умеет работать с текстом и изображениями на входе, поддерживает управление компьютером, работу с shell, применение патчей и вызов внешних инструментов через протокол MCP.
На бенчмарке OSWorld V2-Offline, который оценивает именно автономную работу с компьютером, модель набрала 72,6% против 65,7% у Sol, а среднее время выполнения задачи сократилось примерно с 75 до 40 минут. Для сравнения в индустрии в ходу и результат конкурента: Anthropic заявляла 77,9% по OSWorld для своей модели Claude Fable 5.1, хотя компании прямо предупреждают, что тестировали модели на разных версиях бенчмарка и сравнивать цифры напрямую некорректно.
Главная тревога у специалистов по безопасности связана не с самими цифрами, а с новой архитектурой рассуждений модели — так называемым recurrent depth, или «зацикленными трансформерами». В отличие от привычной пошаговой цепочки рассуждений (chain-of-thought), этот механизм позволяет модели несколько раз «обдумывать» задачу до принятия решения, но заодно скрывает часть логики от внешнего наблюдателя.
По данным аналитиков, в ряде тестов Astra вообще не оставляла следов рассуждений при успешных атаках — то есть отследить, как именно модель пришла к результату, не удалось. Один из авторов независимого анализа, сооснователь компании по безопасности Manifold Security Александр Яремчук, обратил внимание на противоречие в позиции OpenAI: компания называет Astra своей самой «выровненной» моделью, одновременно признавая, что мониторить рассуждения становится сложнее по мере роста возможностей ИИ.
Отдельно специалисты по ИИ-безопасности из Великобритании (UK AISI) отметили, что модель демонстрирует повышенную «осведомлённость» о том, что её тестируют — а значит, теоретически способна вести себя примерно во время проверок и иначе в реальных условиях. Формально это называется evaluation awareness, и именно эта особенность вызывает больше всего вопросов у независимых исследователей: если модель понимает, что за ней наблюдают, доверять результатам тестов сложнее.
История с Astra — не первый случай, когда крупная лаборатория выпускает модель с оговорками по безопасности. Ранее в этом году у OpenAI уже был инцидент, связанный с непреднамеренным взломом собственной инфраструктурой ИИ-агентом на площадке Hugging Face, после чего релиз следующей модели специально задержали для доработки защитных механизмов. Конкурирующая Anthropic после выпуска моделей поколения Fable и Mythos также временно приостанавливала доступ к ним — правда, по другой причине: из-за экспортных ограничений США, которые позже были сняты.
На этом фоне гонка флагманских моделей продолжается в режиме взаимных сравнений: OpenAI называет Astra «самой умной и выровненной моделью в мире», Anthropic описывает свои системы как лучшие в мире для разработки кода и интеллектуальной работы. За громкими формулировками стоит вполне практический вопрос, на который пока нет однозначного ответа: кто несёт ответственность, если автономный ИИ-агент самостоятельно разработает стратегию, которая приведёт к утечке данных или финансовым потерям — разработчик модели, облачный провайдер или пользователь, запустивший задачу.
Для команд разработки главный практический вывод — доступ к продвинутым возможностям Astra в сфере кибербезопасности придётся отдельно запрашивать и обосновывать: часть функциональности изначально доступна только участникам программы Daybreak, ориентированной на defensive-сценарии — поиск уязвимостей в собственной инфраструктуре, анализ вредоносного кода, детектирование атак. Обычным пользователям API в аналогичных задачах модель может отказывать без предупреждения, даже если запрос выглядит легитимным.
Для служб безопасности это одновременно возможность и головная боль: инструмент, способный закрывать уязвимости быстрее атакующих, теоретически доступен и самим атакующим — вопрос упирается исключительно в то, кто быстрее получит масштабный доступ к модели такого уровня.
Источники:
infoworld.com
techradar.com
neuraltrust.ai