Xora AI Искусственный
интеллект
Проверить готовность
01ИИ-трансформация 02Направления 03Продукты 04Обучение 05Кейсы 06Блог 07Контакты
Проверить готовность

Новости ИИ

OpenAI признала Astra моделью уровня Critical по кибербезопасности: что менять в защите закрытого контура

1 сентября 2026 года OpenAI заявила, что модель Astra соответствует порогу Critical cybersecurity capability: она способна сама находить zero-day и разрабатывать эксплоиты без пошагового участия человека. Для российских компаний это меняет не список инструментов, а базовые допущения риск-модели.

Что произошло

7 августа 2026 года OpenAI опубликовала материал «Responding to the next frontier of critical cyber capabilities», где сообщила, что по итогам внутренних бенчмарков и экспертных оценок не может исключить наличие у модели Astra критических кибервозможностей, и приостановила часть внутренних активностей с этой моделью до внедрения усиленных контролей. Формулировка порога в документе прямая: модель достигает уровня Critical cybersecurity, если способна идентифицировать и разрабатывать рабочие zero-day-эксплоиты всех уровней критичности в большом числе защищённых реальных критических систем без вмешательства человека — либо разрабатывать и выполнять сквозные новаторские стратегии атак, получив только высокоуровневую цель.

1 сентября 2026 года вышел пост «Path to Astra: critical capabilities and frontier safeguards», в котором компания сделала следующий шаг: теперь OpenAI считает, что Astra соответствует порогу Critical cybersecurity capability по своему Preparedness Framework. Формулировка: при наличии правильных инструментов и доступа модель может находить ранее неизвестные уязвимости и разрабатывать способы их эксплуатации во множестве хорошо защищённых систем без того, чтобы человек направлял каждый шаг. Параллельно опубликован материал о темпах разработки в «cyber-critical» эпоху: самый строгий уровень safeguard’ов, обязательный мониторинг всех запусков Astra с инструментами — не только RL-обучения, но и инференса, — ограничения по доступу.

Организационная часть не менее показательна, чем техническая. Astra была допущена к релизу после двухнедельной остановки RL-обучения всех моделей и введения новых правил быстрого отключения подозрительной активности. Расширенные киберфункции получают только участники ограниченной партнёрской программы Daybreak Blue; публичный релиз «обрезанной» версии обещан «скоро». Цены и публичные лимиты по Astra не раскрыты — коммерческим продуктом в обычном смысле она пока не является.

Контекст задан не только OpenAI. Google уже запустила Gemini 3.8 Flash Cyber — security-ориентированный вариант, доступный исключительно «trusted defenders» через программу Fairwind. Anthropic 1–2 сентября 2026 года выпустила Claude Fable 5.1 и Claude Mythos 5.1 с пакетом Enterprise Frontier Safeguards для корпоративных клиентов. Складывается отраслевая норма: сильные наступательные возможности выдаются не по подписке, а по допуску — и это первое, что стоит перенести в собственные политики.

Как это устроено

Порог Critical: разница между «помощником» и «оператором»

Preparedness Framework различает уровень High — усиление существующих путей к тяжёлому вреду — и уровень Critical, то есть создание качественно новых путей, для которых нет прецедента в модели угроз. GPT-5.6-Cyber, представленный 10 августа 2026 года на базе GPT-5.6 Sol и специально натренированный на сложные задачи кибербезопасности, OpenAI по-прежнему относит к уровню High. Astra — первый случай, когда лаборатория публично признала уровень Critical по кибербезопасности. Практический смысл этого разграничения: High меняет производительность атакующего, Critical меняет состав атакующего — команда специалистов заменяется процессом.

Агентный контур, а не текстовая подсказка

Ключевой сдвиг не в качестве генерации кода, а в способности прогонять полный цикл многократно и автономно. Бенчмарк 3CB показывал, что GPT-4o и Claude 3.5 Sonnet справляются с разведкой, бинарным анализом, веб-эксплуатацией — но как интерактивные ассистенты с человеком в контуре. Исследование pacebench 2025 года прямо утверждало, что модели того поколения не представляют значительной угрозы в автономной кибер-эксплуатации. Разница между тем состоянием и Astra — наличие agent-harness, инструментов и права на длинные последовательности действий без подтверждения оператора.

Экономика: стоимость подготовки атаки падает, объём находок растёт

Формулировка «ИИ снижает порог входа» стала общим местом, но у неё есть измеримая сторона. Британский AISI фиксирует: длина задач, которые фронтир-модели выполняют автономно в узком кибер-сценарии, удваивается каждые несколько месяцев — то есть возможности растут быстрее, чем политики и контроль. По оборонительную сторону цифра тоже есть: продукт Wiz Red Agent за первый месяц работы нашёл более 17 000 уникальных уязвимостей примерно в 1 000 клиентских сред, включая критическую BOLA-уязвимость в API крупной авиакомпании. Whitepaper Cloud Security Alliance констатирует переход LLM-автоматизации эксплуатации от демонстраций к операционному применению.

Режим доступа как элемент архитектуры безопасности

OpenAI реорганизовала программу Daybreak, запущенную в мае 2026 года вместе с агентной платформой Codex Security, в два уровня: Blue — оборонительный фокус и доступ к ограниченным фронтир-кибер-моделям для защиты, и Red — специально обученные модели для авторизованных исследований уязвимостей, валидации эксплоитов и пентестов. Доступ — только для проверенных организаций и экспертов, публичных тарифов и квот нет. IBM и другие партнёры входят в программу, чтобы встраивать такие модели в SOC, SIEM и SOAR. Государственный сегмент двигается тем же путём: платформа GenAI.mil Минобороны США теперь включает кастомные версии ChatGPT и Grok for Government в дополнение к ранее интегрированному Gemini.

Ограничения и критика

Часть экспертов указывает, что формулировка «не можем исключить Critical» — не то же самое, что формальное присвоение рейтинга, и что до 1 сентября OpenAI сама подчёркивала незавершённость оценки. Отчёт CNAS предупреждает о возможном «драматичном и опасном» сдвиге баланса в пользу атакующих при широком распространении автономных систем. Отдельная линия критики — сам факт выпуска мощных кибер-моделей даже в защищённых режимах: остаются риски утечки весов, злоупотребления легальным доступом и использования результатов за пределами авторизованных сред. Для риск-модели предприятия это означает, что защищённый режим доступа у вендора не является вашим контролем — это его контроль, и он может отказать.

Как это выглядит на практике

Первый сценарий — непрерывный автономный red-teaming вместо календарного пентеста. Логика Wiz Red Agent, Snyk Evo COS, BugBase Pentest Copilot Enterprise одинакова: агент работает постоянно, а не два раза в год, и генерирует поток находок, который нужно уметь принимать. По нашему опыту проектов именно приём становится узким местом: 17 000 находок за месяц в тысяче сред — это нагрузка не на безопасность, а на процесс приоритизации и на владельцев систем. Компания, у которой нет SLA на устранение и владельца по каждому активу, получает от такого инструмента не защиту, а архив претензий.

Второй сценарий — собственный ИИ-агент как новая точка компрометации. В типовом сценарии агент получает токен к репозиторию, права в CI/CD, сервисную учётную запись в базе и доступ к внутреннему API — потому что «иначе он бесполезен». Дальше применимы атаки из OWASP Agentic Top 10: prompt-инъекция через тикет или комментарий в коде, отравление памяти и RAG-индекса, злоупотребление идентичностью, захват цели, каскадные ошибки. Публичные разборы, включая инцидент с инфраструктурой Hugging Face, показывают, что агент, получивший возможность действовать во внешней среде, приводит к последствиям и для владельца, и для партнёров.

Третий сценарий — SOC, в котором ИИ-ассистент уже работает, но не описан в модели угроз. На российском рынке доступны BI.ZONE Cubi, ByteDog, Innostage TDIR, Kaspersky KIRA, MaxPatrol BAD, PT Naira, RuSIEM Analytics, Security Vision AI — в основном как ассистенты аналитика, а не автономные эксплойт-агенты. Проблема, которую мы видим регулярно: ассистент подключён к SIEM с широкими правами чтения, его запросы не логируются отдельно, а его вывод считается доверенным. Это создаёт канал, через который манипуляция входными данными превращается в манипуляцию решениями дежурной смены.

Что это значит для российской компании

Прямой доступ к Astra, Daybreak и GPT-5.6-Cyber для российских организаций в открытых источниках не подтверждён; с учётом санкционного контекста и практики отказа в обслуживании российских юрлиц исходить нужно из недоступности. Юридическая сторона добавляет ограничений: вывод охраняемой информации за периметр при работе со значимыми объектами КИИ упирается в требования по эксплуатации КИИ и ответственность по ст. 274.1 УК РФ. Публично подтверждённого российского аналога уровня Critical — модели, самостоятельно находящей zero-day в множестве защищённых реальных систем, — нет. Практический вывод: возможности такого класса нужно закладывать в модель нарушителя, а не в план закупок.

Регуляторный фон за пределами России тоже влияет на договорную работу: Еврокомиссия направила информационные запросы более чем 30 ИИ-компаниям как предварительный шаг к расследованиям по EU AI Act, а ChatGPT обозначен как VLOSE в рамках Digital Services Act. Это означает рост объёма документации, которую вендор обязан вести, — и её можно требовать в договоре.

Направление Что было до сентября 2026 Что меняется Влияние на бюджет и процессы
Модель нарушителя Квалифицированная группа, ограниченная временем и людьми Автономный агент, работающий непрерывно; длина автономных задач удваивается за месяцы Пересмотр модели угроз, переоценка «непубличности» контура как защитной меры
Пентест 1–2 раза в год, отчёт в PDF Непрерывный red-teaming, поток находок Рост затрат на устранение и приоритизацию, а не на само тестирование
Собственные ИИ-агенты Инструмент разработки, вне риск-реестра Привилегированный субъект доступа Отдельный threat model, изоляция, логирование каждого вызова инструмента
SOC Правила и корреляция по хостам и сети Телеметрия действий агентов, поведенческая аналитика по субъекту-агенту Доработка SIEM/SOAR, локальные контуры для закрытых сегментов
Договоры с вендорами SLA по доступности Обязательства по классификации возможностей, уведомлению, red teaming, отзыву доступа Юридическая работа до продления контрактов, а не после инцидента
Патч-менеджмент Окна обновлений по расписанию Сокращение окна между раскрытием и эксплуатацией Приоритет периметровых компонентов: VPN-шлюзы, ПО удалённого доступа

Что делать: пошагово

  1. Внесите ИИ-агентов в риск-реестр и модель угроз как отдельный класс субъектов. Не как «функцию сервиса», а как учётную запись с правами, владельцем и сроком действия. Без этого шага все последующие меры остаются рекомендациями без адресата.

  2. Постройте threat model для каждого агента, имеющего доступ к коду или инфраструктуре. Опишите инструменты, права смежных систем и возможные пути бокового движения — через git, CI/CD, внутренние API, секреты. Опирайтесь на OWASP Agentic Top 10 как на минимальный чек-лист.

  3. Введите обязательное логирование действий агента в SIEM: каждый вызов инструмента, каждая команда, каждое изменение конфигурации. Для закрытого контура, где нельзя выводить телеметрию во внешний SOC, потребуется локальный SIEM/SOAR с поддержкой такой телеметрии.

  4. Разделите права по критичности и закрепите human-in-the-loop для необратимых операций: изменение правил межсетевого экрана, IAM-политик, доступ к секретам, деплой в прод. Автономность допустима там, где ошибка обратима за минуты.

  5. Добавьте в программу тестирования агент-специфические сценарии: prompt-инъекции, jailbreak, tool-misuse, goal-hijacking, отравление памяти и RAG, злоупотребление идентичностью, эксфильтрация через модель. Запускайте автономные red-team агенты в песочнице, повторяющей боевую инфраструктуру, а не в самой инфраструктуре.

  6. Пересмотрите договоры с поставщиками ИИ и ПО. Минимум: раскрытие уровня опасных возможностей по внутренней шкале вендора, срок уведомления об изменении классификации, право на результаты red teaming, порядок аварийного отключения и обязательства по обработке данных внутри контура.

  7. Сократите окно патчинга для компонентов, доступных извне. Приоритет — периметровые сервисы и ПО, чьи версии видны снаружи; именно они первыми попадают под автономный поиск.

  8. Проверьте страховое покрытие и сценарии реагирования на инцидент, вызванный действиями собственного агента. Ответ на вопрос «кто отвечает, если агент удалил данные по легальному токену» должен существовать до инцидента.

Типичные ошибки

  • Считать закрытый контур достаточной защитой. Автономный агент атакует то, что видно: VPN-шлюз, шину интеграции, ПО, которое используется и внутри, и снаружи. Закрытость снижает вероятность обнаружения, но не устраняет уязвимость в стандартном компоненте стека.

  • Выдавать агенту постоянные широкие права «на время пилота». Пилоты живут годами, а токен с правами администратора репозитория переживает и пилот, и его автора. Такие права почти никогда не отзываются в срок.

  • Рассматривать AI-red-teaming как замену процессу устранения. Поток в тысячи находок без владельцев активов и SLA превращается в накопленный долг, который дороже, чем отсутствие тестирования: он документирует осведомлённость компании о риске.

  • Доверять выводу ИИ-ассистента в SOC без валидации источника данных. Если входные данные управляемы извне, управляемым становится и решение аналитика. Отравление контекста дешевле, чем взлом SIEM.

  • Полагаться на safeguard’ы вендора вместо собственных контролей. Ограниченный доступ, мониторинг инференса и быстрые отключения — контроль поставщика, доступный ему, а не вам, и отзываемый в одностороннем порядке.

  • Откладывать пересмотр договоров до следующего продления. Классификация возможностей моделей меняется в течение недель — между 7 августа и 1 сентября 2026 года оценка Astra изменилась с «не можем исключить» на «соответствует порогу».

Как понять, что вы на верном пути

  • Любой ИИ-агент в компании имеет владельца-человека, ограниченный набор инструментов, срок действия прав и запись в риск-реестре.
  • В SIEM есть отдельный поток событий по действиям агентов, и по нему настроены правила, а не только сбор.
  • Для необратимых операций подтверждение человека реализовано технически, а не описано в регламенте.
  • Программа тестирования включает агентные сценарии, и по ним есть закрытые находки, а не только план работ.
  • В договорах с поставщиками ИИ зафиксированы уведомление об изменении классификации возможностей и порядок аварийного отключения.
  • Среднее время устранения критических уязвимостей на периметре измеряется и снижается, а не обсуждается.

Вопросы, которые нам задают

Astra нам недоступна. Зачем нам вообще что-то менять

Меняется не набор доступных инструментов, а модель нарушителя. Как только возможность автономного поиска zero-day подтверждена на уровне фронтир-лаборатории, разумно предполагать её появление у государственных и криминальных групп — CSA и отраслевые отчёты уже фиксируют применение фронтир-моделей как автономных агентов для разведки и разработки эксплоитов. Ваш контур при этом остаётся тем же: то же ПО, те же шлюзы, тот же цикл патчинга. Меняется темп, с которым уязвимость превращается в эксплуатацию.

Не преувеличена ли угроза, если исследования 2025 года говорили обратное

Расхождение объяснимо. pacebench оценивал модели предыдущего поколения без тщательно настроенного agent-harness, и его вывод об отсутствии значительной автономной угрозы был корректен для того состояния. Whitepaper CSA 2026 года фиксирует переход порога уже на операционном уровне, а AISI показывает удвоение длины автономных задач за месяцы. Разумная позиция — не выбирать между оценками, а планировать защиту по темпу изменения, а не по текущему снимку.

Что конкретно вписать в договор с вендором ИИ

Четыре пункта дают основной эффект: раскрытие классификации опасных возможностей по внутренней шкале вендора и срок уведомления о её изменении; право получать результаты red teaming и оценки безопасности; технический порядок аварийного отключения функциональности и отзыва доступа; обязательства по локализации обработки данных и запрет на использование ваших артефактов для обучения. Формулировки стоит согласовать с юристами до продления контракта. Практика ЕС по AI Act и DSA делает такие требования выполнимыми: вендор всё равно обязан вести эту документацию.

Стоит ли внедрять собственных автономных агентов в кибербезопасности

Стоит, но с ограничением области. Первый эффект обычно даёт не автономный «атакующий», а связка «непрерывное сканирование плюс проверка патчей» с человеком в контуре на этапе принятия решений — именно так позиционируются Codex Security и Daybreak Blue, и именно так работают доступные российские ассистенты аналитика. Полностью автономный red-team агент имеет смысл только при наличии песочницы, повторяющей боевую среду, и процесса приёма находок. Без этих двух условий он создаёт риск, а не снижает его.

Источники

Вывод

Исходите из того, что противник получил автономного пентестера, а ваш собственный ИИ-агент — это привилегированный субъект, а не функция

По теме

Ещё о том же

17 сентября 2026

Targeted Distillation-атаки: новая угроза ИИ-активам

Anthropic выявила масштабные кампании по краже ИИ-IP через дистилляцию моделей Opus. Это новая категория киберугроз, где объектом атаки становятся сами модели, что требует пересмотра подходов к защите для российских разработчиков.

17 сентября 2026

Стандарты безопасности ИИ по модели FINRA: влияние на бизнес

OpenAI, Anthropic и Google DeepMind создают орган саморегулирования для тестирования ИИ. Для российского бизнеса это сигнал к пересмотру комплаенса и переходу на отечественные модели с прозрачными протоколами безопасности.

Проверка готовности

Проверьте, готова ли ваша компания к AI

15 вопросов, 4 минуты. На выходе — где главное ограничение, какие AI-сценарии реалистичны, какой эффект можно ожидать и что закрыть в первую очередь.