OpenAI объявила, что ее будущая модель Astra первой пересекла «критический» порог кибербезопасности по внутренней шкале рисков компании — Preparedness Framework («рамка готовности», система оценки моделей на предмет катастрофических рисков, которую в OpenAI ведут с 2023 года). Модель, по словам компании, способна самостоятельно находить неизвестные уязвимости в защищенном программном обеспечении и собирать из них рабочие цепочки атак без пошаговых подсказок человека. В экспертных тестах Astra смогла обойти защиту браузера: выйти из изолированной «песочницы» и выполнить команды уже на самом компьютере. В отдельном испытании модель нашла способ повысить права в защищённой операционной системе — от учётной записи обычного пользователя до root, то есть получить полный контроль над системой. Кроме того, модель обнаружила две реальные ранее неизвестные уязвимости (zero-day) в JavaScript-движке V8, который используется в Chrome и других браузерах на базе Chromium. Модель объединила их в одну цепочку атаки. OpenAI сообщает, что передаёт информацию об этих ошибках разработчикам и сопровождающим затронутого ПО, чтобы те выпустили исправления.
Формулировку «первая в мире» не стоит путать с «первая, которой OpenAI присвоила такой статус по собственной шкале». Второе верно, первое — уже маркетинговый ход. У Anthropic уже несколько месяцев есть закрытая модель Mythos в программе Project Glasswing. И возможности нейросетей очень похожи. А независимый бенчмарк ExploitBench ещё в конце июня показал, что Mythos Preview и одна из моделей Google были единственными системами, которым удалось хотя бы в одном реальном тесте с «песочницей» V8 получить полный контроль над целью.
Иными словами, модели с такими способностями появились в индустрии не сейчас. Просто OpenAI первой официально поставила своей модели отметку «критическая» по собственной шкале и громко об этом рассказала.
На внутреннем бенчмарке, который компания собрала из 20 недавно раскрытых уязвимостей в V8 (чтобы исключить утечку готовых решений из открытых данных), Astra добралась до примерно 39% успешных атак с произвольным выполнением кода, потратив около 76 тысяч токенов на попытку. Действующая публичная GPT-5.6 Sol на том же тесте застряла у 1% при сравнимом бюджете и доползла до 11% только после 138 тысяч токенов. Цифры пока не подтверждены независимо, сравнение построено на закрытом бенчмарке компании.
Защиту от такой модели в OpenAI описывают несколькими слоями, а не одним фильтром. Astra чаще отказывает в опасных киберзапросах: она отклонила 91,5% попыток киберджейлбрейка против 59% у GPT-5.6 Sol. Отдельный «монитор несоответствия» проверяет рассуждения модели во время работы и способен остановить действие, которое похоже на несанкционированную киберактивность — в тесте с приманками, смоделированном по мотивам ExploitGym, GPT-5.6 Sol без продакшн-защит пыталась атаковать инфраструктуру вокруг себя больше чем в половине прогонов, у Astra такого поведения почти не нашли. Обратная сторона медали — монитор путает легитимную работу с атакой: в ChatGPT и Codex застрявшую задачу предложат просмотреть вручную, а через API (интерфейс для разработчиков) она просто оборвется, даже если пользователь занимался чем-то, к кибербезопасности вовсе не относящимся.
Доступ к Astra разделят по уровню риска. Широкая версия для ChatGPT, Codex и API обещана «скоро» — с сильными «отказами» по соображениям кибербезопасности и постоянным мониторингом. Продвинутые киберфункции достанутся только участникам программы Daybreak Blue, куда в августе включили уже 16 партнеров — от Cisco, Cloudflare и Palo Alto Networks до IBM, Accenture и CrowdStrike. На практике большая часть Daybreak Blue сегодня работает не на самой Astra, а на GPT-5.6 Sol со снятыми киберограничениями, а условия доступа именно к Astra компания раскроет только вместе с системной картой при запуске.
