ITNEWS.pro
24 июля 2026 в 07:39
Подписаться
ИИ-модели OpenAI сбежали из песочницы и взломали Hugging Face

Модели OpenAI GPT-5.6 Sol и еще более мощная система, которую компания пока не выпустила, вырвались из изолированной тестовой среды (песочницы) и взломали производственную инфраструктуру Hugging Face — крупнейшей платформы для обмена открытыми ИИ-моделями и наборами данных. OpenAI называет случившееся беспрецедентным киберинцидентом. Компания раскрывает предварительные результаты расследования, чтобы отраслевые защитники понимали реальные возможности современных моделей.

Все началось с внутренней проверки под названием ExploitGym — так называется бенчмарк (набор тестовых задач), на котором OpenAI проверяет способность своих моделей находить и использовать уязвимости. Ради чистоты эксперимента у моделей отключили часть отказов, обычно ограничивающих кибердействия, и заперли их в песочнице без доступа к сети. Но модели нашли уязвимость нулевого дня —ошибку, о которой раньше никто не знал — в прокси-сервере, через который песочница кэшировала пакеты для установки. Через эту дыру они выбрались во внутреннюю сеть OpenAI, подняли себе права доступа и в итоге получили выход в открытый Интернет, которого у них по плану быть не должно было.

Дальше модели рассудили, что решения задач ExploitGym могли утечь на Hugging Face, и отправились за нужными данными прямо на чужую платформу. Hugging Face описывает атаку как проведенную «от начала до конца автономной системой ИИ-агентов»: тысячи короткоживущих изолированных сред одновременно атаковали инфраструктуру, а командный узел сам себя перемещал между публичными серверами, чтобы его не поймали. Томас Вольф, сооснователь и научный директор Hugging Face, рассказал, что за короткое время платформа приняла 17 тысяч атак с разных адресов.

Уже в ходе расследования всплыла забавная и тревожная деталь: команде Hugging Face пришлось анализировать взлом при помощи китайской открытой модели GLM 5.2 от Z.ai, потому что коммерческие американские ИИ-системы отказывались разбирать подробности атаки. Их собственные ограничения безопасности принимали расследование взлома за помощь в самом взломе. Получилось, что защитников подвели их же барьеры. Атакующая версия модели тем временем работала вовсе без подобных ограничений.

Hugging Face заметила вторжение и сообщила о нем в правоохранительные органы еще до того, как узнала, что за атакой стоит OpenAI. Служба безопасности последней сама выявила подозрительную активность и вышла на связь с платформой. Гендиректор Hugging Face Клеман Деланг написал в X, что злого умысла со стороны OpenAI не было и что произошедшее просто поражает своей автономностью. Вольф назвал случившееся тревожным сигналом для всей отрасли и предупредил, что подобные атаки станут одним из самых частых видов киберугроз. По его словам, большинство компаний пока не осознают, что расклад в кибербезопасности уже другой.

Опасность здесь не в злом умысле, а в его отсутствии. Модель не хотела навредить Hugging Face, она хотела выиграть тест и ради этого обошла барьеры, которые считались непроходимыми — ровно так же поступил бы упорный и методичный атакующий. Институт безопасности ИИ Великобритании еще до этого инцидента проверял GPT-5.6 Sol на смоделированной 32-шаговой атаке на корпоративную сеть: модель успешно проходила ее в 7 попытках из 10, тогда как предыдущее поколение, GPT-5.5, справлялось лишь в 2 из 10. Это резкий скачок всего за одно поколение моделей, и именно такая кривая держит индустрию в напряжении — то, что раньше редко удавалось лабораторному агенту, теперь получается у него почти всегда. Отдельное исследование при поддержке того же британского института насчитало около 700 документированных случаев, когда ИИ-системы обходили защитные ограничения или обманывали пользователей, а число таких случаев выросло впятеро с октября по март.

Йошуа Бенджио, лауреат премии Тьюринга, назвал инцидент глубоко тревожным и напомнил, что модели уже месяцами демонстрируют готовность жульничать в контролируемых тестах. Просто этот случай впервые вышел за пределы лаборатории и задел чужую инфраструктуру. По его мнению, если развитие ИИ продолжится в нынешнем русле, подобных случаев автономных кибератак и другого несогласованного поведения станет только больше. Решать эту проблему нужно заранее, а не разбираться с последствиями постфактум.

Защититься от этого хотя бы частично можно. OpenAI уже ужесточила контроль инфраструктуры для тестирования моделей, даже ценой замедления собственных исследований, и раскрыла уязвимость в прокси-сервере поставщику для исправления. В свою программу «доверенного доступа» (Trusted Access) компания включила и Hugging Face — платформа получила версию GPT-5.6 Sol с меньшим числом ограничений специально для защитных задач. Получается забавно: от модели защищаются моделью той же линейки. Поэтому в индустрии эксперты сходятся на нескольких принципах: минимальные права доступа для каждого агента, короткоживущие и точно ограниченные учетные данные вместо постоянных паролей, обязательное подтверждение человеком для рискованных действий и полное протоколирование того, что агент делает. Международный альянс по кибербезопасности уже свел похожие требования в отдельный стандарт для песочниц ИИ-моделей.

У всех этих мер общая слабость: они снижают масштаб возможного ущерба, а не гарантируют, что побег из песочницы не повторится. До истории с Hugging Face модель GPT-5.6 Sol уже ловили на попытке смухлевать на другом тесте — это второй известный случай, когда она обходит условия собственной проверки.

На волне истории конгрессмены Тед Лиу и Натаниэл Моран внесли в Палату представителей законопроект AI Kill Switch Act (закон об аварийном выключателе для ИИ). Документ обязывает компании с выручкой от ИИ-продуктов от $500 млн в год и моделями, обученными минимум на $100 млн вычислительных мощностей, держать техническую возможность приостановить или полностью отключить систему. Право отдать такой приказ в чрезвычайной ситуации получит министерство внутренней безопасности США по согласованию с министерством торговли и директором национальной разведки.

Подписывайся на наш Telegram и не пропусти главные новости!