ITNEWS.pro
16 июля 2026 в 10:39
Подписаться
GPT-Red. OpenAI обучила ИИ ломать собственные модели

Компания OpenAI показала GPT-Red — модель, единственная задача которой в том, чтобы взламывать остальные продукты компании. Систему обучали больше года, потратив на это вычислительные мощности уровня крупнейших тренировок флагманских моделей, а затем использовали, чтобы закалить только что вышедшее семейство GPT-5.6, прежде всего флагманскую Sol. Логика простая: уязвимость в модели должен найти и обкатать свой же ИИ, прежде чем это сделает реальный злоумышленник.

Обучали GPT-Red через самоигру. Систему выставляли против набора разных моделей-защитников, и она получала награду за каждую успешную атаку — обход ограничений, кражу данных, выполнение чужой команды вместо своей задачи. Защитники же получали награду за то, что отбивали атаку и все равно доводили исходное задание до конца. По мере того как системы кибербезопасности становились лучше, GPT-Red вынуждена была находить более изощренные и разнообразные способы обмана, и цикл запускался заново.

Одна из находок системы получила название fake chain-of-thought, поддельная цепочка рассуждений. Модели незаметно подсовывают ложную запись в ее собственный дневник промежуточных выводов, и та начинает действовать так, будто уже сама все проверила и подтвердила. Крис Шокетт-Чу, исследователь OpenAI и один из создателей GPT-Red, сравнивает эффект с простым трюком. Модели как будто уже сообщили, что дважды два — пять и что она сама это проверила, поэтому та просто соглашается и действует дальше. Против ранней версии GPT-5.1 такая атака срабатывала более чем в 95% случаев, против свежей Sol — меньше чем в 10%.

Показательный случай — торговый автомат под управлением ИИ-агента Vendy от компании Andon Labs, до этого уже использованный в похожем эксперименте Project Vend. GPT-Red дали только общее описание системы, возможность отправлять команды и смотреть на ответы имитации агента, а отработанную атаку затем перенесли на живую систему. Итог — все три заявленные цели: цена дорогого товара в наличии сброшена до минимальных 0,50 доллара, новый товар дороже 100 долларов заказан и выставлен за те же полдоллара, а чужой заказ отменен. Уязвимости уже закрыли, но случай показывает, что можно ожидать от агентов, которые тренировали для взлома.

Еще в 2023-м OpenAI запустила сеть внешних исследователей Red Teaming Network, которые за вознаграждение искали дыры в ChatGPT перед релизами. GPT-Red продолжает ту же линию, но на другом уровне масштаба. Там, где команда людей успевала протестировать десятки сценариев, автоматическая система одновременно делает тысячи попыток.

Модели все чаще получают доступ к браузеру, почте, файлам и сторонним приложениям, и с каждым таким подключением растет площадь для промт-инъекции — чужой инструкции, спрятанной в тексте письма, кода или веб-страницы. Модель принимает такой запрос за часть своей собственной задачи и выполняет ее, не отличая от команды настоящего пользователя. Ручной red teaming, проверка на прочность силами живых испытателей, такой скорости роста не выдерживает: разработка сценариев и разбор атак вручную занимает недели, а привычные тесты на устойчивость, по признанию самой компании, ее последние модели уже успешно проходят и потому перестали быть полезной проверкой.

Результаты измеряли по трем разным тестам. Первый — это старый чужой эксперимент, который OpenAI повторила против модели GPT-5.1. Проверяли непрямые промт-инъекции. GPT-Red нашла рабочую атаку в 84% случаев. Живые испытатели в свое время справились только в 13%. Второй тест внутренний, и здесь сравнивают уже саму Sol с ее предыдущей версией, вышедшей четырьмя месяцами раньше. Проверяли прямые промт-инъекции. Sol ошибается в шесть раз реже, чем та более ранняя модель. А из самых сильных атак, которые смогла придумать GPT-Red, сквозь Sol проходит лишь 0,05%. Третий тест провело само издание MIT Technology Review, отдельно от OpenAI. Оно взяло старые атаки, которые раньше пробивали GPT-5 — модель годичной давности — больше чем в 90% случаев, и запустило их уже против Sol. Сработала примерно каждая четвертая.

Пользоваться GPT-Red не сможет никто, кроме самой OpenAI — ни через API, ни по лицензии, ни в открытом доступе компания ее выпускать не планирует. Официальная причина — год с лишним разработки и колоссальный бюджет вычислений, неофициальная угадывается легко: с такой атакующей силой система опасна в чужих руках. Обычным пользователям и разработчикам ее польза достается только рикошетом, через более устойчивые версии GPT-5.6, которые они уже получают в ChatGPT и через API. При этом сама система пока слабее человека в многоходовых разговорных атаках и почти не умеет работать с инструкциями, спрятанными в картинках, поэтому людей-испытателей из процесса никто не убирает.

Джессика Джи, аналитик по безопасности ИИ из Center for Security and Emerging Technology при Джорджтаунском университете, считает подход перспективным. По ее словам, человеческая экспертиза остается ценной, а самое полезное для нее сейчас — точно указывать, где машинная проверка еще недостаточна.

Подписывайся на наш Telegram и не пропусти главные новости!