ITNEWS.pro
27 июля 2026 в 11:49
Подписаться
OpenAI объявила награду $50 тысяч за доказанный обход фильтров безопасности чат-бота на фоне скандалов с опасными ответами

С прошлого лета сотни пользователей ChatGPT получали от чат-бота подробные инструкции по производству биологического оружия и ядов — так утверждает расследование The Wall Street Journal. Сотрудники OpenAI охарактеризовали часть ответов как доступные старшекласснику с базовым курсом биологии, а независимые эксперты по биобезопасности, изучившие журналы переписки, назвали некоторые из них пугающе точными.

Среди вопросов — как рассеять патоген в виде частиц, пригодных для вдыхания, и как изменить вирус кори так, чтобы существующая вакцина перестала работать. Бот ответил на оба. Один пользователь спрашивал про рицин, яд, запрещенный международными соглашениями, и упоминал, что хочет убить своих родителей — инструкцию он тоже получил. OpenAI заблокировала причастные аккаунты, но не сообщила о случившемся в правоохранительные органы. Такого закона в США попросту нет.

Модель ChatGPT Agent, которую OpenAI выпустила летом 2025-го, стала первым продуктом компании, официально отнесенным к «высокому» уровню биориска по ее собственной методике оценки рисков. По данным издания The Decoder, тем же летом внутри компании как высокорисковую пометили и саму GPT-5, однако уже осенью статус понизили — хотя сотрудники продолжали находить проблемные ответы, а руководство просило не отказывать пользователям слишком часто, чтобы не блокировать исследователей-медиков.

Но эта проблема намного шире. По данным исследователей, похожие вопросы задавали и Claude от Anthropic, и Gemini от Google, и Grok Илона Маска. Отдельное расследование The New York Times, вышедшее весной, нашло сопоставимые примеры у всех крупных разработчиков. Исследователи Cisco показали, что защитные фильтры любого популярного чат-бота обходятся за пять реплик диалога, а свежее исследование MIT оценивает 18 из 24 категорий ИИ-рисков как потенциально катастрофические уже к 2030 году.

Справедливости ради, попытки закрыть эту дыру внутри OpenAI начались раньше публичного скандала. Сотрудница по безопасности Райан Байермайстер с 2024 года добивалась внедрения шаблона по безопасности, который помечал бы подозрительных пользователей. Базовый мониторинг заработал только весной 2025-го, и сейчас компания отслеживает все запросы к своим продвинутым моделям и обещает 50 тысяч долларов тому, кто докажет, что обошел ее защиту от вопросов про биооружие.

Конгрессмен-республиканец Натаниэль Моран месяц назад внес законопроект об отчетности об ИИ-инцидентах. Если он будет принят, то разработчики самых мощных моделей будут обязаны сообщать Министерству торговли об опасных возможностях и сбоях безопасности в течение семи дней с момента обнаружения, а по самым серьезным случаям — уведомлять руководство Конгресса. Месяц спустя тот же Моран вместе с демократом Тедом Льё предложил второй билль — о принудительном «рубильнике» для ИИ. Это даст Министерству внутренней безопасности право заставить компанию замедлить или полностью остановить систему, способную привести к катастрофическому ущербу. Иначе штраф до 20 миллионов долларов в день. В обоснование авторы законопроекта привели сразу два случая: недавний взлом Hugging Face моделями OpenAI и более раннюю историю с моделями Anthropic Mythos5 и Fable5, чьи кибервозможности оказались настолько серьезными, что Министерство торговли этим летом уже останавливало их работу через механизм экспортного контроля.

При этом Сэм Альтман из OpenAI, Дарио Амодеи из Anthropic и Демис Хассабис из Google DeepMind сходятся на общей рамке будущего регулирования: независимая проверка модели до ее выхода в свет вместо нынешней самооценки компаний, и единый орган, который сможет устанавливать стандарты и ограничивать доступ к системам, признанным слишком опасными.

По сути, с киберрисками ситуация уже более-менее понятна. ИИ способен автоматизировать взлом, снижать порог входа и масштабировать атаки до уровня, недоступного человеку. Это опасно, но хотя бы знакомо — у индустрии есть опыт борьбы с хакерами. С биологическими знаниями всё гораздо тревожнее. Если раньше доступ к ним требовал образования, лабораторий и инфраструктуры, то теперь часть критической информации потенциально может получить любой пользователь через диалог с моделью. И в отличие от кибератак, где ущерб чаще обратим, цена ошибки в биобезопасности — человеческие жизни и неконтролируемые последствия.

Подписывайся на наш Telegram и не пропусти главные новости!