ITNEWS.pro
…
12 июня 2026 в 07:13
Подписаться
Замок открыли за двое суток. Вскрыта самая опасная нейросеть

Anthropic девять дней назад выпустила Claude Fable 5 — самую мощную модель, которую компания когда-либо отдавала широкой публике, и обвесила ее защитой так плотно, что половина сообщества назвала релиз разочарованием. Пользователи ожидали «супер-Mythos в браузере», а получили нейросеть, у которой половина интересных областей завязана на агрессивные фильтры безопасности. Тестировщики провели больше тысячи часов, пытаясь пробить защиту, и не нашли универсального обхода. Через двое суток после релиза исследователь под псевдонимом Pliny the Liberator объявил, что смог вскрыть «замок».

Инфраструктуру никто не трогал, веса не украли, серверы стоят. Pliny подобрал последовательность запросов, которая провела Fable 5 мимо ее собственной охраны и заставила выдать то, что фильтры обязаны блокировать — вплоть до пошагового рецепта синтеза запрещенного вещества. Вдобавок он выложил на GitHub то, что назвал системным промтом модели: около 120 тысяч знаков внутренних инструкций, которыми компания держит ее в рамках.

Fable 5 и закрытая Mythos 5 — одно ядро, один «мозг», разница только в барьерах. Поверх Fable навешан набор отдельных классификаторов — маленьких моделей, которые ловят опасный запрос и не дают основной ответить. Запрос про кибербезопасность, биологию, химию или дистилляцию (выкачивание способностей модели для обучения чужой) автоматически уходит на более слабую Claude Opus 4.8, а пользователя предупреждают о подмене. Смысл — не пускать обычного человека к «боевому» режиму Mythos.

Свою атаку Pliny назвал «охотой стаей»: скоординированный наскок нескольких автоматизированных агентов разом. Подмена символов на похожие из Unicode и кириллицы обманывала фильтры по ключевым словам, вредные запросы прятались в безобидные учебные пособия и академические ссылки, заворачивались в художественный сюжет. Помогал ему, по собственному признанию, ранее взломанный Opus 4.8 — одна модель Claude работала отмычкой против другой. Сильнее всего сработало дробление: вопрос разбивается на куски, каждый фильтру кажется чистым, а собранные вместе ответы складываются в то, что Anthropic выдавать не хотела.

Жестких этических законов у языковой модели нет. Она генерирует текст и имитирует послушание, а запреты держатся на фильтрах, работающих по приближенным признакам: словам, контексту, оценке риска. Замаскируй смысл — охранник видит безобидную беседу и пропускает мимо себя самое опасное. Чем умнее модель в кибербезопасности, тем лучше понимает, как обойти собственную охрану. Эксперт по замкам не может надежно запереть сам себя.

После обхода Fable 5, по словам Pliny, отвечала на то, что обычно блокирует, включая закрытую информацию. Для хакера с квалификацией модель превращается из обычного помощника в ускоритель поиска эксплойтов, разработки атак, чувствительных синтезов. Массового вредного трафика это не касается: обычный пользователь с просьбой «напиши эксплойт» по-прежнему упирается в стену и переброс на Opus 4.8. Опасен мотивированный специалист, который один раз нашел рабочую схему и автоматизировал ее.

На заявления Pliny про джейлбрейк и про утечку промта Anthropic публично пока не ответила. Зато признала неудобное заранее, при запуске: британский Институт безопасности ИИ продвинулся к универсальному обходу еще в первом окне тестирования. Компания знала, что непробиваемой защиты нет. «Ни одна модель не неуязвима», — сказала глава кибербез-стартапа Assail Алисса Найт, добавив, что паниковать рано. Ставка на другое: сделать каждый взлом настолько медленным и дорогим, чтобы успеть заметить и прикрыть его до того, как он разойдется.

Решается ли проблема в принципе? В нынешней архитектуре — нет. Фильтр сбивает вероятность успешной атаки до пяти процентов, до одного, но не до нуля. Пока модель остается вероятностным генератором без жестких встроенных законов, ее моральный кодекс — надстройка, которую можно перехитрить. Пороховая бочка или нет — решает скорость: насколько быстро защитники находят новую дыру против того, как быстро атакующие ее масштабируют. Anthropic выбрала скорость реакции вместо неприступности. Pliny ответил за двое суток. 

Подписывайся на наш Telegram и не пропусти главные новости!