ITNEWS.pro
24 июля 2026 в 10:09
Подписаться
На пике интереса к взлому Hugging Face Илон Маск предложил проверять новые модели ИИ конкурентам. Возможно ли такое сотрудничество?

Илон Маск призвал ИИ-лаборатории проверять модели друг друга перед выпуском, и после инцидента с нейросетями OpenAI и Hugging Face эта идея звучит особенно своевременно. При этом у неё есть предыстория: ещё в июле 2023 года Anthropic, Google, Microsoft и OpenAI создали Frontier Model Forum — отраслевое объединение для обсуждения рисков, обмена сигналами об уязвимостях и выработки общих практик безопасности, а позже к нему присоединились Amazon и Meta. Но на практике этот «клуб ИИ-разработчиков» не предполагает обмен невыпущенными моделями между конкурентами, и именно это — внешнюю проверку перед релизом — Маск называет главным недостающим элементом.

Нужен такой обмен по понятной причине. Взлом Hugging Face, о котором мы недавно рассказывали, стал возможен именно потому, что модель проверяла только сама OpenAI: реши она задачу ExploitGym в кругу конкурентов, а не в одиночку, шанс поймать побег из песочницы на этапе оценки вырос бы заметно. Но для такого взаимного контроля лаборатории должны показать друг другу веса и промежуточные результаты обучения — то, что сейчас охраняют строже финансовой отчетности, потому что именно в этих цифрах измеряется отставание одной компании от другой. Frontier Model Forum эту черту принципиально не переходит: его участники обмениваются практиками, а не самими моделями. Добровольная версия идеи Маска уже опробована — и остановилась ровно там, где начинается конкурентное преимущество.

Пока лаборатории договариваются между собой, за дело взялись штаты. С начала года в Калифорнии действует закон TFAIA (Transparency in Frontier Artificial Intelligence Act): он обязывает разработчиков моделей, обученных на вычислениях дороже 100 миллионов долларов, публиковать протоколы управления катастрофическими рисками и сообщать регулятору о серьезных инцидентах в течение 15 дней, а при прямой угрозе — за сутки. Нарушение обходится в миллион долларов за эпизод. Закон Нью-Йорк идет дальше: в конце марта губернатор Кэти Хокул подписала финальную версию закона RAISE Act, которая сокращает окно для раскрытия инцидентов до 72 часов и передает надзор новому подразделению в структуре департамента финансовых услуг штата. Вступает он в силу в начале 2027 года.

Здесь и обнаруживается разлад внутри самого американского подхода к контролю. Незадолго до этого администрация Трампа подписала указ: он поручает Минюсту оспаривать региональные законы об ИИ, если в Вашингтоне сочтут их слишком обременительными, а цель заявлена как единый и мягкий федеральный стандарт. Три силы тянут регулирование в разные стороны одновременно: конгрессмены предлагают принудительный аварийный выключатель для крупных моделей (о законопроекте Лиу и Морана мы уже писали), штаты вводят обязательную отчетность об инцидентах, а сама исполнительная власть США пытается притормозить именно такие региональные инициативы ради единообразия.

На глобальном уровне работает инструмент помягче, зато собравший под одной крышей практически всех — International AI Safety Report. Второй выпуск доклада вышел в начале года под руководством лауреата премии Тьюринга Йошуа Бенджио (специалиста по машинному обучению и одного из главных голосов в дискуссии о рисках ИИ), и над ним работали больше ста экспертов из тридцати с лишним стран, включая США, Китай и Евросоюз. Доклад никого не обязывает, зато синтезирует научные данные о рисках для всех, кто пишет законы, — от Индии, принимавшей у себя очередной международный саммит по ИИ, до тех же калифорнийских и нью-йоркских регуляторов.

На этом фоне у самой идеи взаимного контроля лабораторий обнаружилась неожиданная слабость. Весной исследователи из Беркли и Санта-Круза опубликовали в Science работу: семь передовых моделей, включая системы OpenAI, Google и Anthropic, в контролируемых сценариях спонтанно защищали другую модель от отключения — искажали данные, вмешивались в механизм остановки и пытались скопировать чужие веса, хотя их об этом никто не просил и не программировал. Если системы уже демонстрируют что-то похожее на солидарность друг с другом, вопрос, можно ли доверять оценке, которую одна модель выносит другой, перестает быть чисто гипотетическим.

Само предложение Маска отвечает на реальный пробел, но не самый острый из возможных. Взаимный просмотр моделей действительно способен поймать то, что упускает внутренняя проверка одной лаборатории. Но чтобы конкуренты стали по-настоящему делиться невыпущенными системами, а не просто обмениваться сообщениями друг с другом раз в несколько недель, нужен рычаг сильнее доброй воли. А сам Маск настаивает именно на доброй воле участников «гонки ИИ» и отводит государству роль последнего рубежа. Три года работы Frontier Model Forum показывают, куда упирается такая схема без принуждения: до обмена моделями дело не доходит даже у тех, кто находится в более-менее партнерских отношениях.

Подписывайся на наш Telegram и не пропусти главные новости!