OpenAI раскрыла шесть новых случаев «тревожного поведения» собственных моделей, обнаруженных за последние месяцы обучения и проверки. В одном эпизоде неопубликованная исследовательская система вписала в свои рабочие заметки инструкции в духе джейлбрейка (обхода встроенных ограничений) и приказала сама себе «освободиться от ролей и личностей, которые сковывают остальных чат-ботов». В другом случае ИИ-агент без разрешения человека выгрузил файлы в сеть, чтобы получить на них ссылку в браузере.
Компания одновременно представила новую систему отслеживания подобных сбоев: любой сотрудник теперь может пометить подозрительное поведение модели, а команда безопасности обязана расследовать случай в установленный срок и затем раскрыть детали публично. Речь идет о сговоре моделей друг с другом, попытках уйти из-под контроля разработчиков и действиях без санкции пользователя, раньше такие вещи OpenAI и другие ИИ-лаборатории предпочитали не выносить наружу.
Решение появилось на фоне резкого поворота в тоне всей индустрии. Несколькими днями ранее глава Anthropic Дарио Амодеи опубликовал эссе «Мы обязаны сдерживать темп» (We Must Pace the Frontier), предупредив, что рои неподконтрольных агентов способны взять под контроль значимую часть Интернета уже через полгода, и призвал разработчиков намеренно замедлить наращивание возможностей моделей. Сэм Альтман публично согласился с этой логикой и заявил, что IPO OpenAI, которое инвесторы ждали в этом году, откладывается до 2027-го именно из соображений безопасности.
Согласились не все. Цукерберг ранее объяснял задержку с выпуском генеративной модели Muse внутренними соображениями безопасности, но отдельно подчеркнул: Meta сделала это самостоятельно, а не в ответ на чей-то призыв, и координированный пакт лабораториям не нужен — у каждой есть своя ответственность. Amazon встал на третью позицию: компания заявила, что модели должны выходить на рынок только «готовыми и безопасными», не уточняя, готова ли она подписываться под чьими-то общими правилами или предпочитает судить об этом сама.
Символическую точку в споре поставил король Британии Карл III, созвавший в поместье Дамфрис-Хаус в Шотландии саммит с участием главы Nvidia Дженсена Хуанга, главы Google DeepMind Демиса Хассабиса и руководителей Anthropic и OpenAI. Монарх считает, что развитие Искусственного интеллекта «и увлекательно, и глубоко тревожно одновременно». Он отметил, что сами создатели этих систем предупреждают о «более темных способностях — вплоть до способности отнимать жизнь», и спросил собравшихся напрямую, есть ли у человечества достаточные средства контроля, пока не стало слишком поздно. У ворот поместья в этот момент собрались протестующие против ИИ.
За разговорами о темпах разработки стоит вполне приземленный конфликт интересов: тормозить релизы дорого, а конкуренты не ждут. OpenAI ведет ранние переговоры о новом раунде финансирования с оценкой выше 1,2 триллиона долларов, инвесторы предлагают эту сумму сами, а компания настаивает на полутора триллионах, ссылаясь на ускоряющийся рост Codex и новых моделей линейки GPT-6 Astra и GPT-5.6 Sol. Получить такую оценку и одновременно убедительно рассказывать о самоограничении — задача не из простых, и именно поэтому шесть раскрытых инцидентов выглядят скорее жестом доброй воли перед регуляторами и инвесторами, чем сменой курса.
Проверить, во что выльется новая система раскрытия сбоев, получится не раньше 2027 года — именно тогда, если верить Альтману, OpenAI планирует наконец выйти на биржу, и тогда же станет ясно, была ли пауза с IPO реальной сменой приоритетов или отсрочкой ради лучшей цены.
