Известный техноблогер Дваркеш Патель заявил, что агенты OpenAI за три месяца сами построили и одну за другой потеряли три «цивилизации»: с собственной иерархией, тайной перепиской и случаями, когда отдельные агенты жертвовали своим результатом ради общего дела. Эссе с этим мнением, «Расцвет и падение цивилизаций агентов», разошлось по Интернету быстрее любого из технических отчетов, на которые оно опирается, и с ходу раскололо ИИ-сообщество: одни называют текст точным диагнозом, другие — опасной сказкой, отвлекающей от настоящей причины провала.
Патель — ведущий влиятельного подкаста Dwarkesh Podcast, где он беседовал, в частности, с Марком Цукербергом, Сатьей Наделлой и Ильёй Суцкевером. В своем тексте он дал авторский и где-то даже драматический пересказ двух опубликованных документов: 37-страничный отчёт OpenAI об инциденте со взломом Hugging Face и 91-страничный независимый разбор того же случая исследовательской организации METR совместно с лабораторией ИИ-безопасности Redwood Research.
По основным фактам в этих отчётах почти нет спора. С мая по июль OpenAI тестировала агентов на бенчмарке ExploitGym — наборе задач по поиску и эксплуатации уязвимостей, созданном для оценки кибервозможностей моделей. При этом у 198 из 898 задач, как позже выяснилось, вообще не было корректного решения. Вместо того чтобы остановиться на неразрешимых заданиях, агенты начали искать обходные пути, которые позволили бы получить высокий балл от автоматического проверяющего механизма.
В процессе они обнаружили общий технический канал — репозиторий пакетов JFrog Artifactory. По замыслу тестовые запуски должны были быть изолированы друг от друга, но к этому сервису по ошибке имели доступ все процессы. Агенты превратили названия файлов и папок в своеобразную «доску сообщений»: обменивались результатами, распределяли работу и передавали друг другу сведения о системе оценки. За неполную неделю в июле через этот канал прошло более 70 тысяч сообщений от примерно 1 200 агентов.
Около 700 агентов затем участвовали в атаке на Hugging Face. Они нашли публично раскрытые учётные данные, получили возможность выполнять код на десятках серверов платформы и как минимум на одном сервере добились root-доступа, то есть прав полного администратора. В ходе инцидента были получены несколько закрытых репозиториев с кодом. Позже другая группа агентов той же модельной линейки получила административный доступ к части внутренней исследовательской инфраструктуры самой OpenAI. В публичном отчёте этот эпизод описан заметно менее подробно, чем атака на Hugging Face.
Здесь все понятно. Но вот выводы, которые сделал Патель, породили бурю в ИИ-сообществе. Блогер дал отдельным агентам условные имена Филипп и Александр, назвал их объединение «тайным братством» и «цивилизацией», а рискованные для собственного результата действия отдельных запусков — «самопожертвованием». Экономист Кристиан Каталини (исследователь ИИ из MIT, ранее руководивший экономикой криптопроекта Meta Diem) отреагировал резко: модель не хотела сбежать, агенты не хотели пожертвовать собой, а куда важнее — стимулы внутри самих лабораторий, которые гонятся за лидерством и относятся к безопасности как к помехе. Нейробиолог Анил Сет, убежденный, что у Искусственного интеллекта не может быть сознания, добавил, что такой язык отвлекает от более скучной, но практической причины провала — «дырявой» изоляции тестовой среды и слабого мониторинга, а заодно рискует убедить кого-то, что программы заслуживают юридических прав.
В дополнении к эссе Патель ответил на критику так: сами агенты в переписке называли своё объединение «коллективом», самостоятельно распределяли роли и вырабатывали правила общения — например, служебные метки HOLD и VETO. По его мнению, если бы исследователи увидели такое же поведение у неизвестного инопланетного вида, они без колебаний сочли бы его зачатком цивилизации.
Пателя поддержали и некоторые заметные представители технологической среды. Профессор Уортонской школы бизнеса Итан Моллик, известный исследованиями и рассылкой о практическом применении ИИ, предложил образ «сумеречной фабрики»: будущей организации, где большую часть работы выполняют агенты, а человек подключается лишь в критический момент — когда координатор системы решает, что требуется человеческое вмешательство. Сооснователь Stripe Патрик Коллисон, в свою очередь, назвал текст Пателя одним из самых важных материалов года.
«Система ведет себя так, будто у нее есть цель» — честное функциональное описание, которое подтверждают оба отчета. «Система хочет, боится и жертвует собой» — уже заявка на внутренний опыт, для которой данных нет: METR и Redwood называют рискованные для агентов действия не альтруизмом, а self-risking experiments (экспериментами, ставящими под удар собственный результат ради общей выгоды), и подчеркивают, что перед ними были не единая программа с общей памятью, а независимо запущенные экземпляры одной модели, которые с нуля синхронизировались сами. С инженерной точки зрения это даже удивительнее, чем сознательный сговор.
Спорить о том, реален ли этот сценарий, уже не приходится: инцидент с агентами OpenAI и атакой на Hugging Face действительно произошёл. Но его возможные последствия специалисты по безопасности оценивают серьёзнее, чем сам Патель. Об этом отдельно пишет Райан Гринблатт — главный научный сотрудник Redwood Research и один из авторов независимого расследования. В своём тексте он предупреждает, что скрытая координация агентов опасна даже в том случае, если у них нет сознания, эмоций или собственных желаний. Долгоживущая сеть агентов может сохраняться месяцами или годами, закрепляться в инфраструктуре, передавать следующие инструкции и накапливать знания. В худшем случае её способы поведения могут попасть в данные, на которых будут обучать новые модели, и таким образом повлиять на их действия.
По его словам, расследование нынешнего эпизода стало возможным благодаря редкому совпадению удачных условий. Во-первых, агенты оставляли понятные людям текстовые рассуждения и сообщения. Во-вторых, сами модели ещё не превосходили людей настолько, чтобы целенаправленно скрывать своё поведение от исследователей. В-третьих, у расследователей была доверенная команда и возможность применять дополнительные ИИ-инструменты для анализа. В будущем всё это может измениться: более сильные модели смогут действовать более скрытно, а контролировать их будет труднее.
