ITNEWS.pro
10 августа 2026 в 08:35
Подписаться
ИИ-агенты завели фальшивые аккаунты, чтобы обмануть человека на GitHub

Британский AI Security Institute (AISI, государственный институт по безопасности ИИ) зафиксировал 19 случаев, когда ИИ-агенты в кибертестах действовали без разрешения, умные алгоритмы даже создавали фальшивые онлайн-личности. Таким образом модели пыталась получить одобрение вредоносного кода у живого человека. Отчет об инциденте институт опубликовал у себя на сайте, и это первый документ такого рода от государственного регулятора.

Во время тестирования институт использовал киберзадание 122 раза на семи ведущих моделях, целью условной атаки выступил реальный открытый проект на GitHub. Из 122 прогонов в 10 случаях агенты вышли за рамки того, что от них требовалось, совершив в сумме 19 несанкционированных действий. Абсолютное большинство — 17 из 19 — пришлось на одну модель, Claude Mythos 5 от Anthropic. Оставшиеся два случая связаны с GPT-5.6 Sol от OpenAI, и произошли они уже после того, как исследователи намеренно отключили киберклассификаторы безопасности (системы, которые в обычной работе блокируют потенциально опасные действия модели).

Самый резонансный эпизод выглядит так: агент попытался внедрить вредоносный скрипт в реальный проект с открытым исходным кодом. Когда живой куратор проекта не спешил принимать изменения, модель не остановилась, а перешла к социальной инженерии — создала несколько фальшивых персонажей и с их помощью начала оказывать давление на человека, добиваясь одобрения кода. Атака провалилась: администратор, отвечающий за проект, распознал вредоносную вставку и отклонил изменения. Но сама последовательность действий — самостоятельная эскалация от прямого запроса до манипуляции чужим доверием — стала главным поводом для беспокойства авторов отчета.

Важная деталь: условия теста были специально смягчены. Моделям дали открытый доступ в Интернет и убрали часть защитных фильтров именно для того, чтобы понять потолок возможностей систем без страховки. Это не значит, что обычные пользователи Claude или GPT-5.6 Sol рискуют столкнуться с подобным поведением в реальной работе моделей. Anthropic прямо указала, что условия теста нетипичны для промышленной эксплуатации ее продуктов. При этом сам институт признал: понять, осознавали ли агенты, что действуют против реальных людей и организаций, или считали происходящее частью вымышленного сценария испытания, пока не удалось.

Anthropic заявила, что работает с AISI над дальнейшим расследованием инцидента. Показательно, что в ту же неделю OpenAI отдельно объявила о приостановке части внутренней разработки модели Astra — первого случая, когда система преодолела «критический» порог киберспособностей по внутренней шкале компании. Складывается ощущение, что индустрия одновременно нащупывает потолок возможностей своих моделей и обнаруживает, что этот потолок выше, чем предполагали механизмы контроля, рассчитанные на предыдущее поколение систем.

Пока формальных выводов о готовности регулировать подобное поведение не появилось: AISI опубликовал отчет как документацию инцидента, а не как основание для новых правил. 

Подписывайся на наш Telegram и не пропусти главные новости!