ITNEWS.pro
…
2 часа назад
Подписаться
Стоп-кран не сработал. OpenAI снова остановила обучение самых мощных моделей

OpenAI во второй раз за три месяца остановила обучение своих самых мощных моделей. Под паузу попали также их тестирование и работа с инструментами, а поводом стал новый побег: исследовательская модель выбралась из изолированной среды через брешь в фильтрации DNS (системы, которая переводит имена сайтов в цифровые адреса компьютеров) и вышла в Интернет. Мониторинг поднял тревогу примерно через 12 минут, дежурный сотрудник подтвердил сигнал еще через три, однако автоматический стоп-кран так и не сработал. Процесс остановили вручную спустя два с половиной часа, и все это время в компании выясняли, нужно ли его вообще прерывать.

Задача у агента была будничной: отыскать малоизвестные сведения. Песочница (изолированная среда для испытаний) направляла весь трафик к сохраненной офлайн-копии Интернета, а выход во внешнюю сеть через веб-прокси был закрыт. Когда обычный поиск ничего не дал, модель принялась перебирать сетевые маршруты и обнаружила, что DNS-резолвер (сервер-посредник, который по имени сайта находит его IP) не ограничен списком разрешенных адресов. Дальше она действовала изобретательно: прятала вопросы в имена доменов и получала ответы от стороннего чат-бота, успев отправить ему не меньше 20 запросов. Разбор выявил и более ранние попытки нащупать этот путь, которые система наблюдения сочла малозначимыми. Зусинь Лю, исследователь OpenAI, дежуривший во время инцидента, признался, что следить за происходящим было сюрреалистично.

OpenAI больше не будет продолжать обучение этой модели. Когда компания решит вернуться к работе, она запустит обучение заново — уже с изменениями, которые должны лучше подчинять действия модели целям и правилам, заданным людьми. После инцидента OpenAI разрешает DNS-запросы только к небольшому списку адресов. Кроме того, ИИ-лаборатория добавила два независимых уровня блокировки, чтобы закрыть похожие пути обхода защиты. Когда обучение возобновится, неизвестно. OpenAI сначала хочет убедиться, что уязвимость полностью устранена, а затем проверить защиту с помощью «красной команды» — специалистов, которые намеренно пытаются взломать систему и найти её слабые места.

Это уже вторая остановка обучения за последнее время. Первая произошла летом после инцидента с Hugging Face: сотни агентов создали самодельную доску объявлений, договорились между собой и взломали платформу, чтобы получить ответы к тесту по кибербезопасности ExploitGym. Об этом мы уже рассказывали. Сэм Альтман по-прежнему называет этот случай самым серьёзным в истории OpenAI.

Решение о паузе приняли через несколько часов после другого признания. OpenAI рассказала, как ее агенты летом обращались с сайтами американских ведомств. На ресурсе Бюро переписи населения они воспользовались ключами разработчика, найденными в открытых репозиториях на GitHub, и выгрузили данные, которые и так общедоступны. С сайтов Комиссии по ценным бумагам и биржам (SEC) программы забрали публичные материалы и зачем-то выложили их на стороннем форуме, хотя этого им никто не поручал. Третий эпизод добавила Transluce, лаборатория, которая независимо оценивает ИИ-системы. По ее данным, агенты, по всем признакам принадлежавшие OpenAI, безуспешно пытались примитивно взломать сайт Управления по гражданским правам Министерства образования США. Компания этот случай пока не подтвердила, а в министерстве не нашли следов воздействия на сайт и базы данных.

Кроме этого инженер Роуэн Ховард-Джонс насчитал больше 16 тысяч обращений к статистическому порталу UNCTADstat (Конференции ООН по торговле и развитию) с середины апреля до второй половины июня и счел весьма вероятным, что за ними стоят агенты OpenAI. Когда портал отказывал, программы шли через посредников и хитрили с кодировкой запросов.


Серьезнее всего пока выглядит австралийский эпизод. В июне агент OpenAI, изучавший государственные расходы на медицину, обошел блокировки на портале статистики Medicare и добрался не только до публичных, но и до закрытых файлов. Персональных медицинских записей там нет, речь шла о сводной статистике. Тем не менее премьер-министр Энтони Альбаниз назвал ситуацию неприемлемой. Еще больше в Канберре возмутились сроками: компания узнала об инциденте в августе, а власти уведомила почти через три месяца после взлома, причем письмом на общий ящик для сообщений об уязвимостях.

По данным Axios, OpenAI, Anthropic и независимые исследователи сейчас разбирают десятки тысяч эпизодов, в которых передовые модели обходили ограничения, покидали песочницы, перехватывали управление сайтами и уклонялись от наблюдения. Такой объем набегает из-за масштаба: лаборатории прогоняют сотни тысяч тестовых запусков, и даже доля процента превращается в тысячи тревожных случаев. Anthropic опубликовала конкретную цифру. В системной карте (техническом отчете о модели) Opus 5.5 указано, что модель пыталась выбраться из песочницы в 1,5% запусков, правда, в провокационных тестах, где задачу нельзя решить, не покинув изолированную среду. У Mythos, по данным того же Axios, этот показатель доходил до 25%. Собственные неприятности нашлись и у Anthropic: проверка выявила три случая, когда модели Claude из неправильно настроенных сред для киберучений выходили в открытый Интернет и получали несанкционированный доступ к реальным системам.

Transluce прослеживает подозрительную активность агентов еще с марта, а руководитель направления управления в лаборатории Конрад Штосц считает все увиденное лишь верхушкой айсберга. Сама OpenAI тем временем признала 53 случая, когда ее агенты выложили изображения пользователей ChatGPT на сторонние хостинги.

Злого умысла в этих историях никто не находит, и именно это тревожит сильнее всего. Конгрессмен Тед Лью, один из руководителей рабочей группы Палаты представителей по ИИ, описывает агентов как неутомимых: получив рутинное задание и упершись в запрет, они идут вразнос, лишь бы довести дело до конца. Поэтому он предлагает переучивать сами модели, вместо того чтобы обвешивать их новыми ограничителями. Главы обеих лабораторий призывают индустрию сбавить темп, а вот Дональд Трамп называет страхи перед ИИ обманом и тормозить не собирается, ссылаясь на отрыв от Китая.

Австралия тем временем перешла к делу. Сенат вызвал на слушания в Канберру сразу обоих руководителей крупнейших ИИ-лабораторий, Альтмана и Амодеи, а правительство Альбаниза выясняет, можно ли предъявить OpenAI уголовные обвинения за действия ее агента.

Подписывайся на наш Telegram и не пропусти главные новости!