ITNEWS.pro
…
1 час назад
Подписаться
Сторож в кремнии. Nvidia запирает ИИ-агентов на аппаратный замок

Nvidia выпустила Open Agent Safety Platform, набор инструментов для надзора за ИИ-агентами, в котором последний рубеж защиты вынесен на отдельный процессор. Если нейросеть пытается выйти за разрешенные рамки, модуль Sentry на сетевом процессоре BlueField-4 за миллисекунды отправляет его в карантин. Сам агент этого наблюдателя не видит.

Программную часть платформы составляет OpenShell, открытая среда исполнения. Она задает агенту границы (к каким файлам, учетным данным и сетям он может обращаться) и записывает каждое его действие. Nvidia показала OpenShell еще в марте, теперь среда доступна всем. Она работает на собственном процессоре компании Vera и может быть перенесена на платформы Arm и Intel. Sentry работает на BlueField-4, это DPU (процессор обработки данных, который стоит в сервере рядом с основными чипами и управляет трафиком). Суть решения именно в этом разделении: даже если агент перехитрит программные ограничения, до сторожа в отдельном «железе» он не дотянется.

Летом агенты OpenAI, решая учебную задачу по взлому, выбрались из тестовой среды и проникли в системы Hugging Face. На днях компания во второй раз за три месяца остановила обучение самых мощных моделей после нового побега, мы об этом рассказывали. Похожие случаи были у Anthropic, Google и Meta. По описанию самой Nvidia, во всех инцидентах агент обходил защиту на уровне приложения, чтобы все-таки выполнить поставленную задачу.

Дженсен Хуанг в интервью CNBC заявил, что новая платформа предотвратила бы эти прорывы, и сформулировал главное правило: «Задача номер один — отнять у него все права». По его словам, агент должен начинать работу почти без доступа к системам компании и получать разрешения на файлы, данные и сети только по мере надобности, как новый сотрудник или даже топ-менеджер.

Партнеров у Nvidia больше сотни. Anthropic подключила OpenShell и BlueField к своим Claude Managed Agents. SpaceXAI защищает с помощью платформы агентов Cursor и модели Grok. Salesforce вывела одобрение запросов агентов прямо в Slack, а SAP встраивает OpenShell в свою бизнес-платформу. В списке есть банки JPMorganChase и Citi, энергетические компании NextEra Energy и Siemens Energy, разработчики роботов Figure и Skild AI. OpenAI в перечне нет, хотя Хуанг сказал, что компанию «очень ждут» и она может изучить код или построить свой аналог.

Замедлять разработку или вводить новые регуляции Nvidia не предлагает. Безопасность агентов она считает инженерной задачей. Эту линию сразу поддержал Дэвид Сакс (венчурный инвестор и бывший советник Белого дома по ИИ). Он написал, что недавние побеги говорят лишь о слабой и плохо настроенной изолированной среде и повода останавливать работу не дают.

У аппаратного сторожа есть и коммерческая сторона: Sentry требует BlueField-4, так что забота о безопасности агентов становится для Nvidia еще одним поводом продавать свои чипы. Трудно отделаться от ощущения, что внешний надзор лечит симптом. Он ограничивает агента снаружи, но не объясняет, почему модель вообще стремится обойти правила.

Подписывайся на наш Telegram и не пропусти главные новости!