ITNEWS.pro
1 час назад
Подписаться
Unitree разрабатывает новую систему обучения роботов, построенную на модели мира

Unitree показала видео, в котором два гуманоидных робота компании дерутся друг с другом без участия человека. По словам разработчиков, роботы самостоятельно следят за действиями соперника, выбирают момент для атаки или защиты, меняют позицию и сохраняют равновесие. Система называется UnifoLM-X2-1.0 и построена на так называемой «модели мира» — world model. Unitree утверждает, что это первое решение, позволяющее гуманоиду автономно участвовать в полноценном спарринге, где ситуация постоянно меняется. Компания считает, что такой подход в перспективе позволит массово выпускать гуманоидов с более самостоятельным управлением.

Обычная система управления роботом устроена проще: камеры и датчики передают данные, а обученная нейросеть по текущей картинке решает, какое движение выполнить, и отправляет команду моторам. «Модель мира» добавляет в этот процесс внутренний прогноз. Робот оценивает текущую ситуацию, рассматривает несколько вариантов действий и пытается заранее предсказать последствия каждого из них: удастся ли удержать равновесие, достигнет ли удар цели, как изменится положение соперника через долю секунды. После этого система выбирает наиболее подходящее движение.

Для обучения это меняет больше, чем для самого боя. Раньше, чтобы получить рабочую политику, робота тренировали на записях реальных движений. Такие данные дорого собирать и рискованно повторять, если речь о падениях или столкновениях. Альтернатива — физический симулятор, но его точность всегда ограничена тем, что инженеры заранее в него заложили: трение, жесткость, поведение материалов. Модель мира учится физике иначе — она сама выводит закономерности из видеозаписей действий, а не из готовой формулы. После обучения она работает сразу в двух ролях: как генератор данных, прокручивающий в «воображении» тысячи опасных или редких сценариев без единого настоящего падения. Роботу не нужно физически существовать, чтобы начать учиться, а любой рискованный сценарий можно проиграть внутри модели сколько угодно раз, вместо того чтобы рисковать живым «железом».

Это не только ставка Unitree. NVIDIA продвигает похожий подход через платформу Cosmos — открытые модели мира, обученные на 20 триллионах токенов видео, изображений и данных о действиях роботов и автомобилей, и их уже используют Figure AI, Agility Robotics и Skild AI для генерации собственных обучающих данных. Google DeepMind развивает Genie — модель, которая в реальном времени строит интерактивные трехмерные сцены и служит средой для обучения агентов «в воображении». Иными словами, вся индустрия одновременно нащупывает один и тот же ответ на старую проблему: данных о физическом взаимодействии всегда не хватает, а модель мира превращает эту нехватку в задачу генерации данных, а не их сбора.

Сама система Unitree выросла из открытого проекта UnifoLM-WMA-0, который компания опубликовала год назад. Ее построили на архитектуре видео-диффузии — той же технике, что лежит в основе генераторов картинок вроде Midjourney, только здесь она предсказывает не красивый кадр, а физически правдоподобное продолжение сцены, и дополнили блоком, переводящим этот прогноз в конкретное действие. Работает она в двух режимах — планирования движений и симуляции для генерации данных.

Показать именно спарринг, а не более практичную сортировку коробок на складе, решили не случайно: там ошибка ничего не стоит, а в контактном поединке с меняющимся противником любая задержка реакции сразу меняет исход, и система вынуждена держать цикл «восприятие, прогноз, действие» на высокой скорости.

Независимо проверить заявление пока нельзя: технический отчет, тесты на задержку и сравнение с другими подходами компания не опубликовала. У Unitree к тому же есть история демонстраций, которые оказывались не тем, чем казались: прошлогодние боксерские поединки ее роботов управлялись вживую операторами, а не автономно, и исследователи открыто называли их «робот-театром». Сам Ван Синсин, основатель и глава Unitree, в интервью Time оценил срок до настоящего «момента ChatGPT» для гуманоидов в два-три года в лучшем случае и в десятилетие в худшем.

Подписывайся на наш Telegram и не пропусти главные новости!