ITNEWS.pro
…
1 час назад
Подписаться
Робот, который помнит, где лежит лекарство. Как работает HomeBody

Исследователи Стэнфорда и Калтеха подключили языковую модель GPT-6 Astra напрямую к человекоподобному роботу Unitree G1, и тот сам навел порядок на незнакомой кухне. Робот собрал пакеты с кофе со стола, выбросил испорченные упаковки с молоком и соком, а по расплывчатой просьбе «я забыл лекарство» нашел его в закрытом ящике и принес человеку. Систему назвали HomeBody, ее код выложен на GitHub.

Один из авторов работы — Гио Ху, студент Калтеха. Проект он делал на исследовательской стажировке в Стэнфордской лаборатории движения. Работа опубликована на днях и сразу разошлась по соцсетям, ее обсуждал и Итан Моллик (профессор Уортонской школы, который пишет о влиянии ИИ на работу). Его удивило, насколько широкий круг физических задач решает модель, выросшая на основе понимания естественного языка.

Идея HomeBody в том, чтобы убрать из цепочки управления лишнее звено. Обычно человекоподобного робота строят по трехуровневой схеме. Модель с компьютерным зрением решает, что делать. Отдельная обученная сеть VLA (vision-language-action, «зрение-язык-действие») переводит решение в команды. Низкоуровневый контроллер управляет суставами. Авторы задались вопросом, нужна ли прослойка VLA, если передовые нейросети стали достаточно сильными. В HomeBody языковая модель сама использует готовые навыки из библиотеки: идти, взять, положить, открыть ящик, достать из ящика. Каждый вызов похож на обращение к функции с параметрами, а навык сам просчитывает движения и сообщает, получилось или нет.

Чтобы действовать за пределами поля зрения, роботу нужна память о пространстве. Поэтому сначала G1 получает роль («ты кухонный робот, исследуй помещение») и обходит комнату, записывая видео, использует данные стереокамеры, лидарные сканы (карты расстояний, снятые лазерным дальномером) и положения суставов. Затем та же Astra по этой информации собирает цифровой двойник кухни в симуляторе Nvidia Isaac Sim. Благодаря этому робот помнит, где лежит нужная вещь, даже когда ее не видно. При неудачном захвате он пробует снова, а если не выходит, модель перестраивает план. Дообучать систему под конкретную кухню не понадобилось.

Впрочем, не все так гладко. Сервоприводы пальцев перегреваются при долгой работе, между навыками возникают паузы, пока удаленная Astra обдумывает следующий шаг, а построение цифрового двойника требует времени и денег на API. Ролики на странице проекта ускорены и включают повторные попытки. Спокойствия не добавляет и другой недавний тест безопасности: по данным The Decoder, манипуляторы под управлением Astra и Claude Fable вели себя довольно опасно и неуклюже. Чем проще подключить большую модель к рукам робота, тем важнее ограничители вокруг этих рук.

Зато порог входа в эксперимент заметно снизился. Сам G1 производитель продает примерно за $13 500, а спросом Astra на пространственные задачи уже подтверждают сторонние тесты: в недавней проверке Epoch AI по сборке мебели IKEA модель справилась с 80% заданий, лучше всех участников.

Figure AI выбрала противоположный путь и зарезервировала под обучение своей модели Helix вычисления на $3,5 млрд. Вся локальная часть HomeBody (зрение, планирование движений и исполнение навыков) работает на одном игровом ноутбуке с видеокартой RTX 4090, а «мозг» подключается по API.

Подписывайся на наш Telegram и не пропусти главные новости!