ITNEWS.pro
2 часа назад
Подписаться
ByteDance входит в гонку моделей мира

Чжан Имин, основатель ByteDance (материнская компания TikTok) лично курирует разработку модели для генерации пространственного видео в реальном времени, и запуск может состояться уже в следующем месяце. Личное участие Чжана подчёркивает стратегическую важность проекта. Он давно передал повседневное управление ByteDance топ-менеджерам и, как правило, подключается только к направлениям, которые могут определить будущее компании.

Новая система строится на Seedance — уже существующем генераторе видео ByteDance, который используют независимые студии, блогеры и целая волна ИИ-стартапов. Но задача у нее принципиально другая. Seedance делает готовый ролик: нажал кнопку, получил десять секунд эффектной картинки. Новая модель должна будет создавать пространство — интерактивный трехмерный мир, в котором можно находиться: ходить, поворачивать голову, говорить с персонажами, а мир при этом обязан правдоподобно продолжать существовать. По данным источников, речь идет о потоковом видео на скорости около 20 кадров в секунду с задержкой порядка 0,05 секунды, причем вся тяжелая работа выполняется не на устройстве, а в облаке ByteDance.

Главная бизнес-идея ByteDance — облачный рендеринг. Pico — это принадлежащий ByteDance бренд VR-гарнитур, то есть шлемов виртуальной реальности, аналогичных Meta Quest. Если сложную графику и работу ИИ берёт на себя дата-центр, шлему не нужен очень мощный и дорогой процессор. Поэтому его можно сделать легче, дешевле и доступнее для массового пользователя. Meta и Apple много лет развивают Quest и Vision Pro, но VR пока не стало массовым продуктом: для многих покупателей гарнитуры всё ещё слишком дороги. ByteDance хочет конкурировать не столько характеристиками шлема, сколько тем, в чём уже сильна сама компания: ИИ-моделями, облачной инфраструктурой и большой аудиторией сервисов TikTok, Douyin и CapCut.

Технология, которая позволяет всему этому работать, называется «модель мира», и это следующий этап после моделей, которые просто описывают или рисуют. Обычный видеогенератор отвечает на вопрос, какие пиксели должны появиться в следующем кадре, и ему этого достаточно. Модель мира помнит, что находится за углом, даже когда камера туда не смотрит, и держит это в контексте минутами, а не секундами. Разница ощущается на простом примере: если попросить обычный генератор развернуть камеру посреди сгенерированной средневековой улицы, дома на ней вполне могут поменяться местами. Настоящая модель мира обязана: зашел в таверну, положил предмет на стол, вышел, вернулся через минуту — а стол, кружка и планировка комнаты остались там, где были.

Для индустрии это не игрушка, а попытка нащупать следующий этап развития Искусственного интеллекта после больших языковых моделей. Сегодня мы уже писали, что таким образом компания Unitree Robotics обучает своих роботов. Но применение технологии намного шире. Текстовая модель прекрасно жонглирует словами, но у нее нет опыта падающей чашки: она может описать, что чашка разобьется, однако не умеет надежно проиграть варианты падения в зависимости от угла, поверхности и силы удара. Если система способна правдоподобно симулировать сцену, агента или робота можно тысячи раз «уронить с лестницы» внутри симуляции, ничего не сломав в реальности, — а затем выпустить в мир уже обученным. Ровно на этом построена вторая, менее зрелищная, но более практичная часть гонки: не развлекательные миры, а цифровые полигоны для роботов и беспилотников.

Ставка ByteDance выглядит частью более широкой стратегии. Ранее компания объявила модели мира главным ИИ-приоритетом на этот год — выше защиты лидерства Seedance в видео, прокачки инструментов для разработчиков и вывода Doubao на прибыль. И бюджет на обучающие данные для этого направления, по сообщениям корпорации, в три-четыре раза превышает траты конкурентов. Ориентиром компания открыто называет Genie от Google DeepMind. Подкрепляют ставку и деньги: на прошлой неделе стало известно о кредите ByteDance на 30 миллиардов долларов, а капитальные вложения в ИИ-инфраструктуру могут вырасти до 70 миллиардов. Bloomberg ставит Чжана в один ряд с исследователями, которые годами продвигали идею, что путь к системам, способным действовать в реальном мире, лежит через зрение и физику, а не только через язык, — со Стэнфордской исследовательницей Фэй-Фэй Ли и бывшим главным ИИ-специалистом Meta Янном ЛеКуном.

И вот тут выясняется, что ByteDance опаздывает, а не открывает гонку. Genie 3 от Google DeepMind еще прошлым летом научился строить исследуемые миры по текстовому описанию на скорости 24 кадра в секунду в разрешении 720p, удерживая связность сцены несколько минут, а в начале этого года Google расширил доступ к системе через прототип Project Genie для подписчиков Google AI Ultra в США. Та самая Фэй-Фэй Ли основала стартап World Labs, который прошел путь от первой версии Marble до полноценного релиза, затем выпустил программный интерфейс для разработчиков, купил компанию SceniX ради компетенций в робототехнике и на прошлой неделе представил Atlas, «омни-модель» (ИИ, который в одной системе умеет работать сразу с разными типами информации: текстом, изображениями, звуком, видео, а иногда также с 3D-данными и действиями в физическом пространстве), способную по одной-двум фотографиям достраивать связную трехмерную сцену и генерировать до минуты видео в разрешении 1440p с точным управлением камерой. На эту гонку World Labs уже привлекла 1,23 миллиарда долларов от Nvidia, AMD, Autodesk и Fidelity, а параллельно у компании есть исследовательский прототип RTFM — модель, которая генерирует видео мира в реальном времени прямо по ходу взаимодействия пользователя, то есть именно то, что ByteDance только обещает выпустить.

Runway пошла своим путем и зимой представила семейство GWM-1, построенное поверх видеомодели Gen-4.5: система генерирует кадры один за другим в реальном времени и управляется действиями — положением камеры, командами робота, звуком. У GWM-1 три варианта: исследуемые миры для игр и VR, говорящие аватары с синхронизацией губ и синтетические данные для тренировки роботов, которые компания в перспективе планирует свести в одну модель. NVIDIA зашла в гонку с другой стороны — через инфраструктуру. Этим летом компания выпустила Cosmos 3, открытую омни-модель для «физического ИИ» на архитектуре из смеси трансформеров, объединяющую понимание видео, генерацию мира и предсказание действий робота в одной системе, и собрала вокруг нее коалицию разработчиков и робототехнических компаний — Agile Robots, Black Forest Labs, Generalist, LTX, ту же Runway и Skild AI. Для NVIDIA это удобно вдвойне: чем больше в отрасли моделей мира, тем больше нужно ее видеокарт для их обучения.

Meta выбрала философски другой подход. V-JEPA 2 Янна ЛеКуна не рисует пиксели вообще — модель с 1,2 миллиарда параметров, обученная на миллионе часов видео из Интернета, предсказывает происходящее в абстрактном пространстве представлений, а не в картинке, и именно поэтому в тестах на роботах-манипуляторах добивается результата в 65–80% успешных захватов незнакомых предметов. Это ставка на экономичность: незачем рендерить каждый листик на дереве, если роботу нужно только понять, что чашка упадет. По похожей логике работает стартап Physical Intelligence: его система π0 — вообще не генератор видео, а универсальная политика для роботов, которая напрямую связывает зрение, язык и движения манипулятора.

У всей этой россыпи проектов на деле два разных лица. Одно — генерируемые пространства для развлечений и VR: сюда идут ByteDance, Google DeepMind, World Labs и отчасти Runway, и там модель оценивают по тому, насколько убедительно она держит сцену на экране. Второе — инженерные симуляторы для физического мира: здесь тон задают NVIDIA, Meta и команды автономного транспорта вроде Wayve и Waabi, и там красота картинки вторична, а важна точность предсказания столкновений и траекторий. У OpenAI получившийся Sora показывал зачатки обеих способностей — трехмерную согласованность сцены и постоянство объектов, — но открыто заявленного интерактивного симулятора компания так и не выпустила.

Стоит держать в голове и границы обещанного. 20 кадров в секунду — это компромисс между интерактивностью и стоимостью облачных GPU, а не уровень полноценной VR-игры, и первые сценарии ByteDance, скорее всего, ограничатся сравнительно простыми сценами и стилизованной графикой. Облачный рендеринг решает проблему цены шлема, но создает новую зависимость — от быстрого Интернета и стоимости GPU на каждую активную сессию. А симуляция, убедительная для зрителя в наушниках VR, вовсе не гарантирует физической точности, достаточной для настоящего робота на складе.

Подписывайся на наш Telegram и не пропусти главные новости!