Модель мира — новое и быстро развивающееся направление в ИИ, куда уже идут крупные инвестиции. Это система, которая старается понимать физическую реальность, а не только текст или отдельные изображения: она изучает, как устроены объекты, как они движутся и что произойдет, если с ними что-то сделать. По сути, это виртуальная копия законов физики внутри нейросети. Если робот толкнет чашку, такая модель должна заранее «знать», что чашка упадет и разобьется, а сцена вокруг изменится.
Тема важна потому, что языковые модели хорошо работают с текстом, но плохо предсказывают, что случится в пространстве и времени. Роботу, беспилотному автомобилю или киностудии мало красивой картинки. Им нужна система, которая просчитывает физику и сама выбирает следующий шаг. Именно поэтому крупные лаборатории и инвесторы сейчас вкладывают в модели мира миллиарды долларов.
Четче всех эту идею сформулировала Фэй-Фэй Ли, профессор Стэнфорда и создательница ImageNet — базы из пятнадцати миллионов размеченных изображений, которая в свое время дала толчок глубокому обучению в компьютерном зрении. За этот вклад ее прозвали «крестной матерью Искусственного интеллекта», а в 2025 году журнал Time включил ее в список из восьми архитекторов ИИ года.
Ли предлагает делить любую модель мира на три функции. Рендер превращает текст, фото или видео в картинку и отвечает только за то, насколько она убедительна. Симулятор устроен иначе: он считает, как объекты ведут себя во времени под действием физики, и выдает не картинку, а состояние сцены, с которым напрямую может работать программа. Планировщик берет это состояние и выбирает действие. Так замыкается цикл: увидел, просчитал, сделал.
По словам Ли, почти все системы, которые сегодня называют моделями мира, включая генераторы изображений вроде Nano Banana от Google, на деле остаются рендерами. Они умеют делать визуально правдоподобные картинки и видео, приносят реальные деньги, но не дают физической точности, так что им нельзя доверить ни проектирование здания, ни обучение робота. Настоящие симуляторы куда менее заметны широкой публике, зато именно на них, по оценке Nvidia, завязан рынок на триллионы долларов — заводы, склады, логистика, цифровые двойники инфраструктуры и целых городов. Именно в эту нишу сейчас активно заходит собственный стартап «крестной матери ИИ» World Labs. Компания с 2023 года строит большие модели мира — редактируемые трехмерные среды из фото, видео или текста. Они используются в кино, играх, архитектуре и виртуальном продакшене. Первый продукт компании, Marble, вышел из ограниченной беты в конце 2025 года, а через несколько месяцев получил широкий коммерческий доступ.
Конкуренты не отстают. Nvidia представила Cosmos 3 — открытую модель мира, обученную на 20 триллионах токенов, включая почти миллиард изображений и 400 миллионов видео с людьми и роботами. Главное отличие от обычного видеогенератора в том, что модель выдает не только картинку, но и данные о действии: углы суставов робота, положение захвата, траекторию движения. Этим машина может напрямую воспользоваться. Компания сразу выпустила две версии — Super для задач с высокой физической точностью и Nano для быстрой генерации, а версия Edge для устройств выйдет позже. Вокруг модели уже собралась коалиция из Agile Robots, Black Forest Labs, Runway и других разработчиков роботов и видео.
К гонке присоединился и лондонский PhysicsX. Компания получила 300 миллионов долларов инвестиций при оценке в 2,4 миллиарда. Ее продукт заменяет классические инженерные расчеты — как поведет себя крыло самолета, чип или турбина. Модель выдает результат за секунды вместо часов. По собственным данным компании, это уже сократило цикл проектирования самолетов.
К теме подключился и Китай. Шанхайская компания Fysics AI, которую основал бывший топ-менеджер Nvidia Чжан Лихуа, выпустила Fysiverse — модель, изначально построенную на законах физики, а не на статистике из видео. Компания заявляет, что таким путем обходит подходы OpenAI и Meta и избегает типичных болезней моделей мира: физических галлюцинаций и логических сбоев в нестандартных сценариях.
Практическая польза здесь не абстрактная. Роботы вроде тех, что делает Agile Robots, отрабатывают тысячи вариантов захвата предмета внутри симуляции и переносят в цех уже готовый навык. Это и есть обучение в буквальном смысле слова, только безопасное и многократно ускоренное. Автономный транспорт, архитектурная визуализация, инженерное проектирование и разработка лекарств — все это Ли называет областями, которые зависят от качества симуляционного слоя. В промышленности PhysicsX инженер перебирает за сутки тысячи вариантов конструкции там, где раньше хватало сил на десяток. В науке та же логика работает как безопасная песочница для экспериментов, которые нельзя ставить на реальном объекте. В креативной индустрии эффект заметнее всего в кино и играх, где Genie 3 от Google DeepMind и Marble от World Labs уже строят целую интерактивную сцену по одному изображению.
Единого рецепта у отрасли нет. Ли и Nvidia продвигают генеративный путь: модель рисует пиксели и учится физике по видео. Главный ИИ-исследователь Meta Янн Лекун с этим не согласен и продвигает архитектуру JEPA, которая вообще не генерирует картинку, а сразу предсказывает абстрактное состояние сцены. Но ясно одно, что следующий этап развития Искусственного интеллекта как технологии будет все больше и больше использовать модель мира.
