Ли Фэйфэй: Когда генерация видео, роботы и NVIDIA все называют себя мировыми моделями, нам нужна классификация
Автор: Ли Фэйфэй
Перевод: Цзя Ян
"Мировая модель" — это, вероятно, самый горячий и самый запутанный концепт в области ИИ с 2025 года. Когда появился Sora, OpenAI назвал его мировым симулятором; Genie позволяет вам гулять по сгенерированным изображениям и тоже называется мировой моделью; компании-роботы говорят, что они создают мировую модель, NVIDIA утверждает, что Omniverse является инфраструктурой для мировой модели, даже игровые движки были вовлечены в этот нарратив. Все используют одно и то же слово, но говорят о совершенно разных вещах.
Сегодня Ли Фэйфэй опубликовала новую статью на своем личном Substack, в которой проясняет эту концепцию. Она сначала возвращается к самой классической диаграмме из учебника по обучению с подкреплением (POMDP замкнутый цикл: агент → действие → состояние → наблюдение → агент), а затем указывает: то, что сейчас называется "мировой моделью", на самом деле является тремя разными проекциями этого замкнутого цикла. Выходящие пиксели (наблюдения) — это рендерер, выходящие состояния — это симулятор, выходящие действия — это планировщик. Критерий классификации очень прост, просто посмотрите, какую часть замкнутого цикла вы выводите.

(Источник: «MIT Technology Review»)
Она считает, что среди трех рендерер наиболее коммерчески зрелый, но имеет потолок (красота не равна физической точности), планировщик наиболее захватывающий, но находится дальше всего от реального развертывания (разрыв между лабораторными демонстрациями и фактической применимостью по-прежнему огромен), а симулятор является серьезно недооцененным ключевым узлом. Поскольку симулятор работает на уровне геометрии, физики и динамики, он может проецировать вверх в пиксели для потребления человеком, а также выводить последствия действий для использования роботами. Овладев симуляцией, вы одновременно обладаете основой для рендеринга и планирования; наоборот — нет.
Эта статья, конечно, также является продуктовым манифестом World Labs. Их Marble уже одновременно выводит гауссовские брызги и сетки столкновений, пытаясь объединить рендерер и симулятор в одной модели. Конечная цель, описанная в конце статьи, — это единая базовая модель мира, которая может свободно переключаться между рендерингом, симуляцией и планированием в зависимости от потребностей нижестоящих пользователей. Реализуется ли это видение — другой вопрос, но как аналитическая рамка, тройная классификация рендерер/симулятор/планировщик может действительно помочь прояснить часть шума вокруг текущей концепции "мировой модели".
Полный перевод статьи представлен ниже.
"Мир — это сумма всего, что происходит." ------ Витгенштейн, «Логико-философский трактат», 1921
Мир не состоит из слов.
В одной из предыдущих статей мы утверждали, что пространственный интеллект является следующим фронтиром ИИ, а мировая модель — это путь к нему. Здесь команда World Labs и я хотим углубиться еще больше: среди множества вещей, ныне именуемых "мировыми моделями", какие функциональные модули действительно составляют эту способность? Каковы их назначения?
Языковые модели предоставляют машинам мощный контроль над концепциями, словарным запасом и рассуждениями, но физический мир, будь то виртуальный или реальный, работает на совершенно другой основе. Языковые модели изучают статистическую структуру текста, мировые модели изучают статистическую структуру пространства и времени: как свет падает на поверхность, как сад выглядит с угла, который никогда не был захвачен камерой, как объекты реагируют на силы и следуют физическим законам.
Это делает "мировую модель" одним из самых важных и одновременно самых злоупотребляемых терминов в области ИИ. Компьютерное зрение, робототехника, обучение с подкреплением и генеративный ИИ все утверждают, что они строят мировые модели, но каждый из них имеет в виду совершенно разные вещи. Модель видео, которая может генерировать великолепные, но физически невозможные пламя, язык модели, который может спонтанно генерировать играбельные игры, физический движок, который точно моделирует процесс горения — все они называются одним и тем же именем.
Древние греки никогда не могли прийти к согласию о том, из чего состоит мир, будь то огонь, вода или неделимые атомы, потому что "мир" никогда не был единым понятием. Он всегда был заменителем, используемым каким-либо мыслителем для рассуждения о какой-то целостности. ИИ унаследовал ту же проблему, и это происходит в момент, когда в этой области требуется точность.
Замкнутый цикл за классификацией
Чтобы прояснить эту путаницу, можно начать с диаграммы, которая старше всех вышеперечисленных технологий. Все учебники по обучению с подкреплением, включая классические работы Саттона и Барто, на протяжении десятилетий используют вариации одной и той же диаграммы для описания того, как агент взаимодействует с миром. Официальное название этой диаграммы — частично наблюдаемая марковская решающая задача (POMDP), и первоначальное определение термина "мировая модель" принадлежит этой традиции.
Агент (это может быть человек, робот или программная система) выполняет действия. Эти действия изменяют состояние мира. Но агент никогда не может видеть само состояние напрямую, он получает наблюдения: фотоны, попадающие на сетчатку, показания сенсоров, пиксели в видеокадрах. Новые наблюдения направляют новые действия, и так по кругу.
Слово "состояние" нужно разобрать, потому что в разных областях его значение может смещаться. Здесь речь идет не о состоянии химика, не о различии между твердым, жидким и газообразным состояниями. Здесь речь идет о состоянии физиков и робототехников: полное описание всего, что происходит в мире в данный момент, включая каждый объект, каждую позицию, каждую скорость, каждое свойство. Состояние — это базовая реальность мира, принципиально полная, но для любого агента, находящегося внутри, она всегда недоступна для прямого наблюдения. Наблюдение — это локальная перспектива агента на эту реальность. Действия — это ответ агента на это.
Этот замкнутый цикл (агент → действие → состояние → наблюдение → агент) и есть структура, придающая техническое значение термину "мировая модель". Эта фраза сама по себе гораздо старше и восходит к предложению Кеннета Крайка в 1943 году, который считал, что разум осуществляет рассуждения, работая с "маленькой пропорциональной моделью" реальности, а к концу 1980-х и началу 1990-х годов эта концепция была введена в область нейронных сетей. Этот замкнутый цикл также объясняет, что люди имеют в виду, когда используют этот термин сегодня. То, что сейчас называется мировой моделью, на самом деле является разными проекциями одного и того же замкнутого цикла, каждая из которых выводит разные составные части цикла.
Три функции мировой модели
Первая мировая модель — это рендерер. Рендерер выводит наблюдения, конкретно — пиксели, ориентированные на человеческий глаз, а самым важным качественным показателем является визуальная достоверность. Видео-модель, которая преобразует текстовые подсказки в кинематографические аэрофотоснимки, является рендерером; интерактивные системы, такие как Genie 3 от Google или собственный RTFM от World Labs, также являются рендерерами, которые в реальном времени генерируют изображения на основе пользовательского ввода. Такие модели не обладают явным пониманием трехмерной структуры. Они генерируют то, что увидит зритель, а не то, как выглядят сами вещи. Здания на аэрофотоснимках могут выглядеть безупречно, но попробуйте пройтись по городу внизу, и они рухнут.
Вторая — это симулятор. Симулятор выводит состояния: верное представление мира в геометрическом, физическом или динамическом плане, на котором как люди, так и компьютерные программы могут проводить вычисления и взаимодействовать. Контракт рендерера чисто визуальный, в то время как контракт симулятора структурный, он требует, чтобы геометрия выдерживала проверку, физика следовала законам Ньютона, а динамическое поведение соответствовало ожидаемым физическим законам. Симулятор одновременно обслуживает две категории пользователей. Архитекторы, дизайнеры, кинематографисты, разработчики игр и другие профессионалы нуждаются в точности, выходящей за рамки визуальной достоверности. Компьютерные программы, такие как агенты обучения с подкреплением, контроллеры роботов, автономные транспортные средства, используют симулятор как тренировочную площадку, на которой они взаимодействуют с миром в большом масштабе, тестируя сценарии, которые в реальности либо опасны, либо дороги, либо вообще невозможны для выполнения.
Третья — это планировщик. Планировщик выводит действия. Учитывая наблюдение и цель, вопрос, на который отвечает планировщик, заключается в следующем: что агент должен сделать дальше? Во многих отношениях планировщик является обратным процессом рендерера. Рендерер принимает действия на входе и выдает наблюдения, в то время как планировщик принимает наблюдения на входе и выдает действия, замыкая тем самым цикл восприятия-действия. Модели визуально-языковых действий (VLA), модели на основе модели, а также новая волна мировых моделей действий (World Action Models) — это разные попытки планировщика: позволить системе решать, что должен делать робот в неструктурированном мире.
Эти три категории охватывают большую часть текущей работы, которая уже реализуется, и различия между ними полезны на практике. Но эти три категории не являются принципиально разрозненными. Они разделяют одну и ту же базовую знание о том, как работает мир: геометрия, физика, динамика. Модель, которая может рендерить чашку с любого угла, принципиально также должна уметь симулировать, что произойдет, если чашку толкнуть, и планировать, как рука поднимет ее. Все более интересные исследования намеренно размывают границы между этими тремя.

Иллюстрация | Три типа мировых моделей (Источник: Substack)
Почему симуляция является ключевым узлом
Среди трех категорий симулятор получает наименьшее внимание общественности, но он является самым важным из трех. Эта статья хочет исправить эту асимметрию.
Рендерер в настоящее время наиболее коммерчески зрелый. Множество продуктов по преобразованию изображений или текста в видео быстро расширяются на потребительском и корпоративном рынках. Модель Nano Banana от Google предоставила возможности генерации изображений на уровне рендерера, возможно, миллиардам пользователей. Технология реальна, рынок тоже реален. Однако цель оптимизации рендерера — визуальная достоверность, а не физическая точность, и этот потолок важен. Их выводы красивы, но вы не можете использовать их для проектирования здания или обучения робота.
Планировщик является самым захватывающим, но наименее зрелым, он тесно связан с быстро развивающейся областью обучения роботов. За последние два года эта область произвела множество впечатляющих демонстраций роботов на видео, но нам нужно честно признать, что эти демонстрации на самом деле показывают. Почти все демонстрации ограничены сильно контролируемыми лабораторными условиями, с ограниченным набором объектов и коротким временем выполнения задач. Ни одна из них не прошла верификацию, требуемую для развертывания в реальном мире, с его сложностью, разнообразием и продолжительностью. Пропасть между впечатляющим демонстрационным видео и роботом, который может надежно работать на кухне, в складе или в операционной, по-прежнему огромна.
Тем не менее, масштабы коммерческих ставок все еще значительны. Новые игроки с достаточным финансированием стремятся запустить универсальные системы планирования, в то время как крупные игроки инфраструктуры строят возможности планирования на более широком стеке симуляции.
Симуляция является мостом, соединяющим обе категории. Если язык — это абстракция мира, а пиксели — это проекция мира, то геометрия, физика и динамика — это сам мир. Симулятор должен работать на этом уровне: он является структурным каркасом, из которого можно выводить как визуальные представления (для использования рендерером), так и последствия действий (для использования планировщиком).
Модель, овладевшая симуляцией, может проецировать свое понимание в пиксели для потребления человеком, а также в предсказания действий для использования телесными агентами. А модель, которая овладела только рендерингом или только планированием, не может сделать ни то, ни другое. Здесь коммерческое пространство чрезвычайно велико. Только у NVIDIA с Omniverse целевой рынок, по оценкам компании, превышает триллион долларов, охватывая фабрики, склады, цепочки поставок и цифровые двойники. Обучение роботов, тестирование автономного вождения, визуализация зданий, проектирование инженерных решений, открытие лекарств — все это зависит от какой-то формы симуляции.
Самые сложные открытые вопросы в этой области также сосредоточены здесь. Трехмерные данные с явной геометрией, свойствами материалов и физическими метками редки на несколько порядков по сравнению с интернет-видео, используемыми для обучения рендереров. Разрыв sim-to-real (разница в поведении объектов в симуляции и в реальном мире) все еще существует. Генеративные симуляторы вводят новые риски: геометрия, созданная ИИ, может выглядеть правильно, но на самом деле содержать проблемы с самопересечением или неправильными пропорциями, что приводит к абсурдным результатам физической симуляции. Вычислительные затраты на массовую многопрофильную симуляцию (взаимодействие жестких тел, деформируемых объектов, жидкостей и тканей одновременно) все еще на несколько порядков выше, чем у симуляции в одной области.
В World Labs Marble — это наш первый шаг в этом направлении. Он принимает многомодальные входные данные (текст, изображения, видео или пространственные эскизы), генерирует исследуемую 3D-среду, одновременно выводя гауссовские брызги для визуального исследования и сетки столкновений для работы физического движка. Но Marble — это только первая глава длинной дуги. Поскольку границы между рендерингом, симуляцией и планированием начинают стираться, вся область пишет эту историю.
Границы стираются, и что произойдет дальше
Самая важная тенденция в этой области заключается в том, что три категории начинают сливаться. Основной консенсус заключается в том, что знания, необходимые для рендеринга мира, его симуляции и действий в нем, в значительной степени одинаковы. Используя предыдущий пример, модель, которая действительно понимает, как чашка стоит на столе (ее геометрия, свойства материалов, реакция на силы и т. д.), должна быть в состоянии рендерить эту чашку с любого угла, симулировать, что произойдет, если чашку толкнуть, и планировать, как рука поднимет ее. Три категории — это три проекции одного и того же базового понимания.
Например, недавно появилось небольшое, но растущее количество работ из различных лабораторий робототехники, которые демонстрируют возможность, по крайней мере концептуально: предобученный видео-рендерер может служить основным сетевым соединением для совместного предсказания мира и предсказания действий, позволяя единой модели одновременно представлять "что произойдет" и "что делать", тем самым создавая мост между рендерером и планировщиком. Marble от World Labs уже может одновременно выводить гауссовские брызги и сетки столкновений из единой модели, стирая границы между рендерером и симулятором. Каждый уровень переходит от пассивного вывода к интерактивным системам: рендерер становится способным реагировать на условия действий, мир, созданный симулятором, становится более управляемым и редактируемым, а планировщик начинает проводить осторожные рассуждения, а не просто реагировать.
Логическим конечным пунктом является единая мировая модель: базовая модель, способная рендерить фотореалистичные изображения, генерировать физически точные структуры, планировать последовательности действий и переключаться между различными выходными модальностями в зависимости от потребностей нижестоящих пользователей. Мы все еще столкнемся с рядом серьезных вызовов. Данные крайне неравномерно распределены: рендереры имеют доступ к огромному количеству интернет-видео, в то время как симуляторы и планировщики сталкиваются с серьезной нехваткой 3D-активов и демонстрационных данных для роботов. Оптимизация для визуальной привлекательности может жертвовать точностью, необходимой для роботов или высокоточных симуляций. Согласование этих напряжений в рамках единой архитектуры является основной открытой проблемой исследований мировых моделей сегодня и тем, над чем World Labs стремится работать, продолжая развивать Marble.

(Источник: Substack)
Но общий курс уже ясен. С конца 1980-х годов в этой области ставится одна и та же ставка: если мировая модель достаточно богата, то все, что агенту нужно для того, чтобы видеть мир, строить его и действовать в нем, уже внутри. Эта ставка сейчас движет исследованиями целого поколения. А действительно придаёт ей вес уже происходящее слияние: рендеринг, симуляция и планирование, каждая из которых уже поддерживает индустрию стоимостью десятки миллиардов долларов, изначально были независимыми направлениями исследований, но теперь начинают сливаться. Когда границы исчезают, слияние трех определит нечто большее: отношение машинного интеллекта к физическому миру, в котором он обитает, то есть долгосрочную траекторию пространственного интеллекта.
Язык дал машинам способ говорить об этом мире. Мировая модель — это путь, по которому машины в конечном итоге смогут понять, представить, рассуждать и взаимодействовать с ним.












