Programmable World Model — новый фреймворк для управляемых видеомиров с постоянным состоянием
На arXiv опубликована работа Programmable World Model, в которой авторы предлагают фреймворк для создания интерактивных видеомиров с явным, сохраняемым между кадрами состоянием. Вместо того чтобы генерировать видео напрямую из текстового описания, система переводит инструкции на естественном языке в исполняемые программы, описывающие сущности и правила их взаимодействия. Лёгкий движок поддерживает глобальное состояние мира, включая объекты за кадром и невизуальные атрибуты. Для связи состояния с генерацией видео используется промежуточное представление — state-augmented 3D oriented bounding boxes (OBB), которые вместе с траекторией камеры компилируются в сигналы обусловливания для предобученной видеомодели. Авторы также представили бенчмарк CombatStateBench, на котором их метод достигает 94% точности подсчёта объектов и 98% точности состояния. Код выложен в открытый доступ.
Что это значит
Новость касается направления генерации видео в целом — в нашем разделе AI Video собраны инструменты, которые решают задачу иначе. Programmable World Model — это не генератор видео в привычном смысле, а фреймворк поверх предобученной видеомодели: он добавляет слой управления состоянием и правила, а видеомодель выступает рендерером. Прямого аналога среди наших карточек нет.
Ближайшие по теме инструменты из справочника:
Lance — открытая any-to-any модель от Bytedance на 3B активных параметров, веса занимают 28.6 ГБ, самый большой файл — 13.2 ГБ. Авторы требуют GPU с 40 ГБ видеопамяти и CUDA 12.4+. Модель умеет понимать и генерировать изображения и видео, но постоянного состояния мира и программируемых правил в паспорте нет.
LTX-Video — image-to-video генератор от Lightricks, веса 236.4 ГБ, лицензия кода Apache-2.0, весов — other. Заявлена работа с 1 ГБ видеопамяти и поддержка MPS на macOS. Это классический генератор коротких роликов без механики состояния.
CogVideoX — text-to-video модель от Zhipu AI, веса 20 ГБ, лицензия кода Apache-2.0, весов — other. Требует CUDA, авторы упоминают NVIDIA H100. Также не поддерживает постоянное состояние мира.
Programmable World Model решает задачу, которой нет в паспортах наших инструментов: явное управление сущностями, правила переходов и сохранение состояния за пределами видимого кадра. Для пользователя, который выбирает инструмент в нашем справочнике, это скорее сигнал о направлении развития, чем готовый инструмент для локального запуска: авторы не уточняют требования к видеопамяти, размер весов и лицензию в описании работы.Как устроен метод. Схема нарисована по этой заметке.