Latent-to-4D генерирует 4D-сцены напрямую из латентов видео без промежуточного RGB
Авторы работы Beyond Pixels: From Video Priors to 4D Worlds предлагают метод Latent-to-4D, который минует этап восстановления RGB-видео и предсказывает динамическую 3D-сцену прямо из финальных денойз-латентов видеомодели. Подход опирается на то, что видеогенераторы одного семейства разделяют общий VAE, поэтому латентное пространство можно использовать как переносимый интерфейс. Один чекпоинт, обученный примерно на тысяче клипов, переносится без изменений между разными video diffusion transformers внутри одного VAE-семейства. Код авторы не выкладывали.
Что это значит
Работа касается связки «генератор видео — 4D-сцена», то есть того, что в нашем справочнике относится к разделу AI-видео и 3D. Из инструментов, которые мы описываем, ближе всего по теме — Wan: это открытый генератор видео от Alibaba с задачей text-to-video, код и веса доступны под Apache-2.0, модель работает через diffusers.
В паспорте Wan нет сведений о том, что он умеет отдавать промежуточные латенты наружу для downstream-задач вроде 4D-реконструкции. Авторы Latent-to-4D упоминают Wan в контексте сравнения с каскадами «видео + 4D-реконструктор», но это сравнение в рамках их бенчмарков, а не заявленная интеграция с самим Wan. Разработчик Wan не описывает такой сценарий использования.
Практического следа для пользователя здесь пока немного: кода нет, чекпоинт не опубликован, а сам метод завязан на доступ к латентам конкретного VAE-семейства. Для тех, кто работает с Wan, это скорее сигнал о направлении, в котором может развиваться связка видео и 4D, чем готовый инструмент.Как устроен метод. Схема нарисована по этой заметке.