4DStreamCtrl объединяет управление камерой, объектами и глубиной в потоковом режиме
На arXiv опубликована работа 4DStreamCtrl — метод интерактивной генерации видео, который сводит движение камеры, траектории объектов и глубину к единому представлению 3D point-track. Авторы обучают Geometric Motion Head поверх предобученной видео-диффузионной модели и дистиллируют её в потокового студента, который генерирует видео произвольной длины за четыре шага денойзинга с памятью, не зависящей от длины ролика. По заявлению авторов, метод работает на скорости 20 FPS для видео 480p на одной high-end GPU. Код авторы не выкладывали — arXiv.
Что это значит
Для инструментов из нашего раздела генераторов видео эта работа скорее обозначает направление, чем даёт готовый инструмент: кода нет, весов нет, воспроизвести метод по статье нельзя.
Сравнение с нашими паспортами:
LTX-Video — image-to-video генератор от Lightricks с открытым кодом. В паспорте нет ни управления камерой, ни траекториями объектов, ни потокового режима. 4DStreamCtrl решает задачу, которой у LTX-Video нет вовсе.
CogVideoX — text-to-video генератор от Zhipu AI. Управление движением в паспорте не заявлено, как и стриминг. Прямого пересечения с 4DStreamCtrl нет.
Pyramid Flow — text-to-video генератор с открытым кодом. В паспорте упомянуты multi-GPU inference и CPU offloading, но не управление движением и не потоковая генерация произвольной длины.
Пока 4DStreamCtrl остаётся исследовательской публикацией без публичного кода, практического влияния на доступные инструменты из справочника у него нет. Если авторы выложат реализацию, сравнение по памяти, скорости и качеству управления станет возможным — сейчас для этого нет данных.Как устроен метод. Схема нарисована по этой заметке.