Stream4D добавляет 4D-согласованность в потоковые авторегрессионные видеомодели
Авторы работы Stream4D: 4D-Consistency for Streaming Autoregressive Diffusion Video Models (arXiv, 20.08.2026) предлагают метод обучения потоковых авторегрессионных диффузионных моделей, который заменяет статичную 3D-реконструкцию в функции награды на прямую 4D-реконструкцию, явно моделирующую динамику сцены. Это позволяет поощрять естественное движение вместо того, чтобы штрафовать его как ошибку реконструкции. Дополнительно вводится motion prior, который награждает естественную величину scene flow и штрафует дрожание и нежёсткие артефакты. Код авторы не выкладывали.
Что это значит
Работа касается темы генерации видео в целом — см. раздел AI video на CPU3D. Среди инструментов нашего справочника прямых аналогов Stream4D нет: это метод обучения, а не готовый генератор.
Ближайшие по теме инструменты — LTX-Video, CogVideoX и Pyramid Flow. Все три — диффузионные генераторы видео с открытым кодом, но в их паспортах нет указаний на потоковый авторегрессионный режим генерации, на обучение с reward-сигналами на основе 3D- или 4D-реконструкции и на использование scene flow. LTX-Video решает задачу image-to-video, CogVideoX и Pyramid Flow — text-to-video; ни один из них не заявлен как streaming autoregressive.
Таким образом, Stream4D описывает исследовательский подход, который пока не представлен в виде готового инструмента в нашем справочнике. Если авторы опубликуют код или метод появится в одном из открытых генераторов, это будет повод обновить соответствующие карточки.Как устроен метод. Схема нарисована по этой заметке.