CPU3DИИ-инструменты для 3D и видео

V-RAE предлагает новый подход к латентным пространствам для генерации видео

На arXiv опубликована работа V-RAE, в которой авторы пересматривают устройство латентных пространств видеоавтоэнкодеров. Вместо оптимизации латентного пространства только под попиксельную реконструкцию они строят компактные генеративные латенты поверх замороженных представлений vision foundation models. Лёгкий модуль temporal pooling убирает временную избыточность, сохраняя семантическую структуру, а видеодекодер восстанавливает непрерывное движение из сжатых признаков. Авторы сообщают о 2.13 rFVD на K600, что, по их словам, превосходит все оценённые крупномасштабные предобученные видео VAE, а также о gFVD 117.86 на UCF101 и 19.16 на K600 при сходимости до 6 раз быстрее. Также вводится метрика tFVD для диагностики временной согласованности. Код авторы не выкладывали. Подробнее — на странице работы на arXiv.

Что это значит

Работа касается базового слоя генеративных видеомоделей — автоэнкодера, который сжимает видео в латентное пространство. В нашем справочнике по теме ИИ-инструментов для видео есть три генератора видео с открытым кодом, и все они используют собственные или унаследованные автоэнкодеры. У LTX-Video от Lightricks задача — image-to-video, веса лежат на Hugging Face, код открыт под Apache-2.0. В паспорте нет сведений о том, какой именно автоэнкодер используется и как устроено его латентное пространство, поэтому напрямую сопоставить подход V-RAE с текущей архитектурой LTX-Video по нашим данным нельзя. CogVideoX от Zhipu AI решает задачу text-to-video, код открыт под Apache-2.0. В описании репозитория упоминаются CogVideoX (2024) и CogVideo (ICLR 2023), но деталей об устройстве латентного пространства или используемом видеоавтоэнкодере в паспорте нет. Pyramid Flow — text-to-video генератор с открытым кодом под MIT, работа описывается как pyramidal flow matching для эффективного видеогенеративного моделирования. Как и в двух других случаях, паспорт не содержит информации о том, какой автоэнкодер сжимает видео и оптимизировано ли его латентное пространство под генеративные задачи. V-RAE — это исследовательская работа без опубликованного кода, поэтому практического влияния на перечисленные инструменты она пока не оказывает. Если подход будет реализован и воспроизведён, он может изменить то, как устроены латентные пространства в будущих версиях открытых видеогенераторов, но на текущие версии LTX-Video, CogVideoX и Pyramid Flow это не влияет.
V-RAE: латентное пространство поверх vision foundation models Видео последовательность кадров Vision foundation model замороженные признаки Temporal pooling убирает избыточность Латент компактные признаки Видеодекодер восстанавливает движение Видео непрерывное движение Метрики rFVD 2.13 на K600 gFVD 117.86 на UCF101 tFVD — временная согласованность Код не опубликован; практического влияния на LTX-Video, CogVideoX и Pyramid Flow пока нет
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также