DiffVC-ONE представили одношаговое сжатие видео диффузией на Video DiT
arXiv опубликовал работу DiffVC-ONE — фреймворк генеративного сжатия видео на основе одношагового Video Diffusion Transformer. Авторы заявляют о трёх компонентах: Unified Unidirectional Latent Compressor для сжатия латентных срезов, One-Step Diffusion Enhancer для пространственно-временного улучшения целой группы кадров за один шаг и Hybrid Condition Generator, который извлекает структурные, силовые и семантические условия. По утверждению авторов, на стандартных бенчмарках достигнуто качество восприятия и временная согласованность уровня state-of-the-art при низкой стоимости инференса. Код авторы не выкладывали.
Что это значит
Работа относится к сжатию видео, а не к генерации по текстовому или визуальному промпту, поэтому с инструментами из раздела генераторов видео она пересекается лишь косвенно — через общую архитектурную основу Video Diffusion Transformer.
Из наших паспортов ближе всего по архитектурной линии стоит LTX-Video: его репозиторий помечен тегом dit, и авторы описывают его как diffusion-based генератор. Однако LTX-Video решает задачу image-to-video, а не сжатия, и никаких компонентов для латентного сжатия или одношагового улучшения в его паспорте нет. CogVideoX и Pyramid Flow — это text-to-video генераторы, и к задаче сжатия видео они отношения не имеют.
Практического пересечения с нашим справочником у DiffVC-ONE сейчас нет: кода нет, задача другая, и ни один из описанных у нас инструментов не решает задачу генеративного сжатия видео. Если авторы опубликуют реализацию, можно будет вернуться к сравнению по требованиям к памяти и скорости, но пока это исследовательская работа без доступного кода.Как устроен метод. Схема нарисована по этой заметке.