arXiv 发布了 DiffVC-ONE 的论文——一种基于单步 Video Diffusion Transformer 的生成式视频压缩框架。作者声称包含三个组件:Unified Unidirectional Latent Compressor 用于压缩潜在切片,One-Step Diffusion Enhancer 用于在单步内对整个帧组进行时空增强,以及 Hybrid Condition Generator,用于提取结构、力和语义条件。据作者描述,在标准基准上达到了 state-of-the-art 级别的感知质量和时间一致性,同时推理成本较低。作者未公开代码。
这意味着什么
这项工作属于视频压缩领域,而非基于文本或视觉提示的生成,因此与
视频生成器部分 中的工具仅间接相关——通过共同的架构基础 Video Diffusion Transformer。
在我们的参数表中,架构上最接近的是
LTX-Video:其仓库标记为 dit 标签,作者将其描述为基于扩散的生成器。然而,LTX-Video 解决的是 image-to-video 任务,而非压缩,其参数表中也没有任何用于潜在压缩或单步增强的组件。
CogVideoX(智谱 CogVideoX) 和
Pyramid Flow(快手 Pyramid Flow) 是 text-to-video 生成器,与视频压缩任务无关。
目前 DiffVC-ONE 与我们的指南没有实际交集:没有代码,任务不同,我们描述的任何工具都不解决生成式视频压缩问题。如果作者发布实现,可以再回来比较内存要求和速度,但目前这只是一项没有可用代码的研究工作。
方法的结构。示意图根据这篇简讯绘制。