arXiv 上发布了 V-RAE 的研究论文,作者在其中重新审视了视频自编码器潜在空间的构造方式。他们不再仅仅针对逐像素重建来优化潜在空间,而是在视觉基础模型的冻结表示之上构建紧凑的生成式潜在变量。一个轻量级的时间池化模块去除了时间冗余,同时保留了语义结构,视频解码器则从压缩特征中恢复连续运动。作者报告称在 K600 上取得了 2.13 的 rFVD,据他们称,这优于所有被评估的大规模预训练视频 VAE,同时在 UCF101 上取得了 117.86 的 gFVD,在 K600 上取得了 19.16 的 gFVD,且收敛速度快了最多 6 倍。此外还引入了一个用于诊断时间一致性的 tFVD 指标。作者尚未公开代码。更多详情请见
arXiv 上的论文页面。
这意味着什么
这项工作涉及生成式视频模型的基础层——即把视频压缩到潜在空间的自编码器。在我们的
AI 视频工具指南中,有三个开源的视频生成器,它们都使用自有的或继承而来的自编码器。
LTX-Video(来自 Lightricks)的任务是 image-to-video,权重托管在 Hugging Face 上,代码以 Apache-2.0 许可证开源。其参数表中没有说明具体使用哪种自编码器以及其潜在空间是如何构造的,因此我们无法根据现有数据将 V-RAE 的方法与 LTX-Video 当前的架构进行直接对比。
CogVideoX(智谱 CogVideoX,来自 Zhipu AI)解决的是 text-to-video 任务,代码以 Apache-2.0 许可证开源。在仓库描述中提到了 CogVideoX(2024)和 CogVideo(ICLR 2023),但参数表中没有关于潜在空间构造或所用视频自编码器的细节。
Pyramid Flow(快手 Pyramid Flow)是一个以 MIT 许可证开源的 text-to-video 生成器,其工作被描述为用于高效视频生成建模的金字塔流匹配。与另外两个工具一样,其参数表中也没有包含关于哪个自编码器压缩视频、以及其潜在空间是否为生成任务而优化的信息。
V-RAE 是一项没有公开代码的研究工作,因此目前对上述工具没有实际影响。如果该方法得到实现和复现,它可能会改变未来版本的开源视频生成器中潜在空间的构造方式,但对当前版本的 LTX-Video、CogVideoX 和 Pyramid Flow 没有影响。
方法的工作原理。示意图根据这篇简讯绘制。