CPU3D3D、视频与音频的 AI 工具

DiffVC-ONE 推出基于 Video DiT 的单步视频扩散压缩

arXiv 发布了 DiffVC-ONE 的论文——一种基于单步 Video Diffusion Transformer 的生成式视频压缩框架。作者声称包含三个组件:Unified Unidirectional Latent Compressor 用于压缩潜在切片,One-Step Diffusion Enhancer 用于在单步内对整个帧组进行时空增强,以及 Hybrid Condition Generator,用于提取结构、力和语义条件。据作者描述,在标准基准上达到了 state-of-the-art 级别的感知质量和时间一致性,同时推理成本较低。作者未公开代码。

这意味着什么

这项工作属于视频压缩领域,而非基于文本或视觉提示的生成,因此与 视频生成器部分 中的工具仅间接相关——通过共同的架构基础 Video Diffusion Transformer。 在我们的参数表中,架构上最接近的是 LTX-Video:其仓库标记为 dit 标签,作者将其描述为基于扩散的生成器。然而,LTX-Video 解决的是 image-to-video 任务,而非压缩,其参数表中也没有任何用于潜在压缩或单步增强的组件。CogVideoX(智谱 CogVideoX)Pyramid Flow(快手 Pyramid Flow) 是 text-to-video 生成器,与视频压缩任务无关。 目前 DiffVC-ONE 与我们的指南没有实际交集:没有代码,任务不同,我们描述的任何工具都不解决生成式视频压缩问题。如果作者发布实现,可以再回来比较内存要求和速度,但目前这只是一项没有可用代码的研究工作。
DiffVC-ONE — 单步扩散视频压缩 视频 原始帧 Unified Unidirectional Latent Compressor 潜在切片压缩 One-Step Diffusion Enhancer 帧组增强 压缩视频 结果 Hybrid Condition Generator 结构、力、语义 Video Diffusion Transformer 架构基础 与生成器的区别: LTX-Video — image-to-video,dit 标签,无潜在压缩 CogVideoX(智谱 CogVideoX)和 Pyramid Flow(快手 Pyramid Flow)— text-to-video,与压缩无关 代码未开源 — 仅研究论文,无实现
方法的结构。示意图根据这篇简讯绘制。

相关阅读