CPU3D3D、视频与音频的 AI 工具

DSAQuant 提出考虑去噪阶段的视频扩散量化方法

作者们在 arXiv 上的论文中展示,普通的 quantization-aware training 会破坏视频模型中的细节和锐度,尽管整体构图和运动得以保留。原因在于量化不区分去噪阶段:早期步骤构建结构,后期步骤负责纹理。DSAQuant 根据这些阶段对齐训练,并在最终步骤中关闭 CFG,以避免量化误差变成高频伪影。该方法已在 Wan 和 CogVideoX 系列上以 W4A4 和 W3 模式验证,代码已开源。

这意味着什么

这项工作涉及我们指南中的两个生成器——Wan(通义万相)CogVideoX(智谱 CogVideoX)。两者都是开源的,都解决 text-to-video 任务,两者的代码均采用 Apache-2.0 许可证,并且都通过 diffusers 库运行。 Wan 来自阿里巴巴,是一个大型模型:最大的权重文件为 10.6 GB,所有文件合计 64.3 GB。同时,作者声称支持消费级 GPU:较小的 T2V-1.3B 版本需要 8.19 GB 显存,并在 RTX 4090 上无需量化即可在大约四分钟内生成 480P 的五秒视频。CogVideoX 来自智谱 AI,权重明显更轻——最大的文件为 9.2 GB,总计 20 GB,但据作者描述,它面向 NVIDIA H100 及以上级别的设备,需使用 CUDA 12.4。 对于消费级显卡的用户来说,DSAQuant 是另一种在不更换硬件的情况下降低 Wan 和 CogVideoX 内存需求的方法。至于量化后功耗具体降低多少以及生成速度如何变化,作者在摘要中并未说明。
DSAQuant:按去噪阶段量化视频扩散 输入 文本提示 视频模型 Wan / CogVideoX 常规 QAT 所有阶段 相同 破坏细节 问题 细节丢失 和锐度 伪影 DSAQuant 按阶段对齐训练 在最终步骤关闭 CFG 早期步骤 构建结构 后期步骤 负责纹理 结果:W4A4 和 W3,显存更少,细节不丢失
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读