作者们在
arXiv 上的论文中展示,普通的 quantization-aware training 会破坏视频模型中的细节和锐度,尽管整体构图和运动得以保留。原因在于量化不区分去噪阶段:早期步骤构建结构,后期步骤负责纹理。DSAQuant 根据这些阶段对齐训练,并在最终步骤中关闭 CFG,以避免量化误差变成高频伪影。该方法已在 Wan 和 CogVideoX 系列上以 W4A4 和 W3 模式验证,代码已开源。
这意味着什么
这项工作涉及我们指南中的两个生成器——
Wan(通义万相)和
CogVideoX(智谱 CogVideoX)。两者都是开源的,都解决 text-to-video 任务,两者的代码均采用 Apache-2.0 许可证,并且都通过 diffusers 库运行。
Wan 来自阿里巴巴,是一个大型模型:最大的权重文件为 10.6 GB,所有文件合计 64.3 GB。同时,作者声称支持消费级 GPU:较小的 T2V-1.3B 版本需要 8.19 GB 显存,并在 RTX 4090 上无需量化即可在大约四分钟内生成 480P 的五秒视频。CogVideoX 来自智谱 AI,权重明显更轻——最大的文件为 9.2 GB,总计 20 GB,但据作者描述,它面向 NVIDIA H100 及以上级别的设备,需使用 CUDA 12.4。
对于消费级显卡的用户来说,DSAQuant 是另一种在不更换硬件的情况下降低 Wan 和 CogVideoX 内存需求的方法。至于量化后功耗具体降低多少以及生成速度如何变化,作者在摘要中并未说明。
方法的工作原理。示意图根据这篇简讯绘制。