CPU3D3D、视频与音频的 AI 工具

SQuad 加速 Wan 2.2 视频生成,注意力机制缩减 67 倍

作者 SQuad 团队提出了一种用于视频扩散 Transformer 的次二次注意力蒸馏方法。他们没有从头训练模型,而是分两个阶段蒸馏现成的完整尺寸模型 Wan 2.2 5B:Flow-Matching 监督微调和分布匹配蒸馏。结果是,在 VBench 上质量与教师模型一致,同时每步每块注意力 FLOPs 减少约 67 倍,DiT 端到端延迟减半。详情见 arXiv。作者未公开代码。

这意味着什么

这条新闻涉及 text-to-video 方向的整体进展——请参阅视频生成器板块。在我们指南的工具中,直接涉及的对象是 Wan(通义万相),但需要说明:SQuad 团队是在 Wan 2.2 5B 上做实验的,而我们的参数表中记录的是 Wan 2.1 T2V-14B 模型。 Wan 目前的状况:开源代码和权重,采用 Apache-2.0 许可证,通过 diffusers 运行,最大的权重文件为 10.6 GB,所有文件合计 64.3 GB。据开发者描述,T2V-1.3B 模型需要 8.19 GB 显存,在 RTX 4090 上生成 5 秒 480P 视频大约需要 4 分钟,且未使用量化等优化手段。 参数表中没有的内容:SQuad 结果所基于的 Wan 2.2 5B 的数据,以及蒸馏方法何时、以何种形式可能进入 Wan 的公开版本。SQuad 开发者未说明是否会发布蒸馏模型的代码或权重。 目前 SQuad 仍是一项研究性成果:代码不可用,而根据论文描述复现该方法本身就是一项独立的工程任务。对于我们指南中与 Wan 搭配的实际使用,没有任何变化。
SQuad:sub-quadratic attention 蒸馏 每步每块 attention FLOPs 减少 67 倍 教师 Wan 2.2 5B 全尺寸模型 Video Diffusion Transformer 预训练完成 阶段 1 Flow-Matching Supervised Fine-Tuning 教师蒸馏 注意力模仿 阶段 2 Distribution Matching Distillation 分布 匹配 SQuad — 蒸馏模型 sub-quadratic attention VBench 质量一致 attention FLOPs:减少 67 倍 DiT 延迟:降低一半 蒸馏无需从头训练 状态 代码未发布 权重不可用 复现 — 工程难题
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读