作者 SQuad 团队提出了一种用于视频扩散 Transformer 的次二次注意力蒸馏方法。他们没有从头训练模型,而是分两个阶段蒸馏现成的完整尺寸模型 Wan 2.2 5B:Flow-Matching 监督微调和分布匹配蒸馏。结果是,在 VBench 上质量与教师模型一致,同时每步每块注意力 FLOPs 减少约 67 倍,DiT 端到端延迟减半。详情见
arXiv。作者未公开代码。
这意味着什么
这条新闻涉及 text-to-video 方向的整体进展——请参阅
视频生成器板块。在我们指南的工具中,直接涉及的对象是
Wan(通义万相),但需要说明:SQuad 团队是在 Wan 2.2 5B 上做实验的,而我们的参数表中记录的是 Wan 2.1 T2V-14B 模型。
Wan 目前的状况:开源代码和权重,采用 Apache-2.0 许可证,通过 diffusers 运行,最大的权重文件为 10.6 GB,所有文件合计 64.3 GB。据开发者描述,T2V-1.3B 模型需要 8.19 GB 显存,在 RTX 4090 上生成 5 秒 480P 视频大约需要 4 分钟,且未使用量化等优化手段。
参数表中没有的内容:SQuad 结果所基于的 Wan 2.2 5B 的数据,以及蒸馏方法何时、以何种形式可能进入 Wan 的公开版本。SQuad 开发者未说明是否会发布蒸馏模型的代码或权重。
目前 SQuad 仍是一项研究性成果:代码不可用,而根据论文描述复现该方法本身就是一项独立的工程任务。对于我们指南中与 Wan 搭配的实际使用,没有任何变化。
方法的工作原理。示意图根据这篇简讯绘制。