CPU3D3D、视频与音频的 AI 工具

SPADE 无需微调即可加速视频扩散 Transformer 中的注意力机制

研究人员推出了 SPADE——一种稀疏注意力引擎,可在不进行模型微调的情况下加速视频扩散变换器的推理。该研究于2026年8月4日发表在 arXiv 上。作者提出了三个组件:用于三维令牌分块和动态掩码的 vDiT-SSR 规范、采用逐帧策略的运行时方案,以及带有块稀疏 flash attention 的执行器。在 Hunyuan-Video 和 Wan 2.1/2.2 模型上,注意力加速达到 2.26 倍至 3.40 倍,端到端推理加速达到 1.49 倍至 1.80 倍。代码已在 GitHub 上开源。

这意味着什么

这条消息直接关系到 Wan(通义万相) 生成器:作者在 Wan 2.1 和 2.2 上测试了 SPADE,用于 text-to-video 和 image-to-video 任务。在 Wan 的参数表中,T2V-1.3B 模型在 RTX 4090 上生成 5 秒 480p 视频大约需要 4 分钟,且没有使用量化等优化手段。SPADE 正是这样一种优化,只不过是在注意力机制层面,而且不需要改变模型权重。 Wan 的开发者阿里巴巴与这项研究无关——SPADE 由独立团队创建。端到端推理加速 1.49 倍至 1.80 倍意味着,在相同的硬件要求下,同样的视频可以生成得更快。至于在 RTX 4090 等消费级 GPU 上具体能快多少,作者没有说明——这些数据是在他们的测试环境中获得的。 SPADE 是一种方法,而不是独立产品。要使用它,需要将代码仓库中的代码集成到 Wan 的推理流程中。开发者没有提供现成的构建版本或图形界面。在我们的视频生成器板块中,Wan 的特性保持不变,但现在有技术基础的用户有了一种无需更换模型即可缩短生成时间的方法。
SPADE:视频扩散Transformer中的注意力加速 无需模型微调,仅优化推理 原始模型 视频扩散 Transformer(vDiT) vDiT-SSR 3D令牌屏蔽 与动态掩码 逐帧策略 执行时间 调度方案 Flash Attention 块稀疏 执行器 加速 注意力:2.26x—3.40x 推理:1.49x—1.80x 测试 Hunyuan-Video Wan 2.1 / 2.2 T2V和I2V任务 RTX 4090,约4分钟—更快 代码开源在GitHub—可集成至Wan(通义万相)流程
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读