CPU3D3D、视频与音频的 AI 工具

Token Radius Attention 无需微调即可加速扩散 Transformer 中的视频生成

北京大学的研究人员提出了Token Radius Attention(TRA)——一种在不重新训练模型的情况下,减少Video Diffusion Transformers中计算量的方法。该研究于2026年8月3日发表在arXiv上。作者注意到,不同的令牌需要不同量的注意力,并建议基于熵为每个令牌计算个性化的交互预算。该方法已在Wan2.1、Wan2.2和HunyuanVideo的七种配置上进行了测试,保留了9%至19%的注意力交互,并在质量相当的情况下实现了1.56至2.05倍的加速。

这意味着什么

该方法直接涉及HunyuanVideo(混元视频)——三种测试模型之一。目前,HunyuanVideo在720x1280分辨率和129帧的情况下,至少需要60GB显存,仅支持CUDA,并使用完整的3D注意力。TRA有望在不改变权重的情况下降低计算负载,从而可能减少对内存和生成时间的要求。然而,在工具参数表中,没有关于使用TRA时显存消耗具体降低多少的数据——方法开发者并未针对特定配置明确这些数字。 该方法的代码已发布在开源仓库中,可以将其集成到现有的HunyuanVideo流程中。由于TRA不需要微调,显存低于60GB的GPU用户或许可以测试,他们的设备上是否能够进行生成。当有关于特定模型显存需求降低的确认数据时,AI视频指南部分将进行更新。
输入令牌 视频扩散 变换器 熵评估 预算计算 针对每个令牌 Token Radius Attention 个体半径 交互范围 无需微调 加速 1.56—2.05 倍 保持质量 已在以下验证 Wan2.1, Wan2.2, HunyuanVideo 缩减 保留 9—19% 交互 Token Radius Attention — 无需微调的视频扩散加速
方法的工作原理。示意图根据此简讯绘制。

相关阅读