北京大学的研究人员提出了Token Radius Attention(TRA)——一种在不重新训练模型的情况下,减少Video Diffusion Transformers中计算量的方法。
该研究于2026年8月3日发表在arXiv上。作者注意到,不同的令牌需要不同量的注意力,并建议基于熵为每个令牌计算个性化的交互预算。该方法已在Wan2.1、Wan2.2和HunyuanVideo的七种配置上进行了测试,保留了9%至19%的注意力交互,并在质量相当的情况下实现了1.56至2.05倍的加速。
这意味着什么
该方法直接涉及
HunyuanVideo(混元视频)——三种测试模型之一。目前,HunyuanVideo在720x1280分辨率和129帧的情况下,至少需要60GB显存,仅支持CUDA,并使用完整的3D注意力。TRA有望在不改变权重的情况下降低计算负载,从而可能减少对内存和生成时间的要求。然而,在工具参数表中,没有关于使用TRA时显存消耗具体降低多少的数据——方法开发者并未针对特定配置明确这些数字。
该方法的代码已发布在开源仓库中,可以将其集成到现有的HunyuanVideo流程中。由于TRA不需要微调,显存低于60GB的GPU用户或许可以测试,他们的设备上是否能够进行生成。当有关于特定模型显存需求降低的确认数据时,
AI视频指南部分将进行更新。
方法的工作原理。示意图根据此简讯绘制。