论文
VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention 的作者提出了一种用于 Diffusion Transformers 的免训练低比特注意力方法。它解决了两个问题:value 令牌中离群值导致的量化误差,以及矩阵乘法之间缓慢的 softmax。实现据称面向 B200、B300、H200、RTX PRO 6000 和 RTX 5090,作者未公开代码。
这意味着什么
这项工作直接关系到我们
AI 视频栏目中的视频生成器。在测试的模型中包括腾讯的
HunyuanVideo。这是一款开源的 text-to-video 生成器,据作者描述需要 45—60 GB 显存,并在 CUDA 上运行。代码和模型权重的许可证为 Tencent Hunyuan Community License:除欧盟、英国和韩国外,全球范围内允许商业使用;当月活跃用户超过 1 亿时需要单独授权。
VC-Attention 不是新模型,而是一种加速现有视频生成器中注意力层的方法。它不改变架构,也不需要微调:V-Smooth 重新排列 value 令牌,并对减去块均值后的残差进行量化,而 ExpCast-FP8 用一个融合操作替换 softmax 中的 FP32 指数运算。对于 RTX 5090 和 RTX PRO 6000 的用户来说,这是降低内存需求、加速生成的潜在途径,但在没有公开代码的情况下,目前还无法在自己的硬件上验证该方法。
该方法的构造。示意图根据这篇简讯绘制。