CPU3D3D、视频与音频的 AI 工具

HunyuanVideo(混元视频)获得近无损质量的 5—7 倍加速生成方法

研究人员提出了 LinCa — 一种通过可学习特征缓存与组件分解来加速扩散模型的方法。LinCa 不再对所有特征采用统一的预测策略,而是通过一个轻量级可逆网络将缓存特征分解为连续性不同的子组件,并对每个子组件应用各自的预测阶数。严格的可逆性保证了无损恢复到原始特征空间。该方法已在 FLUX、Qwen(通义千问)-Image 和 HunyuanVideo(混元视频)上验证:在额外参数不到 0.2% 的情况下,实现了 5—7 倍加速,且质量几乎无损。详情见 arXiv 上的论文

这意味着什么

对于 HunyuanVideo 来说,这是直接利好:该模型被列为测试 LinCa 的三款模型之一。HunyuanVideo 是腾讯开源的 text-to-video 生成器,据作者描述需要 45—60 GB 显存,且仅支持 CUDA。在几乎无损画质下实现 5—7 倍加速,对于已经在使用或考虑使用该模型、但受限于生成时间的用户来说,是一个重要的加分项。 需要注意的是:HunyuanVideo 的参数表中没有说明 LinCa 是否已集成到模型的主仓库中,还是仅作为独立方法存在。开发者也没有说明哪些生成场景受益最大。LinCa 的代码已开源,因此可以自行在自己的任务上验证该方法。 对于 AI 视频 板块中的其他工具,该方法目前尚未得到验证:论文中只测试了 FLUX、Qwen(通义千问)-Image 和 HunyuanVideo。如果你使用的是其他模型,建议等待独立验证或针对你所用工具的适配版本。
LinCa — 扩散模型加速 模型特征 缓存数据 FLUX, Qwen-Image, HunyuanVideo 可逆网络 分解为 子组件 严格可逆性 各自顺序 每个 子组件 不同连续性 输出 lossless LinCa 结果 5—7x 生成加速 近乎无损 < 0,2% 额外 参数 3 个模型 FLUX, Qwen-Image, HunyuanVideo LinCa 代码开源 — 可在自己的任务上验证
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读