CPU3D3D、视频与音频的 AI 工具

FreqForcing 将自回归视频生成延长至两分钟,无需微调

2026年7月29日,arXiv 上出现了一篇论文 FreqForcing: Autoregressive Long Video Generation via Spectral Self-Anchoring。作者研究了自回归视频扩散模型的一个问题:在逐帧生成时,误差会不断累积,过一段时间后视频就会“崩溃”——颜色漂移、运动停滞。他们表明,这个过程看起来像是能量向低频漂移,并提出了一种名为 Spectral Self-Anchoring 的方法。该方法利用参考注意力的低频分量来保证长片段中的稳定性,而利用局部注意力的高频分量来保持运动。该方法无需微调,就能让在五秒片段上训练的模型生成长达两分钟的视频。

这意味着什么

FreqForcing 是一种方法,而不是现成的产品。它扩展了自回归视频模型的能力,但并不会直接改变我们指南中任何视频生成器工具。不过,这篇论文涉及的是一个架构方向,我们的几个工具都属于这个方向。

LTX-Video 是一个基于 Diffusion Transformer 的自回归模型,能够生成比训练片段更长的视频。开发者没有说明具体使用哪种外推方法,但从架构上看,LTX-Video 是应用 FreqForcing 的直接候选。目前参数表中还没有关于最大生成时长以及当前版本是否处理误差累积的数据。

CogVideoX(智谱 CogVideoX)和 Pyramid Flow(快手 Pyramid Flow)是基于其他原理的模型:CogVideoX 使用 3D 变分自编码器和专家 Transformer,Pyramid Flow 使用金字塔流匹配。它们的架构并不是论文中所讨论的那种自回归架构,因此 FreqForcing 不能直接应用于它们。

FreqForcing: Spectral Self-Anchoring 无需微调的自动回归视频生成扩展 误差累积 颜色漂移,动作停滞 低频能量漂移 视频“崩坏” Spectral Self-Anchoring 低频——全局注意力 高频——局部注意力 免训练,无需微调 最长两分钟 无质量退化 模型基于短视频训练 适用于现有模型 LTX-Video Diffusion Transformer 自动回归架构 直接适用 CogVideoX 3D变分自编码器 专家变换器 无法直接适用 Pyramid Flow 金字塔流匹配 非自动回归 无法直接适用 该方法扩展自动回归模型——用户可获得无退化的长视频
方法的工作原理。示意图根据这篇简讯绘制。

这篇论文提出了一种无需训练的解决方案——这意味着该方法可以应用于现有的自回归模型,而无需重新训练。如果 LTX-Video 或其他类似工具的开发者集成了 Spectral Self-Anchoring,用户将能够获得显著更长的视频,且质量不会下降。

相关阅读