CPU3D3D、视频与音频的 AI 工具

ViRDM 在 few-step 视频蒸馏中移除教师和评论器

ViRDM 的作者提出了一种无需判别器和评论器的视频生成器后训练方法,可降低显存占用。该工作于 2026 年 9 月 24 日发表在 arXiv 上。原本需要三个网络——教师、评论器和生成器——现在只剩下生成器,它被拟合到预先计算好的目标表示分布上。作者没有公开代码。

这意味着什么

这条简讯涉及 few-step causal video generation 方向,而在我们的视频生成器栏目中,目前还没有以单独工具形式收录该方向。主题上最接近的工具页面是 LTX-Video、CogVideoX(智谱 CogVideoX) 和 Maestro,它们描述的是普通 diffusion 模型,而不是通过 distribution matching 进行后训练的 few-step 自回归生成器。 LTX-Video 采用 Apache-2.0 开源,其模型权重对营收达到 1000 万美元以上的公司需要单独许可证,而据作者描述,该模型在 1 GB 显存下即可运行。CogVideoX 的代码采用 Apache-2.0,模型权重使用自有许可证,商用需注册;参数表中标注的平台为 CUDA。Maestro 是基于 WanGP 的本地工作室,代码为非商业许可证,使用 MiniMax H3 权重,需要至少 12 GB 显存。 ViRDM 是一项研究工作,没有公开代码,也没有标明许可证。在该方法变成可用工具之前,还无法就硬件要求或使用条件将其与指南中的工具页面进行比较。
ViRDM:无监督无评论家的少步视频蒸馏 普通蒸馏 教师 扩散模型 生成参考样本 评论家 评估质量 通过判别器 生成器 少步模型 根据信号训练 ViRDM:仅生成器 目标分布 预先计算的 表示 生成器 少步模型 拟合到 目标分布 教师和评论家 不需要 更少显存 一个网络代替三个 ViRDM 降低后训练时的显存占用
该方法的构成。示意图根据这条简讯绘制。

相关阅读