arXiv 上发布了一篇综述
Video Generation Models: A Survey of Post-Training and Alignment。作者系统梳理了无需从头重训练的视频模型后训练方法:supervised fine-tuning、self-training 与蒸馏、基于偏好和奖励的方法,以及 inference-time 方法。数据集、基准测试和评估实践也单独进行了讨论。代码已开源。
这意味着什么
这篇综述涉及我们在
AI Video 栏目中汇总的整个视频生成主题。我们指南中的工具里,直接涉及三个开源生成器。
Maestro 是基于 WanGP 流水线的本地工作室,MiniMax H3 的模型权重占用 464.1 GB,最大的文件为 9.7 GB。作者指出需要 12—24 GB 显存以及 CUDA 平台。WanGP 的代码许可证仅允许该程序本身用于非商业用途,MiniMax H3 的权重允许年营收不超过 2000 万美元的商业使用,但在欧盟、英国、韩国和美国不适用。
LTX-Video 由 Lightricks 推出,据称仅需 1 GB 显存,支持 macOS 上的 MPS。权重占用 236.4 GB,最大的文件为 26.6 GB。权重许可证允许商业使用,但营收达到 1000 万美元以上的公司需要单独的付费许可证。
CogVideoX 由 Zhipu AI 推出,解决 text-to-video 任务,5b 模型权重占用 20 GB,最大的文件为 9.2 GB。商业使用需要注册,每月 100 万次访问以内免费。
该综述并不绑定具体实现,也没有说明上述方法中哪些已在这些工具中应用。对本地生成器用户的实际价值在于,它系统梳理了可能影响模型后续版本以及后处理流水线的方法。
方法是如何构成的。示意图根据这篇简讯绘制。