Alibaba 发布了 Qwen-Video-Edit — 一种将基于指令的图像编辑模型 Qwen-Image-Edit 应用于视频、而无需从头训练视频生成基础模型的方法。Wan 2.1 视频编码器的潜在帧被拆分为一张大型虚拟图像的拼块,一对轻量级投影连接两个潜在空间。该系统在公开数据集 Ditto-1M 上进行微调,Wan 2.2 的若干去噪步骤作为可选的时间增强器。详情见
arXiv 上的文章。
这意味着什么
这条消息直接涉及我们指南中的
Wan(通义万相):Qwen-Video-Edit 使用的正是该模型的视频 VAE 来编码帧,而 Wan 2.2 被用作可选的时间增强阶段。Wan 本身在我们的指南中被描述为 text-to-video 任务的视频生成器,开源,权重采用 Apache-2.0 许可。其参数表中没有提到基于指令的编辑 — 这是新工作为现有架构新增的一项独立能力。
对于
AI 视频工具 板块,这是一个示例,说明图像编辑模型如何被复用于视频任务,而无需完全重新训练视频扩散基础。开发者强调,即使不进行微调,原生的图像编辑器也能编辑以联系表形式呈现的视频,而微调则弥补了剩余的质量差距。
目前这仍是一项研究工作:该方法在多大程度上适用于真实的视频编辑场景,将由独立测试来验证。
方法的工作原理。示意图根据这篇简讯绘制。