CPU3D3D、视频与音频的 AI 工具

LTX-Video 与 CogVideoX 目前尚无法解决单视频中多对象生成问题

arXiv 上发表了一项对比研究,探讨了三种无需微调即可生成包含多个对象的视频的方法:直接生成、并行生成和顺序生成。作者分析了每种方法在保持对象外观、动作一致性以及对象间交互方面的表现,并描述了典型的失败模式。作者未公开代码。更多详情见 arXiv 上的论文

这意味着什么

在我们的视频生成器指南中,有三个工具支持 image-to-video 或 text-to-video 任务,但没有任何一个声称支持在单个视频中生成多个对象。 LTX-Video 解决的是 image-to-video 任务,并且只处理单个参考图像。据作者描述,没有提到将场景拆分为独立对象或组合多个视频。研究中的直接生成方法与 LTX-Video 的做法最为接近:模型接收完整的图像和完整的提示词。 CogVideoX(智谱 CogVideoX) 被描述为 text-to-video,尽管仓库描述中也提到了 image-to-video。参数表中没有关于多个对象及其分别生成的信息。 Pyramid Flow(快手 Pyramid Flow) 同样是 text-to-video,其描述中也没有任何关于多主体生成或场景分解的内容。 该研究描述了一些目前尚未在我们指南中的工具中实现的范式。直接方法部分与 LTX-Video 的现有能力重叠,但并行和顺序生成是参数表中没有的独立技术。如果作者日后发布代码,就可以验证这些方法是否适用于我们目录中的开源模型。
多对象视频生成的三种方法 无需微调的对比研究 直接生成 完整图像 + 提示词 整个场景一次生成 LTX-Video image-to-video 包含对象的视频 失败:外观、运动 并行生成 对象单独生成 场景拆分 CogVideoX text-to-video 视频合成 失败:一致性 顺序生成 逐个对象 依次生成 Pyramid Flow text-to-video 包含对象的视频 失败:交互 没有任何工具宣称支持单个视频中的多个对象
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读