CPU3D3D、视频与音频的 AI 工具

LTX-Video 和 CogVideoX 通过合成视频获得新的 zero-shot 字幕生成方法

研究人员在 arXiv 上发表了论文 Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning,其中提出了用于零样本视频字幕生成的 WSV 方法。该方法在训练阶段使用预训练的 text-to-video 模型生成合成视频潜变量,然后训练一个“抛光器”来拉近真实视频与合成视频的分布。在推理阶段,输入视频通过 3D Causal VAE 编码,直接送入提示器,由提示器控制 GPT-2 生成字幕。作者报告在 MSVD、MSR-VTT 和 VATEX 数据集上取得了 52 B@4 和 95.7 CIDEr 的结果。作者未公开代码。

这意味着什么

这项工作涉及视频字幕生成任务——即用文本自动描述视频内容。这与视频生成是相邻领域,但并不相同:这里是从视频生成文本,而不是相反。 在我们的视频生成器板块中,没有直接对应此任务的工具。最接近的相关工具是 LTX-VideoCogVideoX(智谱 CogVideoX)——它们解决的是相反的任务:LTX-Video 作为 image-to-video 使用,CogVideoX 作为 text-to-video 使用。两者都采用扩散方法和 diffusers 库,但都不用于描述现成的视频。 同时,WSV 方法将 text-to-video 模型作为中间组件:它生成合成视频潜变量,用于训练字幕生成器。这意味着 text-to-video 生成的质量直接影响最终字幕的质量。然而,作者没有说明他们具体使用了哪个 text-to-video 模型,也没有公开代码,因此目前无法验证与指南中具体生成器的兼容性。 对于正在寻找视频描述工具的用户来说,这项工作目前仍停留在学术论文层面:没有代码和模型权重,无法复现该方法或将其用于自己的项目。
WSV:通过合成视频实现零样本视频字幕生成 方法示意图,依据论文《观看合成视频》 Text-to-Video 生成 视频潜变量 预训练模型 精修器 分布 对齐 真实与合成 3D Causal VAE 输入视频 编码 推理阶段 提示器 + GPT-2 GPT-2 控制 用于生成字幕 提示器控制文本生成 字幕 视频的 文本描述 52 B@4, 95.7 CIDEr LTX-Video(图生视频)和 CogVideoX(智谱 CogVideoX)(文生视频)——逆向任务,扩散方法 WSV 将文生视频用作中间组件,但代码和权重未公开
方法的工作原理。示意图根据这篇简讯绘制。

相关阅读