研究人员在 arXiv 上发表了论文
Watching Synthetic Videos: Aligning Cross-modal Representations with Visual Synthesis for Zero-shot Video Captioning,其中提出了用于零样本视频字幕生成的 WSV 方法。该方法在训练阶段使用预训练的 text-to-video 模型生成合成视频潜变量,然后训练一个“抛光器”来拉近真实视频与合成视频的分布。在推理阶段,输入视频通过 3D Causal VAE 编码,直接送入提示器,由提示器控制 GPT-2 生成字幕。作者报告在 MSVD、MSR-VTT 和 VATEX 数据集上取得了 52 B@4 和 95.7 CIDEr 的结果。作者未公开代码。
这意味着什么
这项工作涉及视频字幕生成任务——即用文本自动描述视频内容。这与视频生成是相邻领域,但并不相同:这里是从视频生成文本,而不是相反。
在我们的
视频生成器板块中,没有直接对应此任务的工具。最接近的相关工具是
LTX-Video 和
CogVideoX(智谱 CogVideoX)——它们解决的是相反的任务:LTX-Video 作为 image-to-video 使用,CogVideoX 作为 text-to-video 使用。两者都采用扩散方法和 diffusers 库,但都不用于描述现成的视频。
同时,WSV 方法将 text-to-video 模型作为中间组件:它生成合成视频潜变量,用于训练字幕生成器。这意味着 text-to-video 生成的质量直接影响最终字幕的质量。然而,作者没有说明他们具体使用了哪个 text-to-video 模型,也没有公开代码,因此目前无法验证与指南中具体生成器的兼容性。
对于正在寻找视频描述工具的用户来说,这项工作目前仍停留在学术论文层面:没有代码和模型权重,无法复现该方法或将其用于自己的项目。
方法的工作原理。示意图根据这篇简讯绘制。