arXiv 上发布了一篇论文 Decoupled Self-Forcing Distillation for Streaming Talking Head Generation。作者提出,对于流式说话头生成,不要将音频直接与视频的每个像素绑定,而是在与身份和背景分离的低维运动空间中进行条件融合。运动由一个小型 causal autoregressive transformer 生成,再由 pretrained diffusion renderer 将其转化为视频。作者未公开代码。详情见
论文页面。
这意味着什么
这项工作涉及一个狭窄的任务——streaming talking head,即随着音频输入逐帧生成说话头。在我们的
视频生成器栏目中,没有专门针对这一任务的工具。
最接近主题的是字节跳动的
Lance:这是一个 any-to-any 模型,拥有 3B 活跃参数,既能理解视频也能生成视频。权重以 Apache-2.0 开源,最大的文件为 13,2 GB,所有文件共 28,6 GB。作者要求 GPU 至少具备 40 GB 显存和 CUDA 12.4+。但 Lance 是通用模型,而非专门的 streaming talking head,不能仅凭参数表直接比较不同方法。
Lightricks 的
LTX-Video 是一个 image-to-video 生成器,作者称其仅需 1 GB 显存,并在 macOS 上支持 MPS。它同样不解决流式说话头任务,但表明开源视频生成器中有向低硬件要求方向发展的趋势——新工作也追求这一点,只是走了另一条路。
智谱 AI 的
CogVideoX(智谱 CogVideoX) 是一个 text-to-video 模型,权重占用 20 GB,最大的文件为 9,2 GB。作者推荐使用 NVIDIA H100 和 CUDA 12.4 运行。这是另一个极端的例子:重型模型,靠规模而非架构上的条件分离来达到质量。
新工作描述了一种通过将条件融合转移到运动空间,在不损失质量的前提下降低模型要求的方法。由于没有代码,目前还无法在自己的硬件上验证其声明。
方法的结构。示意图根据本简讯绘制。