CPU3D3D、视频与音频的 AI 工具

流式说话头像:作者分离音频与渲染以加速生成

arXiv 上发布了一篇论文 Decoupled Self-Forcing Distillation for Streaming Talking Head Generation。作者提出,对于流式说话头生成,不要将音频直接与视频的每个像素绑定,而是在与身份和背景分离的低维运动空间中进行条件融合。运动由一个小型 causal autoregressive transformer 生成,再由 pretrained diffusion renderer 将其转化为视频。作者未公开代码。详情见论文页面

这意味着什么

这项工作涉及一个狭窄的任务——streaming talking head,即随着音频输入逐帧生成说话头。在我们的视频生成器栏目中,没有专门针对这一任务的工具。 最接近主题的是字节跳动的 Lance:这是一个 any-to-any 模型,拥有 3B 活跃参数,既能理解视频也能生成视频。权重以 Apache-2.0 开源,最大的文件为 13,2 GB,所有文件共 28,6 GB。作者要求 GPU 至少具备 40 GB 显存和 CUDA 12.4+。但 Lance 是通用模型,而非专门的 streaming talking head,不能仅凭参数表直接比较不同方法。 Lightricks 的 LTX-Video 是一个 image-to-video 生成器,作者称其仅需 1 GB 显存,并在 macOS 上支持 MPS。它同样不解决流式说话头任务,但表明开源视频生成器中有向低硬件要求方向发展的趋势——新工作也追求这一点,只是走了另一条路。 智谱 AI 的 CogVideoX(智谱 CogVideoX) 是一个 text-to-video 模型,权重占用 20 GB,最大的文件为 9,2 GB。作者推荐使用 NVIDIA H100 和 CUDA 12.4 运行。这是另一个极端的例子:重型模型,靠规模而非架构上的条件分离来达到质量。 新工作描述了一种通过将条件融合转移到运动空间,在不损失质量的前提下降低模型要求的方法。由于没有代码,目前还无法在自己的硬件上验证其声明。
流式说话头像:音频与渲染分离 音频 逐帧输入 Causal transformer 生成运动 运动空间 低维,无背景 Diffusion renderer 转为视频 说话头像 流式视频 身份与背景 与运动分离 与开源视频生成器对比 Lance (Bytedance) any-to-any,40 GB 显存 LTX-Video image-to-video,1 GB 显存 CogVideoX text-to-video, H100 新工作 条件分离
方法的结构。示意图根据本简讯绘制。

相关阅读