研究人员展示了 AnyTalk——一种面向任意角色的 3D 语音动画生成方法,它既不需要动画数据,也不需要手动绑定。相反,作者在目标角色的渲染图上对现成的 video diffusion model 进行微调,使用“零”音频嵌入,然后通过优化 blendshape 参数将生成的 talking-head 视频提升到 3D。代码承诺在项目页面上发布,但截至本简讯发布时,作者尚未公开代码。详情见 arXiv 上的文章。
这意味着什么
AnyTalk 并不直接与我们 AI-视频 板块中的视频生成器竞争:它解决的是 3D 语音动画任务,而非根据文本或图像生成视频。然而,该方法依赖 video diffusion model 作为 motion prior 的来源——即与 LTX-Video、CogVideoX(智谱 CogVideoX) 和 Pyramid Flow(快手 Pyramid Flow) 属于同一类模型。
这些工具的参数表中没有关于针对特定角色进行微调或将视频提升为 3D 动画的信息:它们的任务是 text-to-video 和 image-to-video。AnyTalk 表明,video diffusion model 可以适应于唇形同步这一狭窄任务,且所需数据极少,但要实际应用,还需要目前尚未公开的代码。
如果作者公开实现,我们就能了解该方法对我们指南中开源模型的适用程度,以及它对硬件的要求。方法的工作原理。示意图根据本简讯绘制。