CPU3D3D、视频与音频的 AI 工具

AnyTalk 为任意角色生成 3D 语音动画,无需动画数据

研究人员展示了 AnyTalk——一种面向任意角色的 3D 语音动画生成方法,它既不需要动画数据,也不需要手动绑定。相反,作者在目标角色的渲染图上对现成的 video diffusion model 进行微调,使用“零”音频嵌入,然后通过优化 blendshape 参数将生成的 talking-head 视频提升到 3D。代码承诺在项目页面上发布,但截至本简讯发布时,作者尚未公开代码。详情见 arXiv 上的文章

这意味着什么

AnyTalk 并不直接与我们 AI-视频 板块中的视频生成器竞争:它解决的是 3D 语音动画任务,而非根据文本或图像生成视频。然而,该方法依赖 video diffusion model 作为 motion prior 的来源——即与 LTX-VideoCogVideoX(智谱 CogVideoX)Pyramid Flow(快手 Pyramid Flow) 属于同一类模型。 这些工具的参数表中没有关于针对特定角色进行微调或将视频提升为 3D 动画的信息:它们的任务是 text-to-video 和 image-to-video。AnyTalk 表明,video diffusion model 可以适应于唇形同步这一狭窄任务,且所需数据极少,但要实际应用,还需要目前尚未公开的代码。 如果作者公开实现,我们就能了解该方法对我们指南中开源模型的适用程度,以及它对硬件的要求。
AnyTalk:无需动画数据的3D语音动画 视频扩散作为任意角色的运动先验来源 输入 角色渲染 语音音频 无需绑定 微调 Video diffusion model 零音频嵌入 数据量极少 生成 说话头视频 唇形同步 Motion prior 3D Blend- shape 优化 结果 3D语音动画 任意角色 限制 代码未开源 硬件要求未知 与AI视频的关联 LTX-Video, CogVideoX, Pyramid Flow 同类模型——视频扩散 AnyTalk将视频扩散模型适配为唇形同步,所需数据极少 实际应用取决于代码是否公开
方法的工作原理。示意图根据本简讯绘制。

相关阅读