arXiv 发布了 Vorch-Streamer 的研究论文——这是一种后训练方法,能够根据文本实时生成带音频的视频。作者解决了两个问题:自回归生成长视频时的误差累积,以及当模型不知道当前该朗读哪段文本时,语音与唇部动作的同步问题。为此,causal 生成器先使用 Teacher Forcing 和 Diffusion Forcing 进行训练,然后应用带 DMD 蒸馏的 Self Forcing,而语音进度由外部语言模型通过频率为 25 Hz 的离散令牌来控制。最终系统在四步去噪的情况下,以 27.12 FPS 的速度从文本生成音频和视频,超过了 24 FPS 的播放阈值。
这意味着什么
这条新闻涉及带同步语音的虚拟形象生成——这与我们指南中
视频生成器板块的工具所解决的问题是相邻但不同的任务。
LTX-Video(
工具页面)——image-to-video 生成器,不支持音频,也不针对虚拟形象优化。参数表中没有关于流式生成或唇部同步的数据。
CogVideoX(智谱 CogVideoX)(
工具页面)——text-to-video 生成器,无音轨。参数表中未提及流式模式或语音同步。
Pyramid Flow(快手 Pyramid Flow)(
工具页面)——同样是无声的 text-to-video。参数表中未声明流式生成或虚拟形象相关功能。
Vorch-Streamer 解决的是实时生成说话虚拟形象这一细分任务,目前我们的指南中还没有将其作为独立工具收录。现有的视频生成器并未直接覆盖这一领域。
方法的工作原理。示意图根据这篇简讯绘制。