CPU3D3D、视频与音频的 AI 工具

音视频生成获得兼顾音画同步的加速方法

作者在论文 Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention 中提出了一种加速同时生成视频和音频的模型推理的方法。他们注意到,音频与视频分支之间的双向 cross-attention 会将高响应集中在少数与声音相关的区域。基于此,他们引入了 protected sparse attention:对同步关键的 token 保留计算,而对冗余的 attention 交互进行稀疏化。作者未公开代码。

这意味着什么

在我们的 AI 视频指南 中,没有工具能在统一的扩散过程中同时生成视频和音频。LTX-Video、CogVideoX(智谱 CogVideoX)和 Pyramid Flow(快手 Pyramid Flow)都只是视频生成器:它们的参数表中任务类型标注为 image-to-video 或 text-to-video,没有音频分支,也没有与声音的同步。因此,所提出的方法并不直接适用于它们。 这项工作针对的是另一类 audio-visual 模型,目前指南中尚未收录。如果未来出现这类工具,推理加速能在多大程度上保持音视频同步将成为一个重要问题——这正是作者试图解决的。目前,这则简讯记录的是研究方向,而非现有工具的变化。
Synchrony-Aware Cross-Modal Sparse Attention 加速音频-视频生成的推理 双向 cross-attention 音频 — 视频 高响应 响应分析 集中于 少数 区域 Protected Sparse Attention 保留对同步 关键的令牌 稀疏化冗余 注意力交互 加速 推理 同时保持 音频与视频 同步 代码未开源 · 适用于音频-视频模型的方法 · AI 视频指南中暂无此类工具
方法的工作原理。示意图根据这则简讯绘制。

相关阅读