Audio-visual генерация получила метод ускорения с сохранением синхронизации звука и видео
Авторы работы Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention предлагают метод ускорения инференса для моделей, которые генерируют видео и звук одновременно. Они заметили, что двунаправленный cross-attention между аудио- и видеоветками концентрирует высокие отклики на небольшом числе регионов, связанных со звуком. На основе этого они вводят protected sparse attention: вычисления сохраняются для критичных к синхронизации токенов, а избыточные attention-взаимодействия разреживаются. Код авторы не выкладывали.
Что это значит
В нашем справочнике AI-видео нет инструментов, которые генерируют видео и звук в едином diffusion-процессе. LTX-Video, CogVideoX и Pyramid Flow — это генераторы только видео: в их паспортах задачи указаны как image-to-video или text-to-video, аудиоветки и синхронизации со звуком у них нет. Поэтому предложенный метод напрямую к ним не применяется.
Работа касается отдельного класса audio-visual моделей, которых в справочнике пока нет. Если такие инструменты появятся, для них будет важен вопрос, насколько ускорение инференса сохраняет синхронизацию звука и видео — именно эту проблему решают авторы. Пока же заметка фиксирует направление исследований, а не изменение в доступных инструментах.Как устроен метод. Схема нарисована по этой заметке.