CPU3DИИ-инструменты для 3D, видео и звука

Audio-visual генерация получила метод ускорения с сохранением синхронизации звука и видео

Авторы работы Efficient Audio-Visual Generation via Synchrony-Aware Cross-Modal Sparse Attention предлагают метод ускорения инференса для моделей, которые генерируют видео и звук одновременно. Они заметили, что двунаправленный cross-attention между аудио- и видеоветками концентрирует высокие отклики на небольшом числе регионов, связанных со звуком. На основе этого они вводят protected sparse attention: вычисления сохраняются для критичных к синхронизации токенов, а избыточные attention-взаимодействия разреживаются. Код авторы не выкладывали.

Что это значит

В нашем справочнике AI-видео нет инструментов, которые генерируют видео и звук в едином diffusion-процессе. LTX-Video, CogVideoX и Pyramid Flow — это генераторы только видео: в их паспортах задачи указаны как image-to-video или text-to-video, аудиоветки и синхронизации со звуком у них нет. Поэтому предложенный метод напрямую к ним не применяется. Работа касается отдельного класса audio-visual моделей, которых в справочнике пока нет. Если такие инструменты появятся, для них будет важен вопрос, насколько ускорение инференса сохраняет синхронизацию звука и видео — именно эту проблему решают авторы. Пока же заметка фиксирует направление исследований, а не изменение в доступных инструментах.
Synchrony-Aware Cross-Modal Sparse Attention ускорение инференса audio-visual генерации Двунаправленный cross-attention аудио — видео высокие отклики Анализ откликов концентрация на малом числе регионов Protected Sparse Attention сохраняем критичные к синхронизации токены разреживаем избыточные attention-взаимодействия Ускоренный инференс с сохранением синхронизации звука и видео Код не выложен · метод для audio-visual моделей · в справочнике AI-видео таких инструментов пока нет
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также