SPADE ускоряет внимание в видео-диффузионных трансформерах без переобучения
Исследователи представили SPADE — движок разреженного внимания, который ускоряет инференс видео-диффузионных трансформеров без дообучения модели. Работа опубликована 4 августа 2026 года на arXiv. Авторы предлагают три компонента: спецификацию vDiT-SSR для трёхмерной блокировки токенов и динамических масок, схему времени исполнения с покадровой политикой и исполнитель с блочно-разреженным flash attention. На моделях Hunyuan-Video и Wan 2.1/2.2 ускорение внимания составило от 2,26x до 3,40x, а сквозного инференса — от 1,49x до 1,80x. Код открыт на GitHub.
Что это значит
Новость касается генератора Wan напрямую: авторы тестировали SPADE на Wan 2.1 и 2.2 в задачах text-to-video и image-to-video. В паспорте Wan указано, что модель T2V-1.3B генерирует 5-секундное видео 480p на RTX 4090 примерно за 4 минуты без оптимизаций вроде квантизации. SPADE — как раз такая оптимизация, только на уровне механизма внимания, и она не требует менять веса модели.
Разработчик Wan, Alibaba, не имеет отношения к этой работе — SPADE создан независимой группой. Ускорение в 1,49x—1,80x на сквозном инференсе означает, что то же видео может генерироваться быстрее при тех же аппаратных требованиях. Насколько именно быстрее на пользовательских GPU вроде RTX 4090, авторы не уточняют — цифры получены на их тестовом окружении.
SPADE — это метод, а не отдельный продукт. Чтобы им воспользоваться, нужно интегрировать код из репозитория в пайплайн инференса Wan. Готовой сборки или GUI разработчик не предоставляет. В нашем разделе генераторов видео Wan остаётся с теми же характеристиками, что и раньше, но теперь у пользователей с технической подготовкой появился способ сократить время генерации без смены модели.