SQuad ускоряет генерацию видео в Wan 2.2, сокращая внимание в 67 раз
Авторы SQuad представили метод дистилляции sub-quadratic attention для Video Diffusion Transformers. Вместо обучения модели с нуля они дистиллируют готовую полноразмерную модель Wan 2.2 5B в два этапа: Flow-Matching Supervised Fine-Tuning и Distribution Matching Distillation. Результат — совпадение качества с учителем на VBench при сокращении per-step per-block attention FLOPs примерно в 67 раз и end-to-end задержки DiT вдвое. Подробности в arXiv. Код авторы не выкладывали.
Что это значит
Новость касается направления text-to-video в целом — смотрите раздел генераторов видео. Из инструментов нашего справочника прямой объект работы — Wan, но с оговоркой: авторы SQuad экспериментировали на Wan 2.2 5B, тогда как в нашем паспорте зафиксирована модель Wan 2.1 T2V-14B.
Что у Wan сейчас: открытый код и веса под Apache-2.0, работа через diffusers, самый большой файл весов 10.6 ГБ, все файлы — 64.3 ГБ. По описанию разработчика, модель T2V-1.3B требует 8.19 ГБ видеопамяти и генерирует 5-секундное видео 480P на RTX 4090 примерно за 4 минуты без оптимизаций вроде квантизации.
Чего в паспорте нет: данных о Wan 2.2 5B, на которой получены результаты SQuad, и сведений о том, когда и в каком виде метод дистилляции может попасть в публичные релизы Wan. Разработчик SQuad не уточняет, будет ли опубликован код или веса дистиллированной модели.
Пока SQuad остаётся исследовательским результатом: код недоступен, а воспроизвести метод по описанию в статье — отдельная инженерная задача. Для практического использования в связке с Wan из нашего справочника изменений нет.Как устроен метод. Схема нарисована по этой заметке.