DSAQuant предложил квантование видеодиффузии с учётом стадий денойзинга
Авторы статьи на arXiv показали, что обычный quantization-aware training портит у видеомоделей именно детали и резкость, хотя общую композицию и движение сохраняет. Причина — в том, что квантование не различает стадии денойзинга: ранние шаги строят структуру, поздние отвечают за текстуры. DSAQuant выравнивает обучение по этим стадиям и отключает CFG на финальных шагах, чтобы ошибки квантования не превращались в высокочастотные артефакты. Метод проверен на семействах Wan и CogVideoX в режимах W4A4 и W3, код выложен в открытый доступ.
Что это значит
Работа касается двух генераторов из нашего справочника — Wan и CogVideoX. Оба открыты, оба решают задачу text-to-video, у обоих код под лицензией Apache-2.0 и оба работают через библиотеку diffusers.
Wan от Alibaba — это крупная модель: самый большой файл весов 10.6 ГБ, все файлы вместе 64.3 ГБ. При этом авторы заявляют поддержку потребительских GPU: младшая версия T2V-1.3B требует 8.19 ГБ видеопамяти и генерирует пятисекундный ролик 480P на RTX 4090 примерно за четыре минуты без квантования. CogVideoX от Zhipu AI заметно легче по весам — 9.2 ГБ самый большой файл, 20 ГБ всего, но по описанию авторов нацелен на устройства уровня NVIDIA H100 и выше, с CUDA 12.4.
Для владельцев потребительских карт DSAQuant — это ещё один способ уменьшить требования Wan и CogVideoX к памяти без смены железа. Насколько именно снижается потребление и как меняется скорость генерации после квантования, авторы в аннотации не уточняют.Как устроен метод. Схема нарисована по этой заметке.