CPU3DИИ-инструменты для 3D, видео и звука

SparsePR ускоряет видеогенераторы через разреженное внимание без обучения

Исследователи представили SparsePR — метод training-free block-sparse attention для видеогенераторов и world models. Работа опубликована на arXiv 19 августа 2026 года, страница проекта содержит дополнительные материалы. Авторы показывают, что геометрия разбиения влияет и на объединённый support, и на предсказуемость остаточной ошибки после softmax. SparsePR сочетает Response-Coupled Partitioning с Probe-Fitted Residual Reconstruction: ответы ключей на sampled-запросы формируют парные K/V-группы, а небольшой набор точных строк запросов калибрует аффинную коррекцию. На четырёх видеогенераторах и world models метод снижает ошибку реконструкции внимания, сохраняя качество генерации при 22—26% executed-pair density и ускоряя инференс в 1,48—2,61 раза. Код авторы не выкладывали.

Что это значит

SparsePR — это метод ускорения, а не самостоятельный генератор. Он применим к видеотрансформерам, поэтому в нашем справочнике его стоит рассматривать в связке с инструментами из раздела генераторов видео. Среди наших карточек прямой мишенью метода могут быть модели на базе diffusion transformers. LTX-Video использует DiT-архитектуру и открытый код — технически SparsePR мог бы быть интегрирован в такой пайплайн, но авторы метода не публиковали реализацию, и в репозитории LTX-Video ничего об этом нет. CogVideoX также построен на трансформерной архитектуре, однако в его репозитории разреженное внимание не упоминается. Pyramid Flow использует пирамидальный flow matching — это другой подход к эффективности, и в паспорте инструмента нет данных о совместимости с block-sparse attention. Практического применения SparsePR пока нет: код не опубликован, интеграций с перечисленными инструментами не заявлено. Оценка применимости остаётся на уровне архитектурной совместимости, которую разработчики конкретных моделей не подтверждали.
SparsePR: разреженное внимание без обучения Видеотрансформер DiT / world model Response-Coupled Partitioning парные K/V-группы Probe-Fitted Residual аффинная коррекция 22—26% executed-pair density 1,48—2,61x ускорение инференса Применимость к видеогенераторам LTX-Video DiT, открытый код CogVideoX трансформер Pyramid Flow flow matching Код не опубликован · интеграций не заявлено · совместимость на уровне архитектуры
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также