CPU3DИИ-инструменты для 3D, видео и звука

VC-Attention ускоряет low-bit attention для видеогенераторов на GPU

Авторы работы VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention предлагают training-free метод low-bit attention для Diffusion Transformers. Он решает две проблемы: ошибки квантования из-за выбросов в value-токенах и медленный softmax между матричными умножениями. Реализация заявлена для B200, B300, H200, RTX PRO 6000 и RTX 5090, код авторы не выкладывали.

Что это значит

Работа напрямую касается генераторов видео из нашего раздела об ИИ-видео. Среди протестированных моделей — HunyuanVideo от Tencent. Это text-to-video генератор с открытым кодом, который по описанию авторов требует 45—60 ГБ видеопамяти и работает на CUDA. Лицензия кода и весов — Tencent Hunyuan Community License: коммерческое использование разрешено по всему миру, кроме Евросоюза, Великобритании и Южной Кореи; при аудитории свыше 100 млн пользователей в месяц нужна отдельная лицензия. VC-Attention — это не новая модель, а метод ускорения attention-слоя в уже существующих видеогенераторах. Он не меняет архитектуру и не требует дообучения: V-Smooth переупорядочивает value-токены и квантует остаток после вычитания среднего по блоку, а ExpCast-FP8 заменяет FP32-экспоненту в softmax одной fused-операцией. Для владельцев RTX 5090 и RTX PRO 6000 это потенциальный способ снизить требования к памяти и ускорить генерацию, но без опубликованного кода проверить метод на своём железе пока нельзя.
Видеогенератор Diffusion Transformer HunyuanVideo Выбросы в value ошибки квантования токены с аномалиями Медленный softmax между матричными умножениями V-Smooth переупорядочивает value-токены квантует остаток ExpCast-FP8 заменяет FP32 экспоненту fused-операцией Ускорение снижение памяти без дообучения training-free Целевое оборудование B200 · B300 · H200 · RTX PRO 6000 · RTX 5090 код не опубликован
Как устроен метод. Схема нарисована по этой заметке.

Смотрите также