HunyuanVideo получил метод ускорения генерации с почти lossless-качеством при 5—7-кратном
Исследователи представили LinCa — метод ускорения диффузионных моделей через обучаемое кэширование признаков с разложением на компоненты. Вместо единой стратегии предсказания для всех признаков LinCa раскладывает кэшируемые признаки на подкомпоненты с разной непрерывностью через лёгкую обратимую сеть и применяет к каждой свой порядок предсказания. Строгая обратимость гарантирует восстановление без потерь в исходное пространство признаков. Метод проверен на FLUX, Qwen-Image и HunyuanVideo: при менее чем 0,2% дополнительных параметров достигается 5—7-кратное ускорение с почти lossless-качеством. Подробности в статье на arXiv.
Что это значит
Для HunyuanVideo это прямое попадание: модель названа в числе трёх, на которых тестировали LinCa. HunyuanVideo — открытый text-to-video генератор от Tencent, который по описанию авторов требует 45—60 ГБ видеопамяти и работает только на CUDA. Ускорение в 5—7 раз при почти lossless-качестве — существенный аргумент для тех, кто уже работает с этой моделью или рассматривает её, но упирается во время генерации.
Важно: в паспорте HunyuanVideo нет данных о том, интегрирован ли LinCa в основной репозиторий модели или существует только как отдельный метод. Разработчик не уточняет, какие именно сценарии генерации выигрывают больше всего. Код LinCa выложен в открытый доступ, поэтому проверить метод на своих задачах можно самостоятельно.
Для остальных инструментов из раздела AI-видео метод пока не подтверждён: в статье тестировались только FLUX, Qwen-Image и HunyuanVideo. Если вы работаете с другой моделью, стоит дождаться независимых проверок или адаптаций под ваш инструмент.Как устроен метод. Схема нарисована по этой заметке.