SparkDiffusion: генератор видео — что умеет и что нужно для запуска

SparkDiffusion — открытый генератор видео по текстовому описанию от Alibaba Research. Проект решает задачу text-to-video и, по описанию авторов, ускоряет генерацию видео на базе диффузионных трансформеров в 265 раз за счёт совместного применения разреженности, дистилляции и квантования.
Что умеет
Инструмент принимает текстовое описание и создаёт видео. Техническая основа — модель SparkWan2.1-T2V-1.3B-480P-0.90Sparsity, опубликованная на Hugging Face. Авторы описывают подход как ускорение генерации видео через комбинацию трёх техник: разреженность, дистилляция и квантование. В описании упоминается уровень разреженности 0.90 и формат квантования w8a8.
Код написан на Python. Среди меток репозитория — crossdistill, diffusion-models, distillation, high-sparsity, inference-acceleration, rola, triton и video-generation.
Что нужно для запуска
По описанию автора, для работы требуется Linux с графическим процессором, поддерживающим CUDA. Версия Python — 3.10 или новее. Полный объём файлов весов составляет 2.6 ГБ, самый большой файл весит столько же.
Код распространяется по лицензии Apache-2.0. Веса модели также опубликованы под лицензией Apache-2.0. Лицензия разрешает использование, изменение и распространение как исходного кода, так и обученной модели.
Кому подойдёт
Проект будет полезен тем, кто работает с генерацией видео из текста и ищет открытую реализацию с акцентом на ускорение вывода. Наличие весов в открытом доступе позволяет запускать модель без самостоятельного обучения. Лицензия Apache-2.0 на код и веса подходит для коммерческих и исследовательских задач, включая встраивание в собственные продукты.
Инструмент не рассчитан на пользователей без опыта работы с командной строкой и Python-окружением. Требование CUDA-совместимого GPU на Linux ограничивает применение на машинах без дискретной видеокарты или на других операционных системах. Авторы не указывают минимальный объём видеопамяти, поэтому оценить совместимость с конкретной видеокартой заранее сложно.
Репозиторий создан 18 сентября 2026 года, последнее изменение кода — 5 октября 2026 года. Проект молодой, и на момент описания активность сосредоточена в коротком временном окне.
SparkDiffusion — открытая реализация text-to-video с заявленным ускорением вывода и доступными весами. Для запуска потребуется Linux-машина с CUDA-совместимым GPU и Python 3.10 или новее. Проект ориентирован на разработчиков и исследователей, которым нужна открытая кодовая база и модель под лицензией Apache-2.0.
Паспорт
Репозиторий · Модель на HuggingFace
| Задача | text-to-video источник |
|---|---|
| Лицензия кода | Apache-2.0 источник |
| Лицензия весов | apache-2.0 источник |
| Платформа | CUDA по описанию автора источник |
| Самый большой файл весов | 2.6 ГБ источник |
| Все файлы весов | 2.6 ГБ источник |
| Python | 3.10 по описанию автора источник |
| Язык | Python источник |
| Последнее изменение кода | 2026-10-05 источник |
| Репозиторий создан | 2026-09-18 источник |
| Звёзд на GitHub | 520 источник |
|---|---|
| Форков | 66 источник |
| Загрузок за месяц | 0 источник |
| Обновление модели | 2026-09-24 источник |
Значения собраны автоматически из официальных источников и проверены 08.10.2026. У каждого есть ссылка на источник, а у собранных со страницы разработчика — ещё и дословная цитата: наведите на пометку. Тарифы и версии показаны на дату проверки и меняются чаще всего — перед покупкой сверьтесь с сайтом.



