Stable Video Diffusion: генератор видео — что умеет и что нужно для запуска

Stable Video Diffusion — это генеративная модель с открытым кодом от Stability AI, решающая задачу превращения статичного изображения в короткое видео (image-to-video). Инструмент ориентирован на исследователей и разработчиков, которые готовы работать с кодом напрямую и запускать генерацию на собственном оборудовании.
Что умеет
- Принимает на вход одно изображение и генерирует на его основе видеоряд.
- Реализован в виде модели stable-video-diffusion-img2vid-xt, доступной на Hugging Face.
- Код распространяется по лицензии MIT, что допускает свободное использование и модификацию.
- Интегрируется с библиотекой diffusers.
- Авторы позиционируют репозиторий как набор генеративных моделей, а не как законченное приложение с графическим интерфейсом.
Что нужно для запуска
- Платформа: локальный запуск. Облачной версии в паспорте не указано.
- Память и диск: самый большой файл весов занимает 8.9 ГБ, а полный набор файлов — 30.4 ГБ. Для загрузки модели в память видеокарты потребуется соответствующий объём VRAM.
- Среда исполнения: Python. По описанию автора, код протестирован на версии 3.10. Дословно из описания: «NOTE: This is tested under python3.10. For other python versions, you might encounter version conflicts.»
- Лицензия: код — MIT, веса модели — other (условия использования весов определяются отдельно, авторы не указывают деталей в паспорте).
- Код: доступен в репозитории github.com/Stability-AI/generative-models. Последнее изменение зафиксировано 16 декабря 2025 года. Последний выпуск — версия 0.1.0.
Кому подойдёт
Инструмент рассчитан на технически подготовленных пользователей: исследователей, разработчиков и энтузиастов, знакомых с Python и экосистемой diffusers. Он подойдёт тем, кому нужна генерация видео из изображений с возможностью тонкой настройки и доработки кода.
Не подойдёт тем, кто ищет готовое приложение с интерфейсом, облачный сервис без необходимости локальной установки или решение, работающее на маломощных машинах без дискретной видеокарты с большим объёмом памяти. Также стоит учесть, что версия Python жёстко привязана к 3.10 — на других версиях возможны конфликты зависимостей.
Stable Video Diffusion представляет собой низкоуровневый инструмент в виде кода и весов модели. Для работы с ним потребуется самостоятельно организовать среду исполнения, загрузить десятки гигабайт данных и разобраться с особенностями запуска. Авторы не предоставляют гарантий совместимости за пределами протестированного окружения.
Паспорт
Репозиторий · Модель на HuggingFace
| Задача | image-to-video источник |
|---|---|
| Лицензия кода | MIT источник |
| Лицензия весов | other источник |
| Самый большой файл весов | 8.9 ГБ источник |
| Все файлы весов | 30.4 ГБ источник |
| Python | 3.10 по описанию автора источник |
| Библиотека | diffusers источник |
| Язык | Python источник |
| Последнее изменение кода | 2025-12-16 источник |
| Репозиторий создан | 2023-06-22 источник |
| Последний выпуск | 0.1.0 источник |
|---|---|
| Дата выпуска | 2023-07-27 источник |
| Звёзд на GitHub | 27239 источник |
| Форков | 3102 источник |
| Загрузок за месяц | 192543 источник |
| Обновление модели | 2024-07-10 источник |
Значения собраны автоматически из официальных источников и проверены 03.08.2026. Цен и лимитов тарифов в паспорте нет: они меняются чаще, чем обновляется страница — смотрите официальный сайт.



