Stable Video Diffusion:视频生成器 — 功能与运行要求

Stable Video Diffusion 是 Stability AI 推出的开源生成模型,用于将静态图像转换为短视频(image-to-video)。该工具面向愿意直接处理代码并在自有硬件上运行生成任务的研究人员和开发者。
功能
- 输入一张图像,基于该图像生成视频序列。
- 以模型 stable-video-diffusion-img2vid-xt 的形式实现,可在 Hugging Face 上获取。
- 代码以 MIT 许可证分发,允许自由使用和修改。
- 可与 diffusers 库集成。
- 作者将该仓库定位为一组生成模型,而非带有图形界面的完整应用。
运行要求
- 平台:本地运行。参数表中未提及云服务版本。
- 内存与磁盘:最大的模型权重文件占用 8.9 GB,完整文件集为 30.4 GB。将模型加载到显卡内存中需要相应的 VRAM 容量。
- 运行环境:Python。据作者描述,代码已在 3.10 版本上测试。原描述原文:「NOTE: This is tested under python3.10. For other python versions, you might encounter version conflicts.」
- 许可证:代码为 MIT,模型权重为 other(权重使用条款单独确定,作者未在参数表中说明细节)。
- 代码:可在仓库 github.com/Stability-AI/generative-models 中获取。最后修改时间为 2025 年 12 月 16 日。最新版本为 0.1.0。
适用人群
该工具面向具备技术能力的用户:熟悉 Python 和 diffusers 生态的研究人员、开发者及爱好者。适合需要从图像生成视频,并希望进行微调和代码二次开发的人群。
不适合寻找现成带界面应用、无需本地安装的云服务,或希望在无大显存独立显卡的低配机器上运行的用户。此外需注意,Python 版本严格限定为 3.10——在其他版本上可能出现依赖冲突。
Stable Video Diffusion 是以代码和模型权重形式提供的底层工具。使用时需要自行搭建运行环境、下载数十 GB 的数据,并处理运行中的各种细节。作者不对测试环境之外的兼容性提供任何保证。
参数表
| 任务 | image-to-video 来源 |
|---|---|
| 代码许可证 | MIT 来源 |
| 权重许可证 | other 来源 |
| 最大权重文件 | 8.9 GB 来源 |
| 全部权重文件 | 30.4 GB 来源 |
| Python | 3.10 据作者描述 来源 |
| 库 | diffusers 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2025-12-16 来源 |
| 仓库创建时间 | 2023-06-22 来源 |
经常变化 — 数据截至 2026-08-19
| 最新版本 | 0.1.0 来源 |
|---|---|
| 发布日期 | 2023-07-27 来源 |
| GitHub 星标 | 27239 来源 |
| Fork 数 | 3102 来源 |
| 月下载量 | 192543 来源 |
| 模型更新 | 2024-07-10 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



