Stable Video Diffusion:视频生成器 — 功能与运行要求

Stable Video Diffusion 是 Stability AI 推出的开源生成模型,用于将静态图像转换为短视频(image-to-video)。该工具面向愿意直接使用代码并在自己的硬件上运行生成的研究人员和开发者。
功能
- 接收一张输入图像,并基于它生成视频。
- 以模型 stable-video-diffusion-img2vid-xt 的形式实现,可在 Hugging Face 上获取。
- 代码以 MIT 许可证分发,允许自由使用和修改。
- 与 diffusers 库集成。
- 作者将仓库定位为一组生成模型,而非带图形界面的成品应用。
运行要求
- 平台:本地运行。参数表中未注明云版本。
- 内存与磁盘:最大的权重文件占用 8.9 GB,完整文件集为 30.4 GB。将模型加载到显卡内存需要相应的显存容量。
- 运行环境:Python。据作者描述,代码已在 3.10 版本上测试。描述原文为:「NOTE: This is tested under python3.10. For other python versions, you might encounter version conflicts.」
- 许可证:代码 — MIT,模型权重 — Stability AI Community License(年收入低于 100 万美元可免费商用;商用需在 Stability AI 网站注册;禁止基于该模型或其输出创建或改进其他生成模型)。
- 代码:可在仓库 github.com/Stability-AI/generative-models 获取。最后修改时间为 2025 年 12 月 16 日。最新发布版本为 0.1.0。
适用人群
该工具面向具备技术基础的用户:熟悉 Python 和 diffusers 生态的研究人员、开发者和爱好者。它适合需要从图像生成视频、并能够进行精细调整和代码改进的人。
不适合寻找带界面的成品应用、无需本地安装的云服务,或希望在无大容量显存独立显卡的低配置机器上运行的用户。此外还需注意,Python 版本被严格限定为 3.10 — 在其他版本上可能出现依赖冲突。
Stable Video Diffusion 是一种以代码和模型权重形式提供的底层工具。使用它需要自行搭建运行环境、下载数十 GB 的数据,并弄清运行的各种细节。作者不对经测试环境之外的兼容性提供保证。
参数表
| 任务 | image-to-video 来源 |
|---|---|
| 代码许可证 | MIT 来源 |
| 权重许可证 | Stability AI Community License:年收入不超过 $1 million 可免费商用 来源 |
| 最大权重文件 | 8.9 GB 来源 |
| 全部权重文件 | 30.4 GB 来源 |
| Python | 3.10 据作者描述 来源 |
| 库 | diffusers 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2025-12-16 来源 |
| 仓库创建时间 | 2023-06-22 来源 |
经常变化 — 数据截至 2026-09-14
| 最新版本 | 0.1.0 来源 |
|---|---|
| 发布日期 | 2023-07-27 来源 |
| GitHub 星标 | 27280 来源 |
| Fork 数 | 3107 来源 |
| 月下载量 | 212012 来源 |
| 模型更新 | 2024-07-10 来源 |
数值由程序自动从官方来源采集,并于 2026-09-14 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



