CPU3D3D、视频与音频的 AI 工具

Stable Video Diffusion:视频生成器 — 功能与运行要求

Stable Video Diffusion 是 Stability AI 推出的开源生成模型,用于将静态图像转换为短视频(image-to-video)。该工具面向愿意直接使用代码并在自己的硬件上运行生成的研究人员和开发者。

功能

  • 接收一张输入图像,并基于它生成视频。
  • 以模型 stable-video-diffusion-img2vid-xt 的形式实现,可在 Hugging Face 上获取。
  • 代码以 MIT 许可证分发,允许自由使用和修改。
  • 与 diffusers 库集成。
  • 作者将仓库定位为一组生成模型,而非带图形界面的成品应用。

运行要求

  • 平台:本地运行。参数表中未注明云版本。
  • 内存与磁盘:最大的权重文件占用 8.9 GB,完整文件集为 30.4 GB。将模型加载到显卡内存需要相应的显存容量。
  • 运行环境:Python。据作者描述,代码已在 3.10 版本上测试。描述原文为:「NOTE: This is tested under python3.10. For other python versions, you might encounter version conflicts.」
  • 许可证:代码 — MIT,模型权重 — Stability AI Community License(年收入低于 100 万美元可免费商用;商用需在 Stability AI 网站注册;禁止基于该模型或其输出创建或改进其他生成模型)。
  • 代码:可在仓库 github.com/Stability-AI/generative-models 获取。最后修改时间为 2025 年 12 月 16 日。最新发布版本为 0.1.0。

适用人群

该工具面向具备技术基础的用户:熟悉 Python 和 diffusers 生态的研究人员、开发者和爱好者。它适合需要从图像生成视频、并能够进行精细调整和代码改进的人。

不适合寻找带界面的成品应用、无需本地安装的云服务,或希望在无大容量显存独立显卡的低配置机器上运行的用户。此外还需注意,Python 版本被严格限定为 3.10 — 在其他版本上可能出现依赖冲突。

Stable Video Diffusion 是一种以代码和模型权重形式提供的底层工具。使用它需要自行搭建运行环境、下载数十 GB 的数据,并弄清运行的各种细节。作者不对经测试环境之外的兼容性提供保证。

输入图像 位图帧 用于动画 PNG / JPEG / WEBP 预处理 归一化 和缩放 diffusers Stable Video Diffusion Image-to-Video 帧生成 权重:8.9 GB 许可证:MIT 后处理 帧组装 成视频序列 MP4 / GIF 备选模式 帧单独输出 序列 PNG / JPEG Stable Video Diffusion 流水线 Stability AI · Image-to-Video · 开源 Stability AI · Python 3.10 · diffusers · Hugging Face
Stable Video Diffusion 的处理流程。示意图依据工具参数表绘制。

参数表

任务image-to-video 来源
代码许可证MIT 来源
权重许可证Stability AI Community License:年收入不超过 $1 million 可免费商用 来源
最大权重文件8.9 GB 来源
全部权重文件30.4 GB 来源
Python3.10 据作者描述 来源
库diffusers 来源
语言Python 来源
代码最近更新2025-12-16 来源
仓库创建时间2023-06-22 来源
经常变化 — 数据截至 2026-09-14
最新版本0.1.0 来源
发布日期2023-07-27 来源
GitHub 星标27280 来源
Fork 数3107 来源
月下载量212012 来源
模型更新2024-07-10 来源

数值由程序自动从官方来源采集,并于 2026-09-14 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读