CPU3D3D、视频与音频的 AI 工具

Stable Video Diffusion:视频生成器 — 功能与运行要求

Stable Video Diffusion 是 Stability AI 推出的开源生成模型,用于将静态图像转换为短视频(image-to-video)。该工具面向愿意直接处理代码并在自有硬件上运行生成任务的研究人员和开发者。

功能

  • 输入一张图像,基于该图像生成视频序列。
  • 以模型 stable-video-diffusion-img2vid-xt 的形式实现,可在 Hugging Face 上获取。
  • 代码以 MIT 许可证分发,允许自由使用和修改。
  • 可与 diffusers 库集成。
  • 作者将该仓库定位为一组生成模型,而非带有图形界面的完整应用。

运行要求

  • 平台:本地运行。参数表中未提及云服务版本。
  • 内存与磁盘:最大的模型权重文件占用 8.9 GB,完整文件集为 30.4 GB。将模型加载到显卡内存中需要相应的 VRAM 容量。
  • 运行环境:Python。据作者描述,代码已在 3.10 版本上测试。原描述原文:「NOTE: This is tested under python3.10. For other python versions, you might encounter version conflicts.」
  • 许可证:代码为 MIT,模型权重为 other(权重使用条款单独确定,作者未在参数表中说明细节)。
  • 代码:可在仓库 github.com/Stability-AI/generative-models 中获取。最后修改时间为 2025 年 12 月 16 日。最新版本为 0.1.0。

适用人群

该工具面向具备技术能力的用户:熟悉 Python 和 diffusers 生态的研究人员、开发者及爱好者。适合需要从图像生成视频,并希望进行微调和代码二次开发的人群。

不适合寻找现成带界面应用、无需本地安装的云服务,或希望在无大显存独立显卡的低配机器上运行的用户。此外需注意,Python 版本严格限定为 3.10——在其他版本上可能出现依赖冲突。

Stable Video Diffusion 是以代码和模型权重形式提供的底层工具。使用时需要自行搭建运行环境、下载数十 GB 的数据,并处理运行中的各种细节。作者不对测试环境之外的兼容性提供任何保证。

输入图像 位图帧 用于动画 PNG / JPEG / WEBP 预处理 归一化 和缩放 diffusers Stable Video Diffusion Image-to-Video 帧生成 权重:8.9 GB 许可证:MIT 后处理 帧组装 成视频序列 MP4 / GIF 备选模式 帧单独输出 序列 PNG / JPEG Stable Video Diffusion 流水线 Stability AI · Image-to-Video · 开源 Stability AI · Python 3.10 · diffusers · Hugging Face
Stable Video Diffusion 的处理流程。示意图依据工具参数表绘制。

参数表

任务image-to-video 来源
代码许可证MIT 来源
权重许可证other 来源
最大权重文件8.9 GB 来源
全部权重文件30.4 GB 来源
Python3.10 据作者描述 来源
diffusers 来源
语言Python 来源
代码最近更新2025-12-16 来源
仓库创建时间2023-06-22 来源
经常变化 — 数据截至 2026-08-19
最新版本0.1.0 来源
发布日期2023-07-27 来源
GitHub 星标27239 来源
Fork 数3102 来源
月下载量192543 来源
模型更新2024-07-10 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读