Pyramid Flow(快手 Pyramid Flow):视频生成器 — 功能与运行要求

Pyramid Flow(快手 Pyramid Flow)是一款开源视频生成器,用于解决 text-to-video 任务。该模型采用金字塔式流匹配(flow matching)方法,据开发者称,它可以在显存较小的显卡上生成视频。
功能
- 根据文本描述生成视频(text-to-video)。
- 支持 Multi-GPU 模式——使用多块显卡加速。
- 将计算卸载到中央处理器(CPU offloading),以便在可用显存范围内运行。
作者将该模型描述为「Pyramidal Flow Matching for Efficient Video Generative Modeling」,并指出它曾在 ICLR 2025 上展示。
运行要求
- 平台:开发者提到后端 MPS;代码使用 Python 编写,推荐版本为 3.8.10。
- 内存:据作者描述,运行需要少于 8 GB 的 GPU 显存。使用多块 GPU 和 CPU offloading 时,该数值还可以更低。
- 框架:模型已集成到 diffusers 库,模型权重可在 Hugging Face 获取。最大的权重文件为 7.8 GB,所有文件总大小为 27.2 GB。
- 许可证:代码以 MIT 许可证分发,模型权重采用 Stability AI Community License。
- 本地运行:可行,源代码已在仓库 github.com/jy0205/Pyramid-Flow 开源。代码的最后一次修改日期为 2024 年 12 月 21 日。
适用人群
该工具适合希望了解现代视频生成模型原理,或将其改造用于自身任务的研究人员和开发者——毕竟代码开源,且使用 Python 和 diffusers 编写。能够在 8 GB 显存的显卡上运行以及支持 Multi-GPU,使该模型对没有大显存服务器加速卡的用户也可用。
不适合那些寻找现成云服务、希望「上传文本——得到视频」而不愿深入配置环境和操作命令行的用户。此外还需注意,模型权重有独立于 MIT 的单独许可证——这在商业使用时可能很重要。
Pyramid Flow 是研究型模型逐步降低视频生成门槛的例子之一。有关该项目的更多信息可访问网站 pyramid-flow.github.io,模型权重可从 huggingface.co/rain1011/pyramid-flow-sd3 下载。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-video 来源 |
|---|---|
| 代码许可证 | MIT 来源 |
| 权重许可证 | Stability AI Community License:营收不超过 $1 million 免费 来源 |
| 平台 | MPS 据作者描述 来源 |
| 显存 | 8 GB 据作者描述 来源 |
| 最大权重文件 | 7.8 GB 来源 |
| 全部权重文件 | 27.2 GB 来源 |
| Python | 3.8 据作者描述 来源 |
| 库 | diffusers 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2024-12-21 来源 |
| 仓库创建时间 | 2024-10-06 来源 |
数值由程序自动从官方来源采集,并于 2026-09-14 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



