Pyramid Flow:视频生成器——功能与运行要求

Pyramid Flow(快手 Pyramid Flow)是一个开源的视频生成器,解决 text-to-video 任务。该模型采用金字塔式的流匹配(flow matching)方法,据开发者称,可以在显存较小的显卡上生成视频。
功能
- 根据文本描述生成视频(text-to-video)。
- 支持 Multi-GPU 模式——使用多张显卡加速。
- 支持 CPU offloading,将计算任务卸载到中央处理器,以适应可用显存。
作者将模型描述为“Pyramidal Flow Matching for Efficient Video Generative Modeling”,并指出该模型已在 ICLR 2025 上展示。
运行要求
- 平台:开发者提到 MPS 后端;代码用 Python 编写,推荐版本为 3.8.10。
- 内存:据作者描述,运行所需显存低于 8 GB。使用多 GPU 和 CPU offloading 时,该值还可以更低。
- 框架:模型已集成到 diffusers 库中,权重可在 Hugging Face 上获取。最大的权重文件占用 7.8 GB,所有文件总大小为 27.2 GB。
- 许可证:代码采用 MIT 许可证,模型权重则采用其他许可证(other)。
- 本地运行:可行,源代码已在仓库 github.com/jy0205/Pyramid-Flow 中开源。代码最后更新日期为 2024 年 12 月 21 日。
适合谁
该工具适合希望了解现代视频生成模型结构或将其适配到自身任务的研究人员和开发者——毕竟代码开源,且使用 Python 和 diffusers 编写。支持 8 GB 显存显卡运行以及 Multi-GPU,使得没有大显存服务器加速卡的用户也能使用该模型。
不适合那些寻找现成云解决方案(“上传文本——得到视频”)而不想深入环境配置和命令行操作的人。另外需要注意,模型权重采用与 MIT 不同的独立许可证——这在商业使用时可能很重要。
Pyramid Flow(快手 Pyramid Flow)是研究模型逐步降低视频生成门槛的一个例子。更多项目详情可访问网站 pyramid-flow.github.io,模型权重可从 huggingface.co/rain1011/pyramid-flow-sd3 下载。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-video 来源 |
|---|---|
| 代码许可证 | MIT 来源 |
| 权重许可证 | other 来源 |
| 平台 | MPS 据作者描述 来源 |
| 显存 | 8 GB 据作者描述 来源 |
| 最大权重文件 | 7.8 GB 来源 |
| 全部权重文件 | 27.2 GB 来源 |
| Python | 3.8 据作者描述 来源 |
| 库 | diffusers 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2024-12-21 来源 |
| 仓库创建时间 | 2024-10-06 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



