SparkDiffusion:视频生成器 — 功能与运行要求

SparkDiffusion — 阿里巴巴研究团队推出的开源文本生成视频生成器。该项目解决 text-to-video 任务,据作者描述,通过稀疏化、蒸馏和量化三种技术的结合,将基于扩散 Transformer 的视频生成速度提升 265 倍。
功能
该工具接收文本描述并生成视频。技术基础是发布在 Hugging Face 上的模型 SparkWan2.1-T2V-1.3B-480P-0.90Sparsity。作者将这一方法描述为通过三种技术的组合来加速视频生成:稀疏化、蒸馏和量化。描述中提到了 0.90 的稀疏度水平和 w8a8 量化格式。
代码使用 Python 编写。仓库标签包括 crossdistill、diffusion-models、distillation、high-sparsity、inference-acceleration、rola、triton 和 video-generation。
运行要求
据作者描述,运行需要 Linux 系统和支持 CUDA 的图形处理器。Python 版本为 3.10 或更高。权重文件总大小为 2.6 GB,最大的单个文件也是这个大小。
代码以 Apache-2.0 许可证分发。模型权重同样以 Apache-2.0 许可证发布。该许可证允许对源代码和训练好的模型进行使用、修改和分发。
适用人群
该项目适合从事文本生成视频工作、并寻找以加速推理为重点的开源实现的人。权重公开可用,因此无需自行训练即可运行模型。代码和权重均采用 Apache-2.0 许可证,适用于商业和研究任务,包括嵌入到自己的产品中。
该工具不适合没有命令行和 Python 环境使用经验的用户。要求 Linux 上具备 CUDA 兼容的 GPU,这限制了它在没有独立显卡的机器或其他操作系统上的使用。作者未说明最低显存要求,因此很难事先评估与具体显卡的兼容性。
仓库创建于 2026 年 9 月 18 日,最后一次代码修改是在 2026 年 10 月 5 日。项目很年轻,在撰写本说明时,活跃度集中在很短的时间窗口内。
SparkDiffusion 是一个开源的 text-to-video 实现,具有宣称的推理加速和公开可用的权重。运行需要一台配备 CUDA 兼容 GPU 的 Linux 机器以及 Python 3.10 或更高版本。该项目面向需要开源代码库和 Apache-2.0 许可证模型的开发者和研究人员。
参数表
| 任务 | text-to-video 来源 |
|---|---|
| 代码许可证 | Apache-2.0 来源 |
| 权重许可证 | apache-2.0 来源 |
| 平台 | CUDA 据作者描述 来源 |
| 最大权重文件 | 2.6 GB 来源 |
| 全部权重文件 | 2.6 GB 来源 |
| Python | 3.10 据作者描述 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-10-05 来源 |
| 仓库创建时间 | 2026-09-18 来源 |
数值由程序自动从官方来源采集,并于 2026-10-08 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



