CogVideoX(智谱 CogVideoX):视频生成器 — 功能与运行要求

我们面前的是 CogVideoX(智谱 CogVideoX)——一个开源的文本描述生成视频工具。开发者智谱 AI 公司将其定位为把文本提示转化为视频短片的工具。该模型也被提及与图像生成视频相关联,尽管参数表中标注的主要任务是 text-to-video。
功能
作者将 CogVideoX 描述为根据文本和图像生成视频的系统。在代码仓库中,该项目被标记为 text-to-video 和 image-to-video,这表明它有两种工作模式。关键词中还包括 llm 和 sora——这说明其底层基于语言模型,而该技术本身属于与 Sora 类似的解决方案类别。参数表中没有关于视频最大时长或支持分辨率的详细信息。
运行要求
代码使用 Python 编写,采用 Apache-2.0 许可证分发。模型权重采用 The CogVideoX License:注册后可商用,每月最多 100 万次访问。运行需要支持 CUDA 的 NVIDIA 显卡。据作者描述原文:需要 NVIDIA H100 及以上的设备,需要从源代码安装 torch 和 torchao 包。推荐的 CUDA 版本为 12.4。最大的权重文件占用 9.2 GB,所有文件的总体积为 20 GB。该模型已集成到 diffusers 库中。可以在本地运行,但对硬件的要求相当特殊。
适合谁
该工具面向能够使用强大服务器加速器的开发者和研究人员。开源代码以及 GitHub 上的代码仓库使得研究其架构并针对自身任务改进模型成为可能。就所声明的运行要求来看,CogVideoX 并不适合在用户级显卡上日常使用。对于希望寻找无需配置环境的云服务的人来说,也应当考虑其他解决方案——这里需要手动构建依赖并处理 Python 代码。
该模型仍在持续发展:最后一次代码变更日期为 2025 年 11 月,最新版本标记为 v1.0。这说明项目处于积极维护阶段,但目前尚未积累大量中间版本。
参数表
| 任务 | text-to-video 来源 |
|---|---|
| 代码许可证 | Apache-2.0 来源 |
| 权重许可证 | The CogVideoX License:注册后可商用,每月不超过 100 万次访问 来源 |
| 平台 | CUDA 据作者描述 来源 |
| 最大权重文件 | 9.2 GB 来源 |
| 全部权重文件 | 20 GB 来源 |
| 库 | diffusers 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2025-11-04 来源 |
| 仓库创建时间 | 2022-05-29 来源 |
| 最新版本 | v1.0 来源 |
|---|---|
| 发布日期 | 2024-11-08 来源 |
| GitHub 星标 | 12996 来源 |
| Fork 数 | 1339 来源 |
| 月下载量 | 17161 来源 |
| 模型更新 | 2024-11-23 来源 |
数值由程序自动从官方来源采集,并于 2026-09-14 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



