CogVideoX(智谱 CogVideoX):视频生成器 — 功能与运行要求

我们面前是 CogVideoX(智谱 CogVideoX)——一款基于文本描述生成视频的开源工具。开发者智谱 AI 将其定位为将文本提示词转化为视频片段的工具。该模型也常与图生视频功能一同被提及,尽管其参数表中的主要任务标注为 text-to-video。
功能
据作者描述,CogVideoX 是一个根据文本和图像生成视频的系统。在代码仓库中,该项目被标记为 text-to-video 和 image-to-video,表明其有两种工作模式。关键词中还包含 llm 和 sora,这说明其底层基于语言模型,且该技术属于与 Sora 类似的解决方案类别。参数表中未提供关于视频最大时长或支持分辨率的详细信息。
运行要求
代码使用 Python 编写,并以 Apache-2.0 许可证分发。模型权重采用不同的许可证——other。运行需要支持 CUDA 的 NVIDIA 显卡。据作者描述原文:需要 NVIDIA H100 及以上设备,并要求从源代码安装 torch 和 torchao 包。推荐的 CUDA 版本为 12.4。最大的权重文件占用 9.2 GB,所有文件的总大小为 20 GB。该模型已集成到 diffusers 库中。可以在本地运行,但对硬件的要求相当特殊。
适用人群
该工具面向能够使用强大服务器加速器的开发者和研究人员。开源代码以及 GitHub 上的仓库使得研究架构并根据自身需求改进模型成为可能。根据其声明的要求,CogVideoX 并不适合在消费级显卡上日常使用。对于寻找无需配置环境的云服务的用户,也应考虑其他方案——这里需要手动构建依赖并处理 Python 代码。
该模型仍在持续发展:代码的最后一次修改日期为 2025 年 11 月,最新版本标记为 v1.0。这表明项目处于积极维护阶段,但尚未积累大量中间版本。
参数表
| 任务 | text-to-video 来源 |
|---|---|
| 代码许可证 | Apache-2.0 来源 |
| 权重许可证 | other 来源 |
| 平台 | CUDA 据作者描述 来源 |
| 最大权重文件 | 9.2 GB 来源 |
| 全部权重文件 | 20 GB 来源 |
| 库 | diffusers 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2025-11-04 来源 |
| 仓库创建时间 | 2022-05-29 来源 |
| 最新版本 | v1.0 来源 |
|---|---|
| 发布日期 | 2024-11-08 来源 |
| GitHub 星标 | 12929 来源 |
| Fork 数 | 1324 来源 |
| 月下载量 | 15821 来源 |
| 模型更新 | 2024-11-23 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



