CPU3D3D、视频与音频的 AI 工具

CogVideoX(智谱 CogVideoX):视频生成器 — 功能与运行要求

我们面前的是 CogVideoX(智谱 CogVideoX)——一个开源的文本描述生成视频工具。开发者智谱 AI 公司将其定位为把文本提示转化为视频短片的工具。该模型也被提及与图像生成视频相关联,尽管参数表中标注的主要任务是 text-to-video。

功能

作者将 CogVideoX 描述为根据文本和图像生成视频的系统。在代码仓库中,该项目被标记为 text-to-video 和 image-to-video,这表明它有两种工作模式。关键词中还包括 llm 和 sora——这说明其底层基于语言模型,而该技术本身属于与 Sora 类似的解决方案类别。参数表中没有关于视频最大时长或支持分辨率的详细信息。

运行要求

代码使用 Python 编写,采用 Apache-2.0 许可证分发。模型权重采用 The CogVideoX License:注册后可商用,每月最多 100 万次访问。运行需要支持 CUDA 的 NVIDIA 显卡。据作者描述原文:需要 NVIDIA H100 及以上的设备,需要从源代码安装 torch 和 torchao 包。推荐的 CUDA 版本为 12.4。最大的权重文件占用 9.2 GB,所有文件的总体积为 20 GB。该模型已集成到 diffusers 库中。可以在本地运行,但对硬件的要求相当特殊。

适合谁

该工具面向能够使用强大服务器加速器的开发者和研究人员。开源代码以及 GitHub 上的代码仓库使得研究其架构并针对自身任务改进模型成为可能。就所声明的运行要求来看,CogVideoX 并不适合在用户级显卡上日常使用。对于希望寻找无需配置环境的云服务的人来说,也应当考虑其他解决方案——这里需要手动构建依赖并处理 Python 代码。

该模型仍在持续发展:最后一次代码变更日期为 2025 年 11 月,最新版本标记为 v1.0。这说明项目处于积极维护阶段,但目前尚未积累大量中间版本。

CogVideoX(智谱 CogVideoX)流水线 按文本和图像生成视频 输入 文本描述 图像 提示词和参考帧 编码 分词 嵌入 文本和帧转向量 生成 CogVideoX-5b 扩散 去噪,帧 解码 VAE 解码器 帧组装 潜码转视频 结果 视频文件 格式:MP4 生成的视频 工作模式: Text-to-Video Image-to-Video 平台:CUDA 12.4 库:diffusers 许可证:Apache-2.0 权重:20 GB
CogVideoX 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-video 来源
代码许可证Apache-2.0 来源
权重许可证The CogVideoX License:注册后可商用,每月不超过 100 万次访问 来源
平台CUDA 据作者描述 来源
最大权重文件9.2 GB 来源
全部权重文件20 GB 来源
库diffusers 来源
语言Python 来源
代码最近更新2025-11-04 来源
仓库创建时间2022-05-29 来源
经常变化 — 数据截至 2026-09-14
最新版本v1.0 来源
发布日期2024-11-08 来源
GitHub 星标12996 来源
Fork 数1339 来源
月下载量17161 来源
模型更新2024-11-23 来源

数值由程序自动从官方来源采集,并于 2026-09-14 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读