CPU3D3D、视频与音频的 AI 工具

CogVideoX(智谱 CogVideoX):视频生成器 — 功能与运行要求

我们面前是 CogVideoX(智谱 CogVideoX)——一款基于文本描述生成视频的开源工具。开发者智谱 AI 将其定位为将文本提示词转化为视频片段的工具。该模型也常与图生视频功能一同被提及,尽管其参数表中的主要任务标注为 text-to-video。

功能

据作者描述,CogVideoX 是一个根据文本和图像生成视频的系统。在代码仓库中,该项目被标记为 text-to-video 和 image-to-video,表明其有两种工作模式。关键词中还包含 llm 和 sora,这说明其底层基于语言模型,且该技术属于与 Sora 类似的解决方案类别。参数表中未提供关于视频最大时长或支持分辨率的详细信息。

运行要求

代码使用 Python 编写,并以 Apache-2.0 许可证分发。模型权重采用不同的许可证——other。运行需要支持 CUDA 的 NVIDIA 显卡。据作者描述原文:需要 NVIDIA H100 及以上设备,并要求从源代码安装 torchtorchao 包。推荐的 CUDA 版本为 12.4。最大的权重文件占用 9.2 GB,所有文件的总大小为 20 GB。该模型已集成到 diffusers 库中。可以在本地运行,但对硬件的要求相当特殊。

适用人群

该工具面向能够使用强大服务器加速器的开发者和研究人员。开源代码以及 GitHub 上的仓库使得研究架构并根据自身需求改进模型成为可能。根据其声明的要求,CogVideoX 并不适合在消费级显卡上日常使用。对于寻找无需配置环境的云服务的用户,也应考虑其他方案——这里需要手动构建依赖并处理 Python 代码。

该模型仍在持续发展:代码的最后一次修改日期为 2025 年 11 月,最新版本标记为 v1.0。这表明项目处于积极维护阶段,但尚未积累大量中间版本。

CogVideoX(智谱 CogVideoX)流水线 按文本和图像生成视频 输入 文本描述 图像 提示词和参考帧 编码 分词 嵌入 文本和帧转向量 生成 CogVideoX-5b 扩散 去噪,帧 解码 VAE 解码器 帧组装 潜码转视频 结果 视频文件 格式:MP4 生成的视频 工作模式: Text-to-Video Image-to-Video 平台:CUDA 12.4 库:diffusers 许可证:Apache-2.0 权重:20 GB
CogVideoX 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-video 来源
代码许可证Apache-2.0 来源
权重许可证other 来源
平台CUDA 据作者描述 来源
最大权重文件9.2 GB 来源
全部权重文件20 GB 来源
diffusers 来源
语言Python 来源
代码最近更新2025-11-04 来源
仓库创建时间2022-05-29 来源
经常变化 — 数据截至 2026-08-19
最新版本v1.0 来源
发布日期2024-11-08 来源
GitHub 星标12929 来源
Fork 数1324 来源
月下载量15821 来源
模型更新2024-11-23 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读