HunyuanVideo:视频生成器——功能与运行要求

HunyuanVideo(混元视频)是腾讯公司推出的开源视频生成器,解决 text-to-video 任务。该工具基于 diffusion-transformer 构建,旨在根据文本描述生成视频。
功能
作者将该项目定位为大规模视频生成的系统框架。仓库中未公开具体的质量指标或支持的风格。从项目标签可以看出,其基础是 diffusion-models 和 diffusion-transformer。源代码用 Python 编写,可供研究和修改。
运行要求
- 平台:据作者描述,需要支持 CUDA 的 NVIDIA 显卡。
- 显存:作者给出的最低要求为:720x1280 分辨率(129 帧)需 60 GB,544x960 分辨率(129 帧)需 45 GB。
- 许可证:代码采用非标准许可证(需要人工审核),模型权重标记为「other」。
- 模型:可在 Hugging Face 获取,代码在 GitHub 上。
适合谁
该工具面向拥有强大计算资源的研究人员和开发者。最高分辨率需要 60 GB 显存,这排除了大多数消费级显卡。该项目适合愿意使用开源代码、自行研究非标准许可证并配置环境的人。如需快速体验,可在网站 aivideo.hunyuan.tencent.com 上使用云服务版本——无法在本地运行。
HunyuanVideo(混元视频)作为视频生成的 diffusion-transformer 开源实现很有价值,但硬件门槛高且许可证非标准,在纳入工作流程前需要仔细研究。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-video 来源 |
|---|---|
| 代码许可证 | 非标准(需手动核实) 来源 |
| 权重许可证 | other 来源 |
| 平台 | CUDA 据作者描述 来源 |
| 显存 | 45–60 GB 据作者描述 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-06-29 来源 |
| 仓库创建时间 | 2024-11-28 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



