MMAudio:音频生成器 — 功能与运行要求

MMAudio — 开源音频生成器,可根据视频或文本描述合成音轨。开发者将其定位为一种高质量音频合成工具,采用多类型数据联合训练。代码已发布在 GitHub 上,模型权重已上传至 Hugging Face。
功能
据作者描述,MMAudio 解决两个主要任务:
- video-to-audio — 为现成视频生成音轨;
- text-to-audio — 根据文本描述合成音频。
作者将该项目归入深度学习和计算机视觉领域。仓库描述中指出,该工作已被 CVPR 2025 接收。最新版本为 v0.1。
运行要求
代码使用 Python 编写。据作者描述,需要 Python 3.9 或更高版本,以及 PyTorch 2.5.1 或更高版本,并搭配相应版本的 torchvision 和 torchaudio。平台为 CUDA;作者建议在 pytorch.org 网站上根据自己 CUDA 版本选择对应的 PyTorch 版本。
据作者描述,显存需求约为 6 GB(16 位模式)。原文描述为:“In our experiments, inference only takes around 6GB of GPU memory (in 16-bit mode) which should fit in most modern GPUs”。这是开发者的声明,而非独立测量结果。
最大的权重文件占用 19.2 GB,所有权重文件合计 50.5 GB。代码许可证为 MIT,权重许可证为 cc-by-nc-4.0。这意味着权重仅可用于非商业用途,而代码可自由使用,包括商业用途,但需保留许可证声明。
适用人群
该工具面向那些从事视频或文本描述音频生成工作,并愿意在本地运行模型的人。开源代码便于研究其架构并根据自身需求进行改进。权重托管在 Hugging Face 上,简化了现成模型的下载流程。
不适合没有支持 CUDA 且显存充足的显卡的用户,也不适合寻找“开箱即用”商业解决方案的人:权重许可证 cc-by-nc-4.0 将使用限制在非商业用途。权重总量达 50.5 GB,在规划磁盘空间时也需要考虑这一点。
MMAudio 是一个开源研究项目,提供了现成的模型,用于根据视频或文本合成音频。运行需要 CUDA 兼容显卡、Python 3.9+ 和 PyTorch 2.5.1+。代码在 MIT 许可下自由使用,但权重仅限非商业用途。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 代码许可证 | MIT 来源 |
|---|---|
| 权重许可证 | cc-by-nc-4.0 来源 |
| 平台 | CUDA 据作者描述 来源 |
| 显存 | 6 GB 据作者描述 来源 |
| 最大权重文件 | 19.2 GB 来源 |
| 全部权重文件 | 50.5 GB 来源 |
| Python | 3.9 据作者描述 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-02-23 来源 |
| 仓库创建时间 | 2024-12-07 来源 |
| 最新版本 | v0.1 来源 |
|---|---|
| 发布日期 | 2024-12-07 来源 |
| GitHub 星标 | 2259 来源 |
| Fork 数 | 265 来源 |
| 月下载量 | 0 来源 |
| 模型更新 | 2026-02-19 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



