CPU3D3D、视频与音频的 AI 工具

MMAudio:音频生成器 — 功能与运行要求

MMAudio — 开源音频生成器,可根据视频或文本描述合成音轨。开发者将其定位为一种高质量音频合成工具,采用多类型数据联合训练。代码已发布在 GitHub 上,模型权重已上传至 Hugging Face。

功能

据作者描述,MMAudio 解决两个主要任务:

  • video-to-audio — 为现成视频生成音轨;
  • text-to-audio — 根据文本描述合成音频。

作者将该项目归入深度学习和计算机视觉领域。仓库描述中指出,该工作已被 CVPR 2025 接收。最新版本为 v0.1。

运行要求

代码使用 Python 编写。据作者描述,需要 Python 3.9 或更高版本,以及 PyTorch 2.5.1 或更高版本,并搭配相应版本的 torchvision 和 torchaudio。平台为 CUDA;作者建议在 pytorch.org 网站上根据自己 CUDA 版本选择对应的 PyTorch 版本。

据作者描述,显存需求约为 6 GB(16 位模式)。原文描述为:“In our experiments, inference only takes around 6GB of GPU memory (in 16-bit mode) which should fit in most modern GPUs”。这是开发者的声明,而非独立测量结果。

最大的权重文件占用 19.2 GB,所有权重文件合计 50.5 GB。代码许可证为 MIT,权重许可证为 cc-by-nc-4.0。这意味着权重仅可用于非商业用途,而代码可自由使用,包括商业用途,但需保留许可证声明。

适用人群

该工具面向那些从事视频或文本描述音频生成工作,并愿意在本地运行模型的人。开源代码便于研究其架构并根据自身需求进行改进。权重托管在 Hugging Face 上,简化了现成模型的下载流程。

不适合没有支持 CUDA 且显存充足的显卡的用户,也不适合寻找“开箱即用”商业解决方案的人:权重许可证 cc-by-nc-4.0 将使用限制在非商业用途。权重总量达 50.5 GB,在规划磁盘空间时也需要考虑这一点。

MMAudio 是一个开源研究项目,提供了现成的模型,用于根据视频或文本合成音频。运行需要 CUDA 兼容显卡、Python 3.9+ 和 PyTorch 2.5.1+。代码在 MIT 许可下自由使用,但权重仅限非商业用途。

MMAudio — 音频生成管线 从多模态输入到合成音频 输入数据 视频和文本 多模态输入 编码器 特征提取 视频和文本 联合训练 多模态 联合训练 音频生成器 高质量 音频合成 输出 音频 合成 开源 · MIT 许可证 · 权重 cc-by-nc-4.0 显存:6 GB · 平台:CUDA · Python 3.9+ CVPR 2025 · Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis 仓库创建:2024-12-07 · 最新版本:v0.1
MMAudio 的处理流程。示意图依据工具参数表绘制。

参数表

代码许可证MIT 来源
权重许可证cc-by-nc-4.0 来源
平台CUDA 据作者描述 来源
显存6 GB 据作者描述 来源
最大权重文件19.2 GB 来源
全部权重文件50.5 GB 来源
Python3.9 据作者描述 来源
语言Python 来源
代码最近更新2026-02-23 来源
仓库创建时间2024-12-07 来源
经常变化 — 数据截至 2026-08-19
最新版本v0.1 来源
发布日期2024-12-07 来源
GitHub 星标2259 来源
Fork 数265 来源
月下载量0 来源
模型更新2026-02-19 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读