CPU3D3D、视频与音频的 AI 工具

Stable Audio Open:音频生成器 — 功能与运行要求

Stable Audio Open 是 Stability AI 推出的开源音频生成器。它解决的是 text-to-audio 任务:将文本描述转换为音频文件。该工具适合那些需要根据文本生成音频、并且愿意直接处理代码和模型权重的人。

功能

据作者描述,该项目是用于条件音频生成的生成模型。模型解决的任务是 text-to-audio:输入文本,输出音频。参数表中未声明其他工作模式,例如语音生成或按乐谱生成音乐。

代码使用 Python 编写。仓库最后一次更新是在 2026 年 8 月 9 日,仓库本身创建于 2023 年 5 月 23 日。

运行要求

运行需要 stable-audio-tools 库。最大的权重文件占用 4.5 GB,所有权重文件合计 14.6 GB。规划磁盘空间时需要考虑到这一点。

据作者描述,开发使用的是 Python 3.10。仓库描述中注明:“Requires PyTorch 2.5 or later for Flash Attention and Flex Attention support. Development for the repo is done in Python 3.10”。也就是说,要支持 Flash Attention 和 Flex Attention,需要 PyTorch 2.5 或更高版本。

代码以 MIT 许可证分发。权重许可证标注为 other——作者未在参数表中披露具体条款。

适合谁

该工具面向那些熟悉 Python、不畏惧通过代码运行模型的人。开源代码和可获取的权重让用户能够深入了解模型结构,并在必要时针对自己的需求进行改进。

对于寻找带界面的现成应用的人来说,这个方案可能不合适:参数表中没有关于图形界面或 Web 服务的信息。此外还需要考虑权重体积——合计 14.6 GB,对配置较低的机器来说可能比较吃力。

Stable Audio Open 是面向开发者和研究人员的工具,他们需要根据文本生成音频,并且愿意直接处理代码和权重。代码是开源的,模型可以获取,但运行需要一定的技术准备和足够的磁盘空间。

Stable Audio Open 流程 文本 提示 声音描述 自然语言 分词 转换 为数值令牌 生成 扩散 模型 解码 转换 为音频信号 音频 声音 文件 开源 · MIT · Python · PyTorch 模型: stable-audio-open-1.0 库: stable-audio-tools 任务: text-to-audio 开发者: Stability AI Python 版本: 3.10 代码许可证: MIT
Stable Audio Open 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-audio 来源
代码许可证MIT 来源
权重许可证other 来源
最大权重文件4.5 GB 来源
全部权重文件14.6 GB 来源
Python3.10 据作者描述 来源
stable-audio-tools 来源
语言Python 来源
代码最近更新2026-08-09 来源
仓库创建时间2023-05-23 来源
经常变化 — 数据截至 2026-08-19
GitHub 星标3842 来源
Fork 数478 来源
月下载量21491 来源
模型更新2025-06-19 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读