Stable Audio Open:音频生成器 — 功能与运行要求

Stable Audio Open 是 Stability AI 推出的开源音频生成器。它解决的是 text-to-audio 任务:将文本描述转换为音频文件。该工具适合那些需要根据文本生成音频、并且愿意直接处理代码和模型权重的人。
功能
据作者描述,该项目是用于条件音频生成的生成模型。模型解决的任务是 text-to-audio:输入文本,输出音频。参数表中未声明其他工作模式,例如语音生成或按乐谱生成音乐。
代码使用 Python 编写。仓库最后一次更新是在 2026 年 8 月 9 日,仓库本身创建于 2023 年 5 月 23 日。
运行要求
运行需要 stable-audio-tools 库。最大的权重文件占用 4.5 GB,所有权重文件合计 14.6 GB。规划磁盘空间时需要考虑到这一点。
据作者描述,开发使用的是 Python 3.10。仓库描述中注明:“Requires PyTorch 2.5 or later for Flash Attention and Flex Attention support. Development for the repo is done in Python 3.10”。也就是说,要支持 Flash Attention 和 Flex Attention,需要 PyTorch 2.5 或更高版本。
代码以 MIT 许可证分发。权重许可证标注为 other——作者未在参数表中披露具体条款。
适合谁
该工具面向那些熟悉 Python、不畏惧通过代码运行模型的人。开源代码和可获取的权重让用户能够深入了解模型结构,并在必要时针对自己的需求进行改进。
对于寻找带界面的现成应用的人来说,这个方案可能不合适:参数表中没有关于图形界面或 Web 服务的信息。此外还需要考虑权重体积——合计 14.6 GB,对配置较低的机器来说可能比较吃力。
Stable Audio Open 是面向开发者和研究人员的工具,他们需要根据文本生成音频,并且愿意直接处理代码和权重。代码是开源的,模型可以获取,但运行需要一定的技术准备和足够的磁盘空间。
参数表
| 任务 | text-to-audio 来源 |
|---|---|
| 代码许可证 | MIT 来源 |
| 权重许可证 | other 来源 |
| 最大权重文件 | 4.5 GB 来源 |
| 全部权重文件 | 14.6 GB 来源 |
| Python | 3.10 据作者描述 来源 |
| 库 | stable-audio-tools 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-08-09 来源 |
| 仓库创建时间 | 2023-05-23 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



