Stable Audio Open:音频生成器 — 功能与运行要求

Stable Audio Open 是 Stability AI 推出的开源音频生成器。它解决 text-to-audio 任务:将文本描述转换为音频文件。该工具适合需要根据文本生成音频、并且愿意直接使用代码和模型权重的用户。
功能
作者将该项目的描述为用于条件音频生成的生成模型。模型解决的任务是 text-to-audio:输入文本,输出音频。参数表中未声明其他工作模式,例如语音生成或按乐谱生成音乐。
代码使用 Python 编写。仓库的最后一次变更是 2026 年 8 月 9 日,仓库本身创建于 2023 年 5 月 23 日。
运行要求
运行需要 stable-audio-tools 库。最大的单个权重文件为 4.5 GB,所有权重文件合计为 14.6 GB。在规划磁盘空间时需要考虑这一点。
据作者描述,开发使用 Python 3.10。仓库说明中写道:“Requires PyTorch 2.5 or later for Flash Attention and Flex Attention support. Development for the repo is done in Python 3.10”。也就是说,要支持 Flash Attention 和 Flex Attention,需要 PyTorch 2.5 或更新版本。
代码按 MIT 许可证分发。
适合谁
该工具面向会使用 Python、并且不介意通过代码运行模型的用户。开源代码和可获取的权重让用户能够了解模型的结构,并在需要时将其改造以满足自己的任务。
对于寻找带界面的现成应用的用户,这个方案可能并不合适:参数表中没有关于图形界面或 Web 服务的信息。此外还需要考虑权重的体积——总计 14.6 GB,这对性能较弱的机器来说可能比较明显。
Stable Audio Open 是面向开发者和研究人员的工具,他们需要根据文本生成音频,并且愿意直接使用代码和权重。代码开源,模型可获取,但运行需要技术准备和足够的磁盘空间。
参数表
| 任务 | text-to-audio 来源 |
|---|---|
| 代码许可证 | MIT 来源 |
| 最大权重文件 | 4.5 GB 来源 |
| 全部权重文件 | 14.6 GB 来源 |
| Python | 3.10 据作者描述 来源 |
| 库 | stable-audio-tools 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-09-18 来源 |
| 仓库创建时间 | 2023-05-23 来源 |
数值由程序自动从官方来源采集,并于 2026-10-03 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



