CPU3D3D、视频与音频的 AI 工具

Stable Audio Open:音频生成器 — 功能与运行要求

Stable Audio Open 是 Stability AI 推出的开源音频生成器。它解决 text-to-audio 任务:将文本描述转换为音频文件。该工具适合需要根据文本生成音频、并且愿意直接使用代码和模型权重的用户。

功能

作者将该项目的描述为用于条件音频生成的生成模型。模型解决的任务是 text-to-audio:输入文本,输出音频。参数表中未声明其他工作模式,例如语音生成或按乐谱生成音乐。

代码使用 Python 编写。仓库的最后一次变更是 2026 年 8 月 9 日,仓库本身创建于 2023 年 5 月 23 日。

运行要求

运行需要 stable-audio-tools 库。最大的单个权重文件为 4.5 GB,所有权重文件合计为 14.6 GB。在规划磁盘空间时需要考虑这一点。

据作者描述,开发使用 Python 3.10。仓库说明中写道:“Requires PyTorch 2.5 or later for Flash Attention and Flex Attention support. Development for the repo is done in Python 3.10”。也就是说,要支持 Flash Attention 和 Flex Attention,需要 PyTorch 2.5 或更新版本。

代码按 MIT 许可证分发。

适合谁

该工具面向会使用 Python、并且不介意通过代码运行模型的用户。开源代码和可获取的权重让用户能够了解模型的结构,并在需要时将其改造以满足自己的任务。

对于寻找带界面的现成应用的用户,这个方案可能并不合适:参数表中没有关于图形界面或 Web 服务的信息。此外还需要考虑权重的体积——总计 14.6 GB,这对性能较弱的机器来说可能比较明显。

Stable Audio Open 是面向开发者和研究人员的工具,他们需要根据文本生成音频,并且愿意直接使用代码和权重。代码开源,模型可获取,但运行需要技术准备和足够的磁盘空间。

Stable Audio Open 流程 文本 提示 声音描述 自然语言 分词 转换 为数值令牌 生成 扩散 模型 解码 转换 为音频信号 音频 声音 文件 开源 · MIT · Python · PyTorch 模型: stable-audio-open-1.0 库: stable-audio-tools 任务: text-to-audio 开发者: Stability AI Python 版本: 3.10 代码许可证: MIT
Stable Audio Open 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-audio 来源
代码许可证MIT 来源
最大权重文件4.5 GB 来源
全部权重文件14.6 GB 来源
Python3.10 据作者描述 来源
库stable-audio-tools 来源
语言Python 来源
代码最近更新2026-09-18 来源
仓库创建时间2023-05-23 来源
经常变化 — 数据截至 2026-10-03
GitHub 星标3872 来源
Fork 数487 来源
月下载量20884 来源
模型更新2025-06-19 来源

数值由程序自动从官方来源采集,并于 2026-10-03 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读