CPU3D3D、视频与音频的 AI 工具

ACE-Step:音频生成器 — 功能与运行要求

ACE-Step — 这是一个开源的音频生成器,能将文本描述转化为音频。开发者将其定位为迈向音乐生成基础模型的一步,因此该工具值得那些从事基于文本的声音合成、并希望在自己的硬件上运行模型的人关注。

功能

ACE-Step 解决的是 text-to-audio 任务:输入文本,输出音频文件。作者将项目描述为“迈向音乐生成基础模型的一步”,但参数表中未透露关于支持的音乐类型、生成片段的时长或控制参数的细节。该模型通过 diffusers 库运行,这简化了与现有 Python 管线的集成。

代码和模型权重均为开源。代码许可证为 Apache-2.0,模型权重许可证为 apache-2.0。这允许在不受专有模型常见限制的情况下进行使用和修改。

运行要求

运行需要 8 GB 显存——据作者描述,这是一个降低的要求,使模型“更兼容消费级设备”。作为性能参考,开发者提到了 MacBook M2 Max:生成耗时 26.43 秒,加速系数为 2.27x。这是开发者的声明,而非独立测量结果。

完整的模型权重文件集占用 7.7 GB,最大的文件为 6.2 GB。安装时,作者建议使用 Python 3.10 环境。代码使用 Python 编写,仓库位于 github.com/ace-step/ACE-Step,模型权重位于 huggingface.co/ACE-Step/ACE-Step-v1-3.5B。更多信息可在项目网站上找到:https://ace-step.github.io/。

仓库创建于 2025 年 4 月 28 日,代码最后修改于 2026 年 2 月 15 日。项目正在持续开发,但作者未说明更新频率或开发计划。

适合谁

ACE-Step 对已经使用 diffusers、并希望将 text-to-audio 集成到项目中而无需外部 API 的开发者会很有用。Apache-2.0 开源许可证允许在商业产品和研究项目中使用该模型。

8 GB 显存的要求排除了老旧或入门级显卡的用户,但仍可在现代消费级 GPU 和 M2 Max 级别的笔记本上运行。对于寻找现成 Web 界面服务的人来说,需要通过 Python 和 diffusers 自行配置运行——作者未说明是否有图形界面。

ACE-Step 适合那些愿意处理代码、并希望在自己的机器上控制音频生成过程的用户。开源权重和适中的显存要求使其成为 text-to-audio 实验的一个可行选择,但关于模型音乐能力的细节建议在仓库和项目网站上进一步确认。

ACE-Step — 音频生成器流水线 text-to-audio · 开源 · Apache-2.0 输入 文本描述 用户提示词 自然语言 分词 编码 文本转令牌 嵌入 模型 ACE-Step-v1 音频生成 扩散模型 解码 声码器 令牌转音频 信号重建 输出 音频 声音 语音 工具特性 开发者:ACE Studio 和 StepFun 许可证:Apache-2.0 库:diffusers 显存:8 GB 平台:M2 Max Python: 3.10 模型:ACE-Step-v1-3.5B 权重:7.7 GB 任务:text-to-audio
ACE-Step 的处理流程。示意图依据工具参数表绘制。

参数表

任务text-to-audio 来源
代码许可证Apache-2.0 来源
权重许可证apache-2.0 来源
平台M2 Max 据作者描述 来源
显存8 GB 据作者描述 来源
最大权重文件6.2 GB 来源
全部权重文件7.7 GB 来源
Python3.10 据作者描述 来源
diffusers 来源
语言Python 来源
代码最近更新2026-02-15 来源
仓库创建时间2025-04-28 来源
经常变化 — 数据截至 2026-08-19
GitHub 星标4777 来源
Fork 数613 来源
月下载量0 来源
模型更新2025-05-22 来源

数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。

相关阅读