ACE-Step:音频生成器 — 功能与运行要求

ACE-Step — 这是一个开源的音频生成器,能将文本描述转化为音频。开发者将其定位为迈向音乐生成基础模型的一步,因此该工具值得那些从事基于文本的声音合成、并希望在自己的硬件上运行模型的人关注。
功能
ACE-Step 解决的是 text-to-audio 任务:输入文本,输出音频文件。作者将项目描述为“迈向音乐生成基础模型的一步”,但参数表中未透露关于支持的音乐类型、生成片段的时长或控制参数的细节。该模型通过 diffusers 库运行,这简化了与现有 Python 管线的集成。
代码和模型权重均为开源。代码许可证为 Apache-2.0,模型权重许可证为 apache-2.0。这允许在不受专有模型常见限制的情况下进行使用和修改。
运行要求
运行需要 8 GB 显存——据作者描述,这是一个降低的要求,使模型“更兼容消费级设备”。作为性能参考,开发者提到了 MacBook M2 Max:生成耗时 26.43 秒,加速系数为 2.27x。这是开发者的声明,而非独立测量结果。
完整的模型权重文件集占用 7.7 GB,最大的文件为 6.2 GB。安装时,作者建议使用 Python 3.10 环境。代码使用 Python 编写,仓库位于 github.com/ace-step/ACE-Step,模型权重位于 huggingface.co/ACE-Step/ACE-Step-v1-3.5B。更多信息可在项目网站上找到:https://ace-step.github.io/。
仓库创建于 2025 年 4 月 28 日,代码最后修改于 2026 年 2 月 15 日。项目正在持续开发,但作者未说明更新频率或开发计划。
适合谁
ACE-Step 对已经使用 diffusers、并希望将 text-to-audio 集成到项目中而无需外部 API 的开发者会很有用。Apache-2.0 开源许可证允许在商业产品和研究项目中使用该模型。
8 GB 显存的要求排除了老旧或入门级显卡的用户,但仍可在现代消费级 GPU 和 M2 Max 级别的笔记本上运行。对于寻找现成 Web 界面服务的人来说,需要通过 Python 和 diffusers 自行配置运行——作者未说明是否有图形界面。
ACE-Step 适合那些愿意处理代码、并希望在自己的机器上控制音频生成过程的用户。开源权重和适中的显存要求使其成为 text-to-audio 实验的一个可行选择,但关于模型音乐能力的细节建议在仓库和项目网站上进一步确认。
参数表
代码仓库 · HuggingFace 模型 · 开发者网站
| 任务 | text-to-audio 来源 |
|---|---|
| 代码许可证 | Apache-2.0 来源 |
| 权重许可证 | apache-2.0 来源 |
| 平台 | M2 Max 据作者描述 来源 |
| 显存 | 8 GB 据作者描述 来源 |
| 最大权重文件 | 6.2 GB 来源 |
| 全部权重文件 | 7.7 GB 来源 |
| Python | 3.10 据作者描述 来源 |
| 库 | diffusers 来源 |
| 语言 | Python 来源 |
| 代码最近更新 | 2026-02-15 来源 |
| 仓库创建时间 | 2025-04-28 来源 |
数值由程序自动从官方来源采集,并于 2026-08-19 核对。每个数值都附来源链接;取自开发者页面的数值还附有原文引用——将鼠标悬停在标注上即可查看。价格与版本为核对日期时的数据,变化最频繁——购买前请以官网为准。



