ACE-Step 1.5
Pushing the Boundaries of Open-Source Music Generation
Project | Hugging Face | ModelScope | Space Demo | Discord | Technical Report | Awesome ACE-Step
目录
📝 摘要
🚀 我们介绍ACE Step v1.5,这是一个高效的开源音乐基础模型,为消费硬件带来了商业级的生成。在常用的评估指标上,ACE Step v1.5的质量超越了大多数商业音乐型号,同时保持了极快的速度——在A100上每首完整歌曲不到2秒,在RTX 3090上不到10秒。该模型在本地运行,VRAM不到4GB,并支持轻量级个性化:用户可以从几首歌曲中训练LoRA来捕捉自己的风格。
🌉 其核心是一种新颖的混合架构,其中语言模型(LM)充当一个全能的规划者:它将简单的用户查询转换为全面的歌曲蓝图——从短循环扩展到10分钟的作品——同时通过思维链合成元数据、歌词和字幕,以指导扩散转换器(DiT)。 ⚡ 独特的是,这种对齐是通过仅依赖模型内部机制的内在强化学习实现的,从而消除了外部奖励模型或人类偏好中固有的偏见。 🎚️
🔮 除了标准合成之外,ACE Step v1.5还将精确的风格控制与多功能编辑功能相结合,如封面生成、重新绘制和声音到背景音乐的转换,同时严格遵守50多种语言的提示。这为无缝集成到音乐艺术家、制作人和内容创作者的创作工作流程中的强大工具铺平了道路。 🎸
✨ 特性
⚡ 演出
- ✅ 超高速一代 --A100上每首完整歌曲不超过2秒,RTX 3090上不超过10秒(A100上为0.5秒至10秒,具体取决于思考模式和扩散步骤)
- ✅ 灵活的持续时间 --支持10秒至10分钟(600秒)的音频生成
- ✅ 批量生成 --最多可同时生成8首歌曲
🎵 发电质量
- ✅ 商业级产量 --质量超越大多数商业音乐型号(介于Suno v4.5和Suno v5之间)
- ✅ 丰富的风格支持 --1000多种乐器和风格,具有细腻的音色描述
- ✅ 多语言歌词 --支持50多种语言,歌词提示用于结构和风格控制
🎛️ 多功能性和控制
| 特性 | 描述 |
|---|---|
| ✅ 参考音频输入 | 使用参考音频指导生成风格 |
| ✅ 封面生成 | 从现有音频创建封面 |
| ✅ 重新绘制和编辑 | 选择性本地音频编辑和再生 |
| ✅ 音轨分离 | 将音频分离为单独的词干 |
| ✅ 多轨道生成 | 添加图层,如Suno Studio的“添加图层”功能 |
| ✅ Vocal2BGM | 自动为声乐曲目生成伴奏 |
| ✅ 元数据控制 | 控制持续时间、BPM、密钥/规模、时间签名 |
| ✅ 简单模式 | 根据简单描述生成完整歌曲 |
| ✅ 查询重写 | 标签和歌词的自动LM扩展 |
| ✅ 音频理解 | 从音频中提取BPM、按键/比例、时间特征和字幕 |
| ✅ LRC生成 | 为生成的音乐自动生成歌词时间戳 |
| ✅ LoRA培训 | Gradio中的一键注释和培训。8首歌曲,3090(12GB VRAM)播放1小时 |
| ✅ 质量评分 | 生成音频的自动质量评估 |
| ✅ MCP服务器 | 通过模型上下文协议集成Claude代码/游标工具 |
🔔 保持领先
在GitHub上启动ACE Step,并立即收到新版本的通知 
🤝 伙伴
⚡ 快速开始
要求: Python 3.11-3.12,推荐CUDA GPU(也支持MPS/ROCm/Intel XPU/CPU) 注: Windows上的ROCm需要Python 3.12(AMD官方只提供Python 3.12轮子)
# 1. Install uv
curl -LsSf https://astral.sh/uv/install.sh | sh # macOS / Linux
# powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex" # Windows
# 2. Clone & install
git clone https://github.com/ACE-Step/ACE-Step-1.5.git
cd ACE-Step-1.5
uv sync
# 3. Launch Gradio UI (models auto-download on first run)
uv run acestep
# Or launch REST API server
uv run acestep-api打开http://localhost:7860(Gradio)或http://localhost:8001API
📖 完整安装指南 (AMD/ROCm、英特尔GPU、CPU、环境变量、命令行选项): 英语 | 中文 | 日本语
💡 我应该选择哪种型号?
| 您的GPU VRAM | 推荐的LM型号 | 后端 | 注意事项 |
|---|---|---|---|
| ≤6GB | 无(仅DiT) | -- | LM默认禁用;INT8量化+完全CPU卸载 |
| 6-8GB | acestep-5Hz-lm-0.6B | pt | 带有PyTorch后端的轻量级LM |
| 8-16GB | acestep-5Hz-lm-0.6B / 1.7B | vllm | 8-12GB为0.6B,12-16GB为1.7B |
| 16-24GB | acestep-5Hz-lm-1.7B | vllm | 4B在20GB+上可用;20GB+无需卸载 |
| ≥24GB | acestep-5Hz-lm-4B | vllm | 质量最好,所有型号都适合,无需卸载 |
UI会自动为GPU选择最佳配置。所有设置(LM模型、后端、卸载、量化)都是分层感知和预配置的。
📖 GPU兼容性详细信息: 英语 | 中文 | 日本语 | 韩语
🚀 启动脚本
适用于所有平台的即用型启动脚本,具有自动环境检测、更新检查和依赖关系安装功能。
| 平台 | 脚本 | 后端 |
|---|---|---|
| 视窗 | start_gradio_ui.bat, start_api_server.bat | CUDA |
| Windows(ROCm) | start_gradio_ui_rocm.bat, start_api_server_rocm.bat | AMD ROCm |
| Linux | start_gradio_ui.sh, start_api_server.sh | CUDA |
| macOS | start_gradio_ui_macos.sh, start_api_server_macos.sh | MLX(苹果硅) |
# Windows
start_gradio_ui.bat
# Linux
chmod +x start_gradio_ui.sh && ./start_gradio_ui.sh
# macOS (Apple Silicon)
chmod +x start_gradio_ui_macos.sh && ./start_gradio_ui_macos.sh⚙️ 自定义启动设置
推荐: 创建一个 .env 文件以自定义模型、端口和其他设置。你的 .env 配置将在存储库更新后继续有效。
# Copy the example file
cp .env.example .env
# Edit with your preferred settings
# Examples in .env:
ACESTEP_CONFIG_PATH=acestep-v15-turbo
ACESTEP_LM_MODEL_PATH=acestep-5Hz-lm-1.7B
PORT=7860
LANGUAGE=en📖 脚本配置和自定义: 英语 | 中文 | 日本语
📚 文档
使用指南
| 方法 | 描述 | 文档 |
|---|---|---|
| 🖥️ Gradio Web用户界面 | 用于音乐生成的交互式web界面 | 指南 |
| 🎚️ 工作室UI | 可选HTML前端(类似DAW) | 指南 |
| 🎛️ VST3 MVP架构 | 建议的DAW插件架构和范围 | 指南 |
| 🐍 Python API | 程序化集成访问 | 指南 |
| 🌐 REST API | 用于服务的基于HTTPs的异步API | 指南 |
| ⌨️ 命令行界面 | 交互式向导和配置 | 指南 |
| 🤖 MCP服务器 | 克劳德代码/光标工具集成 | 指南 |
设置和配置
多语言文档
📖 教程
🎯 必读: ACE Step 1.5的设计理念和使用方法的综合指南。
本教程涵盖:心智模型和设计哲学、模型架构和选择、输入控制(文本和音频)、推理超参数、随机因素和优化策略。
🔨 火车
📖 LoRA培训教程 --涵盖数据准备、注释、预处理和培训的分步指南:
另请参见 LoRA培训 Gradio UI中的选项卡,用于一键式培训,或 Gradio指南-LoRA培训 供用户界面参考。
🏗️ 建筑
🦁 模型动物园
DiT模型
|DiT模型|预训练|SFT|RL|CFG|步骤|参考音频|Text2Music|封面|重新涂漆|提取|乐高|完整|质量|多样性|精细可调性|拥抱面部| |-----------|:------------:|:---:|:--:|:---:|:----:|:-----------:|:----------:|:-----:|:-------:|:-------:|:----:|:--------:|:-------:|:---------:|:---------------:|--------------| | acestep-v15-base | ✅ | ❌ | ❌ | ✅ | 50 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | 中等|高|简单| 链接 | | acestep-v15-sft | ✅ | ✅ | ❌ | ✅ | 50 | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ❌ | 高|中|易| 链接 | | acestep-v15-turbo | ✅ | ✅ | ❌ | ❌ | 8.✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ❌ | 非常高|中等|中等| 链接 | | acestep-v15-turbo-rl | ✅ | ✅ | ✅ | ❌ | 8.✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ❌ | 非常高|中等|中等|待发布|
LM型号
|LM模型|预训练|预训练|SFT|RL|CoT元|查询重写|音频理解|作曲能力|复制旋律|拥抱面部| |----------|---------------|:------------:|:---:|:--:|:---------:|:-------------:|:-------------------:|:----------------------:|:-----------:|--------------| | acestep-5Hz-lm-0.6B |Qwen3-0.6B |✅ | ✅ | ✅ | ✅ | ✅ | 中等|中等|弱|✅ | | acestep-5Hz-lm-1.7B |问题3-1.7B |✅ | ✅ | ✅ | ✅ | ✅ | 中等|中等|中等✅ | | acestep-5Hz-lm-4B |Qwen3-4B |✅ | ✅ | ✅ | ✅ | ✅ | 强|强|强✅ |
🔬 基准
ACE步骤1.5包括 profile_inference.py,一种分析和基准测试工具,用于测量设备和配置之间的LLM、DiT和VAE时序。
python profile_inference.py # Single-run profile
python profile_inference.py --mode benchmark # Configuration matrix📖 完整指南 (所有模式、CLI选项、输出解释): 英语 | 中文
📜 许可与免责声明
该项目已获得许可 麻省理工学院
ACE Step支持跨不同流派的原创音乐创作,并应用于创意制作、教育和娱乐。虽然旨在支持积极和艺术的用例,但我们承认潜在的风险,例如由于风格相似而导致的无意侵犯版权、文化元素的不恰当混合以及滥用以生成有害内容。为确保负责任的使用,我们鼓励用户验证生成作品的原创性,明确披露人工智能的参与,并在改编受保护的风格或材料时获得适当的许可。通过使用ACE Step,您同意遵守这些原则,尊重艺术完整性、文化多样性和法律合规性。作者不对任何滥用该模型的行为负责,包括但不限于侵犯版权、文化不敏感或产生有害内容。
🔔 重要通知\ ACE Step项目的唯一官方网站是我们的GitHub Pages网站。\ 我们不运营任何其他网站。\ 🚫 假冒域名包括但不限于: ac\*\*p.com、a\*\*p.org、a\*\*c.org\ ⚠️ 请小心。不要访问、信任或支付任何这些网站。
🌐 社区与生态系统
结账 卓越的ACE步骤 --围绕ACE Step构建的社区项目、替代UI、ComfyUI节点、云部署、培训工具等的精选列表。
🙏 致谢
该项目由ACE工作室和StepFun共同领导。
📖 引用
如果你发现这个项目对你的研究有用,请考虑引用:
@misc{gong2026acestep,
title={ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation},
author={Junmin Gong, Yulin Song, Wenxiao Zhao, Sen Wang, Shengyuan Xu, Jing Guo},
howpublished={\url{https://github.com/ace-step/ACE-Step-1.5}},
year={2026},
note={GitHub repository}
}