Token导航 LogoToken导航TokenDH.com
Ace Step 1 5 logo
音视频stdio官方级别未说明来源级核验

Ace Step 1 5

MCP Server

ACE-Step v1.5是一款高效的开源音乐基础模型,可在消费级硬件上实现商业级音乐生成,支持多种风格和多语言歌词。

工具数

0

提示词数

0

GitHub Stars

0

资源数

0
PythonClaude语音音频Claude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

PiMPStudios

提供方

PiMPStudios

最后核验

2026/5/17 20:21

运行时

Python

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

uv run acestep

详细介绍

ACE-Step 1.5

Pushing the Boundaries of Open-Source Music Generation

Project | Hugging Face | ModelScope | Space Demo | Discord | Technical Report | Awesome ACE-Step

目录

📝 摘要

🚀 我们介绍ACE Step v1.5,这是一个高效的开源音乐基础模型,为消费硬件带来了商业级的生成。在常用的评估指标上,ACE Step v1.5的质量超越了大多数商业音乐型号,同时保持了极快的速度——在A100上每首完整歌曲不到2秒,在RTX 3090上不到10秒。该模型在本地运行,VRAM不到4GB,并支持轻量级个性化:用户可以从几首歌曲中训练LoRA来捕捉自己的风格。

🌉 其核心是一种新颖的混合架构,其中语言模型(LM)充当一个全能的规划者:它将简单的用户查询转换为全面的歌曲蓝图——从短循环扩展到10分钟的作品——同时通过思维链合成元数据、歌词和字幕,以指导扩散转换器(DiT)。 ⚡ 独特的是,这种对齐是通过仅依赖模型内部机制的内在强化学习实现的,从而消除了外部奖励模型或人类偏好中固有的偏见。 🎚️

🔮 除了标准合成之外,ACE Step v1.5还将精确的风格控制与多功能编辑功能相结合,如封面生成、重新绘制和声音到背景音乐的转换,同时严格遵守50多种语言的提示。这为无缝集成到音乐艺术家、制作人和内容创作者的创作工作流程中的强大工具铺平了道路。 🎸

✨ 特性

⚡ 演出

  • 超高速一代 --A100上每首完整歌曲不超过2秒,RTX 3090上不超过10秒(A100上为0.5秒至10秒,具体取决于思考模式和扩散步骤)
  • 灵活的持续时间 --支持10秒至10分钟(600秒)的音频生成
  • 批量生成 --最多可同时生成8首歌曲

🎵 发电质量

  • 商业级产量 --质量超越大多数商业音乐型号(介于Suno v4.5和Suno v5之间)
  • 丰富的风格支持 --1000多种乐器和风格,具有细腻的音色描述
  • 多语言歌词 --支持50多种语言,歌词提示用于结构和风格控制

🎛️ 多功能性和控制

特性描述
✅ 参考音频输入使用参考音频指导生成风格
✅ 封面生成从现有音频创建封面
✅ 重新绘制和编辑选择性本地音频编辑和再生
✅ 音轨分离将音频分离为单独的词干
✅ 多轨道生成添加图层,如Suno Studio的“添加图层”功能
✅ Vocal2BGM自动为声乐曲目生成伴奏
✅ 元数据控制控制持续时间、BPM、密钥/规模、时间签名
✅ 简单模式根据简单描述生成完整歌曲
✅ 查询重写标签和歌词的自动LM扩展
✅ 音频理解从音频中提取BPM、按键/比例、时间特征和字幕
✅ LRC生成为生成的音乐自动生成歌词时间戳
✅ LoRA培训Gradio中的一键注释和培训。8首歌曲,3090(12GB VRAM)播放1小时
✅ 质量评分生成音频的自动质量评估
✅ MCP服务器通过模型上下文协议集成Claude代码/游标工具

🔔 保持领先

在GitHub上启动ACE Step,并立即收到新版本的通知 ![](assets/star.gif)

🤝 伙伴

⚡ 快速开始

要求: Python 3.11-3.12,推荐CUDA GPU(也支持MPS/ROCm/Intel XPU/CPU) 注: Windows上的ROCm需要Python 3.12(AMD官方只提供Python 3.12轮子)
# 1. Install uv
curl -LsSf https://astral.sh/uv/install.sh | sh          # macOS / Linux
# powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"  # Windows

# 2. Clone & install
git clone https://github.com/ACE-Step/ACE-Step-1.5.git
cd ACE-Step-1.5
uv sync

# 3. Launch Gradio UI (models auto-download on first run)
uv run acestep

# Or launch REST API server
uv run acestep-api

打开http://localhost:7860(Gradio)或http://localhost:8001API

📖 完整安装指南 (AMD/ROCm、英特尔GPU、CPU、环境变量、命令行选项): 英语 | 中文 | 日本语

💡 我应该选择哪种型号?

您的GPU VRAM推荐的LM型号后端注意事项
≤6GB无(仅DiT)--LM默认禁用;INT8量化+完全CPU卸载
6-8GBacestep-5Hz-lm-0.6Bpt带有PyTorch后端的轻量级LM
8-16GBacestep-5Hz-lm-0.6B / 1.7Bvllm8-12GB为0.6B,12-16GB为1.7B
16-24GBacestep-5Hz-lm-1.7Bvllm4B在20GB+上可用;20GB+无需卸载
≥24GBacestep-5Hz-lm-4Bvllm质量最好,所有型号都适合,无需卸载

UI会自动为GPU选择最佳配置。所有设置(LM模型、后端、卸载、量化)都是分层感知和预配置的。

📖 GPU兼容性详细信息: 英语 | 中文 | 日本语 | 韩语

🚀 启动脚本

适用于所有平台的即用型启动脚本,具有自动环境检测、更新检查和依赖关系安装功能。

平台脚本后端
视窗start_gradio_ui.bat, start_api_server.batCUDA
Windows(ROCm)start_gradio_ui_rocm.bat, start_api_server_rocm.batAMD ROCm
Linuxstart_gradio_ui.sh, start_api_server.shCUDA
macOSstart_gradio_ui_macos.sh, start_api_server_macos.shMLX(苹果硅)
# Windows
start_gradio_ui.bat

# Linux
chmod +x start_gradio_ui.sh && ./start_gradio_ui.sh

# macOS (Apple Silicon)
chmod +x start_gradio_ui_macos.sh && ./start_gradio_ui_macos.sh

⚙️ 自定义启动设置

推荐: 创建一个 .env 文件以自定义模型、端口和其他设置。你的 .env 配置将在存储库更新后继续有效。

# Copy the example file
cp .env.example .env

# Edit with your preferred settings
# Examples in .env:
ACESTEP_CONFIG_PATH=acestep-v15-turbo
ACESTEP_LM_MODEL_PATH=acestep-5Hz-lm-1.7B
PORT=7860
LANGUAGE=en
📖 脚本配置和自定义: 英语 | 中文 | 日本语

📚 文档

使用指南

方法描述文档
🖥️ Gradio Web用户界面用于音乐生成的交互式web界面指南
🎚️ 工作室UI可选HTML前端(类似DAW)指南
🎛️ VST3 MVP架构建议的DAW插件架构和范围指南
🐍 Python API程序化集成访问指南
🌐 REST API用于服务的基于HTTPs的异步API指南
⌨️ 命令行界面交互式向导和配置指南
🤖 MCP服务器克劳德代码/光标工具集成指南

设置和配置

主题文档
📦 安装(所有平台)英语中文日本语
🎮 GPU兼容性英语中文日本语
🔧 GPU故障排除英语
🔬 基准和分析英语中文

多语言文档

语言APIGradio推理教程LoRA培训安装基准
🇺🇸 英语链接链接链接链接链接链接链接
🇨🇳 中文链接链接链接链接链接链接链接
🇯🇵日本语链接链接链接链接链接链接
🇰🇷 韩语 链接链接链接链接链接

📖 教程

🎯 必读: ACE Step 1.5的设计理念和使用方法的综合指南。

语言链接
🇺🇸 英语英文辅导
🇨🇳 中文中文教程
🇯🇵日本语日语教程

本教程涵盖:心智模型和设计哲学、模型架构和选择、输入控制(文本和音频)、推理超参数、随机因素和优化策略。

🔨 火车

📖 LoRA培训教程 --涵盖数据准备、注释、预处理和培训的分步指南:

语言链接
🇺🇸 英语LoRA培训教程
🇨🇳 中文LoRA 训练教程
🇯🇵日本语培训教程
🇰🇷 韩语 LoRA学习教程

另请参见 LoRA培训 Gradio UI中的选项卡,用于一键式培训,或 Gradio指南-LoRA培训 供用户界面参考。

🏗️ 建筑

🦁 模型动物园

DiT模型

|DiT模型|预训练|SFT|RL|CFG|步骤|参考音频|Text2Music|封面|重新涂漆|提取|乐高|完整|质量|多样性|精细可调性|拥抱面部| |-----------|:------------:|:---:|:--:|:---:|:----:|:-----------:|:----------:|:-----:|:-------:|:-------:|:----:|:--------:|:-------:|:---------:|:---------------:|--------------| | acestep-v15-base | ✅ | ❌ | ❌ | ✅ | 50 | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | ✅ | 中等|高|简单| 链接 | | acestep-v15-sft | ✅ | ✅ | ❌ | ✅ | 50 | ✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ❌ | 高|中|易| 链接 | | acestep-v15-turbo | ✅ | ✅ | ❌ | ❌ | 8.✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ❌ | 非常高|中等|中等| 链接 | | acestep-v15-turbo-rl | ✅ | ✅ | ✅ | ❌ | 8.✅ | ✅ | ✅ | ✅ | ❌ | ❌ | ❌ | 非常高|中等|中等|待发布|

LM型号

|LM模型|预训练|预训练|SFT|RL|CoT元|查询重写|音频理解|作曲能力|复制旋律|拥抱面部| |----------|---------------|:------------:|:---:|:--:|:---------:|:-------------:|:-------------------:|:----------------------:|:-----------:|--------------| | acestep-5Hz-lm-0.6B |Qwen3-0.6B |✅ | ✅ | ✅ | ✅ | ✅ | 中等|中等|弱|✅ | | acestep-5Hz-lm-1.7B |问题3-1.7B |✅ | ✅ | ✅ | ✅ | ✅ | 中等|中等|中等✅ | | acestep-5Hz-lm-4B |Qwen3-4B |✅ | ✅ | ✅ | ✅ | ✅ | 强|强|强✅ |

🔬 基准

ACE步骤1.5包括 profile_inference.py,一种分析和基准测试工具,用于测量设备和配置之间的LLM、DiT和VAE时序。

python profile_inference.py                        # Single-run profile
python profile_inference.py --mode benchmark       # Configuration matrix
📖 完整指南 (所有模式、CLI选项、输出解释): 英语 | 中文

📜 许可与免责声明

该项目已获得许可 麻省理工学院

ACE Step支持跨不同流派的原创音乐创作,并应用于创意制作、教育和娱乐。虽然旨在支持积极和艺术的用例,但我们承认潜在的风险,例如由于风格相似而导致的无意侵犯版权、文化元素的不恰当混合以及滥用以生成有害内容。为确保负责任的使用,我们鼓励用户验证生成作品的原创性,明确披露人工智能的参与,并在改编受保护的风格或材料时获得适当的许可。通过使用ACE Step,您同意遵守这些原则,尊重艺术完整性、文化多样性和法律合规性。作者不对任何滥用该模型的行为负责,包括但不限于侵犯版权、文化不敏感或产生有害内容。

🔔 重要通知\ ACE Step项目的唯一官方网站是我们的GitHub Pages网站。\ 我们不运营任何其他网站。\ 🚫 假冒域名包括但不限于: ac\*\*p.com、a\*\*p.org、a\*\*c.org\ ⚠️ 请小心。不要访问、信任或支付任何这些网站。

🌐 社区与生态系统

结账 卓越的ACE步骤 --围绕ACE Step构建的社区项目、替代UI、ComfyUI节点、云部署、培训工具等的精选列表。

🙏 致谢

该项目由ACE工作室和StepFun共同领导。

📖 引用

如果你发现这个项目对你的研究有用,请考虑引用:

@misc{gong2026acestep,
	title={ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation},
	author={Junmin Gong, Yulin Song, Wenxiao Zhao, Sen Wang, Shengyuan Xu, Jing Guo}, 
	howpublished={\url{https://github.com/ace-step/ACE-Step-1.5}},
	year={2026},
	note={GitHub repository}
}

目录标签

目录标签

PythonClaude语音音频音乐生成本地部署开源模型AI音乐多语言支持轻量级个性化

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Python

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP