本地AI生成MCP服务器(local_ai_gen)
此项目运行一个本地MCP(模型上下文协议)服务器,该服务器提供以下工具:
- 文本到图像
- 文本转音乐/音频
- 文本转语音
- 图像/文本到3D模型
模型使用
- 图像生成:
segmind/SSD-1B
*一个快速、精炼的SDXL版本,在消费级GPU上运行良好。*
- 音乐发生器:
stabilityai/stable-audio-open-1.0
*一个高质量的开放式模型,用于生成声音效果、短音乐曲目和环境音频。* *(注意:需要接受许可条款)*
- 语音生成:
Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice
*一个强大的多语言文本到语音模型。*
- 3D生成:
stabilityai/TripoSR
*一种用于图像到3D重建的快速前馈模型。*
需求
- Python 3.10+
- NVIDIA GPU(建议使用8GB+VRAM,以确保一切运行顺畅)
- 拥抱脸用户访问令牌 (为
stable-audio-open-1.0)
完整安装指南
1.制备和拥抱面部基因改造
这 稳定音频打开 模型是封闭的,要求您在下载之前接受其许可证。
- 首选 稳定性i/稳定的音频输出-1.0 在拥抱的脸上。
- 登录并单击 接受条款/许可.
- 在您的 拥抱面部设置.
- 在本地运行Hugging Face CLI登录:
pip install -U "huggingface_hub"
hf auth*(在提示时粘贴您的令牌。您不需要将其添加为git凭据)。*
2.环境安装
python -m venv .venv
source .venv/bin/activate
python setup.py什么 python setup.py 做:
- 创建输出目录(
generated_images,generated_audio,generated_models,models) - 克隆
third_party/TripoSR如果它不见了 - 安装以下所有内容
requirements.txt - 编译和安装
torchmcubes与您的活动火炬版本(3D生成所需)相比 - 安装
flash-attn.
运行MCP服务器
要手动运行MCP服务器(通过标准I/O):
python mcp_server/main.py*注意:任何特定工具的第一次运行都会变慢,因为它必须将该模型的权重下载到您的拥抱脸缓存中。*
冒烟测试
您可以运行附带的烟雾测试脚本来验证所有模型是否正常工作:
python smoke_test_generate.pyMCP工具暴露
generate_imagegenerate_audiogenerate_speechgenerate_3d_modelhealth_check
备注
- 生成的文件将写入
generated_images,generated_audio,以及generated_models默认情况下。 - 对于
generate_audio和generate_speech,您可以用以下命令覆盖目标: - 工具arg
output_dir(最高优先级),或 - env 是
GENAI_OUTPUT_AUDIO_DIR - 对于
generate_image,使用工具arg覆盖目标output_dir或环境变量GENAI_OUTPUT_IMAGE_DIR - 对于
generate_3d_model,使用工具arg覆盖目标output_dir或环境变量GENAI_OUTPUT_MODEL_DIR
与MCP客户端(光标、克劳德桌面等)一起使用
要在MCP兼容客户端中使用此服务器,请将以下内容添加到您的 mcp.json (或您客户端的相应MCP配置文件)。确保更换 `` 使用克隆此存储库的绝对路径:
{
"mcpServers": {
"local_ai_gen": {
"command": "/.venv/bin/python",
"args": [
"/mcp_server/main.py"
],
"env": {}
}
}
}