Token导航 LogoToken导航TokenDH.com
local image and music generation logo
音视频stdio官方级别未说明来源级核验

local image and music generation

MCP Server

本地运行的AI生成服务器,支持文本到图像、音乐、语音及3D模型的转换。

工具数

5

提示词数

0

GitHub Stars

1

资源数

0
AI生成Python语音音频

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

davidemodolo

提供方

davidemodolo

最后核验

2026/5/17 20:22

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install -U "huggingface_hub"

详细介绍

本地AI生成MCP服务器(local_ai_gen)

此项目运行一个本地MCP(模型上下文协议)服务器,该服务器提供以下工具:

  1. 文本到图像
  2. 文本转音乐/音频
  3. 文本转语音
  4. 图像/文本到3D模型

模型使用

  • 图像生成: segmind/SSD-1B

*一个快速、精炼的SDXL版本,在消费级GPU上运行良好。*

  • 音乐发生器: stabilityai/stable-audio-open-1.0

*一个高质量的开放式模型,用于生成声音效果、短音乐曲目和环境音频。* *(注意:需要接受许可条款)*

  • 语音生成: Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

*一个强大的多语言文本到语音模型。*

  • 3D生成: stabilityai/TripoSR

*一种用于图像到3D重建的快速前馈模型。*

需求

  • Python 3.10+
  • NVIDIA GPU(建议使用8GB+VRAM,以确保一切运行顺畅)
  • 拥抱脸用户访问令牌 (为 stable-audio-open-1.0)

完整安装指南

1.制备和拥抱面部基因改造

稳定音频打开 模型是封闭的,要求您在下载之前接受其许可证。

  1. 首选 稳定性i/稳定的音频输出-1.0 在拥抱的脸上。
  2. 登录并单击 接受条款/许可.
  3. 在您的 拥抱面部设置.
  4. 在本地运行Hugging Face CLI登录:
   pip install -U "huggingface_hub"
   hf auth

*(在提示时粘贴您的令牌。您不需要将其添加为git凭据)。*

2.环境安装

python -m venv .venv
source .venv/bin/activate
python setup.py

什么 python setup.py 做:

  1. 创建输出目录(generated_images, generated_audio, generated_models, models)
  2. 克隆 third_party/TripoSR 如果它不见了
  3. 安装以下所有内容 requirements.txt
  4. 编译和安装 torchmcubes 与您的活动火炬版本(3D生成所需)相比
  5. 安装 flash-attn.

运行MCP服务器

要手动运行MCP服务器(通过标准I/O):

python mcp_server/main.py

*注意:任何特定工具的第一次运行都会变慢,因为它必须将该模型的权重下载到您的拥抱脸缓存中。*

冒烟测试

您可以运行附带的烟雾测试脚本来验证所有模型是否正常工作:

python smoke_test_generate.py

MCP工具暴露

  • generate_image
  • generate_audio
  • generate_speech
  • generate_3d_model
  • health_check

备注

  • 生成的文件将写入 generated_images, generated_audio,以及 generated_models 默认情况下。
  • 对于 generate_audiogenerate_speech,您可以用以下命令覆盖目标:
  • 工具arg output_dir (最高优先级),或
  • env 是 GENAI_OUTPUT_AUDIO_DIR
  • 对于 generate_image,使用工具arg覆盖目标 output_dir 或环境变量 GENAI_OUTPUT_IMAGE_DIR
  • 对于 generate_3d_model,使用工具arg覆盖目标 output_dir 或环境变量 GENAI_OUTPUT_MODEL_DIR

与MCP客户端(光标、克劳德桌面等)一起使用

要在MCP兼容客户端中使用此服务器,请将以下内容添加到您的 mcp.json (或您客户端的相应MCP配置文件)。确保更换 `` 使用克隆此存储库的绝对路径:

{
  "mcpServers": {
    "local_ai_gen": {
      "command": "/.venv/bin/python",
      "args": [
        "/mcp_server/main.py"
      ],
      "env": {}
    }
  }
}

目录标签

目录标签

AI生成Python语音音频本地部署文本转图像文本转音乐文本转语音图像转3D

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

5

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP