高级TTS MCP服务器
一个具有原生TypeScript实现的高质量、功能丰富的文本到语音MCP服务器。专为需要自然、富有表现力的语音合成的专业应用而设计,具有高级控制和零外部依赖性。
✨ 特性
🎯 高级语音控制
- 10高品质的声音 -具有鲜明个性的男性和女性声音
- 情绪控制 -中立、快乐、兴奋、冷静、严肃、随意、自信
- 动态起搏 -自然、对话、演示、教程、叙事模式
- 速度和音量 -从0.25倍到3.0倍的速度、0.1倍到2.0倍的音量进行精确控制
🚀 专业能力
- 流式音频 -实时合成和回放
- 批处理 -高效处理多个文本段
- 多种格式 -支持WAV、MP3、FLAC、OGG输出
- 自然语音增强 -自动暂停插入和情绪标记
- 队列管理 -处理多个并发请求
🔧 MCP集成
- 6强大的工具 -完整的合成、批处理、语音管理
- 2资源丰富 -语音功能和使用示例
- 实时状态 -跟踪处理进度并管理请求
- 文件管理 -保存、列出和组织音频输出
🚀 快速开始
选项1:部署到Smithery.ai(推荐)
🎯 一键部署到Smithery平台
- 立即部署:参观 Smithery.ai 并导入此存储库
- 配置:设置您的首选语音和讲话设置
- 立即使用:通过Claude Desktop或任何兼容MCP的客户端访问
优点:
- ✅ 需要零设置
- ✅ 自动缩放和更新
- ✅ 无需下载模型
- ✅ 企业级主机
选项2:本地安装
先决条件:
- Node.js 18+
安装:
- 克隆存储库
git clone https://github.com/samihalawa/advanced-tts-mcp.git
cd advanced-tts-mcp- 安装依赖项
npm install- 配置Claude桌面
添加到您的 claude_desktop_config.json:
{
"mcpServers": {
"advanced-tts": {
"command": "node",
"args": ["dist/index.js"],
"cwd": "/path/to/advanced-tts-mcp"
}
}
}- 开始使用!
# Build TypeScript
npm run build
# Start server
npm start重新启动Claude Desktop,开始合成自然、富有表现力的声音。
🎙️ 可用声音
| 语音ID | 姓名 | 性别 | 描述 |
|---|---|---|---|
af_heart | 心形 | 女性 | 温暖友好的声音(默认) |
af_sky | 天空 | 女性 | 清澈明亮的声音 |
af_bella | 贝拉 | 女 | 优雅、精致的嗓音 |
af_sarah | Sarah | 女 | 专业、自信的嗓音 |
af_nicole | 妮可 | 女 | 温柔舒缓的声音 |
am_adam | Adam | 男 | 强有力、权威的声音 |
am_michael | Michael | 男 | 友善、平易近人的声音 |
bf_emma | Emma | 女 | 声音年轻、充满活力 |
bf_isabella | 伊莎贝拉 | 女 | 成熟、富有表现力的声音 |
bm_lewis | Lewis | 男 | 低沉洪亮的嗓音 |
📚 使用示例
基础合成
# Simple text-to-speech
await synthesize_speech(
text="Hello! Welcome to Advanced TTS.",
voice_id="af_heart"
)情绪表达
# Excited announcement
await synthesize_speech(
text="This is amazing news! You're going to love this new feature!",
voice_id="af_heart",
emotion="excited",
pacing="conversational",
speed=1.1
)专业演示
# Tutorial narration
await synthesize_speech(
text="Step one: Open your browser. Step two: Navigate to the website.",
voice_id="am_adam",
emotion="calm",
pacing="tutorial",
speed=0.9
)批处理
# Multiple segments with pauses
await batch_synthesize(
segments=[
"Welcome to our presentation.",
"Today we'll cover three main topics.",
"Let's begin with the first topic."
],
voice_id="af_sarah",
emotion="confident",
pacing="presentation",
merge_output=True,
segment_pause=1.0,
save_file=True
)🛠️ 可用工具
synthesize_speech
将文本转换为自然语音,完全控制语音特征。
参数:
text-要合成的文本(最多10000个字符)voice_id-语音选择(见上表)speed-语速(0.25-3.0)emotion-声音情感(中性、快乐、兴奋、冷静、严肃、随意、自信)pacing-演讲风格(自然、对话、演示、教程、叙事、快、慢)volume-音量(0.1-2.0)output_format-文件格式(wav、mp3、flac、ogg)save_file-保存到文件(布尔值)filename-自定义文件名
batch_synthesize
通过可选的合并有效地处理多个文本段。
参数:
segments-文本段列表merge_output-合并为单个文件segment_pause-分段之间暂停(0.0-5.0秒)- 上述所有合成参数
get_voices
检索完整的语音信息和功能。
get_status
检查合成请求的处理状态。
cancel_request
取消当前正在进行的合成操作。
list_output_files
使用元数据浏览已保存的音频文件。
🎛️ 语音控制
情感
- 中性 -标准、专业的语调
- 快乐 -乐观、开朗的表情
- 兴奋 -热情、充满活力的交付
- 平静 -轻松舒缓的语调
- 严肃的 -正式、权威的交付
- 随意 -轻松、健谈的风格
- 自信的 -自信、专业的语气
起搏风格
- 自然的 -平衡、人性化的节奏
- 对话式 -随意的讨论节奏
- 演示 -专业口语节奏
- 教程 -教育,清晰的交付
- 叙述 -讲故事的节奏
- 快速 -快速交货(1.2倍基本速度)
- 慢 -故意交付(0.8倍基本速度)
🎵 音频格式
| 格式 | 质量 | 用例 |
|---|---|---|
| 铃声 | 未压缩 | 最高质量,可编辑 |
| MP3文件 | 压缩 | 网络、流媒体、共享 |
| 弗拉克 | 无损 | 档案级、高质量存储 |
| 铃声 | 压缩 | 开源替代方案 |
🔧 配置
环境变量
# Model paths (optional)
KOKORO_MODEL_PATH=./kokoro-v1.0.onnx
KOKORO_VOICES_PATH=./voices-v1.0.bin
# Output settings
TTS_OUTPUT_DIR=./audio_output
TTS_MAX_QUEUE_SIZE=100
# Audio settings
TTS_DEFAULT_VOICE=af_heart
TTS_ENABLE_STREAMING=true服务器配置
config = ServerConfig(
model_path="./kokoro-v1.0.onnx",
voices_path="./voices-v1.0.bin",
output_dir="./audio_output",
max_queue_size=100,
enable_streaming=True,
default_voice="af_heart"
)🏗️ 建筑
├── src/advanced_tts/
│ ├── __init__.py # Package initialization
│ ├── server.py # MCP server implementation
│ ├── engine.py # Kokoro TTS engine wrapper
│ ├── models.py # Data models and validation
│ └── utils.py # Utility functions
├── pyproject.toml # Project configuration
├── README.md # Documentation
└── LICENSE # MIT License🤝 贡献
欢迎投稿!需要改进的地方:
- 其他语音模型
- 实时流媒体合成
- 高级音频效果
- 多语言支持
- 性能优化
📄 许可证
MIT许可证-请参阅 许可证 了解详情。
🙏 致谢
- 科科罗TTS -高质量神经语音合成
- MCP协议 -无缝的AI模型集成
- FastMCP -高效的服务器框架
______________________________________________________________________
由开发 萨米·哈拉瓦
*使用Advanced TTS MCP Server将您的文本转换为自然、富有表现力的语音。*
