Token导航 LogoToken导航TokenDH.com
Audio MCP logo
音视频stdio官方级别未说明来源级核验

Audio MCP

MCP Server

一款用于专业音频处理、分析和语音音乐同步的模型上下文协议(MCP)服务器,支持生成广播级音频内容。

工具数

15

提示词数

0

GitHub Stars

0

资源数

0
音频处理Python语音音频

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

bladina-dev

提供方

bladina-dev

最后核验

2026/5/17 20:21

运行时

Python

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

python3 -m venv venv

详细介绍

🎧 音频MCP服务器

A. 模型上下文协议(MCP)服务器 用于专业音频处理、分析和语音音乐同步——由Python(librosa、numpy、Whisper)和TypeScript MCP包装器提供支持。

为AI编码代理构建,以编程方式创建广播就绪的音频内容。

✨ 特性

🎵 核心音频工具(1-8)

工具说明
audio_generate_music按程序生成免版税的背景音乐(环境垫、低保真)
audio_mix_with_ducking将画外音+音乐与智能音量切换相结合
audio_transcribe通过OpenAI Whisper进行单词级时间戳转录
audio_time_stretch在保持音调的同时延长音频/视频的时间
audio_analyze分析音频元数据:持续时间、BPM、RMS、采样率
audio_normalize符合平台响度标准(Spotify、YouTube、TikTok等)
audio_format_convert通过比特率控制在WAV、MP3、AAC、OGG、FLAC之间进行转换
audio_eq带预设的参数均衡器(语音清晰度、温感、去感、播客)

🎼 语音音乐同步工具(9-15)

工具说明
audio_beat_grid使用HPSS+librosa提取精确的节拍时间戳
audio_speech_timestamps通过Whisper交叉注意力进行单词级语音计时
audio_prosody_analyze语言节奏分析(n-PVI,重音模式,阿拉伯语支持)
audio_dtw_align语音和音乐节拍之间的动态时间扭曲对齐
audio_formant_stretch蚁类保存时间延长(无花栗鼠效应)
audio_beat_drop_detect为社交媒体编辑寻找高能量的影响时刻
audio_artisan_mix通过智能闪避技术生成具有身体感知的音乐

🏗 建筑

audio-mcp/
├── src/
│   └── index.ts          # MCP server — tool definitions + Python runner
├── python/
│   ├── audio_analyze.py          # Audio metadata analysis
│   ├── audio_normalize.py        # LUFS loudness normalization
│   ├── audio_eq.py               # Parametric EQ engine
│   ├── audio_format_convert.py   # Format conversion (via pydub/ffmpeg)
│   ├── audio_beat_grid.py        # Beat tracking (HPSS + librosa)
│   ├── audio_speech_timestamps.py# Word-level timestamps (Whisper)
│   ├── audio_prosody_analyze.py  # Linguistic prosody (n-PVI)
│   ├── audio_dtw_align.py        # Dynamic Time Warping alignment
│   ├── audio_formant_stretch.py  # Formant-preserving stretch
│   ├── audio_beat_drop_detect.py # Energy drop detection
│   ├── artisan_sync_mixer.py     # Prosody-aware music mixer
│   ├── generate_music.py         # Lo-fi music generator
│   ├── generate_ideal.py         # Ambient pad music generator
│   ├── generate_captions.py      # Whisper captioning
│   ├── rhythmic_audio_mixer.py   # Voice+music ducking mixer
│   ├── time_stretch_video.py     # Video time-stretch
│   └── requirements.txt          # Python dependencies
├── package.json
└── tsconfig.json

🚀 设置

先决条件

  • Node.js ≥ 18
  • python ≥ 3.10
  • FFmpeg (用于格式转换)

安装

# Clone the repo
git clone https://github.com/YOUR_USERNAME/audio-mcp.git
cd audio-mcp

# Install Node dependencies
npm install

# Set up Python venv
cd python
python3 -m venv venv
source venv/bin/activate
pip install -r requirements.txt
cd ..

# Build TypeScript
npm run build

配置MCP客户端

添加到您的MCP配置中(例如,双子座/反重力/克劳德):

{
  "mcpServers": {
    "audio-mcp": {
      "command": "node",
      "args": ["/path/to/audio-mcp/dist/index.js"]
    }
  }
}

📖 用法

连接后,您的AI代理可以使用15个工具中的任何一个。工作流程示例:

1. audio_analyze        → Get BPM, duration of speech clip
2. audio_speech_timestamps → Extract word-level timing
3. audio_prosody_analyze   → Analyze speech rhythm (n-PVI)
4. audio_generate_music    → Create matching background music
5. audio_beat_grid         → Extract beat grid from music
6. audio_dtw_align         → Align speech to music beats
7. audio_formant_stretch   → Stretch speech to fit alignment
8. audio_mix_with_ducking  → Final mix with ducking
9. audio_normalize         → Normalize for target platform
10. audio_format_convert   → Export as MP3

🎯 平台响度标准

平台目标LUFS
Spotify-14
YouTube-14
尝试-14
Instagram-14
播客-16
广播(EBU R128)-23

📄 许可证

麻省理工学院

目录标签

目录标签

音频处理Python语音音频本地部署语音分析音乐同步音频生成语音音乐同步

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Python

工具数量(toolCount,工具数)

15

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP