Token导航 LogoToken导航TokenDH.com
Voiceforge MCP logo
音视频未说明官方级别未说明来源级核验

Voiceforge MCP

MCP Server

VoiceForge MCP是一个语音AI开发工具,提供推荐、基准测试和搭建STT+LLM+TTS堆栈的功能,适用于企业级语音AI开发。

工具数

8

提示词数

0

GitHub Stars

0

资源数

0
JavaScriptClaude语音音频Claude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

beknazar

提供方

beknazar

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

voiceforge mcp

用于语音AI开发的MCP服务器。推荐、基准测试和脚手架STT+LLM+TTS堆栈——由企业规模4年语音人工智能的生产数据提供支持。

安装

claude mcp add voiceforge-mcp -- npx -y voiceforge-mcp

就是这样。Claude Code现在可以访问所有VoiceForge工具。

工具

voiceforge_recommend

为您的语言和用例获得最佳的STT+LLM+TTS组合。 您可以通过以下方式请求结构化输出 output_format: "json" 为了实现自动化。

"What's the best voice stack for Thai debt collections?"
→ Deepgram nova-3 → ElevenLabs eleven-turbo → ElevenLabs eleven_v3
  142ms latency | 4.1/5 quality | $0.004/min

voiceforge_benchmark

浏览所有测试的组合,包括延迟、质量和成本数据。按语言或提供商筛选。 支持 output_format: "markdown" | "json" 为了实现自动化。

voiceforge_compare

并排比较两个堆栈:延迟、质量、成本和语言覆盖率。 combo_a/combo_b 仅支持提供者或提供者+模型语法。 当仅使用提供者并且多个基准行匹配时,将选择得分最高的匹配项。

示例:

  • combo_a: "Deepgram + OpenAI + Cartesia"
  • combo_b: "Deepgram nova-3 + OpenAI gpt-4.1-mini + Cartesia sonic-3"

voiceforge_scaffold

使用推荐的堆栈生成完整的语音AI项目。

  • LiveKit代理 python agent.py, requirements.txt, voiceforge.yaml, .env
  • Next.js+ElevenLabs (TypeScript)-语音小部件组件,env配置(目前基于ElevenLabs的MVP)

voiceforge_validate

根据基准覆盖率和可搭建性验证自定义堆栈(提供者+模型元组)。 模型名称根据已知的提供者目录进行验证;不支持的值返回明确的建议。

在投球/现场演示之前使用此功能,以便YC评审员可以验证候选堆栈是否真实且可运行。

voiceforge_providers

列出所有支持的提供商:Deepgram、ElevenLabs、Cartesia、OpenAI、Anthropic、谷歌、Groq、AssemblyAI、Speechmatics、PlayHT、Rime。

voiceforge_config

使用管道设置、质量目标和监控阈值生成生产就绪的YAML配置。 支持 output_format: "markdown" | "json" 以及提供商/模型净化。

voiceforge_health

面试前使用,一目了然地表明准备就绪:

  • 可用基准行总数
  • 语言支持和框架覆盖
  • 表现最好的总结(最快、质量最好、最便宜)
  • 健康产出包括 data_snapshot 用于可重复的演示证据

YC演示清单

  1. voiceforge_health 并保存输出。
  2. 保持 voiceforge_health {"output_format":"json"} 在YC审核截图的最终提交文件夹中输出。
  3. voiceforge_recommend 对于您的顶级用例,请使用 output_format: "json".
  4. voiceforge_validate 在录制前的最后一张纸上。
  5. voiceforge_scaffold 并共享生成的启动文件/屏幕截图。
  6. voiceforge_providersvoiceforge_config 提交前提供一页证据。

YC演示脚本

voiceforge_health {"output_format":"json"}
voiceforge_recommend {"language":"English","use_case":"customer-support","output_format":"json"}
voiceforge_validate {"stt_provider":"Deepgram","stt_model":"nova-3","llm_provider":"OpenAI","llm_model":"gpt-4.1-mini","tts_provider":"Cartesia","tts_model":"sonic-3","framework":"livekit","output_format":"json"}
voiceforge_scaffold {"language":"English","use_case":"customer-support","framework":"livekit","output_format":"json"}

稳定性改进

  • 规范规范化现在可以处理提供者别名,并避免不明确的部分匹配。
  • 用例别名被规范化(customer support, debt collections等等)。
  • 脚手架输出现在对文件系统友好的代理名称是安全的。
  • 未知的提供程序/语言筛选器返回可操作的支持值提示。
  • voiceforge_compare 现在解析提供者+模型元组,并在需要时返回歧义元数据。

基准数据

从生产企业部署中测试了12种跨10种语言的STT+LLM+TTS组合。

度量范围
延迟142毫秒--287毫秒
质量4.0--4.8 UTMOS
成本0.004--0.022/分钟
语言10(英语、泰语、越南语、日语、韩语等)

为什么选择VoiceForge?

每个构建语音代理的团队都会对提供商组合进行反复试验。ElevenLabs对自己进行了基准测试。Deepgram对自己进行了基准测试。 没有人对组合进行基准测试。 我们确实如此。

由...建造 Beknazar Abdikamalov --4年为企业客户构建8种语言的生产语音AI。

许可证

麻省理工学院

目录标签

目录标签

JavaScriptClaude语音音频语音AI本地部署STTLLMTTS企业级开发

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

8

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP