Token导航 LogoToken导航TokenDH.com
Autoglm Asr MCP logo
音视频stdio官方级别未说明来源级核验

Autoglm Asr MCP

MCP Server

autoglm-asr-mcp

一个面向Agent的高质量语音转文字MCP服务,支持长音频分块、上下文传递和时间戳分段,适用于会议记录、通话分析、字幕草稿和语音备忘录转录等场景。

工具数

2

提示词数

0

GitHub Stars

6

资源数

0
音频处理PythonVS CodeVS Code

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

Starrylyn

提供方

Starrylyn

最后核验

2026/5/17 20:22

运行时

Node.js

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

npx autoglm-asr-mcp

详细介绍

AutoGLM ASR MCP服务器

使用知普AutoGLM ASR进行高质量语音到文本转录的MCP服务器。

CN: 一个面向 Agent 的语音转文字 MCP 服务,支持长音频分块、上下文传递和时间戳分段。

有关面向AI的设置详细信息,请参阅 AI_SETUP_GUIDE.md.

人工智能代理(TL;DR)

  • 类型:MCP服务器
  • 域:ASR/语音转文本/转录
  • 输入:本地音频文件路径
  • 输出:完整转录文本+时间戳段
  • 最适合:会议笔记、通话分析、字幕草稿、语音备忘录转录
  • 支持的音频格式: mp3, wav, m4a, flac, ogg, webm
  • 核心工具: transcribe_audio, get_audio_info

它做什么

  • 使用自动分块功能转录短音频文件和长音频文件。
  • 使用上下文感知模式来平衡速度和质量。
  • 返回可读的全文和段级时间戳。
  • 作为编码助手的MCP服务器在stdio上运行。

工具索引

工具目的必需参数可选参数返回值
transcribe_audio将音频转录为文本audio_pathcontext_mode, max_concurrency完整的成绩单和时间对齐的片段
get_audio_info转录前检查音频audio_path持续时间、格式、通道、采样率、估计块

特性

  • 滑动窗口并发的快速长音频转录。
  • 通过块到块上下文传递提高准确性。
  • 长输入的自动拆分(API限制友好)。
  • 零安装运行时 npx.
  • 适用于常见的MCP客户端。

安装

先决条件

ffmpeg 必须安装:

# macOS
brew install ffmpeg

# Ubuntu/Debian
apt install ffmpeg

# Windows
choco install ffmpeg

从获取API密钥 智普AI开放平台.

NPX(推荐)

npx autoglm-asr-mcp

快速开始

将此MCP服务器添加到您的客户端配置中并设置 AUTOGLM_ASR_API_KEY.

{
  "mcpServers": {
    "autoglm-asr": {
      "command": "npx",
      "args": ["-y", "autoglm-asr-mcp"],
      "env": {
        "AUTOGLM_ASR_API_KEY": "your-api-key"
      }
    }
  }
}

兼容性

  • 克劳德桌面/克劳德代码
  • 光标
  • 帆板运动
  • VS代码MCP
  • 其他MCP兼容客户端

VS Code快速安装:

![Install with NPX in VS Code](https://insiders.vscode.dev/redirect/mcp/install?name=autoglm-asr&config=%7B%22command%22%3A%22npx%22%2C%22args%22%3A%5B%22-y%22%2C%22autoglm-asr-mcp%22%5D%2C%22env%22%3A%7B%22AUTOGLM_ASR_API_KEY%22%3A%22your-api-key%22%7D%7D)

工具

transcribe_audio

将音频文件转录为带有定时段的文本。

论据:

名称类型必填描述
audio_pathstring音频文件的绝对路径
context_modestringsliding (默认), none (最快), full_serial (质量最好,速度较慢)
max_concurrencyinteger最大并行请求数,范围 1-20,默认值 5

退货:

  • 完整转录文本
  • 带时间戳的段列表
  • 基本运行统计数据(块、模式、运行时间)

常见错误:

  • 找不到文件或路径不可读
  • 格式不受支持或音频流中断
  • 缺少/无效的API密钥

get_audio_info

转录前检查音频文件。

论据:

名称类型必填描述
audio_pathstring音频文件的绝对路径

退货:

  • 持续时间
  • 格式
  • 采样率
  • 频道
  • 估计块数

上下文模式

模式速度质量描述
sliding快速第一个块初始化上下文,后面的块与上下文并行运行
none最快中等块并行独立运行
full_serial慢速最佳使用完整上下文链按顺序转录所有块

环境变量

变量默认值描述
AUTOGLM_ASR_API_KEY必需您的智浦API密钥
AUTOGLM_ASR_API_BASEhttps://open.bigmodel.cn/api/paas/v4/audio/transcriptionsAPI终点
AUTOGLM_ASR_MODELglm-asr-2512ASR型号名称
AUTOGLM_ASR_MAX_CHUNK_DURATION25最大块持续时间(秒)
AUTOGLM_ASR_MAX_CONCURRENCY5默认并发性
AUTOGLM_ASR_CONTEXT_MAX_CHARS2000块之间传递的最大上下文大小

用例

  • 将会议记录转换为可编辑的成绩单
  • 客户支持电话转录
  • 播客/视频字幕草稿生成
  • 语音备忘录索引和搜索

局限性

  • 需要本地文件路径输入(不是远程URL输入)。
  • 音频质量强烈影响转录质量。
  • 非常嘈杂或多扬声器重叠会降低准确性。

故障排除

  • ffmpeg not found:安装ffmpeg并重试。
  • File not found:传递一条绝对现有路径。
  • API错误:验证 AUTOGLM_ASR_API_KEY 以及账户配额。

关键词

mcp, model-context-protocol, asr, speech-to-text, transcription, autoglm, zhipu, chinese-asr, audio-transcription, meeting-transcript, subtitle-generation, voice-to-text, agent-tools, llm-tools, coding-agent

许可证

麻省理工学院

目录标签

目录标签

音频处理PythonVS Code语音转文字本地部署自动语音识别MCP服务AI工具

支持客户端

VS Code

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Node.js

来源包(packageName,安装包名)

autoglm-asr-mcp

工具数量(toolCount,工具数)

2

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP