Token导航 LogoToken导航TokenDH.com
Glm Asr logo
音视频stdio官方级别未说明来源级核验

Glm Asr

MCP Server

基于GLM-ASR-Nano的高精度语音识别服务,支持17种语言,提供Web UI、REST API和SSE流式传输功能。

工具数

0

提示词数

0

GitHub Stars

7

资源数

0
语音识别Python音频处理

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

neosun100

提供方

neosun100

最后核验

2026/5/17 20:20

运行时

Docker

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

docker run -d --gpus all -p 7860:7860 neosun/glm-asr:v2.0.1

详细介绍

英语 | 简体中文 | 繁体中文 | 日本语

GLM-ASR

](https://hub.docker.com/r/neosun/glm-asr) ![License](LICENSE) ![Python](https://python.org) ![FastAPI](https://fastapi.tiangolo.com)

基于GLM ASR Nano的多功能语音识别服务

Web UI•REST API•SSE流媒体•Swagger文档

______________________________________________________________________

🖥️ 截图

Web UI

______________________________________________________________________

✨ 特性

  • 🎯 高精度 -基于GLM-ASR-Nano-2512(1.5B),性能优于Whisper V3
  • 🌍 17种语言 -中文、英语、广东话、日语、韩语等
  • 🎤 长音频 -VAD智能分段,音频长度不受限制
  • 🚀 SSE流媒体 -长音频的实时进度和结果
  • 🖥️ Web用户界面 -现代暗模式界面,支持4种语言
  • 🔌 REST API -带有Swagger文档的完整API
  • 💾 GPU管理 -手动加载/卸载内存控制
  • 🐳 Docker就绪 -带有预加载模型的一个命令部署

______________________________________________________________________

🚀 快速开始

Docker(推荐)

docker run -d --gpus all -p 7860:7860 neosun/glm-asr:v2.0.1

访问权限:

  • Web用户界面:http://localhost:7860
  • Swagger文档:http://localhost:7860/docs
  • 重新记录:http://localhost:7860/redoc

Docker Compose

git clone https://github.com/neosun100/glm-asr.git
cd glm-asr
docker compose up -d

______________________________________________________________________

📖 api参考

基本URL

http://localhost:7860

端点

健康检查

GET /health
{"status": "ok", "model_loaded": true}

转录(同步)-用于短音频

POST /api/transcribe
Content-Type: multipart/form-data
参数类型默认值说明
file文件必需音频文件(wav/mp3/flac/m4a/ogg/webm)
max_new_tokensint512最大输出令牌数(1-2048)
curl -X POST http://localhost:7860/api/transcribe \
  -F "file=@audio.mp3" \
  -F "max_new_tokens=512"
{"status": "success", "text": "Transcribed text here..."}

转录(SSE流)-用于长音频

POST /api/transcribe/stream
Content-Type: multipart/form-data

返回服务器发送的事件及其实时进度:

事件类型描述示例
start处理已开始{"type": "start"}
progress分部进度{"type": "progress", "current": 3, "total": 10, "duration": 22.5}
partial细分结果{"type": "partial", "text": "Segment text..."}
done完成{"type": "done", "text": "Full transcription..."}
error发生错误{"type": "error", "message": "Error details"}
curl -X POST http://localhost:7860/api/transcribe/stream \
  -F "file=@long_audio.mp3"

GPU状态

GET /gpu/status
{
  "model_loaded": true,
  "device": "cuda",
  "gpu_memory_used_mb": 4320.5,
  "gpu_memory_total_mb": 24576.0
}

装载/卸载模型

POST /gpu/load
POST /gpu/unload

交互式文档

  • Swagger用户界面: http://localhost:7860/docs
  • ReDoc: http://localhost:7860/redoc

______________________________________________________________________

⚙️ 配置

环境变量

变量默认值描述
MODEL_CHECKPOINTzai-org/GLM-ASR-Nano-2512HuggingFace模型路径
PORT7860服务端口
HF_HOME/app/cache模型缓存目录

docker-compose.yml

services:
  glm-asr:
    image: neosun/glm-asr:v2.0.1
    container_name: glm-asr
    ports:
      - "7860:7860"
    volumes:
      - ./cache:/app/cache
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]

______________________________________________________________________

🏗️ 技术栈

组件技术
型号GLM-ASR-Nano-2512(1.5B)
后端FastAPI+Uvicorn
流媒体服务器发送事件(SSE)
前端HTML5+香草JS
容器Docker+NVIDIA CUDA
API文档Swagger/ReDoc

______________________________________________________________________

📊 基准

GLM ASR Nano在同类型号中实现了最低的平均错误率(4.10):

Benchmark

______________________________________________________________________

📝 更新日志

v2.0.1(2025-12-28)

  • ✅ 迁移到FastAPI异步框架
  • ✅ SSE流媒体实时进度
  • ✅ 完整的Swagger API文档
  • ✅ API双模式:同步+流
  • ✅ 修复了长音频浏览器超时问题
  • ✅ 带有进度显示的现代深色UI

v1.1.0(2025-12-15)

  • ✅ VAD 智能分割
  • ✅ 支持无限音频长度

v1.0.0(2025-12-14)

  • ✅ 初始版本
  • ✅ 支持4种语言的Web UI
  • ✅ 带有Swagger文档的REST API
  • ✅ Docker一体化镜像

______________________________________________________________________

📄 许可证

Apache许可证2.0

______________________________________________________________________

⭐ 明星历史

![Star History Chart](https://star-history.com/#neosun100/glm-asr)

目录标签

目录标签

语音识别Python音频处理本地部署多语言支持实时转录深度学习

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Docker

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP