Token导航 LogoToken导航TokenDH.com
效率需要联网clawhub未标认证来源可访问clear审计提醒

faster-whisper-zhfaster Whisper ZH 音频

Agent Skill

faster-whisper-zh 用于补充效率相关能力,适合在 OpenClaw 中需要让 Agent 承接效率相关任务时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

3,528

周安装

147

GitHub Stars

1

下载量

1,176
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:faster-whisper-zh(faster Whisper ZH 音频)
来源仓库:https://github.com/mapleshadow/faster-whisper-zh
安装命令:
openclaw skills install faster-whisper-zh
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install faster-whisper-zh

简介

使用 faster-whisper 的本地语音转文字工具。支持 GPU 加速的高性能转录,包含词级时间戳和蒸馏模型。当用户要求"转录音频"、"语音转文字"或"whisper"时使用此技能。

SKILL.md

name
faster-whisper-zh
description
使用 faster-whisper 的本地语音转文字工具。支持 GPU 加速的高性能转录,包含词级时间戳和蒸馏模型。当用户要求"转录音频"、"语音转文字"或"whisper"时使用此技能。
metadata

Faster-Whisper 中文版

基于 faster-whisper 的高性能本地语音转文字工具。

安装设置

1. 运行安装脚本

执行安装脚本以创建虚拟环境并安装依赖包。脚本会自动检测 NVIDIA GPU 以启用 CUDA 加速。

./setup.sh

系统要求:

  • Python 3.10 或更高版本
  • ffmpeg(系统已安装)

使用方法

使用转换脚本转换音频文件。

适用场景

  • 会议录音转文字纪要
  • 语音笔记转文字记录
  • 音频文件内容提取
  • 访谈录音整理
  • 培训录音转文字材料
  • 视频字幕生成
  • 播客内容转录
  • 语音转文字
  • 音频转文字

基本转录

export HF_HOME=/config/huggingface
export HF_ENDPOINT=https://hf-mirror.com
.venv/bin/python3 scripts/transcribe.py

高级选项

  • 指定模型: .venv/bin/python3 scripts/transcribe.py audio.mp3 --model large-v3-turbo
  • 词级时间戳: .venv/bin/python3 scripts/transcribe.py audio.mp3 --word-timestamps
  • JSON 输出: .venv/bin/python3 scripts/transcribe.py audio.mp3 --json
  • 语音活动检测(静音去除): .venv/bin/python3 scripts/transcribe.py audio.mp3 --vad
  • 指定语言: .venv/bin/python3 scripts/transcribe.py audio.mp3 --language zh
  • GPU 加速: .venv/bin/python3 scripts/transcribe.py audio.mp3 --device cuda
  • CPU 优化: .venv/bin/python3 scripts/transcribe.py audio.mp3 --device cpu --compute-type int8

完整命令示例

# 中文转录,使用 GPU 加速
.venv/bin/python3 scripts/transcribe.py 会议录音.mp3 --language zh --device cuda --compute-type float16

# 英文转录,包含词级时间戳
.venv/bin/python3 scripts/transcribe.py interview.wav --language en --word-timestamps --json

# 快速 CPU 转录,优化性能
.venv/bin/python3 scripts/transcribe.py audio.m4a --device cpu --compute-type int8 --model distil-large-v3

# 批量处理脚本
.venv/bin/python3 scripts/batch_transcribe.sh /path/to/audio/files/

可用模型

  • large-v3-turbo (默认):推荐用于多语言或最高准确度任务
  • large-v3: 原始大模型,准确度最高
  • distil-large-v3: 速度和准确性的最佳平衡
  • medium: 中等大小,平衡性能
  • small: 小型模型,速度快
  • base: 基础模型,资源需求最低
  • tiny: 微型模型,速度最快
  • medium.en, small.en: 仅支持英语的更快版本

模型选择指南

模型大小推荐用途硬件要求
large-v3-turbo1.5GB专业级转录高性能 GPU
medium1.5GB平衡性能普通配置
distil-large-v3756MB通用中文转录中等配置
small500MB快速转录低配置
tiny150MB实时转录最低配置

性能优化

GPU 加速配置

# NVIDIA GPU (CUDA)
.venv/bin/python3 scripts/transcribe.py audio.mp3 --device cuda --compute-type float16

# Apple Silicon (macOS)
.venv/bin/python3 scripts/transcribe.py audio.mp3 --device mps

CPU 优化配置

# 高性能 CPU
.venv/bin/python3 scripts/transcribe.py audio.mp3 --device cpu --compute-type int8 --beam-size 3

# 低资源环境
.venv/bin/python3 scripts/transcribe.py audio.mp3 --device cpu --compute-type int8 --model small --beam-size 1

故障排除

常见问题

  • 未检测到 GPU: 确保 NVIDIA 驱动和 CUDA 正确安装。CPU 转录速度会显著变慢。
  • 内存不足错误: 使用更小的模型(如 smallbase)或使用 --compute-type int8
  • 模型下载失败: 设置环境变量 HF_ENDPOINT=https://hf-mirror.com 使用国内镜像
  • 音频格式不支持: 使用 ffmpeg 转换音频格式:ffmpeg -i input.m4a output.wav

错误解决方案

  1. CUDA 不可用
   # 检查 CUDA 安装
   nvidia-smi
   
   # 如果未安装,重新运行安装脚本
   ./setup.sh
  1. ffmpeg 未找到
   # Ubuntu/Debian
   sudo apt install ffmpeg
   
   # macOS
   brew install ffmpeg
   
   # CentOS/RHEL
   sudo yum install ffmpeg
  1. Python 版本过低
   # 检查 Python 版本
   python3 --version
   
   # 需要 Python 3.10+

环境变量配置

# 设置 HuggingFace 缓存目录(避免重复下载)
export HF_HOME=/config/huggingface

# 使用国内镜像加速下载
export HF_ENDPOINT=https://hf-mirror.com

# 设置 PyTorch CUDA 版本(如有需要)
export CUDA_VISIBLE_DEVICES=0

批量处理

创建 batch_transcribe.sh 脚本进行批量处理:

#!/bin/bash
# 批量转录脚本
for audio_file in *.mp3 *.wav *.m4a; do
    if [ -f "$audio_file" ]; then
        echo "处理: $audio_file"
        ./scripts/transcribe.py "$audio_file" --output "${audio_file%.*}.txt"
    fi
done

输出格式

纯文本输出

[00:00:00.000 --> 00:00:05.000] 欢迎使用 faster-whisper 语音转文字工具。
[00:00:05.000 --> 00:00:10.000] 这是一个高性能的本地转录解决方案。

JSON 输出

{
  "text": "完整的转录文本...",
  "segments": [
    {
      "start": 0.0,
      "end": 5.0,
      "text": "欢迎使用 faster-whisper 语音转文字工具。",
      "words": [
        {"word": "欢迎", "start": 0.0, "end": 0.5},
        {"word": "使用", "start": 0.5, "end": 1.0}
      ]
    }
  ]
}

更新日志

v1.0.5 (2026-04-16)

  • 重新调整命令
  • 原需激活虚拟环境更改为直接执行虚拟环境的python3

技术支持

如有问题,请:

  1. 查看本文档的故障排除部分
  2. 检查系统要求是否满足
  3. 确保网络连接正常(模型下载需要网络)
  4. 查看脚本错误信息进行调试

提示: 首次运行会下载所选模型(large-v3-turbo 约 1.5GB)。请确保有足够的磁盘空间和稳定的网络连接。

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

89.9%
按下载量换算1,057

安全审计

VirusTotal

可疑

ClawScan

可疑

Static analysis

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills