Token导航 LogoToken导航TokenDH.com
待分类权限需确认unknown未标认证来源可访问许可证需确认审计通过

whisper-sttWhisper STT 音频

Agent Skill

whisper-stt 用于辅助 Python 项目开发、测试和数据处理,适合在 Local Agent 中需要阅读 Python 代码、运行测试或整理脚本流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

832

周安装

34

下载量

267
Local Agent

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:whisper-stt(Whisper STT 音频)
来源仓库:https://skills.volces.com
仓库路径:whisper-stt
安装命令:
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。当前暂无明确安装命令,请以来源页面说明为准。

简介

whisper-stt 用于辅助 Python 项目开发、测试和数据处理,适合在 Local Agent 中阅读代码或整理脚本流程。

  • 适用于需要运行测试、分析代码结构或处理数据文件的场景。
  • 可结合来源仓库和原始 README 进一步核验具体用法。
  • 安装前建议确认权限范围、维护状态及是否触发命令执行或文件读写。
  • 当前无详细功能说明,需参考官方文档获取完整实现细节。

SKILL.md

Whisper 语音转文字技能

将音频/语音文件识别并转换为文字。

使用方式

自动处理(推荐)

当用户发送语音/音频文件时,自动:

  1. 识别语音内容
  2. 转换为文字
  3. 发送文字到飞书

手动命令

用户发送音频文件后,技能自动处理。

支持格式

  • MP3, WAV, M4A, OGG, FLAC, WebM
  • 任何音频格式(FFmpeg支持即可)

模型选择

模型大小速度精度
tiny~1GB最快基础
base~1GB一般
small~2GB中等较好
medium~5GB较慢很好
large~10GB最慢最佳
turbo~6GB接近large

技术实现

import whisper

# 加载模型(首次使用会下载)
model = whisper.load_model("base")  # 可选: tiny/base/small/medium/large/turbo

# 识别语音
result = model.transcribe("audio.mp3")

# 输出文字
print(result["text"])

依赖

  • Python 3.8+
  • PyTorch
  • openai-whisper
  • ffmpeg

注意事项

  1. 首次使用会下载模型(1-10GB)
  2. 大模型需要较多内存
  3. 中文识别效果很好

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Local Agent

96.94%
按下载量换算259

安全审计

Socket

通过

权限和风险

权限需确认

当前来源未能明确判断权限范围,默认进入异常复核队列。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills