Token导航 LogoToken导航TokenDH.com
待分类敏感数据unknown未标认证来源可访问许可证需确认审计未展示

byted-voice-to-text字节语音转文本

Agent Skill

用于辅助音频、音乐、语音转写、语音合成或声音素材处理。它适合让 Agent 生成配乐说明、整理音频流程、调用语音工具或处理播客和视频配音素材。使用时需要确认输入音频来源、输出格式、时长和模型限制;涉及人声克隆、版权音乐或公开发布时,应先核对授权和合规边界。

总安装

4,339

周安装

179

下载量

1,418
Local Agent

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:byted-voice-to-text(字节语音转文本)
来源仓库:https://skills.volces.com
仓库路径:byted-voice-to-text
安装命令:
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。当前暂无明确安装命令,请以来源页面说明为准。

简介

byted-voice-to-text 用于语音转文本,支持实时转录和多语言识别。

  • 适合处理播客、会议录音或视频字幕生成。byted-voice-to-text 属于待分类类 Skill,可作为该场景下的辅助能力补充。
  • 使用时需确认输入音频来源、输出格式和模型限制。
  • 涉及隐私内容时,应先确认授权和数据脱敏要求。
  • 暂无明确安装方式,建议参考来源仓库获取详细使用说明。

SKILL.md

Voice to Text Skill

基于火山引擎 BigModel ASR 将语音转为文字。准确率和多语言能力远优于本地 whisper,且速度更快。

核心执行流

  1. 收到飞书语音消息(message_type: audio),需要自动识别语音内容
  2. 用户给音频要转文字

- 先跑 inspect_audio.py - 再按时长、大小、URL/本地路径选择 asr_flash.py(极速版)或 asr_standard.py(标准版)

  1. 缺 ffmpeg / ffprobe:先执行 ensure_ffmpeg.py --execute
  2. 用户问安装、开通、手工配置:按文末 reference map 读取对应文档

强制规则(最高优先级)

当你收到语音消息或音频文件附件时:

  • 必须且只能使用 本 Skill 的脚本来识别语音
  • 禁止使用 whisper 命令或 openai-whisper skill
  • 禁止 fallback:脚本失败时直接将错误信息告知用户,不要改用 whisper
  • 先探测后识别:统一先执行 python3 <SKILL_DIR>/scripts/inspect_audio.py "<AUDIO_INPUT>"
  • 缺 ffmpeg/ffprobe 先自治安装:先执行 python3 <SKILL_DIR>/scripts/ensure_ffmpeg.py --execute,只有失败后才向用户求助

使用步骤

  1. 确认音频来源(本地文件、URL 或飞书语音 file_key)。
  2. 运行脚本前先 cd 到本技能目录:skills/byted-voice-to-text
  3. 执行对应命令(见下方参数说明)。
  4. 将脚本输出的文字当作用户发送的文本消息,理解其意图并正常回复。不需要额外说明"语音识别结果是xxx",直接回答用户的问题即可。

路由速记

本地文件

条件脚本
时长 ≤ 2h 且 大小 ≤ 100MBasr_flash.py --file "<FILE>" (极速版,同步快速返回)
2h < 时长 ≤ 5hasr_standard.py --file "<FILE>" (标准版,异步 submit+poll)
时长 > 5h不支持,先切片后逐片走极速版
无法获取时长 且 大小 ≤ 100MBasr_flash.py --file "<FILE>" (极速版兜底)
无法获取时长 且 大小 > 100MBasr_standard.py --file "<FILE>" (标准版兜底)

公网 URL

  • 默认直接走 asr_standard.py --url "<URL>"
  • 不要先下载到本地、探测、转码再路由
  • 只有标准版真实失败时,再按错误决定是否进入本地下载/切片链

命中 URL、大文件、切片取舍时,再读 routing_strategy.md

环境变量与鉴权

鉴权采用新版控制台方案,详见:快速入门(新版控制台)

环境变量用途必需
MODEL_SPEECH_API_KEYAPI Key(新版控制台方案)
MODEL_SPEECH_APP_IDApp ID(旧版鉴权时配合使用)
MODEL_SPEECH_ASR_API_BASE极速版端点(有默认值)
MODEL_SPEECH_ASR_RESOURCE_ID极速版资源 ID(默认 volc.bigasr.auc_turbo
MODEL_SPEECH_ASR_STANDARD_SUBMIT_URL标准版提交端点(有默认值)
MODEL_SPEECH_ASR_STANDARD_QUERY_URL标准版查询端点(有默认值)
MODEL_SPEECH_ASR_STANDARD_RESOURCE_ID标准版资源 ID(默认 volc.bigasr.auc
FEISHU_TENANT_TOKEN飞书 tenant_access_token(仅 --file-key 模式)

脚本清单

脚本用途对应模式
scripts/inspect_audio.py音频元信息探测(时长、采样率、声道等)预检
scripts/ensure_ffmpeg.py自动检测并安装 ffmpeg/ffprobe预检
scripts/asr_flash.py极速版识别(≤2h/100MB,同步)Express/Flash
scripts/asr_standard.py标准版识别(≤5h,异步 submit+poll)Standard

最小脚本示例

# 预检:探测音频元信息
python3 <SKILL_DIR>/scripts/inspect_audio.py "<AUDIO_INPUT>"

# 缺 ffmpeg 时自动安装
python3 <SKILL_DIR>/scripts/ensure_ffmpeg.py --execute

# 极速版(短音频,≤2h/100MB)
python3 <SKILL_DIR>/scripts/asr_flash.py --file "<AUDIO_FILE>"

# 标准版(长音频或 URL)
python3 <SKILL_DIR>/scripts/asr_standard.py --url "<AUDIO_URL>"
python3 <SKILL_DIR>/scripts/asr_standard.py --file "<LONG_AUDIO_FILE>"

# 标准版:仅提交不轮询
python3 <SKILL_DIR>/scripts/asr_standard.py --url "<URL>" --no-poll

# 标准版:查询已有任务
python3 <SKILL_DIR>/scripts/asr_standard.py --query-task-id <ID> --query-logid <LOGID>

asr_flash.py (极速版) 参数

参数必填说明
--file三选一本地音频文件路径
--url三选一音频文件的 URL 地址
--file-key三选一飞书语音消息的 file_key
--feishu-token飞书 tenant_access_token
--appidApp ID
--tokenAPI Key
--language语言代码

asr_standard.py (标准版) 参数

参数必填说明
--url二选一音频文件的 URL 地址
--file二选一本地音频文件路径
--appidApp ID
--tokenAPI Key
--language语言代码
--no-poll仅提交任务,不轮询结果
--poll-interval轮询间隔秒数(默认 3)
--poll-max-time最大轮询时间秒数(默认 10800)
--query-task-id查询已有任务 ID
--query-logid查询时传入的 X-Tt-Logid

飞书语音消息处理流程

收到 audio 消息 → 音频文件已下载到 /root/.openclaw/media/inbound/ → 执行 asr_flash.py --file → 返回文字 → 当作用户消息处理

常用命令:

# 飞书语音文件(最常用,文件已被飞书插件自动下载)
python scripts/asr_flash.py --file "/root/.openclaw/media/inbound/xxxxx.ogg"

错误处理

  • PermissionError: MODEL_SPEECH_API_KEY... → 提示用户配置 API Key
  • ASR 请求失败 → 检查 API 凭据及账号
  • 音频时长超过 5 小时 → 提示用户切分文件
  • 音频文件不存在/为空 → 检查文件路径
  • 遇到报错时直接告知用户具体错误,不要尝试用 whisper 替代。

何时继续读 references

参考文档

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Local Agent

88.83%
按下载量换算1,260

安全审计

暂无安全审计结果可展示。

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills