Token导航 LogoToken导航TokenDH.com
效率external-serviceclawhub未标认证来源可访问clear审计通过

voice-clone-tts语音克隆 tts

Agent Skill

用于辅助音频、音乐、语音转写、语音合成或声音素材处理。它适合让 Agent 生成配乐说明、整理音频流程、调用语音工具或处理播客和视频配音素材。使用时需要确认输入音频来源、输出格式、时长和模型限制;涉及人声克隆、版权音乐或公开发布时,应先核对授权和合规边界。

总安装

6,666

周安装

275

GitHub Stars

公开资料未说明

下载量

2,178
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:voice-clone-tts(语音克隆 tts)
来源仓库:https://github.com/oliviapp8/voice-clone-tts
安装命令:
openclaw skills install voice-clone-tts
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install voice-clone-tts

简介

支持多后端 TTS 引擎的声纹克隆与语音批量生成服务。

  • 可选择 MiniMax、ElevenLabs 等不同提供商平衡质量与成本。
  • 允许调节情绪、语速等参数适应多样化应用场景需求。
  • 触发词机制便于在长对话中精准唤醒特定语音模式。voice-clone-tts 属于效率类 Skill,可作为该场景下的辅助能力补充。
  • 批量生成任务建议分批次提交避免超时或内存溢出异常。

SKILL.md

name
voice-clone-tts
description
声纹克隆和语音合成。上传音频样本克隆声纹,用克隆声纹或预设声纹生成语音。支持多个后端:MiniMax、ElevenLabs、Fish Audio、Azure TTS、OpenAI TTS。支持情绪控制、语速调整、批量生成。触发词:语音合成、TTS、声纹克隆、voice clone、text to speech、配音、旁白。

声纹克隆 & 语音合成

何时使用此 Skill

场景是否需要此 Skill
数字人平台支持声纹克隆(可灵/即梦/HeyGen)不需要,直接在 digital-avatar 里处理
数字人平台不支持声纹克隆需要,生成音频后上传
纯音频输出(播客/有声书)需要
需要更精细的语音控制可选,MiniMax/ElevenLabs 控制更细

推荐:优先用数字人平台自带的声纹克隆,保持后端一致性。


功能

  1. 声纹克隆:上传音频样本 → 生成声纹 ID
  2. 语音合成:文本 + 声纹 → 音频文件
  3. 批量生成:分镜列表 → 多个音频文件

支持的后端

后端克隆情绪多语言特点
MiniMax中/英国内快,中文好
ElevenLabs30+质量顶级
Fish Audio-中/英/日开源,便宜
Azure TTS-100+稳定,多语言
OpenAI TTS--多语言简单快速

默认使用 MiniMax(如已配置)。

工作流程

流程 A:声纹克隆

输入: 音频样本(10s-5min)
  ↓
上传到后端
  ↓
等待训练(即时-几分钟)
  ↓
输出: voice_id

流程 B:语音合成

输入: text + voice_id + 参数
  ↓
调用 TTS API
  ↓
输出: 音频文件

流程 C:批量生成

输入: scenes[] + voice_id
  ↓
逐条生成(或并行)
  ↓
输出: 音频文件列表

输入参数

声纹克隆

参数必填说明
modeclone
backend-minimax / elevenlabs / fish
audio_sample音频文件路径(10s-5min)
name-声纹名称
description-声纹描述

语音合成

参数必填说明
modesynthesize
backend-同上 + azure / openai
text要合成的文本
voice_id声纹 ID 或预设名
output-输出路径
speed-语速 0.5-2.0(默认1.0)
emotion-情绪(见下表)
pitch-音调调整
format-mp3 / wav / ogg

批量生成

参数必填说明
modebatch
backend-同上
scenes分镜列表(含台词)
voice_id声纹 ID
output_dir-输出目录

情绪控制

情绪英文适用场景
neutralneutral默认/旁白
happyhappy轻松/种草
sadsad共情/痛点
angryangry吐槽/愤怒
excitedexcited惊喜/CTA
seriousserious专业/严肃
whisperwhisper悄悄话/ASMR

输入格式(批量)

mode: batch
voice_id: "voice_abc123"
backend: minimax

scenes:
  - id: 1
    text: "你是不是也遇到过这样的问题?"
    emotion: neutral
    speed: 1.0
    
  - id: 2
    text: "每次做 PPT 都要花好几个小时..."
    emotion: sad
    speed: 0.9
    
  - id: 3
    text: "现在只需要 30 秒!"
    emotion: excited
    speed: 1.1
    
  - id: 4
    text: "链接在评论区,快去试试吧"
    emotion: happy
    speed: 1.0

output_dir: "./audio_output/"
format: mp3

输出格式

声纹克隆

voice:
  id: "voice_abc123"
  backend: minimax
  name: "我的声音"
  status: ready
  created_at: "2024-01-01T00:00:00Z"

语音合成

audio:
  path: "./output/scene_01.mp3"
  duration: 3.5
  format: mp3
  sample_rate: 44100

批量生成

audios:
  - id: 1
    path: "./audio_output/scene_01.mp3"
    duration: 2.8
    
  - id: 2
    path: "./audio_output/scene_02.mp3"
    duration: 4.2
    
  - id: 3
    path: "./audio_output/scene_03.mp3"
    duration: 2.1
    
  - id: 4
    path: "./audio_output/scene_04.mp3"
    duration: 3.0

total_duration: 12.1

后端配置

详见 references/backend-setup.md

音频样本要求

声纹克隆最佳实践

项目要求
时长30s-3min(最佳1-2min)
格式mp3 / wav / m4a
采样率≥16kHz
内容清晰朗读,无背景噪音
情绪自然平稳,不要太夸张

提高克隆质量

  1. 安静环境录制
  2. 保持语速稳定
  3. 内容覆盖常用音节
  4. 避免口水音/换气声
  5. 使用高质量麦克风

使用示例

克隆声纹

用户:用这段音频克隆我的声音 [附音频]

执行:
1. mode=clone, audio_sample=<音频路径>
2. 上传到 MiniMax
3. 返回 voice_id

单条合成

用户:用 voice_abc123 合成这句话:"大家好,欢迎来到我的频道"

执行:
1. mode=synthesize, voice_id="voice_abc123", text="..."
2. 调用 TTS API
3. 返回音频文件

批量合成分镜

用户:根据这个分镜列表生成配音 [附 YAML]

执行:
1. 解析 scenes 列表
2. 逐条调用 TTS
3. 返回音频列表 + 总时长

与上下游对接

上游video-script-generator 的 scenes[].narration

下游

  • digital-avatar:音频输入生成口播
  • scene-video-generator:音频轨道
  • video-stitcher:音频合并

Pipeline 集成

# video-script-generator 输出
scenes:
  - id: 1
    narration: "你是不是也..."
    duration: 3s
    
# 自动提取 narration → voice-clone-tts
# 输出音频 → digital-avatar / video-stitcher

注意事项

  1. 声纹克隆需遵守各平台使用条款
  2. 不要用他人声音做误导性内容
  3. 商用需确认版权协议
  4. 批量生成建议控制并发,避免 rate limit
  5. 保存 voice_id,避免重复克隆

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

75.67%
按下载量换算1,648

安全审计

VirusTotal

通过

ClawScan

通过

Static analysis

通过

权限和风险

external-service

该 Skill 可能调用第三方服务、云服务或外部模型 API,使用前需要确认账号、额度、数据发送范围和服务条款。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills