Token导航 LogoToken导航TokenDH.com
待分类只读unknown未标认证来源可访问许可证需确认审计未展示

tts-voice-synthesistts 语音合成

Agent Skill

用于辅助音频、音乐、语音转写、语音合成或声音素材处理。它适合让 Agent 生成配乐说明、整理音频流程、调用语音工具或处理播客和视频配音素材。使用时需要确认输入音频来源、输出格式、时长和模型限制;涉及人声克隆、版权音乐或公开发布时,应先核对授权和合规边界。

总安装

194

周安装

8

下载量

63
Local Agent

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:tts-voice-synthesis(tts 语音合成)
来源仓库:https://modelscope.cn
仓库路径:tts-voice-synthesis
安装命令:
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。当前暂无明确安装命令,请以来源页面说明为准。

简介

用于辅助音频、音乐、语音转写、语音合成或声音素材处理。

  • 适合生成配乐说明、整理音频流程或调用语音工具。
  • 使用时需确认输入音频来源、输出格式和模型限制。
  • 涉及人声克隆或公开发布时应先核对授权和合规边界。
  • tts-voice-synthesis 属于待分类类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

TTS 语音合成服务

任务目标

  • 本 Skill 用于:将文本转换为高质量语音,支持音色克隆、情感适配、流式生成和多语言支持
  • 能力包含:

- 角色音色自动整理与克隆(从参考音频提取音色特征) - 拟人化语义适配配音(根据文本情绪自动调整语音语调、语速、音调) - 流式实时配音(支持边输入文本边生成语音) - 多语言与方言支持(中文、英文及多种方言) - 双模型选择(1.7B 高质量模型、0.6B 快速模型)

  • 触发条件:当需要将文本转换为语音、克隆特定音色、生成情感化配音时使用

前置准备

- GPU:推荐使用 8GB+ 显存的 GPU(0.6B 模型可在 CPU 上运行) - 内存:建议 16GB+ 系统内存 - 磁盘空间:至少 10GB 可用空间(模型权重约 3-5GB)

  • 依赖配置:确保已安装所需的 Python 依赖包

操作步骤

模式一:基础语音合成

  1. 文本准备

- 确认待合成的文本内容 - 智能体将分析文本情绪和语义特征

  1. 选择音色

- 使用预置音色(见 references/model_config.md) - 或使用已克隆的自定义音色

  1. 执行合成

- 调用 scripts/tts_generate.py 进行语音生成 - 根据情绪分析结果自动设置语音参数

  1. 验证输出

- 检查生成的音频质量和情感匹配度 - 如有需要,调整参数重新生成

模式二:音色克隆

  1. 准备参考音频

- 提供目标音色的参考音频文件(3-30 秒,清晰语音) - 确保参考音频无背景噪音、音质清晰

  1. 提取音色特征

- 调用 scripts/voice_clone.py 提取音色特征 - 保存为可复用的音色模型

  1. 使用克隆音色

- 使用提取的音色模型生成语音 - 可应用于不同文本的配音

模式三:流式实时配音

  1. 文本分段

- 将长文本分段处理(智能体自动完成) - 确保分段自然,不会截断语义

  1. 流式生成

- 调用 scripts/tts_generate.py 启用流式模式 - 逐步生成并输出音频片段

  1. 实时合并

- 将生成的音频片段实时合并 - 输出完整的配音文件

模式四:情感适配配音

  1. 文本情绪分析

- 智能体分析文本的情绪倾向(高兴、悲伤、愤怒、平静等) - 识别关键情感词和语气

  1. 语音参数调整

- 根据情绪自动调整: - 语速(悲伤时放慢,兴奋时加快) - 音调(悲伤时降低,兴奋时提高) - 音量(根据情感强度调整)

  1. 生成验证

- 生成情感化语音 - 验证情感表达是否准确

资源索引

  • 核心脚本:

- scripts/tts_generate.py(TTS 语音生成) - scripts/voice_clone.py(音色克隆)

  • 参考文档:

- references/model_config.md(模型配置和选择指南) - references/emotion_guide.md(情感标注和适配指南) - references/usage_examples.md(使用示例)

注意事项

  • 模型选择:

- 1.7B 模型:音质更高,适合高质量配音、有声书等场景 - 0.6B 模型:速度更快,适合实时交互、智能客服等场景

  • 音色克隆:

- 参考音频应清晰、无背景噪音 - 时长建议 5-15 秒,最短不少于 3 秒 - 单人语音效果最佳,避免多人混合音频

  • 流式生成:

- 适合长文本和实时交互场景 - 会产生多个临时音频片段

  • 情感适配:

- 文本情绪分析由智能体完成 - 最终效果取决于情感标注的准确性 - 可手动调整语音参数进行微调

使用示例

  • 基础语音合成: python scripts/tts_generate.py \ --text "你好,欢迎使用语音合成服务" \ --output_path./output/hello.wav \ --model_size 1.7B \ --voice default
  • 音色克隆: python scripts/voice_clone.py \ --reference_audio./reference.wav \ --voice_name my_voice \ --output_dir./voices
  • 情感化配音: python scripts/tts_generate.py \ --text "今天真是太开心了!" \ --output_path./output/happy.wav \ --emotion happy \ --speed 1.2 \ --pitch 1.1
  • 流式生成: python scripts/tts_generate.py \ --text_file./long_text.txt \ --output_path./output/stream_output.wav \ --streaming true

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Local Agent

85.3%
按下载量换算54

安全审计

暂无安全审计结果可展示。

权限和风险

只读

该 Skill 主要提供规则、说明或参考内容,本身偏只读;真正读写文件、联网或执行命令仍取决于宿主 Agent 的任务。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills