Token导航 LogoToken导航TokenDH.com
开发敏感数据github未标认证来源可访问许可证需确认审计通过

minimax-speech极小极大语音

Agent Skill

用于辅助音频、音乐、语音转写、语音合成或声音素材处理。它适合让 Agent 生成配乐说明、整理音频流程、调用语音工具或处理播客和视频配音素材。使用时需要确认输入音频来源、输出格式、时长和模型限制;涉及人声克隆、版权音乐或公开发布时,应先核对授权和合规边界。

总安装

329

周安装

14

GitHub Stars

7

下载量

115
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:minimax-speech(极小极大语音)
来源仓库:https://github.com/nmvr2600/minimax-token-plan-skills
仓库路径:skills/minimax-speech
安装命令:
npx skills add https://github.com/nmvr2600/minimax-token-plan-skills --skill minimax-speech
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/nmvr2600/minimax-token-plan-skills --skill minimax-speech

简介

用于辅助音频、语音合成和声音素材处理。适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

  • 适合生成配乐说明、调用语音工具或处理播客配音。
  • 使用时需确认输入来源、输出格式和模型限制。
  • 涉及人声克隆或版权音乐时应核对授权边界。
  • minimax-speech 属于开发类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

MiniMax Speech Synthesis

Quick Reference

任务命令
短文本语音合成(自动选择同步接口)bun run ${CLAUDE_SKILL_DIR}/scripts/tts.ts "文本"
指定音色--voice female-tianmei
指定输出文件--output result.mp3
指定语速--speed 1.2
长文本(>3000字,自动走异步)bun run ${CLAUDE_SKILL_DIR}/scripts/tts.ts "很长很长的文本..."
查询可用音色`bun run ${CLAUDE_SKILL_DIR}/scripts/voices.ts [--type system\all]`

前置要求

  • MINIMAX_API_KEY: MiniMax API Key(必需)
  • MINIMAX_API_HOST: API 地址(可选,默认 https://api.minimaxi.com

MiniMax 语音合成 API,支持将文本转换为高质量语音音频。自动选择模式

  • 短文本(≤3000字):同步接口,直接返回音频数据,无需等待
  • 长文本(>3000字):异步接口,轮询查询任务状态(最大支持 100 万字符)
同步接口文本限制 < 10000 字符,超过 3000 字符推荐使用异步接口以获得更好的体验。

Agent 决策指南(重要)

当用户请求语音合成时,Agent 应该:

1. 智能选择音色

根据用户描述或上下文,自动选择最合适的音色,不要询问用户

用户描述/场景推荐的 voice_id说明
"温柔女声"、"甜美"、"亲切"female-tianmei甜美女声,适合日常对话
"成熟女声"、"御姐"、"有声书"female-yujie御姐音,适合故事朗读
"青年男声"、"普通男声"、默认male-qn-qingse青年男声,通用场景
"成熟男声"、"绅士"、"稳重"Chinese (Mandarin)_Gentleman绅士音,适合正式场合
"新闻播报"、"播音员"、"正式"Chinese (Mandarin)_News_Anchor新闻主播,适合播报
"可爱女声"、"萝莉"、"活泼"female-shaonv少女音,适合活泼内容
"中年男声"、"大叔"male-jieshuo解说音,适合讲解

2. 智能调整语速

场景speed 参数说明
正常朗读1.0默认语速
"慢一点"、"清晰点"0.8慢速,适合学习
"快一点"、"赶紧"1.2快速,适合紧急通知
"新闻播报"、"正式"1.0标准语速
"讲故事"、"有声书"0.9稍慢,更有氛围

3. 文件名生成

从文本内容提取 2-4 个关键词作为文件名前缀,例如:

  • 文本:"第一章 故事的开始" → 前缀:story_chapter_1
  • 文本:"欢迎使用本产品" → 前缀:welcome_message

使用方式

方式一:命令行脚本(Agent 直接调用)

# 基础用法 - Agent 已选好音色
bun run ${CLAUDE_SKILL_DIR}/scripts/tts.ts "文本内容" --voice female-tianmei --speed 1.0 --output welcome_message.mp3

# 或使用 package.json 中的快捷命令
bun run ${CLAUDE_SKILL_DIR}/scripts/tts.ts "文本内容" --voice female-tianmei --speed 1.0 --output welcome_message.mp3

# 完整参数
bun run ${CLAUDE_SKILL_DIR}/scripts/tts.ts "文本" \
  --voice female-tianmei \
  --speed 1.0 \
  --vol 10 \
  --pitch 1.0 \
  --model speech-2.8-hd \
  --output output.mp3

方式二:TypeScript 函数调用

import { textToSpeech } from "./scripts/tts";

// Agent 决策后直接调用
const output = await textToSpeech({
    text: "要合成的文本",
    voiceId: "female-tianmei",  // Agent 根据场景选择
    speed: 1.0,                   // Agent 根据需求选择
    outputFile: "story_chapter_1.mp3"
});

脚本参数说明

参数类型默认值说明
textstring必填要合成的文本
--voice, -vstringmale-qn-jingying音色ID
--speed, -sfloat1.0语速 0.5-2.0
--volfloat1音量 0-10
--pitch, -pint0音调 -12 到 12
--model, -mstringspeech-2.8-hd语音模型
--output, -ostringoutput.mp3输出文件

推荐音色列表

中文常用音色

voice_id描述适用场景
female-tianmei甜美女生日常对话、客服、欢迎词
female-yujie御姐音有声书、故事、情感朗读
female-shaonv少女音可爱风格、动漫、活泼内容
male-qn-qingse青年男声通用男声、默认选择
male-jieshuo解说男声讲解、教程、纪录片
Chinese (Mandarin)_News_Anchor新闻主播新闻播报、正式公告
Chinese (Mandarin)_Gentleman绅士男声商务、正式场合
Chinese (Mandarin)_Elderly_Man老年男声长辈角色、慈祥风格

英文常用音色

voice_id描述
English (US)_Jenny美式女声
English (US)_Guy美式男声
English (UK)_Libby英式女声
English (UK)_Ryan英式男声

完整音色列表: voices.md(327个音色)

模型选择

模型特点适用场景
speech-2.8-hd音质最佳,情感丰富专业配音、有声书(默认)
speech-2.6-hd低延迟,高自然度实时对话
speech-2.8-turbo性价比高,速度快批量生成
speech-02-hd韵律出色音乐、歌曲

示例场景

❌/✅ 正确示例:自动选择接口

WRONG - 手动指定异步接口处理短文本(不必要的等待)

用户:生成一个欢迎语音

Agent(错误做法):
- 手动调用异步接口
- 轮询等待任务完成
- 延迟不必要地增加

CORRECT - 让 skill 自动选择(短文本走同步,立即返回)

用户:生成一个欢迎语音

Agent(正确做法):
- 调用 tts.ts,传入文本
- skill 自动判断 ≤3000字,走同步接口
- 直接返回音频,无等待

示例 1:欢迎语音

用户:生成一个欢迎语音,温柔一点的女生

Agent 决策:
- 音色:female-tianmei(温柔女声)
- 语速:1.0(正常)
- 命令:bun run ${CLAUDE_SKILL_DIR}/scripts/tts.ts "欢迎使用我们的服务" --voice female-tianmei --output welcome.mp3

示例 2:新闻播报

用户:把这段新闻用播音员的声音读出来

Agent 决策:
- 音色:Chinese (Mandarin)_News_Anchor(新闻主播)
- 语速:1.0(标准)
- 命令:bun run ${CLAUDE_SKILL_DIR}/scripts/tts.ts "[新闻文本]" --voice "Chinese (Mandarin)_News_Anchor" --output news_broadcast.mp3

示例 3:有声书

用户:把这段故事转成语音,要有讲故事的感觉

Agent 决策:
- 音色:female-yujie(御姐音,适合讲故事)
- 语速:0.9(稍慢,更有氛围)
- 命令:bun run ${CLAUDE_SKILL_DIR}/scripts/tts.ts "[故事文本]" --voice female-yujie --speed 0.9 --output story_chapter_1.mp3

示例 4:紧急通知

用户:生成一个紧急通知,语速快一点

Agent 决策:
- 音色:male-qn-qingse(清晰男声)
- 语速:1.2(稍快)
- 命令:bun run ${CLAUDE_SKILL_DIR}/scripts/tts.ts "紧急通知:请立即疏散" --voice male-qn-qingse --speed 1.2 --output emergency_notice.mp3

限制说明

  • 同步接口(/v1/t2a_v2):文本 < 10,000 字符,返回 data.audio(hex 编码音频)
  • 异步接口(/v1/t2a_async_v2):文本 < 100 万字符,返回 task_id 后轮询
  • 流式输出:文本 > 3,000 字符推荐使用异步或流式接口
  • 非法字符:控制字符(除 \t 和 \n)超过 10% 会报错
  • 下载时效:音频链接 9 小时内有效
  • 返回格式:tar 压缩包(异步),hex 数据(同步)
  • 音频参数:channel 默认 1(单声道),pitch 范围 [-12, 12]

错误处理

错误原因解决方案
2038未实名认证提醒用户完成 MiniMax 实名认证
Text too long文本超过限制(>100万字)分段处理
Task failed任务失败检查文本内容,重试
"同步接口未返回音频数据"API 响应格式变化或音频为空检查 data.audio 字段,确认返回的是 hex 编码数据
"等待任务超时"异步任务处理时间过长减少文本长度或增加重试次数
"MINIMAX_API_KEY 环境变量未设置"未配置 API Key设置 MINIMAX_API_KEY 环境变量

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

37.07%
按下载量换算43

Claude

30.05%
按下载量换算35

Cursor

20.13%
按下载量换算23

Gemini CLI

10.01%
按下载量换算12

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills