Token导航 LogoToken导航TokenDH.com
效率需要联网clawhub未标认证来源可访问clear审计提醒

video-dubbing视频配音

Agent Skill

用于辅助视频生成、动画合成、脚本化剪辑或 Remotion 等视频项目开发。它适合让 Agent 组织镜头、生成素材说明、维护合成代码或排查渲染问题。使用时需要确认分辨率、时长、素材路径和导出格式;涉及外部素材、人物肖像或商业发布时,应先核对版权授权和内容审核要求。

总安装

4,039

周安装

165

GitHub Stars

公开资料未说明

下载量

1,294
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:video-dubbing(视频配音)
来源仓库:https://github.com/newaiguy/video-dubbing
安装命令:
openclaw skills install video-dubbing
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install video-dubbing

简介

🎯 **唯一使用VoxCPM的中文配音技能** - 外语视频一键中文配音,支持硬字幕检测、断点续传、智能BGM。触发场景:(1) 用户需要给外语视频配音 (2) 视频翻译需求 (3) 多语言内容本地化

SKILL.md

name
voxcpm-chinese-dubbing
description
🎯 唯一使用VoxCPM的中文配音技能 - 外语视频一键中文配音,支持硬字幕检测、断点续传、智能BGM。触发场景:(1) 用户需要给外语视频配音 (2) 视频翻译需求 (3) 多语言内容本地化
version
1.1.0
author
newaiguy
tags
[video, dubbing, voxcpm, chinese, translation, whisper, tts]
credentials
description
翻译API密钥(SiliconFlow/兼容OpenAI格式的API)
required
true
description
VoxCPM模型目录路径
required
true
endpoints
description
翻译API端点
default
https://api.siliconflow.cn/v1/chat/completions
description
硬字幕检测API端点(支持Vision模型)
default
https://api.siliconflow.cn/v1/chat/completions
paths
description
工作目录
default
./workspace
description
TTS参考音频路径
default
./reference_audio/speaker.wav
external_calls
trigger
自动调用(配音流程中必需)
trigger
自动调用(可选,检测视频是否有烧录字幕)

🎬 VoxCPM中文视频配音

唯一使用VoxCPM开源模型的中文配音技能 生产环境验证 ✅ | 断点续传 ✅ | 智能BGM ✅

🌟 核心卖点

特性说明
🎯 VoxCPM独家唯一集成VoxCPM开源TTS模型的中文配音技能
生产验证已在B站成功发布4个视频
🔄 断点续传中断后可继续,无需重新生成
🔍 硬字幕检测AI自动检测并覆盖原字幕
🎵 智能BGM自动循环、交叉淡入淡出

📋 完整流程

1. Whisper转写    → medium模型转写 + 时间戳
2. AI翻译        → 腾讯混元MT翻译模型
3. 分组TTS       → VoxCPM配音(按组生成,保持连贯)
4. 音频匹配      → 智能拉伸/加静音
5. 硬字幕检测    → AI自动检测是否需要遮盖
6. 字幕生成      → 中文字幕(自动换行)
7. 视频合并      → GPU加速编码

🚀 快速开始

1. 安装依赖

# Python依赖
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
pip install openai-whisper soundfile scipy librosa requests

# VoxCPM(从官方获取)
git clone https://github.com/modelscope/VoxCPM.git

2. 配置

复制配置模板:

cp config.example.json config.json

编辑 config.json

{
  "work_dir": "./workspace",
  "voxcpm_dir": "./VoxCPM",
  "ffmpeg_path": "ffmpeg",
  "translate": {
    "api_url": "https://api.siliconflow.cn/v1/chat/completions",
    "api_key": "YOUR_API_KEY",
    "model": "tencent/Hunyuan-MT-7B"
  },
  "vision": {
    "api_url": "https://api.siliconflow.cn/v1/chat/completions",
    "model": "Qwen/Qwen2.5-VL-72B-Instruct"
  },
  "tts": {
    "reference_audio": "./reference_audio/speaker.wav",
    "reference_text": "参考音频对应的文本"
  }
}
注意: 所有配置项均可通过环境变量覆盖,优先级:环境变量 > config.json > 默认值

### 3. 运行

python scripts/dubbing.py your_video.mp4


输出:
- `workspace/output/your_video_dubbed.mp4` - 配音视频
- `workspace/output/your_video.srt` - 字幕文件

## ⚙️ 参数说明

### Whisper参数

| 参数 | 默认值 | 说明 |
|------|--------|------|
| `whisper.model` | medium | Whisper模型大小 |
| `whisper.language` | en | 源语言 |

### TTS参数

| 参数 | 默认值 | 说明 |
|------|--------|------|
| `tts.max_group_duration` | 15.0 | 每组最大时长(秒) |
| `tts.inference_timesteps` | 10 | 推理步数 |
| `tts.cfg_value` | 2.0 | CFG值 |

### 字幕参数

| 参数 | 默认值 | 说明 |
|------|--------|------|
| `subtitle.fontsize` | 16 | 字体大小 |
| `subtitle.fontname` | SimHei | 字体名称 |
| `subtitle.outline` | 2 | 描边宽度 |

## 🎵 BGM添加

python scripts/add_bgm.py <视频> [BGM文件] [输出文件]


特性:
- BGM自动循环(交叉淡入淡出3秒)
- 音量控制(默认12%)
- 自动淡入淡出

## 🔧 高级用法

### 测试模式

只处理前30秒:

python scripts/dubbing.py video.mp4 --test 30


### 指定输出名

python scripts/dubbing.py video.mp4 --output my_video


### 自定义配置

python scripts/dubbing.py video.mp4 --config my_config.json


## 📁 文件结构

video-dubbing/ ├── SKILL.md # 本文档 ├── config.example.json # 配置模板 ├── scripts/ │ ├── dubbing.py # 主流程脚本 │ ├── add_bgm.py # BGM添加 │ └── upload_bilibili.py # B站上传 └── reference_audio/ # TTS参考音频 └── speaker.wav


## 🔑 环境变量

| 变量 | 说明 | 默认值 |
|------|------|--------|
| `TRANSLATE_API_KEY` | 翻译API密钥(必需) | - |
| `VOXCPM_DIR` | VoxCPM目录 | `./VoxCPM` |
| `WORK_DIR` | 工作目录 | `./workspace` |
| `REFERENCE_AUDIO` | TTS参考音频路径 | `./reference_audio/speaker.wav` |
| `REFERENCE_TEXT` | 参考音频对应文本 | - |
| `TRANSLATE_API_URL` | 翻译API端点 | SiliconFlow |
| `TRANSLATE_MODEL` | 翻译模型 | `tencent/Hunyuan-MT-7B` |
| `VISION_API_URL` | 硬字幕检测API端点 | SiliconFlow |
| `VISION_MODEL` | Vision模型 | `Qwen/Qwen2.5-VL-72B-Instruct` |
| `WHISPER_MODEL` | Whisper模型 | `medium` |
| `WHISPER_LANGUAGE` | 源语言 | `en` |
| `FFMPEG_PATH` | ffmpeg路径 | `ffmpeg` |

## 📊 音频匹配质量

| ratio范围 | 方法 | 质量 |
|-----------|------|------|
| < 0.85 | 加静音 | ✅ 无损 |
| 0.85-1.15 | resample | ✅ 轻微调整 |
| > 1.15 | librosa加速 | ⚠️ 轻微失真 |

**实测:60%+组无损音质**

## ⚠️ 注意事项

### AV1编码视频

AV1编码视频需要重新编码:

使用GPU编码

-c:v h264_nvenc

或CPU编码

-c:v libx264


### VoxCPM模型

需要从ModelScope获取VoxCPM模型:

下载模型到指定目录

modelscope download --model modelscope/VoxCPM --local_dir ./VoxCPM


## 📜 许可证

MIT License

## 🙏 致谢

- [VoxCPM](https://github.com/modelscope/VoxCPM) - 高质量中文TTS
- [OpenAI Whisper](https://github.com/openai/whisper) - 语音识别
- [Hunyuan-MT](https://huggingface.co/tencent/Hunyuan-MT-7B) - 翻译模型

---

**🎯 选择VoxCPM中文配音的理由:**
1. 开源免费,无商业限制
2. 中文效果最佳,自然流畅
3. 支持声音克隆(参考音频)
4. 本地运行,数据安全

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

75.27%
按下载量换算974

安全审计

VirusTotal

通过

ClawScan

可疑

Static analysis

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills