Token导航 LogoToken导航TokenDH.com
效率敏感数据clawhub未标认证来源可访问clear审计提醒

jetson-cuda-voice杰森 cuda 语音

Agent Skill

用于辅助音频、音乐、语音转写、语音合成或声音素材处理。它适合让 Agent 生成配乐说明、整理音频流程、调用语音工具或处理播客和视频配音素材。使用时需要确认输入音频来源、输出格式、时长和模型限制;涉及人声克隆、版权音乐或公开发布时,应先核对授权和合规边界。

总安装

18,238

周安装

745

GitHub Stars

公开资料未说明

下载量

5,722
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:jetson-cuda-voice(杰森 cuda 语音)
来源仓库:https://github.com/nikil511/jetson-cuda-voice
安装命令:
openclaw skills install jetson-cuda-voice
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install jetson-cuda-voice

简介

基于 NVIDIA Jetson 平台的离线 CUDA 加速语音助手。

  • 支持唤醒词识别、实时 VAD 和 GPU 加速语音转写。
  • 适用于本地语音处理无需联网的场景。
  • 安装命令:openclaw skills install jetson-cuda-voice
  • 注意模型限制和音频格式兼容性jetson-cuda-voice 属于效率类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

name
jetson-cuda-voice
version
1.1.0
description
>
metadata
openclaw
emoji
🎙️
os
["linux"]
requires
bins
["arecord", "aplay", "python3"]
env
["OPENROUTER_API_KEY"]
notes
hardware
>
Mic
ReSpeaker USB Mic Array v1.0 (VID 2886:PID 0007) — requires S24_3LE format.
Speaker
any ALSA device. LED feedback optional (requires pyusb).

Jetson CUDA Voice Pipeline

Fully offline, GPU-accelerated local voice assistant for NVIDIA Jetson devices. No cloud for STT or TTS — only the LLM call uses the internet (OpenRouter or any OpenAI-compatible endpoint).

Architecture

ReSpeaker mic (hw:Array,0, S24_3LE, 16kHz)
    ↓ arecord raw stream — never restarted mid-conversation
openWakeWord — "Hey Jarvis" detection (~32ms chunks)
    ↓ wake word triggered → two-tone beep
_measure_ambient() — 480ms median RMS → dynamic VAD thresholds
    ↓
transcribe_stream() — VAD + whisper.cpp CUDA HTTP (~2-4s per utterance)
    ↓
ask_llm() — OpenRouter or local OpenAI-compatible API (~1-2s)
    ↓
Piper TTS — offline neural TTS, hot-loaded at startup → aplay
    ↓
ReSpeaker LEDs: 🔵 blue=listening  🩵 cyan=thinking  ⚫ off=done  🔴 red=error

Total latency: ~5-8 seconds from wake word to first spoken word.

Key Features

  • Zero mic-restart gap — same arecord pipe feeds wake word detection and STT
  • Dynamic ambient calibration — measures room noise floor on every wake word trigger (adapts to fans, AC, time of day)
  • Conversation history — 20-turn rolling context for natural follow-ups
  • Auto language detection — whisper -l auto, works multilingual
  • ReSpeaker LED ring — visual state feedback (silent no-op if device not present)
  • Fully configurable — all paths and thresholds via environment variables

Hardware Requirements

ComponentTestedNotes
Jetson Xavier NXARM64, sm_72, 8GB, JetPack 5.1.4
ReSpeaker USB Mic Array v1.02886:0007, S24_3LE, 16kHz
Any ALSA speakertested with Creative MUVO 2c
Other Jetson modelschange CMAKE_CUDA_ARCHITECTURES

Quick Start

# 1. Install Python deps
pip install openwakeword piper-tts numpy requests pyusb

# 2. Build whisper.cpp with CUDA (see BUILD.md — ~45 min, one-time)
#    Then place binary at ~/.local/bin/whisper-server-gpu

# 3. Download Piper voice model
mkdir -p ~/.local/share/piper/voices && cd ~/.local/share/piper/voices
wget https://huggingface.co/rhasspy/piper-voices/resolve/main/en/en_US/lessac/medium/en_US-lessac-medium.onnx
wget https://huggingface.co/rhasspy/piper-voices/resolve/main/en/en_US/lessac/medium/en_US-lessac-medium.onnx.json

# 4. Install and start services
export OPENROUTER_API_KEY=your-key-here
bash pipeline/setup.sh
bash pipeline/manage.sh start

# Say "Hey Jarvis" — blue LED = listening

Setup Details

Build whisper.cpp with CUDA

See BUILD.md for full instructions. Critical flag:

cmake .. -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=72 -DCMAKE_BUILD_TYPE=Release
make -j4   # ~45 min — detach with nohup if needed
⚠️ CMAKE_CUDA_ARCHITECTURES=72 (sm_72 = Xavier NX) is critical. Default multi-arch compilation OOMs on 8GB Jetson.

Architecture map:

  • Xavier NX / AGX Xavier → 72
  • Orin → 87
  • TX2 → 62
  • Nano → 53

Piper Voice Models

mkdir -p ~/.local/share/piper/voices && cd "$_"

# English (required)
wget https://huggingface.co/rhasspy/piper-voices/resolve/main/en/en_US/lessac/medium/en_US-lessac-medium.onnx
wget https://huggingface.co/rhasspy/piper-voices/resolve/main/en/en_US/lessac/medium/en_US-lessac-medium.onnx.json

# Greek (optional — any language from huggingface.co/rhasspy/piper-voices works)
wget https://huggingface.co/rhasspy/piper-voices/resolve/main/el/el_GR/rapunzelina/medium/el_GR-rapunzelina-medium.onnx
wget https://huggingface.co/rhasspy/piper-voices/resolve/main/el/el_GR/rapunzelina/medium/el_GR-rapunzelina-medium.onnx.json

Service Install

setup.sh writes and enables the systemd user services automatically:

bash pipeline/setup.sh [/path/to/voice_pipeline.py] [API_KEY]

Or with env var:

OPENROUTER_API_KEY=sk-... bash pipeline/setup.sh

Re-run to update an existing install.

ReSpeaker Mic Gain & USB Autosuspend

# Optimal gain (no clipping, RMS ~180 ambient)
amixer -c 0 set Mic 90

# Prevent USB autosuspend (mic sleeps after 2s idle without this)
sudo tee /etc/udev/rules.d/99-usb-audio-nosuspend.rules << 'EOF'
ACTION=="add", SUBSYSTEM=="usb", ATTR{idVendor}=="2886", ATTR{idProduct}=="0007", \
  ATTR{power/control}="on", ATTR{power/autosuspend}="-1"
EOF
sudo udevadm control --reload-rules

Management

bash pipeline/manage.sh start     # start both services
bash pipeline/manage.sh stop      # stop both services
bash pipeline/manage.sh restart   # restart both
bash pipeline/manage.sh status    # systemd status
bash pipeline/manage.sh logs      # tail live log
bash pipeline/manage.sh test-mic  # record 4s + play back
bash pipeline/manage.sh test-stt  # record 4s + transcribe
bash pipeline/manage.sh test-tts  # speak a test phrase

Environment Variables

VariableDefaultDescription
OPENROUTER_API_KEY*(required)*API key for OpenRouter (or any OpenAI-compatible provider)
VOICE_MIChw:Array,0ALSA mic device name
VOICE_SPEAKERhw:C2c,0ALSA speaker device name
VOICE_LLM_URLOpenRouterLLM API endpoint
VOICE_LLM_MODELanthropic/claude-3.5-haikuModel name
VOICE_WAKE_THRESHOLD0.5Wake word confidence (0.0–1.0)
VOICE_SPEECH_RMS400Fallback speech RMS threshold
VOICE_SILENCE_RMS250Fallback silence RMS threshold
VOICE_UTC_OFFSET0Timezone offset hours for LLM context
PIPER_VOICES_DIR~/.local/share/piper/voicesPiper voice models directory
WHISPER_URLhttp://127.0.0.1:8181/inferencewhisper-server endpoint
WHISPER_BIN~/.local/bin/whisper-server-gpuwhisper-server binary (used by setup.sh)
WHISPER_MODEL~/.local/share/whisper/models/ggml-base.binWhisper model (used by setup.sh)

Troubleshooting

Mic records silence

  • Check gain: amixer -c 0 set Mic 90
  • Use card name not number (hw:Array,0 not hw:0,0) — numbers shift on reboot
  • ReSpeaker requires S24_3LE format, not S16_LE
  • Disable USB autosuspend (see setup above)

Records full 6s timeout, never cuts off

  • Room ambient noise > VOICE_SILENCE_RMS fallback. Dynamic calibration handles this automatically.
  • If still an issue, set VOICE_SILENCE_RMS slightly above your measured ambient floor.

[BEEPING] or (bell dings) in transcript

  • Speaker beep being picked up by mic. The 0.3s drain buffer after beep handles this.
  • Check speaker/mic distance and speaker volume.

Whisper OOM during build

  • Must use -DCMAKE_CUDA_ARCHITECTURES=72 — default multi-arch build exhausts 8GB RAM.
  • Use -j4 not -j6.

LED not lighting up

  • Install pyusb: pip install pyusb
  • Only supported on ReSpeaker USB Mic Array v1.0 (2886:0007)
  • All LED errors are silent — pipeline continues without it.

Wake word triggers constantly (false positives)

  • Lower VOICE_WAKE_THRESHOLD to 0.7 or higher.
  • Ensure no TV/radio playing phrases close to "Hey Jarvis".

File Structure

jetson-cuda-voice/
├── SKILL.md                  ← this file
├── BUILD.md                  ← whisper.cpp CUDA build guide
└── pipeline/
    ├── voice_pipeline.py     ← main pipeline
    ├── led.py                ← ReSpeaker LED control (optional)
    ├── setup.sh              ← one-command service installer
    └── manage.sh             ← start/stop/status/test

适合场景

01

调用多模型

02

代码和文本生成

03

Agent 推理流程

04

OpenRouter 模型接入

能力概览

能力 1

统一调用多种 LLM

能力 2

支持 Claude、Gemini、Kimi 等模型

能力 3

适合聊天、代码和推理任务

能力 4

可作为 Agent 模型调用入口

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

93.02%
按下载量换算5,323

安全审计

VirusTotal

可疑

ClawScan

通过

Static analysis

未展示

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills