Token导航 LogoToken导航TokenDH.com
效率敏感数据clawhub未标认证来源可访问clear审计提醒

yuyonghao-multimodal-base余永浩多式联运基地

Agent Skill

yuyonghao-multimodal-base 用于处理图像、截图、视觉识别或图片素材相关工作,适合在 OpenClaw 中需要让 Agent 分析图片、整理视觉素材或辅助图像流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

4,029

周安装

163

GitHub Stars

公开资料未说明

下载量

1,265
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:yuyonghao-multimodal-base(余永浩多式联运基地)
来源仓库:https://github.com/yuyonghao-123/yuyonghao-multimodal-base
安装命令:
openclaw skills install yuyonghao-multimodal-base
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install yuyonghao-multimodal-base

简介

支持使用 OpenAI 和 Edge TTS 进行多语音和多模态统一处理的图像理解、OCR、语音转文本和文本转语音合成。

SKILL.md

Multimodal Base Skill

version: 0.1.0

OpenClaw 多模态基础 - 图像理解 + 语音识别 + 语音合成

功能特性

  • 图像理解: GPT-4V API 图像描述、OCR 文字提取、图表分析
  • 语音识别: Whisper 语音转文字(支持本地/API 模式)
  • 语音合成: Edge TTS 文字转语音(8 种音色)
  • 统一管道: 多模态输入输出统一处理

安装

cd skills/multimodal-base
npm install

# 安装 Edge TTS(需要 Python)
pip install edge-tts

# 可选:安装 FFmpeg(音频处理)
# Windows: winget install FFmpeg

快速开始

import { MultimodalPipeline } from './src/multimodal-pipeline.js';

// 创建管道
const pipeline = new MultimodalPipeline({
  image: {
    openaiApiKey: 'your-api-key'
  },
  speech: {
    mode: 'api', // 'local' 或 'api'
    openaiApiKey: 'your-api-key'
  },
  tts: {
    outputDir: './output'
  }
});

// 处理图像
const imageResult = await pipeline.processInput({
  type: 'image',
  path: './photo.jpg'
});
console.log(imageResult.content.image.description);

// 处理语音
const audioResult = await pipeline.processInput({
  type: 'audio',
  path: './recording.wav'
});
console.log(audioResult.content.audio.transcript);

// 生成语音输出
const output = await pipeline.generateOutput(
  '这是合成的语音',
  { speak: true, voice: 'zh-CN-XiaoxiaoNeural' }
);
console.log(output.content.audio.path);

API 参考

MultimodalPipeline

processInput(input)

处理多模态输入

// 文本输入
await pipeline.processInput({
  type: 'text',
  content: '你好'
});

// 图像输入
await pipeline.processInput({
  type: 'image',
  path: './image.jpg',
  prompt: '描述这张图片'
});

// 语音输入
await pipeline.processInput({
  type: 'audio',
  path: './audio.wav'
});

// 多模态输入
await pipeline.processInput({
  type: 'multimodal',
  text: '请分析',
  image: './chart.png'
});

generateOutput(text, options)

生成输出(支持语音)

await pipeline.generateOutput('你好', {
  speak: true,
  voice: 'zh-CN-XiaoxiaoNeural',
  rate: 1.0,
  pitch: 0
});

ImageProcessor

understand(imagePath, prompt)

理解图像内容

import ImageProcessor from './src/image-processor.js';

const processor = new ImageProcessor({ openaiApiKey: 'key' });
const result = await processor.understand('./photo.jpg', '描述内容');
// { description: '...', tokens: 123 }

ocr(imagePath)

OCR 文字提取

const result = await processor.ocr('./document.png');
// { text: '...', confidence: 95 }

SpeechRecognizer

recognize(audioPath)

语音识别

import SpeechRecognizer from './src/speech-recognizer.js';

const recognizer = new SpeechRecognizer({
  mode: 'api',
  openaiApiKey: 'key'
});

const result = await recognizer.recognize('./audio.wav');
// { text: '...', confidence: 0.95 }

SpeechSynthesizer

synthesize(text, options)

语音合成

import SpeechSynthesizer from './src/speech-synthesizer.js';

const tts = new SpeechSynthesizer();
const result = await tts.synthesize('你好', {
  voice: 'zh-CN-XiaoxiaoNeural',
  rate: 1.2
});
// { audioPath: './output/tts_xxx.mp3', duration: 1.5 }

getVoices()

获取可用音色

const voices = tts.getVoices();
// [{ id: 'zh-CN-XiaoxiaoNeural', name: '晓晓', ... }]

配置选项

完整配置

const pipeline = new MultimodalPipeline({
  // 图像处理
  image: {
    openaiApiKey: process.env.OPENAI_API_KEY,
    model: 'gpt-4o',
    baseURL: 'https://api.openai.com/v1'
  },
  
  // 语音识别
  speech: {
    mode: 'api', // 'local' 或 'api'
    modelPath: './models/ggml-base.bin',
    openaiApiKey: process.env.OPENAI_API_KEY,
    language: 'zh'
  },
  
  // 语音合成
  tts: {
    outputDir: './output',
    defaultVoice: 'zh-CN-XiaoxiaoNeural'
  },
  
  // 历史记录
  maxHistory: 100
});

音色列表

ID名称性别语言
zh-CN-XiaoxiaoNeural晓晓中文
zh-CN-XiaoyiNeural晓伊中文
zh-CN-YunjianNeural云健中文
zh-CN-YunxiNeural云希中文
en-US-AriaNeuralAria英文
en-US-GuyNeuralGuy英文
ja-JP-NanamiNeural七海日文
ko-KR-SunHiNeural善熙韩文

注意事项

  1. API Key: 图像理解和语音识别需要 OpenAI API Key
  2. Edge TTS: 需要 Python 环境和 edge-tts
  3. 音频格式: 支持 WAV、MP3、M4A 等常见格式
  4. 图像大小: 最大 20MB
  5. 音频大小: 最大 25MB(OpenAI 限制)

License

MIT

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

88.91%
按下载量换算1,125

安全审计

VirusTotal

通过

ClawScan

可疑

Static analysis

可疑

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills