Token导航 LogoToken导航TokenDH.com
待分类敏感数据github未标认证来源可访问许可证需确认审计异常

bailian-multimodal-skills百联多式联运技能

Agent Skill

bailian-multimodal-skills 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

588

周安装

24

GitHub Stars

7

下载量

188
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:bailian-multimodal-skills(百联多式联运技能)
来源仓库:https://github.com/cclank/openclaw_provider_plugins
仓库路径:skills/bailian-multimodal-skills
安装命令:
npx skills add https://github.com/cclank/openclaw_provider_plugins --skill bailian-multimodal-skills
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/cclank/openclaw_provider_plugins --skill bailian-multimodal-skills

简介

bailian-multimodal-skills 集成阿里云百炼多模态模型,支持图像、音视频生成与转录。

  • 覆盖文生图、图生视频、语音识别与文本转语音等多样化 AI 能力。
  • 调用前需参考官方文档配置认证参数与资源配额。
  • 适用于创意内容生产与多媒体应用开发,注意合理使用频率与成本。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

Bailian Multimodal Skills

Generate images, audio, video, and transcribe speech using Aliyun Bailian (Qwen/Wan/PixVerse/Kling/CosyVoice) models.

Features

  • Image Generation: z-image-turbo, wan2.6-t2i, wan2.7-image-pro
  • Image Editing: wan2.7-image-pro
  • Video Editing: wan2.7-videoedit
  • ASR (Speech-to-Text): qwen3-asr-flash
  • TTS (Text-to-Speech): qwen3-tts-flash
  • Text-to-Video: wan2.7-t2v, wan2.6-t2v, pixverse/pixverse-v5.6-t2v, kling/kling-v3-video-generation
  • Image-to-Video: wan2.7-i2v, wan2.6-i2v-flash, wan2.6-i2v, pixverse/pixverse-v5.6-it2v, kling/kling-v3-video-generation
  • Reference-to-Video: wan2.6-r2v-flash, wan2.6-r2v, pixverse/pixverse-v5.6-r2v

Usage

1. Image Generation

Generate images from text.

uv run {baseDir}/scripts/run_multimodal.py --mode image --model z-image-turbo --prompt "A futuristic city" --output "city.png"

Models: z-image-turbo, wan2.6-t2i, wan2.7-image-pro

wan2.7-image-pro supports multi-image sequential generation and 2K size:

uv run {baseDir}/scripts/run_multimodal.py --mode image --model wan2.7-image-pro --prompt "电影感组图,记录同一只流浪橘猫的四季" --n 4 --enable-sequential --size 2K --output "cat_seasons.png"

Options (wan2.7-image-pro): --n (number of images), --enable-sequential (keep character consistency across images), --size (e.g., 2K, 1024*1024), --watermark

2. Image Editing

Edit images with text instructions. Supports multiple input images.

uv run {baseDir}/scripts/run_multimodal.py --mode image-edit --model wan2.7-image-pro --input-images "car.png" "graffiti.png" --prompt "把图2的涂鸦喷绘在图1的汽车上" --output "edited.png"

Options: --input-images (required, one or more image URLs/local paths), --prompt (required, editing instruction), --size (default: 2K), --n, --watermark, --thinking-mode (enable deeper reasoning for complex edits)

3. ASR (Speech Recognition)

Transcribe audio files or URLs to text.

uv run {baseDir}/scripts/run_multimodal.py --mode asr --model qwen3-asr-flash --input-audio "https://example.com/audio.mp3"

4. TTS (Speech Synthesis)

Convert text to speech.

uv run {baseDir}/scripts/run_multimodal.py --mode tts --model qwen3-tts-flash --text "Hello world" --output "hello.wav"

5. Text-to-Video (T2V)

Generate video from text prompt. Async task with auto-polling.

wan2.7-t2v (new protocol — uses resolution + ratio instead of size, no shot_type):

uv run {baseDir}/scripts/run_multimodal.py --mode t2v --model wan2.7-t2v --prompt "一只小猫在月光下奔跑" --resolution 1080P --ratio 16:9 --duration 10 --output "cat.mp4"

Options (wan2.7-t2v): --resolution (720P/1080P, default 1080P), --ratio (16:9/9:16/1:1, default 16:9), --duration, --prompt-extend/--no-prompt-extend, --negative-prompt, --audio-url, --audio/--no-audio, --watermark, --seed

Note: --shot-type is not supported for wan2.7-t2v. Use natural language in --prompt to describe shot structure (e.g., "生成多镜头视频" or timestamp-based descriptions).

wan2.6-t2v and earlier (legacy protocol — uses size and shot-type):

uv run {baseDir}/scripts/run_multimodal.py --mode t2v --model wan2.6-t2v --prompt "一只小猫在月光下奔跑" --duration 10 --size "1280*720" --output "cat.mp4"

Models: wan2.6-t2v, pixverse/pixverse-v5.6-t2v, kling/kling-v3-video-generation

Options: --size (e.g., 1280*720, 1920*1080), --duration, --prompt-extend/--no-prompt-extend, --shot-type single|multi, --negative-prompt, --audio-url, --audio/--no-audio, --watermark, --seed, --quality-mode std|pro

5.5 Video Editing (videoedit)

Edit an existing video with text instructions (style transfer, content modification, etc.).

uv run {baseDir}/scripts/run_multimodal.py --mode videoedit --model wan2.7-videoedit \
  --video-url "https://example.com/input.mp4" \
  --prompt "将整个画面转换为黏土风格" \
  --resolution 1080P \
  --output "edited.mp4"

With reference images (for appearance/style guidance):

uv run {baseDir}/scripts/run_multimodal.py --mode videoedit --model wan2.7-videoedit \
  --video-url "clip.mp4" \
  --prompt "为人物换上参考图里的服装" \
  --ref-images "outfit.png" \
  --resolution 1080P \
  --output "result.mp4"

Models: wan2.7-videoedit

Options:

  • --video-url (required): input video URL or local file path
  • --prompt (optional): editing instruction (up to 5000 chars)
  • --negative-prompt (optional): content to avoid
  • --ref-images (optional): one or more reference image URLs/local paths
  • --resolution (720P/1080P, default 1080P)
  • --ratio (16:9/9:16/1:1; omit to preserve input video's ratio)
  • --prompt-extend/--no-prompt-extend (default: enabled)
  • --watermark, --seed
Note: Billing = input video duration + output video duration (seconds).

6. Image-to-Video (I2V)

Generate video from a reference image (first frame).

wan2.7-i2v (new protocol — uses resolution + ratio):

uv run {baseDir}/scripts/run_multimodal.py --mode i2v --model wan2.7-i2v --img-url "photo.png" --prompt "人物微微歪头,自然眨眼,浅笑" --resolution 1080P --ratio 9:16 --duration 10 --output "result.mp4"

Options (wan2.7-i2v): --img-url (required), --prompt, --resolution (720P/1080P, default 1080P), --ratio (16:9/9:16/1:1), --duration, --prompt-extend/--no-prompt-extend, --negative-prompt, --audio-url, --audio/--no-audio, --watermark, --seed

wan2.6 and other models:

uv run {baseDir}/scripts/run_multimodal.py --mode i2v --model wan2.6-i2v-flash --img-url "https://example.com/cat.png" --prompt "A cat running" --resolution 720P --duration 5 --output "cat_run.mp4"

Models: wan2.6-i2v-flash, wan2.6-i2v, pixverse/pixverse-v5.6-it2v, kling/kling-v3-video-generation

Options: --img-url (required, image URL, base64, or local file path), --prompt, --resolution (480P/720P/1080P), --duration, --prompt-extend/--no-prompt-extend, --shot-type single|multi, --negative-prompt, --audio-url, --audio/--no-audio, --watermark, --seed, --quality-mode std|pro

7. Reference-to-Video (R2V)

Generate video with character/object references (images or videos as actors).

uv run {baseDir}/scripts/run_multimodal.py --mode r2v --model wan2.6-r2v-flash --prompt "character1 在公园里散步" --reference-urls "https://example.com/person.png" --size "1280*720" --duration 5 --output "walk.mp4"

Multi-character example:

uv run {baseDir}/scripts/run_multimodal.py --mode r2v --model wan2.6-r2v-flash --prompt "character1 对 character2 说你好" --reference-urls "https://example.com/role1.mp4" "https://example.com/role2.png" --shot-type multi --output "dialog.mp4"

Models: wan2.6-r2v-flash, wan2.6-r2v, pixverse/pixverse-v5.6-r2v

Options: --reference-urls (required, space-separated, up to 5, supports local file paths), --prompt (required, use character1/character2 to map references), --size, --duration, --shot-type single|multi, --negative-prompt, --no-audio, --watermark, --seed

Notes

  • 本地文件处理:脚本自动处理本地路径。wan2.7-videoedit 模式会将本地视频/图片上传到 DashScope OSS 获取 oss:// URL;其他模式(image/i2v/r2v 等)使用 SDK 自带的 file:// URL 传入。
  • PixVerse 与 Kling 模型以 URL 方式提交媒体;脚本已兼容本地路径输入,但若百炼后端对某些模型拒绝 file://,请改用可公网访问的 HTTP/HTTPS URL。

Configuration

API Key 按以下优先级读取:

  1. 命令行参数 --api-key
  2. 环境变量 DASHSCOPE_API_KEY
  3. 配置文件 ~/.config/bailian-multimodal/api_key.txt
# 方式一:环境变量
export DASHSCOPE_API_KEY="sk-..."

# 方式二:配置文件
mkdir -p ~/.config/bailian-multimodal
echo "sk-..." > ~/.config/bailian-multimodal/api_key.txt

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

35.63%
按下载量换算67

Claude

28.2%
按下载量换算53

Cursor

17.85%
按下载量换算34

Gemini CLI

9.37%
按下载量换算18

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

未通过

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills