Token导航 LogoToken导航TokenDH.com
研究检索需要联网github未标认证来源可访问许可证需确认审计提醒

faion-multimodal-aifaion 多式联运 AI

Agent Skill

faion-multimodal-ai 用于查找、检索和筛选相关信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要根据关键词、任务场景或来源线索快速定位候选结果时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

269

周安装

11

GitHub Stars

2

下载量

87
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:faion-multimodal-ai(faion 多式联运 AI)
来源仓库:https://github.com/faionfaion/faion-network
仓库路径:skills/faion-multimodal-ai
安装命令:
npx skills add https://github.com/faionfaion/faion-network --skill faion-multimodal-ai
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/faionfaion/faion-network --skill faion-multimodal-ai

简介

faion-multimodal-ai 处理视觉、语音等多模态应用,支持图像生成和视频合成。

  • 可分析媒体文件输入和 API 调用模式,但不直接操作原始素材。
  • 适用于创意内容生产和跨模态检索系统开发。
  • 安装命令:npx skills add https://github.com/faionfaion/faion-network --skill faion-multimodal-ai。
  • 版权素材使用需遵守平台政策,避免生成侵权内容。

SKILL.md

Entry point: /faion-net — invoke this skill for automatic routing to the appropriate domain.

Multimodal AI Skill

Communication: User's language. Code: English.

Purpose

Handles multimodal AI applications. Covers vision, image generation, video generation, speech, and voice synthesis.

Context Discovery

Auto-Investigation

Check these project signals before asking questions:

SignalWhere to CheckWhat to Look For
Dependenciespackage.json, requirements.txtopenai, PIL/pillow, ffmpeg-python, elevenlabs
Media files/images, /audio, /videoInput files to process
API usageGrep for "images.generate", "audio.transcriptions"Existing multimodal APIs
Output dirs/generated, /outputWhere generated content goes

Discovery Questions

question: "Which modality are you working with?"
header: "Modality"
multiSelect: true
options:
  - label: "Vision (image understanding)"
    description: "GPT-4o Vision, Gemini Vision for OCR/analysis"
  - label: "Image generation"
    description: "DALL-E 3, Midjourney, Stable Diffusion"
  - label: "Video generation/understanding"
    description: "Sora, Runway, or video analysis"
  - label: "Speech-to-text"
    description: "Whisper, Deepgram for transcription"
  - label: "Text-to-speech"
    description: "OpenAI TTS, ElevenLabs for voice synthesis"
question: "What's your primary use case?"
header: "Use Case"
multiSelect: false
options:
  - label: "Document/receipt OCR and analysis"
    description: "Extract structured data from images"
  - label: "Content generation (images/videos)"
    description: "Create marketing/creative assets"
  - label: "Accessibility (vision/speech conversion)"
    description: "Convert between modalities for a11y"
  - label: "Voice assistant/bot"
    description: "Speech → Text → LLM → TTS pipeline"
question: "Volume and latency requirements?"
header: "Scale"
multiSelect: false
options:
  - label: "Low volume, quality over speed"
    description: "Use premium models (HD TTS, GPT-4o Vision)"
  - label: "High volume, optimize for cost"
    description: "Batch APIs, smaller models"
  - label: "Real-time required"
    description: "Streaming APIs (Deepgram, OpenAI TTS)"
  - label: "Async processing OK"
    description: "Queue-based approach"

Scope

AreaCoverage
VisionGPT-4o Vision, Gemini Vision, image understanding
Image GenerationDALL-E 3, Midjourney, Stable Diffusion
Video GenerationSora, Runway, Pika
Speech-to-TextWhisper, Deepgram, AssemblyAI
Text-to-SpeechOpenAI TTS, ElevenLabs, Google TTS
VoiceReal-time voice, voice cloning

Quick Start

TaskFiles
Vision APIvision-basics.md → vision-applications.md
Image generationimg-gen-basics.md → img-gen-tools.md
Video generationvideo-gen-basics.md → video-gen-tools.md
Speech-to-textspeech-to-text-basics.md → speech-to-text-advanced.md
Text-to-speechtts-basics.md → tts-implementation.md
Voice synthesisvoice-basics.md → voice-implementation.md

Methodologies (12)

Vision (2):

  • vision-basics: Image understanding, OCR, scene analysis
  • vision-applications: Use cases, production patterns

Image Generation (2):

  • img-gen-basics: Prompt engineering, models
  • img-gen-tools: DALL-E 3, Midjourney, Stable Diffusion

Video Generation (2):

  • video-gen-basics: Fundamentals, prompting
  • video-gen-tools: Sora, Runway, Pika, Luma

Speech-to-Text (2):

  • speech-to-text-basics: Whisper API, real-time
  • speech-to-text-advanced: Diarization, timestamps

Text-to-Speech (2):

  • tts-basics: Voice selection, SSML
  • tts-implementation: Production patterns, streaming

Voice (2):

  • voice-basics: Real-time voice, cloning
  • voice-implementation: Integration patterns

Code Examples

GPT-4o Vision

from openai import OpenAI

client = OpenAI()

response = client.chat.completions.create(
    model="gpt-4o",
    messages=[{
        "role": "user",
        "content": [
            {"type": "text", "text": "What's in this image?"},
            {"type": "image_url", "image_url": {"url": "https://..."}}
        ]
    }]
)

DALL-E 3 Image Generation

from openai import OpenAI

client = OpenAI()

response = client.images.generate(
    model="dall-e-3",
    prompt="A futuristic city with flying cars",
    size="1024x1024",
    quality="hd",
    n=1
)

image_url = response.data[0].url

Whisper Speech-to-Text

from openai import OpenAI

client = OpenAI()

audio_file = open("speech.mp3", "rb")
transcription = client.audio.transcriptions.create(
    model="whisper-1",
    file=audio_file,
    response_format="verbose_json",
    timestamp_granularities=["word"]
)

print(transcription.text)

OpenAI TTS

from openai import OpenAI
from pathlib import Path

client = OpenAI()

response = client.audio.speech.create(
    model="tts-1-hd",
    voice="alloy",
    input="Hello, this is a test of text to speech."
)

response.stream_to_file("speech.mp3")

Gemini Vision

import google.generativeai as genai

genai.configure(api_key="...")
model = genai.GenerativeModel('gemini-pro-vision')

image = PIL.Image.open("image.jpg")
response = model.generate_content([
    "Describe this image in detail",
    image
])

print(response.text)

Model Comparison

Vision Models

ModelBest ForMax Image Size
GPT-4oGeneral vision, OCR20MB
Gemini Pro VisionHigh-res images20MB
Claude Sonnet 4Document analysis5MB

Image Generation

ModelBest ForCost
DALL-E 3Photorealistic, text$$$
MidjourneyArtistic, creative$$
Stable DiffusionCustom, open-sourceFree/$

Speech-to-Text

ServiceBest ForLanguages
WhisperGeneral, multilingual99
DeepgramReal-time, low latency30+
AssemblyAIFeatures, diarization10+

Text-to-Speech

ServiceBest ForVoices
OpenAI TTSQuality, variety6
ElevenLabsCloning, realismCustom
Google TTSLanguages, SSML400+

Use Cases

Use CaseModalities
Document analysisVision → Text
Video narrationVideo → Speech → TTS
Voice assistantSpeech → LLM → TTS
Content generationText → Images/Video
AccessibilityVision → TTS, Speech → Text

Related Skills

SkillRelationship
faion-llm-integrationProvides vision APIs
faion-ai-agentsMultimodal agents

*Multimodal AI v1.0 | 12 methodologies*

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

34.15%
按下载量换算30

Claude

28.91%
按下载量换算25

Cursor

18.84%
按下载量换算16

Gemini CLI

9.25%
按下载量换算8

安全审计

Gen Agent Trust Hub

可疑

Socket

通过

Snyk

可疑

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills