Token导航 LogoToken导航TokenDH.com
图像处理敏感数据github未标认证来源可访问许可证需确认审计通过

image-generation图像生成

Agent Skill

用于辅助图像生成、图片编辑、视觉素材处理或图像模型工作流。它适合让 Agent 根据文本生成图片、处理背景、整理视觉提示词或调用相关图像工具。使用时需要确认输入图片、版权来源、输出格式和模型限制;涉及人物、品牌、商品或公开展示素材时,应额外核对授权、真实性和内容合规边界。

总安装

541

周安装

23

GitHub Stars

968

下载量

190
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:image-generation(图像生成)
来源仓库:https://github.com/massgen/massgen
仓库路径:skills/image-generation
安装命令:
npx skills add https://github.com/massgen/massgen --skill image-generation
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/massgen/massgen --skill image-generation

简介

image-generation 辅助图像生成和图片编辑,支持视觉素材处理和图像模型工作流调用。

  • 适用于文本生成图片、背景处理和提示词整理等图像处理场景。
  • 通过输入图片、版权来源和输出格式参数配置实现图像生成。
  • 涉及人物或品牌素材时应额外核对授权和真实性边界。
  • 安装命令为 npx skills add https://github.com/massgen/massgen --skill image-generation。

SKILL.md

Image Generation

Generate images using generate_media with mode="image". The system auto-selects the best backend based on available API keys.

Quick Start

# Simple text-to-image (auto-selects backend)
generate_media(prompt="A cat in space", mode="image")

# Specify backend and quality
generate_media(prompt="A logo for a coffee shop", mode="image",
               backend_type="openai", quality="high")

# Batch generation (parallel)
generate_media(prompts=["sunset over ocean", "mountain landscape", "city at night"],
               mode="image", max_concurrent=3)

Backend Comparison

BackendDefault ModelStrengthsAPI Key
Google (priority 1)gemini-3.1-flash-image-preview (Nano Banana 2)Fast, flexible sizes, image editing, multi-turnGOOGLE_API_KEY or GEMINI_API_KEY
OpenAI (priority 2)gpt-5.4High quality, transparent backgrounds, continuation via response IDOPENAI_API_KEY
Grok (priority 3)grok-imagine-image1k resolution, continuation via stored data URIXAI_API_KEY
OpenRouter (priority 4)google/gemini-3.1-flash-image-previewAccess to multiple models via single APIOPENROUTER_API_KEY

Key Parameters

ParameterDescriptionExample
promptText description of the image"A watercolor painting of mountains"
backend_typeForce a specific backend"google", "openai", "grok", "openrouter"
modelOverride default model"gemini-3-pro-image-preview" for studio quality
qualityImage quality (OpenAI)"low", "medium", "high", "auto"
sizeImage dimensionsSee backends reference
aspect_ratioAspect ratio"16:9", "1:1", "4:5"
input_imagesSource images for image-to-image editing["photo.jpg"]
continue_fromContinuation ID for multi-turn editingresult["continuation_id"]

Image-to-Image Editing

Transform existing images by providing input_images:

generate_media(
    prompt="Make it look like a watercolor painting",
    mode="image",
    input_images=["photo.jpg"]
)

Supported backends for image-to-image: Google (Gemini), OpenAI, Grok. The system auto-selects if your current backend doesn't support it.

Multi-Turn Editing (Continuation)

Iteratively refine images using continue_from:

# First generation
result = generate_media(prompt="A logo for a coffee shop", mode="image")

# Refine using the continuation ID
result2 = generate_media(
    prompt="Make the text larger and add a cup icon",
    mode="image",
    continue_from=result["continuation_id"]
)

Each backend uses a different continuation mechanism:

  • OpenAI: Passes previous_response_id (stateless)
  • Google Gemini: In-memory chat store (LRU, 50 items)
  • Grok: In-memory data URI store (LRU, 50 items)

Continuation only works for single image generation (not batch).

Google: Gemini vs Imagen

Google supports two API paths. Gemini (Nano Banana 2) is the default and recommended for most use cases. Imagen is only needed for advanced reference-image editing features.

  • Gemini models (gemini-*): generate_content() — text-to-image, image editing via input_images, multi-turn continuation
  • Imagen models (imagen-*): generate_images() / edit_image() — text-to-image with negative_prompt/seed/guidance_scale, plus style transfer, control editing, and subject consistency via reference images

For studio-quality precision and text rendering, use: model="gemini-3-pro-image-preview" (Pro-tier).

Need More Control?

适合场景

01

文本生成图片

02

图片风格化

03

产品图和创意图

04

需要 FLUX 模型时

能力概览

能力 1

调用 FLUX 图像模型

能力 2

支持文本生图和图像改写

能力 3

覆盖 LoRA 或风格适配

能力 4

适合创意视觉生成

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

36.4%
按下载量换算69

Claude

28.54%
按下载量换算54

Cursor

17.68%
按下载量换算34

Gemini CLI

9.89%
按下载量换算19

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills