Token导航 LogoToken导航TokenDH.com
Gemini Media MCP logo
音视频未说明官方级别未说明来源级核验

Gemini Media MCP

MCP Server

一个统一的Go MCP服务器,通过Google Gemini API和Vertex AI提供AI媒体生成服务,包括图像、视频、音频和音乐生成。

工具数

12

提示词数

0

GitHub Stars

5

资源数

0
视频生成GoClaudeClaude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

mordor-forge

提供方

mordor-forge

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

双子座媒体mcp

![Go](https://go.dev) ![License](LICENSE) ![gemini-media-mcp MCP server](https://glama.ai/mcp/servers/mordor-forge/gemini-media-mcp)

通过Google Gemini API和Vertex AI生成人工智能媒体的统一Go MCP服务器。

![gemini-media-mcp MCP server](https://glama.ai/mcp/servers/mordor-forge/gemini-media-mcp)

特性

  • 图像生成 --文本到图像,具有可配置的宽高比和分辨率(1K/2K/4K)
  • 图像编辑 --使用自然语言提示修改现有图像
  • 多参考成分 --最多可将3张参考图像与风格/内容指导相结合
  • 视频生成 --通过Veo 3.1 Lite、快速和标准层将文本转换为视频
  • 图像转视频 --将静止图像动画化为视频片段
  • 视频扩展 --用于较长内容的链式剪辑(快速和标准层)
  • 文本到语音 --使用可配置的语音和语言生成口语音频
  • 音乐发生器 --通过Lyria 3播放的AI音乐(30秒片段或带人声、结构控制的完整歌曲)
  • 单个二进制 --无运行时依赖关系,通过stdio传输运行
  • 提供者抽象 --用于图像、视频、音频和模型操作的后端无关接口
  • 双后端 --支持Gemini API(API密钥)和Vertex AI(项目证书)

快速开始

# Install
go install github.com/mordor-forge/gemini-media-mcp/cmd/gemini-media-mcp@latest

# Configure (Gemini API; either variable name works)
export GEMINI_API_KEY="your-api-key"
# export GOOGLE_API_KEY="your-api-key"

# Or configure (Vertex AI)
export GOOGLE_CLOUD_PROJECT="your-project-id"
export GOOGLE_CLOUD_LOCATION="us-central1"

# Run directly (stdio transport)
gemini-media-mcp

然后将其添加到您的MCP客户端中——请参阅 MCP客户端配置 在......下面

配置

变量必填默认描述
GOOGLE_API_KEY是\*--Gemini API密钥。 GEMINI_API_KEY 也被接受
GOOGLE_CLOUD_PROJECT是\*--Vertex AI后端的GCP项目ID
GOOGLE_CLOUD_LOCATION没有us-central1Vertex AI的GCP区域
MEDIA_OUTPUT_DIR没有~/generated_media保存媒体文件的目录

\*其中之一 GOOGLE_API_KEYGOOGLE_CLOUD_PROJECT 必须设置。如果同时设置了两者,则API键优先(避免在 GOOGLE_CLOUD_PROJECT 在其他工具的外壳中设置)。

如果您不确定哪个后端处于活动状态,请致电 get_config 从MCP客户端确认所选后端和输出目录。

可用工具

工具描述类型
generate_image从文本提示生成图像同步
edit_image使用文本提示编辑现有图像同步
compose_images多参考图像合成(最多3个)同步
generate_video从文本提示生成视频(返回操作ID)Async
animate_image将图像动画化为视频(第一帧)异步
extend_video链接视频剪辑以获得更长的内容异步
video_status检查视频生成进度同步
download_video下载完成的视频同步
generate_audio从文本生成语音音频(TTS)同步
generate_music从文本描述生成AI音乐(Lyria)同步
list_models显示具有功能和定价的可用型号同步
get_config显示当前后端和配置同步

异步工具立即返回操作ID。使用 video_status 要轮询完成情况,则 download_video 以检索文件。

模型层

图像

级别型号最适合成本
nb2(默认)gemini-3.1-flash-image-preview快速迭代,大多数任务~0.067/img美元
progemini-3-pro-image-preview最终渲染,复杂场景~0.134/img美元

这两个层都支持1K、2K、4K分辨率和1:1、2:3、3:2、3:4、4:3、4:5、5:4、9:16、16:9、21:9的宽高比。

视频

级别型号最适合成本
lite(默认)veo-3.1-lite-generate-preview大容量,草稿0.05美元/秒(720p),0.08美元/每秒(1080p)
veo-3.1-fast-generate-preview高质量迭代0.15美元/秒(720p/1080p),0.35美元/秒
标准veo-3.1-generate-preview最终渲染,4K每秒0.40美元(720p/1080p),每秒0.60美元(4K)

支持的纵横比为 16:99:16支持的持续时间为 4, 6,以及 8 秒。Lite支持 720p1080p快速和标准支持 720p, 1080p,以及 4K.视频扩展(extend_video)仅在快速和标准层上可用,扩展层必须与原始版本匹配。

音频(TTS)

级别型号最适合成本
ttsgemini-2.5-flash-preview-tts自然声音的文本转语音标准Gemini代币定价

generate_audio 该工具将文本转换为语音。它支持:

  • 语音选择 --从预构建的声音中选择,如 Aoede, Kore, Puck以及更多。违约: Aoede
  • 语言 --设置语言代码(例如。, en-US, it-IT, cs-CZ, de-DE).违约: en-US
  • 自然语音 --通过适当的节奏和语调生成富有表现力、听起来自然的语音

输出保存为原始PCM音频(audio/L1624kHz采样率)。该文件可以使用以下工具播放 ffplay 或转换为其他格式:

# Play directly
ffplay -f s16le -ar 24000 -ac 1 ~/generated_media/audio-2026-04-02T12-20-12-0603.pcm

# Convert to WAV
ffmpeg -f s16le -ar 24000 -ac 1 -i audio.pcm audio.wav

# Convert to MP3
ffmpeg -f s16le -ar 24000 -ac 1 -i audio.pcm audio.mp3

音乐(Lyria)

层级型号产量最适合成本
剪辑(默认)lyria-3-clip-preview30秒剪辑快速迭代,声音设计约0.08美元/首
lyria-3-pro-preview长达约3分钟包含人声、诗句、合唱的完整歌曲基于代币

generate_music 该工具根据文本描述创建人工智能生成的音乐。功能包括:

  • 类型和风格 --指定任何流派、乐器、BPM、键/音阶、情绪
  • 结构控制 --使用以下标签 [Verse], [Chorus], [Bridge], [Intro], [Outro]
  • 自定义歌词 --包括带有声乐曲目分段标记的歌词
  • 时间戳控制 -- [0:00 - 0:10] Intro: gentle piano... 用于精确的分段计时
  • 多语言 --提示语言决定输出语言
  • 高保真 --48kHz立体声MP3输出

所有生成的音乐都带有SynthID水印。

示例提示:

# Instrumental
"A gentle acoustic guitar melody in C major, 90 BPM, calm and peaceful indie folk"

# With structure
"[Intro] Ambient synth pad, ethereal
[Verse] Lo-fi hip-hop beat, mellow piano chords, vinyl crackle
[Chorus] Uplifting, add strings and gentle drums
[Outro] Fade out with reverb"

# With lyrics
"Upbeat pop song, 120 BPM, major key
[Chorus] We're dancing in the light / Everything feels right / Under stars so bright tonight"

您可以传递层名称(lite, fast, standard, nb2, pro, tts, clip, full)或者直接输入原始型号ID。

MCP客户端配置

克劳德代码

添加到您的Claude Code MCP设置中(~/.claude/settings.json 或项目 .mcp.json):

{
  "mcpServers": {
    "gemini-media": {
      "command": "gemini-media-mcp",
      "env": {
        "GOOGLE_API_KEY": "your-api-key",
        "MEDIA_OUTPUT_DIR": "/path/to/output"
      }
    }
  }
}

使用其中之一 GOOGLE_API_KEYGEMINI_API_KEYenv 上方挡块;两者都被接受。

或者,如果从源头构建:

{
  "mcpServers": {
    "gemini-media": {
      "command": "/path/to/gemini-media-mcp",
      "env": {
        "GOOGLE_API_KEY": "your-api-key"
      }
    }
  }
}

克劳德代码的同伴技能

skills/ 该目录包含在MCP工具之上提供交互式工作流的ClaudeCode技能。每种技能都指导克劳德完成针对特定媒体类型的快速工程、模型选择和迭代改进。

技能目录描述
双子座图像生成器skills/gemini-image-gen/图像生成、编辑和多参考合成
视频发生器skills/video-gen/使用异步轮询、图像到视频、扩展生成视频
音乐基因skills/music-gen/具有结构标签、歌词、流派控制的音乐生成
tts发电机skills/tts-gen/带语音和语言选择的文本转语音

要安装技能,请将其目录复制到 ~/.claude/skills/:

cp -r skills/video-gen ~/.claude/skills/
cp -r skills/music-gen ~/.claude/skills/
cp -r skills/tts-gen ~/.claude/skills/
cp -r skills/gemini-image-gen ~/.claude/skills/

技能是可选的——MCP工具在没有技能的情况下也能工作。但这些技能增加了及时的工程指导、模型层建议和交互式审查工作流程,显著提高了输出质量。

从源代码构建

git clone https://github.com/mordor-forge/gemini-media-mcp.git
cd gemini-media-mcp
go build ./cmd/gemini-media-mcp/

二进制文件将在以下时间创建 ./gemini-media-mcp.

要运行测试,请执行以下操作:

go test ./...

贡献

  1. 分叉存储库
  2. 创建要素分支(git checkout -b feature/your-feature)
  3. 进行更改并添加测试
  4. go test ./...go vet ./...
  5. 提交您的更改
  6. 打开一个pull请求 main

许可证

阿帕奇-2.0

目录标签

目录标签

视频生成GoClaudeAI媒体生成本地部署图像编辑文本转语音音乐生成

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

12

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP