MCP视频识别服务器
一个MCP(模型上下文协议)服务器,使用谷歌的Gemini AI提供图像、音频和视频识别工具。
特性
- 图像识别:使用Google Gemini AI分析和描述图像
- 音频识别:使用Google Gemini AI分析和转录音频
- 视频识别:使用Google Gemini AI分析和描述视频
先决条件
- Node.js 18或更高版本
- Google Gemini API密钥
安装
手动安装
- 克隆存储库:
git clone https://github.com/yourusername/mcp-video-recognition.git
cd mcp-video-recognition- 安装依赖项:
npm install- 构建项目:
npm run build安装在 流动
- 单击添加服务器
- 将GitHub URL复制并粘贴到流中
- 单击解析、克隆、安装、构建和保存。
通过配置文件安装
要通过配置文件将此MCP服务器与Cline或其他MCP客户端集成:
- 打开您的Cline设置:
- 在VS Code中,转到文件->首选项->设置 - 搜索“临床MCP设置” - 点击“在settings.json中编辑”
- 将服务器配置添加到
mcpServers对象:
{
"mcpServers": {
"video-recognition": {
"command": "node",
"args": [
"/path/to/mcp-video-recognition/dist/index.js"
],
"disabled": false,
"autoApprove": []
}
}
}- 替换
/path/to/mcp-video-recognition/dist/index.js与实际路径index.js项目目录中的文件。在Windows上对路径使用正斜杠(/)或双反斜杠(\\\\)。
- 保存设置文件。Cline应自动连接到服务器。
配置
使用环境变量配置服务器:
GOOGLE_API_KEY(必需):您的Google Gemini API密钥TRANSPORT_TYPE:要使用的运输类型(stdio或sse,默认为stdio)PORT:SSE传输的端口号(默认为3000)LOG_LEVEL:日志记录级别(verbose,debug,info,warn,error,默认为info)
用法
启动服务器
使用stdio传输(默认)
GOOGLE_API_KEY=your_api_key npm start苏格兰和南方能源公司运输
GOOGLE_API_KEY=your_api_key TRANSPORT_TYPE=sse PORT=3000 npm start使用工具
服务器提供了三个MCP客户端可以调用的工具:
图像识别
{
"name": "image_recognition",
"arguments": {
"filepath": "/path/to/image.jpg",
"prompt": "Describe this image in detail",
"modelname": "gemini-2.0-flash"
}
}音频识别
{
"name": "audio_recognition",
"arguments": {
"filepath": "/path/to/audio.mp3",
"prompt": "Transcribe this audio",
"modelname": "gemini-2.0-flash"
}
}视频识别
{
"name": "video_recognition",
"arguments": {
"filepath": "/path/to/video.mp4",
"prompt": "Describe what happens in this video",
"modelname": "gemini-2.0-flash"
}
}刀具参数
所有工具都接受以下参数:
filepath(必需):要分析的媒体文件的路径prompt(可选):自定义识别提示(默认为“描述此内容”)modelname(可选):用于识别的Gemini模型(默认为“Gemini-2.0-flash”)
发展
以开发模式运行
GOOGLE_API_KEY=your_api_key npm run dev项目结构
src/index.ts:入口点src/server.ts:MCP服务器实现src/tools/:工具实施src/services/:服务实现(Gemini API)src/types/:类型定义src/utils/:实用功能
许可证
麻省理工学院
