MCP图像识别服务器
使用Anthropic和OpenAI视觉API提供图像识别功能的MCP服务器。版本0.1.2。
特性
- 使用Anthropic Claude Vision或OpenAI GPT-4 Vision进行图像描述
- 支持多种图像格式(JPEG、PNG、GIF、WebP)
- 可配置的主要和后备提供者
- 支持Base64和基于文件的图像输入
- 使用Tesseract OCR进行可选文本提取
需求
- Python 3.8或更高版本
- Tesseract OCR(可选)-文本提取功能所需
- Windows:从下载并安装 UB曼海姆/镶嵌 - Linux: sudo apt-get install tesseract-ocr - macOS: brew install tesseract
安装
- 克隆存储库:
git clone https://github.com/mario-andreschak/mcp-image-recognition.git
cd mcp-image-recognition- 创建并配置您的环境文件:
cp .env.example .env
# Edit .env with your API keys and preferences- 构建项目:
build.bat用法
运行服务器
使用python生成服务器:
python -m image_recognition_server.server改用批处理启动服务器:
run.bat server使用MCP Inspector以开发模式启动服务器:
run.bat debug可用工具
describe_image
- 输入:Base64编码的图像数据和MIME类型 - 输出:图像的详细描述
describe_image_from_file
- 输入:图像文件的路径 - 输出:图像的详细描述
环境配置
ANTHROPIC_API_KEY:您的Anthropic API密钥。OPENAI_API_KEY:您的OpenAI API密钥。VISION_PROVIDER:初级视力提供者(anthropic或openai).FALLBACK_PROVIDER:可选回退提供程序。LOG_LEVEL:日志记录级别(调试、信息、警告、错误)。ENABLE_OCR:启用Tesseract OCR文本提取(true或false).TESSERACT_CMD:Tesseract可执行文件的可选自定义路径。OPENAI_MODEL:OpenAI模型(默认值:gpt-4o-mini).可以将OpenRouter格式用于其他型号(例如。,anthropic/claude-3.5-sonnet:beta).OPENAI_BASE_URL:OpenAI API的可选自定义基本URL。吃起来https://openrouter.ai/api/v1OpenRouter。OPENAI_TIMEOUT:可选的OpenAI API自定义超时(以秒为单位)。
使用OpenRouter
OpenRouter允许您使用OpenAI API格式访问各种模型。要使用OpenRouter,请执行以下步骤:
- 从OpenRouter获取OpenAI API密钥。
- 集
OPENAI_API_KEY在你的.env文件到您的OpenRouter API密钥。 - 集
OPENAI_BASE_URL向https://openrouter.ai/api/v1. - 集
OPENAI_MODEL使用OpenRouter格式(例如。,anthropic/claude-3.5-sonnet:beta). - 集
VISION_PROVIDER向openai.
违约模型
- 人类学:
claude-3.5-sonnet-beta - OpenAI:
gpt-4o-mini - OpenRouter:使用
anthropic/claude-3.5-sonnet:beta格式在OPENAI_MODEL.
发展
运行测试
运行所有测试:
run.bat test运行特定的测试套件:
run.bat test server
run.bat test anthropic
run.bat test openaiDocker支持
构建Docker镜像:
docker build -t mcp-image-recognition .运行容器:
docker run -it --env-file .env mcp-image-recognition许可证
MIT许可证-有关详细信息,请参阅许可证文件。
发布历史
- 0.1.2 (2025-02-20):改进了OCR错误处理,并为OCR功能增加了全面的测试覆盖率
- 0.1.1 (2025-02-19):添加了Tesseract OCR支持,用于从图像中提取文本(可选功能)
- 0.1.0 (2025-02-19):首次发布,支持Anthropic和OpenAI视觉
