Token导航 LogoToken导航TokenDH.com
mata MCP logo
AI代理未说明官方级别未说明来源级核验

mata MCP

MCP Server

MCP Vision Bridge是一个模型上下文协议服务器,使非视觉LLM能够通过OpenRouter利用视觉模型的能力。

工具数

3

提示词数

0

GitHub Stars

0

资源数

0
TypeScriptClaude图像处理Claude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

theotheobeats

提供方

theotheobeats

最后核验

2026/5/17 20:20

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

MCP视觉桥

一种模型上下文协议(MCP)服务器,使非视觉LLM能够通过OpenRouter通过视觉模型利用视觉能力。

概述

MCP视觉桥作为一个中间MCP服务器,通过OpenRouter的统一API将没有图像输入支持的LLM(如GLM-4.6)连接到多模式模型(如Grok)。这使得任何兼容MCP的客户端,包括OpenCode,都可以使用非视觉LLM执行视觉任务。

建筑

Non-vision LLM → MCP Vision Bridge → OpenRouter → Vision Model → Response Transformer → Text Response

核心组件

  1. MCP视觉服务器 -主服务器通过MCP协议公开视觉工具
  2. 路由器型号 -非视觉和视觉模型之间的智能路由
  3. 图像处理器 -处理图像编码、预处理和格式转换
  4. 响应变压器 -将多模式响应转换为纯文本格式
  5. OpenRouter客户端 -管理与OpenRouter API的通信
  6. OpenCode集成层 -确保与OpenCode的MCP客户端兼容

特性

  • 符合MCP协议 -标准MCP服务器实现
  • OpenRouter集成 -通过统一的API访问75+人工智能模型
  • OpenCode兼容 -与OpenCode的MCP客户端直接集成
  • 隐私第一 -无持久存储,临时文件清理
  • 多模型支持 -主要和后备视觉模型
  • 速率限制 -内置请求限制和错误处理
  • 流媒体支持 -实时响应流媒体功能

快速开始

安装

# Clone the repository
git clone 
cd vision-mcp

# Install dependencies
npm install

# Configure environment
cp .env.example .env
# Edit .env with your OpenRouter API key

基本用法

import { MCPVisionBridge } from './src/server/mcp-server'

const bridge = new MCPVisionBridge({
  openrouter: {
    apiKey: process.env.OPENROUTER_API_KEY!,
    models: {
      primary: 'x-ai/grok-beta-vision',
      fallback: 'google/gemini-2.0-flash-001'
    }
  }
})

await bridge.start()

OpenCode集成

添加到您的OpenCode配置中:

{
  "mcpServers": {
    "vision-bridge": {
      "command": "node",
      "args": ["dist/server/mcp-server.js"],
      "env": {
        "OPENROUTER_API_KEY": "your-api-key"
      }
    }
  }
}

可用工具

analyze_image

使用视觉模型分析图像。

参数:

  • image_url (string):URL或base64编码的图像数据
  • prompt (string):分析提示
  • model (字符串,可选):要使用的视觉模型
  • max_tokens (数字,可选):响应长度限制

describe_image

获取图像内容的详细描述。

参数:

  • image_url (string):URL或base64编码的图像数据
  • detail_level (字符串,可选):“低”或“高”

extract_text_from_image

从图像中提取文本内容(OCR)。

参数:

  • image_url (string):URL或base64编码的图像数据
  • language (字符串,可选):OCR语言提示

文档

支持的型号

主要视觉模型

  • x-ai/grok-beta-vision -Grok视觉能力
  • google/gemini-2.0-flash-001 -谷歌最新的视觉模型
  • anthropic/claude-3-5-sonnet-20241022 -人类视觉模型

回退模型

  • 自动故障转移到辅助模型
  • 速率限制和错误处理
  • 通过模型路由实现成本优化

安全与隐私

  • 无持久存储 -图像在内存中处理并清理
  • API密钥保护 -仅环境变量存储
  • 输入验证 -图像格式和大小验证
  • 速率限制 -内置请求限制
  • 审计日志 -请求跟踪合规性

许可证

MIT许可证-有关详细信息,请参阅许可证文件。

贡献

  1. 分叉存储库
  2. 创建要素分支
  3. 进行更改
  4. 添加测试
  5. 提交拉取请求

支持

  • GitHub问题:报告bug和功能请求
  • 文档:查看文档/文件夹以获取详细指南
  • 示例:有关使用示例,请参阅示例/文件夹

马塔·麦克普

目录标签

目录标签

TypeScriptClaude图像处理视觉模型桥接本地部署多模态AIMCP协议OpenRouter集成

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

api-key

工具数量(toolCount,工具数)

3

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明api-key部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP