概述
此存储库包含一组专门构建的 模型上下文协议 服务器,每个服务器都围绕特定的功能设计:网络抓取和结构化数据提取、代码库导航和分析、LLM驱动的文本生成和JSON查询。每台服务器都将其功能作为MCP工具和资源公开,使其成为AI代理工作流的可组合构建块。
这些服务器跨越两个语言生态系统——用于Firecrawl集成的TypeScript和DeepSeek/JSON服务器,用于代码库分析服务器的Python——并遵循MCP SDK的工具定义、资源URI和传输配置(stdio和HTTP)约定。
技术栈
Languages
MCP Framework
Web Scraping
AI Integration
Data & Querying
Runtime
Tooling
服务器索引
| 服务器 | 语言 | 传输 | 工具 | 资源 | 描述 |
|---|---|---|---|---|---|
| Firecrawl网页抓取 | TypeScript | stdio | 10 | -- | 网络抓取、爬行、批处理、LLM提取、深度研究和大麻菌株数据提取 |
| 代码库分析 | Python | stdio | 6 | 4 | 文件系统导航、代码搜索、项目结构分析和实时变更监控 |
| DeepSeek R1 | JavaScript | stdio | 5 | 5 | 通过DeepSeek AI进行文本生成、摘要、流式传输、多模型支持和文档处理 |
| JSON管理器 | JavaScript | stdio/HTTP | 4 | 4 | JSONPath查询、高级过滤、数据集比较和结果缓存 |
______________________________________________________________________
Firecrawl Web抓取服务器
基于 萤火虫 用于网络抓取、内容提取和结构化数据收集的平台。通过专门的大麻菌株数据提取管道扩展了Firecrawl的基本功能,该管道使用双重提取策略从Leafly.com收集每个菌株的66个标准化数据点:基于正则表达式的模式匹配和LLM驱动的模式提取。
工具
| 工具 | 说明 |
|---|---|
firecrawl_scrape | 通过格式选择(标记、HTML、屏幕截图)、自定义操作和内容过滤来抓取单个页面 |
firecrawl_map | 发现网站上的所有网址并生成网站地图 |
firecrawl_crawl | 递归抓取具有深度和页面限制的网站 |
firecrawl_batch_scrape | 通过基于队列的处理同时抓取多个URL |
firecrawl_check_batch_status | 轮询正在进行的批处理抓取作业的状态 |
firecrawl_check_crawl_status | 轮询正在进行的爬网作业的状态 |
firecrawl_search | 搜索网络并从结果中返回抓取的内容 |
firecrawl_extract | 使用调用者定义的JSON模式进行LLM驱动的结构化数据提取 |
firecrawl_deep_research | 多步骤研究工作流程,对主题进行抓取、综合和报告 |
firecrawl_leafly_strain | 提取标准化大麻菌株数据(大麻素、萜烯、作用、风味、相互作用) |
应变数据提取管道
Leafly菌株提取器是该系列中最专业的组件。它对同一数据源实施了两种互补的提取策略:
基于正则表达式的提取 使用大麻素百分比、萜类成分、效果评级和风味描述符的模式匹配规则解析原始HTML/markdown内容。这种方法具有确定性和快速性,但对布局更改很脆弱。
LLM动力提取 使用Firecrawl的 extract 端点,用于将页面内容发送到具有结构化JSON模式的LLM。这种方法以API延迟和令牌使用为代价,更优雅地处理非结构化文本、格式变化和丢失数据。
这两种策略都将输出标准化为一致的模式,包括:
| 类别 | 字段 |
|---|---|
| 大麻素 | THC、CBD、CBG、CBN |
| 萜类 | 月桂烯、蒎烯、石竹烯、柠檬烯、芳樟醇、萜品烯、Ocimene、Humulene |
| 医疗效果 | 压力、焦虑、抑郁、疼痛、失眠、食欲不振、恶心 |
| 用户效果 | 快乐、愉悦、有创造力、放松、振奋、精力充沛、专注、嗜睡、饥饿、健谈、耳鸣、咯咯笑 |
| 不利影响 | 口干、眼干、头晕、偏执、焦虑 |
| 风味 | 浆果、甜味、泥土味、辛辣味、松木、香草味、薄荷味、臭鼬味、柑橘味、辣味、草本、柴油、热带、果味、葡萄 |
| 药代动力学 | 发病时间(分钟),持续时间(小时) |
| 药物相互作用 | 镇静剂、苯二氮卓类、选择性血清素再摄取抑制剂、阿片类镇痛药、抗惊厥药、抗凝剂 |
标准化方法:实验室测试数据优先。当无法获得确切值时,应用标准化归一化(主要萜烯=0.008,次要萜烯=0.005,第三萜烯=0.003)。效果和口味被标准化为0.0-1.0的范围。
快速开始
cd firecrawl-mcp-server
npm install
cp .env.example .env # Add your FIRECRAWL_API_KEY
npm run build
npm start # Start the MCP server (stdio transport)# CLI: extract strain data directly
npm run scrape-leafly -- output.csv "Blue Dream,OG Kush,Sour Diesel"______________________________________________________________________
代码库分析服务器
用于导航和分析代码库的Python MCP服务器。通过看门狗提供文件系统访问、文本搜索、函数发现、依赖关系分析和实时文件更改监控。使用Python MCP SDK构建 FastMCP 框架。
工具
| 工具 | 说明 |
|---|---|
search_function | 跨Python、JavaScript和TypeScript文件查找函数定义 |
search_code | 在目录树中的所有代码文件中进行全文搜索 |
get_project_structure | 生成项目目录的树视图表示 |
analyze_dependencies | 解析和分析项目依赖关系清单 |
find_components | 发现React和React Native组件定义 |
资源
| URI | 描述 |
|---|---|
file/list/{directory} | 列出目录中的文件 |
file/read/{filepath} | 读取文件内容(使用LRU缓存) |
file/info/{filepath} | 获取文件元数据(大小、时间戳) |
file/changes/{directory} | 获取最近修改的文件(监视器支持) |
快速开始
cd Model-Context-Protocol-servers
pip install "mcp[cli]" watchdog
python code_server.py______________________________________________________________________
DeepSeek R1服务器
集成了以下功能的MCP服务器 DeepSeek AI 用于文本生成、摘要、流式输出和文档处理的模型。通过兼容OpenAI的API支持多种DeepSeek模型(推理器、聊天器、编码器)。包括内存中的响应缓存和生成输出的文件持久性。
工具
| 工具 | 说明 |
|---|---|
deepseek_r1 | 使用DeepSeek推理器模型生成文本(针对复杂推理进行了优化) |
deepseek_summarize | 将文本浓缩成摘要 |
deepseek_stream | 使用分块输出生成流文本 |
deepseek_multi | 使用调用者指定的DeepSeek模型变体生成文本 |
deepseek_document | 处理文档:总结、提取实体或分析情绪 |
资源
| URI | 描述 |
|---|---|
model/info | 支持的模型、上下文长度和功能 |
server/status | 服务器运行状况和正常运行时间状态 |
file/save/{filename} | 将生成的内容持久化到磁盘 |
file/list | 列出以前保存的输出文件 |
file/read/{filename} | 读取已保存的输出文件 |
支持的型号
| 模型 | 上下文 | 已优化 |
|---|---|---|
| DeepSeek推理器(R1) | 8K令牌 | 复杂的推理、数学、代码 |
| DeepSeek聊天(V3) | 8K代币 | 一般对话和知识 |
| DeepSeek Coder | 16K令牌 | 代码生成、调试、解释 |
快速开始
cd Model-Context-Protocol-servers
echo "DEEPSEEK_API_KEY=your_key_here" > .env
npm install @modelcontextprotocol/sdk openai dotenv
node deepseek.py # Starts on stdio transport______________________________________________________________________
JSON管理服务器
用于查询、过滤、比较和缓存JSON数据的MCP服务器。使用JSONPath表达式进行遍历,支持使用字符串、数字和日期操作进行高级过滤,并提供持久查询存储。支持stdio和HTTP传输。
工具
| 工具 | 说明 |
|---|---|
query | 使用带有数组操作的JSONPath表达式查询JSON数据 |
filter | 按字段条件(相等、范围、模式匹配)过滤JSON数组 |
save_query | 将查询结果保存到磁盘以供以后检索 |
compare_json | 区分两个JSON数据集并报告结构/值差异 |
资源
| URI | 描述 |
|---|---|
saved_queries/list | 列出所有已保存的查询结果文件 |
saved_queries/get/{filename} | 检索以前保存的查询结果 |
cache/status | 缓存大小、TTL配置和条目年龄 |
cache/clear | 清空内存中的查询缓存 |
快速开始
cd Model-Context-Protocol-servers
npm install @modelcontextprotocol/sdk node-fetch jsonpath
node json.py # stdio transport (default)
node json.py --port=3000 # HTTP transport______________________________________________________________________
Project Structure
.
├── firecrawl-mcp-server/ # TypeScript — Firecrawl + Leafly MCP server
│ ├── src/
│ │ ├── index.ts # MCP server entry point (10 tools)
│ │ ├── leafly-scraper.ts # Strain data extraction engine
│ │ ├── leafly-scraper-cli.ts # CLI interface for direct scraping
│ │ └── index.test.ts # Jest test suite
│ ├── leafly-extract-data/ # Extracted strain datasets (batches + individual)
│ ├── leafly-analysis/ # Raw HTML analysis of strain pages
│ ├── extract-test-output/ # Sample extraction results
│ ├── Dockerfile # Container build
│ ├── package.json
│ └── tsconfig.json
│
├── Model-Context-Protocol-servers/ # Python + JavaScript MCP servers
│ ├── code_server.py # Codebase analysis server (Python, FastMCP)
│ ├── deepseek.py # DeepSeek R1 server (JavaScript, FastMCP)
│ ├── json.py # JSON manager server (JavaScript, FastMCP)
│ ├── main.py # Python entry point
│ └── pyproject.toml # Python project configuration
│
├── terminal-top-panel.svg # README header graphic
├── terminal-bottom-panel.svg # README footer graphic
└── README.md入门指南
先决条件
- Node.js 18+ 适用于Firecrawl、DeepSeek和JSON服务器
- Python 3.12+ 用于代码库分析服务器
- Firecrawl API密钥 对于网络抓取服务器(从获取 firecrawl.dev)
- DeepSeek API密钥 对于DeepSeek R1服务器(从获取 deepseek.com)
安装
# Clone the repository
git clone https://github.com/adi2355/MCP-Server-Collection.git
cd MCP-Server-Collection
# Firecrawl server
cd firecrawl-mcp-server && npm install && npm run build && cd ..
# Python codebase server
cd Model-Context-Protocol-servers && pip install "mcp[cli]" watchdog && cd ..环境变量
| 变量 | 服务器 | 必填 |
|---|---|---|
FIRECRAWL_API_KEY | Firecrawl网络抓取 | 是 |
DEEPSEEK_API_KEY | DeepSeek R1 | 是 |
许可证
MIT许可证

