MCP服务器数据集生成器
用于构建和维护模型上下文协议(MCP)服务器数据集的综合工具。此工具会自动从多个来源收集、分类和更新有关MCP服务器的信息。
概述
MCP服务器数据集生成器旨在:
- 从中提取MCP服务器信息 很棒的mcp服务器 仓库
- 在GitHub上搜索其他MCP服务器存储库
- 合并并消除两个来源的重复数据
- 生成一个每日CSV文件,其中包含有关每台服务器的全面信息
特性
- 双重数据源:整合来自精选列表和GitHub搜索的数据
- 自动分类:根据存储库内容分配类别
- 技术栈检测:确定编程语言和框架
- 表情符号标记:添加视觉指示器以快速识别
- 每日更新:自动运行以保持数据集的最新状态
- 数据持久层:在添加新条目时维护历史数据
数据集结构
生成的CSV文件包含以下字段:
| 字段 | 描述 |
|---|---|
| name | 存储库名称 |
| description | 存储库描述 |
| html_url | 指向存储库的url |
| stars | GitHub star的数量 |
| forks | GitHub fork的数量 |
| 关键字 | 逗号分隔的关键字列表 |
| category | 主要类别(例如,框架、实用程序、客户端) |
| techstack | 使用逗号分隔的技术列表 |
| 表情符号 | 用于快速识别的视觉指示器 |
用法
自动每日更新
数据集每天通过GitHub Actions自动更新。无需人工干预。
手动触发
您可以从GitHub Actions选项卡手动触发工作流:
- 转到存储库中的“操作”选项卡
- 选择“统一MCP服务器提取”
- 点击“运行工作流”
- 可选择自定义:
- GitHub搜索关键词 - 最小星叉阈值 - 应采用哪种提取方法
地方发展
要在本地运行脚本,请执行以下操作:
# Install dependencies
pip install -r requirements.txt
# Run README extraction
python extract_mcp_servers.py
# Run GitHub search
python daily.py环境变量
以下环境变量可用于自定义行为:
| 变量 | 描述 | 默认值 |
|---|---|---|
| GITHUB_TOKEN | 用于身份验证的GITHUB API令牌 | - |
| 关键字_ENV | 逗号分隔的搜索关键字列表 | MCP相关关键字 |
| MIN_STARS | 存储库的最小星数 | 10 |
| MIN_FORKS | 存储库的最小分叉数 | 5 |
数据源
1.出色的MCP服务器存储库
该工具从中提取数据 很棒的mcp服务器 存储库,其中包含按类别组织的MCP服务器的精选列表。
2.GitHub搜索
该工具在GitHub上搜索与MCP相关关键字匹配的存储库,确保对生态系统的全面覆盖。
分类系统
存储库根据其内容和目的进行分类:
- 框架:核心MCP服务器实现
- 效用:辅助工具和实用程序
- 客户端:客户端库和应用程序
- 教程:学习资源和示例
- 数据库:数据库集成
- API:API实现
- 存储:存储解决方案
- 人工智能:AI和LLM集成
- 聊天:聊天和消息功能
- 搜索:搜索功能
技术栈检测
该工具识别了以下技术:
- 语言:Python、TypeScript、Go、Rust、Java、C#
- 框架:FastAPI、Langchain、Spring
- 协议:SSE、WebSocket、HTTP
- 部署:云、本地、Docker
- 平台:iOS、Windows、Linux
贡献
欢迎投稿!请随时提交拉取请求。
许可证
此项目根据MIT许可证获得许可-有关详细信息,请参阅许可证文件。
