jms文档MCP服务器📚
通过模型上下文协议(MCP)使人工智能助手可以立即访问copula文档
  
⚠️ 免责声明:这是 非 一个官方的copula产品 非 由Databricks支持。这是一个社区项目,它抓取和索引公开可用的copula文档,以提供MCP集成。使用风险自负。如需官方支持,请直接联系copula。
此MCP服务器为Claude、GPT-4等AI助手提供了对完整的copula AWS文档(约3200页)的语义搜索访问。它通过MCP工具和资源抓取、缓存、索引和提供文档。
✨ 特性
- 🔍 语义搜索:使用自然语言查询查找相关文档
- 📦 全覆盖:访问超过3181页的copula AWS文档
- ⚡ 快速异步爬行器:比传统爬虫快5-10倍(在~5-7分钟内抓取完整文档)
- 🗄️ 本地高速缓存:本地存储的爬网页面,用于离线访问和快速查询
- 🧠 向量搜索:由ChromaDB和句子转换器嵌入提供支持
- 🔄 自动刷新:可选的每日文档刷新
- 🛠️ 10个MCP工具:以编程方式搜索、推荐和浏览文档
- 📖 MCP资源:直接浏览文档
- 🎯 AI IDE兼容:适用于Cursor、Claude Code和其他MCP客户端
🚀 快速开始
先决条件
- Python 3.11或更高版本
- 紫外线 (推荐)或pip
安装
# Clone the repository
git clone https://github.com/YOUR-USERNAME/databricks-docs-mcp.git
cd databricks-docs-mcp
# Quick start script (installs dependencies, crawls docs, starts server)
chmod +x start_server.sh
./start_server.sh⏱️ 初始设置时间预期:
- 第一次爬行:~5-7分钟(3181页,带快速异步爬虫)
- 嵌入生成:约10-15分钟(为所有页面创建向量嵌入)
- 首次运行总计:约15-22分钟
- 后续启动:~5-10秒(使用缓存数据)
服务器将在第一次运行时自动抓取和索引文档。喝杯咖啡! ☕
手动安装
# Install uv (if not already installed)
curl -LsSf https://astral.sh/uv/install.sh | sh
# Install dependencies and create virtual environment
uv sync --group dev
# Crawl documentation (fast mode) - Takes ~5-7 minutes
uv run python -m databricks_docs_mcp crawl --fast
# Start MCP server (first start: ~10-15 min for indexing, subsequent: ~5-10 sec)
uv run python -m databricks_docs_mcp.server --no-scheduler💡 小贴士:The --fast flag使用异步爬虫进行5-10倍的爬行。服务器在首次启动时自动创建嵌入。📖 用法
可用的MCP工具
服务器为AI助手提供了10个MCP工具:
search_docs-使用语义搜索搜索文档get_page-检索特定文档页面list_categories-列出所有文档类别search_by_category-在特定类别内搜索get_page_sections-获取页面目录recommend_related-查找相关文档页面suggest_docs-根据上下文获取建议get_quickstart-查找主题的快速入门指南explore_category-浏览类别中的所有页面get_popular_topics-获取最受欢迎的文档主题
AI IDE中的示例查询
"Search Databricks docs for Lakeflow Connect with Salesforce"
"How do I use MLflow to track experiments?"
"Show me Unity Catalog best practices"
"What are Delta Lake optimization techniques?"CLI命令
# Crawl documentation
python -m databricks_docs_mcp crawl --fast --max-pages 1000
# Check statistics
python -m databricks_docs_mcp stats
# Reindex existing data
python -m databricks_docs_mcp index
# Refresh documentation
python -m databricks_docs_mcp refresh
# Start server
python -m databricks_docs_mcp server --no-scheduler🔧 配置
在AI IDE中配置
光标
添加到 ~/.cursor/mcp.json:
{
"mcpServers": {
"databricks-docs": {
"url": "http://localhost:8100/mcp"
}
}
}克劳德桌面版
添加到 ~/Library/Application Support/Claude/claude_desktop_config.json:
{
"mcpServers": {
"databricks-docs": {
"command": "python",
"args": ["-m", "databricks_docs_mcp", "server", "--no-scheduler"],
"cwd": "/path/to/databricks_docs_mcp",
"env": {
"PYTHONPATH": "/path/to/parent/directory"
}
}
}
}🏗️ 建筑
databricks_docs_mcp/
├── crawler/ # Web scraping and parsing
│ ├── scraper.py # Original sequential crawler
│ ├── async_scraper.py # Fast async crawler (5-10x faster)
│ ├── parser.py # HTML to Markdown conversion
│ └── scheduler.py # Daily auto-refresh scheduler
├── embeddings/ # Vector search components
│ ├── embedder.py # Sentence-transformer embeddings
│ ├── vector_db.py # ChromaDB wrapper
│ └── search.py # Semantic search engine
├── resources/ # MCP resources
│ └── docs_resources.py
├── storage/ # Data models and caching
│ ├── models.py # Pydantic data models
│ ├── cache.py # Local cache management
│ └── data/ # Cached documentation
├── tools/ # MCP tools
│ ├── search.py # Search tools
│ └── recommend.py # Recommendation tools
├── tests/ # Unit tests
├── server.py # FastMCP server
└── __main__.py # CLI entry point📊 演出
- 爬行速度:3181页约5-7分钟(异步模式)
- 索引速度:约5-6分钟用于完整文档
- 搜索延迟:语义查询小于100ms
- 存储:缓存页面约50MB,嵌入约200MB
🛠️ 发展
运行测试
pytest tests/代码风格
# Format code
black .
# Lint
flake8 .
# Type check
mypy .📝 文档
🤝 贡献
欢迎投稿!请查看 贡献.md 作为指导方针。
📄 许可证
此项目根据MIT许可证获得许可-请参阅 许可证 文件以获取详细信息。
