Web爬虫MCP服务器部署指南
先决条件
- Node.js(v18+)
- npm(v9+)
安装
- 克隆存储库:
git clone https://github.com/jitsmaster/web-crawler-mcp.git
cd web-crawler-mcp- 安装依赖项:
npm install- 构建项目:
npm run build配置
创建一个 .env 包含以下环境变量的文件:
CRAWL_LINKS=false
MAX_DEPTH=3
REQUEST_DELAY=1000
TIMEOUT=5000
MAX_CONCURRENT=5运行服务器
启动MCP服务器:
npm startMCP配置
将以下内容添加到MCP设置文件中:
{
"mcpServers": {
"web-crawler": {
"command": "node",
"args": ["/path/to/web-crawler/build/index.js"],
"env": {
"CRAWL_LINKS": "false",
"MAX_DEPTH": "3",
"REQUEST_DELAY": "1000",
"TIMEOUT": "5000",
"MAX_CONCURRENT": "5"
}
}
}
}用法
服务器提供 crawl 可以通过MCP访问的工具。示例用法:
{
"url": "https://example.com",
"depth": 1
}配置选项
| 环境变量 | 默认值 | 描述 |
|---|---|---|
| CRAWL_LINKS | false | 是否关注链接 |
| MAX_DEPTH | 3 | 最大爬行深度 |
| REQUEST_DELAY | 1000 | 请求之间的延迟(毫秒) |
| 超时 | 5000 | 请求超时(毫秒) |
| MAX_CONCURRENT | 5 | 最大并发请求数 |
