打开爬网程序MCP服务器
 ](https://www.npmjs.com/package/open-crawler-mcp-server) ](https://www.npmjs.com/package/open-crawler-mcp-server) ](https://github.com/elchika-inc/open-crawler-mcp-server)
一种模型上下文协议(MCP)服务器,用于从具有多种输出格式的网页中抓取和提取内容。
特性
- 多种输出格式:将内容提取为文本、markdown、结构化XML或JSON
- 智能内容提取:CSS选择器支持目标内容提取
- Robots.txt合规性:自动robots.txt检查和合规性
- 速率限制:内置速率限制(请求之间至少1秒)
- 尺寸保护:最大页面大小限制(10MB),以防止内存问题
- 结构化内容:分别提取标题、段落、链接、图像和列表
- 错误处理:不同故障场景的综合错误代码
MCP客户端配置
将此服务器添加到MCP客户端配置中:
{
"mcpServers": {
"open-crawler": {
"command": "npx",
"args": ["@elchika-inc/open-crawler-mcp-server"]
}
}
}可用工具
crawl_page
通过自动robots.txt合规性检查以多种格式从网页中提取内容。
参数:
url(必需):要爬网的目标URLselector(可选):用于特定内容提取的CSS选择器format(可选):输出格式-text,markdown,xml,或json(默认值:text)text_only(可选):用于纯文本提取的传统参数(已弃用,请使用format相反)
输出格式:
text:干净、纯文本内容,空白已规范化markdown:格式良好的Markdown,保留了标题、链接、图像和列表xml:结构化XML,标题、段落、链接、图像和列表有单独的部分json:包含分类内容元素的结构化JSON对象
示例:
基本文本提取:
{
"name": "crawl_page",
"arguments": {
"url": "https://example.com",
"format": "text"
}
}使用CSS选择器提取Markdown:
{
"name": "crawl_page",
"arguments": {
"url": "https://example.com",
"selector": "article",
"format": "markdown"
}
}结构化JSON提取:
{
"name": "crawl_page",
"arguments": {
"url": "https://example.com",
"format": "json"
}
}check_robots
验证是否允许根据网站的robots.txt文件抓取URL。
参数:
url(必填):用于检查爬网权限的URL
例子:
{
"name": "check_robots",
"arguments": {
"url": "https://example.com/page"
}
}错误处理
常见错误场景:
- 网络连接问题
- HTML无效或缺少内容
- Robots.txt限制
- 请求超时或速率限制
- 内容大小太大(>10MB)
许可证
麻省理工学院
