mcp服务器蜘蛛:一个蜘蛛mcp服务器
概述
用于蜘蛛爬虫交互和自动化的模型上下文协议服务器。此服务器提供抓取和抓取网页的工具。
请注意,mcp服务器蜘蛛目前处于早期开发阶段。将来可能会添加错误和功能。
工具
crawl
- 抓取给定的网址并返回找到的网址列表 - 输入: - url:要抓取的url - headers:随爬网请求传递的其他标头 - user_agent:用于爬网请求的用户代理 - depth:链接遍历的深度 - blacklist:用于将爬网过程中的URL列入黑名单的正则表达式列表 - whitelist:从爬网过程到白名单URL的正则表达式列表 - respect_robots_txt:是否尊重 robots.txt 文件 - accept_invalid_certs:是否接受无效证书 - 返回:找到的URL列表
scrape
- 抓取给定的url并返回一个JSON对象列表,其中包含所发现的每个页面的url、链接和内容 - 输入:与 crawl - 返回:JSON对象列表(字符串形式),其中包含所发现的每个页面的url、链接和内容
安装
使用紫外线(推荐)
使用时 uv 不需要特定的安装。我们将 使用 uvx 直接运行 *mcp服务器蜘蛛*.
使用PIP
或者,您可以安装 mcp-server-spider 通过pip:
pip install mcp-server-spider安装后,您可以使用以下命令将其作为脚本运行:
python -m mcp_server_spider