Crawl4AI MCP服务器
一种模型上下文协议(MCP)服务器实现,将Crawl4AI与Cursor AI集成在一起,提供web抓取和爬行功能,作为Cursor Composer代理模式下LLM的工具。
系统要求
已安装Python 3.10或更高版本。
特点
- 单页抓取
- 网站爬行
安装
基本设置说明也可在 MCP服务器快速入门官方文档.
设置您的环境
首先,让我们安装 uv 并设置我们的Python项目和环境:
MacOS/Linux:
curl -LsSf https://astral.sh/uv/install.sh | sh窗户:
powershell -ExecutionPolicy ByPass -c "irm https://astral.sh/uv/install.ps1 | iex"确保之后重新启动终端,以确保收到uv命令。
之后:
- 克隆存储库
- 使用UV安装依赖项:
# Navigate to the crawl4ai-mcp directory
cd crawl4ai-mcp
# Install dependencies (Only first time)
uv venv
uv sync
# Activate the venv
source .venv/bin/activate
# Run the server
python main.py- 添加到Cursor的MCP服务器或Claude的MCP服务器
您可能需要在命令字段中输入uv可执行文件的完整路径。你可以通过跑步来获得这个 which uv 在MacOS/Linux或 where uv 在Windows上。
{
"mcpServers": {
"Crawl4AI": {
"command": "uv",
"args": [
"--directory",
"/ABSOLUTE/PATH/TO/PARENT/FOLDER/crawl4ai-mcp",
"run",
"main.py"
]
}
}
}提供的工具
此MCP服务器向LLM公开以下工具:
scrape_webpage(url: str)
- 说明: 使用Crawl4AI从单个网页中抓取内容和元数据。 - 参数: - url (string,必填):要抓取的网页的URL。 - 退货: 包含以下内容的列表 TextContent 对象将抓取的内容(主要是markdown)转换为JSON。
crawl_website(url: str, crawl_depth: int = 1, max_pages: int = 5)
- 说明: 使用Crawl4AI从给定的URL开始抓取网站,直到达到指定的深度和页面限制。 - 参数: - url (字符串,必填):要爬网的起始URL。 - crawl_depth (整数,可选,默认值:1):相对于起始URL的最大爬网深度。 - max_pages (整数,可选,默认值:5):爬网期间要抓取的最大页数。 - 退货: 包含以下内容的列表 TextContent 对象,其中包含已爬网页面的JSON结果数组(包括URL、成功状态、标记内容或错误)。
