______________________________________________________________________
克隆、抓取和抓取任何网站。 免费Firecrawl替代品。没有API密钥,没有速率限制,没有订阅。
快速开始
光标(单击一次): 单击上面的“在光标中安装”按钮。
手动MCP配置:
{
"mcpServers": {
"deepcrawl-mcp": {
"command": "npx",
"args": ["-y", "deepcrawl-mcp@latest"]
}
}
}CLI:
npx deepcrawl-mcp@latest工具
deepcrawl_scrape
删除一页并返回干净的标记。提取标题、描述、链接、图像和元数据。剥离导航、页脚、广告和跟踪。
"Scrape https://example.com and give me the main content"| 参数 | 默认值 | 说明 |
|---|---|---|
url | 必需 | 要抓取的页面URL |
mainContentOnly | true | 仅提取主要内容(跳过导航/页脚) |
includeLinks | true | 包含已发现的链接 |
includeImages | true | 包含图像URL |
deepcrawl_clone
克隆一个包含所有资源的完整页面:HTML、CSS、JS、图像、字体、favicons。将所有内容下载到本地文件夹中,将URL重写为相对路径。打开 index.html 在浏览器中,它可以正常工作。
"Clone https://competitor.com into a local folder"| 参数 | 默认值 | 说明 |
|---|---|---|
url | 必需 | 要克隆的页面URL |
outputDir | ~/deepcrawl-clones/ | 输出文件夹 |
depth | 0 | 链接深度:0=单页,1+=关注链接 |
deepcrawl_crawl
通过内部链接抓取整个网站。以干净的markdown返回每一页。非常适合内容分析、SEO审计或为RAG管道提供数据。
"Crawl https://docs.example.com and return all pages as markdown"| 参数 | 默认值 | 说明 |
|---|---|---|
url | 必需 | 起始URL |
maxPages | 20 | 要抓取的最大页面数(最大:100) |
includeImages | false | 每页包含图像URL |
deepcrawl_map
通过sitemap.xml解析和主页链接爬行发现网站中的所有URL。在爬网之前运行此命令以查看网站的范围。
"Map all pages on https://example.com"| 参数 | 默认值 | 说明 |
|---|---|---|
url | 必填 | 网站URL |
maxUrls | 200 | 要发现的最大URL数 |
vs Firecrawl
| deepcrawl | Firecrawl | |
|---|---|---|
| 价格 | 免费 | 每月19美元以上 |
| API密钥 | 无 | 必需 |
| 费率限制 | 无 | 是 |
| 报废降价 | 是 | 是 |
| 完整网站抓取 | 是 | 是 |
| 网站地图 | 是 | 是 |
| 使用资产进行克隆 | 是 | 没有 |
| JS渲染 | 是 (通过剧作家) | 是 |
| 反机器人旁路 | 部分(UA轮换、标头、延迟) | 是 |
deepcrawl可以开箱即用地处理静态站点。对于JS密集的SPA(React、Next.JS、SvelteKit),安装Playwright进行完整渲染:
npm install -g playwright
npx playwright install chromium安装后,deepcrawl会自动检测Playwright并启用JS渲染。使用 jsRender: true 所有工具还包括UA旋转、逼真的浏览器头和随机延迟,以避免基本的机器人检测。
也是Soflution
- brandcheck -检查27个平台上的品牌可用性
- 副声纳 -依赖性审计、安全扫描、许可证检查
许可证
麻省理工学院
