Token导航 LogoToken导航TokenDH.com
Web Scraper API logo
浏览器工具未说明官方级别未说明来源级核验

Web Scraper API

MCP Server

一个全面的网页抓取API,支持MCP服务器集成、SDK和Docker,可将任何网站转换为干净、结构化的数据。

工具数

0

提示词数

0

GitHub Stars

0

资源数

0
浏览器自动化结构化数据TypeScriptCursorCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

jotape4ai

提供方

jotape4ai

最后核验

2026/5/17 20:20

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

🔥 Web Scraper API

全面的web抓取API,支持MCP服务器集成、SDK和Docker。将任何网站转换为干净、结构化的数据。

🌟 特性

  • 🕷️ 个人报废:从特定URL提取内容
  • 🔄 完全爬行:抓取网站的所有可访问页面
  • 📝 多种格式:Markdown、HTML、截图
  • ⚡ 异步:带有Redis的队列系统用于后台处理
  • 🛡️ 健壮:错误处理、速率限制和验证
  • 🎯 可定制的:灵活的抓取和过滤选项

🚀 快速开始

先决条件

  • Node.js 18+
  • 雷迪斯
  • npm或pnpm

安装

  1. 克隆和设置:
cd web-scraper-api
npm run install:all
  1. 配置环境变量:
cp api/env.example api/.env
# Edit api/.env as needed
  1. 启动Redis:
redis-server
  1. 启动服务器:
npm run start:dev

API将于 http://localhost:3002

📋 API终点

系统健康

# Check that the API is working
curl http://localhost:3002/health

个人报废

# Basic scrape
curl -X POST http://localhost:3002/api/scrape \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://example.com"
  }'

# Scrape with options
curl -X POST http://localhost:3002/api/scrape \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://example.com",
    "options": {
      "includeHtml": true,
      "includeMarkdown": true,
      "includeScreenshot": false,
      "waitFor": 2000,
      "onlyMainContent": true
    }
  }'

批量报废

curl -X POST http://localhost:3002/api/scrape/batch \
  -H "Content-Type: application/json" \
  -d '{
    "urls": [
      "https://example.com",
      "https://example.com/about",
      "https://example.com/contact"
    ],
    "options": {
      "includeMarkdown": true
    }
  }'

爬行

# Start crawl
curl -X POST http://localhost:3002/api/crawl \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://example.com",
    "options": {
      "maxPages": 10,
      "maxDepth": 2,
      "includeSubdomains": false
    }
  }'

# Check crawl status
curl http://localhost:3002/api/crawl/{job-id}

⚙️ 配置选项

报废选项

选项类型默认值描述
includeHtmlbooleanfalse包含原始HTML
includeMarkdownbooleantrue在Markdown中包含内容
includeScreenshotbooleanfalse包括屏幕截图
waitFornumber0等待时间(毫秒)
timeoutnumber30000请求超时
userAgentstring-自定义用户代理
headersobject-自定义HTTP标头
excludeSelectorsstring\[\]-要排除的CSS选择器
onlyMainContentbooleanfalse只有主要内容

爬行选项

包括所有抓取选项以及:

选项类型默认值描述
maxPagesnumber10可抓取的最大页面数
maxDepthnumber3最大深度
allowedDomainsstring\[\]-允许的域
excludePatternsstring\[\]-要排除的URL模式
includeSubdomainsbooleanfalse包含子域
respectRobotsTxtbooleanfalse尊重robots.txt

🏗️ 建筑

web-scraper-api/
├── api/                    # API Server
│   ├── src/
│   │   ├── routes/        # HTTP routes
│   │   ├── services/      # Business logic
│   │   ├── types/         # Type definitions
│   │   ├── utils/         # Utilities
│   │   └── workers/       # Queue workers
│   └── package.json
├── sdk/                   # TypeScript SDK
│   ├── src/               # API client
│   └── package.json
├── mcp-server/            # MCP Server for Cursor
│   ├── src/               # MCP server
│   └── package.json
├── examples/              # Usage examples
├── docs/                  # Documentation
├── install-mcp.sh         # MCP installation script
└── start-mcp-server.sh    # MCP startup script

🛠️ 发展

可用脚本

# Install all dependencies
npm run install:all

# Development (with hot reload)
npm run start:dev

# Production
npm run build
npm start

# Tests
npm test

# Start workers
cd api && npm run workers

开发配置

api/.env 文件应包括:

PORT=3002
HOST=0.0.0.0
REDIS_URL=redis://localhost:6379
NUM_WORKERS=4
PUPPETEER_HEADLESS=true
LOG_LEVEL=info

🤖 MCP游标服务器

现在,您可以直接在Cursor中使用Web Scraper API和我们的MCP服务器!

快速安装

# Install everything automatically
./install-mcp.sh

# Start server
./start-mcp-server.sh

光标配置

将此添加到光标 settings.json:

{
  "mcp.servers": {
    "web-scraper-api": {
      "command": "node",
      "args": ["/full/path/to/web-scraper-api/mcp-server/dist/index.js"],
      "env": {
        "WEB_SCRAPER_API_URL": "http://localhost:3002"
      }
    }
  }
}

游标中的用法

配置后,您可以使用以下命令:

  • “从中提取内容https://example.com"
  • “批量删除这些URL:\[URLs\]”
  • “抓取整个网站https://blog.example.com"

完整的文件: mcp服务器/README.md

🚀 部署

使用Docker

# Coming soon - Docker Compose
docker-compose up

手册

  1. 在生产环境中配置Redis
  2. 设置环境变量
  3. 构建项目: npm run build
  4. 启动服务器: npm start
  5. 启动工人: npm run workers

🔧 技术

  • 后端:Node.js、TypeScript、Express
  • Web剪贴:木偶,切里奥
  • 队列:BullMQ+Redis
  • 处理:关闭服务(HTML→ Markdown)
  • 安全:头盔、CORS、速率限制

📝 路线图

  • \[\]JavaScript/TypeScript SDK
  • \[\]Python SDK
  • \[\]Web管理界面
  • \[\]身份验证支持
  • \[ \] 网钩通知
  • \[\]Docker容器
  • \[\]指标和监测
  • \[\]智能缓存
  • \[\]代理支持

🤝 贡献

  1. 分叉项目
  2. 创建要素分支(git checkout -b feature/new-feature)
  3. 提交更改(git commit -am 'Add new feature')
  4. 推到分支(git push origin feature/new-feature)
  5. 创建拉取请求

📄 许可证

MIT许可证-请参阅 许可证 了解更多详情。

🙏 灵感

这个项目的灵感来自 萤火虫 并作为一个简化的概念证明,以理解大规模网络抓取的概念。

目录标签

目录标签

浏览器自动化结构化数据TypeScriptCursor网页抓取本地部署数据提取爬虫工具自动化处理

支持客户端

Cursor

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP