Token导航 LogoToken导航TokenDH.com
效率操作浏览器clawhub未标认证来源可访问clear审计提醒

anti-bot-scraper反机器人抓取工具

Agent Skill

anti-bot-scraper 用于处理浏览器自动化、网页检查和页面信息提取,适合在 OpenClaw 中需要让 Agent 打开页面、读取网页或验证前端流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

7,338

周安装

312

GitHub Stars

公开资料未说明

下载量

2,571
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:anti-bot-scraper(反机器人抓取工具)
来源仓库:https://github.com/tttyix/anti-bot-scraper
安装命令:
openclaw skills install anti-bot-scraper
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install anti-bot-scraper

简介

anti-bot-scraper 基于 Playwright 实现反爬虫网页抓取,支持隐身模式和批量整理任务。

  • 适用于 OpenClaw 中自动化提取网页内容、截图保存或绕过基础反爬机制。
  • 内置 webdriver 隐藏、随机 User-Agent 和指纹防护技术增强隐蔽性。
  • 使用前需确认是否具备目标网站访问权限,避免违反服务条款或法律风险。
  • 建议限制请求频率并遵守 robots.txt 规则,确保合规性与稳定性。

SKILL.md

name
stealth-scraper
description
基于 Playwright 的反爬虫网页抓取技能。支持普通模式、隐身模式和批量模式。内置反检测技术(隐藏 webdriver、随机 UA、Canvas/WebGL 指纹防护)绕过常见反爬虫机制。使用场景:抓取网页内容、反爬虫抓取、批量整理、截图保存。触发关键词:scrape, 抓取, 爬虫, 反爬, stealth scrape, 整理网页, 批量抓取。
bins

Stealth Scraper

基于 Playwright 的反爬虫网页抓取技能,支持普通模式、隐身模式和批量模式。

Description

强大的网页抓取工具,内置反检测技术,绕过常见反爬虫机制。纯手写反检测代码,不依赖任何第三方 stealth 插件。

核心能力:

  • 🕵️ 隐身模式:隐藏 webdriver 指纹、随机 UA、随机延迟、禁用指纹追踪
  • 📄 普通模式:快速抓取页面内容
  • 📦 批量模式:并发抓取多个 URL,自动限速
  • 🎯 精确提取:CSS 选择器定向抓取
  • 📸 截图 & HTML 保存

Configuration

bins: ["node"]

Setup

首次使用前需要安装依赖:

cd ~/.openclaw/workspace/skills/stealth-scraper
npm install

如果 Chromium 未自动安装,运行:

node scripts/setup.js

Usage

普通模式(快速抓取)

node scripts/scraper-simple.js <URL> [options]

参数:

参数说明默认值
--wait <ms>页面加载后等待时间(毫秒)2000
--selector <css>CSS 选择器,只提取匹配元素的内容无(提取全部)

示例:

# 基本抓取
node scripts/scraper-simple.js https://example.com

# 等待 5 秒后提取
node scripts/scraper-simple.js https://example.com --wait 5000

# 只提取文章正文
node scripts/scraper-simple.js https://example.com --selector "article.content"

隐身模式(反爬虫)

node scripts/scraper-stealth.js <URL> [options]

参数:

参数说明默认值
--wait <ms>页面加载后等待时间(毫秒)2000
--selector <css>CSS 选择器精确提取
--proxy <url>代理服务器地址
--screenshot <path>保存截图到指定路径
--html <path>保存完整 HTML 到指定路径
--cookie <json>自定义 cookie(JSON 格式)
--scroll自动滚动页面加载懒加载内容false

示例:

# 隐身抓取
node scripts/scraper-stealth.js https://example.com

# 使用代理 + 截图
node scripts/scraper-stealth.js https://example.com --proxy http://127.0.0.1:7890 --screenshot ./shot.png

# 自动滚动 + 保存 HTML
node scripts/scraper-stealth.js https://example.com --scroll --html ./page.html

# 带 cookie 访问
node scripts/scraper-stealth.js https://example.com --cookie '[{"name":"token","value":"abc123","domain":".example.com"}]'

# 精确提取 + 等待
node scripts/scraper-stealth.js https://example.com --selector "div.main" --wait 5000

批量模式

node scripts/scraper-batch.js [options] <URL1> <URL2> ...
# 或
node scripts/scraper-batch.js --file urls.txt [options]

参数:

参数说明默认值
--file <path>URL 列表文件(每行一个 URL)
--concurrency <n>并发数3
--stealth使用隐身模式false
--wait <ms>每个页面的等待时间2000
--selector <css>CSS 选择器
--output <path>输出 JSON 文件路径stdout

示例:

# 批量抓取多个 URL
node scripts/scraper-batch.js https://a.com https://b.com https://c.com

# 从文件读取 URL 列表,隐身模式
node scripts/scraper-batch.js --file urls.txt --stealth --concurrency 2

# 输出到文件
node scripts/scraper-batch.js --file urls.txt --output results.json

Output Format

所有模式输出统一的 JSON 结构:

{
  "success": true,
  "url": "https://example.com",
  "title": "Example Domain",
  "content": "页面文本内容...",
  "links": [{"text": "More info", "href": "https://..."}],
  "images": [{"alt": "Logo", "src": "https://..."}],
  "metadata": {
    "description": "...",
    "keywords": "...",
    "author": "..."
  },
  "elapsedSeconds": 2.35
}

Anti-Detection Features

技术说明
navigator.webdriver 隐藏删除 webdriver 属性,伪装为真实浏览器
User-Agent 轮换10+ 真实 UA,涵盖 Chrome/Safari/Firefox,桌面+移动端
随机延迟1-3 秒随机等待,模拟人类浏览行为
随机视口随机分辨率,避免固定窗口指纹
WebGL 指纹防护注入噪声干扰 WebGL 指纹整理
Canvas 指纹防护对 Canvas 数据添加微小噪声
插件伪装伪造 navigator.plugins 数组
语言伪装伪造 navigator.languages
硬件并发伪装随机化 navigator.hardwareConcurrency

Notes

  • 纯手写反检测代码,不使用任何第三方 stealth 插件(如 puppeteer-extra-plugin-stealth),避免被反检测系统识别
  • 使用 Playwright 而非 Puppeteer,因为 Playwright 的反检测基础更好
  • 所有反检测代码通过 addInitScript 在页面加载前注入
  • 请遵守目标网站的 robots.txt 和服务条款

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

79%
按下载量换算2,031

安全审计

VirusTotal

通过

ClawScan

通过

Static analysis

可疑

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills