Token导航 LogoToken导航TokenDH.com
效率操作浏览器clawhub未标认证来源可访问clear审计提醒

playwright-ocrPlaywright OCR 测试

Agent Skill

用于辅助测试设计、自动化测试、用例整理和回归验证。它适合让 Agent 编写单元测试、端到端测试、测试计划或根据失败日志定位问题。使用时需要确认项目测试框架、运行命令和夹具数据,避免为了通过测试而改坏真实逻辑;涉及浏览器或外部服务时,应区分本地模拟、测试环境和生产环境。

总安装

2,281

周安装

96

GitHub Stars

公开资料未说明

下载量

799
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:playwright-ocr(Playwright OCR 测试)
来源仓库:https://github.com/cgxxxxxxxxxxxx/playwright-ocr
安装命令:
openclaw skills install playwright-ocr
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install playwright-ocr

简介

playwright-ocr 结合 OCR 技术实现网页文本识别与数据自动提取,提升非结构化信息处理能力。

  • 适用于验证码识别、图片内文字整理及动态渲染内容解析等场景。
  • 通过 clawhub 安装后,可在浏览器自动化基础上叠加 OCR 功能模块。
  • 使用前应确认目标页面是否包含遮挡或低对比度文本,影响识别准确率。
  • 建议配合截图预处理命令优化图像质量,提高 OCR 结果可靠性。

SKILL.md

name
Playwright_OCR
slug
playwright_ocr
version
3.0.0
description
Automated web data extraction using Playwright for browser automation and OCR for text recognition. Use when you need to extract data from dynamic web pages, charts, or visual elements that require both browser automation and optical character recognition. v2.0: Added batch processing, data validation, and error recovery.
metadata
{"clawdbot":{"emoji":"🤖","requires":{"bins":["node","python3"],"npm":["playwright"],"pip":["pytesseract","pillow","paddleocr"]},"os":["linux","darwin","win32"]}}

When to Use

  • Extract data from dynamic web pages with JavaScript-rendered content
  • Scrape charts, graphs, or visual data representations
  • Capture and process screenshots for text extraction
  • Automate data collection from web dashboards
  • Extract data from pages requiring authentication or interaction

Architecture

playwright_ocr/
├── SKILL.md              # This file
├── scripts/
│   ├── extract_data.js   # Playwright browser automation
│   ├── process_ocr.py    # OCR text recognition
│   └── upload_csv.py     # Data export and upload
└── output/
    └── extracted_data.csv # Extracted data

Configuration

Prerequisites

  1. Node.js (for Playwright)
npm install playwright
npx playwright install chromium
  1. Python (for OCR)
pip3 install pytesseract pillow
apt-get install tesseract-ocr  # Linux

API Keys (Optional)

  • Feishu API: For uploading data to Feishu Bitable
  • Cloud OCR: For enhanced OCR accuracy (Google Vision, Azure OCR, etc.)

Usage Examples

Example 1: Extract Chart Data

cd /root/.openclaw/workspace/skills/playwright_ocr
node scripts/extract_data.js --url "https://example.com/chart" --output data.json
python3 scripts/process_ocr.py --input screenshots/ --output data.csv

Example 2: Full Pipeline

# Configure target URL and selectors
export TARGET_URL="https://openrouter.ai/apps?url=https%3A%2F%2Fopenclaw.ai%2F"
export OUTPUT_DIR="/root/.openclaw/workspace/output"

# Run extraction
python3 scripts/run_pipeline.py

Example 3: Scheduled Extraction

# Add to crontab for daily extraction
0 2 * * * cd /root/.openclaw/workspace/skills/playwright_ocr && python3 scripts/run_pipeline.py

Workflow

  1. Browser Automation (Playwright)

- Navigate to target URL - Wait for dynamic content to load - Interact with elements (hover, click, etc.) - Capture screenshots of data regions

  1. OCR Processing (Tesseract)

- Pre-process images (enhance contrast, remove noise) - Extract text using OCR - Parse structured data (tables, charts)

  1. Data Export

- Clean and validate extracted data - Export to CSV/Excel format - Upload to target system (Feishu Bitable, database, etc.)

Output Format

CSV Output

日期,模型名称,Token 消耗,请求次数,费用 (USD)
2026-02-16,Others,67500000000,0,0
2026-02-16,Step 3.5 Flash,55300000000,0,0

JSON Output

{
  "extraction_date": "2026-03-18",
  "source_url": "https://openrouter.ai/apps",
  "data": [
    {
      "date": "2026-02-16",
      "model": "Others",
      "tokens": 67500000000
    }
  ]
}

Error Handling

  • Timeout: Increase wait time in extract_data.js
  • OCR Accuracy: Use image pre-processing or cloud OCR
  • Rate Limiting: Add delays between requests
  • Authentication: Configure credentials in .env file

Best Practices

  1. Respect robots.txt: Check website's crawling policy
  2. Rate Limiting: Add delays to avoid overwhelming servers
  3. Error Recovery: Implement retry logic for failed extractions
  4. Data Validation: Verify extracted data before export
  5. Logging: Maintain detailed logs for debugging

Troubleshooting

Issue: Playwright fails to launch

# Install system dependencies
npx playwright install-deps

Issue: OCR accuracy is poor

# Install additional language packs
sudo apt-get install tesseract-ocr-eng
# Use image pre-processing
python3 scripts/preprocess_image.py --input screenshot.png

Issue: Data extraction incomplete

# Increase wait time for dynamic content
# Check selectors in extract_data.js
# Enable debug mode: export DEBUG=playwright:*

Related Skills

  • web-content-fetcher: For simple web page content extraction
  • self-improving: For learning from extraction errors
  • feishu-bitable: For uploading extracted data to Feishu Bitable

Changelog

v2.0.0 (2026-04-03) - Major Update

新增功能:

  1. 批量处理

- ✅ 支持整个目录批量 OCR 处理 - ✅ 自动去重(相同文件只处理一次) - ✅ 进度跟踪(显示完成百分比) - ✅ 并行处理(同时处理多个文件)

  1. 数据验证

- ✅ OCR 结果自动校验(置信度检查) - ✅ 置信度阈值过滤(<90% 标记为待审核) - ✅ 人工审核队列生成 - ✅ 数据完整性检查

  1. 错误恢复

- ✅ 断点续传(从中断位置继续) - ✅ 失败重试(最多 3 次) - ✅ 详细日志(记录每个步骤) - ✅ 状态保存(重启后恢复)

  1. PaddleOCR 集成

- ✅ 支持 PaddleOCR(中文识别更准确) - ✅ 多语言支持(简中/繁中/英文) - ✅ 自动选择最佳 OCR 引擎

使用示例:

# 批量处理整个目录
python3 scripts/batch_ocr_processor.py \
  --input /path/to/pdfs \
  --output /path/to/results \
  --lang chinese_cht \
  --parallel 4

# 带验证的提取
python3 scripts/extract_data.js \
  --validate \
  --confidence-threshold 0.9 \
  --review-queue

性能提升:

  • 批量处理速度提升 3-5 倍
  • 中文识别准确率提升至 95%+
  • 错误恢复减少 80% 重复工作

v1.0.0 (2026-03-18)

  • Initial release
  • Playwright browser automation
  • Tesseract OCR integration
  • CSV/JSON export
  • Feishu Bitable upload support

适合场景

01

调用多模型

02

代码和文本生成

03

Agent 推理流程

04

OpenRouter 模型接入

能力概览

能力 1

统一调用多种 LLM

能力 2

支持 Claude、Gemini、Kimi 等模型

能力 3

适合聊天、代码和推理任务

能力 4

可作为 Agent 模型调用入口

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

80.43%
按下载量换算643

安全审计

VirusTotal

未展示

ClawScan

可疑

Static analysis

通过

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills