Token导航 LogoToken导航TokenDH.com
开发操作浏览器clawhub未标认证来源可访问clear审计提醒

crawl4aicrawl4ai 命令行

Agent Skill

crawl4ai 用于处理浏览器自动化、网页检查和页面信息提取,适合在 OpenClaw 中需要让 Agent 打开页面、读取网页或验证前端流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

67,944

周安装

2,831

GitHub Stars

2

下载量

22,648
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:crawl4ai(crawl4ai 命令行)
来源仓库:https://github.com/codylrn804/crawl4ai
安装命令:
openclaw skills install crawl4ai
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install crawl4ai

简介

由人工智能驱动的网络抓取框架,用于从网站中提取结构化数据。当 Codex 需要使用 AI 支持的解析从网页中爬行、抓取或提取数据、处理动态内容或处理复杂的 HTML 结构时使用。

SKILL.md

name
crawl4ai
description
AI-powered web scraping framework for extracting structured data from websites. Use when Codex needs to crawl, scrape, or extract data from web pages using AI-powered parsing, handle dynamic content, or work with complex HTML structures.

Crawl4ai

Overview

Crawl4ai is an AI-powered web scraping framework designed to extract structured data from websites efficiently. It combines traditional HTML parsing with AI to handle dynamic content, extract text intelligently, and clean and structure data from complex web pages.

When to Use This Skill

Use when Codex needs to:

  • Extract structured data from web pages (products, articles, forms, tables, etc.)
  • Scrape websites with dynamic content or complex JavaScript
  • Clean and normalize extracted data from various HTML structures
  • Work with APIs or web services that return HTML
  • Handle CORS limitations by scraping directly
  • Process web content at scale with reliability

Trigger phrases:

  • "Extract data from this website"
  • "Scrape this page for [specific data]"
  • "Parse this HTML"
  • "Get data from [URL]"
  • "Extract structured information from [website]"
  • "Scrape [website] for [data type]"
  • "Web scrape [URL]"

Quick Start

Basic Usage

from crawl4ai import AsyncWebCrawler, BrowserMode

async def scrape_page(url):
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(
            url=url,
            browser_mode=BrowserMode.LATEST,
            headless=True
        )
        return result.markdown, result.clean_html

Extracting Structured Data

from crawl4ai import AsyncWebCrawler, JsonModeScreener
import json

async def extract_products(url):
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(
            url=url,
            screenshot=True,
            javascript=True,
            bypass_cache=True
        )
        # Extract product data
        products = []
        for item in result.extracted_content:
            if item['type'] == 'product':
                products.append({
                    'name': item['name'],
                    'price': item['price'],
                    'url': item['url']
                })
        return products

Common Tasks

Web Scraping Basics

Scenario: User wants to scrape a website for all article titles.

from crawl4ai import AsyncWebCrawler

async def scrape_articles(url):
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(
            url=url,
            javascript=True,
            verbose=True
        )
        # Extract article titles from HTML
        articles = result.extracted_content if result.extracted_content else []
        titles = [item.get('name', item.get('text', '')) for item in articles]
        return titles

Trigger: "Scrape this site for article titles" or "Get all titles from [URL]"

Dynamic Content Handling

Scenario: Website loads data via JavaScript.

from crawl4ai import AsyncWebCrawler

async def scrape_dynamic_site(url):
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(
            url=url,
            javascript=True,  # Wait for JS execution
            wait_for="body",   # Wait for specific element
            delay=1.5,         # Wait time after load
            headless=True
        )
        return result.markdown

Trigger: "Scrape this dynamic website" or "This page needs JavaScript to load data"

Structured Data Extraction

Scenario: Extract specific fields like prices, descriptions, etc.

from crawl4ai import AsyncWebCrawler

async def extract_product_details(url):
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(
            url=url,
            screenshot=True,
            js_code="""
                const products = document.querySelectorAll('.product');
                return Array.from(products).map(p => ({
                    name: p.querySelector('.name')?.textContent,
                    price: p.querySelector('.price')?.textContent,
                    url: p.querySelector('a')?.href
                }));
            """
        )
        return result.extracted_content

Trigger: "Extract product details from this page" or "Get price and name from [URL]"

HTML Cleaning and Parsing

Scenario: Clean messy HTML and extract clean text.

from crawl4ai import AsyncWebCrawler

async def clean_and_parse(url):
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(
            url=url,
            remove_tags=['script', 'style', 'nav', 'footer', 'header'],
            only_main_content=True
        )
        # Clean and return markdown
        clean_text = result.clean_html
        return clean_text

Trigger: "Clean this HTML" or "Extract main content from this page"

Advanced Features

Custom JavaScript Injection

async def custom_scrape(url, custom_js):
    async with AsyncWebCrawler() as crawler:
        result = await crawler.arun(
            url=url,
            js_code=custom_js,
            js_only=True  # Only execute JS, don't download resources
        )
        return result.extracted_content

Session Management

from crawl4ai import AsyncWebCrawler

async def multi_page_scrape(base_url, urls):
    async with AsyncWebCrawler() as crawler:
        results = []
        for url in urls:
            result = await crawler.arun(
                url=url,
                session_id=f"session_{url}",
                bypass_cache=True
            )
            results.append({
                'url': url,
                'content': result.markdown,
                'status': result.success
            })
        return results

Best Practices

  1. Always check if the site allows scraping - Respect robots.txt and terms of service
  2. Use appropriate delays - Add delays between requests to avoid overwhelming servers
  3. Handle errors gracefully - Implement retry logic and error handling
  4. Be selective with data - Extract only what you need, don't dump entire pages
  5. Store data reliably - Save extracted data in structured formats (JSON, CSV)
  6. Clean URLs - Handle redirects and malformed URLs

Error Handling

async def robust_scrape(url):
    try:
        async with AsyncWebCrawler() as crawler:
            result = await crawler.arun(
                url=url,
                timeout=30000  # 30 seconds timeout
            )
            if result.success:
                return result.markdown, result.extracted_content
            else:
                print(f"Scraping failed: {result.error_message}")
                return None, None
    except Exception as e:
        print(f"Scraping error: {str(e)}")
        return None, None

Output Formats

Crawl4ai supports multiple output formats:

  • Markdown: Clean, readable text (result.markdown)
  • Clean HTML: Structured, cleaned HTML (result.clean_html)
  • Extracted Content: Structured JSON data (result.extracted_content)
  • Screenshot: Visual representation (result.screenshot)
  • Links: All links found on page (result.links)

Resources

scripts/

Python scripts for common crawling operations:

  • scrape_single_page.py - Basic scraping utility
  • scrape_multiple_pages.py - Batch scraping with pagination
  • extract_from_html.py - HTML parsing helper
  • clean_html.py - HTML cleaning utility

references/

Documentation and examples:

  • api_reference.md - Complete API documentation
  • examples.md - Common use cases and patterns
  • error_handling.md - Troubleshooting guide

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

74.42%
按下载量换算16,855

安全审计

VirusTotal

可疑

ClawScan

通过

Static analysis

未展示

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills