Token导航 LogoToken导航TokenDH.com
开发操作浏览器github未标认证来源可访问许可证需确认审计异常

website-to-vite-scraper网站 vite scraper

Agent Skill

website-to-vite-scraper 用于处理浏览器自动化、网页检查和页面信息提取,适合在 Codex、Claude、Cursor、Gemini CLI 中需要让 Agent 打开页面、读取网页或验证前端流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

1,082

周安装

46

GitHub Stars

5

下载量

379
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:website-to-vite-scraper(网站 vite scraper)
来源仓库:https://github.com/breverdbidder/life-os
仓库路径:skills/website-to-vite-scraper
安装命令:
npx skills add https://github.com/breverdbidder/life-os --skill website-to-vite-scraper
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/breverdbidder/life-os --skill website-to-vite-scraper

简介

website-to-vite-scraper 用于处理浏览器自动化、网页检查和页面信息提取,适合在 Codex、Claude、Cursor、Gemini CLI 中需要让 Agent 打开页面、读取网页或验证前端流程时使用。

  • 可结合来源仓库、安装命令和原始 README 继续核验具体用法。
  • 安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。
  • 当前顶部介绍为空,底部简介无内容。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

Website-to-Vite Scraper V2

Multi-provider website scraper with AI-powered extraction for any website type.

Scraping Methods

MethodBest ForAnti-BotJS RenderingCost
PlaywrightGeneral sites, Next.js/React apps✅ FullFREE
Apify RAG BrowserLLM/RAG-optimized content✅ AdaptiveCredits
Crawl4AIAI training data, clean extractionCredits
FirecrawlProtected sites, anti-bot bypass✅✅$16/mo

Quick Start

GitHub Actions (Recommended)

# Go to: Actions → Website Scraper V2 → Run workflow
# Options:
#   - URL: https://www.reventure.app/
#   - Project name: reventure-clone
#   - Method: all (tries all providers)
#   - Deploy: true

API MEGA LIBRARY Integration

The following APIs from our library enhance this scraper:

APIPurposeStatus
APIFY_API_TOKENRAG Browser, Crawl4AI, Web Scraper✅ Configured
FIRECRAWL_API_KEYAnti-bot bypass, stealth mode✅ Configured
BROWSERLESS_API_KEYAlternative headless browser🔄 Available

MCP Server Integration

Connect Claude Desktop/Cursor to Apify MCP for AI-powered scraping:

{
  "mcpServers": {
    "apify": {
      "command": "npx",
      "args": ["@apify/actors-mcp-server"],
      "env": {
        "APIFY_TOKEN": "your-apify-api-token"
      }
    }
  }
}

Or use hosted: https://mcp.apify.com?token=YOUR_TOKEN

Apify Actors Used

apify/rag-web-browser

  • Purpose: LLM-optimized web content extraction
  • Output: Markdown, HTML, text
  • Features:

- Playwright adaptive (handles JS) - Clean content extraction - Link following - Metadata extraction

raizen/ai-web-scraper (Crawl4AI)

  • Purpose: AI training data collection
  • Output: Cleaned markdown, structured links
  • Features:

- Excludes boilerplate (headers, footers, nav) - Word count thresholding - External link filtering

Firecrawl

  • Purpose: Anti-bot protected sites
  • Output: Markdown, HTML, screenshots
  • Features:

- Anti-detection technology - JavaScript rendering - Main content extraction - 5-second wait for dynamic content

Output Structure

project-name/
├── dist/
│   ├── index.html      # Best merged HTML
│   ├── screenshot.png  # Full page capture
│   ├── meta.json       # Scrape metadata
│   └── assets/
│       ├── images/     # Downloaded images
│       ├── css/        # Stylesheets
│       └── js/         # Scripts
└── results/
    ├── playwright/     # Raw Playwright output
    ├── apify-rag/      # RAG Browser output
    ├── crawl4ai/       # Crawl4AI output
    └── firecrawl/      # Firecrawl output

Handling CSR/SPA Sites

Sites like Next.js, React, Vue that render client-side require JavaScript execution:

  1. Playwright waits for networkidle + 5 seconds
  2. Apify RAG uses adaptive crawler (Playwright when needed)
  3. Firecrawl has built-in JS rendering

For __NEXT_DATA__ extraction (Next.js sites):

  • Playwright automatically extracts and saves to next_data.json
  • Can be parsed to reconstruct static pages

Workflow Parameters

ParameterTypeDefaultDescription
urlstringrequiredWebsite URL to scrape
project_namestringrequiredOutput folder/Cloudflare project name
scrape_methodchoiceplaywrightMethod to use
extract_assetsbooleantrueDownload images/CSS/JS
deploy_cloudflarebooleantrueDeploy to Cloudflare Pages

Cost Optimization

ScenarioRecommended Method
Simple static sitePlaywright (FREE)
JS-heavy SPAPlaywright → Apify RAG fallback
Protected site (Cloudflare)Firecrawl
AI/RAG pipelineApify RAG or Crawl4AI
Maximum coverageall method

Security Assessment

Per API_MEGA_LIBRARY guidelines:

APISecurity ScoreRecommendation
Apify85/100✅ ADOPT
Firecrawl82/100✅ ADOPT
Playwright90/100✅ ADOPT (local)

Troubleshooting

Site returns blank page

  1. Try scrape_method: all to use multiple providers
  2. Increase wait time in Playwright
  3. Check if site blocks datacenter IPs → use Firecrawl

Assets not downloading

  1. Some sites block direct asset requests
  2. Use relative paths from original HTML
  3. Check for CORS restrictions

Cloudflare protection detected

  1. Use Firecrawl (has anti-bot bypass)
  2. Or use Apify with residential proxies

Related Skills

  • auction-results - Uses similar scraping for auction data
  • bcpao-scraper - BCPAO property data extraction
  • youtube-transcript - Video content extraction

Changelog

V2.0 (Dec 2025)

  • Added multi-provider support (Playwright, Apify, Firecrawl)
  • MCP server integration
  • Automatic provider fallback
  • Asset downloading
  • Cloudflare Pages deployment

V1.0 (Dec 2025)

  • Initial Playwright-only scraper
  • Basic HTML/CSS/JS extraction

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

33.4%
按下载量换算127

Claude

28.8%
按下载量换算109

Cursor

19.39%
按下载量换算73

Gemini CLI

9.71%
按下载量换算37

安全审计

Gen Agent Trust Hub

未通过

Socket

通过

Snyk

未通过

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills