AI光标刮除助手
一个强大的工具,利用Cursor AI和MCP(模型上下文协议)为各种类型的网站轻松生成网页抓取器。该项目可帮助您快速分析网站,并以最小的努力生成合适的Scrapy或迷彩刮刀。
项目概述
该项目包含两个主要组成部分:
- 光标规则 -一组规则,教Cursor AI如何分析网站并创建不同类型的Scrapy蜘蛛
- MCP工具 -一组模型上下文协议工具,增强了Cursor执行web抓取任务的能力
先决条件
- 光标AI 安装
- 已安装Python 3.10+
- 网络抓取概念的基本知识
安装
将此存储库克隆到本地计算机:
git clone https://github.com/TheWebScrapingClub/AI-Cursor-Scraping-Assistant.git
cd AI-Cursor-Scraping-Assistant安装所需的依赖项:
pip install mcp camoufox scrapy如果你打算使用Camoufox,你需要获取它的浏览器二进制文件:
python -m camoufox fetch设置
设置MCP服务器
MCP服务器提供了帮助Cursor AI分析网页和生成XPath选择器的工具。要启动MCP服务器,请执行以下操作:
- 导航到MCPfiles目录:
cd MCPfiles- 更新
CAMOUFOX_FILE_PATH在……里面xpath_server.py指向您的本地Camoufox_template.py文件。
- 启动MCP服务器:
python xpath_server.py- 在Cursor中,通过在设置中配置或使用MCP面板连接到MCP服务器。
光标规则
游标规则目录包含教cursor AI如何分析网站和创建不同类型抓取器的规则。在Cursor中打开项目时,这些规则会自动加载。
光标规则详解
这 cursor-rules 目录包含一组MDC(Markdown配置)文件,用于指导Cursor在创建web抓取器时的行为:
prerequisites.mdc
此规则在创建任何抓取器之前处理初始设置任务:
- 使用以下命令获取当前项目的完整路径
pwd - 将路径存储在上下文中,供其他规则稍后使用
- 在继续之前确认初步行动的执行
website-analysis.mdc
这条全面的规则指导Cursor进行网站分析:
- 确定要构建的刮擦蜘蛛的类型(PLP、PDP等)
- 获取并存储主页HTML和Cookie
- 使用MCP工具剥离CSS以简化HTML分析
- 检查Cookie的反机器人保护(Akamai、Datadome、PerimeterX等)
- 对于PLP抓取器:获取类别页面,分析结构,查找JSON数据
- 对于PDP抓取器:获取产品页面,分析结构,查找JSON数据
- 检测schema.org标记和Next.js等现代框架
scrapy-step-by-step-process.mdc
此规则提供了创建抓取器的执行流程:
- 概述要遵循的步骤顺序
- 以正确的顺序引用其他规则文件
- 确保在创建刮刀之前完成先决条件操作
- 引导Cursor在生成代码之前分析网站
scrapy.mdc
这条广泛的规则包含了Scrapy的最佳实践:
- 定义推荐的代码组织和目录结构
- 详细说明文件命名约定和模块组织
- 提供组件架构指南
- 提供代码拆分和重用策略
- 包括性能优化建议
- 涵盖安全实践、错误处理和日志记录
- 提供特定的语法示例和代码片段
scraper-models.mdc
此规则定义了可以创建的不同类型的刮刀:
- 电子商务PLP:详细说明数据结构、字段定义和实施步骤
- 电子商务PDP:详细说明数据结构、字段定义和实施步骤
- 所有刮板类型的现场测绘指南
- 创建每种类型刮刀的分步说明
- 默认设置建议
- 针对不同保护系统的反机器人对策
用法
以下是如何使用AI光标抓取助手:
- 在Cursor AI中打开项目
- 确保MCP服务器正在运行
- 让Cursor创建一个带有如下提示的scraper:
Write an e-commerce PLP scraper for the website gucci.com光标将:
- 分析网站结构
- 检查反机器人保护
- 提取相关的HTML元素
- 根据网站类型生成完整的Scrapy spider
可用刮板类型
您可以要求不同类型的刮刀:
- 电子商务PLP(产品列表页面) -废弃产品目录/类别页面
- 电子商务PDP(产品详情页) -报废详细的产品信息
例如:
Write an e-commerce PDP scraper for nike.com高级用法
迷彩集成
该项目包括一个迷彩模板,用于创建可以绕过某些反机器人措施的隐形刮刀。MCP工具可帮助您:
- 使用Camoufox获取页面内容
- 为所需元素生成XPath选择器
- 根据模板创建完整的迷彩刮刀
定制刮刀
您可以通过向光标规则文件添加新的刮刀类型来扩展该功能。模块化设计便于定制。
项目结构
AI-Cursor-Scraping-Assistant/
├── MCPfiles/
│ ├── xpath_server.py # MCP server with web scraping tools
│ └── Camoufox_template.py # Template for Camoufox scrapers
├── cursor-rules/
│ ├── website-analysis.mdc # Rules for analyzing websites
│ ├── scrapy.mdc # Best practices for Scrapy
│ ├── scrapy-step-by-step-process.mdc # Guide for creating scrapers
│ ├── scraper-models.mdc # Templates for different scraper types
│ └── prerequisites.mdc # Setup requirements
└── README.mdTODO:未来的增强功能
计划在未来开发以下功能:
代理集成
- 在操作员要求时添加代理支持
- 实施代理轮换策略
- 支持不同的代理提供商
- 处理代理身份验证
- 与流行的代理服务集成
改进的XPath生成和验证
- 为生成的XPath选择器添加验证机制
- 实施反馈循环以优化选择器
- 返工选择器的控制流管理
- 自动纠正有问题的选择器
- 处理动态内容和AJAX加载等边缘情况
其他计划功能
- 支持更多抓取器类型(新闻网站、社交媒体等)
- 与其他反机器人绕过技术集成
- 增强的JSON提取功能
- 支持更复杂的导航模式
- 多页面抓取优化
参考文献
该项目基于The Web Scraping Club的文章:
有关网页抓取技术和最佳实践的更多信息,请访问 网络刮擦俱乐部.
贡献
欢迎投稿!请随时提交拉取请求。
许可证
此项目根据MIT许可证获得许可-有关详细信息,请参阅许可证文件。

