克劳德·斯基尔刮网机
Claude Code技能,使用Playwright MCP浏览器将任何网站的结构化数据提取到CSV中。
它做什么
- 从任何URL中删除联系人、校友、与会者、潜在客户或任何记录
- 处理登录门控网站(您手动登录,其余由Claude完成)
- 分页、无限滚动、AJAX/SPA网站
- 可恢复的会话--从您中断的地方继续
- 重复数据删除、错误记录、后处理
- 多个搜索词以合并输出运行
非常适合
- LinkedIn连接——您自己的,或来自任何其他个人资料
- 校友名录(麻省理工学院、哈佛大学等)
- 与会者名单(Luma、Whova、Eventbrite)
- 任何企业或人员目录
安装
# 1. Clone or download this repo
mkdir -p ~/.claude/skills
git clone https://github.com/Sharan0516/claude-skill-web-scraper.git ~/.claude/skills/web-scraper-extractor
# 2. Add Playwright MCP
claude mcp add playwright -- npx @playwright/mcp
# 3. Restart Claude Code, then say:
# "Set up the web scraper prerequisites"用法
只需在Claude Code中描述你想要什么:
- *“将此URL中的所有联系人提取到CSV中”*
- *“将我在领英的联系记录到电子表格中”*
- *“转到linkedin.com/in/username,提取他们的10个连接,包括姓名、职务、公司、位置”*
- *“恢复昨天的抓取会话”*
LinkedIn笔记
破坏他人的联系: 指向Claude的LinkedIn个人资料URL,并询问他们的联系方式。克劳德会找到的 connectionOf 自动搜索URL并提取结果。
登录: Playwright浏览器是一个 隔离会话 --它不会与您共享Cookie 常规浏览器。您必须登录Playwright内的LinkedIn(或任何其他网站) 在抓取开始之前打开浏览器窗口。
CSS选择器: LinkedIn经常更换前端。此技能使用 innerText 行解析而不是CSS类选择器,使其对LinkedIn UI更新具有鲁棒性。
需求
- 克劳德代码
- Node.js
- Python 3
- 剧作家MCP服务器(
npx @playwright/mcp)
更新日志
2026-03-02
- 添加了用于抓取的LinkedIn剧本 另一个人的关系 (不仅仅是你自己的)
- 将脆弱的CSS类提取替换为
innerTextLinkedIn搜索结果的行解析 - 为所有LinkedIn标题格式添加标题解析逻辑(
@ Company,at Company,自由格式) - 添加了明确的注释:Playwright浏览器是一个独立的会话,与常规浏览器分开
- 在错误恢复备忘单中添加了特定于LinkedIn的行
