废料流MCP
 
实施 模型上下文协议(MCP) 这使得像克劳德这样的人工智能代理能够以高精度抓取和解释实时网络数据。
特性
- FastMCP框架: 使用最新的2026年AI互操作标准构建。
- 无头自动化: 使用Playwright处理JavaScript繁重的网站。
- 上下文优化: 自动清理HTML以保存LLM令牌。
- 智能缓存: 缓存会抓取内容10分钟,以避免冗余请求。
- 可配置: 可调节的字符限制和元数据选项。
______________________________________________________________________
先决条件
在开始之前,请确保您已经:
______________________________________________________________________
安装
1.克隆或下载此存储库
git clone https://github.com/RootedDreamsBlog/ScrapeFlow-MCP
cd ScrapeFlow-MCP或者下载并解压缩ZIP文件,然后导航到终端中的文件夹。
2.安装Python依赖项
pip install -r requirements.txt3.安装Playwright浏览器
playwright install chromium这将下载Playwright用于抓取的Chromium浏览器。
______________________________________________________________________
使用Claude Desktop进行设置
第一步:找到你的 server.py 绝对路径
你需要 完整路径 致你的 server.py 文件。
在Mac/Linux上:
cd /path/to/ScrapeFlow-MCP
echo "$(pwd)/server.py"在Windows(PowerShell)上:
cd C:\path\to\ScrapeFlow-MCP
Write-Host "$(Get-Location)\server.py"复制输出! 例子:
- 雨衣:
/Users/yourname/Documents/ScrapeFlow-MCP/server.py - 窗户:
C:\Users\yourname\Documents\ScrapeFlow-MCP\server.py
______________________________________________________________________
步骤2:找到您的Claude桌面配置文件
在Mac上:
open ~/Library/Application\ Support/Claude/在Windows上(命令提示符):
explorer %APPDATA%\Claude在Windows(PowerShell)上:
explorer $env:APPDATA\Claude这将打开Claude配置文件夹。寻找 claude_desktop_config.json.
______________________________________________________________________
步骤3:编辑配置文件
如果文件不存在,请创建它。然后添加以下配置:
Mac示例:
{
"mcpServers": {
"scrapeflow": {
"command": "python3",
"args": ["/Users/yourname/Documents/ScrapeFlow-MCP/server.py"]
}
}
}Windows示例:
{
"mcpServers": {
"scrapeflow": {
"command": "python",
"args": ["C:/Users/yourname/Documents/ScrapeFlow-MCP/server.py"]
}
}
}重要提示:
- 将路径替换为步骤1中的实际路径
- 在Windows上,使用正斜杠(
/)或双反睫毛(\\) - 如果您使用虚拟环境,请使用该Python可执行文件的完整路径
______________________________________________________________________
步骤4:重新启动克劳德桌面
完全退出 Claude Desktop(不要只是关闭窗口),然后重新打开它。
在Mac上: Cmd + Q 退出 在Windows上: 右键单击任务栏图标并选择“退出”
______________________________________________________________________
测试您的MCP服务器
重新启动Claude Desktop后,打开一个新的聊天室并尝试以下测试提示:
简易测试站点(从这里开始)
Can you scrape https://example.com and tell me what it says?Use the search_and_summarize tool to get content from https://news.ycombinator.comScrape https://lite.cnn.com and summarize the top headlines高级测试
Get the content from https://www.bbc.com/news with max_chars set to 3000Scrape https://github.com/trending and tell me what's trending⚠可能无法运行的网站
一些网站具有强大的反机器人保护功能,可能会超时:
- 福布斯,中型(付费墙)
- 亚马逊、eBay(大量JavaScript)
- 带有验证码的网站
对于这些网站,该工具将返回一条包含建议的错误消息。
______________________________________________________________________
替代测试方法:MCP检查员
如果您想在没有Claude Desktop的情况下进行测试,请使用MCP检查器:
1.安装Node.js
下载自
2.运行检查器
cd /path/to/ScrapeFlow-MCP
npx @modelcontextprotocol/inspector python server.py3.打开浏览器界面
- 终端将显示一个URL,如下所示
http://localhost:6274 - 单击它或将其粘贴到浏览器中
- 点击“连接”→ 转到“工具”选项卡
- 你会看到
search_and_summarize-尝试在那里输入URL
______________________________________________________________________
运作原理
当你让克劳德抓取一个网站时:
- 克劳德认识到它应该使用
search_and_summarize工具 - 您的MCP服务器接收URL
- Playwright启动无头浏览器并访问页面
- 清理HTML(删除脚本、广告、导航)
- 提取并缓存文本内容
- Claude收到清理后的内容,可以回答您的问题
______________________________________________________________________
故障排除
“未找到工具”或Claude未使用该工具
解决方案:
- 检查配置文件路径是否正确
- 确保您完全退出并重新启动了Claude Desktop
- 检查克劳德桌面日志:
- 雨衣: ~/Library/Logs/Claude/mcp*.log - 窗户: %APPDATA%\Claude\logs\mcp*.log
“找不到命令:python”
解决方案: 尝试更改 "command": "python" 到 "command": "python3" 在您的配置文件中。
特定网站上的超时错误
解决方案: 对于具有大量JavaScript或反机器人保护的网站来说,这是正常的。尝试:
- 更简单的新闻网站(英国广播公司、路透社)
- 技术网站(GitHub、Stack Overflow)
- 文件网站
服务器未启动
解决方案: 终端手动测试:
cd /path/to/ScrapeFlow-MCP
python server.py如果看到错误,请检查是否安装了所有依赖项。
______________________________________________________________________
配置选项
这 search_and_summarize 工具接受以下参数:
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
url | 字符串 | *必需的* | 要抓取的网页URL |
max_chars | integer | 5000 | 返回的最大字符数 |
include_metadata | boolean | true | 包括URL和字符计数信息 |
Claude中的示例用法:
Scrape https://example.com with max_chars set to 10000______________________________________________________________________
项目结构
ScrapeFlow-MCP/
├── server.py # FastMCP server configuration
├── scraper.py # WebScout scraping class
├── requirements.txt # Python dependencies
└── README.md # This file______________________________________________________________________
贡献
发现bug或想改进刮刀?欢迎投稿!
- 分叉此存储库
- 创建要素分支(
git checkout -b feature/improvement) - 提交您的更改(
git commit -am 'Add new feature') - 推到分支(
git push origin feature/improvement) - 打开拉取请求
______________________________________________________________________
许可证
麻省理工学院许可证-请随意使用此项目进行学习和发展!
______________________________________________________________________
致谢
______________________________________________________________________
问题或议题?
如果你遇到问题:
- 检查上面的故障排除部分
- 查看克劳德桌面日志
- 在GitHub上打开一个问题:
- 您的操作系统 - 日志中的错误消息 - 您已经尝试过的步骤
刮得开心!
这个项目是我博客上深度学习教程的一部分:\[https://www.rooteddreams.net/web-scraping-mcp-guide/\]
