Token导航 LogoToken导航TokenDH.com
Scrape Flow MCP logo
浏览器工具stdio官方级别未说明来源级核验

Scrape Flow MCP

MCP Server

ScrapeFlow-MCP 是一个基于 Model Context Protocol (MCP) 实现的网页抓取工具,能够帮助 AI 代理(如 Claude)高效抓取和解析实时网页数据。

工具数

1

提示词数

0

GitHub Stars

0

资源数

0
浏览器自动化PythonClaudeAI代理工具Claude DesktopClaude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

RootedDreamsBlog

提供方

RootedDreamsBlog

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install -r requirements.txt

详细介绍

废料流MCP

![Python 3.8+](https://www.python.org/downloads/) ![License: MIT](https://opensource.org/licenses/MIT)

实施 模型上下文协议(MCP) 这使得像克劳德这样的人工智能代理能够以高精度抓取和解释实时网络数据。

特性

  • FastMCP框架: 使用最新的2026年AI互操作标准构建。
  • 无头自动化: 使用Playwright处理JavaScript繁重的网站。
  • 上下文优化: 自动清理HTML以保存LLM令牌。
  • 智能缓存: 缓存会抓取内容10分钟,以避免冗余请求。
  • 可配置: 可调节的字符限制和元数据选项。

______________________________________________________________________

先决条件

在开始之前,请确保您已经:

______________________________________________________________________

安装

1.克隆或下载此存储库

git clone https://github.com/RootedDreamsBlog/ScrapeFlow-MCP
cd ScrapeFlow-MCP

或者下载并解压缩ZIP文件,然后导航到终端中的文件夹。

2.安装Python依赖项

pip install -r requirements.txt

3.安装Playwright浏览器

playwright install chromium

这将下载Playwright用于抓取的Chromium浏览器。

______________________________________________________________________

使用Claude Desktop进行设置

第一步:找到你的 server.py 绝对路径

你需要 完整路径 致你的 server.py 文件。

在Mac/Linux上:

cd /path/to/ScrapeFlow-MCP
echo "$(pwd)/server.py"

在Windows(PowerShell)上:

cd C:\path\to\ScrapeFlow-MCP
Write-Host "$(Get-Location)\server.py"

复制输出! 例子:

  • 雨衣: /Users/yourname/Documents/ScrapeFlow-MCP/server.py
  • 窗户: C:\Users\yourname\Documents\ScrapeFlow-MCP\server.py

______________________________________________________________________

步骤2:找到您的Claude桌面配置文件

在Mac上:

open ~/Library/Application\ Support/Claude/

在Windows上(命令提示符):

explorer %APPDATA%\Claude

在Windows(PowerShell)上:

explorer $env:APPDATA\Claude

这将打开Claude配置文件夹。寻找 claude_desktop_config.json.

______________________________________________________________________

步骤3:编辑配置文件

如果文件不存在,请创建它。然后添加以下配置:

Mac示例:

{
  "mcpServers": {
    "scrapeflow": {
      "command": "python3",
      "args": ["/Users/yourname/Documents/ScrapeFlow-MCP/server.py"]
    }
  }
}

Windows示例:

{
  "mcpServers": {
    "scrapeflow": {
      "command": "python",
      "args": ["C:/Users/yourname/Documents/ScrapeFlow-MCP/server.py"]
    }
  }
}

重要提示:

  • 将路径替换为步骤1中的实际路径
  • 在Windows上,使用正斜杠(/)或双反睫毛(\\)
  • 如果您使用虚拟环境,请使用该Python可执行文件的完整路径

______________________________________________________________________

步骤4:重新启动克劳德桌面

完全退出 Claude Desktop(不要只是关闭窗口),然后重新打开它。

在Mac上: Cmd + Q 退出 在Windows上: 右键单击任务栏图标并选择“退出”

______________________________________________________________________

测试您的MCP服务器

重新启动Claude Desktop后,打开一个新的聊天室并尝试以下测试提示:

简易测试站点(从这里开始)

Can you scrape https://example.com and tell me what it says?
Use the search_and_summarize tool to get content from https://news.ycombinator.com
Scrape https://lite.cnn.com and summarize the top headlines

高级测试

Get the content from https://www.bbc.com/news with max_chars set to 3000
Scrape https://github.com/trending and tell me what's trending

⚠可能无法运行的网站

一些网站具有强大的反机器人保护功能,可能会超时:

  • 福布斯,中型(付费墙)
  • 亚马逊、eBay(大量JavaScript)
  • 带有验证码的网站

对于这些网站,该工具将返回一条包含建议的错误消息。

______________________________________________________________________

替代测试方法:MCP检查员

如果您想在没有Claude Desktop的情况下进行测试,请使用MCP检查器:

1.安装Node.js

下载自

2.运行检查器

cd /path/to/ScrapeFlow-MCP
npx @modelcontextprotocol/inspector python server.py

3.打开浏览器界面

  • 终端将显示一个URL,如下所示 http://localhost:6274
  • 单击它或将其粘贴到浏览器中
  • 点击“连接”→ 转到“工具”选项卡
  • 你会看到 search_and_summarize -尝试在那里输入URL

______________________________________________________________________

运作原理

当你让克劳德抓取一个网站时:

  1. 克劳德认识到它应该使用 search_and_summarize 工具
  2. 您的MCP服务器接收URL
  3. Playwright启动无头浏览器并访问页面
  4. 清理HTML(删除脚本、广告、导航)
  5. 提取并缓存文本内容
  6. Claude收到清理后的内容,可以回答您的问题

______________________________________________________________________

故障排除

“未找到工具”或Claude未使用该工具

解决方案:

  1. 检查配置文件路径是否正确
  2. 确保您完全退出并重新启动了Claude Desktop
  3. 检查克劳德桌面日志:

- 雨衣: ~/Library/Logs/Claude/mcp*.log - 窗户: %APPDATA%\Claude\logs\mcp*.log

“找不到命令:python”

解决方案: 尝试更改 "command": "python""command": "python3" 在您的配置文件中。

特定网站上的超时错误

解决方案: 对于具有大量JavaScript或反机器人保护的网站来说,这是正常的。尝试:

  • 更简单的新闻网站(英国广播公司、路透社)
  • 技术网站(GitHub、Stack Overflow)
  • 文件网站

服务器未启动

解决方案: 终端手动测试:

cd /path/to/ScrapeFlow-MCP
python server.py

如果看到错误,请检查是否安装了所有依赖项。

______________________________________________________________________

配置选项

search_and_summarize 工具接受以下参数:

参数类型默认值说明
url字符串*必需的*要抓取的网页URL
max_charsinteger5000返回的最大字符数
include_metadatabooleantrue包括URL和字符计数信息

Claude中的示例用法:

Scrape https://example.com with max_chars set to 10000

______________________________________________________________________

项目结构

ScrapeFlow-MCP/
├── server.py           # FastMCP server configuration
├── scraper.py          # WebScout scraping class
├── requirements.txt    # Python dependencies
└── README.md          # This file

______________________________________________________________________

贡献

发现bug或想改进刮刀?欢迎投稿!

  1. 分叉此存储库
  2. 创建要素分支(git checkout -b feature/improvement)
  3. 提交您的更改(git commit -am 'Add new feature')
  4. 推到分支(git push origin feature/improvement)
  5. 打开拉取请求

______________________________________________________________________

许可证

麻省理工学院许可证-请随意使用此项目进行学习和发展!

______________________________________________________________________

致谢

______________________________________________________________________

问题或议题?

如果你遇到问题:

  1. 检查上面的故障排除部分
  2. 查看克劳德桌面日志
  3. 在GitHub上打开一个问题:

- 您的操作系统 - 日志中的错误消息 - 您已经尝试过的步骤

刮得开心!

这个项目是我博客上深度学习教程的一部分:\[https://www.rooteddreams.net/web-scraping-mcp-guide/\]

目录标签

目录标签

浏览器自动化PythonClaudeAI代理工具网页抓取本地部署数据解析自动化工具

支持客户端

Claude DesktopClaude

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

1

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP