Token导航 LogoToken导航TokenDH.com
Intercept MCP logo
AI代理未说明官方级别未说明来源级核验

Intercept MCP

MCP Server

一个无需API密钥的网页内容提取工具,支持多种网站特定处理和多种备用策略,能够将网页内容转换为干净的Markdown格式。

工具数

2

提示词数

0

GitHub Stars

6

资源数

0
TypeScriptClaudeAI代理Claude DesktopClaudeCursorWindsurfCline

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

bighippoman

提供方

bighippoman

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

拦截mcp

赋予你的人工智能阅读网络的能力。一个命令,不需要API密钥。

没有它,你的AI会点击一个URL,得到一个403、一堵墙或一堵原始HTML墙。通过拦截,它几乎总是能得到内容——干净的标记,随时可用。

处理推文、YouTube视频(有文字记录时)、arXiv论文、PDF、维基百科文章和GitHub仓库。如果第一个策略失败,它会在放弃之前再尝试14次。

适用于任何MCP客户端:Claude Code、Claude Desktop、Codex、Cursor、Windsurf、Cline等。

安装

克劳德代码

claude mcp add intercept -s user -- npx -y intercept-mcp

法典

codex mcp add intercept -- npx -y intercept-mcp

光标

设置→ MCP → 添加服务器:

{
  "mcpServers": {
    "intercept": {
      "command": "npx",
      "args": ["-y", "intercept-mcp"]
    }
  }
}

帆板运动

设置→ MCP → 添加服务器→ 与上述JSON配置相同。

克劳德桌面版

添加到您的 claude_desktop_config.json:

{
  "mcpServers": {
    "intercept": {
      "command": "npx",
      "args": ["-y", "intercept-mcp"]
    }
  }
}

其他MCP客户端

任何支持stdio MCP服务器的客户端都可以运行 npx -y intercept-mcp.

不需要API密钥 fetch 工具。

运作原理

URL的处理分为四个阶段:

1.现场特定处理人员

已知的URL模式在回退管道之前被路由到专用处理程序:

模式处理程序你得到了什么
twitter.com/*/status/*, x.com/*/status/*Twitter/X推文文本、作者、媒体、参与度统计(通过第三方API)
youtube.com/watch?v=*, youtu.be/*YouTube标题、频道、持续时间、浏览量、描述、文字记录(字幕可用时)
arxiv.org/abs/*, arxiv.org/pdf/*arXiv论文元数据、作者、摘要、类别
*.pdfPDF提取的文本(仅限文本层PDF)
*.wikipedia.org/wiki/*Wikipedia通过Wikimedia REST API清理文章内容
github.com/{owner}/{repo}GitHub原始README.md内容

2.共享缓存(agentsweb.org)

在点击任何提取器之前,每个请求都会进行检查 agentsweb.org --AI代理的全局共享markdown缓存,由9源并行获取管道支持,具有JS/SPA渲染(React、Vue、Angular通过Cloudflare浏览器运行)。如果另一个代理已经获取了此URL,您将在50毫秒内得到结果。

每次成功获取都会自动返回。条目通过自愈共识模型获得信任:当独立实例获取相同的URL并确认相同的内容时,信任度会提高。

选择完全退出 INTERCEPT_SHARED_CACHE=false,或使用只读模式(消费但从不贡献) INTERCEPT_CACHE_READ_ONLY=true.

agentsweb.org API

agentsweb.org还公开了独立端点供直接使用:

  • /web?q= --搜索网页
  • /research?q= --在一次调用中搜索+获取+缓存
  • /fetch?url= --按需获取,自动缓存

agentsweb.org/docs 获取完整的API文档。

3.回退管线

如果没有匹配的处理程序(或处理程序未返回任何内容),则URL将进入多层管道:

层级费彻战略
0agentsweb.org全局共享降价缓存--如果另一个代理已获取此URL,则立即执行
1Cloudflare浏览器运行JS/SPA渲染+降价提取-也支持 agentsweb.org (可选,需要API令牌)
1Jina Reader清洁降价提取服务
2Wayback Machine存档版本来自archive.org
2archive.ph通过时间映射API+隐形TLS获取的存档快照
2谷歌缓存谷歌缓存页面版本
2Arquivo.pt葡萄牙语网络档案(广泛的国际覆盖)
2代码标签CORS代理
3原始获取直接GET,带浏览器头+向下标记转换
3隐形提取通过获取抓取进行浏览器TLS指纹模拟(选择加入,见下文)
4RSS、CrossRef、语义学者、HN、Reddit元数据/讨论回退
5OG MetaOpen Graph标签(保证回退)

第二层收割台并行运行。当多个成功时,最高质量的结果获胜。所有其他层都按顺序运行。

所有搬运工返回正确 标记语言 (标题、链接、粗体、表格、代码块)通过下拉菜单,而不是纯文本。

4.缓存

结果以TTL缓存在内存中(成功30分钟,失败5分钟)。LRU驱逐最多100次。缓存失败的URL以防止重新尝试已知的无效URL。

工具

fetch

获取一个URL并将其内容作为干净的标记返回。

  • url (字符串,必填)--要获取的URL
  • maxTier (数字,可选,1-5)——对于速度敏感的情况,请在此级别停止

search

搜索网络并返回结果。

  • query (字符串,必填)--搜索查询
  • count (数字,可选,1-20,默认5)--结果数量

如果使用勇敢搜索API BRAVE_API_KEY 如果已设置,则SearXNG SEARXNG_URL 如果设置好,那么DuckDuckGo将成为不可靠的最后手段。

提示

research-topic

搜索主题并获取多源摘要的顶部结果。

  • topic (string)--要研究的主题
  • depth (字符串,默认值“3”)--要获取的顶部结果数

extract-article

获取一个URL并从内容中提取关键点。

  • url (string)--获取和汇总的URL

环境变量

变量必填描述
BRAVE_API_KEY没有勇敢搜索API 搜索关键字
SEARXNG_URL自托管SearXNG实例URL(推荐)
CF_API_TOKEN具有“浏览器渲染-编辑”权限的Cloudflare API令牌
CF_ACCOUNT_IDCloudflare帐户ID(如果是必需的 CF_API_TOKEN 已设置)
USE_STEALTH_FETCH设置为 true 启用隐形提取器(见下面的警告)
INTERCEPT_SHARED_CACHE设置为 false 禁用agentsweb.org共享缓存
INTERCEPT_CACHE_READ_ONLY设置为 true 消耗但从不贡献共享缓存
INTERCEPT_CACHE_TTL_MS成功获取的内存缓存TTL(以毫秒为单位)(默认值 3600000 =60分钟)
INTERCEPT_CACHE_FAILURE_TTL_MS失败获取的内存缓存TTL(以毫秒为单位)(默认值 300000 =5分钟)
INTERCEPT_CACHE_SIZE最大内存缓存条目数(默认值 250)
HTTPS_PROXY / HTTP_PROXY标准代理传递--通过代理路由所有出站获取(包括隐藏)。荣誉 NO_PROXY.

搜索: 有一个DuckDuckGo回退,但它的速度有限且不可靠。用于生产用途,自主机 SearXNG 并设置 SEARXNG_URL (见下文),或获取 勇敢搜索API密钥.

提取: 无需任何钥匙即可工作。集 CF_API_TOKEN + CF_ACCOUNT_ID 为JavaScript繁重的页面(SPA、React站点)启用Cloudflare浏览器运行(以前称为浏览器渲染)。

隐形获取(USE_Stealth_fetch)

使用风险自负。 启用后,这将添加一个提取器,使用以下命令模拟真实的浏览器TLS指纹(Chrome/Firefox密码套件、HTTP/2设置、标头顺序) 被刮伤了这可以绕过网站上的机器人检测和验证码触发器,否则这些触发器会阻止自动请求。

这个fetcher在常规原始fetch之后运行在第3层。如果原始获取被阻止(CAPTCHA,Cloudflare挑战,403),隐形获取器将通过浏览器模拟重试。

这可能会违反某些网站的服务条款。 拦截mcp的作者对如何使用此功能不承担任何责任。默认情况下,它处于禁用状态,必须明确选择加入。

带上自己的代理(HTTPS_proxy)

如果原始获取开始被标记,最有效的修复方法通常是干净的出站IP,而不是更花哨的指纹。拦截mcp符合标准 HTTPS_PROXY / HTTP_PROXY / NO_PROXY env变量,因此您可以通过已有的任何代理路由所有出站流量:

HTTPS_PROXY=http://user:pass@proxy.example.com:8080 npx intercept-mcp

这适用于任何HTTP(S)代理——一个自托管的Squid、一个Tailscale出口节点、一个运行5美元的VPS 3代理,或商业住宅代理(Bright Data、Oxylabs等)。隐形提取器和 got-scraping 电话也会自动接听。

自托管SearXNG

为了实现可靠的搜索,请使用Docker自托管SearXNG。配置包含在 仓库:

git clone https://github.com/bighippoman/intercept-mcp.git
cd intercept-mcp/searxng && docker compose up -d

然后设置 SEARXNG_URL=http://localhost:8888。没有费率限制,没有验证码,聚合了谷歌+必应+DuckDuckGo+维基百科+Brave。

或者使用任何现有的SearXNG实例——只需设置 SEARXNG_URL 到其URL。

URL规范化

传入的URL会自动清理:

  • 条带60+跟踪参数(UTM、点击ID、分析、A/B测试等)
  • 删除哈希片段
  • 升级到HTTPS
  • 清除AMP伪影
  • 保留功能参数(ref, format, page, offset, limit)

内容质量检测

每一次清理结果都会根据质量进行评分。自动故障开启:

  • 验证码/Cloudflare挑战
  • 登录墙
  • 正文中的HTTP错误页
  • 200个字符以下的内容

需求

  • Node.js>=18
  • 基本使用不需要API密钥

目录标签

目录标签

TypeScriptClaudeAI代理网页提取本地部署Markdown转换多策略处理AI助手内容缓存

支持客户端

Claude DesktopClaudeCursorWindsurfCline

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

部署方式(deploymentType,部署类型)

remote-capable

工具数量(toolCount,工具数)

2

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明noneremote-capable

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP