Token导航 LogoToken导航TokenDH.com
purify (Easonliuliang) logo
AI代理未说明官方级别未说明来源级核验

purify (Easonliuliang)

MCP Server

Purify是一个高效的网页爬取API服务,专为AI代理设计,提供干净的内容提取、批量爬取和递归爬取功能,适用于AI代理、RAG管道、交易机器人和研究助手等场景。

工具数

5

提示词数

0

GitHub Stars

2

资源数

0
网页爬取内容提取GoClaude数据处理Claude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

Easonliuliang

提供方

Easonliuliang

最后核验

2026/5/17 20:20

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

净化

人工智能代理的网页抓取API。 一个二进制。零依赖。内置MCP服务器。

Go是Firecrawl/Craw4AI的替代品——没有Python,没有Node.js,没有Redis。就 docker compose up 然后走。

获取免费的API密钥 · API文件 · MCP服务器 · 服务托管

______________________________________________________________________

看到它工作

# Start Purify
docker compose up -d

# Scrape a page
curl -s -X POST http://localhost:8080/api/v1/scrape \
  -H "Content-Type: application/json" \
  -d '{"url": "https://news.ycombinator.com"}' | jq .
{
  "success": true,
  "content": "# Hacker News\n\n1. Show HN: ...",
  "tokens": {
    "original_estimate": 11708,
    "cleaned_estimate": 5572,
    "savings_percent": 52.4
  },
  "timing": {
    "total_ms": 400
  }
}

两个命令。在不到一秒钟的时间内清除Markdown。

______________________________________________________________________

如何比较

PurifyFirecrawlCrawl4AIJina Reader
语言TypeScriptPythonN/A(云)
自助主机单个二进制5+容器(Redis、PG、Playwright…)pip+Playwright没有自主机文档
MCP服务器内置(5个工具)社区维护
代币节省52–99%~70–80%~75–85%~60–70%
递归爬行
批量刮擦
许可证Apache 2.0AGPL-3.0Apache 2.0部分开源
价格(每月需要50k)29美元/月49美元/月免费(本地)49美元/日

快速开始

选项A:Docker

docker compose up -d

选项B:从源代码构建

git clone https://github.com/Easonliuliang/purify.git
cd purify && make build
PURIFY_AUTH_ENABLED=false ./bin/purify

选项C:托管API(无设置)

curl -s -X POST https://purify.verifly.pro/api/v1/scrape \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"url": "https://news.ycombinator.com"}' | jq .content

在获取免费API密钥 purify.verifly.pro --每月1000次请求,无信用卡。

代币节省——实际数字

用以下方式测量 令牌。 (GPT-4标记器)。Purify剥离了导航、广告、脚本和样式——你的LLM只看到内容。

网站原始HTML净化后节省延迟
GitHub仓库页面99181137098.6%1.1秒
《纽约时报》103744213098.0%1.1秒
API无烟煤文件129066483796.3%1.8秒
Next.js博客(React SPA)87231427195.1%5.0秒
英国广播公司新闻主页97540696992.9%2.5秒
arXiv论文(DeepSeek-R1)26684312988.3%0.5秒
维基百科(法学硕士)2452767632568.9%1.5秒
黑客新闻11708557252.4%0.4秒
sspai.com32,89518799.4%1.2秒
小红书(红注)15874235399.8%1.0秒
低成本网站(Hacker News,paulgraham.com)已经很少了——几乎是纯文本,没有可删除的垃圾。这是一个特性,不是bug。

用例

  • AI代理 -通过MCP或REST API为您的代理提供网络访问权限
  • RAG管道 --抓取文档,获得干净的Markdown,嵌入到你的矢量数据库中
  • 交易机器人 --以低于500毫秒的延迟抓取预测市场和新闻
  • 研究助理 --阅读并总结任何网页

MCP服务器

Purify包括一个内置的MCP服务器 5工具:

工具说明
scrape_url删除一页,返回干净的内容
batch_scrape并行删除多个URL
crawl_site递归抓取网站(BFS)
map_site发现网站上的所有URL
extract_data使用LLM提取结构化数据(BYOK)

设置

添加到您的Claude桌面配置(claude_desktop_config.json):

{
  "mcpServers": {
    "purify": {
      "command": "purify-mcp",
      "env": {
        "PURIFY_API_URL": "https://purify.verifly.pro",
        "PURIFY_API_KEY": "your-api-key"
      }
    }
  }
}

对于自托管实例,设置 PURIFY_API_URLhttp://localhost:8080.

然后问克劳德:

  • *“刮擦https://paulgraham.com/greatwork.html并对其进行总结”*
  • *“抓取Next.js文档网站,最多20页。”*
  • *“从本页提取产品名称和价格:…”*

API

POST/api/v1/scrape

删除一页并返回已清理的内容。支持JSON响应或SSE流。

{
  "url": "https://example.com/article",
  "output_format": "markdown",
  "extract_mode": "readability"
}
参数类型默认值说明
url字符串*必需的*目标URL
output_format字符串markdownmarkdown, html, text,或 markdown_citations
extract_mode字符串readabilityreadability, raw, pruning,或 auto
timeoutint30超时时间(秒)(1–120)
stealth bool的。 false反检测模式
headersobject--自定义HTTP标头
cookiesarray--导航前要设置的Cookie
actionsarray--浏览器交互(单击、滚动、等待等)
include_tags数组--要保留的CSS选择器
exclude_tags数组--要删除的CSS选择器
css_selectorstring--仅提取匹配的元素
max_ageint0缓存最大年龄(毫秒)(0=无缓存)

答复:

{
  "success": true,
  "status_code": 200,
  "final_url": "https://example.com/article",
  "content": "# Article Title\n\nClean markdown content...",
  "metadata": {
    "title": "Article Title",
    "author": "Author Name",
    "language": "en",
    "source_url": "https://example.com/article",
    "fetch_method": "http"
  },
  "links": {
    "internal": [{"href": "/about", "text": "About"}],
    "external": [{"href": "https://github.com/...", "text": "GitHub"}]
  },
  "images": [{"src": "https://example.com/hero.jpg", "alt": "Hero"}],
  "tokens": {
    "original_estimate": 32895,
    "cleaned_estimate": 187,
    "savings_percent": 99.43
  },
  "timing": {
    "total_ms": 1172,
    "navigation_ms": 1162,
    "cleaning_ms": 9
  },
  "engine_used": "http"
}

SSE流媒体

添加 Accept: text/event-stream 用于接收服务器发送事件而不是JSON的标头:

curl -X POST https://purify.verifly.pro/api/v1/scrape \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Accept: text/event-stream" \
  -d '{"url": "https://example.com"}'

活动: scrape.startedscrape.navigatedscrape.completed (或 scrape.error).

引文格式

使用 "output_format": "markdown_citations" 将内联链接转换为学术风格参考:

See [Google][1] and [GitHub][2]

---
[1]: https://google.com
[2]: https://github.com

POST/api/v1/批处理/刮擦

并行删除多个URL。返回异步轮询的作业ID。

{
  "urls": ["https://a.com", "https://b.com", "https://c.com"],
  "options": {"output_format": "markdown"},
  "webhook_url": "https://your-server.com/callback",
  "webhook_secret": "your-hmac-secret"
}

投票状态: GET /api/v1/batch/:id

POST/api/v1/抓取

从URL开始递归抓取网站。

{
  "url": "https://docs.example.com",
  "max_depth": 3,
  "max_pages": 100,
  "scope": "subdomain",
  "webhook_url": "https://your-server.com/callback",
  "webhook_secret": "your-hmac-secret"
}

投票状态: GET /api/v1/crawl/:id

POST/api/v1/map

在不抓取内容的情况下发现网站上的所有网址。

{"url": "https://example.com"}

POST/api/v1/提取

使用您自己的LLM密钥进行结构化数据提取(BYOK)。

curl -X POST https://purify.verifly.pro/api/v1/extract \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "url": "https://example.com/product",
    "schema": {
      "name": "string",
      "price": "number",
      "features": ["string"]
    },
    "llm_api_key": "your-openai-key"
  }'

Webhook回调

批处理和爬网端点支持webhook通知。当作业完成时,Purify会向您的 webhook_url 使用HMAC-SHA256签名 X-Purify-Signature 头球

活动: batch.completed, crawl.page, crawl.completed, crawl.failed

验证签名:

HMAC-SHA256(webhook_secret, request_body) == X-Purify-Signature (sha256=)

GET/api/v1/health

返回服务器状态和正常运行时间。

配置

所有通过环境变量进行的配置:

变量默认值描述
PURIFY_HOST0.0.0.0收听地址
PURIFY_PORT8080监听端口
PURIFY_AUTH_ENABLEDtrue启用API密钥身份验证
PURIFY_API_KEYS-逗号分隔的有效API密钥
PURIFY_MAX_PAGES10最大并发浏览器选项卡数
PURIFY_DEFAULT_TIMEOUT30s默认抓取超时
PURIFY_RATE_RPS5速率限制(请求/秒/键)
PURIFY_RATE_BURST10速率限制突发
PURIFY_LOG_LEVELinfodebug, info, warn, error

自足执行

Purify是一个单一的Go二进制文件。无需Docker,无需Redis,无需数据库。

# Local development (no auth)
PURIFY_AUTH_ENABLED=false ./bin/purify

# Production (with API key)
PURIFY_API_KEYS=your-secret-key ./bin/purify

在任何每月5美元的VPS上运行。自托管时没有使用限制。

系统要求

  • 任何Linux、macOS或Windows计算机
  • 约15 MB磁盘空间
  • 约30 MB RAM空闲

定价

免费专业版
价格0美元/月29美元/月
请求数1000/月50000/月
并发210
MCP服务器
结构化提取

免费开始→

贡献

欢迎捐款。请先打开一个问题,讨论您想更改的内容。

许可证

Apache 2.0 --无论是商业上还是其他方面,都可以随心所欲地使用它。无AGPL限制。

目录标签

目录标签

网页爬取内容提取GoClaude数据处理本地部署AI代理自动化工具

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

api-key

工具数量(toolCount,工具数)

5

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明api-key部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP