markudown mcp
MCP服务器 MarkU自有/报废技术 --允许AI代理(Claude、Cursor、Windsurf、n8n、LangGraph等)访问网络抓取、谷歌搜索、数据提取等。
不需要基础设施。 只是一个API密钥。
______________________________________________________________________
运作原理
AI Agent (Claude Desktop, Cursor, etc.)
│ MCP protocol (stdio)
▼
markudown-mcp (this package)
│ HTTPS + polling
▼
api.scrapetechnology.com
│ BullMQ jobs
▼
MarkUDown Engine workers______________________________________________________________________
快速开始
MARKUDOWN_API_KEY=your-key npx markudown-mcp获取API密钥: scrapetechnology.com.
______________________________________________________________________
克劳德桌面
添加 claude_desktop_config.json:
- macOS:
~/Library/Application Support/Claude/claude_desktop_config.json - 视窗:
%APPDATA%\Claude\claude_desktop_config.json
{
"mcpServers": {
"markudown": {
"command": "npx",
"args": ["markudown-mcp"],
"env": {
"MARKUDOWN_API_KEY": "your-api-key-here"
}
}
}
}保存后重新启动Claude Desktop。
______________________________________________________________________
光标/风帆
添加到编辑器的MCP配置中:
{
"markudown": {
"command": "npx",
"args": ["markudown-mcp"],
"env": {
"MARKUDOWN_API_KEY": "your-api-key-here"
}
}
}______________________________________________________________________
环境变量
| 变量 | 必填 | 默认 | 描述 |
|---|---|---|---|
MARKUDOWN_API_KEY | 是 | - | 您的Scrape Technology API密钥 |
MARKUDOWN_API_URL | 没有 | https://api.scrapetechnology.com | 覆盖API基本URL(自托管部署) |
______________________________________________________________________
可用工具
scrape
删除一个URL,并将其内容作为干净的Markdown返回。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
url | string | 必需 | 要抓取的URL |
mainContent | 布尔值 | true | 条形导航、广告和侧边栏 |
includeLinks | 布尔值 | false | 在输出中包含超链接 |
includeHtml | 布尔值 | false | 同时返回原始HTML |
excludeTags | string\[\] | ["header","nav","footer"] | 要删除的HTML标签 |
timeout | 编号 | 60 | 超时时间(秒) |
示例提示: *“刮擦https://example.com并总结了主要内容。"*
______________________________________________________________________
map
通过站点地图解析和链接爬行发现网站上的所有网址。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
url | string | 必填 | 网站的根URL |
maxUrls | 编号 | 1000 | 要返回的最大URL数 |
allowedWords | string\[\] | [] | 仅包含包含这些单词的URL |
blockedWords | string\[\] | [] | 排除包含这些单词的URL |
示例提示: *“映射docs.example.com上的所有URL。”*
______________________________________________________________________
crawl
根据内部链接递归抓取网站。返回每个页面的Markdown。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
url | string | 必需 | 起始URL |
maxDepth | 编号 | 2 | 最大链接深度 |
limit | 编号 | 10 | 可抓取的最大页面数 |
mainContent | 布尔值 | true | 仅提取主要内容 |
includeLinks | 布尔值 | false | 包含超链接 |
includeHtml | 布尔值 | false | 包含原始HTML |
excludeTags | string\[\] | -- | 要删除的HTML标签 |
blockedWords | string\[\] | -- | 跳过包含这些单词的URL |
includeOnly | string\[\] | -- | 仅抓取包含这些单词的URL |
timeout | 编号 | 60 | 每页超时时间(秒) |
示例提示: *“爬行https://docs.example.com深入到深度3,找到所有提到“身份验证”的地方。"*
______________________________________________________________________
search
运行谷歌搜索,并可选择抓取每个结果页面的完整内容。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
query | string | 必填 | 搜索查询 |
limit | 编号 | 5 | 结果数量 |
scrapeResults | 布尔值 | true | 为每个结果删除全部内容 |
lang | 字符串 | "en" | 语言代码 |
country | 字符串 | "us" | 国家代码 |
timeout | 编号 | 60 | 每页超时时间(秒) |
示例提示: *“搜索‘2025年最佳网络抓取库’,并总结前5个结果。”*
______________________________________________________________________
extract
使用自然语言提示抓取URL并提取结构化数据。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
url | string | 必需 | 要从中提取的URL |
prompt | string | required | 要提取什么,例如。 "All product names and prices" |
timeout | 编号 | 60 | 超时时间(秒) |
示例提示: *“从以下位置提取所有工作列表https://jobs.example.com包括职位、地点和工资。"*
______________________________________________________________________
batch_scrape
并行删除多个URL。为每个对象返回Markdown。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
urls | string\[\] | 必需 | 要抓取的URL(至少1个) |
timeout | 编号 | 60 | 每页超时时间(秒) |
示例提示: *“删除这5个竞争对手的定价页面,并比较他们的计划。”*
______________________________________________________________________
screenshot
对URL进行全屏截图。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
url | string | 必填 | 截图URL |
timeout | 编号 | 60 | 导航超时(秒) |
示例提示: *“截图https://example.com."*
______________________________________________________________________
deep_research
使用LLM抓取多个URL并将其内容合成为一份全面的研究报告。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
query | string | 必填 | 研究问题或主题 |
urls | string\[\] | 必填 | 要抓取的源URL(至少1个) |
maxTokens | 编号 | 4096 | 报告的最大令牌数 |
timeout | 编号 | 180 | 超时时间(秒) |
示例提示: *“研究这3家SaaS公司的定价策略,并撰写比较分析。”*
______________________________________________________________________
agent
启动一个人工智能代理,自动导航网站以回答问题或完成任务。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
url | string | 必需 | 起始URL |
prompt | string | 必填 | 代理的任务或问题 |
maxSteps | 编号 | 10 | 最大导航步数 |
maxPages | 编号 | 5 | 可访问的最大页面数 |
allowNavigation | 布尔值 | true | 允许以下链接 |
includeScreenshots | 布尔值 | false | 每一步截图 |
timeout | 编号 | 120 | 总超时时间(秒) |
示例提示: *首选https://shop.example.com并找到退货政策。"*
______________________________________________________________________
change_detection
检测URL的内容自上次检查以来是否已更改。
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
url | string | 必需 | 要监视的URL |
mainContent | 布尔值 | true | 仅比较主要内容 |
excludeTags | string\[\] | ["header","nav","footer"] | 比较时要忽略的标签 |
timeout | 编号 | 60 | 超时时间(秒) |
示例提示: *“检查定价页面是否位于https://example.com/pricing已经改变了。"*
______________________________________________________________________
自托管部署
如果您运行自己的MarkUDown引擎,请设置 MARKUDOWN_API_URL 指向您的实例:
{
"mcpServers": {
"markudown": {
"command": "npx",
"args": ["markudown-mcp"],
"env": {
"MARKUDOWN_API_KEY": "your-api-key",
"MARKUDOWN_API_URL": "https://your-engine.example.com"
}
}
}
}对于直接的BullMQ访问(不需要API密钥),请使用 自托管MCP服务器 在 MarkUDown-Engine/services/mcp/.
______________________________________________________________________
支持与社区
| 频道 | 链接 |
|---|---|
| 💬 不和谐 | 不一致.gg/GBSKsC8DvS |
| 📧 电子邮件 | joao.sobhie@scrapetechnology.com |
| 🌐 文件 | scrapetechnology.com/markudown/docs |
许可证
麻省理工学院
