mcp剧作家scraper
一种模型上下文协议(MCP)服务器,可以抓取web内容并将其转换为Markdown。
概述
此MCP服务器提供了一个简单的工具,用于抓取网络内容并将其转换为Markdown格式。它使用:
- 剧作家:用于无头浏览器自动化,以处理包括JavaScript密集型网站在内的现代网页
- 美丽汤:用于HTML解析和清理
- 皮潘多克:用于高质量的HTML到Markdown转换
工具
服务器实现了一个工具:
scrape_to_markdown:从URL中抓取内容并将其转换为Markdown
- 必需参数: url (string)-要抓取的URL - 可选参数: verify_ssl (boolean)-是否验证SSL证书(默认值:true)
安装
使用紫外线(推荐)
使用时 uv 不需要特定的安装。我们将 使用 uvx 直接运行 *mcp剧作家scraper*.
使用PIP
或者,您可以安装 mcp-playwright-scraper 通过pip:
pip install mcp-playwright-scraper安装后,您可以使用以下命令将其作为脚本运行:
python -m mcp_playwright_scraper先决条件
- Python 3.11或更高版本
- Playwright浏览器依赖关系
- Pandoc(可选,如果可能的话,将由pypandoc自动安装)
安装后,您需要安装Playwright浏览器依赖项:
playwright install --with-deps chromium配置
使用Claude Desktop
将此添加到您的 claude_desktop_config.json:
Using uvx
"mcpServers": {
"mcp-playwright-scraper": {
"command": "uvx",
"args": ["mcp-playwright-scraper"]
}
}Using pip installation
"mcpServers": {
"mcp-playwright-scraper": {
"command": "python",
"args": ["-m", "mcp_playwright_scraper"]
}
}使用Claude代码
# Basic syntax
$ claude mcp add mcp-playwright-scraper -- uvx mcp-playwright-scraper
# Alternatively, with pip installation
$ claude mcp add mcp-playwright-scraper -- python -m mcp_playwright_scraperDevelopment/Unpublished Servers Configuration
"mcpServers": {
"mcp-playwright-scraper": {
"command": "uv",
"args": [
"--directory",
"/path/to/mcp-playwright-scraper",
"run",
"mcp-playwright-scraper"
]
}
}使用方法 泽德
添加到您的Zed settings.json:
Using uvx
"context_servers": [
"mcp-playwright-scraper": {
"command": {
"path": "uvx",
"args": ["mcp-playwright-scraper"]
}
}
],Using pip installation
"context_servers": {
"mcp-playwright-scraper": {
"command": "python",
"args": ["-m", "mcp_playwright_scraper"]
}
},使用游标
- 打开光标设置
- 导航到光标设置>功能>MCP - 点击“+添加新MCP服务器”按钮
- 配置服务器
- 姓名: mcp-playwright-scraper - 类型:选择 stdio - 命令:输入以下命令之一:
Using uvx
uvx mcp-playwright-scraperUsing pip installation
python -m mcp_playwright_scraper用法
在Claude Desktop中配置后,您可以显式地使用scraper并显示如下提示:
Use the mcp-playwright-scraper to scrape the content from https://example.com and summarize it.调试
您可以使用MCP检查器调试服务器:
npx @modelcontextprotocol/inspector uvx mcp-playwright-scraper或者,如果您已将软件包安装在特定目录中或正在其上开发:
cd path/to/mcp-playwright-scraper
npx @modelcontextprotocol/inspector uv run mcp-playwright-scraper启动后,检查器将显示一个URL,您可以在浏览器中访问该URL以开始调试。
发展
建筑与出版
准备分发包裹:
- 同步依赖关系并更新锁文件:
uv sync- 构建包分发:
uv build这将在 dist/ 目录。
- 发布到PyPI:
uv publish注意:您需要通过环境变量或命令标志设置PyPI凭据:
- 令牌:
--token或UV_PUBLISH_TOKEN - 或用户名/密码:
--username/UV_PUBLISH_USERNAME和--password/UV_PUBLISH_PASSWORD
许可证
此MCP服务器根据Apache许可证2.0版获得许可。您可以根据Apache许可证2.0的条款和条件自由使用、修改和分发软件。有关更多详细信息,请参阅项目存储库中的LICENSE文件或访问http://www.apache.org/licenses/LICENSE-2.0.
