Token导航 LogoToken导航TokenDH.com
MCP Weixin Spider logo
AI代理stdio官方级别未说明来源级核验

MCP Weixin Spider

MCP Server

一个MCP服务器,使AI助手能够直接爬取和分析微信公众号文章内容,无需手动复制粘贴。

工具数

5

提示词数

0

GitHub Stars

0

资源数

0
内容分析PythonClaude数据分析ClaudeCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

alanxurox

提供方

alanxurox

最后核验

2026/5/17 20:23

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install -r requirements.txt

详细介绍

MCP微信蜘蛛🕷️

英语 | 中文

不再复制粘贴!让AI通过MCP直接阅读微信文章

一个MCP(模型上下文协议)服务器,使人工智能助手能够直接抓取和分析微信公众号文章——不再复制粘贴!

问题解决了

你是否曾希望人工智能分析微信文章,却发现它无法访问内容?传统的工作流程要求:

  1. 打开微信文章
  2. 手动复制所有文本
  3. 粘贴到AI聊天
  4. 丢失图像和格式

这个MCP服务器解决了这个问题。 只需给AI一个微信网址,它就可以:

  • 提取整篇文章内容(文本+HTML)
  • 下载嵌入图像
  • 分析文章统计
  • 比较多篇文章
  • 批量处理竞争对手账户

快速开始

1.安装依赖项

cd mcp-weixin
pip install -r requirements.txt

或者使用紫外线:

uv pip install -r requirements.txt

2.选择后端

后端优点缺点
代理浏览器更轻,不需要Chrome驱动程序功能更少,需要安装代理浏览器
功能齐全,图像下载更重,需要Chrome/ChromeDriver

通过设置 CRAWLER_BACKEND env 是: "agentbrowser""selenium" (默认)。

3.在Cursor/Claude中配置

添加到MCP设置(光标:设置→ MCP,或 ~/.cursor/mcp.json):

选项A:代理浏览器后端(推荐-重量更轻)

{
  "mcpServers": {
    "weixin_spider": {
      "command": "python",
      "args": ["/path/to/mcp-weixin/src/mcp_weixin_spider/server.py"],
      "env": {
        "PYTHONPATH": "/path/to/mcp-weixin",
        "CRAWLER_BACKEND": "agentbrowser",
        "AGENT_BROWSER_BIN": "/path/to/agent-browser/bin/agent-browser",
        "WAIT_TIME": "10"
      }
    }
  }
}

选项B:Selenium后端(全功能)

{
  "mcpServers": {
    "weixin_spider": {
      "command": "python",
      "args": ["/path/to/mcp-weixin/src/mcp_weixin_spider/server.py"],
      "env": {
        "PYTHONPATH": "/path/to/mcp-weixin",
        "CRAWLER_BACKEND": "selenium",
        "DOWNLOAD_IMAGES": "true",
        "WAIT_TIME": "10"
      }
    }
  }
}

3.在AI聊天中使用

配置后,您可以询问您的AI:

帮我分析这篇公众号文章: https://mp.weixin.qq.com/s/...

人工智能将使用MCP工具直接抓取和分析文章!

可用工具

工具说明
crawl_weixin_article爬取文章内容和图片 - Full article extraction
analyze_weixin_article分析文章统计数据 - Statistics and key phrases
summarize_weixin_article获取文章摘要 - Quick summary
batch_crawl_articles批量爬取多篇文章 - Process multiple URLs
compare_articles对比分析多篇文章 - Competitive analysis

建筑

mcp-weixin/
├── src/mcp_weixin_spider/
│   ├── server.py          # FastMCP server (main entry point)
│   ├── client.py           # MCP client for testing
│   └── __init__.py
├── weixin_spider_simple.py # Core crawler (Selenium/Chrome)
├── pyproject.toml          # Project config
├── requirements.txt        # Dependencies
└── README.md

运作原理

┌─────────────┐     MCP Protocol    ┌──────────────┐
│   AI/LLM    │ ◄─────────────────► │  MCP Server  │
│ (Claude/    │    stdio transport  │  (FastMCP)   │
│  Cursor)    │                     └──────┬───────┘
└─────────────┘                            │
                                           ▼
                               ┌───────────────────┐
                               │   Chrome Driver   │
                               │   (Headless)      │
                               └─────────┬─────────┘
                                         │
                                         ▼
                               ┌───────────────────┐
                               │  mp.weixin.qq.com │
                               │   (Articles)      │
                               └───────────────────┘
  1. AI发送请求 通过MCP协议
  2. MCP 服务器 接收并解析请求
  3. Chrome驱动程序 加载微信文章(无头)
  4. 提取的内容 (标题、作者、文本、图片)
  5. 返回结果 将AI转换为结构化JSON

用例

1.单项分析

用户: 帮我总结这篇文章 https://mp.weixin.qq.com/s/xxx
AI: [calls summarize_weixin_article] 这篇文章主要讲述了...

2.竞争分析

用户: 对比分析这三个竞品公众号的最新文章
AI: [calls compare_articles] 三篇文章的对比分析如下...

3.批量内容监控

用户: 批量获取这10篇文章的摘要
AI: [calls batch_crawl_articles] 已获取10篇文章...

配置

环境变量

变量默认值描述
DOWNLOAD_IMAGEStrue下载文章图片
WAIT_TIME10页面加载超时(秒)
OUTPUT_DIR./downloads图像下载目录

Chrome要求

爬虫使用Selenium和Chrome。首次运行时,它将通过以下方式自动下载相应的ChromeDriver webdriver-manager.

对于无头服务器(如VPC),请确保已安装Chrome:

# Ubuntu/Debian
sudo apt-get install chromium-browser

# Or install Google Chrome
wget https://dl.google.com/linux/direct/google-chrome-stable_current_amd64.deb
sudo dpkg -i google-chrome-stable_current_amd64.deb

测试

使用内置客户端进行测试:

python src/mcp_weixin_spider/client.py

这将打开一个交互式会话,您可以在其中测试所有工具。

直接测试履带:

python weixin_spider_simple.py
# Enter a WeChat article URL when prompted

提取的数据

示例输出来自 crawl_weixin_article:

{
  "url": "https://mp.weixin.qq.com/s/...",
  "title": "告别复制粘贴!用MCP让AI直接读取微信公众号",
  "author": "精神抖擞王大鹏",
  "account_name": "精神抖擞王大鹏",
  "publish_date": "2025-07-02",
  "content_text": "你有没有遇到过这种场景...",
  "content_html": "
...
",
  "word_count": 1234,
  "images": [
    {
      "index": 0,
      "url": "https://mmbiz.qpic.cn/...",
      "local_path": "./downloads/abc123/image_000.jpg"
    }
  ],
  "crawl_timestamp": "2026-02-03T10:30:00"
}

限制和反机器人保护

⚠️ 微信具有复杂的反机器人检测功能:

  • 验证页面:微信显示“环境异常”自动访问
  • IP阻塞:数据中心IP很快被阻止
  • 速率限制:严格限制请求频率

变通方法

1.使用已保存的浏览器状态(推荐):

# Login manually in headed mode first
agent-browser --headed open https://mp.weixin.qq.com
# Complete any verification, then save state
agent-browser state save weixin-auth.json

# Later, load saved state
agent-browser state load weixin-auth.json

2.使用住宅代理:

agent-browser --proxy http://residential-proxy:port open 

3.限速最佳做法:

  • 请求之间等待10-30秒
  • 每小时限制10-20篇文章
  • 使用随机延迟

其他限制

  • 需要登录:有些文章需要微信登录
  • 动态内容:复杂的交互式内容可能无法完全呈现
  • 图像过期:下载的图像是时间点快照

参考文献

贡献

PR欢迎!拜托:

  1. 使用 black 用于格式化
  2. 为新功能添加测试
  3. 为API更改更新README

许可证

麻省理工学院

学分

灵感来自 精神抖擞王大鹏's WeChat article MCP+爬虫集成。

内置:

目录标签

目录标签

内容分析PythonClaude数据分析微信爬虫本地部署AI助手自动化工具

支持客户端

ClaudeCursor

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

session

工具数量(toolCount,工具数)

5

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdiosession部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP