Token导航 LogoToken导航TokenDH.com
Pymupdf4llm Enhanced MCP logo
文档知识未说明官方级别未说明来源级核验

Pymupdf4llm Enhanced MCP

MCP Server

基于PyMuPDF4LLM和Tiktoken的PDF解析与分块服务,支持PDF转Markdown格式、智能分块、缓存机制和MCP协议,适用于大型文档分析、RAG系统和批量处理。

工具数

2

提示词数

0

GitHub Stars

0

资源数

0
文档处理PythonClaudeClaude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

schwartx

提供方

schwartx

最后核验

2026/5/17 20:22

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

PyMuPDF4LLM Enhanced MCP

基于 PyMuPDF4LLM 和 Tiktoken 的 PDF 解析与分块 MCP 服务器。

功能特性

  • 🔍 PDF 转 Markdown 格式
  • 📊 基于 Token 的智能分块(使用 Tiktoken o200k_base)
  • 💾 SHA256 哈希缓存机制
  • 🔄 可配置的块重叠
  • 📡 完整 MCP 协议支持

Claude Code 配置

claude mcp add -s local pymupdf4llm-enhanced pymupdf4llm-enhanced-mcp

使用方法

parse_pdf - 解析 PDF

将 PDF 转换为 Markdown 并分块。

parse_pdf(
    file_path="/path/to/document.pdf",
    chunk_size_tokens=2000,
    chunk_overlap_tokens=200
)
# 返回: {"chunks_count": 15, "cached": false}

read_chunk - 读取分块

从缓存读取指定分块。

read_chunk(
    file_path="/path/to/document.pdf",
    chunk_index=0
)
# 返回: {"chunk_index": 0, "content": "...", "file_path": "..."}

工作原理

  1. 计算 PDF 文件的 SHA256 哈希值
  2. 转换为 Markdown 并按 Token 数分块
  3. 缓存到 .pymupdf4llm-enhanced-mcp/ 目录
  4. 文件变更时自动重建缓存

使用场景

  • 大型文档分析:处理长篇论文、技术手册
  • RAG 系统:为检索增强生成准备文档块
  • 批量处理:高效处理多个相同文档的查询

最佳实践

  • 块大小:根据 LLM 上下文窗口设置(1000-3000 tokens)
  • 重叠率:建议 10-15% 保持上下文连贯性
  • 缓存管理:定期清理旧缓存释放空间

常见问题

Q: 缓存占用过大 A: 删除 .pymupdf4llm-enhanced-mcp/ 目录

Q: PDF 返回空内容 A: 检查 PDF 是否损坏或需要 OCR

相关链接

目录标签

目录标签

文档处理PythonClaudePDF解析本地部署智能分块Markdown转换RAG系统

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

token

工具数量(toolCount,工具数)

2

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明token部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP