PDF提取MCP服务器(克劳德代码分叉)
MCP服务器,用于从PDF文件中提取内容,并修复了Claude Code CLI安装。
此分支包括使用Claude Code(CLI版本)安装和运行服务器的关键修复。
这个叉子有什么不同
- 添加
__main__.py-使包能够作为模块运行python -m pdf_extraction - Claude Code特定说明 -明确适用于Claude Code CLI的安装步骤
- 测试安装过程 -已验证使用
claude mcp add命令
组件
工具
服务器实现了一个工具:
- 提取pdf内容:从本地PDF文件中提取内容
- 拿 pdf_path 作为必需的字符串参数(本地文件路径) - 拿 pages 作为可选的字符串参数(逗号分隔的页码,支持负索引,如 -1 最后一页) - 支持PDF文本提取和OCR扫描文档
Claude Code CLI的安装
先决条件
- Python 3.11或更高版本
- pip或conda
- 已安装Claude Code CLI(
claude命令)
步骤1:克隆并安装
# Clone this fork
git clone https://github.com/lh/mcp-pdf-extraction-server.git
cd mcp-pdf-extraction-server
# Install in development mode
pip install -e .步骤2:查找已安装的命令
# Check where pdf-extraction was installed
which pdf-extraction
# Example output: /opt/homebrew/Caskroom/miniconda/base/bin/pdf-extraction步骤3:添加到克劳德代码
# Add the server using the full path from above
claude mcp add pdf-extraction /opt/homebrew/Caskroom/miniconda/base/bin/pdf-extraction
# Verify it was added
claude mcp list步骤4:在Claude中使用
# Start a new Claude session
claude
# In Claude, type:
/mcp
# You should see:
# MCP Server Status
# • pdf-extraction: connected用法示例
连接后,您可以要求Claude提取PDF内容:
"Can you extract the content from the PDF at /path/to/document.pdf?"
"Extract pages 1-3 and the last page from /path/to/document.pdf"故障排除
服务器未连接
- 确保在添加服务器后启动了NEW Claude会话
- 验证命令路径是否正确:
ls -la $(which pdf-extraction) - 直接测试命令(它应该挂起等待输入):
pdf-extraction
未找到模块错误
如果你遇到Python导入错误:
- 确保您使用的Python环境与安装包的Python环境相同
- 尝试使用完整的Python路径:
claude mcp add pdf-extraction /path/to/python -m pdf_extraction
安装问题
如果 pip install -e . 失败:
- 确保你有Python 3.11+:
python --version - 尝试创建一个新的虚拟环境:
python -m venv venv
source venv/bin/activate # On Windows: venv\Scripts\activate
pip install -e .适用于Claude桌面用户
这个分叉是专门为Claude Code CLI设计的。如果您使用的是Claude Desktop(GUI应用程序),请参阅 原始存储库 有关安装说明。
依赖项
- mcp>=1.2.0
- pypdf2>=3.0.1
- pytesseract>=0.3.10(用于OCR支持)
- 枕头>=10.0.0
- 媒染剂>=2.10.1,\=1.24.0
贡献
欢迎投稿!这个叉子的主要变化是增加了 __main__.py 使包可以作为模块运行。
许可证
与原始存储库相同。
