基本能力
产品定位
PDF RAG MCP Server 是一个基于PDF处理和语义搜索的文档知识库系统,旨在为用户提供高效的文档管理和检索能力。
核心功能
- PDF文档上传与处理:上传PDF并自动提取、分块和向量化内容
- 实时处理状态:基于WebSocket的实时文档处理状态更新
- 语义搜索:基于向量的跨文档语义搜索
- MCP协议支持:通过模型上下文协议与Cursor等AI工具集成
- 现代Web界面:React/Chakra UI前端,用于文档管理和查询
- 快速依赖管理:使用uv进行高效的Python依赖管理
适用场景
- 需要管理和检索大量PDF文档的场景
- 需要将文档知识库集成到AI工具中的场景
- 需要实时监控文档处理进度的场景
使用教程
使用依赖
- Python 3.8或更高版本
- uv - 快速的Python包安装器和解析器
- Git
- Cursor(可选,用于MCP集成)
安装教程
- 克隆仓库:
git clone https://github.com/yourusername/PdfRagMcpServer.git
cd PdfRagMcpServer- 安装uv(如果尚未安装):
curl -sS https://astral.sh/uv/install.sh | bash- 使用uv安装依赖:
uv init .
uv venv
source .venv/bin/activate
uv pip install -r backend/requirements.txt- 启动应用:
uv run run.py- 访问Web界面:http://localhost:8000
调试方式
- 检查端口8000是否被其他应用占用
- 确保WebSocket连接正常工作
- 检查PDF是否包含可提取的文本
- 查看后端日志获取详细错误信息
