PaddleOCR MCP 服务器
概述
PaddleOCR MCP服务器为AI应用提供工业级OCR和文档解析能力。基于PaddleOCR——一个经过5万+GitHub star验证,被MinerU、RAGFlow、OmniParser等头部项目深度集成的成熟解决方案,并基于MCP理念做了针对性的优化。
- 官方文档:
- PaddleOCR GitHub仓库:
- PaddleOCR产线功能在线体验:
* AI Studio 星河社区: * PP-OCRv5 * PP-StructureV3
* Hugging Face: * PP-OCRv5 * PP-StructureV3
* ModelScope 魔搭社区 * PP-OCRv5 * PP-StructureV3
核心功能
文字识别(基于PP-OCRv5)
- 多语言支持:支持中英日韩等37种语言,支持印刷体、手写体识别
- 高精度识别:识别精度达到开源方案领先水平
- 结构化输出:返回包含文字坐标和内容的JSON数据
文档解析(基于PP-StructureV3)
- 版面智能分析:识别文本块、标题、段落、图片、表格等版面元素
- 结构化转换:将PDF和图像转换为保留原始结构的Markdown格式
- 复杂文档处理:处理含有复杂表格、公式、手写文字的文档
MCP优化
- 智能输出模式:
simple模式包含识别到的文本/Markdown内容等关键信息,detailed模式包含边界框坐标等详细信息 - PP-OCRv5:OCR结果包含置信度和统计信息,帮助agent评估结果质量
- PP-StructureV3:支持图文混合输出,保留图片原始位置信息
部署模式
工作模式
- 本地Python库:直接在本地运行PaddleOCR模型
- 星河社区服务:调用托管在飞桨星河社区的云服务
- 自托管服务:连接用户自托管的PaddleOCR服务
传输机制
- stdio:适用于本地集成的标准输入输出模式
- Streamable HTTP:支持远程调用的HTTP流式传输
快速开始(以Claude Desktop为例)
- 在星河社区部署推理服务
- 配置Claude Desktop的
claude_desktop_config.json:
{
"mcpServers": {
"paddleocr-ocr": {
"command": "uvx",
"args": [
"--from",
"paddleocr-mcp@https://paddle-model-ecology.bj.bcebos.com/paddlex/PaddleX3.0/mcp/paddleocr_mcp/releases/v0.2.0/paddleocr_mcp-0.2.0-py3-none-any.whl",
"paddleocr_mcp"
],
"env": {
"PADDLEOCR_MCP_PIPELINE": "OCR",
"PADDLEOCR_MCP_PPOCR_SOURCE": "aistudio",
"PADDLEOCR_MCP_SERVER_URL": "",
"PADDLEOCR_MCP_AISTUDIO_ACCESS_TOKEN": ""
}
}
}
}- 重启Claude Desktop即可使用
典型应用场景
文档数字化
- 提取手写笔记的内容,并存储到笔记软件中
- 将图片/PDF文档转换为可用Word/Excel编辑的格式
开发工作流
- 手写思路/伪代码转换为可运行脚本
- 将文档图片快速转换为Markdown格式的项目文档
技术优势
- 成熟稳定:经过大量生产环境验证的工业级OCR方案
- 精度领先:OCR、文档解析等在公开评测中超越众多商业方案
- 易于集成:部署步骤简单,几分钟完成集成
- 成本可控:支持本地部署,避免数据外传和API调用费用
开始使用PaddleOCR MCP服务器,让您的AI应用具备工业级文档理解能力。
