小智AI MCP OCR扩展服务
基于小智AI MCP框架的OCR扩展服务,提供截图OCR功能,集成硅基流动DeepSeek-OCR模型。
环境要求
- Python 3.8+
功能特性
- 📸 屏幕截图: 自动进行屏幕截图
- 🔍 OCR识别: 集成硅基流动DeepSeek-OCR模型
- 🔄 MCP协议: 兼容小智AI MCP扩展协议
- 🚀 自动重连: 支持WebSocket连接自动重连
- 📊 日志记录: 完整的操作日志记录
项目结构
xiaozhi-mcp-ocr/
├── config.yaml # 配置文件
├── mcp_pipe.py # MCP管道服务
├── main.py # 主程序入口
├── requirements.txt # 依赖包列表
├── run.bat # Windows启动脚本
├── README.md # 项目说明
├── handle/ # 处理模块
│ ├── loader.py # 配置加载
│ └── logger.py # 日志设置
├── services/ # 服务模块
│ └── register.py # 工具注册
└── utils/ # 工具模块
└── ocr/ # OCR工具
├── tools.py # OCR工具注册
└── screenshot_ocr.py # 截图OCR实现快速开始
1. 安装依赖
pip install -r requirements.txt2. 配置API密钥
编辑 config.yaml 文件,确保OCR配置正确:
ocr:
api_key: "sk-"
api_url: "https://api.siliconflow.cn/v1/chat/completions"
model: "deepseek-ai/DeepSeek-OCR"3. 启动服务
Windows系统:
run.bat手动启动:
python mcp_pipe.py main.py配置说明
MCP服务配置
endpoint:
url: "wss://api.xiaozhi.me/mcp/?token=your_token"重连配置
reconnection:
initial_backoff: 1 # 初始重连等待时间(秒)
max_backoff: 600 # 最大重连等待时间(秒)工具功能
截图OCR工具
工具名称: Roco截图文字识别
功能描述: 进行屏幕截图并使用OCR识别图片中的文字内容
参数:
save_dir(可选): 截图保存目录,默认保存到tem文件夹
返回值:
{
"success": true,
"screenshot_path": "路径/to/screenshot.png",
"ocr_result": "识别出的文字内容",
"message": "截图OCR识别成功"
}打包说明
项目采用模块化架构,便于后期打包成exe客户端:
- 依赖管理: 使用requirements.txt管理所有依赖
- 配置分离: 配置文件独立,便于部署
- 模块化设计: 功能模块清晰分离
- 日志系统: 完整的日志记录,便于调试
推荐使用PyInstaller进行打包:
pip install pyinstaller
pyinstaller --onefile --console mcp_pipe.py故障排除
常见问题
- 依赖安装失败
- 确保使用Python 3.8+ - 尝试使用国内镜像源: pip install -i https://pypi.tuna.tsinghua.edu.cn/simple -r requirements.txt
- OCR API调用失败
- 检查API密钥是否正确 - 确认网络连接正常 - 查看日志文件获取详细错误信息
- 截图失败
- 确保有屏幕访问权限 - 检查Pillow库是否正确安装
日志查看
日志文件保存在 log/ 目录下,按日期命名,便于问题排查。
技术支持
如有问题,请查看日志文件或联系技术支持。
