一个简单的捕获屏幕的mcp🦊
这个项目是一个使用 FastMCP 框架实现的屏幕截图工具,它能够捕获屏幕内容,并通过 Ollama API或者是阿里云的Dashscope发送给视觉模型进行分析
功能描述
- 屏幕截图:使用
ImageGrab捕获整个屏幕,并调整图像大小 - Base64 编码:将截图转换为 Base64 编码的 data URL
- Ollama API 调用:将 Base64 编码的图像发送给 Ollama API 进行分析,以识别图像内容
- 结果返回:将 Ollama API 返回的结果返回给用户
注意事项🚨
- 请确保 Ollama API 已经运行,或者你已正确配置了Dashscope API 的地址和模型名称
- 本示例使用了
qwen2.5vl:7b作为视觉模型,你可以根据需要替换为其他模型 - 请根据你的需求调整图像的缩放倍数(4050跑视觉模型什么的还是太勉强了😭……建议真的缩放倍率开高一点)
