👁️ OSIRIS:基于视觉的GUI代理(MCP)
奥西里斯是一个 自主计算机使用代理 由 模型上下文协议(MCP).
与依赖于可访问性API或HTML DOM的标准代理(在传统应用程序、远程桌面和游戏上失败)不同,Osiris使用 净见。它实现了微软的 OmniParser 研究“看到”屏幕,检测可交互元素(按钮、图标、文本字段),并将其映射到像素完美坐标。
它支持LLM(如 双子座闪光)控制 软件 就像人类一样:通过观察和点击。
______________________________________________________________________
🎥 演示
*在这个演示中,Osiris自动打开WhatsApp,搜索特定组,并根据高级自然语言命令发送消息。*
______________________________________________________________________
🧠 运作原理
Osiris基于模块化构建 视觉语言行动 管道:
- 眼睛(视觉核心):
- 使用微调 YOLOv8 模型(Microsoft OmniParser)用于检测UI元素。 - 用途 EasyOCR/TrOCR 读取按钮和字段内的文本。 - 将这些合并到一个带有边界框的结构化“UI树”中。
- 协议(MCP服务器):
- 揭示视觉逻辑 MCP工具 (parse_screen). - 这允许任何符合MCP的客户端(Claude Desktop、Cursor、自定义代理)立即“插入”视觉功能。
- 大脑(自主循环):
- Python代理循环由 双子座闪光. - 它维护操作历史、屏幕状态原因,并通过以下方式执行鼠标/键盘命令 PyAutoGUI.
______________________________________________________________________
📸 可视化调试器
我们包括a 流线型仪表板 以准确可视化AI看到的内容。
Debugger View *左:原始屏幕截图|右:虹膜检测(红色=图标,绿色=文本按钮)*
______________________________________________________________________
🛠️ 安装
1.克隆存储库
git clone https://github.com/yourusername/osiris.git
cd osiris2.安装依赖项
我们建议使用虚拟环境。
python -m venv venv
source venv/bin/activate # On Windows: venv\Scripts\activate
pip install -r requirements.txt3.下载型号重量
此脚本从HuggingFace下载OmniParser YOLO权重。
python setup.py4.配置密钥
在根目录中创建.env文件:
GOOGLE_API_KEY=your_gemini_api_key_here用法
1.运行自治代理
这开始了循环。系统将提示您输入目标。
python agent.py示例目标:“打开记事本,键入一首关于人工智能的诗,然后保存。”
2.运行可视化调试器
这运行了一个Streamlit应用程序,可以可视化人工智能的愿景。
streamlit run app.py3.作为MCP服务器运行
如果您想将Osiris连接到Claude Desktop或其他MCP客户端:
python -m osiris.server演示
演示视频展示于
