代理-X
标语: 第一个为你工作的网络AI。解放双手。
任务
构建一个浏览器原生AI助手,该助手使用视觉语言模型来理解web界面,并根据简单的英语指令执行任务。
概述
AutomateAI是一个业余爱好者项目,旨在创建一个可以自动化web任务的AI助手。它使用视觉语言模型来理解网页并与之交互,允许用户用简单的英语给出指令。该项目对捐款开放。
核心架构
- MCP(模型上下文协议)服务器: 处理AI模型和浏览器之间通信的核心服务器。
- 基于Pydantic的数据验证: 确保数据完整性和验证。
- 浏览器自动化引擎: 使用Playwright实现强大的浏览器自动化。
- 视觉语言AI集成: 利用Gemini 2.5计算机使用API来理解web界面。
- 安全第一设计原则: 通过动作验证和权限控制等功能优先考虑用户安全。
入门指南
先决条件
- Python 3.10+
- Node.js 16+
- 诗歌
- 码头工人
设置
- 克隆存储库:
git clone https://github.com/your-username/AutomateAI-Agent.git
cd AutomateAI-Agent- 安装后端依赖项:
cd MCP_SERVER
poetry install- 安装前端依赖项:
cd frontend
npm install- 设置环境变量:
创建一个 .env 文件在 MCP_SERVER 目录并添加以下内容:
GEMINI_API_KEY=your_api_key- 运行应用程序:
cd ..
poetry run uvicorn main:app --reload在单独的终端中,运行前端:
cd frontend
npm start用法
- 打开浏览器并导航到
http://localhost:3000. - 使用聊天界面输入web任务的提示。例如:
- “导航到https://example.com" - “单击“更多信息…”链接” - “在搜索栏中键入‘hello world’”
- 代理将处理您的请求,并在新的浏览器窗口中执行任务。
- 您可以在聊天界面中监视任务的进度。
开发阶段
该项目分为以下开发阶段:
- 基金会: 设置核心基础设施,包括MCP服务器和浏览器自动化。
- 人工智能集成和后端: 整合视觉语言模型并构建后端逻辑。
- 前端开发: 创建一个用户友好的界面,用于与人工智能助手进行交互。
- 核心自动化功能: 实现数据提取和表单填写等关键自动化功能。
- 建议的自动化和用例: 为用户提供预构建的自动化建议和模板。
- 安全与安保: 增强助理的安全和安保功能。
- 验证和测试: 在部署之前彻底测试应用程序。
技术栈
后端
- Python 3.10+
- 快速API
- 派丹蒂克
- 剧作家
- 异步
- 瑞迪斯
- PostgreSQL
前端
- React 18+与TypeScript
- 顺风 CSS
- Socket.io
- React查询
- React路由器
基础设施
- 码头工人
- Docker Compose
- Nginx
- 让我们加密
如何做出贡献
这是一个爱好项目,我们欢迎社区的贡献。如果您有兴趣贡献,请随时分叉存储库并提交拉取请求。
许可证
该项目尚未获得许可。
