Token导航 LogoToken导航TokenDH.com
Smooth Operator Agent Tools logo
浏览器工具stdio官方级别未说明来源级核验

Smooth Operator Agent Tools

MCP Server

Smooth Operator Agent Tools是一个用于Windows系统的先进自动化工具库,提供UI元素识别、浏览器控制和系统操作等功能,适用于开发计算机使用代理。

工具数

0

提示词数

0

GitHub Stars

2

资源数

0
Python浏览器自动化网页抓取

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

fstandhartinger

提供方

fstandhartinger

最后核验

2026/5/17 20:19

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install smooth-operator-agent-tools

详细介绍

如果您正在寻找MCP服务器: 在这里找到它.

如果你正在寻找Python库,请继续;)

平滑运算符代理工具-Python库

这是Smooth Operator Agent Tools的官方Python库实现,这是一个最先进的工具包,供程序员在Windows系统上开发计算机使用代理。

概述

Smooth Operator Agent Tools是一个功能强大的工具包,可以处理与Windows Automation Tree和Playwright浏览器控件交互的复杂任务,同时提供高级AI功能,例如通过屏幕截图和文本描述识别UI元素。

此Python库为Smooth Operator Tools Server API提供了一个方便的包装器,使您能够轻松地将这些功能集成到Python应用程序中。

在代码中实现之前,可以通过方便的Windows用户界面测试和探索所有功能。试试看 流畅的操作员工具用户界面.

安装

pip install smooth-operator-agent-tools

先决条件

谷歌浏览器

Smooth Operator Agent Tools库需要在系统上安装Google Chrome(或兼容的基于Chromium的浏览器),以便浏览器自动化功能正常工作。

服务器安装

Smooth Operator客户端库包含一个需要安装在应用程序数据目录中的服务器组件。服务器文件与库打包在一起,并在首次使用时自动提取。

首次执行

当您第一次使用库时,它将自动:

  1. 创建目录 %APPDATA%\SmoothOperator\AgentToolsServer (或操作系统上的等效工具)
  2. 从包中提取服务器文件
  3. 启动服务器进程

请注意,为了使Chrome自动化功能正常工作,您需要确保按照先决条件部分中的描述安装了Node.js和Playwright。

适用于应用程序安装程序

如果你正在构建一个包含此库的应用程序安装程序,你应该在应用程序的安装过程中包括安装Node.js和Playwright的步骤,以获得更好的用户体验。有关所需的安装步骤,请参阅先决条件部分。

用法

from smooth_operator_agent_tools import SmoothOperatorClient

# Initialize the client with your API key, get it for free at https://screengrasp.com/api.html
client = SmoothOperatorClient(api_key="YOUR_API_KEY")

# Start the Server - this takes a moment
client.start_server()

# Take a screenshot
screenshot = client.screenshot.take()

# Get system overview
overview = client.system.get_overview()

# Perform a mouse click
client.mouse.click(500, 300)

# Find and click a UI element by description
client.mouse.click_by_description("Submit button")

# Type text
client.keyboard.type("Hello, world!")

# Control Chrome browser
client.chrome.open_chrome("https://www.example.com")
client.chrome.get_dom()

# You can also use the to_json_string() method on many objects
# to get a JSON string that can easily be used in a prompt to a LLM
# to utilize AI even more for automated decision making

特性

  • 屏幕截图和分析:捕获屏幕截图并分析UI元素
  • 鼠标控制:使用坐标或AI驱动的元素检测进行精确的鼠标操作
  • 键盘输入:键入文本并发送组合键
  • Chrome浏览器控件:导航、与元素交互和执行JavaScript
  • Windows自动化:与Windows应用程序和UI元素交互
  • 系统操作:打开应用程序并管理系统状态

文档

有关API的详细文档,请访问:

  • 使用指南: 常见用例的详细示例和解释。
  • 示例项目: 下载,按照分步说明进行操作,并在分钟内运行您的第一个自动化。
  • 文档: 内部执行工作的服务器的所有API端点的详细文档。

许可证

此项目根据MIT许可证获得许可-有关详细信息,请参阅许可证文件。

目录标签

目录标签

Python浏览器自动化网页抓取Windows自动化本地部署浏览器控制UI元素识别Python库系统操作

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

api-key

部署方式(deploymentType,部署类型)

local-only

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdioapi-keylocal-only

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP