Token导航 LogoToken导航TokenDH.com
待分类操作浏览器github未标认证来源可访问许可证需确认审计提醒

browser-use浏览器使用

Agent Skill

browser-use 用于处理浏览器自动化、网页检查和页面信息提取,适合在 Codex、Claude、Cursor、Gemini CLI 中需要让 Agent 打开页面、读取网页或验证前端流程时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

306

周安装

13

GitHub Stars

3

下载量

107
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:browser-use(浏览器使用)
来源仓库:https://github.com/abczsl520/browser-use-skill
仓库路径:skills/browser-use
安装命令:
npx skills add https://github.com/abczsl520/browser-use-skill --skill browser-use
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/abczsl520/browser-use-skill --skill browser-use

简介

browser-use 用于浏览器自动化、网页检查与信息提取,适合在 Codex、Claude、Cursor、Gemini CLI 中让 Agent 打开页面或验证前端流程。

  • 适用于需要模拟用户操作、批量重复任务或绕过反检测机制的场景,尤其适合多步骤交互如登录、填表与提交。
  • 安装后可选择使用内置 Chromium 或连接真实 Chrome 实例,根据是否需要反检测决定模式,首次安装需配置虚拟环境与依赖。
  • 使用前请确认权限范围、维护状态,并注意其可能触发联网、命令执行及文件读写等高风险操作。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

Browser-Use 浏览器自动化

何时用 Browser-Use vs 内置 browser tool

场景内置 toolBrowser-Use
截图/看页面/点一个按钮✅ 免费快❌ 杀鸡用牛刀
5步以上流程(登录→导航→填表→提交)❌ 容易断
需要反检测(真Chrome)
批量重复操作

代价:Browser-Use 每步调一次外部 LLM(花钱+慢),简单操作用内置 tool。

执行流程

1. 检查环境

test -d ~/browser-use-env && echo "已安装" || echo "需要安装"

2. 首次安装(仅一次)

python3 -m venv ~/browser-use-env
source ~/browser-use-env/bin/activate
pip install browser-use playwright langchain-openai
playwright install chromium

3. 决定模式

  • 简单场景 / 不怕被检测:用内置 Chromium(模式A),直接跑
  • 需要反检测 / 用户已有登录态:连真 Chrome(模式B),需用户配合

模式B前置步骤——提示用户:

请先完全退出 Chrome(Mac: Cmd+Q),然后告诉我"关了"

用户确认后执行:

/Applications/Google\ Chrome.app/Contents/MacOS/Google\ Chrome --remote-debugging-port=9222 &
# Windows: "C:\Program Files\Google\Chrome\Application\chrome.exe" --remote-debugging-port=9222
# Linux: google-chrome --remote-debugging-port=9222 &

验证:curl -s http://127.0.0.1:9222/json/version

4. 写脚本并运行

脚本写到用户 workspace 下,然后:

source ~/browser-use-env/bin/activate
python3 脚本路径.py

5. 反馈结果

运行完把结果发给用户,失败则按故障决策树处理。

脚本模板

import asyncio
from browser_use import Agent, ChatOpenAI, Browser

async def main():
    # LLM — 任何 OpenAI 兼容 API 均可
    llm = ChatOpenAI(
        model="gpt-4o-mini",
        api_key="<YOUR_API_KEY>",
        base_url="https://api.openai.com/v1",  # 或其他兼容端点
    )

    # 模式A: 内置 Chromium
    browser = Browser(headless=False, user_data_dir="~/.browser-use/任务名-profile")
    # 模式B: 连真 Chrome
    # browser = Browser(cdp_url="http://127.0.0.1:9222")

    agent = Agent(
        task="详细的任务描述(见下方写法指南)",
        llm=llm,
        browser=browser,
        use_vision=True,
        max_steps=25,
    )
    result = await agent.run()
    print(result)

asyncio.run(main())

Task 写法指南(关键!)

✅ 好的写法:具体分步

task = """
1. 打开 https://www.reddit.com/login
2. 输入用户名: x_user
3. 输入密码: x_pass
4. 点击登录按钮
5. 如果遇到 CAPTCHA,等待30秒让用户手动完成
6. 登录成功后,导航到 https://www.reddit.com/r/xxx/submit
7. 在标题框输入: xxx
8. 在正文框输入: xxx
9. 点击发布按钮
"""

❌ 坏的写法:模糊笼统

task = "去Reddit发个帖子"

进阶技巧

  • 键盘导航兜底:task里加 "如果按钮点不了,用 Tab+Enter 键盘导航"
  • 错误恢复:加 "如果页面加载失败,刷新重试"
  • 敏感数据:用占位符 + sensitive_data 参数,密码不暴露给LLM

敏感数据处理

agent = Agent(
    task="登录网站,用户名 x_user,密码 x_pass",
    sensitive_data={"x_user": "真实用户名", "x_pass": "真实密码"},
    use_vision=False,  # 关闭截图防止LLM看到密码
    llm=llm, browser=browser,
)

关键参数速查

参数说明推荐
use_visionAI看截图一般True,有密码时False
max_steps最大步数20-30
max_failures最大重试3(默认)
flash_mode快速模式(跳过思考)简单任务True
extend_system_message追加系统提示加特定指令
allowed_domains限制访问域名安全场景用
fallback_llm备用LLM主LLM不稳时设

故障决策树

被网站检测为自动化?
  └→ 换模式B连真Chrome

CAPTCHA人机验证?
  └→ 提示用户手动完成,task里写等待时间

LLM调用超时?
  └→ 设 fallback_llm 或换更快的模型

操作了但没效果(如帖子没发出)?
  └→ 1. 检查是否被平台反垃圾拦截(新账号常见)
     2. task里加更具体的确认步骤

网站UI变化导致找不到元素?
  └→ Browser-Use能自适应,但可在task里加备选路径

LLM兼容性

LLM兼容备注
GPT-4o / 4o-mini最佳,推荐
Claude好用
Gemini结构化输出不兼容

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

35.73%
按下载量换算38

Claude

27.91%
按下载量换算30

Cursor

18.15%
按下载量换算19

Gemini CLI

10.07%
按下载量换算11

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

可疑

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills