Token导航 LogoToken导航TokenDH.com
待分类需要联网unknown未标认证来源可访问许可证需确认审计未展示

smart-web-fetch智能网页抓取

Agent Skill

smart-web-fetch 用于补充待分类相关能力,适合在 Local Agent 中需要让 Agent 承接待分类相关任务时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

214

周安装

9

下载量

75
Local Agent

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:smart-web-fetch(智能网页抓取)
来源仓库:https://gitee.com
仓库路径:smart-web-fetch
安装命令:
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。当前暂无明确安装命令,请以来源页面说明为准。

简介

用于补充待分类相关能力。smart-web-fetch 属于待分类类 Skill,可作为该场景下的辅助能力补充。

  • 适合在 Local Agent 中承接待分类相关任务。
  • 暂无明确安装命令,需参考来源站点获取使用方式。
  • 建议确认权限范围和维护状态,注意可能触发联网或文件操作。
  • 可结合来源站点进一步了解具体功能和使用方法。

SKILL.md

Smart Web Fetch

当需要抓取网页正文并转为干净 Markdown 时,优先使用本 skill 自带脚本 scripts/smart_web_fetch.py

Quick Start

先看帮助(不要先读源码):

python3 scripts/smart_web_fetch.py --help

抓取并输出 Markdown:

python3 scripts/smart_web_fetch.py "https://example.com"

输出结构化 JSON(包含 provider/title/source_url/markdown):

python3 scripts/smart_web_fetch.py "https://example.com" --json

对需要登录态或验证态的页面传入 Cookie:

python3 scripts/smart_web_fetch.py "https://mp.weixin.qq.com/s?..." --service wechat --cookie "name=value; name2=value2"

也可以从文件读取 Cookie:

python3 scripts/smart_web_fetch.py "https://mp.weixin.qq.com/s?..." --service wechat --cookie-file ./wechat.cookie

Providers (Auto Routing)

默认 --service auto 会并行请求:

  • jina: https://r.jina.ai/<original_url>
  • wechat: 对 mp.weixin.qq.com 调用本地 wechat-article-extractor,提取结构化字段后再转为 Markdown
  • scrapling: 本机已安装 scrapling + html2text 时启用,优先抽取正文节点并转 Markdown
  • markdown.new: https://markdown.new/<original_url>(必要时 fallback 到 POST https://markdown.new/
  • defuddle: https://defuddle.md/<original_url_without_scheme>(例如 defuddle.md/example.com/path

脚本会做有效性校验(长度/错误关键字/HTML 假返回),选择“第一个有效结果”,并取消其他请求。

对于 mp.weixin.qq.com,会优先尝试 wechat-article-extractor,再尝试 scrapling,避免浪费 Jina 配额。 若文章被微信环境校验拦截,可通过 --cookie--cookie-file 传入浏览器中的 Cookie 请求头重试。

Notes

  • 基础依赖:系统需要有 python3curl
  • 微信增强:系统需要有 node,并且 wechat-article-extractor 的 npm 依赖已安装
  • 可选增强:安装 scraplinghtml2text 后,可获得更强的反爬能力与更干净的正文提取
  • 推荐安装:pip install "scrapling[fetchers]" html2text && scrapling install
  • 不适用:登录/支付/上传/强交互页面、或被严格反爬/验证码拦截页面
  • 需要调参时用:--timeout--min-chars--service--cookie--cookie-file

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Local Agent

89.94%
按下载量换算67

安全审计

暂无安全审计结果可展示。

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills