Token导航 LogoToken导航TokenDH.com
研究检索操作浏览器clawhub未标认证来源可访问clear审计提醒

content-collector内容收集器

Agent Skill

用于辅助文档、README、Markdown、说明文和内容稿件的整理与改写。它适合让 Agent 提炼结构、补齐章节、统一术语、检查链接或把零散材料整理成可读文档。使用时应保留项目已有事实、命令和路径,不要把未确认的信息写成确定结论;涉及对外文案时,还需要控制语气,避免过度营销或夸大能力。

总安装

13,195

周安装

561

GitHub Stars

公开资料未说明

下载量

4,623
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:content-collector(内容收集器)
来源仓库:https://github.com/lovensky1992-wk/content-collector
安装命令:
openclaw skills install content-collector
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install content-collector

简介

内容收集器实现个人知识资产管理,支持收藏、检索与二次创作功能。

  • 当用户说“存一下”或“剪辑”时自动保存链接、文本与多媒体素材。
  • 提供语义搜索与智能标签体系,提升信息回溯与再利用效率。
  • 安装命令:openclaw skills install content-collector,注意本地存储加密策略。
  • 使用前应评估是否允许同步浏览器书签或访问剪贴板历史记录。

SKILL.md

name
content-collector
version
2.0.0
description
>

Content Collector - 个人内容收藏系统

收藏好内容 → 结构化整理 → 关键词检索 → 二次创作

数据位置

  • 主存储: <WORKSPACE>/collections/(articles/ tweets/ videos/ wechat/ ideas/)
  • Obsidian 同步: <YOUR_OBSIDIAN_VAULT>/收藏/(每次收藏同时写入)
  • 索引: collections/index.md + collections/tags.md(自动维护)

收藏工作流

Step 0: 去重(每次必做)

有 URL 时: obsidian search query="<domain/path>" total(去掉 https:// 前缀)或 grep -rl "<url>" collections/ 返回 > 0 → 已收藏,终止。返回 0 → 继续。

Step 1: URL 路由

按 URL 匹配处理路径。详见 references/url-routing-and-site-specs.md

URL 模式category处理方式
内网域名articlesChrome Relay,不调 web_fetch
arxiv.org/abs/*articles提取 abstract/authors
github.com/*/*articlesREADME + stars/language
mp.weixin.qq.comwechat优先 browser
youtube.com/watch*videosSupadata transcript
B站videosvideo_transcribe.sh 本地转录
小红书/抖音(视频)videosvideo_transcribe.sh 本地转录
x.com/*/status/*tweets提取互动数据,thread 展开
其他articles默认流程

Step 2: 内容提取

文章/网页:

  1. supadata_fetch.py web <url>(降级: web_fetch
  2. Schema.org 提取 — 详见 references/schema-extraction-spec.md
  3. 插图提取+下载(必做)— 详见 references/image-extraction-spec.md
  4. 主题关键词提取 — 详见 references/theme-extraction-spec.md

视频:

  1. 元数据: supadata_fetch.py metadata <url>bilibili_extract.py <url>
  2. 转录: bash scripts/video_transcribe.sh <url>(自动检测平台和字幕源)
  3. 精彩片段提取(≥10min) — 详见 references/highlight-extraction-spec.md
  4. 主题关键词提取

推文/短内容: 直接提取文本+互动数据

Step 3: 写文件

  1. 生成 collections/{category}/YYYY-MM-DD-slug.md(格式见下方 Schema)
  2. 内容概览图(>1000字文章) — 详见 references/content-overview-spec.md
  3. 同步到 Obsidian — 详见 references/obsidian-integration.md
  4. obsidian daily:append content="- 📌 收藏了 [[{标题}]]({source})| {一句话摘要}"
  5. 更新 index.md + tags.md

Step 3.5: 微信图片缓存(wechat 类必做)

如果 URL 是微信公众号(mp.weixin.qq.com),写完收藏文件后运行: bash scripts/cache-wechat-images.sh <刚写入的收藏文件> 下载微信 CDN 图片到本地 collections/images/<slug>/,防止图片过期 404。

Step 4: 关联匹配

运行 bash scripts/post-collect.sh <刚写入的收藏文件> 脚本自动匹配活跃项目和相关收藏,更新 frontmatter 的 related_projects。 如有相关收藏,在回复中附带提及。 仍需手动匹配 collections/topics/topic-pool.md → 追加到 temp/handoffs/collector-to-writing.md

写文件前自检

每次写 collections/ 文件前,确认以下步骤已完成。缺项标注 incomplete: true,不允许静默跳过。

  • 去重 ✓ → 内容提取 ✓ → 插图(文章类,必做) ✓ → 主题关键词 ✓ → 写文件 ✓ → Obsidian同步 ✓ → Daily Note ✓
  • 写 tags 前运行 bash scripts/normalize-tags.sh <tag1> <tag2> ... 检查是否有已有近似 tag,优先复用已有 tag 名称

存储 Schema

文件命名: YYYY-MM-DD-slug.md

---
title: ""
source: ""
url: ""
author: ""
date_published: ""
date_collected: ""
tags: []
category: "articles|tweets|videos|wechat|ideas"
language: "zh|en"
summary: ""
themes: []              # 5-7 个概念切面
schema_type: ""         # Schema.org @type(可选)
schema_data: {}         # ≤10 key-value(可选)
incomplete: false
# 视频专属
duration: ""
platform: ""
bvid: ""
stats: {}
subtitle_source: ""     # native_cc|whisper
highlights: []          # 精彩片段
related_projects: []
---

内容结构

  • 内容概览(Mermaid,>1000字触发)
  • 核心观点(3-7个要点)
  • 精彩片段(视频≥10min)
  • 要点摘录(blockquote 金句)
  • 热门评论精选(视频类)
  • 我的笔记
  • 原文摘要(200-500字)

英文内容

默认 storytelling 翻译风格。术语参照 <WORKSPACE>/references/glossary-ai-zh.md,首次出现 中文(English) 格式。

检索

  1. 标签: tags.md
  2. 全文: grep -ril "keyword" collections/
  3. 返回匹配列表 + 摘要

二创

按选题从收藏库筛选素材,交给 xiaohongshu-opswemp-ops 处理。本 skill 只负责供料。

工具脚本

脚本用途
`scripts/supadata_fetch.py web\transcript\metadata <url>`Supadata API 抓取
scripts/bilibili_extract.py <url>B站元数据
scripts/video_transcribe.sh <url>视频转录(自动检测平台)
scripts/sync_to_obsidian.py批量同步到 Obsidian
scripts/cache-wechat-images.sh <file>微信 CDN 图片本地缓存
scripts/normalize-tags.sh <tag1> <tag2> ...标签归一化去重
scripts/post-collect.sh <file>收藏后自动关联分析

🔴 Final: 机械验证(不可跳过)

通知用户前运行:

bash scripts/skill-verify.sh content-collector <collections-file-path>
# 例: bash scripts/skill-verify.sh content-collector collections/wechat/2026-04-23-xxx.md
  • ✅ ALL PASSED → 回复用户收藏结果
  • ❌ FAILED → 按输出补齐缺失项(Obsidian 同步/插图/index.md 等),重新验证直到通过

绝不在验证未通过时回复用户"已完成"。

收藏结果通知

  • 成功: `📌 已收藏:<标题>\

核心:<一句话摘要>\ 标签:<3-5个标签>`

  • 重复: 📌 已存在:<标题>(之前已收藏过)
  • 失败: `❌ 收藏失败:<URL>\

原因:<失败原因>`

下一步建议(条件触发)

触发条件推荐
与公众号选题方向高度相关用 wemp-ops 写
适合小红书短图文用 xiaohongshu-ops 改写
某博主收藏 ≥3 条用 x-profile-deep-dive 画像
涉及技术方案/架构决策存到 memory 做长期参考

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

96.59%
按下载量换算4,465

安全审计

VirusTotal

可疑

ClawScan

可疑

Static analysis

通过

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills