Token导航 LogoToken导航TokenDH.com
研究检索敏感数据github未标认证来源可访问许可证需确认审计提醒

clawshire-doc-extract-engine克劳郡文档提取引擎

Agent Skill

用于辅助文档、README、Markdown、说明文和内容稿件的整理与改写。它适合让 Agent 提炼结构、补齐章节、统一术语、检查链接或把零散材料整理成可读文档。使用时应保留项目已有事实、命令和路径,不要把未确认的信息写成确定结论;涉及对外文案时,还需要控制语气,避免过度营销或夸大能力。

总安装

570

周安装

24

GitHub Stars

1

下载量

549
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:clawshire-doc-extract-engine(克劳郡文档提取引擎)
来源仓库:https://github.com/lihanghang/clawshire-open-skill
仓库路径:skills/clawshire-doc-extract-engine
安装命令:
npx skills add https://github.com/lihanghang/clawshire-open-skill --skill clawshire-doc-extract-engine
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/lihanghang/clawshire-open-skill --skill clawshire-doc-extract-engine

简介

ClawShire Doc Extract Engine 支持任意 PDF 文件的字段提取,适用于简历、合同、研报等文档。

  • 适用于 Codex、Claude、Cursor、Gemini CLI 中需要自动化解析非结构化文本的场景。
  • 用户只需提供 PDF 路径与自然语言需求,Agent 自动完成上传、schema 创建与提取流程。
  • 使用时需保留项目已有事实,避免将未确认信息写成确定结论。
  • clawshire-doc-extract-engine 属于研究检索类 Skill,可作为该场景下的辅助能力补充。

SKILL.md

ClawShire 通用文档提取引擎技能

上传自备 PDF → 用自然语言描述要提取的字段 → 拿到结构化 JSON。适用于简历、合同、研报、说明书等任意 PDF。

服务地址: https://api.clawshire.cn 前置条件: 设置 CLAWSHIRE_API_KEY。脚本仅使用 Python 标准库,无需安装任何第三方依赖。


Agent 调用指引(重要)

用户只需提供 PDF 路径 + 一句话需求,Agent 自动完成全流程,无需用户手动传递任何 ID。

典型触发语句:

  • "帮我从这个简历 PDF 提取基本信息、工作经历、技能"
  • "把这份合同里的甲乙方、金额、签署日期提取出来"
  • "解析这个研报,提取公司名称、评级、目标价"

Agent 执行顺序(全自动,中间 ID 不需要用户参与):

1. upload PDF               → 获得 document_id
2. schema-create            → 获得 conversation_id
3. schema-chat "用户需求"   → 获得 schema(504 时自动 fallback 到 schema-get)
4. session-create           → 获得 session_id
5. extract --auto-end       → 获得结构化结果 + 自动打印摘要
耗时提示: schema-chat 约 30秒~3分钟,extract 约 1~5分钟,请告知用户等待。

快速开始(三步完成一次提取)

export CLAWSHIRE_API_KEY="sk-..."
SCRIPT="python skills/clawshire-doc-extract-engine/scripts/clawshire_doc_extract_client.py"

# 第一步:上传 PDF,记下返回的 document_id
$SCRIPT upload 合同.pdf

# 第二步:设计提取字段(一句话描述即可,遇到 504 会自动拉取服务端结果)
$SCRIPT schema-create --doc-ids <document_id>
$SCRIPT schema-chat <conversation_id> "提取甲方、乙方、合同金额、签署日期" --save-as 合同

# 第三步:创建 Session 并提取(完成后自动打印覆盖率摘要)
$SCRIPT session-create --name "合同提取" --from-lib 合同 --doc-ids <document_id>
$SCRIPT extract --session-id <session_id> --doc-ids <document_id> --out result.json --auto-end
--auto-end 自动归档并触发平台经验学习;提取完成后始终输出结构化数据,Claude 可直接读取并展示给用户。

标准工作流(完整 7 步 API)

1. 上传 PDF

POST /api/v1/doc-extract-engine/uploadmultipart/form-data,字段名 files(可多个)。

响应:{"document_ids": [...], "count": N}

2. 开启 Schema 设计对话

POST.../schema-conversations,body:{"document_ids": ["id1","id2"]}

响应:{"conversation_id": <int>}

3. 用自然语言描述提取需求

POST.../schema-conversations/{conversation_id}/chat,body:{"message": "请提取甲方、乙方、合同金额、签署日期"}

响应为服务端聚合 SSE 后的 JSON,含 schemamessagesresults 等字段(以实际返回为准)。

若响应未带完整 schema:GET.../schema-conversations/{conversation_id} 拉取当前状态。

4. 创建提取 Session

POST.../sessions,body:

{
  "session_name": "合同-项目A",
  "extraction_schema": { "type": "object", "properties": { ... } },
  "document_ids": ["id1", "id2"]
}

响应:{"session_id": <int>}

5. 执行提取

POST.../extract,body:{"session_id": 1, "document_ids": ["id1","id2"]}

响应含 batch_idresults 等。

6. 迭代修正(可选)

POST.../batches/{batch_id}/chat,body:{"message": "把金额统一成数字,去掉货币符号"}

可重复多轮。

7. 归档

POST.../batches/{batch_id}/end


高级用法:省 Token & 省额度

输出行为说明

extractbatch-resultbatch-chat 命令始终将实际接口响应的结构化数据(results[].data)输出到 stdout,让 Claude 和用户都能直接看到提取内容。

选项作用
extract --quiet额外打印字段覆盖率概要(进度条)
batch-result --summary额外打印字段覆盖率,查询已有批次时使用
batch-chat --quiet额外打印字段覆盖率概要

省额度:本地提取缓存

首次提取会自动写入 ~/.clawshire/cache.json(按 API Key + BaseURL + session_id + doc_ids 四维隔离,切换环境不会污染)。

# 首次提取(写入缓存)
$SCRIPT extract --session-id 1 --doc-ids id1,id2 --out result.json --quiet

# 再次访问同一批文档,命中缓存则不消耗额度
$SCRIPT extract --session-id 1 --doc-ids id1,id2 --use-cache --quiet
注意--use-cache 未命中时会打印明确提示后执行真实提取;缓存命中但该 batch 已被 --auto-end 归档时,会显示"归档快照"警告。

省 schema-chat:本地 Schema 库

Schema 保存到 ~/.clawshire/schemas.json,跨 API Key 复用,无需重复 schema-chat。

# 查询已有 schema(支持关键字过滤)
$SCRIPT schema-lib-list
$SCRIPT schema-lib-list --search 合同

# schema-chat 时自动保存(同名已存在时跳过,不静默覆盖)
$SCRIPT schema-chat 1 "提取甲方、乙方、金额" --save-as 合同 --description "合同通用 schema"

# 手动保存(允许覆盖已有 schema,会提示原保存时间)
$SCRIPT schema-lib-save --name 合同 --file schema.json

# 跳过 schema-chat,直接从库创建 Session
$SCRIPT session-create --name "批量任务" --from-lib 合同 --doc-ids id1,id2,id3

CLI 完整参数参考

# 连通性检查
$SCRIPT status

# 上传(本地路径 或 http/https URL,可混用)
$SCRIPT upload a.pdf "https://example.com/b.pdf"

# Schema 流程
$SCRIPT schema-create --doc-ids id1,id2
$SCRIPT schema-chat <conv_id> "描述需求" [--save-as 名称] [--description 描述]
$SCRIPT schema-get <conv_id>

# Session 流程
$SCRIPT session-create --name 名称 (--schema-file schema.json | --from-lib 名称) --doc-ids id1,id2
$SCRIPT sessions
$SCRIPT history <session_id>

# 提取
$SCRIPT extract --session-id <sid> --doc-ids id1,id2 \
  [--out [path.json]] [--auto-end] [--quiet] [--use-cache]

# Batch 操作
$SCRIPT batch-result <batch_id> [--out [path.json]] [--summary]
$SCRIPT batch-chat <batch_id> "修正说明" [--out [path.json]] [--quiet]
$SCRIPT batch-end <batch_id>

# Schema 库管理
$SCRIPT schema-lib-list [--search 关键字]
$SCRIPT schema-lib-save --name 名称 --file schema.json [--description 描述]
$SCRIPT schema-lib-delete 名称

辅助说明

认证Authorization: Bearer $CLAWSHIRE_API_KEY 本地调试export CLAWSHIRE_API_BASE_URL=http://localhost:8452 依赖:脚本无需第三方库,仅用 Python 标准库(urllib、json、argparse 等);平台需启用 MEME_PLUGIN_REFLECT_ENGINE_ENABLED 耗时extract / schema-chat / batch-chat 可能耗时数分钟,应告知用户等待

与公告数据的关系:本技能不需要 met_uuid,适合对用户手头的任意 PDF 做通用提取;若只有公告链接,使用 clawshire-data-query 查看已有结构化结果。

错误码处理
401检查 CLAWSHIRE_API_KEY
413单文件超过平台 MAX_UPLOAD_MB
503插件未启用或未配置引擎 URL
502引擎超时或 SSE 报错,稍后重试

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

37.05%
按下载量换算203

Claude

29.93%
按下载量换算164

Cursor

19.09%
按下载量换算105

Gemini CLI

10.43%
按下载量换算57

安全审计

Gen Agent Trust Hub

通过

Socket

可疑

Snyk

可疑

权限和风险

敏感数据

该 Skill 可能接触密钥、Token、环境变量或敏感配置,应进入高风险复核队列,默认不自动发布。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills