Token导航 LogoToken导航TokenDH.com
待分类权限需确认unknown未标认证来源可访问许可证需确认审计未展示

document-processor文件处理器

Agent Skill

document-processor 用于整理文档、README、Markdown 和说明材料,适合在 Local Agent 中需要把零散信息整理成结构清晰的文档时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

768

周安装

33

下载量

269
Local Agent

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:document-processor(文件处理器)
来源仓库:https://skills.volces.com
仓库路径:document-processor
安装命令:
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。当前暂无明确安装命令,请以来源页面说明为准。

简介

document-processor 用于整理文档、README、Markdown 和说明材料。

  • 它适合在 Local Agent 中把零散信息整理成结构清晰的文档时使用。
  • 使用时可结合来源仓库和原始 README 核验具体功能。
  • 安装前建议确认权限范围、维护状态及是否涉及联网或文件操作。
  • 该技能适用于文档处理辅助,但需人工验证内容完整性与格式规范性。

SKILL.md

文档处理技能 📄

专业的PDF和Word文档处理工具集,支持多种文档格式转换和编辑操作。

功能特性

1. PDF处理

  • ✅ PDF页面提取(提取指定页面生成新PDF)
  • ✅ PDF转Word(保留格式)
  • ✅ PDF合并/拆分
  • ✅ PDF去水印
  • ✅ PDF压缩优化
  • ✅ PDF添加水印/页眉页脚
  • ✅ OCR页码识别(识别扫描件PDF中的页码)

2. Word处理

  • ✅ Word转PDF
  • ✅ Word文档合并
  • ✅ Word内容提取
  • ✅ Word格式清理

3. OCR功能

  • ✅ 扫描件PDF文字识别
  • ✅ 多语言支持(中英文等)
  • ✅ 页码自动识别和映射
  • ✅ 批量OCR处理

4. 其他功能

  • ✅ 图片提取(从PDF中提取图片)
  • ✅ 批量处理(处理多个文件)

工具依赖

本技能需要以下Python库:

  • PyPDF2 - PDF处理
  • python-docx - Word文档处理
  • pdf2docx - PDF转Word
  • Pillow - 图片处理
  • pdfplumber - 高级PDF处理

安装命令:

pip install PyPDF2 python-docx pdf2docx pillow pdfplumber

使用示例

1. PDF页面提取

# 提取第14-29页
python3 pdf_extractor.py "input.pdf" "output_pages_14-29.pdf" -s 14 -e 29

# 提取特定页面
python3 pdf_extractor.py "input.pdf" "output_specific.pdf" -p "1,3,5-7,10"

2. PDF转Word

python3 pdf_to_word.py "document.pdf" "document.docx"

3. Word转PDF

python3 word_to_pdf.py "document.docx" "document.pdf"

4. PDF去水印

python3 remove_watermark.py "input.pdf" "output_no_watermark.pdf"

5. 批量PDF转Word

python3 batch_pdf_to_word.py "/path/to/pdf/folder" "/path/to/output/folder"

脚本文件

本技能包含以下Python脚本:

核心脚本

  1. pdf_extractor.py - PDF页面提取工具
  2. pdf_to_word.py - PDF转Word工具
  3. word_to_pdf.py - Word转PDF工具
  4. pdf_ocr.py - PDF OCR和页码识别工具
  5. remove_watermark.py - PDF去水印工具
  6. pdf_merger.py - PDF合并工具
  7. pdf_splitter.py - PDF拆分工具

实用工具

  1. batch_processor.py - 批量处理工具
  2. pdf_compressor.py - PDF压缩工具
  3. image_extractor.py - 图片提取工具
  4. install_dependencies.py - 依赖安装工具
  5. test_skill.py - 技能测试工具

使用指南

当用户需要处理文档时:

  1. 识别需求:确定用户需要什么功能(转换、提取、编辑等)
  2. 检查依赖:确保所需Python库已安装
  3. 选择脚本:根据需求选择合适的脚本
  4. 执行操作:运行相应的Python脚本
  5. 验证结果:检查输出文件是否满足要求

高级功能

OCR页码识别

# 分析PDF页码结构
python3 pdf_ocr.py analyze "input.pdf" --start 1 --end 50 --language chi_sim+eng

# 根据标注页码提取页面
python3 pdf_ocr.py extract "input.pdf" "output.pdf" --start-label 14 --end-label 29 --language chi_sim+eng

自定义水印

# 添加文本水印
python3 add_watermark.py "input.pdf" "output.pdf" --text "CONFIDENTIAL" --position "center"

# 添加图片水印
python3 add_watermark.py "input.pdf" "output.pdf" --image "watermark.png" --opacity 0.3

批量处理

# 批量转换文件夹内所有PDF为Word
python3 batch_processor.py --input-dir "./pdfs" --output-dir "./docs" --operation "pdf2word"

# 批量提取所有PDF的封面
python3 batch_processor.py --input-dir "./pdfs" --output-dir "./covers" --operation "extract" --pages "1"

错误处理

  • 文件不存在时提供清晰错误信息
  • 格式不支持时建议转换方法
  • 权限问题提示解决方案
  • 内存不足时建议分批处理

性能优化

  • 大文件处理时显示进度条
  • 支持多线程批量处理
  • 提供压缩选项减少文件大小
  • 缓存中间结果避免重复处理

安全注意事项

  • 验证输入文件格式
  • 限制文件大小防止内存溢出
  • 清理临时文件
  • 不处理加密或受保护的PDF
  • 用户确认后再执行删除操作

技能维护者:文档处理团队 最后更新:2026-03-01 版本:1.0.0 状态:✅ 生产就绪

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Local Agent

82.83%
按下载量换算223

安全审计

暂无安全审计结果可展示。

权限和风险

权限需确认

当前来源未能明确判断权限范围,默认进入异常复核队列。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills