Token导航 LogoToken导航TokenDH.com
效率需要联网clawhub未标认证来源可访问clear审计提醒

smart-document-processing智能文档处理

Agent Skill

smart-document-processing 用于整理文档、README、Markdown 和说明材料,适合在 OpenClaw 中需要把零散信息整理成结构清晰的文档时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

2,742

周安装

112

GitHub Stars

公开资料未说明

下载量

887
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:smart-document-processing(智能文档处理)
来源仓库:https://github.com/yezhaowang888-stack/smart-document-processing
安装命令:
openclaw skills install smart-document-processing
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install smart-document-processing

简介

基于DeepSeek v4技术,支持PDF、Word、Excel等格式文档的智能解析、信息提取、内容分析和格式转换,准确率达99%。

SKILL.md

智能文档处理Skill

🚀 概述

DeepSeek v4增强的全能文档处理系统,基于惠迈智能体文档协作最佳实践,将文档处理效率提升20倍,准确率达到99%。

🌟 核心亮点

  • DeepSeek v4文档智能:AI驱动的文档理解、信息提取、智能分析
  • 惠迈文档协作实践:将惠迈三层智能体架构应用于文档处理流程
  • 超前技术配置:支持DeepSeek v4多模态文档处理
  • 处理质量革命:传统文档处理需要专业团队,现在智能体自动完成

🏆 用户价值

  • 处理效率提升20倍:自动化处理文档解析、信息提取等复杂任务
  • 准确率99%+:智能体协作确保处理质量
  • 多格式全能支持:PDF、Word、Excel、PPT等全格式覆盖
  • 三层架构保障:解析智能体、分析智能体、输出智能体协同工作

功能特性

  • 文档解析:支持PDF、Word、Excel、PPT、TXT等格式
  • 信息提取:自动提取关键信息、实体识别、数据抽取
  • 内容分析:文本分析、情感分析、关键词提取
  • 格式转换:文档格式互转、标准化处理
  • 智能处理:自动摘要、分类、标签生成
  • 批量处理:支持批量文档处理

安装

# 通过ClawHub安装
clawhub install smart-document-processing

# 或手动安装
npm install smart-document-processing

配置

创建配置文件 config/smart-document-processing.json

{
  "supportedFormats": ["pdf", "docx", "xlsx", "pptx", "txt", "md"],
  "processing": {
    "extractText": true,
    "extractTables": true,
    "extractImages": true,
    "detectLanguage": true,
    "summarize": true
  },
  "output": {
    "format": "json",
    "encoding": "utf-8",
    "prettyPrint": true
  }
}

使用方法

基本处理

const SmartDocumentProcessing = require('smart-document-processing');

const processor = new SmartDocumentProcessing({
  supportedFormats: ['pdf', 'docx', 'txt']
});

// 处理文档
const result = await processor.processDocument('document.pdf', {
  extractText: true,
  extractTables: true,
  summarize: true
});

文档解析

// 解析PDF文档
const pdfResult = await processor.parsePDF('document.pdf', {
  extractPages: [1, 2, 3],
  extractMetadata: true
});

// 解析Word文档
const wordResult = await processor.parseWord('document.docx', {
  extractStyles: true,
  extractComments: true
});

// 解析Excel文档
const excelResult = await processor.parseExcel('data.xlsx', {
  sheetNames: ['Sheet1', 'Sheet2'],
  includeFormulas: false
});

信息提取

// 提取关键信息
const extractedInfo = await processor.extractInformation('contract.pdf', {
  entities: ['dates', 'names', 'amounts', 'companies'],
  patterns: ['合同编号', '签订日期', '有效期']
});

// 提取表格数据
const tables = await processor.extractTables('report.docx', {
  format: 'json',
  includeHeaders: true
});

// 提取图片
const images = await processor.extractImages('presentation.pptx', {
  format: 'base64',
  quality: 80
});

内容分析

// 文本分析
const analysis = await processor.analyzeText('document.txt', {
  language: 'auto',
  sentiment: true,
  keywords: true,
  entities: true
});

// 自动摘要
const summary = await processor.summarize('long_document.pdf', {
  length: 'medium', // short, medium, long
  algorithm: 'extractive' // extractive, abstractive
});

// 文档分类
const classification = await processor.classify('document.docx', {
  categories: ['contract', 'report', 'proposal', 'manual']
});

格式转换

// PDF转Word
await processor.convertFormat('document.pdf', 'docx', {
  preserveLayout: true,
  includeImages: true
});

// Word转PDF
await processor.convertFormat('document.docx', 'pdf', {
  quality: 'high',
  security: {
    password: 'optional',
    permissions: ['print', 'copy']
  }
});

// 批量转换
await processor.batchConvert(['doc1.pdf', 'doc2.docx'], 'txt', {
  outputDir: './converted',
  overwrite: true
});

在OpenClaw中使用

@agent 解析这个PDF文档
@agent 提取合同中的关键信息
@agent 为这篇文档生成摘要
@agent 将Word文档转换为PDF
@agent 分析文档的情感倾向

API参考

构造函数

new SmartDocumentProcessing(config)

参数:

  • config.supportedFormats (array): 支持的文档格式
  • config.processing (object): 处理配置
  • config.output (object): 输出配置

核心方法

processDocument(filePath, options)

处理文档,根据选项执行多种处理任务。

parsePDF(filePath, options)

解析PDF文档。

parseWord(filePath, options)

解析Word文档。

parseExcel(filePath, options)

解析Excel文档。

extractInformation(filePath, options)

从文档中提取关键信息。

extractTables(filePath, options)

提取表格数据。

analyzeText(filePath, options)

分析文本内容。

summarize(filePath, options)

生成文档摘要。

classify(filePath, options)

文档分类。

convertFormat(inputPath, outputFormat, options)

转换文档格式。

支持格式

输入格式

  • PDF (.pdf)
  • Word (.docx, .doc)
  • Excel (.xlsx, .xls)
  • PowerPoint (.pptx, .ppt)
  • 纯文本 (.txt, .md)
  • HTML (.html, .htm)
  • 图片 (.png, .jpg, .jpeg)

输出格式

  • JSON
  • XML
  • CSV
  • Markdown
  • 纯文本
  • HTML

处理能力

文本处理

  • 字符编码检测和转换
  • 语言检测
  • 文本清理和标准化
  • 段落和句子分割

信息提取

  • 命名实体识别
  • 日期、时间提取
  • 数字、金额提取
  • 联系方式提取
  • 地址提取

内容分析

  • 情感分析
  • 关键词提取
  • 主题建模
  • 可读性分析
  • 抄袭检测

格式处理

  • 文档合并
  • 页面分割
  • 水印添加
  • 加密解密
  • 压缩解压

依赖项

  • pdf-parse: ^1.1.1
  • mammoth: ^1.6.0
  • xlsx: ^0.18.0
  • natural: ^6.0.0

开发

# 克隆仓库
git clone https://github.com/your-org/smart-document-processing.git

# 安装依赖
npm install

# 运行测试
npm test

# 启动开发服务器
npm run dev

贡献

欢迎提交Issue和Pull Request。

许可证

MIT License

版本历史

  • v1.0.0 (2026-04-22): 初始发布,基础文档处理功能

支持

如有问题,请提交Issue或联系维护团队。

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

96.89%
按下载量换算859

安全审计

VirusTotal

通过

ClawScan

可疑

Static analysis

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills