Token导航 LogoToken导航TokenDH.com
开发需要联网clawhub未标认证来源可访问clear审计提醒

word-reader文字阅读器

Agent Skill

word-reader 用于整理文档、README、Markdown 和说明材料,适合在 OpenClaw 中需要把零散信息整理成结构清晰的文档时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

66,480

周安装

2,770

GitHub Stars

4

下载量

22,160
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:word-reader(文字阅读器)
来源仓库:https://github.com/xtfnhcyjpgf/word-reader
安装命令:
openclaw skills install word-reader
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install word-reader

简介

读取Word文档(.docx 和 .doc 格式)并提取文本内容。支持文档解析、表格提取、图片处理等功能。当用户需要分析Word文档内容、提取文本信息或批量处理文档时使用。

SKILL.md

name
word-reader
description
|
homepage
https://python-docx.readthedocs.io/
metadata

Word 文档读取器

使用 Python 解析 Word 文档,提取文本内容和结构化信息。

支持的功能

  • 文档文本提取 - 提取段落、标题、页眉页脚内容
  • 表格解析 - 读取表格数据并转换为结构化格式
  • 图片处理 - 提取文档中的图片信息
  • 元数据获取 - 读取文档属性(作者、标题、创建时间等)
  • 批量处理 - 支持处理多个文档

用法

基本文本提取

python3 {baseDir}/scripts/read_word.py <文件路径>

指定输出格式

# JSON 输出
python3 {baseDir}/scripts/read_word.py <文件路径> --format json

# 纯文本输出
python3 {baseDir}/scripts/read_word.py <文件路径> --format text

# Markdown 格式
python3 {baseDir}/scripts/read_word.py <文件路径> --format markdown

提取特定内容

# 只提取文本
python3 {baseDir}/scripts/read_word.py <文件路径> --extract text

# 提取表格数据
python3 {baseDir}/scripts/read_word.py <文件路径> --extract tables

# 获取文档元数据
python3 {baseDir}/scripts/read_word.py <文件路径> --extract metadata

批量处理

# 处理目录下所有 .docx 文件
python3 {baseDir}/scripts/read_word.py <目录路径> --batch

参数说明

参数说明默认值
--format输出格式(json/text/markdown)text
--extract提取内容类型(text/tables/images/metadata/all)all
--batch批量处理模式false
--output输出文件路径stdout
--encoding文本编码(utf-8/gb2312)utf-8

输出格式

JSON 格式

{
  "metadata": {
    "title": "文档标题",
    "author": "作者姓名",
    "created": "2024-01-01T10:00:00",
    "modified": "2024-01-01T12:00:00"
  },
  "text": "文档全文内容...",
  "tables": [
    [
      ["表头1", "表头2"],
      ["行1列1", "行1列2"],
      ["行2列1", "行2列2"]
    ]
  ],
  "images": [
    {
      "filename": "image1.png",
      "description": "图片描述",
      "size": "1024x768"
    }
  ]
}

Markdown 格式

# 文档标题

**作者**:作者姓名  
**创建时间**:2024-01-01 10:00:00

## 正文内容

这是文档的正文内容...

### 表格示例

| 表头1 | 表头2 |
|-------|-------|
| 行1列1 | 行1列2 |
| 行2列1 | 行2列2 |

![图片描述](image1.png)

## 图片列表

1. **image1.png** (1024x768) - 图片描述

错误处理

  • 文件不存在:显示错误信息并退出
  • 格式不支持:提示支持的文件类型
  • 权限问题:提示文件访问权限
  • 编码问题:尝试自动检测编码

示例场景

1. 查看项目文档

python3 {baseDir}/scripts/read_word.py 项目需求.docx --format markdown

2. 提取会议记录

python3 {baseDir}/scripts/read_word.py 会议记录.docx --extract text

3. 批量处理文档

python3 {baseDir}/scripts/read_word.py ./文档目录 --batch --format json --output results.json

注意事项

  • 支持 .docx 格式(Office 2007+)
  • .doc 格式需要额外依赖(如 antiword)
  • 大文档处理可能需要较长时间
  • 图片提取仅获取元数据,不包含实际图片数据
  • 表格格式可能需要手动调整

故障排除

常见问题

  1. ModuleNotFoundError: 确保已安装 python-docx
  2. PermissionError: 检查文件读取权限
  3. UnicodeDecodeError: 尝试不同的编码格式

安装依赖

pip3 install python-docx

对于 .doc 格式支持:

# Ubuntu/Debian
sudo apt-get install antiword

# macOS
brew install antiword

高级功能

自定义样式处理

脚本会自动处理以下文档元素:

  • 标题级别(H1-H6)
  • 段落样式
  • 列表项目
  • 页眉页脚
  • 文档属性

性能优化

  • 大文件流式处理
  • 内存使用优化
  • 进度显示(批量模式)

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

84.66%
按下载量换算18,761

安全审计

VirusTotal

可疑

ClawScan

可疑

Static analysis

未展示

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills