Token导航 LogoToken导航TokenDH.com
待分类需要联网github未标认证来源可访问许可证需确认审计通过

literature-parsing文献解析

Agent Skill

literature-parsing 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

282

周安装

12

GitHub Stars

44

下载量

99
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:literature-parsing(文献解析)
来源仓库:https://github.com/internscience/chemclaw
仓库路径:skills/literature-parsing
安装命令:
npx skills add https://github.com/internscience/chemclaw --skill literature-parsing
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/internscience/chemclaw --skill literature-parsing

简介

用于化学领域文献的结构化信息抽取。literature-parsing 属于待分类类 Skill,可作为该场景下的辅助能力补充。

  • 适合从 PDF 或期刊文章中提取化合物名称、反应条件与产率数据。
  • 可输出标准化表格便于后续统计分析。
  • 需处理多语言文献与化学式排版识别问题。
  • 建议人工抽样核对以确保实体识别准确率。

SKILL.md

Literature Parsing Skill

将 PDF 文献完整转换为 Markdown 文件,并自动提取所有图表和图片。使用 MinerU (opendatalab) 进行工业级高质量解析

触发条件

  • 用户提供 PDF 文件并要求转换为 Markdown
  • 提到"PDF 转 Markdown"、"文献解析"
  • 说"提取 PDF 中的图片"、"extract figures from PDF"
  • 需要批量处理多个 PDF 文件

功能特性

  • PDF → Markdown 转换 - 保留标题、段落、列表、公式等结构
  • 智能空格处理 - 自动修复中英文之间的空格
  • 图表提取 - 提取 PDF 中嵌入的真实图片
  • 表格识别 - 检测并转换表格为 Markdown 格式
  • 公式保留 - LaTeX 格式数学公式
  • 元数据提取 - 提取标题、作者等信息
  • 批量处理 - 支持同时处理多个 PDF
  • 结构化输出 - 生成组织良好的 Markdown 文档

核心技术

组件用途
MinerU工业级 PDF 解析引擎 (opendatalab)
Pipeline Backend文本提取、布局分析
OCR扫描版 PDF 文字识别

输出结构

转换后的目录结构:

output_folder/
├── document.md          # 主 Markdown 文件
├── images/              # 提取的图片
│   ├── xxx.jpg
│   ├── yyy.jpg
│   └── ...
└── document_metadata.json  # 文档元数据

使用方法

对话框中使用

将这个 PDF 转换为 Markdown
解析这篇文献,提取所有图片
PDF to Markdown with figures
批量转换这些 PDF 文件

命令行使用

# 基本转换(自动模式)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output

# 文本 PDF(速度快)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -m txt

# 扫描版 PDF(使用 OCR)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -m ocr

# 指定语言(提高 OCR 准确率)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -l en

# 使用 GPU 加速
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -d cuda

直接使用 MinerU

# 基本用法
mineru -p paper.pdf -o ./output

# 文本模式(无图片,速度快)
mineru -p paper.pdf -o ./output -m txt

# OCR 模式(扫描版)
mineru -p paper.pdf -o ./output -m ocr

# 指定语言
mineru -p paper.pdf -o ./output -l ch

# 指定设备
mineru -p paper.pdf -o ./output --device cpu

参数说明

参数简写说明默认值
--input-i输入 PDF 文件路径-
--output-o输出目录~/.openclaw/media/literature-parsing
--method-m解析方法:auto/txt/ocrauto
--lang-lOCR 语言:ch/en 等ch
--device-d设备:cpu/cudacpu
--quiet-q安静模式(输出 JSON)false

输出示例

基本转换

$ python3 scripts/literature_parsing.py -i paper.pdf -o ./output
✓ 开始处理:paper.pdf
  输出目录:./output
  解析方法:auto
  设备:cpu
✓ 处理完成:paper.pdf
  Markdown: paper.md
  图片数量:12 张
✓ 文件已整理到:./output/paper

✅ 转换完成!
📄 Markdown: ./output/paper/paper.md
🖼️  图片:./output/paper/images (12 张)
📊 元数据:./output/paper/paper_metadata.json

批量处理

# 处理目录中所有 PDF
for pdf in *.pdf; do
  python3 scripts/literature_parsing.py -i "$pdf" -o ./output
done

Markdown 输出格式

生成的 Markdown 文件结构:

# 论文标题

作者信息

# Abstract

摘要内容...

# 1. Introduction

正文内容,保留 LaTeX 公式:$E = mc^2$

![Figure 1](images/xxx.jpg)

## 2. Methods

### 2.1 Data Collection

| Column 1 | Column 2 |
|----------|----------|
| Data A   | Data B   |

![Figure 2](images/yyy.jpg)

# References

[1] Author A, et al. Title. Journal, 2023.

依赖安装

# 安装 MinerU
pip install 'mineru[all]'

# 如果遇到 numpy 版本问题
pip install 'numpy<2.0' 'pandas<3.0'

特性说明

文本提取改进

  • 智能空格修复 - 自动在中英文之间添加空格
  • 保留布局 - 使用先进的布局分析
  • 段落识别 - 自动检测段落边界
  • 标题检测 - 识别标题层级

图片提取改进

  • 嵌入图片提取 - 提取真实嵌入的图片
  • 格式保留 - 保持原始图片格式(JPG/PNG)
  • 按哈希命名 - 自动去重

公式处理

  • LaTeX 保留 - 内联公式 $...$ 和显示公式 $$...$$
  • 数学符号 - 完整保留数学符号

表格处理

  • 自动检测 - 识别 PDF 中的表格
  • Markdown 转换 - 转换为标准 Markdown 表格

注意事项

  • 自动创建目录 - 输出目录不存在时自动创建
  • 图片去重 - 使用 MD5 哈希值自动去重
  • 错误处理 - 损坏的 PDF 会跳过并报告
  • ⚠️ 扫描版 PDF - 使用 -m ocr 模式
  • ⚠️ 加密 PDF - 需要先解密
  • ⚠️ 复杂布局 - 多栏复杂排版可能影响转换质量

错误处理

错误说明解决方案
File not foundPDF 文件不存在检查文件路径
Invalid PDFPDF 格式损坏尝试修复或重新下载
Permission denied无读取权限检查文件权限
No images found未找到图片PDF 可能使用矢量图形
Timeout处理超时(>10 分钟)尝试 -m txt 模式或减小文件

与其他技能配合

与 chemical_file_converter 配合

处理化学文献时,可以:

  1. literature-parsing: 提取 PDF 中的分子结构和反应式图片
  2. chemical_file_converter: 转换提取的化学结构文件格式

与 mol_paper_renderer 配合

生成高质量论文:

  1. mol_paper_renderer: 生成出版级分子图片
  2. literature-parsing: 将包含这些图片的 PDF 转换为 Markdown

完整工作流程示例

示例 1: 单篇文献转换

# 转换单篇 PDF
python3 scripts/literature_parsing.py -i nature_paper.pdf -o ./papers/nature

# 查看结果
ls -la ./papers/nature/
# paper.md
# images/xxx.jpg ...
# paper_metadata.json

示例 2: 批量文献库处理

# 批量转换
mkdir -p ~/papers/library
for pdf in ~/downloads/*.pdf; do
  python3 scripts/literature_parsing.py -i "$pdf" -o ~/papers/library
done

示例 3: 只处理特定页面

# 使用 MinerU 直接处理
mineru -p paper.pdf -o ./output -s 0 -e 9  # 只处理前 10 页

性能优化

文本 PDF(无图片)

# 使用 txt 模式,速度更快
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -m txt

扫描版 PDF

# 使用 OCR 模式
python3 scripts/literature_parsing.py -i scanned.pdf -o ./output -m ocr

# 指定语言提高准确率
python3 scripts/literature_parsing.py -i scanned.pdf -o ./output -m ocr -l en

CPU/GPU 选择

# 使用 CPU(兼容性好)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -d cpu

# 使用 GPU(速度快,需要 CUDA)
python3 scripts/literature_parsing.py -i paper.pdf -o ./output -d cuda

输出目录白名单

重要:为了能在飞书等平台上发送生成的文件,输出目录必须在白名单内:

  • ~/.openclaw/media/
  • ~/.openclaw/workspace/
  • ~/.openclaw/agents/

本 skill 默认输出到 ~/.openclaw/media/literature-parsing/,可以直接分享!

技术细节

MinerU 优势

MinerU 是 opendatalab 开源的工业级 PDF 解析工具:

  • 📊 布局分析 - 准确识别标题、段落、表格、图片
  • 📐 公式识别 - 完整保留 LaTeX 数学公式
  • 🖼️ 图片提取 - 提取真实嵌入的图片
  • 📝 OCR 支持 - 支持扫描版 PDF
  • 🌍 多语言 - 支持 109 种语言 OCR

与之前版本对比

特性PyMuPDFMinerU
文本提取⭐⭐⭐⭐⭐⭐⭐⭐
公式保留
表格识别⭐⭐⭐⭐⭐⭐
布局分析⭐⭐⭐⭐⭐⭐⭐
OCR 支持
扫描版支持

处理流程

  1. 布局分析 - 识别页面布局、文本区域、图片区域
  2. 文本提取 - 从 PDF 中提取文本内容
  3. 公式识别 - 识别并保留 LaTeX 公式
  4. 表格识别 - 检测表格并转换为 Markdown
  5. 图片提取 - 提取嵌入的图片
  6. OCR(可选) - 对扫描版进行文字识别
  7. 格式整理 - 生成结构化的 Markdown 文档

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

35.39%
按下载量换算35

Claude

28.85%
按下载量换算29

Cursor

20.17%
按下载量换算20

Gemini CLI

9.27%
按下载量换算9

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills