Token导航 LogoToken导航TokenDH.com
研究检索操作浏览器clawhub未标认证来源可访问clear审计提醒

logics-parsing逻辑解析

Agent Skill

logics-parsing 用于查找、检索和筛选相关信息,适合在 OpenClaw 中需要根据关键词、任务场景或来源线索快速定位候选结果时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

1,536

周安装

64

GitHub Stars

公开资料未说明

下载量

512
OpenClaw

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

MIT-0

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:logics-parsing(逻辑解析)
来源仓库:https://github.com/smseow001/logics-parsing
安装命令:
openclaw skills install logics-parsing
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 OpenClaw 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

ClawHubOpenClaw
openclaw skills install logics-parsing

简介

阿里文档智能解析工具 - 将PDF/图片转结构化HTML。支持复杂布局、公式识别、化学结构、代码块、流程图、乐谱等。

SKILL.md

name
logics-parsing
description
阿里文档智能解析工具 - 将PDF/图片转结构化HTML。支持复杂布局、公式识别、化学结构、代码块、流程图、乐谱等。

Logics-Parsing 文档解析工具

阿里文档智能解析 v1/v2 | GitHub 1.3k ⭐ 文档图片 → 结构化 HTML | 复杂布局 | 公式识别 | 化学结构 | 代码块

一、核心定位

本技能整合阿里巴巴 Logics-Parsing 文档解析工具,核心理念:

End-to-End Document Parsing 从文档图片直接输出结构化结果,无需复杂 pipeline

二、版本对比

维度v1v2(推荐)
发布2025-092026-02
性能基础 SOTA全面领先
LogicsDocBench基准82.16
OmniDocBench基准93.23
Parsing-2.0❌ 不支持✅ 支持
结构化内容公式/化学+ 流程图/乐谱/代码

三、核心能力

3.1 支持的内容类型

类型输出格式说明
文本段落HTML <p>自动识别标题/页眉/页脚
表格HTML Table跨页表格合并
科学公式LaTeX / MathML复杂公式精准识别
化学结构SMILES 格式分子式标准化
流程图Mermaid 语法v2 新增
乐谱ABC Notationv2 新增
代码块语法高亮代码v2 新增
手写内容独立标注区分打印/手写

3.2 输出结构

<div class="content-block" category="formula" bbox="[x1,y1,x2,y2]">
  <!-- 公式内容 + 坐标 + OCR 文本 -->
</div>

每个元素包含:

  • category: 元素类型(paragraph/table/formula/figure 等)
  • bbox: 边界框坐标
  • text: OCR 识别文本

四、 Benchmarks 性能

4.1 LogicsDocBench(自建基准)

模型总体分数
Logics-Parsing-v282.16
GPT-546.0
Gemini 2.5 pro26.0
Qwen2.5VL-72B34.9
SmolDocling92.7

4.2 OmniDocBench-v1.5(公开基准)

模型总体分数
Logics-Parsing-v293.23
GPT-546.0
Gemini 2.5 pro46.0
Qwen2VL-72B35.9
Doubao-1.631.7

五、安装方式

5.1 基础安装(推荐 v2)

# 1. 克隆仓库
git clone https://github.com/alibaba/Logics-Parsing.git
cd Logics-Parsing

# 2. 创建环境(Python 3.10)
conda create -n logics-parsing python=3.10
conda activate logics-parsing

# 3. 安装依赖
pip install -r requirements.txt

# 4. 下载模型(Modelscope)
pip install modelscope
python download_model_v2.py -t modelscope

# 或从 HuggingFace
pip install huggingface_hub
python download_model_v2.py -t huggingface

5.2 快速安装(仅 v1)

conda create -n logics-parsing python=3.10
conda activate logics-parsing
pip install -r requirements.txt

# 下载模型
python download_model.py -t modelscope

六、快速开始

6.1 v2 推理命令

python3 inference_v2.py \
  --image_path PATH_TO_INPUT_IMG \
  --output_path PATH_TO_OUTPUT \
  --model_path PATH_TO_MODEL

6.2 v1 推理命令

python3 inference.py \
  --image_path PATH_TO_INPUT_IMG \
  --output_path PATH_TO_OUTPUT \
  --model_path PATH_TO_MODEL

6.3 Python API

from logics_parsing import LogicsParser

# 初始化
parser = LogicsParser(model_path="path/to/model")

# 解析文档
result = parser.parse("document.jpg")

# 输出 HTML
print(result.html)

# 输出结构化 JSON
print(result.to_json())

七、应用场景

7.1 学术文档处理

场景能力
论文 PDF 解析提取公式/表格/参考文献
化学论文SMILES 格式分子结构
数学讲义LaTeX 公式精准提取
教科书复杂布局(多栏/跨页)处理

7.2 商业文档处理

场景能力
合同解析条款表格结构化
财务报表数字表格提取
发票识别表单字段提取
报纸剪报复杂排版处理

7.3 Parsing-2.0 场景(v2 新增)

场景输出格式
流程图Mermaid 代码
乐谱ABC Notation
代码块语法高亮代码
Pseudocode结构化伪代码

八、输出示例

8.1 输入

[复杂布局学术论文图片,包含多栏文字、跨页表格、化学结构式]

8.2 结构化输出(HTML)

<div class="content-block" category="paragraph" bbox="[120,340,580,420]">
  <p>We introduce a new document parsing model...</p>
</div>

<div class="content-block" category="formula" bbox="[200,450,400,520]">
  <span class="latex">E = mc^2</span>
</div>

<div class="content-block" category="chemistry" bbox="[100,550,300,700]">
  <span class="smiles">CC(=O)OC(=O)C</span>
</div>

<div class="content-block" category="table" bbox="[50,750,600,900]">
  <table>
    <tr><td>Method</td><td>Score</td></tr>
    <tr><td>Logics-Parsing</td><td>82.16</td></tr>
  </table>
</div>

九、与其他技能关联

本技能关联技能关系
Logics-Parsingai-research-tools论文解析 + 科研自动化
Logics-Parsingbrowser-use网页内容抓取 + 解析
Logics-Parsingobsidian-handbook解析结果存入 Obsidian
Logics-Parsingmath-theory-notes数学公式识别

十、常见问题

问题解决方案
模型下载慢使用 Modelscope(国内推荐)
显存不足减小 image_size 参数
OCR 乱码检查字体配置
表格识别不准使用 v2 版本性能更优

十一、注意事项

⚠️ 注意事项:
- Python 3.10+ required
- 需要 GPU(推荐 8GB+ 显存)
- 模型文件较大(~2GB),下载需要网络
- 部分功能需要额外字体支持

十二、使用方式

触发场景

用户说「解析这篇 PDF」→ 调用 Logics-Parsing v2
用户说「提取论文公式」→ 调用 Logics-Parsing
用户说「识别化学结构式」→ SMILES 格式输出
用户说「将 PDF 转 HTML」→ 结构化 HTML 输出
用户说「解析乐谱」→ v2 Parsing-2.0 功能

组合使用

用户:「帮我把这篇论文的关键公式和表格提取出来」
→ 使用 Logics-Parsing v2 解析
→ 提取公式(LaTeX)+ 表格(HTML)
→ 存入 Obsidian 或知识库

*本技能整合阿里 Logics-Parsing 文档解析工具的完整安装与使用指南*

适合场景

01

OpenClaw 用户查找和安装 Skill 时

02

用户想查找某类 Agent Skill 时

03

需要根据任务场景推荐可安装能力包时

04

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

补充不同宿主或平台的使用分布数据

能力 5

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

OpenClaw

98.56%
按下载量换算505

安全审计

VirusTotal

可疑

ClawScan

通过

Static analysis

通过

权限和风险

操作浏览器

该 Skill 可能涉及浏览器控制能力,使用时可能读取或操作网页内容,需要在受控环境中确认权限边界。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。来源安全扫描存在 warning/failed 结果,不能写成本站确认安全。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills