Token导航 LogoToken导航TokenDH.com
开发需要联网github未标认证来源可访问许可证需确认审计通过

pdf-vision-readerPDF vision reader 命令行

Agent Skill

pdf-vision-reader 用于处理 GitHub 仓库、Issue、Pull Request 和代码协作信息,适合在 Codex、Claude、Cursor、Gemini CLI 中需要围绕仓库状态、代码变更或协作事项进行整理时使用。可结合来源仓库、安装命令和原始 README 继续核验具体用法。安装前建议确认权限范围、维护状态,以及是否会触发联网、命令执行或文件读写。

总安装

5,949

周安装

243

GitHub Stars

公开资料未说明

下载量

1,905
CodexClaudeCursorGemini CLI

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

GitHub

来源数

2

许可证

unknown

最后核验

2026-05-01

来源状态

来源可访问

安装方式

通过对话安装

复制提示词发给支持本地命令或 Skills 的 AI 助手,先确认命令和权限,再让它执行。

请帮我安装这个 Agent Skill:pdf-vision-reader(PDF vision reader 命令行)
来源仓库:https://github.com/childbamboo/claude-code-marketplace-sample
仓库路径:skills/pdf-vision-reader
安装命令:
npx skills add https://github.com/childbamboo/claude-code-marketplace-sample --skill pdf-vision-reader
安装前请先检查当前环境是否支持对应 CLI,并向我确认将要执行的命令、安装目录、联网范围和文件读写权限;确认后再执行。

命令行安装

复制命令到本机终端执行。该命令会通过 npx skills 从第三方来源获取 Skill;本站只展示命令,不托管安装包,也不自动执行。

skills.shnpx skills
npx skills add https://github.com/childbamboo/claude-code-marketplace-sample --skill pdf-vision-reader

简介

pdf-vision-reader 将 PDF 转为图像并用 vision 解析,输出 Markdown。

  • 适合处理图表丰富的中文文档。
  • 依赖 poppler-utils 和 Python 包 pdf2image、Pillow。
  • 需确认是否允许转换文件系统和调用外部脚本。
  • 适用宿主包括 Codex、Claude、Cursor、Gemini CLI,接入前应确认版本、权限和运行环境要求。

SKILL.md

PDF Vision Reader

図表が多い PDF を画像化して、Claude の vision 機能で内容を解析・Markdown 化するスキルです。

クイックスタート

基本的な使い方

# 1. PDF を画像に変換
wsl python3 scripts/pdf_to_images.py "/mnt/c/path/to/file.pdf"

# 2. 各画像を Read ツールで読み込んで解析
# 3. Markdown 形式でまとめる

前提条件

必要なパッケージ:

# Python パッケージ
wsl pip3 install pdf2image Pillow

# システムパッケージ (poppler)
wsl sudo apt-get update
wsl sudo apt-get install -y poppler-utils

ワークフロー

ステップ1: PDF を画像に変換

wsl python3 scripts/pdf_to_images.py "/mnt/c/path/to/document.pdf"

これにより document_pages/ ディレクトリが作成され、各ページが画像として保存されます:

  • page_001.png
  • page_002.png
  • page_003.png
  • ...

ステップ2: 各画像を解析

Read ツールで各画像を順番に読み込み、内容を解析します。

解析時の指示例:

この画像の内容を詳しく説明してください:
- タイトルや見出し
- 本文テキスト
- 図表の説明
- グラフやチャートのデータ
- 重要なポイント

ステップ3: Markdown に統合

各ページの解析結果を統合して、一つの Markdown ファイルを作成します。

使用例

例1: プレゼンテーション資料を Markdown 化

User: "presentation.pdf を vision で解析して Markdown 化して"
Assistant:
1. scripts/pdf_to_images.py で PDF を画像に変換
2. 各画像を Read ツールで読み込み
3. 各ページの内容を解析(タイトル、図表、テキスト)
4. 全ページの解析結果を統合
5. Write ツールで Markdown ファイルに保存

例2: 特定のページのみ解析

User: "document.pdf の 5-10 ページだけ解析して"
Assistant:
1. PDF を画像に変換(全ページ)
2. page_005.png から page_010.png のみ Read で読み込み
3. 該当ページの内容を Markdown 化

解析の観点

自動的に抽出する情報

各ページの画像から以下を抽出:

  1. テキスト情報

- タイトル・見出し - 本文テキスト - 箇条書きリスト - 注釈・キャプション

  1. 図表

- 図の種類(フローチャート、組織図、etc.) - 図の説明・要約 - 主要な要素と関係性

  1. グラフ・チャート

- グラフの種類(棒グラフ、円グラフ、etc.) - 軸ラベル - 主要なデータポイント - トレンドや傾向

  1. テーブル

- テーブルの構造 - ヘッダー行 - データの内容 - Markdown テーブル形式に変換

  1. レイアウト・構造

- ページ全体のレイアウト - セクション分け - 強調されている情報

Markdown 出力フォーマット

# [PDFタイトル]

**解析日時:** YYYY-MM-DD
**総ページ数:** N

---

## Page 1: [ページタイトル]

### 概要
[ページの概要説明]

### 主要な内容
- [ポイント1]
- [ポイント2]

### 図表
**図1: [図のタイトル]**
[図の説明]

### テキスト内容
[ページ内のテキスト]

---

## Page 2: [ページタイトル]
...

スクリプト詳細

pdf_to_images.py

機能:

  • PDF の各ページを PNG 画像に変換
  • 解像度指定可能(デフォルト: 200 DPI)
  • 出力ディレクトリの自動作成

使い方:

python scripts/pdf_to_images.py <pdf_path> [output_dir] [dpi]

# 例
python scripts/pdf_to_images.py document.pdf ./images 300

出力:

  • [pdf_name]_pages/page_001.png
  • [pdf_name]_pages/page_002.png
  • ...

対応可能なコンテンツ

  • ✅ テキスト(日本語・英語)
  • ✅ 図表・ダイアグラム
  • ✅ グラフ・チャート
  • ✅ テーブル
  • ✅ スクリーンショット
  • ✅ インフォグラフィック
  • ✅ 複雑なレイアウト
  • ⚠️ 手書きメモ(精度は状況による)
  • ⚠️ 低解像度画像(精度低下の可能性)

テキスト抽出との違い

pdf-reader (テキスト抽出)

  • ✅ テキストのみの PDF で高速
  • ✅ 純粋なテキスト抽出
  • ❌ 図表は抽出不可
  • ❌ レイアウトは簡略化

pdf-vision-reader (画像解析)

  • ✅ 図表・グラフを理解
  • ✅ 複雑なレイアウトを保持
  • ✅ ビジュアル要素の説明
  • ⚠️ 処理時間が長い
  • ⚠️ API コスト(画像解析)

推奨される使い分け

PDF の種類推奨スキル
テキスト中心の文書pdf-reader
プレゼンテーション資料pdf-vision-reader
図表・グラフが多い資料pdf-vision-reader
技術図面・設計書pdf-vision-reader
論文(図表含む)pdf-vision-reader
単純なテキストPDFpdf-reader

トラブルシューティング

pdf2image が見つからない

wsl pip3 install pdf2image

poppler-utils が見つからない

wsl sudo apt-get update
wsl sudo apt-get install -y poppler-utils

画像変換が失敗する

  • PDF が破損していないか確認
  • ディスク容量を確認
  • メモリ不足の可能性(大きな PDF は分割処理)

解析精度が低い

  • DPI を上げる(300 推奨) python scripts/pdf_to_images.py document.pdf./images 300
  • 元の PDF の画質を確認

パフォーマンス

処理時間の目安

ページ数画像変換解析(Claude vision)合計
10ページ5秒30-60秒~1分
30ページ15秒90-180秒~3分
100ページ50秒300-600秒~10分

最適化のヒント

  1. 必要なページのみ処理

- 全ページ変換後、重要なページのみ解析

  1. DPI の調整

- 図表が多い: 300 DPI - テキスト中心: 150-200 DPI

  1. バッチ処理

- 複数 PDF を並行処理しない(順次処理)

パス変換

Windows パスから WSL パスへの変換:

  • C:\Users\.../mnt/c/Users/...
  • D:\Projects\.../mnt/d/Projects/...

関連ツール

  • pdf-reader: テキスト中心の PDF 用
  • docx-reader: Word 文書用
  • OCR ツール: pytesseract(テキスト特化)

バージョン履歴

  • v1.0.0 (2026-01-06): 初期リリース

- PDF → 画像変換機能 - Vision ベースの解析ワークフロー - 図表・グラフの理解対応 - Markdown 出力フォーマット

适合场景

01

用户想查找某类 Agent Skill 时

02

需要根据任务场景推荐可安装能力包时

03

需要对比不同来源的安装命令和来源信息时

能力概览

能力 1

按任务关键词查找相关 Skills

能力 2

展示可复制的安装命令

能力 3

保留来源站点、仓库和原始说明,方便继续核验

能力 4

展示第三方安全扫描或审计结果

安装后应在对应宿主中按原始 README 的触发条件使用;具体调用方式请以来源页面和 README 为准。

平台分布

Codex

40.65%
按下载量换算774

Claude

28.45%
按下载量换算542

Cursor

18.18%
按下载量换算346

Gemini CLI

10.07%
按下载量换算192

安全审计

Gen Agent Trust Hub

通过

Socket

通过

Snyk

通过

权限和风险

需要联网

该 Skill 可能需要联网访问来源站点、仓库或外部 API;具体网络访问范围需要结合源码和 README 复核。

安装前确认

本站仅展示第三方公开信息,不托管安装包,不提供自动安装或运行环境。安装前应自行审查源码、依赖和命令行为。当前只有一个来源,正式发布前建议补源仓库或其他目录站核验。

来源信息

继续浏览同类 Skills