Token导航 LogoToken导航TokenDH.com
Anything To Md logo
文档知识stdio官方级别未说明来源级核验

Anything To Md

MCP Server

Anything-to-MD 是一个将多种格式文件(PDF、Office、图片、音视频等)转换为结构化Markdown的工具,适用于AI处理、知识管理和内容索引。

工具数

4

提示词数

0

GitHub Stars

12

资源数

0
PythonClaude文档处理ClaudeCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

1596941391qq

提供方

1596941391qq

最后核验

2026/5/17 20:19

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install -e .

详细介绍

Anything-to-MD

把任何文件变成 AI 能吃的 Markdown。PDF、Office、图片、音视频、YouTube — 一个命令搞定。
anything-to-md file report.pdf -o ./output

为什么需要这个

LLM 不吃 PDF,不吃 PPT,不吃视频。但你的知识全在这些格式里。

Anything-to-MD 是一个统一转换层:原始多模态输入 → 结构化、可索引、可总结的 Markdown

三种使用方式,同一套引擎:

方式场景
CLI本地命令行,单文件或批量
MCP ServerClaude Code / Cursor / AionUI 等 MCP 客户端直接调用
SkillAgent 工作流中作为可复用能力

架构

输入文件
  │
  ├─ PDF ──→ MinerU (OCR级) ──→ MarkItDown ──→ pypdf
  │          布局检测+表格识别     文本提取        纯文本兜底
  │          图片提取+公式识别
  │
  ├─ Office (DOCX/XLSX/PPTX) ──→ MarkItDown ──→ openpyxl 兜底
  │
  ├─ 图片 ──→ MarkItDown + OCR 插件
  │
  ├─ 视频 ──→ VideoRouter (智能路由)
  │     │
  │     ├─ PROBE: 探测字幕轨/音频轨/画面文字
  │     ├─ DECIDE: 选择最优策略
  │     ├─ EXTRACT: 字幕提取 / faster-whisper / 关键帧OCR
  │     └─ FUSE: 时间轴对齐 + 内容去重
  │
  ├─ 音频 ──→ faster-whisper 转写
  │
  ├─ YouTube ──→ yt-dlp 字幕/转写
  │
  └─ HTML/EPUB/CSV/JSON/XML ──→ MarkItDown
                                      │
                                      ▼
                              结构化 Markdown 输出

每种格式都有多级降级链。上游失败,自动切下游,不丢内容。

PDF 三级引擎

这是核心差异化能力。大多数工具只有一个 PDF 后端,遇到扫描件或中文图文混排就歇菜。

优先级引擎能力适用场景
1MinerUOCR + 布局检测 + 表格识别 + 图片提取扫描件、中文/CJK、PPT导出、图文混排
2MarkItDown快速文本提取纯文本 PDF、英文文档
3pypdf基础文本提取最后兜底

MinerU 首次运行会下载 ~2GB 模型(后续秒开)。如果你的 PDF 是纯文本英文,MarkItDown 就够了;但凡涉及中文、扫描件、表格 — MinerU 是质的飞跃。

视频智能路由(NEW)

视频不是简单的"转写"就完事。很多视频(教程、PPT录屏、带字幕的讲座)的核心信息在画面上。

4 阶段流水线

PROBE → DECIDE → EXTRACT → FUSE

Phase 1: PROBE ( 音频 > OCR

关键优化

不要 OCR 每一帧。场景检测 + 感知哈希把 1 小时视频从 ~108,000 帧降到 50-200 关键帧。

安装

方式一:一键安装(推荐)

Linux / macOS:

git clone https://github.com/1596941391qq/anything-to-md.git
cd anything-to-md
chmod +x install.sh
./install.sh

Windows (PowerShell):

git clone https://github.com/1596941391qq/anything-to-md.git
cd anything-to-md
Set-ExecutionPolicy -Scope Process -ExecutionPolicy Bypass
.\install.ps1

安装脚本会:

  1. 创建独立虚拟环境
  2. 安装基础依赖
  3. 询问是否安装 PDF 增强(MinerU)
  4. 询问是否安装视频支持
  5. 验证安装

方式二:手动安装

# 基础安装(纯文本 PDF、Office、HTML、JSON 等)
pip install -e .

# PDF 增强(中文 PDF、扫描件、表格)
pip install -e ".[pdf]"

# 视频处理支持
pip install -e ".[video]"

# 完整安装(所有功能)
pip install -e ".[full]"

外部依赖

功能依赖安装方法
视频处理ffmpegbrew install ffmpeg / apt install ffmpeg / winget install ffmpeg
PDF OCRMinerU 模型 (~2GB)首次运行自动下载

常见问题

NumPy 兼容性:

pip install "numpy<2.0"  # 避免 ABI 兼容问题

PyTorch CUDA 问题:

# faster-whisper CUDA DLL 加载失败时,自动降级到 openai-whisper
pip install openai-whisper

CLI

# 单文件转换
anything-to-md file document.pdf -o ./output

# 目录批量转换(保持目录结构)
anything-to-md dir ./my-docs ./my-mds --report

# YouTube 视频转写
anything-to-md youtube "https://www.youtube.com/watch?v=..."

# 查看支持的格式
anything-to-md formats

MCP Server

# 直接启动
anything-to-md-mcp

# 或
python -m anything_to_md.mcp_server

Claude Code 配置:

{
  "mcpServers": {
    "anything-to-md": {
      "type": "stdio",
      "command": "python",
      "args": ["-m", "anything_to_md.mcp_server"]
    }
  }
}

MCP 提供 4 个工具:

  • convert_file_to_markdown — 单文件转换
  • convert_directory_to_markdown — 批量转换
  • convert_youtube_to_markdown — YouTube 转写
  • get_supported_formats — 查看支持格式

支持格式

类别格式
文档PDF, DOCX, XLSX, PPTX, ODT, ODS, ODP
网页HTML, HTM, XHTML
电子书EPUB, MOBI
数据CSV, TSV, JSON, XML
图片PNG, JPG, GIF, BMP, TIFF, WEBP (OCR)
音频MP3, WAV, M4A, FLAC, OGG, AAC
视频MP4, MKV, AVI, MOV, WEBM
URLYouTube, Wikipedia, RSS

Roadmap

  • [ ] GPU 加速支持(CUDA/Metal)
  • [ ] 并行批处理
  • [ ] 更多 OCR 引擎(EasyOCR, Tesseract)

致谢 / Acknowledgments

本项目基于以下优秀开源项目构建:

项目用途链接
MarkItDown核心文档转换引擎
MinerU (magic-pdf)PDF OCR + 布局检测 + 表格识别
Video Insight视频智能路由设计灵感Claude Code Skill
faster-whisper高效音频转写
RapidOCR中英文 OCR 引擎
PySceneDetect视频场景检测
imagehash感知哈希去重

特别感谢这些项目的作者和贡献者,让文档转换变得更简单。

License

MIT

目录标签

目录标签

PythonClaude文档处理文件转换本地部署Markdown生成多模态处理OCR视频转写

支持客户端

ClaudeCursor

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

4

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP