Token导航 LogoToken导航TokenDH.com
kreuzberg (Richman Tan Organisation) logo
文档知识未说明官方级别未说明来源级核验

kreuzberg (Richman Tan Organisation)

MCP Server

Kreuzberg是一个高性能的多格式文档处理工具,支持56+种文件格式的文本提取、OCR处理和元数据提取,适用于多语言环境下的文档处理需求。

工具数

0

提示词数

0

GitHub Stars

0

资源数

0
文档处理高性能多语言支持

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

RichmanTanOrganisation

提供方

RichmanTanOrganisation

最后核验

2026/5/17 20:22

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

克罗伊茨贝格

从各种文件格式(56+)中提取文本和元数据,以本机速度生成嵌入和后处理,而无需GPU。

主要特点

  • 可扩展架构 –用于自定义OCR后端、验证器、后处理器和文档提取器的插件系统
  • 通晓多种语言的人 –Rust、Python、TypeScript/Node.js、Ruby、Go、Java、C#、PHP和Elixir的原生绑定
  • 56种文件格式 –PDF、Office文档、图像、HTML、XML、电子邮件、档案、8类学术格式
  • OCR支持 –Tesseract(通过本机绑定的所有语言)、EasyOCR/PaddleOCR(Python)、Guten(Node.js),可通过插件API扩展
  • 高性能 –具有原生PDFium、SIMD优化和完全并行性的Rust核心
  • 灵活部署 –用作库、CLI工具、REST API服务器或MCP服务器
  • 内存效率高 –多GB文件的流式解析器

完整的文件 | 安装指南

安装

每种语言绑定都提供了包含示例和最佳实践的全面文档。选择您的平台开始:

脚本语言:

  • python –PyPI包、异步/同步API、OCR后端(Tesseract、EasyOCR、PaddleOCR)
  • 红宝石 –RubyGems包、惯用Ruby API、本机绑定
  • PHP –Composer包,现代PHP 8.2+支持,类型安全的API
  • 灵药 –十六进制包、OTP集成、并发处理

JavaScript/TypeScript:

  • **** –Node.js/Bun的原生NAPI-RS绑定,性能最快
  • @kreuzberg/wasm –适用于浏览器的WebAssembly/Deno/Cloudflare Workers

编译语言:

  • –带有FFI绑定的Go模块,上下文感知异步
  • Java –Maven Central,外部函数和内存API
  • C –NuGet包。NET 6.0+,完全异步/等待支持

本地:

  • –核心库、灵活的功能标志、零拷贝API

容器:

  • 码头工人 –具有API、CLI和MCP服务器模式的官方图像(核心:约1.0-1.3GB,完整:约1.5-2.1GB,带LibreOffice)

命令行:

所有语言绑定都包括Linux和macOS上x86_64和aarch64架构的预编译二进制文件。

Docker:

平台支持

涵盖所有语言绑定的完整架构:

语言Linux x86_64Linux aarch64macOS ARM64Windows x64
python✅
Node.js
Ruby-
灵丹妙药
去吧✅
Java✅
C✅
PHP
锈蚀
CLI
Docker-

备注: ✅ = 可即时安装的预编译二进制文件。所有平台都经过CI测试。macOS仅支持Apple Silicon。

嵌入支持(可选)

要使用嵌入功能,请执行以下操作:

  1. 安装ONNX运行时1.22.x:

- Linux:从下载 ONNX运行时版本 (Debian软件包可能有旧版本) - macOS: brew install onnxruntime - Windows:从下载 ONNX运行时版本

  1. 在代码中使用嵌入-请参阅 嵌入指南

注: Kreuzberg需要ONNX Runtime 1.22.x版本进行嵌入。所有其他Kreuzberg功能都可以在没有ONNX Runtime的情况下工作。

支持格式

具有智能格式检测和全面元数据提取功能的8个主要类别的56种文件格式。

办公文档

类别格式功能
文字处理.docx, .odt全文、表格、图像、元数据、样式
电子表格.xlsx, .xlsm, .xlsb, .xls, .xla, .xlam, .xltm, .ods工作表数据、公式、单元格元数据、图表
演示.pptx, .ppt, .ppsx幻灯片、演讲者笔记、图像、元数据
PDF.pdf文本、表格、图像、元数据、OCR支持
电子书.epub, .fb2章节、元数据、嵌入式资源

图像(启用OCR)

类别格式功能
光栅.png, .jpg, .jpeg, .gif, .webp, .bmp, .tiff, .tifOCR、表格检测、EXIF元数据、维度、颜色空间
高级.jp2, .jpx, .jpm, .mj2, .pnm, .pbm, .pgm, .ppmOCR、表格检测、特定格式元数据
矢量.svgDOM解析、嵌入文本、图形元数据

网络和数据

类别格式功能
标记.html, .htm, .xhtml, .xml, .svgDOM解析、元数据(开放图、推特卡)、链接提取
结构化数据.json, .yaml, .yml, .toml, .csv, .tsv模式检测、嵌套结构、验证
文本和Markdown.txt, .md, .markdown, .rst, .org, .rtfCommonMark、GFM、重构文本、组织模式

电子邮件和档案

类别格式功能
电子邮件.eml, .msg页眉、正文(HTML/纯文本)、附件、线程
档案.zip, .tar, .tgz, .gz, .7z文件列表、嵌套档案、元数据

学术与科学

类别格式功能
引用.bib, .biblatex, .ris, .enw, .csl书目解析、引文提取
科学的.tex, .latex, .typst, .jats, .ipynb, .docbookLaTeX、Jupyter笔记本、PubMed JATS
文档.opml, .pod, .mdoc, .troff技术文件格式

完整格式参考→

主要特点

OCR with Table Extraction

多个OCR后端(Tesseract、EasyOCR、PaddleOCR),具有智能表格检测和重建功能。使用可配置的精度阈值从扫描的文档和图像中提取结构化数据。

OCR后端文档→

Batch Processing

以可配置的并行方式同时处理多个文档。通过自动资源管理优化大规模文档处理工作负载的吞吐量。

批处理指南→

Password-Protected PDFs

通过单次或多次密码尝试处理加密的PDF。支持RC4和AES加密,并具有自动回退策略。

PDF配置→

Language Detection

使用快速语言检测对提取的文本进行自动语言检测。配置置信阈值和每种语言的访问统计信息。

语言检测指南→

Metadata Extraction

从所有支持的格式中提取全面的元数据:作者、标题、创建日期、页数、EXIF数据和特定于格式的属性。

元数据指南→

文档

贡献

欢迎投稿!看 贡献.md 作为指导方针。

许可证

MIT许可证-请参阅 许可证 了解详情。您可以在商业和闭源产品中自由使用克罗伊茨贝格,没有义务,没有病毒效应,也没有许可限制。

目录标签

目录标签

文档处理高性能多语言支持本地部署OCR元数据提取

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP