提取MCP服务器
使用提取库进行文本提取的模型上下文协议(MCP)服务器。
特性
- 从各种文件格式(PDF、DOCX、HTML、带OCR的图像、带语音转文本的音频/视频)中提取文本
- 获取文件元数据以及提取的文本
- 支持MIME类型覆盖
- 列出支持的文件格式
安装
# Install dependencies
uv pip install -e .
# Or using pip
pip install extractous-mcp用法
作为MCP服务器
# Run the server
extractous-mcp
# Or run directly
python -m extractous_mcp.server可用工具
- 提取文本
- 从文件中提取文本 - 参数: file_path (必填), mime_type (可选)
- 提取文本与元数据
- 从文件中提取文本和元数据 - 参数: file_path (必填), mime_type (可选)
- get_supported_formats
- 获取支持的文件格式列表 - 无参数
示例用法
# Extract text from PDF
extract_text("/path/to/document.pdf")
# Extract with specific MIME type
extract_text("/path/to/file", mime_type="application/pdf")
# Get text with metadata
extract_text_with_metadata("/path/to/document.docx")
# Check supported formats
get_supported_formats()支持格式
- 文件:PDF、DOC、DOCX、RTF、ODT
- 电子表格:XLS、XLSX、ODS、CSV
- 演示-PPT、PPTX、ODP
- 网络HTML、HTM、XML
- 文本:TXT、MD、JSON、YAML、YML
- 图像:JPG、JPEG、PNG、TIFF、BMP、GIF(带OCR)
- 音频:MP3、WAV、FLAC、M4A、OGG(语音转文本)
- 视频:MP4、AVI、MOV、MKV、WEBM
发展
# Install in development mode
uv pip install -e .
# Run tests
python -m pytest tests/