Token导航 LogoToken导航TokenDH.com
Extractous MCP logo
音视频stdio官方级别未说明来源级核验

Extractous MCP

MCP Server

Extractous MCP Server是一个基于Model Context Protocol (MCP)的文本提取服务,支持从多种文件格式(如PDF、DOCX、HTML、图像和音频/视频)中提取文本和元数据。

工具数

3

提示词数

0

GitHub Stars

2

资源数

0
文本提取文件处理Python语音音频

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

fitzlf

提供方

fitzlf

最后核验

2026/5/17 20:23

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install extractous-mcp

详细介绍

提取MCP服务器

使用提取库进行文本提取的模型上下文协议(MCP)服务器。

特性

  • 从各种文件格式(PDF、DOCX、HTML、带OCR的图像、带语音转文本的音频/视频)中提取文本
  • 获取文件元数据以及提取的文本
  • 支持MIME类型覆盖
  • 列出支持的文件格式

安装

# Install dependencies
uv pip install -e .

# Or using pip
pip install extractous-mcp

用法

作为MCP服务器

# Run the server
extractous-mcp

# Or run directly
python -m extractous_mcp.server

可用工具

  1. 提取文本

- 从文件中提取文本 - 参数: file_path (必填), mime_type (可选)

  1. 提取文本与元数据

- 从文件中提取文本和元数据 - 参数: file_path (必填), mime_type (可选)

  1. get_supported_formats

- 获取支持的文件格式列表 - 无参数

示例用法

# Extract text from PDF
extract_text("/path/to/document.pdf")

# Extract with specific MIME type
extract_text("/path/to/file", mime_type="application/pdf")

# Get text with metadata
extract_text_with_metadata("/path/to/document.docx")

# Check supported formats
get_supported_formats()

支持格式

  • 文件:PDF、DOC、DOCX、RTF、ODT
  • 电子表格:XLS、XLSX、ODS、CSV
  • 演示-PPT、PPTX、ODP
  • 网络HTML、HTM、XML
  • 文本:TXT、MD、JSON、YAML、YML
  • 图像:JPG、JPEG、PNG、TIFF、BMP、GIF(带OCR)
  • 音频:MP3、WAV、FLAC、M4A、OGG(语音转文本)
  • 视频:MP4、AVI、MOV、MKV、WEBM

发展

# Install in development mode
uv pip install -e .

# Run tests
python -m pytest tests/

目录标签

目录标签

文本提取文件处理Python语音音频本地部署OCR语音转文本元数据提取

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

3

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP