Token导航 LogoToken导航TokenDH.com
Pageindex Light MCP logo
文档知识未说明官方级别未说明来源级核验

Pageindex Light MCP

MCP Server

PageIndex Light MCP是一款基于MCP协议的智能PDF搜索工具,通过LLM推理实现类人类的文档导航和搜索功能。

工具数

2

提示词数

0

GitHub Stars

2

资源数

0
Python文档处理知识管理

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

BukeLy

提供方

BukeLy

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

页面索引灯MCP

![Python](https://python.org) ![FastMCP](https://github.com/jlowin/fastmcp) ![MCP](https://modelcontextprotocol.io) ![License](LICENSE)

通过MCP进行代理PDF搜索——灵感来自 页码

*无向量、基于推理的文档检索,像人类一样思考*

______________________________________________________________________

概述

页面索引灯MCP带来 代理搜索 通过模型上下文协议将功能添加到PDF文档中。它利用LLM推理进行智能的、类似人类的文档导航,而不是传统的向量相似性。

特性

  • 代理搜索 --基于LLM的文档结构语义搜索
  • MCP采样 --原生MCP协议采样支持
  • LLM回退 --非采样客户端自动回退到OpenAI兼容API
  • OCR回退 --扫描PDF的自动OCR

工具

工具说明
get_index获取支持语义搜索的PDF索引
get_detail检索特定页面的详细内容

运作原理

flowchart TB
    subgraph Input
        A[PDF File] --> B{Text Extraction}
    end

    subgraph TextExtraction["Text Extraction"]
        B -->|Success| C[Raw Text]
        B -->|Empty/Minimal| D{OCR Configured?}
        D -->|Yes| E[Vision LLM OCR]
        D -->|No| C
        E --> C
    end

    subgraph Indexing
        C --> F[LLM Summarization]
        F -->|Per Page| G[Page Summaries]
        G --> H[(Cached Index)]
    end

    subgraph Search["Agentic Search"]
        I[User Query] --> J{Has Query?}
        J -->|No| K[Return Full Index]
        J -->|Yes| L[LLM Reasoning]
        H --> L
        L --> M[Ranked Results]
    end

    subgraph LLMProvider["LLM Provider"]
        N{MCP Sampling?}
        N -->|Supported| O[MCP Client LLM]
        N -->|Not Supported| P[Fallback LLM API]
    end

    F -.-> N
    L -.-> N

快速开始

克劳德桌面/克劳德代码

添加到MCP配置中:

{
  "mcpServers": {
    "pageindex": {
      "command": "uv",
      "args": ["run", "--directory", "/path/to/pageindex-light-mcp", "server.py"],
      "env": {
        "PAGEINDEX_LLM_BASE_URL": "https://api.openai.com/v1",
        "PAGEINDEX_LLM_API_KEY": "sk-xxx",
        "PAGEINDEX_LLM_MODEL": "gpt-4o-mini",
        "PAGEINDEX_OCR_BASE_URL": "https://api.openai.com/v1",
        "PAGEINDEX_OCR_API_KEY": "sk-xxx",
        "PAGEINDEX_OCR_MODEL": "gpt-4o-mini"
      }
    }
  }
}

环境变量

这两种配置都是 可选且独立:

变量目的必填
PAGEINDEX_LLM_*非采样MCP客户端的回退可选
PAGEINDEX_OCR_*扫描PDF的回退(当文本提取失败时)可选
# LLM Config — Used when MCP client doesn't support Sampling
PAGEINDEX_LLM_BASE_URL=https://api.openai.com/v1
PAGEINDEX_LLM_API_KEY=sk-xxx
PAGEINDEX_LLM_MODEL=gpt-4o-mini

# OCR Config — Used when PDF text extraction returns empty/minimal content
PAGEINDEX_OCR_BASE_URL=https://api.openai.com/v1
PAGEINDEX_OCR_API_KEY=sk-xxx
PAGEINDEX_OCR_MODEL=gpt-4o-mini  # Any vision-capable model

许可证

麻省理工学院

目录标签

目录标签

Python文档处理知识管理PDF搜索本地部署智能推理文档导航OCR支持MCP协议

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

2

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP