Token导航 LogoToken导航TokenDH.com
MCP Scientific Rag logo
文档知识未说明官方级别未说明来源级核验

MCP Scientific Rag

MCP Server

MCP科学RAG是一个高性能、完全私有的本地检索增强生成系统,专为科学研究设计,支持从复杂科学PDF中提取、搜索和合成信息。

工具数

6

提示词数

0

GitHub Stars

0

资源数

0
PythonClaude隐私保护Claude DesktopClaudeCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

davinson-pezo

提供方

davinson-pezo

最后核验

2026/5/17 20:20

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

🧬 MCP科学RAG(本地服务器)

![License: MIT](https://opensource.org/licenses/MIT) ![Python 3.12](https://www.python.org/downloads/release/python-3120/) ![Model Context Protocol](https://modelcontextprotocol.io/)

专为以下目的设计的高性能、100%私有和本地检索增强生成(RAG)系统 科学研究基于模型上下文协议(MCP),它将您的本地机器转换为集中式AI知识库,使Claude、Cursor、, 反重力VS代码, 爱马仕代理商,或OpenClaw,从密集的技术PDF、表格和复杂的科学符号中即时搜索、提取和综合见解。

______________________________________________________________________

🔬 为什么科学家需要专门的RAG

今天的研究人员淹没在文献中,但标准的人工智能工具和通用的RAG实现在科学工作流程中根本失败了:

  1. PDF解析噩梦:科学论文使用复杂的多列布局、复杂的表格和繁重的数学公式。标准的提取器会把这些变成难以阅读的胡言乱语。
  2. 严格的数据隐私研究人员不断处理敏感的患者数据、未发表的手稿或专有化学配方。将这些上传到第三方API(如OpenAI或Anthropic云)是一个巨大的安全风险或完全违反政策的行为。
  3. 高上下文密度:通用嵌入模型无法区分高度细微差别的技术术语,导致语义搜索结果不佳和人工智能幻觉。
  4. 零散的知识:文献通常分散在数十个项目文件夹中,因此不可能随着时间的推移在不同学科之间“连接点”。

MCP科学RAG 通过提供专门的、完全本地的基础设施来解决这个问题。它使用最先进的布局感知提取器(pymupdf4llm)以及高维嵌入(nomic-embed-text 通过Ollama)为您的AI助手提供完美、安全和永久的研究记忆。

______________________________________________________________________

🚀 改进和起源

该项目是对 mcp rag本地。我们重新设计了原始架构,以满足 科学界,复杂PDF的精度和本地隐私是不可谈判的。

🔬 核心科学增强

  1. 最先进的提取技术(pymupdf4llm):

- 与标准提取器不同, pymupdf4llm 将表格、公式和科学文档结构直接转换为 清除Markdown,使LLM能够以零转录错误摄取技术数据。

  1. 高质量嵌入(nomic-embed-text):

- 与原生集成 奥拉玛该模型明显优于传统的轻量级模型,为密集的技术术语提供了更大的上下文窗口和更好的语义理解。

  1. 可移植JSON矢量数据库:

- 我们已经消除了对ChromaDB/Docker的严重依赖。通过使用原生Python JSON向量系统,该项目仍然 轻量级、快速、零配置,非常适合需要跨平台可移植性的研究人员。

  1. 增强的批处理:

- 原生支持同时索引多达10篇科学论文,并优化了1500个字符的分块。

🧠 架构:集中的大脑

与需要为每个项目文件夹维护单独矢量数据库的传统RAG系统不同,此MCP服务器充当 单一的全球知识库 你的整个机器。

您可以要求您的LLM为分散在计算机上的PDF(下载、研究文件夹等)建立索引,服务器将所有提取的文本和嵌入集中到一个单一的文件中 ~/.mcp/scientific-rag/simple_db.json 文件。这允许你的人工智能将你1月份读到的一篇论文中的概念与你4月份正在进行的一个完全不同的项目进行交叉引用。

+----------------------+        1. Finds PDFs       +----------------------+
|   Scattered PDFs     | -------------------------> |    AI Assistant      |
| (Project A, Dwnlds)  |                            | (Claude/Cursor/etc)  |
+----------------------+                            +---------+------------+
                                                              |
                                 2. Calls index_multiple_pdfs |
                                      or search_knowledge     |
                                                              v
+----------------------+        3. Gets Vectors     +----------------------+
|        Ollama        |  |   MCP RAG Server     |
|  (nomic-embed-text)  |                            |  (pymupdf4llm)       |
+----------------------+                            +---------+------------+
                                                              |
                                        4. Stores / Retrieves |
                                                              v
                                                    +----------------------+
                                                    | Centralized Database |
                                                    |  (simple_db.json)    |
                                                    +----------------------+

______________________________________________________________________

🛠️ MCP工具暴露

服务器为您的AI助手提供以下功能:

工具说明
index_multiple_pdfs智能提取和矢量化多达10个本地PDF文件。
search_knowledge跨科学知识库的高精度矢量相似性搜索。
list_indexed_files本地内存中当前所有文档的清单。
clear_knowledge_base安全地擦除本地数据库。
memorize_text将任意的研究笔记、片段或发现直接存储到内存中。
memorize_multiple_texts在一次批处理操作中记住一系列文本片段或研究笔记。

______________________________________________________________________

⚙️ 快速开始

1.要求

2.准备嵌入模型

ollama pull nomic-embed-text

3.安装

# Clone the repository
git clone https://github.com/davinson-pezo/mcp-scientific-rag.git
cd mcp-scientific-rag

# Sync dependencies
uv sync

4.配置您的AI客户端

将此添加到您的MCP配置中(例如,Claude Desktop、Cursor、, 反重力VS代码, 爱马仕代理商,或OpenClaw设置):

"mcp-scientific-rag": {
  "command": "uv",
  "args": [
    "--directory",
    "/ABSOLUTE/PATH/TO/mcp-scientific-rag",
    "run",
    "main.py"
  ]
}

______________________________________________________________________

🛡️ 隐私和安全

  • 100%本地:没有数据离开你的机器。嵌入和搜索通过Ollama在本地处理。
  • 山宁泰元数据:该系统旨在避免存储绝对的本地路径,确保您的存储库在公共共享时保持安全。

______________________________________________________________________

☕ 支持项目

如果这个工具对你的研究有帮助,你想支持它的发展,请随时给我买杯咖啡!

![PayPal](https://www.paypal.com/donate?business=davinson@gmail.com&no_recurring=0&item_name=Scientific+RAG+Support&currency_code=EUR)

______________________________________________________________________

📄 许可证

此项目根据MIT许可证获得许可-请参阅 许可证 文件以获取详细信息。

目录标签

目录标签

PythonClaude隐私保护本地RAG本地部署科学PDF解析知识管理AI辅助研究

支持客户端

Claude DesktopClaudeCursor

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

6

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP