🧬 MCP科学RAG(本地服务器)
  
专为以下目的设计的高性能、100%私有和本地检索增强生成(RAG)系统 科学研究基于模型上下文协议(MCP),它将您的本地机器转换为集中式AI知识库,使Claude、Cursor、, 反重力VS代码, 爱马仕代理商,或OpenClaw,从密集的技术PDF、表格和复杂的科学符号中即时搜索、提取和综合见解。
______________________________________________________________________
🔬 为什么科学家需要专门的RAG
今天的研究人员淹没在文献中,但标准的人工智能工具和通用的RAG实现在科学工作流程中根本失败了:
- PDF解析噩梦:科学论文使用复杂的多列布局、复杂的表格和繁重的数学公式。标准的提取器会把这些变成难以阅读的胡言乱语。
- 严格的数据隐私研究人员不断处理敏感的患者数据、未发表的手稿或专有化学配方。将这些上传到第三方API(如OpenAI或Anthropic云)是一个巨大的安全风险或完全违反政策的行为。
- 高上下文密度:通用嵌入模型无法区分高度细微差别的技术术语,导致语义搜索结果不佳和人工智能幻觉。
- 零散的知识:文献通常分散在数十个项目文件夹中,因此不可能随着时间的推移在不同学科之间“连接点”。
MCP科学RAG 通过提供专门的、完全本地的基础设施来解决这个问题。它使用最先进的布局感知提取器(pymupdf4llm)以及高维嵌入(nomic-embed-text 通过Ollama)为您的AI助手提供完美、安全和永久的研究记忆。
______________________________________________________________________
🚀 改进和起源
该项目是对 mcp rag本地。我们重新设计了原始架构,以满足 科学界,复杂PDF的精度和本地隐私是不可谈判的。
🔬 核心科学增强
- 最先进的提取技术(
pymupdf4llm):
- 与标准提取器不同, pymupdf4llm 将表格、公式和科学文档结构直接转换为 清除Markdown,使LLM能够以零转录错误摄取技术数据。
- 高质量嵌入(
nomic-embed-text):
- 与原生集成 奥拉玛该模型明显优于传统的轻量级模型,为密集的技术术语提供了更大的上下文窗口和更好的语义理解。
- 可移植JSON矢量数据库:
- 我们已经消除了对ChromaDB/Docker的严重依赖。通过使用原生Python JSON向量系统,该项目仍然 轻量级、快速、零配置,非常适合需要跨平台可移植性的研究人员。
- 增强的批处理:
- 原生支持同时索引多达10篇科学论文,并优化了1500个字符的分块。
🧠 架构:集中的大脑
与需要为每个项目文件夹维护单独矢量数据库的传统RAG系统不同,此MCP服务器充当 单一的全球知识库 你的整个机器。
您可以要求您的LLM为分散在计算机上的PDF(下载、研究文件夹等)建立索引,服务器将所有提取的文本和嵌入集中到一个单一的文件中 ~/.mcp/scientific-rag/simple_db.json 文件。这允许你的人工智能将你1月份读到的一篇论文中的概念与你4月份正在进行的一个完全不同的项目进行交叉引用。
+----------------------+ 1. Finds PDFs +----------------------+
| Scattered PDFs | -------------------------> | AI Assistant |
| (Project A, Dwnlds) | | (Claude/Cursor/etc) |
+----------------------+ +---------+------------+
|
2. Calls index_multiple_pdfs |
or search_knowledge |
v
+----------------------+ 3. Gets Vectors +----------------------+
| Ollama | | MCP RAG Server |
| (nomic-embed-text) | | (pymupdf4llm) |
+----------------------+ +---------+------------+
|
4. Stores / Retrieves |
v
+----------------------+
| Centralized Database |
| (simple_db.json) |
+----------------------+______________________________________________________________________
🛠️ MCP工具暴露
服务器为您的AI助手提供以下功能:
| 工具 | 说明 |
|---|---|
index_multiple_pdfs | 智能提取和矢量化多达10个本地PDF文件。 |
search_knowledge | 跨科学知识库的高精度矢量相似性搜索。 |
list_indexed_files | 本地内存中当前所有文档的清单。 |
clear_knowledge_base | 安全地擦除本地数据库。 |
memorize_text | 将任意的研究笔记、片段或发现直接存储到内存中。 |
memorize_multiple_texts | 在一次批处理操作中记住一系列文本片段或研究笔记。 |
______________________________________________________________________
⚙️ 快速开始
1.要求
2.准备嵌入模型
ollama pull nomic-embed-text3.安装
# Clone the repository
git clone https://github.com/davinson-pezo/mcp-scientific-rag.git
cd mcp-scientific-rag
# Sync dependencies
uv sync4.配置您的AI客户端
将此添加到您的MCP配置中(例如,Claude Desktop、Cursor、, 反重力VS代码, 爱马仕代理商,或OpenClaw设置):
"mcp-scientific-rag": {
"command": "uv",
"args": [
"--directory",
"/ABSOLUTE/PATH/TO/mcp-scientific-rag",
"run",
"main.py"
]
}______________________________________________________________________
🛡️ 隐私和安全
- 100%本地:没有数据离开你的机器。嵌入和搜索通过Ollama在本地处理。
- 山宁泰元数据:该系统旨在避免存储绝对的本地路径,确保您的存储库在公共共享时保持安全。
______________________________________________________________________
☕ 支持项目
如果这个工具对你的研究有帮助,你想支持它的发展,请随时给我买杯咖啡!

______________________________________________________________________
📄 许可证
此项目根据MIT许可证获得许可-请参阅 许可证 文件以获取详细信息。
