aitherflow知识
用于RAG(检索增强生成)知识库搜索的MCP服务器。本地嵌入,本地矢量搜索,不需要API键。
它做什么
知识库是通过以下方式创建和管理的 等待流 桌面应用程序。此MCP服务器提供对它们的读取和搜索访问。
工具
| 工具 | 说明 |
|---|---|
search_knowledge_base | 跨知识库的语义搜索——返回相关文档块 |
list_knowledge_bases | 列出所有可用的知识库 |
get_document_info | 获取特定文档的元数据 |
reindex_document | 重新嵌入和重新索引文档 |
文档解析器
- PDF --通过以下方式提取文本
pdftotext,回退到pdf-extract,扫描页面的OCR回退 - 电子出版物 --全内容提取
- TXT/Markdown --纯文本,分块嵌入
光学字符识别
扫描的PDF文件通过PP-OCR ONNX型号(拉丁文+西里尔文)进行处理。模型在首次使用时会自动下载。页面通过以下方式呈现为图像 pdftoppm,然后认出。
嵌入模型
| 型号 | 语言 | 尺寸 |
|---|---|---|
all-MiniLM-L6-v2 (默认) | 英语 | 23 MB |
multilingual-e5-small | 100多种语言 | 118 MB |
multilingual-e5-large | 100多种语言 | 560 MB |
nomic-embed-text-v1.5 | 英语 | 137 MB |
bge-m3 | 100多种语言 | 567 MB |
模型在首次使用时下载,并由ONNX运行时本地缓存。
先决条件
- 锈蚀1.75+
poppler-utils--提供pdftotext,pdftoppm,pdfinfo(PDF解析和OCR需要)
安装poppler实用程序:
# Arch / Manjaro
sudo pacman -S poppler
# Ubuntu / Debian
sudo apt install poppler-utils
# macOS
brew install poppler构建
cargo build --release在首次构建时,这将需要一段时间——fastembed和ONNX运行时是很大的依赖关系。
安装
在Claude Code中注册MCP服务器:
claude mcp add --scope user aitherflow-knowledge /path/to/target/release/aitherflow-knowledge对于Claude Desktop,添加到您的配置中:
{
"mcpServers": {
"aitherflow-knowledge": {
"command": "/path/to/target/release/aitherflow-knowledge"
}
}
}适用于任何支持stdio传输的MCP客户端。
数据位置
| 路径 | 内容 |
|---|---|
~/.local/share/aither-flow/rag/ | 知识库数据(LanceDB表、文档元数据) |
~/.local/share/aither-flow/rag/settings.json | RAG设置(嵌入模型、块大小等) |
用法
注册后,询问任何克劳德代理人:
“在我的知识库中搜索有关矢量数据库的信息”
“我的知识库中有哪些文档?”
“重新索引文件report.pdf”
