新皮质学者
一个组成部分 新 科蒂卡 --用于学术论文搜索、获取、阅读和参考探索的MCP服务器。
工具
| 工具 | 说明 |
|---|---|
paper_searching | 使用arXiv、Semantic Scholar和Unpaywall的元数据丰富Google Scholar结果 |
paper_fetching | 以markdown:cache格式获取整篇论文→ 本地PDF→ arxiv2md(→arxiv PDF回退)→ MinerU |
paper_content | 按标题读取缓存的纸张标记(本地,无网络) |
paper_reference | 通过Semantic Scholar API获取论文参考,回退到markdown解析 |
paper_reading | 通过LLM代理(Keshav方法)使用人工智能驱动的三通纸阅读器 |
设置
npm install
cp .mcp.example.json .mcp.json
# Fill in your API keys in .mcp.json用法
npm run mcp # Start MCP server (stdio transport)
npm test # Run tests
npm run build # Compile TypeScript环境变量
配置于 .mcp.json 在...之下 neocortica-scholar 服务器的 env 现场。看 .mcp.example.json 对于模板。
| 变量 | 目的 | 必填 |
|---|---|---|
MINERU_TOKEN | MinerU PDF→API降价 | 是 |
EMAIL | Unpaywall OA PDF查找 | 是 |
NEOCORTICA_CACHE | 缓存目录(默认: .cache/) | 没有 |
OPENAI_API_KEY | 用于纸张读取的LLM API密钥 | 用于纸张读取 |
OPENAI_BASE_URL | LLM API基础URL | 用于纸张读取 |
OPENAI_MODEL | 用于paper_reading的LLM模型(默认值: openai/gpt-oss-120b) | 没有 |
建筑
典型的工作流程从通过外部Apify MCP服务器抓取Google Scholar开始,然后通过以下方式处理论文 paper_searching → paper_fetching。一旦取回,文件可以通过以下方式阅读 paper_content,他们的参考文献通过 paper_reference,或通过以下方式进行深入分析 paper_reading.
纸张归档
使用开放获取元数据丰富原始Google学术搜索结果。优先级:arXiv标题搜索→ 语义学者标题搜索→ 未付款DOI查询。如果A arxivUrl 如果输入中已经存在,则跳过富集。
纸张蚀刻
使用多个回退源将全文文本作为标记提取。首先检查缓存,然后尝试本地PDF(通过MinerU)、arxiv2md转换、通过MinerU的arxiv PDF(当arxiv2dd失败时回退),最后通过MinerU尝试OA PDF URL。使用时 pdfPath,title和normalizedTitle是从文件名自动导出的。
论文参考
检索论文的所有参考文献。主路径使用具有的语义学者API s2Id, ARXIV:id,或 DOI:id当没有可用的标识符时,返回到从缓存的markdown解析References部分。
已知限制
- arxiv2md:有些arXiv论文无法转换(复杂的LaTeX,非常长的论文)。通过MinerU回到arxiv PDF。
- 通过MinerU访问oaPdfUrl:来自Unpaywall/SS的URL是DOI重定向(
doi.org/...)可能会解析为HTML登录页或付费墙,而不是实际的PDF,导致MinerU提取失败。
