纸童子军
个人AI研究论文摄取和评分管道。Paper Scout监控arXiv、Semantic Scholar和Hugging Face Daily Papers进行新的研究,使用本地嵌入(无LLM调用)根据您的兴趣档案对论文进行评分,并将候选人存储在MongoDB中,以便通过Claude Desktop或Cowork中的MCP工具进行审查。
两半:
- 自动化流水线 --每天按计划获取论文,对其进行评分,并将候选人写入MongoDB。在Fly.io(或Docker运行的任何地方)上运行。
- MCP服务器 --克劳德用来审查候选人、评估重要性、管理兴趣档案的工具。在您的计算机上本地运行。
运作原理
Paper Scout每天在设定的时间:
- 从arXiv(跨您选择的类别)、语义学者趋势和HF日报中提取新论文
- 对以前看过的论文进行重复删除
- 使用五个加权信号对每篇论文进行评分(0.0-1.0):
| 信号 | 默认权重 | 来源 |
|---|---|---|
| 嵌入相似性 | 0.45 | 标题+摘要与您的兴趣简介主题 |
| 关键字匹配 | 0.15 | 在标题/摘要中找到的关键字 |
| 引文和作者信号 | 0.20 | 语义学者引文计数,h指数 |
| 社区信号 | 0.10 | HF日报赞成票 |
| 最近奖励 | 0.10 | 在获取窗口内线性衰减 |
- 超过候选人阈值的论文将被存储为候选人供您审阅
- 您可以使用MCP工具在Claude Desktop/Cowork中查看它们
设置
先决条件
- Python 3.12+
- MongoDB(本地或 Atlas免费套餐)
1.克隆并安装
git clone https://github.com/jonradoff/paper-scout.git
cd paper-scout
python -m venv .venv
source .venv/bin/activate
pip install -e ".[mcp]"2.配置
cp .env.example .env编辑 .env 使用您的设置:
MONGODB_URI(必填)--您的MongoDB连接字符串。本地mongodb://localhost:27017作品,或使用Atlas:mongodb+srv://user:pass@cluster.mongodb.net/S2_API_KEY(可选)-- 语义学者API密钥 为了获得更好的引用数据和速率限制HF_TOKEN(可选)-- 拥抱脸令牌 获取每日报纸
所有评分权重、日程安排、arXiv类别和其他设置都可以在中配置 .env。参见 .env.example 查看完整列表。
3.自定义您的兴趣档案
编辑 interest_profile/seed.json 以反映您的研究兴趣:
topics--您所关心的内容的自然语言描述(这些内容被嵌入以进行语义匹配)keywords.high_weight--强烈表明相关性的术语keywords.medium_weight--适度相关的术语keywords.low_weight--松散相关的术语tracked_labs--论文被引用信号增强的机构tracked_authors--值得关注的特定作者
默认配置文件涵盖了AI代理、MCP、LLM和AI安全。用你自己的兴趣取而代之。
4.播种轮廓
这将为您的主题生成嵌入,并将所有内容存储在MongoDB中:
python scripts/seed_profile.py第一次运行将嵌入模型(~80MB)下载到 ./model_cache/.
5.单次运行测试
python scripts/run_once.py这会获取论文,对其进行评分,并打印出最优秀的候选人。使用此功能验证一切是否正常,并调整您的阈值。
6.连接到克劳德桌面/协作
将Paper Scout MCP服务器添加到您的Claude Desktop配置中。
macOS: ~/Library/Application Support/Claude/claude_desktop_config.json 窗户: %APPDATA%\Claude\claude_desktop_config.json
添加(或合并到) mcpServers 章节:
{
"mcpServers": {
"paper-scout": {
"command": "/path/to/your/python",
"args": ["-m", "mcp_server.server"],
"cwd": "/path/to/paper-scout",
"env": {
"PYTHONPATH": "/path/to/paper-scout/src",
"MONGODB_URI": "your-mongodb-connection-string",
"DB_NAME": "paper_scout",
"MODEL_CACHE_DIR": "/path/to/paper-scout/model_cache"
}
}
}
}用实际值替换路径:
command--你的venv中的Python(例如。,/path/to/paper-scout/.venv/bin/python)cwd--纸侦察项目目录PYTHONPATH--thesrc/paper scout内的目录MONGODB_URI--与您的连接字符串相同.envMODEL_CACHE_DIR--其中缓存了嵌入模型
重新启动Claude Desktop以获取新的MCP服务器。
7.使用它
在Claude Desktop或Cowork中,请Claude致电 get_todays_papers --它将通过可点击的arXiv链接调出你的评分候选人。从那里:
- 钻入: 让克劳德打电话来
get_paper_detail或assess_significance在任何纸张上 - 管理:
update_paper_status将论文标记为已审阅、共享或已驳回 - 分享:
generate_summary_context为了了解写论文的背景,那么record_share记录它 - 搜索:
search_papers用于在所有存储的论文中进行全文搜索 - 调音:
get_interest_profile和update_interest_profile随着时间的推移,发展你的兴趣
MCP工具
| 工具 | 说明 |
|---|---|
get_todays_papers | 今天的候选人按分数排序 |
get_paper_detail | 特定论文的全部细节 |
assess_significance | 评估论文重要性的背景 |
generate_summary_context | 平台的论文细节+过去的例子 |
update_paper_status | 将候选人标记为已审核/共享/已解雇 |
record_share | 使用所使用的摘要记录共享 |
search_papers | 在所有存储的论文中进行全文搜索 |
get_interest_profile | 查看当前兴趣档案 |
update_interest_profile | 添加/删除主题、关键字、实验室、作者 |
get_pipeline_status | 管道运行统计数据和计划信息 |
运行调度程序
对于日常自动化运行,启动调度程序:
python -m paper_scout.scheduler默认情况下,它在东部时间早上5:00运行,启动后也会立即运行一次。在中配置计划 .env:
SCHEDULE_CRON_HOUR=5
SCHEDULE_CRON_MINUTE=0
SCHEDULE_TIMEZONE=America/New_York部署到Fly.io(可选)
如果你想让管道在云中运行,而不是在你的机器上运行:
# Edit fly.toml — change the app name to yours
fly launch --no-deploy
fly volumes create model_cache --size 2 --region ewr
fly secrets set MONGODB_URI="mongodb+srv://..." S2_API_KEY="..." HF_TOKEN="..."
fly deployDockerfile使用仅限CPU的PyTorch来保持镜像较小(约1.4GB,而CUDA为约4GB)。
MCP服务器仍然在您的机器上本地运行——它只是从云管道写入的同一MongoDB数据库中读取数据。
项目结构
paper-scout/
├── src/
│ ├── paper_scout/ # Ingestion pipeline
│ │ ├── config.py # Settings from env vars
│ │ ├── db.py # MongoDB connection + indexes
│ │ ├── models.py # Pydantic data models
│ │ ├── pipeline.py # Fetch -> dedupe -> score -> store
│ │ ├── scheduler.py # APScheduler cron entry point
│ │ ├── sources/ # arXiv, Semantic Scholar, HF
│ │ └── scoring/ # Embeddings, signals
│ └── mcp_server/ # MCP tools for Claude
├── interest_profile/ # Your interest profile (customize this)
├── scripts/ # One-shot runners
├── Dockerfile # CPU-only PyTorch build
├── fly.toml # Fly.io config
├── .env.example # All configuration options
└── LICENSE许可证
MIT许可证。版权所有(c)2026 Metavert LLC。参见 许可证.
