学术论文刮刀
从Semantic Scholar(226M多篇论文)和arXiv搜索和检索学术论文。以干净的JSON格式获取标题、摘要、人工智能摘要、引用计数、DOI和开放获取PDF。在一次运行中跨多个查询进行批量搜索。没有API密钥,没有浏览器,没有代理。
它有什么作用?
学术论文抓取器查询语义学者图API和arXiv API来查找、检索和分析学术文献。它将两个来源的结果统一到一个一致的模式中——无论论文来自哪里,都是相同的字段。
v1.1.0版本: 添加了批量搜索(queriesList)--在单个作业中运行多个查询,并按纸张ID自动进行重复数据删除。
谁用这个
- AI/LLM构建者 --收集特定主题的摘要、TLD和元数据,以构建RAG管道、微调模型或为研究助理提供动力,而无需手动下载论文
- 系统评价和荟萃分析团队 --在一次运行中通过多个搜索查询收集数百篇论文,进行重复数据消除并准备进行筛选
- 制药和生物技术研究人员 --绘制药物发现文献,跟踪临床试验出版物,按领域和日期范围提取基因组学论文
- 研究情报小组 --监控竞争对手和学术界发表的内容;按引文速度追踪新兴主题
- 开发人员构建研究工具 -通过REST API、Python/JS客户端或用于AI代理集成的MCP对学术文献进行编程访问
特性
- 3种刮擦模式: 关键字搜索、按ID查找论文、引文图遍历
- 批量搜索: 在一个作业中运行多个查询--结果按纸张ID进行合并和重复数据消除
- 语义学者发表2.26亿篇论文 --涵盖所有学术领域,具有引用指标和人工智能生成的TLD
- 通过arXiv预印本超过240万张 --全开放存取,最适合物理、计算机科学、数学和邻近领域
- 过滤器: 出版年份范围、研究领域、仅开放获取、arXiv类别
- 引文图: 获取引用某一作品的所有论文,或任何论文的完整参考文献列表
- 人工智能总结(TLDR): 一句话人工智能为约40%的语义学者论文生成了摘要
- 开放访问链接: 直接PDF URL(如果可用)
- 不需要API密钥 --针对公共API的开箱即用
- 无代理成本 -基于API,无浏览器渲染,无机器人程序检测问题
______________________________________________________________________
报废模式
模式1:按关键字搜索
{
"mode": "search",
"query": "transformer attention mechanism",
"yearFrom": 2020,
"openAccessOnly": true,
"maxResults": 50
}模式1b:批量搜索(v1.1.0)
在单个作业中运行多个查询--在所有查询中对结果进行合并和重复数据消除:
{
"mode": "search",
"queriesList": ["CRISPR gene editing", "base editing", "prime editing"],
"yearFrom": 2022,
"fieldsOfStudy": ["Biology"],
"maxResults": 150
}queriesList 覆盖 query 如果提供。非常适合系统评价、竞争格局分析和多主题监测。
模式2:通过ID获取纸张
通过DOI、arXiv ID、PubMed ID或Semantic Scholar ID查找任何论文。参与者会自动检测ID类型。
{
"mode": "get_paper",
"query": "10.48550/arXiv.1706.03762"
}接受的ID格式: 10.1234/... (DOI), 2301.12345 (arXiv), PMID:12345678 (PubMed),40字符十六进制(语义学者)。
模式3:引文图
获取引用给定论文的所有论文(citing),或它引用的所有论文(cited_by):
{
"mode": "citations",
"query": "1706.03762",
"citationDirection": "citing",
"yearFrom": 2023,
"maxResults": 100
}模式1c:arXiv类别搜索
{
"mode": "search",
"query": "large language models",
"source": "arxiv",
"arxivCategories": ["cs.AI", "cs.CL"],
"sortBy": "date",
"maxResults": 50
}______________________________________________________________________
输入参数
| 参数 | 类型 | 默认值 | 说明 |
|---|---|---|---|
mode | 字符串 | search | search, get_paper,或 citations |
query | string | 必填 | 关键字(搜索模式)或论文ID(获取/引用模式) |
queriesList | string\[\] | [] | 多个搜索查询--合并和重复数据消除。覆盖 query。仅搜索模式。 |
source | 字符串 | auto | auto, semantic_scholar,或 arxiv |
citationDirection | 字符串 | citing | citing (由谁引用)或 cited_by (其参考文献)。仅引用模式。 |
yearFrom | integer | -- | 筛选器:今年或之后发布 |
yearTo | integer | -- | 筛选器:今年或之前发布 |
fieldsOfStudy | string\[\] | [] | 按字段筛选: Computer Science, Medicine, Physics, Biology等等。(仅S2) |
openAccessOnly | 布尔值 | false | 仅提供带免费PDF的退回文件 |
arxivCategories | string\[\] | [] | 按arXiv类别筛选: cs.AI, cs.LG, q-bio.NC等等。(仅限arXiv来源) |
maxResults | 整数 | 100 | 最多可退回的纸张数量(1-500)。免费等级上限为25。 |
includeAbstract | 布尔值 | true | 在输出中包含完整摘要 |
includeTldr | 布尔值 | true | 包括人工智能生成的摘要(仅S2) |
includeCitationCounts | 布尔值 | true | 包括引文、参考文献和有影响力的引文计数 |
sortBy | 字符串 | relevance | relevance 或 date (最新优先) |
requestIntervalSecs | 编号 | 3.0 | API请求之间的秒数(0.5–10) |
______________________________________________________________________
输出
结果将保存到默认数据集。从“输出”选项卡下载JSON、CSV、Excel或XML格式。
纸场
| 字段 | 类型 | 描述 |
|---|---|---|
title | string | 论文标题 |
authors | string\[\] | 作者姓名 |
year | integer | 出版年份 |
publication_date | string | 完整日期(YYYY-MM-DD) |
venue | string | 会议或期刊名称 |
journal | string | 带有卷号和页码的日记 |
abstract | string | 完整摘要文本 |
tldr | string | AI生成一句话摘要(仅S2,~40%覆盖率) |
doi | string | 数字对象标识符 |
arxiv_id | string | arXiv预印本ID |
pubmed_id | string | PubMed ID |
semantic_scholar_id | string | 语义学者论文ID |
corpus_id | integer | 语义学者语料库ID |
fields_of_study | string\[\] | 学术领域(例如。 Computer Science, Medicine) |
publication_types | string\[\] | 类型: JournalArticle, Conference, Preprint等等。 |
citation_count | integer | 收到的引用总数 |
reference_count | integer | 论文中的参考文献数量 |
influential_citation_count | integer | 对引用论文有重大影响的引用 |
is_open_access | boolean | 是否有免费的全文PDF |
open_access_pdf_url | string | 直接PDF链接(如果可用) |
external_urls | object | 指向语义学者、arXiv、DOI解析器的链接 |
source | string | 哪个API提供了此结果: semantic_scholar 或 arxiv |
scraped_at | string | ISO 8601 UTC时间戳 |
输出示例
{
"schema_version": "1.0",
"type": "academic_paper",
"title": "Attention is All you Need",
"authors": ["Ashish Vaswani", "Noam Shazeer", "Niki Parmar", "Jakob Uszkoreit"],
"year": 2017,
"publication_date": "2017-06-12",
"venue": "Neural Information Processing Systems",
"journal": "",
"abstract": "The dominant sequence transduction models are based on complex recurrent or convolutional neural networks...",
"tldr": "A new simple network architecture, the Transformer, based solely on attention mechanisms, dispensing with recurrence and convolutions entirely.",
"doi": "10.48550/arXiv.1706.03762",
"arxiv_id": "1706.03762",
"pubmed_id": "",
"semantic_scholar_id": "204e3073870fae3d05bcbc2f6a8e263d9b72e776",
"corpus_id": 13756489,
"fields_of_study": ["Computer Science"],
"publication_types": ["JournalArticle", "Conference"],
"citation_count": 140000,
"reference_count": 41,
"influential_citation_count": 12000,
"is_open_access": true,
"open_access_pdf_url": "https://arxiv.org/pdf/1706.03762",
"external_urls": {
"semantic_scholar": "https://www.semanticscholar.org/paper/204e3073870fae3d05bcbc2f6a8e263d9b72e776",
"doi_url": "https://doi.org/10.48550/arXiv.1706.03762",
"arxiv_abs": "https://arxiv.org/abs/1706.03762",
"arxiv_pdf": "https://arxiv.org/pdf/1706.03762"
},
"source": "semantic_scholar",
"scraped_at": "2025-03-01T12:00:00+00:00"
}______________________________________________________________________
数据源
语义学者(默认)
- 2.26亿篇论文 横跨各个学术领域
- 引用次数、参考次数和 有影响力的引文计数
- 人工智能生成的TLDR摘要 约40%的论文
- 接受DOI、arXiv ID、PubMed ID和语义学者ID进行直接查找
- 速率限制:无API密钥时为1 req/sec(内置符合性)
arXiv
- 240万+预印本 物理、数学、计算机科学、定量生物学、金融、统计学和工程学
- 所有论文均可通过直接PDF链接公开访问
- 最适合在同行评审之前找到最新的预印本
- 类别筛选:
cs.AI,cs.LG,physics.hep-th,q-bio.NC等等。 - 无引用数据(使用Semantic Scholar获取引用指标)
何时使用每个: 使用 auto (默认)。当您指定时,它会选择Semantic Scholar进行一般查询,并选择arXiv arxivCategories.覆盖到 arxiv 当您需要预打印或特定类别的过滤时,可以明确地进行过滤。
______________________________________________________________________
成本
此演员使用 按事件付费(PPE)定价 --你只为你得到的结果付费。
- 每1000个结果0.50美元 (每篇0.0005美元)
- 无代理成本 -基于API,无需浏览器,无需住宅代理
- 免费等级:每次运行25个结果 --无需订阅
- 付费级别:每次运行最多500个结果
典型运行:100篇论文大约需要10秒。成本: $0.05.
______________________________________________________________________
MCP集成
此参与者通过Apify的托管MCP服务器作为MCP工具工作。AI代理可以直接查询学术文献,无需自定义服务器设置。
- 端点:
https://mcp.apify.com?tools=labrat011/academic-paper-scraper - 认证:
Authorization: Bearer - 运输: 流式HTTP
- 适用于: Claude桌面,光标,VS代码,Windsurf,Warp,Gemini CLI
Claude桌面/光标配置:
{
"mcpServers": {
"academic-paper-scraper": {
"url": "https://mcp.apify.com?tools=labrat011/academic-paper-scraper",
"headers": {
"Authorization": "Bearer "
}
}
}
}代理提示示例:
- “查找自2021年以来发表的关于CRISPR碱基编辑的20篇被引用最多的论文”
- “搜索关于‘检索增强生成’和‘知识图’的论文——合并结果”
- “查阅DOI 10.1038/s41586-021-03819-2的论文,并总结其主要发现”
- “哪些论文引用了‘注意力是你所需要的一切’?让我看看2023年以后引用次数排名前30位的论文”
- 在arXiv中搜索最近关于指令调优的cs.AI和cs.CL论文,按日期排序
- “收集2020年至2024年关于mRNA疫苗疗效的所有开放获取论文进行文献综述”
______________________________________________________________________
技术细节
- Python 3.12,异步
httpx.AsyncClient - 语义学者图API v1(无需证书)
- 带有XML解析的arXiv Atom API(
xml.etree.ElementTree) - 自动纸张ID检测:DOI、arXiv ID、PubMed ID、语料库ID、S2 ID
- 带可配置速率限制的分页取数
- 批量推送(25个项目)以提高内存效率
- Apify平台迁移中可恢复运行的状态持久性
______________________________________________________________________
局限性
- S2速率限制 可能会减缓大型请求。scraper遵守1个请求/秒的限制,但Semantic Scholar可能会在高峰时段进行限制——内置的指数回退重试功能可以处理这一点。
- arXiv没有引用数据。 引文计数、参考计数和TLDR摘要仅可从Semantic Scholar获得。
- TLDR覆盖率约为40%。 不适用于Semantic Scholar中的所有论文。
- arXiv上的年份过滤是客户端 -arXiv的API不支持原生年份范围,因此scraper在本地获取额外的页面和过滤器。
- 每次运行最多500个结果 -Semantic Scholar的API对未经验证的批量访问施加了实际限制。
get_paper和citations模式需要单个查询 --批量通过queriesList仅适用于搜索模式。
______________________________________________________________________
常见问题解答
我应该使用哪个来源?
使用 auto (默认设置)。设置时,它会选择Semantic Scholar进行一般搜索,并选择arXiv arxivCategories.覆盖到 arxiv 仅当您需要预印本或arXiv特定类别过滤时。
批量搜索是如何工作的?
集 queriesList 到一系列搜索词。参与者按顺序运行每个查询,并将结果合并到一个数据集中,删除语义学者论文ID、arXiv ID、DOI或标题匹配的重复项。这是系统评价(一次运行所有PICO术语)和研究监测(在计划的每日运行中跟踪多个主题)的推荐方法。
我可以按作者搜索吗?
是--在查询中包含作者姓名: "Yann LeCun deep learning"语义学者的相关性排名考虑了作者姓名。要进行精确的作者搜索,请在引号中添加姓名: "\"Yoshua Bengio\" neural networks".
我如何查找特定的论文?
使用 get_paper 具有任何标识符的模式:DOI(10.1038/...),arXiv ID(2301.12345),PubMed ID(PMID:12345678),或语义学者ID(40个字符十六进制)。演员会自动检测格式。
有什么区别 citing 和 cited_by?
citing--返回以下文件 引用 你的目标(后来谁引用了它)cited_by--返回您的目标文件 引用 (自己的参考书目)
使用 citing 寻找后续工作并衡量影响。使用 cited_by 追溯一篇论文的思想渊源。
我可以将其与Apify API一起使用吗?
对。通过Apify REST API调用参与者,轮询结果,并以JSON、CSV、Excel或XML下载。适用于Apify Python和JavaScript客户端库。
______________________________________________________________________
反馈
发现错误或有功能请求?在Apify控制台的“问题”选项卡上打开问题。
