RNA数据集搜索-MCP服务器
  
用于从数据库中搜索和访问RNA测序数据集的模型上下文协议(MCP)服务器 欧洲核苷酸档案馆(ENA)查找公开可用的批量RNA-seq和单细胞RNA-seq数据集,以验证研究假设或复制已发表的分析。
优化:支持批量、单细胞和空间转录组学的人类和小鼠疾病相关RNA-seq研究。
特性
- 以疾病为重点的搜索:按疾病、生物体和组织类型查找数据集
- 先进技术过滤:
- 简单预设:批量、单细胞、小rna、核糖序列、rna全部 - 粒度控制:通过50多种文库策略(RNA-Seq、miRNA-Seq、ChIP-Seq、ATAC-Seq等)进行筛选 - 源过滤:转录、基因组、代谢等。
- 常见生物体名称:使用“人类”、“老鼠”、“大鼠”代替学名
- 下载支持:生成用于下载FASTQ文件的wget/cill脚本
- 研究元数据:检索包括PubMed ID在内的综合元数据
- 出版物链接:发现与PubMed出版物相关的数据集
- 灵活的查询:使用多个字段条件构建自定义查询
- 现场发现:探索可用的搜索和返回字段
- 环境配置:通过环境变量自定义API端点、超时和日志记录
可用工具
MCP服务器提供10个专用工具:
搜索与发现
- search_rna_研究 -使用预设过滤器或高级库策略/源过滤进行统一搜索
- list_library_types -列出所有50+可用的库策略和资源
- get_study_details -获取特定研究的全面元数据(包括PubMed ID)
- 查找_研究_发布 -查找与PubMed ID相关的研究
- 搜索_研究_关键字 -跨研究标题的灵活关键字搜索
下载与访问
- get_download_urls -获取研究中所有数据文件的FTP下载URL
- generatedownload_script -生成用于下载数据的bash脚本(wget/cill)
高级
- 获取可用字段 -发现不同数据类型的可搜索和可返回字段
- get_result_types -列出ENA中的所有可用数据类型
- build_custom_query -构建具有多个字段条件的高级查询
示例用例
简单搜索(预设过滤器)
- 查找人类癌症批量RNA-seq数据集:
disease="cancer" - 在小鼠大脑中搜索单细胞RNA-seq:
organism="mouse", tissue="brain", technology="single-cell" - 查找小型RNA测序研究:
technology="small-rna" - 核糖体分析实验:
technology="ribo-seq"
高级搜索(特定库类型)
- ChIP-Seq染色质研究:
library_strategies=["ChIP-Seq"] - ATAC-seq可访问性数据:
library_strategies=["ATAC-seq"] - 组合小RNA类型:
library_strategies=["miRNA-Seq", "ncRNA-Seq"] - 任何单细胞数据:
library_sources=["TRANSCRIPTOMIC SINGLE CELL"] - 宏基因组RNA:
library_sources=["METATRANSCRIPTOMIC"]
工作流示例
- 从特定研究中下载FASTQ文件
- 从特定出版物中发现数据集
- 生成带有MD5验证的下载脚本
- 列出所有可用的测序技术:
list_library_types()
入门
您还可以在上找到该项目 BioContextAI,生物医学MCP服务器的社区中心: nucleotide_archive_mcp在BioContextAI中的应用.
安装
您的系统上需要安装Python 3.11或更高版本。 如果你没有安装Python,我们建议你安装 紫外线.
安装nucleotide_archive_mcp有几个替代选项:
1.使用 uvx 立即运行它
发布到PyPI后:
uvx nucleotide_archive_mcp或者从Git仓库:
uvx git+https://github.com/biocontext-ai/nucleotide_archive_mcp.git@main2.将其包含在支持 mcp.json 标准
如果您的MCP服务器已发布到PyPI,请使用以下配置:
{
"mcpServers": {
"nucleotide_archive_mcp": {
"command": "uvx",
"args": ["nucleotide_archive_mcp"]
}
}
}如果MCP服务器尚未发布到PyPI,请使用以下配置:
{
"mcpServers": {
"nucleotide_archive_mcp": {
"command": "uvx",
"args": ["git+https://github.com/biocontext-ai/nucleotide_archive_mcp.git@main"]
}
}
}对于纯本地开发(例如,在Cursor或VS Code中),请使用以下配置:
{
"mcpServers": {
"nucleotide_archive_mcp": {
"command": "uvx",
"args": [
"--refresh",
"--from",
"path/to/repository",
"nucleotide_archive_mcp"
]
}
}
}如果要重用现有环境进行本地开发,请使用以下配置:
{
"mcpServers": {
"nucleotide_archive_mcp": {
"command": "uv",
"args": ["run", "--directory", "path/to/repository", "nucleotide_archive_mcp"]
}
}
}3.通过安装 pip:
pip install --user nucleotide_archive_mcp4.安装最新开发版本:
pip install git+https://github.com/biocontext-ai/nucleotide_archive_mcp.git@main配置
服务器可以通过环境变量进行配置。复制 .env.example 到 .env 并自定义:
# ENA API Configuration
ENA_PORTAL_API_BASE=https://www.ebi.ac.uk/ena/portal/api # Override API base URL
ENA_BROWSER_API_BASE=https://www.ebi.ac.uk/ena/browser/api
ENA_TIMEOUT=30.0 # Request timeout in seconds
ENA_SEARCH_LIMIT=20 # Default search result limit
ENA_MAX_RPS=10.0 # Rate limiting (requests per second)
# Logging
LOG_LEVEL=INFO # DEBUG, INFO, WARNING, ERROR, CRITICAL这些设置允许您:
- 使用自定义或镜像ENA API端点
- 调整慢速连接的超时
- 控制默认结果限制
- 配置大批量操作的速率限制
- 设置调试日志的详细程度
数据引用和归因
在出版物中使用ENA的数据时,请适当引用数据:
如何引用ENA数据
顶级项目登录应与ENA浏览器中的数据链接一起引用:
“本研究的数据已存入EMBL-EBI的欧洲核苷酸档案馆(ENA),登录号为PRJEBxxxx(https://www.ebi.ac.uk/ena/browser/view/PRJEBxxxx)."
替换 PRJEBxxxx 使用搜索结果中的实际研究登录号。
在ENA浏览器中访问数据
所有加入都可以在ENA浏览器中查看:
- 直接URL:
https://www.ebi.ac.uk/ena/browser/view/ - 例子:https://www.ebi.ac.uk/ena/browser/view/PRJDB2345
ORCID数据声明
ENA研究可以通过以下方式针对您的ORCID进行索赔 EBI搜索界面。搜索您的项目,然后单击“向ORCID索赔”将其链接到您的ORCID个人资料。
数据政策和使用
ENA/INSDC数据政策
该工具访问欧洲核苷酸档案馆(ENA)的数据,该档案馆是与DDBJ和GenBank的国际核苷酸序列数据库合作(INSDC)的一部分。
要点:
- 开放获取ENA/INSDC数据库中的所有数据均可免费公开访问
- 没有限制:数据没有使用限制或许可要求
- 再分配:允许免费重新分发和使用数据
- 永久性:所有提交的记录均可永久访问
- 归因:期望正确引用原始提交材料(见上文)
数据可用性
ENA中的数据可以是:
- 公共:可通过此工具和ENA浏览器免费访问
- 机密:尚未公开的出版前数据(无法通过此工具搜索)
发布的数据应在出版物中适当引用,并在适用的情况下通过ORCID声明。
数据标准
ENA通过以下方式促进数据协调:
- 示例检查表:不同数据类型的最低信息标准
- MIxS标准:基因组标准联盟(GSC)最低信息标准
- 社区标准:研究界制定了报告标准
有关更多信息,请参阅 ENA数据标准 文档。
免责声明
该工具提供对EMBL-EBI欧洲核苷酸档案馆(ENA)数据的访问。该工具是:
- 独立:与ENA、EMBL-EBI或INSDC没有正式联系或认可
- 质量:数据质量和准确性由原始提交者负责
- 更新:ENA数据和API可能会发生变化;维护此工具以反映当前的ENA服务
- 支持:有关ENA数据或服务的问题,请联系 ENA支持
欧洲核苷酸档案由EMBL-EBI在INSDC国际咨询委员会的指导下开发和维护。
联系
如果您发现此MCP服务器存在错误,请使用 问题跟踪系统.
有关ENA数据或服务的问题,请联系 ENA支持.
致谢
此工具从以下位置访问数据:
- 欧洲核苷酸档案馆(ENA) EMBL-EBI
- 国际核苷酸序列数据库合作组织(INSDC)
特别感谢ENA团队维护公共API和全面的文档。
