SciTeX数据集(scitex数据集)
      
Unified access to neuroscience and scientific datasets
Full Documentation · pip install scitex-dataset
______________________________________________________________________
接口: python⭐⭐⭐ (主要)·CLI⭐ · 主控程序⭐⭐ · 技能⭐⭐ · 钩子--·HTTP--
问题与解决方案
| # | 问题 | 解决方案 |
|---|---|---|
| 1 | 公共数据集存储库被分割 --OpenNeuro(BIDS)+DANDI(NWB)+PhysioNet(WFDB)+Zenodo(通用)+GEO/ChEMBL/ClinicalTrials——不同的API、认证、下载工具 | 统一提取器 -- stx.dataset.neuroscience.openneuro.fetch_all_datasets() 所有呼叫形状相同;跨元数据的本地FTS5搜索 |
| 2 | “下载此BIDS数据集”是指首先阅读DataLad文档 --障碍是工具,而不是知识 | 一行提取 --无DataLad设置;该模块透明地处理身份验证、恢复、校验和 |
问题
神经科学数据集分散在多个存储库中——OpenNeuro、DANDI Archive、PhysioNet、Zenodo——每个存储库都有自己的API、数据格式和查询界面。研究人员浪费时间浏览不兼容的API来发现相关数据。人工智能代理缺乏以编程方式搜索和评估数据集的统一方法。
解决方案
SciTeX数据集提供了一个 单个Python API、CLI和MCP(模型上下文协议)服务器 从主要科学数据存储库中发现和查询元数据。它侧重于在不下载完整数据集的情况下快速检索元数据。
| 存储库 | 描述 | 数据类型 |
|---|---|---|
| OpenNeuro | 共享神经影像数据的开放平台 | MRI、EEG、MEG、iEEG、PET |
| 丹迪 | BRAIN倡议数据档案 | Ophysics电生理学 |
| PhysioNet 的 | 生理信号数据库 | 心电图、脑电图、临床数据 |
| 泽诺多 | 通用科学数据存储库(CERN) | 任何研究数据 |
Table 1. Supported data repositories. Each source is queried via its public API; no authentication required for metadata access.
安装
需要Python>=3.10。
pip install scitex-datasetMCP支持: pip install scitex-dataset[mcp]快速开始
from scitex_dataset import fetch_all_datasets, format_dataset
# Fetch datasets from OpenNeuro
datasets = fetch_all_datasets(max_datasets=10)
# Format for analysis
for ds in datasets:
formatted = format_dataset(ds)
print(f"{formatted['id']}: {formatted['name']} ({formatted['n_subjects']} subjects)")四个接口
Python API
from scitex_dataset import fetch_all_datasets, format_dataset, search_datasets, sort_datasets
from scitex_dataset import neuroscience, database
# Fetch from specific sources
datasets = fetch_all_datasets(max_datasets=100) # OpenNeuro
dandi_ds = neuroscience.dandi.fetch_all_datasets(max_datasets=50) # DANDI
phys_ds = neuroscience.physionet.fetch_all_datasets() # PhysioNet
# Search and filter
eeg_datasets = search_datasets(datasets, modality="eeg", min_subjects=20)
popular = sort_datasets(datasets, by="downloads", descending=True)
# Local database for fast full-text search
database.build() # index all sources
results = database.search("alzheimer EEG", min_subjects=20)API完整参考
CLI Commands
scitex-dataset --help-recursive # Show all commands
# Fetch from repositories
scitex-dataset openneuro -n 100 -o datasets.json -v
scitex-dataset dandi -n 50 -o dandi.json -v
scitex-dataset physionet -n 50 -v
scitex-dataset zenodo -q "neuroscience" -n 20
# Local database
scitex-dataset db build # index all sources
scitex-dataset db search "epilepsy EEG" # full-text search
scitex-dataset db stats # show statistics
# Introspection
scitex-dataset list-python-apis -v # list Python API tree
scitex-dataset mcp list-tools -v # list MCP tools完整CLI参考
MCP Server -- for AI Agents
人工智能代理可以自主发现和查询神经科学数据集。
| 工具 | 说明 |
|---|---|
dataset_openneuro_fetch | 从OpenNeuro获取数据集 |
dataset_dandi_fetch | 从DANDI档案中获取数据集 |
dataset_physionet_fetch | 从PhysioNet获取数据集 |
dataset_zenodo_fetch | 从Zenodo获取数据集 |
dataset_search | 按模态、主题等过滤数据集。 |
dataset_list_sources | 列出可用的数据存储库 |
dataset_db_build | 构建本地搜索数据库 |
dataset_db_search | 在所有来源中进行全文搜索 |
dataset_db_stats | 数据库统计 |
表2。 九种MCP工具可用于人工智能辅助数据集发现。所有工具都接受JSON参数并返回JSON结果。
scitex-dataset mcp start完整的MCP规范
Skills — for AI Agent Discovery
技能提供了面向工作流程的指南,人工智能代理通过查询来发现功能和使用模式。
scitex-dataset skills list # List available skill pages
scitex-dataset skills get SKILL # Show main skill page
scitex-dev skills export --package scitex-dataset # Export to Claude Code| 技能 | 内容 |
|---|---|
quick-start | 基本用法 |
data-sources | OpenNeuro、DANDI、PhysioNet |
cli-reference | CLI命令 |
mcp-tools | 用于AI代理的MCP工具 |
SciTeX的一部分
SciTeX数据集是 赛天使当在SciTeX框架内使用时,数据集发现与可重复的研究会话集成在一起:
import scitex
from scitex_dataset import fetch_all_datasets, format_dataset
@scitex.session
def main(logger=scitex.INJECTED):
datasets = fetch_all_datasets(max_datasets=100, logger=logger)
formatted = [format_dataset(ds) for ds in datasets]
scitex.io.save(formatted, "openneuro_datasets.json")
return 0SciTeX生态系统遵循研究的四大自由,灵感来自 自由软件定义:
研究的四大自由 0. 自由 跑 你的研究在任何地方——你的机器,你的条件。 1. 自由 学习 从原始数据到最终手稿,每一步都是如何工作的。 1. 自由 重新分配 您的工作流程,而不仅仅是您的论文。 1. 自由 修改 任何模块,并与社区分享改进。 AGPL-3.0——因为我们相信研究基础设施应该拥有与其运行的软件相同的自由。
______________________________________________________________________
