Token导航 LogoToken导航TokenDH.com
Open Bench Publisher logo
运维云端stdio官方级别未说明来源级核验

Open Bench Publisher

MCP Server

一个端到端的AI驱动平台,通过无缝连接论文分析、数据集生成和实验原型设计,彻底改变机器学习研究工作流程。

工具数

3

提示词数

0

GitHub Stars

0

资源数

0
机器学习PythonClaudeClaudeCursor

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

exploring-curiosity

提供方

exploring-curiosity

最后核验

2026/5/17 20:23

运行时

Python

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

uvx mcp-agent deploy

详细介绍

DatasetSmith平台

从研究论文到生产就绪数据集,只需几分钟

一个端到端的人工智能平台,通过无缝连接论文分析、数据集生成和实验原型,彻底改变了机器学习研究工作流程。

![License: MIT](https://opensource.org/licenses/MIT) ![Python 3.11+](https://www.python.org/downloads/) ![MongoDB Atlas](https://www.mongodb.com/atlas) ![Powered by Tavily](https://tavily.com) ![LastMile AI](https://lastmileai.dev)

______________________________________________________________________

概述

DatasetSmith解决了机器学习研究中的一个关键问题:阅读一篇论文和拥有一个工作数据集来再现其结果之间长达数周的间隔。

平台:

  1. 使用Tavily的高级搜索发现和分析机器学习论文
  2. 使用基于LLM的分析提取数据集需求
  3. 生成具有许可证清理映像的生产就绪数据集
  4. 通过LastMile AI的MCP框架协调工作流程
  5. 使用MongoDB Atlas和矢量搜索存储和搜索所有内容

结果: 研究人员在30分钟内从论文发现到工作原型。

______________________________________________________________________

奖项类别对齐

总体而言:具有现实世界可用性的最佳AI代理

  • 解决机器学习研究中的可重复性危机
  • 通过ChatGPT/Claude/Cursor进行日常工作流集成
  • Dagster编排制作就绪
  • 从研究到原型工作流程的速度提高了10倍

MongoDB:MongoDB Atlas的最佳使用

  • 语义发现的向量搜索
  • 复杂的聚合管道
  • 更改流以进行实时更新
  • 多模态数据的灵活模式

Tavilly:Tavilly API的最佳使用

  • 高级搜索参数
  • 多模态搜索(论文+图片)
  • 特定领域优化
  • 许可证清洁内容过滤

LastMile AI:最佳MCP代理项目

  • 端到端MCP架构
  • 通过mcp代理进行生产部署
  • 日常工作流程集成
  • 多个MCP工具暴露

______________________________________________________________________

快速开始

先决条件

  • Python 3.11+
  • Node.js 18+
  • MongoDB Atlas帐户
  • API键:Tavily、OpenAI、VoyageAI

安装

git clone https://github.com/exploring-curiosity/OpenBenchPublisher.git
cd OpenBenchPublisher

# Install uv
curl -LsSf https://astral.sh/uv/install.sh | sh

# Setup environment
uv venv
source .venv/bin/activate
uv sync

# Install frontend
cd web-ui-next && npm install && cd ..

# Install Paper Analyser
cd obp-paper-analyser && pip install -r requirements.txt && cd ..

# Configure
cp .env.example .env
# Edit .env with your API keys

启动所有服务

./start.sh

访问地址:

  • 纸张分析仪:http://localhost:8001
  • 后端API:http://localhost:8000
  • Dagster用户界面:http://localhost:3000
  • 前端:http://localhost:3001

停止所有服务

./stop.sh

______________________________________________________________________

MongoDB Atlas集成

矢量搜索实现

收藏:

  • papers -带有嵌入的研究论文
  • claims -带有嵌入的摘录权利要求
  • assets -带有CLIP嵌入的图像
  • datasets -数据集清单
  • runs -管道执行历史

矢量索引:

// Papers collection
{
  "fields": [{
    "type": "vector",
    "path": "embed",
    "numDimensions": 384,
    "similarity": "cosine"
  }]
}

语义搜索:

pipeline = [
    {
        "$vectorSearch": {
            "index": "paper_vector_index",
            "path": "embed",
            "queryVector": query_embed,
            "numCandidates": 100,
            "limit": 10
        }
    },
    {
        "$project": {
            "title": 1,
            "score": {"$meta": "vectorSearchScore"}
        }
    }
]

聚合管道

数据集统计:

pipeline = [
    {"$match": {"dataset_id": ObjectId(dataset_id)}},
    {
        "$facet": {
            "class_distribution": [
                {"$group": {
                    "_id": "$class",
                    "count": {"$sum": 1}
                }}
            ],
            "size_stats": [
                {"$group": {
                    "_id": None,
                    "avg_width": {"$avg": "$width"},
                    "avg_height": {"$avg": "$height"}
                }}
            ]
        }
    }
]

更改流

实时进度:

pipeline = [
    {
        "$match": {
            "operationType": {"$in": ["insert", "update"]},
            "fullDocument.request_id": request_id
        }
    }
]

with collection.watch(pipeline) as stream:
    for change in stream:
        notify_frontend(change)

______________________________________________________________________

Tavilly API集成

高级论文发现

完整参数用法:

response = client.search(
    query="depth estimation transformers",
    search_depth="advanced",
    topic="general",
    time_range="week",
    max_results=20,
    include_domains=["arxiv.org", "openaccess.thecvf.com"],
    exclude_domains=["medium.com"],
    include_raw_content=True,
    include_images=False,
    include_answer=True
)

许可证清洁图像搜索

CC-BY过滤:

response = client.search(
    query=f"{class_name} high quality photo",
    search_depth="advanced",
    max_results=20,
    include_domains=[
        "commons.wikimedia.org",
        "unsplash.com",
        "pexels.com"
    ],
    include_images=True,
    include_image_descriptions=True
)

多阶段搜索策略

全面覆盖:

  1. 使用精确类名进行主搜索
  2. 同义词搜索多样性
  3. 特定上下文搜索
  4. 通过MongoDB矢量搜索进行重复数据删除
  5. 基于分辨率的质量选择

______________________________________________________________________

LastMile AI MCP集成

MCP工具暴露

build_dataset_slice:

@app.async_tool(name="build_dataset_slice")
async def build_dataset_slice(
    classes: List[str],
    total: int = 100,
    min_size: int = 256,
    license_filter: str = "CC-BY",
    app_ctx: Optional[AppContext] = None
) -> str:
    """Build license-clean dataset using Tavily + MongoDB"""
    # Implementation

list_datasets:

@app.tool(name="list_datasets")
async def list_datasets(app_ctx: Optional[AppContext] = None) -> str:
    """List all datasets from MongoDB Atlas"""
    # Implementation

export_dataset:

@app.tool(name="export_dataset")
async def export_dataset_tool(
    dataset_id: str,
    app_ctx: Optional[AppContext] = None
) -> str:
    """Export dataset as organized ZIP"""
    # Implementation

部署

致LastMile Cloud:

uvx mcp-agent deploy

地方发展:

uv run mcp_stdio_server.py

客户端集成

ChatGPT

{
  "mcpServers": {
    "datasetsmith": {
      "type": "lastmile",
      "appId": "app_xxx",
      "apiKey": "your_key"
    }
  }
}

克劳德桌面:

{
  "mcpServers": {
    "datasetsmith": {
      "command": "uv",
      "args": ["run", "mcp_stdio_server.py"],
      "cwd": "/path/to/DatasetSmith"
    }
  }
}

______________________________________________________________________

技术栈

后端:

  • Python 3.11+带async/await
  • REST API的FastAPI
  • Dagster用于编排
  • uv用于包装管理

前端:

  • Next.js 15(应用路由器)
  • React 19+TypeScript
  • 尾风CSS
  • Lucide图标

人工智能和搜索:

  • Tavilly API(论文+图片搜索)
  • OpenAI GPT-4o-mini(分析)
  • VoyageAI(嵌入)
  • LastMile AI(MCP部署)

数据和存储:

  • MongoDB Atlas(数据库+矢量搜索)
  • Pillow+ImageHash(图像处理)
  • 句子转换器(文本嵌入)

______________________________________________________________________

实际使用情况

日常工作流程

  1. 早晨: 通过ChatGPT查看新论文
   "Find yesterday's cs.CV papers on depth estimation"
  1. 分析: 提取数据集要求
   "Analyze the top paper and tell me what dataset I need"
  1. 世代: 构建数据集
   "Build that dataset with 100 images"
  1. 原型制作: 下载和实验
   "Export the dataset as ZIP"

节省的时间: 2-3周减少到30分钟

生产特点

  • 健康检查端点
  • 综合录井
  • 重试时的错误处理
  • MongoDB连接池
  • 始终异步/等待
  • 到处键入提示
  • Dagster监控
  • 实时进度跟踪

______________________________________________________________________

API 文档

纸张分析仪(端口8001)

POST /tools/obp.paper.search
POST /tools/obp.paper.analyze
POST /tools/obp.claims.extract
GET /health

DatasetSmith后端(端口8000)

POST /api/chats
POST /api/chat
GET /api/download-progress
POST /api/start-full-run
GET /download/{id}
DELETE /api/datasets/{id}
GET /health

______________________________________________________________________

许可证

MIT许可证-有关详细信息,请参阅许可证文件

______________________________________________________________________

联系

______________________________________________________________________

DatasetSmith平台 -使机器学习研究具有可重复性、可访问性和闪电般的速度。

目录标签

目录标签

机器学习PythonClaude本地部署数据集生成论文分析AI研究MongoDB集成

支持客户端

ClaudeCursor

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Python

工具数量(toolCount,工具数)

3

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP