Token导航 LogoToken导航TokenDH.com
MCP Sy logo
运维云端stdio官方级别未说明来源级核验

MCP Sy

MCP Server

MCPMark是一个用于在真实MCP工具环境中评估代理模型的套件,提供可复现、可扩展的基准测试,适用于研究人员和工程师。

工具数

5

提示词数

0

GitHub Stars

0

资源数

0
PythonClaude云端部署Claude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

mcpmark-eval-sy

提供方

mcpmark-eval-sy

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

pip install -e .

详细介绍

MCPMark:压力测试综合MCP使用

![Website](https://mcpmark.ai) ![arXiv](https://arxiv.org/abs/2509.24002) ![Discord](https://discord.gg/HrKkJAxDnA) ![Docs](https://mcpmark.ai/docs) ![Hugging Face](https://huggingface.co/datasets/Jakumetsu/mcpmark-trajectory-log)

用于真实MCP工具环境(Notion/GitHub/Filesystem/Postgres/Playwright)中代理模型的评估套件。

MCPMark为研究人员和工程师提供了一个可重复、可扩展的基准:一个命令任务、隔离沙箱、故障自动恢复、统一指标和聚合报告。

![MCPMark](https://mcpmark.ai)

您可以使用MCPMark做什么

  • 评估实际工具使用情况 跨多个MCP服务: Notion, GitHub, Filesystem, Postgres, Playwright.
  • 使用即用型任务 涵盖实际工作流程,每个流程都有严格的自动验证。
  • 可靠且可重复:不会污染您的帐户/数据的隔离环境;失败的任务会自动重试并恢复。
  • 统一的度量和聚合:单次/多次运行(pass@k, avg@k等)与自动结果聚合。
  • 灵活部署:本地或Docker;在macOS和Linux上完全验证。

______________________________________________________________________

快速入门(5分钟)

1) 克隆存储库

git clone https://github.com/eval-sys/mcpmark.git
cd mcpmark

2) 设置环境变量(创建 .mcp_env 在回购根目录)

只设置你需要的东西。在运行该服务的任务时添加服务凭据。

# Example: OpenAI
OPENAI_BASE_URL="https://api.openai.com/v1"
OPENAI_API_KEY="sk-..."

# Optional: Notion (only for Notion tasks)
SOURCE_NOTION_API_KEY="your-source-notion-api-key"
EVAL_NOTION_API_KEY="your-eval-notion-api-key"
EVAL_PARENT_PAGE_TITLE="MCPMark Eval Hub"
PLAYWRIGHT_BROWSER="chromium"   # chromium | firefox
PLAYWRIGHT_HEADLESS="True"

# Optional: GitHub (only for GitHub tasks)
GITHUB_TOKENS="token1,token2"   # token pooling for rate limits
GITHUB_EVAL_ORG="your-eval-org"

# Optional: Postgres (only for Postgres tasks)
POSTGRES_HOST="localhost"
POSTGRES_PORT="5432"
POSTGRES_USERNAME="postgres"
POSTGRES_PASSWORD="password"

docs/introduction.md 有关更多详细信息,请参阅下面的服务指南。

3) 安装并运行一个最小示例

本地(推荐)

pip install -e .
# If you'll use browser-based tasks, install Playwright browsers first
playwright install

MCPMark默认为内置编排代理(MCPMarkAgent).要尝试ReAct风格的代理,请通过 --agent reactpipeline.py (其他设置保持不变)。

码头工人

./build-docker.sh

运行文件系统任务(不需要外部帐户):

python -m pipeline \
  --mcp filesystem \
  --k 1 \ # run once to quick start
  --models gpt-5  \ # or any model you configured
  --tasks file_property/size_classification
# Add --task-suite easy to run the lightweight dataset (where available)

结果保存到 ./results/{exp_name}/{model}__{mcp}/run-*/... 对于标准套房和 ./results/{exp_name}/{model}__{mcp}-easy/run-*/... 当你跑步时 --task-suite easy (例如。, ./results/test-run/gpt-5__filesystem/run-1/..../results/test-run/gpt-5__github-easy/run-1/...).

______________________________________________________________________

运行您的评估

任务套件(标准与简单)

  • 现在,每个MCP服务都将任务存储在 tasks/////.
  • standard (默认)涵盖了完整的基准测试(目前有127个任务)。
  • easy 每个MCP承载10个轻量级任务,非常适合烟雾测试和CI(GitHub已经在 tasks/github/easy).
  • 交换机套件 --task-suite easy (默认为 --task-suite standard).

单次运行(k=1)

# Run ALL tasks for a service
python -m pipeline --exp-name exp --mcp notion --tasks all --models MODEL --k 1

# Run a task group
python -m pipeline --exp-name exp --mcp notion --tasks online_resume --models MODEL --k 1

# Run a specific task
python -m pipeline --exp-name exp --mcp notion --tasks online_resume/daily_itinerary_overview --models MODEL --k 1

# Evaluate multiple models
python -m pipeline --exp-name exp --mcp notion --tasks all --models MODEL1,MODEL2,MODEL3 --k 1

多次运行(k>1)pass@k

# Run k=4 to compute stability metrics (requires --exp-name to aggregate final results)
python -m pipeline --exp-name exp --mcp notion --tasks all --models MODEL

# Aggregate results (pass@1 / pass@k / pass^k / avg@k)
python -m src.aggregators.aggregate_results --exp-name exp

使用Docker运行

# Run all tasks for a service
./run-task.sh --mcp notion --models MODEL --exp-name exp --tasks all

# Cross-service benchmark
./run-benchmark.sh --models MODEL --exp-name exp --docker

请访问 docs/introduction.md 对于选择 *模型*.

提示:MCPMark支持 自动恢复。重新运行时,只会执行未完成的任务。与可重试模式匹配的失败(请参阅 可重试模式)会自动重试。模型可能会发出不同的错误字符串——如果您遇到新的可恢复错误,请打开PR或问题。

______________________________________________________________________

服务设置和身份验证

服务设置摘要文档
注意环境隔离(源中心/Eval-Hub)、集成创建和授权、浏览器登录验证。指南
GitHub建议多账户代币池;如果需要,导入预导出的回购状态。指南
Postgres通过Docker启动并导入示例数据库。设置
Playwright首次运行前安装浏览器;默认为 chromium.设置
文件系统零配置,直接运行。配置

您也可以关注 快速启动 以获得最短的端到端路径。

______________________________________________________________________

结果和指标

  • 结果按以下方式组织 ./results/{exp_name}/{model}__{mcp}/run-*/ (每个任务的JSON+CSV)。
  • 使用以下内容生成摘要:
# Basic usage
python -m src.aggregators.aggregate_results --exp-name exp

# For k-run experiments with single-run models
python -m src.aggregators.aggregate_results --exp-name exp --k 4 --single-run-models claude-opus-4-1
  • 只有在所有任务和运行中都有完整结果的模型才会包含在最终摘要中。
  • 包括多运行指标(pass@k,pass^k)用于k>1时的稳定性比较。

______________________________________________________________________

模型和任务

  • 模型支撑:MCPMark通过LiteLLM调用模型——请参阅LiteLLM文档: LiteLLM Doc.对于Anthropic(克劳德)扩展思维模式(通过启用 --reasoning-effort),我们使用Anthropic的原生API。
  • docs/introduction.md 有关MCPMark中支持的模型的详细信息和配置。
  • 要添加新模型,请编辑 src/model_config.py。添加之前,请检查LiteLLM支持的模型/提供程序。看 LiteLLM Doc.
  • 任务设计原则 docs/datasets/task.md.每项任务都配有一个自动化系统 verify.py 有关客观、可重复的评估,请参阅 docs/task.md 了解详情。

______________________________________________________________________

贡献

欢迎捐款:

  1. 在下添加新任务 tasks///// 随着 meta.json, description.mdverify.py.
  2. 确保本地检查通过并打开PR。
  3. docs/contributing/make-contribution.md.

______________________________________________________________________

引用

如果您发现我们的作品对您的研究有用,请考虑引用:

@misc{wu2025mcpmark,
      title={MCPMark: A Benchmark for Stress-Testing Realistic and Comprehensive MCP Use}, 
      author={Zijian Wu and Xiangyan Liu and Xinyuan Zhang and Lingjun Chen and Fanqing Meng and Lingxiao Du and Yiran Zhao and Fanshi Zhang and Yaoqi Ye and Jiawei Wang and Zirui Wang and Jinjie Ni and Yufan Yang and Arvin Xu and Michael Qizhe Shieh},
      year={2025},
      eprint={2509.24002},
      archivePrefix={arXiv},
      primaryClass={cs.CL},
      url={https://arxiv.org/abs/2509.24002}, 
}

许可证

此项目在Apache License 2.0下获得许可——请参阅 LICENSE.

目录标签

目录标签

PythonClaude云端部署代理模型评估本地部署多服务测试自动化验证可复现性统一指标

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

token

工具数量(toolCount,工具数)

5

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdiotoken部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP