Token导航 LogoToken导航TokenDH.com
MCP Server Benchmark logo
运维云端stdio官方级别未说明来源级核验

MCP Server Benchmark

MCP Server

该工具用于评估容器化与裸金属部署在MCP服务器上托管轻量级LLM的性能差异,适用于需要可扩展性和部署便捷性的生产系统和DevOps流水线。

工具数

0

提示词数

0

GitHub Stars

0

资源数

0
容器化PythonDevops

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

ResponsibleAILab

提供方

ResponsibleAILab

最后核验

2026/5/17 20:21

运行时

Python

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

python3 -m venv benchmark_venv

详细介绍

评估MCP服务器中可扩展LLM推理的容器化开销:一项比较基准研究

摘要

近年来,通过面向服务的架构部署大型语言模型(LLM)在研究和生产环境中都得到了广泛的应用。然而,很少有研究系统地评估现实世界场景中模型主机的容器化和裸机部署之间的权衡,特别是对于涉及LLM的延迟敏感应用程序。本文研究了将负责托管使用多个数据集评估的轻量级LLM的MCP(模型上下文协议)服务器容器化的性能影响。 _通过比较基于容器的部署和裸机部署_,我们分析了多个并发负载级别的关键性能指标。目标是确定容器化执行(通常因其可扩展性、可重复性和易于部署而得到推广)是否会引入可测量的开销或损害实时模型推理质量。通过严格的基准测试和扩展的资源监控,我们提供了经验证据,表明容器化MCP服务的LLM与裸机实现保持了相当的推理质量,在低到中等并发用户负载下,延迟权衡可以忽略不计。我们的研究结果加强了容器化在生产系统和DevOps管道中提供可扩展LLM服务的可行性,在这些系统中,可靠性、模块化和自动化至关重要。 该代码可在以下网址获得:https://github.com/ResponsibleAILab/mcp_server_benchmark.

容器化MCP服务器框架

下图说明了容器化MCP服务器框架的架构。

Containerized MCP Server Framework

主要绩效指标

度量含义
BLEU措施 n元语法重叠 在生成的输出和参考之间。更高=更准确。
胭脂措施 召回-基于相似性(侧重于捕获了多少引用)。
Pass@1生成输出的示例分数 完全匹配 (经常用于编码任务,更严格)。
平均延迟服务器响应每个提示所用的平均时间(以毫秒为单位)。更低=更快。

关键成果

精度(蓝色、红色-L,Pass@1):\ 在所有数据集中,容器化部署与裸机部署几乎持平,差异在一个标准偏差以内,95%的置信区间重叠。

延迟时间:\ 裸机运行速度一直较快,特别是在较长的产量上(如羊驼),但集装箱开销适中,仍在实际公差范围内。

总体发现:\ 容器化带来的精度损失可以忽略不计,同时提供了可移植性、可重复性和易于部署的优点,使其成为可扩展LLM推理的可行选择。

裸金属与容器的评估指标(平均值±标准差)

BLEU

数据集裸金属容器
羊驼0.0653±0.00220.0630±0.0014
布尔Q值0.1221±0.00120.1204±0.0010
SQuADv20.1507±0.00360.1482±0.0025

胭脂-L

数据集裸金属容器
羊驼0.2513±0.00240.2527±0.0014
布尔Q0.6865±0.00710.6772±0.0057
SQuADv20.6794±0.00630.6853±0.0121

Pass@1

数据集裸金属容器
羊驼0.0190±0.00210.0164±0.0017
布尔Q0.6865±0.00710.6772±0.0057
SQuADv20.3846±0.01100.3802±0.0124

延迟 *(毫秒)*

数据集裸金属容器
羊驼2112.2±18.42153.1±22.4
布尔Q值46.7±3.147.4±2.5
SQuADv2171.8±8.0186.0±8.2

*笔记:* 所有值均报告为 平均值±标准偏差.

安装

  1. 安装Python v3.10+
  2. 设置Python虚拟环境

在Windows上(PowerShell)

python3 -m venv benchmark_venv
.\benchmark_venv\Scripts\Activate
pip3 install -r requirements.txt
.\benchmark_venv\Scripts\Deactivate

在Linux/macOS上

python3 -m venv benchmark_venv
source benchmark_venv/bin/activate
pip3 install -r requirements.txt
deactivate

所有操作系统选项都需要Docker

  • Windows使用Docker桌面
  • Linux安装docker

运行

执行下面的bash脚本时,您不希望处于venv中。它将调用其他程序运行裸机和容器shell脚本。

./run_all.sh

这将运行10次裸机和容器迭代,保存每次迭代的结果

比较结果

将results_bare\_\*和results_ctn\_\*替换为运行以下命令时生成的结果。

python3 compare_multi_run_suite.py \
  --bare results_bare_20250720_101500 results_bare_20250720_111530 results_bare_20250720_121601 results_bare_20250720_131633 results_bare_20250720_141704 \
  --ctn  results_ctn_20250720_102040  results_ctn_20250720_112115  results_ctn_20250720_122146  results_ctn_20250720_132218  results_ctn_20250720_142249 \
  --out  multi_run_report

这是一个比较并保存所有裸机和容器报告以评估结果的示例。

引用

如果你觉得这项工作有用,请按如下方式引用:

@inproceedings{SteeleFeng2025MCP,
  author    = {Michael Steele and Yunhe Feng},
  title     = {Evaluating Containerization Overhead in {MCP} Servers for Scalable {LLM} Inference: A Comparative Benchmark Study},
  booktitle = {Proceedings of the Integrated Approaches to Testing Data-Centric {AI} Systems: Methods, Metrics, and Benchmarks Workshop at {IEEE} Artificial Intelligence x Software Engineering ({AIxSE})},
  year      = {2025},
  publisher = {IEEE},
  note      = {Workshop paper}
}

致谢

这项工作得到了美国国家科学基金会CCF-2447834的部分支持。

目录标签

目录标签

容器化PythonDevopsLLM推理本地部署性能评估MCP服务器

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Python

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP