Token导航 LogoToken导航TokenDH.com
Rhoai Observability MCP logo
运维云端stdio官方级别未说明来源级核验

Rhoai Observability MCP

MCP Server

Red Hat OpenShift AI可观测性MCP服务器,为AI助手提供直接访问OpenShift AI可观测性数据的能力,包括查询Prometheus指标、Alertmanager警报、Loki日志、Grafana仪表板和Kubernetes集群状态。

工具数

21

提示词数

0

GitHub Stars

0

资源数

0
日志分析PythonClaudeClaude DesktopClaude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

amito

提供方

amito

最后核验

2026/5/17 20:20

运行时

Python

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

python -m rhoai_obs_mcp.server

详细介绍

红帽OpenShift AI(RHOAI)可观察性MCP

![CI](https://github.com/opendatahub-io/rhoai-observability-mcp/actions/workflows/ci.yml) ![Build](https://github.com/opendatahub-io/rhoai-observability-mcp/actions/workflows/container-build.yml) ![codecov](https://codecov.io/gh/opendatahub-io/rhoai-observability-mcp) ![Python 3.11+](https://www.python.org) ![License: MIT](LICENSE)

MCP(模型上下文协议)服务器,使AI助手可以直接访问Red Hat OpenShift AI可观察性数据。查询Prometheus指标、Alertmanager警报、Loki日志、Grafana仪表板和Kubernetes集群状态,以排除vLLM推理工作负载的故障。

特性

  • 21工具 跨越7个类别,实现全面可观测性
  • vLLM感知 度量(TTFT、TPOT、E2E延迟、KV缓存、队列深度)
  • 综合调查 自动关联指标、日志和警报的工具
  • 自动检测 OpenShift服务的集群内访问与外部访问
  • 建立在 FastMCP 通过异步后端 httpx

建筑

graph TD
    A[Claude / AI Assistant] -->|MCP Protocol| B[rhoai-observability-mcp]
    B --> C[Thanos / Prometheus]
    B --> D[Alertmanager]
    B --> E[Loki]
    B --> F[Tempo]
    B --> G[Grafana]
    B --> H[Kubernetes / OpenShift]

后端:

后端目的来源
普罗米修斯(灭霸)指标查询(PromQL)backends/prometheus.py
Alertmanager活动警报和警报组backends/alertmanager.py
洛基日志查询(LogQL)backends/loki.py
Tempo分布式跟踪查询(TraceQL)backends/tempo.py
Grafana仪表板发现和面板查询backends/grafana.py
Kubernetes(OpenShift)Pod、事件、节点、InferenceServicesbackends/openshift.py

快速开始

# Clone and install
git clone https://github.com/opendatahub-io/rhoai-observability-mcp.git
cd rhoai-observability-mcp
uv pip install -e ".[dev]"

# Configure (see INSTALL.md for all options)
export THANOS_URL=https://thanos-querier.openshift-monitoring.svc:9091
export ALERTMANAGER_URL=https://alertmanager-main.openshift-monitoring.svc:9093
export OPENSHIFT_TOKEN=$(oc whoami -t)

# Run
python -m rhoai_obs_mcp.server

安装.md 了解详细的设置、配置和Claude Desktop集成。

构建和部署

构建容器映像

make build

覆盖图像名称或标签:

make build IMAGE_NAME=quay.io/myorg/rhoai-observability-mcp IMAGE_TAG=v1.0.0

推送到注册表

make push

部署到OpenShift

先决条件: oc login 到您的集群, kustomize 安装并创建目标项目:

oc new-project rhoai-obs-mcp

然后部署:

make deploy

这使用Kustomize构建OpenShift覆盖层(deploy/overlays/openshift/)在基础清单之上(deploy/base/)并将其应用于 rhoai-obs-mcp 命名空间。要部署到其他命名空间,请执行以下操作:

make deploy NAMESPACE=my-namespace

卸载

make undeploy

如果部署到自定义命名空间,请传递相同的值:

make undeploy NAMESPACE=my-namespace

CI构建的映像

容器图像是从以下内容自动构建的 main 并向GHCR发布:

ghcr.io/opendatahub-io/rhoai-observability-mcp:latest

地方发展与善良

为开发和测试设置一个具有模拟可观察性后端的本地Kubernetes集群:

# Prerequisites: kind, kubectl, helm, kustomize
make kind-up

这将创建一个Kind集群,通过Helm安装Prometheus+Alertmanager+Grafana,部署一个假的vLLM指标导出器,并部署MCP服务器。访问MCP服务器 http://localhost:30080.

要指向真正的外部后端而不是模拟:

make kind-deploy THANOS_URL=https://real-cluster:9091 ALERTMANAGER_URL=https://real-cluster:9093 GRAFANA_URL=https://real-cluster:3000 TEMPO_URL=https://real-cluster:8080

拆卸:

make kind-down

工具参考

指标

工具说明
query_prometheus对ThanosQuerier执行原始PromQL查询
query_prometheus_range执行PromQL范围查询以获取时间序列数据(趋势、峰值、相关性)
get_vllm_metrics获取模型的关键vLLM指标(TTFT、TPOT、E2E、缓存、队列)的摘要
list_metrics列出可用的Prometheus度量名称,可选择按正则表达式过滤

警报

工具说明
get_alerts从Alertmanager获取活动警报,可按严重程度和标签进行过滤
get_alert_groups获取按路由标签分组的警报

日志

工具说明
query_logs对OpenShift LokiStack执行LogQL查询
get_pod_logs按命名空间和名称获取特定pod的日志

痕迹

工具说明
get_trace通过跟踪ID获取分布式跟踪
search_traces使用TraceQL表达式搜索跟踪
list_trace_tags列出用于构建TraceQL查询的可用跟踪标记名称

工具说明
get_pods在命名空间中列出Pod,包括状态、重启和创建时间
get_events列出Kubernetes事件,可按资源和原因过滤
get_node_status获取节点状态、容量和GPU分配信息
describe_resource获取Kubernetes资源的详细描述
get_inference_services列出KServe Inference服务资源

仪表盘

工具说明
list_dashboards列出可用的Grafana仪表板,可按标签或标题过滤
get_dashboard_panels从Grafana仪表板获取面板及其查询

调查

工具说明
investigate_latency关联vLLM模型的延迟度量、错误日志和警报
investigate_gpu关联GPU利用率、KV缓存、队列深度和pod状态
investigate_errors在命名空间中关联错误日志、警报和Kubernetes事件

文档

许可证

麻省理工学院

目录标签

目录标签

日志分析PythonClaudeAI可观测性本地部署PrometheusKubernetes指标监控

支持客户端

Claude DesktopClaude

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

session

运行时(runtime,运行环境)

Python

工具数量(toolCount,工具数)

21

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdiosession部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP