Token导航 LogoToken导航TokenDH.com
AI Sre MCP logo
运维云端未说明官方级别未说明来源级核验

AI Sre MCP

MCP Server

AI增强SRE助手是一个基于模型上下文协议(MCP)的现代SRE工具,提供Kubernetes调试、日志分析、部署洞察和AI自动化值班功能,专为DevOps和SRE设计。

工具数

9

提示词数

0

GitHub Stars

0

资源数

0
PythonClaude日志分析Claude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

ambarishravindran1994

提供方

ambarishravindran1994

最后核验

2026/5/17 20:21

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

详细介绍

AI增强SRE助手

🚀 人工智能增强SRE助手(MCP服务器套件) 由模型上下文协议(MCP)支持的现代SRE工具 Kubernetes调试•日志分析•部署洞察•人工智能随叫随到自动化

📌 概述

该项目实现了一组生产级MCP(模型上下文协议)服务器,使LLM(ChatGPT、Claude等)能够以安全、许可、确定的方式直接与真实的SRE/DevOps系统交互。

AI可以:

调查失败的Kubernetes Pod

分析来自服务的日志

检查部署运行状况

建议RCA(根本原因分析)

生成补救步骤

自动化安全的SRE工作流程

该存储库旨在既是一个学习参考,也是一个展示人工智能增强DevOps和SRE未来的投资组合项目。

🧠 这个项目展示了什么

✔ How MCP works in real-world SRE tasks
✔ How LLMs can safely inspect infra without full access
✔ How to expose tools and resources to an AI
✔ How AI can help debug, analyze, and automate SRE workflows
✔ A complete working example of AI + Infra convergence (2026 skillset)

📁 存储库结构

ai-sre-mcp/
│
├── servers/
│   ├── k8s_server.py        # Kubernetes debugging tools
│   ├── log_server.py        # Log inspection tools
│   └── deployment_server.py # Deployment health insights
│
├── examples/
│   ├── diagnose_pod.txt
│   ├── analyze_logs.txt
│   └── summarize_incident.txt
│
├── README.md
└── requirements.txt

⚙️ 能力

🔹 1. Kubernetes Debugging Server

Tools exposed:

List pods

Describe pods

Retrieve logs

Restart deployments

Inspect restarts & statuses

Use cases:

CrashLoopBackOff analysis

Pod misconfiguration debugging

Deployment rollout checks

Node-level investigation (future expansion)

🔹 2. Log Analysis Server

Tools exposed:

List available log files

Read specific logs

Use cases:

Error spike analysis

Latency pattern detection

AI-driven anomaly detection

Incident summaries & RCA generation

🔹 3. Deployment Health Server

Tools exposed:

Get deployment replica status

Inspect readiness & health

Analyze rollout timestamps

Use cases:

Post-deployment verification

Canary analysis

Rollout stability checks

📦 安装和设置

  1. 克隆存储库

克隆https://github.com/ambarishravindran1994/ai-sre-mcp.git cd-ai-sre-mcp

  1. 安装依赖项

pip安装-r要求.txt

  1. 确保您拥有:

Python 3.10+

访问Kubernetes集群(kubectl配置)

一些示例登录。/演示日志/(或配置您自己的目录)

🏃‍♂️ 运行MCP服务器

每台服务器都使用stdio传输,这是本地MCP的默认传输方式。

运行Kubernetes服务器: python服务器/k8s_server.py

运行日志服务器: python服务器/log_server.py

运行部署服务器: python服务器/部署服务器.py

在ChatGPT或任何兼容MCP的LLM客户端中将它们配置为MCP工具。

🧪 示例工作流(复制/粘贴到AI聊天中)

这些示例位于examples/文件夹中。

  1. 诊断CrashLoopBackOff吊舱

使用k8s_server中的工具:

  1. list_pods(名称空间=“payments”)
  1. describe_pod(pod_name=“payments-api-123”,namespace=“pays”)
  1. get_logs(pod_name=“payments-api-123”)

确定吊舱重启的原因,并提出缓解措施。

  1. 分析日志是否存在高延迟

使用log_server工具:

  1. list_logs()
  1. get_log(“支付api.log”)

查找任何导致高延迟的异常、尖峰或模式。 提供总结和可能的根本原因。

  1. 发布后验证部署

使用部署服务器中的工具:

  1. get_deployment_status(“签出服务”,命名空间=“prod”)

解释部署是否正常,所有副本是否都已更新。

🧩 架构图

              +------------------+
              |   LLM Client     |
              | (ChatGPT/Claude) |
              +--------+---------+
                       |
                 MCP Protocol
                       |
        ---------------------------------
        |               |               |
+---------------+ +----------------+ +-------------------+
| K8s MCP Server| | Log MCP Server | | Deployment Server |
+-------+-------+ +-------+--------+ +---------+---------+
        |                 |                    |
 Kubernetes API     App Log Files        K8s Deployment API

目录标签

目录标签

PythonClaude日志分析Kubernetes调试本地部署部署健康检查AI自动化DevOps工具

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

未说明

鉴权方式(authType,认证方式)

none

工具数量(toolCount,工具数)

9

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

未说明none部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

仍需确认:installCommand

来源信息

继续浏览同类 MCP