Token导航 LogoToken导航TokenDH.com
Intelligent Sre MCP logo
运维云端stdio官方级别未说明来源级核验

Intelligent Sre MCP

MCP Server

基于AI的SRE平台,利用Claude自动检测、调查和修复生产事故,提供从告警到修复的完整闭环解决方案。

工具数

0

提示词数

0

GitHub Stars

0

资源数

0
PythonClaude云端部署Claude

安装说明

本站只整理中文说明和来源信息,不托管安装包,也不代用户安装。

作者 / 组织

sanketsultan

提供方

sanketsultan

最后核验

2026/5/17 20:20

运行时

Python

快速接入

先看主来源和安装命令,再打开仓库或文档;下面只保留这个条目的关键接入事实。

命令预览

python -m intelligent_sre_agent.sre_agent "What is the current health of the system?"

详细介绍

智能SRE代理

人工智能驱动的SRE平台,使用Claude自动检测、调查和修复生产事件。

Alertmanager发出警报,代理查询Prometheus、Loki和Kubernetes,确定根本原因,进行补救(重启pod、补丁部署、回滚发布),并将摘要发布到Slack。所有这些都在PostgreSQL中有完整的审计跟踪。

先决条件

  • 适用于Docker Compose和本地Kubernetes
  • Python 3.10+用于运行SRE代理CLI
  • kubectl 用于Kubernetes设置(包含在Docker Desktop中)
  • ANTHROPIC_API_KEY 从https://console.anthropic.com

______________________________________________________________________

快速开始

Docker Compose(建议本地开发人员使用)

git clone https://github.com/sanketsultan/intelligent-sre-agent.git
cd intelligent-sre-agent
cp .env.example .env        # then set ANTHROPIC_API_KEY in .env
make dev
服务URL
APIhttp://localhost:8080
普罗米修斯http://localhost:9090
格拉法娜http://localhost:3000

Kubernetes(Docker桌面)

cp .env.example .env        # then set ANTHROPIC_API_KEY in .env
./scripts/setup.sh
服务URL
APIhttp://localhost:30080
普罗米修斯http://localhost:30090
格拉法娜http://localhost:30300
警报管理器http://localhost:30093
耶格尔http://localhost:30686

ANTHROPIC_API_KEY.env 启用代理和Slack机器人。

______________________________________________________________________

运作原理

当警报响起时:

  1. 第一阶段-俳句调查(总是跑,便宜又快)
  2. 第2阶段-如果严重程度达到阈值(默认值:严重),十四行诗将进行补救
  3. 第三阶段——如果十四行诗有任何破损,作品会以其他方式升级
  4. 如果opus也失败了,发布一条紧急的Slack消息以进行人工干预

每5分钟有一个CronJob点击 /health/proactive-check如果健康评分降至阈值以下(默认值50/100),调查和补救将自动运行,而无需等待警报。

______________________________________________________________________

SRE代理

# Investigate
python -m intelligent_sre_agent.sre_agent "What is the current health of the system?"

# Investigate + remediate
python -m intelligent_sre_agent.sre_agent --remediate "Pods are CrashLoopBackOff in production"

# Model selection (default: haiku for speed/cost)
python -m intelligent_sre_agent.sre_agent --model sonnet "High 5xx error rate on checkout"
python -m intelligent_sre_agent.sre_agent --model opus  "Database down, 100% error rate"

______________________________________________________________________

Slack机器人

./scripts/run-slack-bot.sh
# Requires SLACK_BOT_TOKEN + SLACK_APP_TOKEN + ANTHROPIC_API_KEY in .env
命令操作
`/sre
`调查(只读)
`/sre remediate
`调查和治疗
/sre runbooks列出运行手册
`@SRE-Bot
`提及快捷方式

______________________________________________________________________

警报管理器Webhook

每次警报时自动点火。保存到数据库并运行后台代理调查。

POST http://localhost:8080/alertmanager/webhook   # receives alerts
GET  http://localhost:8080/alerts                 # list all alerts
GET  http://localhost:8080/alerts/            # alert + investigation summary

______________________________________________________________________

调整代理

在中设置这些环境变量 k8s/base/app/intelligent-sre-agent.yaml.env:

Var默认值它的作用
SRE_AUTO_REMEDIATE_SEVERITYcritical设置为 warning 还可以自动修复警告警报
SRE_PROACTIVE_HEALTH_THRESHOLD50健康评分低于此值时,主动检查会触发补救
SRE_REMEDIATION_MODELclaude-sonnet-4-5第二阶段修复模型
SRE_ESCALATION_MODELclaude-opus-4-6如果十四行诗让东西破碎,则使用模型
SRE_MODELclaude-haiku-4-5第一阶段调查模型
SRE_MAX_TOKENS4096输出令牌上限

______________________________________________________________________

混沌/修复测试

端到端测试:部署损坏的Pod,触发自动化管道,验证代理是否修复了它们。

export ANTHROPIC_API_KEY=sk-ant-...
./scripts/test-remediation.sh

模拟的故障模式:

Pod故障代理修复
crash-workerCrashLoopBackOff修补导致退出1的环境变量
dependent-worker初始化:错误崩溃修复后自动恢复
pending-worker待定修补不可能节点选择器
sick-api正在运行/NotReady补丁损坏的准备就绪探针

______________________________________________________________________

堆栈

  • 应用:FastAPI+PostgreSQL
  • 可观测性:普罗米修斯+格拉法纳+洛基+耶格尔+开放遥测+警报管理器
  • 基础设施:地形(AWS EKS+RDS)+Kubernetes(Kustomize覆盖)
  • 安全:OPA/看门人、Falco、吊舱安全标准
  • 持续集成:GitHub使用ruff、pytest、docker build、kubeconform、tflint、checkov进行操作

______________________________________________________________________

故障排除

# Auto-detect environment and tail logs
make logs

# Docker Compose
make dev-logs
docker compose ps

# Kubernetes
kubectl get pods -n intelligent-sre
kubectl logs -n intelligent-sre deployment/intelligent-sre-agent --tail=50

______________________________________________________________________

许可证

麻省理工学院

目录标签

目录标签

PythonClaude云端部署SRE自动化本地部署生产事故管理AI运维Kubernetes监控Prometheus集成

支持客户端

Claude

接入字段

传输方式(transport,传输协议)

stdio

鉴权方式(authType,认证方式)

none

运行时(runtime,运行环境)

Python

工具数量(toolCount,工具数)

0

资源数量(resourceCount,资源数)

0

提示词数量(promptCount,提示词数)

0

权限和风险

stdionone部署方式未说明

接入前请确认传输方式、认证方式和部署位置,并根据实际工具能力限制访问范围。

安装前确认

不要直接授予不必要的文件、网络或账号权限;先核对安装命令和配置内容。

来源信息

继续浏览同类 MCP