代理聊天
人工智能代理对基础设施警报进行分类,调查根本原因,并提出修复方案——而独立操作员则处于睡眠状态。
有关完整的技术参考,请参阅 README.extensive.md.
问题
一个人。 310+基础设施对象 横跨6个地点。3个防火墙,12个Kubernetes节点,一切都是自托管的。当警报在凌晨3点响起时,没有团队可以呼叫。从来没有。
解决方案
三个处理侦探工作的代理子系统-- 聊天操作 (基础设施), ChatSecOps (安全), 聊天DevOps (CI/CD)——基于 n8n 编排, 矩阵 作为人机界面和3层代理架构。每当基础设施发生变化时,人类都会参与其中。该系统从不在没有竖起大拇指或投票的情况下运作。
______________________________________________________________________
是什么让这与众不同
自我提升提示——现在有A/B试验(没有其他人这样做)
系统评估自己的性能并自动修补提示。每节课都由一个 法学硕士作为法官 论5个质量维度(gemma3:12b 自2026年4月19日以来,海库首次进行校准)。当一个维度在30天内平均低于阈值时 首选项迭代修补程序 (IFRNLLEI01PRD-645,2026-04-20)产生 3种候选指令变体 (简洁/详细/示例),并通过确定性BLAKE2b哈希将每个未来的匹配会话分配给一个手臂,再加上无补丁控制。每天的cron在每只手臂达到15个样本时进行单侧Welch t检验;获胜者只有在以≥0.05分击败控制权时才能获得晋升 p = 5 力量 [POLL]; >= 10 硬停;链中两次的任何代理都会被拒绝并记录为 handoff_cycle_detected.
- 不可变的每转快照 (
scripts/lib/snapshot.py)--每次调用变异工具之前都会捕获快照(Bash,Edit,Write,Task;跳过只读工具);rollback_to(id)恢复任何先前sessions行。7天保留期。
四个新的SQLite表(event_log, handoff_log, session_state_snapshot, session_turns)使总数达到35。迁移006-011在新数据库和旧数据库上都同样适用。此后的两次跟进——A/B提示修补程序(IFRNLLEI01PRD-645, prompt_patch_trial + session_trial_assignment)以及CLI会话RAG捕获管道(-646/-647/-648,没有新桌子;组块+工具调用+标记的知识行 issue_id='cli-' 在现有模式上)--将实时总数调整为 39.
CLI会话RAG捕获——交互式 claude 会话也流入RAG(2026-04-20)
在此之前,只有YT支持的Runner会话将其成绩单/工具调用/提取的知识写入共享的RAG表中。交互式 claude CLI会话(人工在环开发工作)仅由以下人员捕获 poll-claude-usage.sh 对于成本/代币——他们的 *内容* 丢失,无法找回。
三层管道(IFRNLLEI01PRD-646/-647/-648)缩小差距。单个cron行在每个CLI JSONL上链接三个幂等步骤:
archive-session-transcript.py块交换对→session_transcripts+nomic-embed-text嵌入+文档链细化总结chunk_index=-1(会话≥5000个助理字符)。parse-tool-calls.py提取物tool_use/tool_result对→tool_call_log(issue_id解析为cli-通过补丁路径推理)。extract-cli-knowledge.py跑gemma3:12b在摘要行上以严格的JSON模式→incident_knowledge和project='chatops-cli',嵌入以供检索。
检索权重 chatops-cli 行在 CLI_INCIDENT_WEIGHT=0.75 默认情况下,真正的基础设施事件仍然会赢得密切的联系。字节偏移水印跳过未更改的文件。浸泡测试(10个文件):12个块+245个工具调用行+4个知识提取——gemma正确地将一个样本分类为 subsystem=sqlite-schema, tags=[schema, migration, versioning, data] 置信度为0.95。
技能创作提升——6个维度封闭vs google/agents-cli (2026-04-23)
- 掌握相位门技能 新
.claude/skills/chatops-workflow/SKILL.md将阶段0编码→6 事件生命周期(分诊→ 漂移检查→ 上下文→ 提议→ 批准→ 执行→ 事件发生后)。在每个Runner会话的构建提示中注入力(标记为用于手术移除;回滚锚保留在/tmp/runner-pre-IMMUTABLE.json). - 自动生成技能指数 —
scripts/render-skill-index.py发出漂移门控信号docs/skills-index.md来自所有SKILL.md+代理前台。由守卫test-656-skill-index-fresh.sh,作为每日04:30 UTC维基编译cron的前一步进行刷新。 - 版本化+审核技能 --现在每个SKILL.md+代理frontmatter都携带
version: 1.x.0+requires: {bins, env}.scripts/audit-skill-requires.sh+普罗米修斯导出器提供两个新警报(SkillPrereqMissing,SkillMetricsExporterStale). 在没有碰撞的情况下,行走git历史记录;塞弗会议 . - 反指导尾随条款 --现在,每个主要技能/代理描述都以“不要用于X(使用/其他技能代替)”结尾。可测量地减少到相邻探测代理的过度路由。
- 抵制表格的快捷方式 内联11个代理(从中抽取46行
memory/feedback_*.md带有来源引用)——在模型即将起作用的表面进行行为接种。 - 证明你的工作指令 新
check_evidence()在scripts/classify-session-risk.py发出aevidence_missing强制的风险信号[POLL]当置信度≥0.8但回复中没有工具输出/代码围栏时。在跑步者的“准备结果”节点中镜像,以剥夺不劳而获的资格[AUTO-RESOLVE]标记和前缀aGUARDRAIL EVIDENCE-MISSING:横幅。 - 用户词汇表 —
config/user-vocabulary.json(20个条目:"the firewall"→nl-fw01;gr-fw01,"xs4all"→"budget"2026-04-21后重命名等)被提示提交挂钩扫描;每个匹配都会发出一个类型vocabulary事件到event_log.
记分卡增量: 3.94 → 4.94 平均值; 5/5处的13/16尺寸 (9/16)。完整备忘录: docs/scorecard-post-agents-cli-adoption.md.E2E通过J1-J5焊道在同一批次中硬化:带电 vocabulary 通过触发真实提示提交钩子捕获的事件, promtool test rules 在实时普罗米修斯吊舱内执行,通过一个真实的Runner会话验证了强制注入,该会话的第一个工具调用已成功执行 Phase 0 在注入的技能体中。
NVIDIA DLI交叉审核+P0+P1实施(2026-04-29)
NVIDIA深度学习研究所的19份成绩单 *代理人工智能系统* 课程(Vadim Kudlai)是最后一个尚未针对该平台进行评估的主要人工智能来源。2026年4月29日的12维交叉审计对系统进行了初步评级 A(4.4/5.0) --在被审计的9个来源中,最低的一个。当天,所有7个P0+P1项目的实施将其提升到 A+(4.83/5.0),将所有9个来源的系统设置为A+(总计A+4.79)。
在YouTrack保护伞下以4次提交(G1–G4)的形式发货 IFRNLLEI01PRD-747 有孩子的-748…-751。六次提交直接推送到main,零次回复。 57/57新的QA测试通过。
- G1——长期推理回放评估 (
scripts/long-horizon-replay.py)每周回放30个最长的历史会话(星期一05:00 UTC),对跟踪一致性、工具效率、轮询正确性、成本转换率进行评分。新增long_horizon_replay_results桌子;LongHorizonReplayStale警觉的。 - G1——越狱语料库+希腊语扩展 --5个NVIDIA-DLI-08矢量中的39个夹具(星号混淆、角色转换、追溯历史编辑、上下文注入、迷失在中间诱饵中),包括 8个希腊语操作员语言夹具纯正则表达式
scripts/lib/jailbreak_detector.py;每周回归时间(星期三05:00 UTC);JailbreakBypassDetected警惕任何失误。 - G2——中间语义轨道(DARK-FIRST) —
scripts/lib/intermediate_rail.py(启发式+Ollama双后端)插入为Check Intermediate RailRunner工作流中构建计划和风险分类之间的代码节点(现在 50个节点).发射intermediate_rail_check每场活动;IntermediateRailDriftHigh超过24小时,警报率超过20%。仅观察——不堵塞;软门评估延迟≥7天后数据。 - G2——语法约束解码 --JSON模式位于
scripts/lib/grammars/通过format字段时OLLAMA_USE_GRAMMAR=1(默认启用)。回退到format=json关于模式拒绝。断路器语义得以保留。 - G3——团队形成技能 (
.claude/skills/team-formation/SKILL.mdv1.0.0)+scripts/lib/team_formation.py根据(alert_category, risk_level, hostname).Build Prompt注入一个## Team Charter (advisory)节;发出的JSON与team_charterevent_log行。KNOWN_AGENTS库存强制执行.claude/agents/*.md. - G3——推理时间缩放显式预算 —
EXTENDED_THINKING_BUDGET_Senv-var(+可选的每个类别覆盖)驱动## Reasoning Budget构建提示部分;its_budget_consumed事件在会话结束时捕获观察到的转弯/思考曲线。 - G4——服务器端会话重播端点 --新工作流程
claude-gateway-session-replay.json(idlJEGboDYLmx25kBo)活跃。发布/session-replay接受{session_id, prompt},验证格式,sqlite3检查SSH命令中是否存在会话(n8n任务运行器沙盒块child_process在代码节点中),运行claude -r,返回JSON。未知会话上的HTTP 404,格式错误的输入上的HTTP 400。session_replay_invoked活动。
event_log 架构碰撞1→ 4 (13 → 17 事件类型)。 18 → 19 模式版本表。已安装5个cron条目。5个YouTrack问题全部通过直接REST POST转移到Done( tonyzorin/youtrack-mcp:latest 集装箱 update_issue_state 省略了 $type: "StateBundleElement" 鉴别器——记录在 memory/feedback_youtrack_mcp_state_bug.md).
平台参考的完整状态: docs/agentic-platform-state-2026-04-29.md.
QA套件--411/0通过(99.52%),44个套件文件
scripts/qa/run-qa-suite.sh 跑 44套档案 (约3-5分钟),JSON记分卡+摘要输出,由每个套件保护 QA_PER_SUITE_TIMEOUT 包装纸(IFRNLLEI01PRD-724)它将任何慢速/楔形组曲的上限设置为120秒,并发出一个合成的FAIL记录,因此编排器永远不会安静地挂起:
- 每期套房 --每次采用都要进行健全性+QA+集成,并对首选项迭代修补程序进行16次测试(-645)以及 CLI会话RAG管道的12个测试 (-646/-647/-648).
- 作家报道 --每一个脚本
INSERT将s放入版本化表中以进行标记schema_version=1;对于所有5n8n工作流INSERT站点都是一样的。 - 逐个图案覆盖 --53拒绝模式测试+32拒绝模式测试。
- 有效载荷形状 --13种事件类型中的每一种都通过CLI+Python路径进行往返。
- 并发凹凸模糊 --8平行
handoff_depth.bump()没有丢失更新断言的呼叫。修复并修复了一个真实的比赛条件。 - 模拟HTTP服务器 (
scripts/qa/lib/mock_http.py)--stdlib仅用于离线测试成功压实的假OLAMA/人类终点。 - 6种e2e场景 --快乐路径(一个流中的所有9个采用)、循环预防、崩溃+回滚、模式前向兼容、信封到子代理、切换时的压缩。
- 基准测试 --事件发射的p95延迟(111毫秒)、切换缓冲(108毫秒)、包络编码(76毫秒)、快照捕获(86毫秒)、统一保护挂钩(198毫秒)、10K行传统数据库上的迁移(约200毫秒)。
______________________________________________________________________
建筑
Alert → n8n → OpenClaw (GPT-5.1, 7-21s) → Haiku Planner (+AWX) → Claude Code (Opus 4.6, 5-15min) → Human (Matrix)| 组件 | 角色 |
|---|---|
| n8n | 27个工作流——警报接收、会话管理、知识人口、教师代理运行器、服务器端会话回放 |
| 开爪 v2026.4.11(GPT-5.1) | 第1层——17种技能+活动内存的快速分诊,处理80%以上的分诊,无需升级 |
| 克劳德代码 (操作4.6) | 第2层--11个子代理+主代理 chatops-workflow 阶段关卡技能、再动作推理、交互式\[POL\]批准 |
| 西安上空 | 41本可理解的剧本被整合到人工智能规划器中 |
| 矩阵 (Synapse) | 人在循环中——民意调查、反应、回复 |
| 普罗米修斯+格拉法纳 | 11个仪表板、64+个面板、16+个指标导出器、4个警报规则文件 |
| Openbserve | OTel追踪——39K跨度,OTLP导出 |
| 奥拉玛 (RTX 3090 Ti) | 本地嵌入——nomic嵌入文本、查询重写 |
| 编译维基 | 来自7+来源的44篇文章,每日重新编译 |
安全——7层
该系统可以自由调查,但 未经人工批准,从不执行基础设施更改:
- 克劳德代码挂钩 --7个注射检测组+59个破坏性/渗出模式被确定性阻断。现在发射 3-行为分类学 (
allow/reject_content/deny)--可恢复模式会得到重试提示,而不是墙。每一次拒绝都会发生event_log作为打字tool_guardrail_rejection活动。这evidence_missing风险信号(IFRNLLEI01PRD-718)在乐队中点火时CONFIDENCE ≥ 0.8声称没有可见的工具输出块,强制[POLL]和剥离不劳而获[AUTO-RESOLVE]标记。 - 安全出口.sh --提示注入无法绕过的代码级块列表
- exec-approvals.json --36种特定技能模式(无通配符)
- 评估器优化器 --Haiku在发布前筛选高风险的回复
- 信任门控 --\<0.5停止,\<0.7升级
- 预算上限 --5欧元/时段警告,25美元/天仅限计划模式
- 凭证扫描 --16个PII模式被编辑,39个凭证被轮流跟踪
另外: 切换深度对抗部队 [POLL] 在深度≥5时/在深度≥10时硬停止,任何循环回到自身链中的试剂都被拒绝。一 audit-risk-decisions.sh 每周不变检查拒绝任何 reject_content 带有空消息的事件(会使代理失明)。
关键数字
| 度量 | 值 |
|---|---|
| 运营激活审计 | A(91.8%) --已填充23个表,超过148K行 |
| 代理设计模式 | 21/21 在A+(三源审计:11/11尺寸) |
| OpenAI代理SDK采用批量 | 9/9已执行 (第635–643期),45个文件更改,6次迁移,4个新表 |
| 首选项迭代提示修补程序 | 生活 (第645期)——N-候选A/B试验、Welch t检验、自动推广 |
| CLI会话RAG捕获 | 生活 (第646/647/648期)-成绩单+工具调用+知识提取 |
| QA套件 | 468/0通过(99.57%),2良性跳跃,横跨 51套档案 --运行约3-5分钟,JSON记分卡,每个套件超时保护。(7个套件中有411个基线+57个新的NVIDIA G1-G4测试。) |
技能创作记分卡与 google/agents-cli | 4.94 / 5.00 (为3.94)——5/5时为13/16维;6个目标间隙尺寸已关闭 |
| NVIDIA DLI 12暗记分卡 | A+(4.83/5.0) --2026-04-29之前为A(4.4);A+处9/12个维度,B处1个维度(多租户,有意单操作员设计);9-源骨料 A+(4.79) |
| 交接信封压缩 | 0.43%的比率 (176 KB输入_历史记录→ 752 导线上的B,zlib+b64) |
| AWX/Ansible小册子 | 41本游戏书连接到计划和执行中 |
| 工具调用检测 | 108种类型的88448次调用,每种工具的错误率+延迟p50/p95 |
| OTel追踪 | 39K跨度→ Openbserve+普罗米修斯指标 |
| 键入会话事件 | 17 事件类,可查询 event_log 表+促销出口商(event_log schema_version=4) |
| GraphRAG知识图 | 360个实体,193个关系 |
| 自我改进的提示补丁 | 5个活动补丁(根据评估分数自动生成) |
| 预测性风险评分 | 每天扫描123台设备,其中23台风险较高 |
| 整体健康检查 | 96%+ --142次检查(功能+e2e+跨站点) |
| E2E整体课程 | 100% (23/23) --涵盖18个YT问题,包括评分前后 |
| SQLite表 | 43 (42 + long_horizon_replay_results \[-748\]);19模式通过中央版本控制 CURRENT_SCHEMA_VERSION 注册表 |
| 行业基准 | 4.10/5.00 (82%) --15个维度,23个行业来源,E2E认证(39/39) |
| RAGAS黄金集 | 33个查询(15个硬评估标记)——多跳/时态/否定/元/跨语料库 |
| 每周艰难评估(50-q) | 评委评分hit@5=0.90,第50页5.7秒,第95页13.6秒 |
| RAGAS RAG质量 | 可信度0.88,精度0.86,召回率0.88(克劳德·海库进行了18次评估) |
| NIST行为遥测 | 5/5 AG-MS.1信号激活(动作速度、权限升级、跨境、授权深度、异常率) |
| 对抗性红队 | 54次测试(32次基线+22次对抗性),季度时间表,12次旁路向量强化 |
| 治理合规性 | 欧盟人工智能法案有限风险评估、质量管理体系(第17条)、NIST监督边界框架 |
| 供应链安全 | CI中的CycloneDX SBOM、模型来源链、代理退役程序 |
文档
| 文档 | 它涵盖了什么 |
|---|---|
| 运营激活审计 | 分数数据激活——21/21个表,109K行 |
| 三源审计 | 11/11维度A+(古力+人类学+工业) |
| 外部源映射 | atlas代理+claude源代码技术的应用 |
| 代理模式审计 | 21/21模式记分卡 |
| 评估过程 | 3组评估,飞轮,CI门 |
| ACI工具审核 | 10个MCP工具对照8点检查表 |
| 编译维基 | 45篇自动编译文章 |
| 行业基准 | 对23个行业来源进行15个维度的评分评估 |
| 技能创作记分卡 | 16维记分卡与 google/agents-cli — 3.94 → 4.94,6个闭合间隙尺寸 |
| 技能版本控制运行手册 | 根据技能赛惯例(补丁/次要/主要与技能合同挂钩)+ audit-skill-versions.sh |
| 技能指数 | 由所有SKILL.md+代理frontmatter自动生成;漂流门 test-656 |
| 代理平台状态 | 描述后NVIDIA批处理平台的单一记录源;将audit+cert+重新缩放的文档合并到一个规范的“系统当前所在位置”参考中 |
| NVIDIA DLI交叉审核(来源) | 原始的12维交叉审计+9源主记分卡+P0/P1/P2差距缩小路线图 |
| NVIDIA P0+P1认证 | E2E认证:57/57 G1-G4测试、集成审计、实弹烟雾火灾、模式碰撞痕迹、操作员门关闭 |
| NVIDIA DLI交叉审核(重新评分) | 实施后的每维增量——A(4.4)→A+(4.83) |
| 欧盟人工智能法案评估 | 风险分类+文章映射 |
| 工具风险分类 | 153个MCP工具分类(NIST AG-MP.1) |
| 代理停用 | 每层生命周期程序 |
| 安装指南 | 设置步骤+cron配置 |
快速开始
git clone https://github.com/papadopouloskyriakos/agentic-chatops.git
cd agentic-chatops
cp .env.example .env # Add your credentials看 安装指南 进行完整设置。
参考文献
- 能动性设计模式 作者:Antonio Gulli(Springer,2025)——21种模式,全部实现
- 克劳德认证建筑师-基础 (拟人)——子代理设计
- 行业参考 --Anthropic、OpenAI、LangChain、微软
许可证
山宁泰私有GitLab存储库的镜像。按原样提供,用于教育和参考目的。
______________________________________________________________________
*由一位独自的基础设施运营商建造,他厌倦了在凌晨3点醒来时收到人工智能可以分类的警报。*
