授权可控、全程可审计的 多智能体运维事件响应平台
OpsKeeper 把告警、证据、根因分析、人工审批、窄域授权恢复、独立验证和事后复盘串成同一条闭环。 没有提案、人工审批、审计记录这三件套,任何变更动作都不会被执行。
# Worker 插件 —— 从 AgentTeams Dashboard 安装
# (热部署:qwenpaw plugin install <path> --force)
# 或直接为任何 Worker 启动 stdio MCP 代理
cd plugins/opskeeper-teamharness
OPSKEEPER_BACKEND_URL=http://localhost:8080 \
OPSKEEPER_GATEWAY_KEY="$GATEWAY_KEY" \
python3 mcp/server.py八个阶段,每一次跃迁都可追溯。
OpsKeeper 用显式的状态机驱动事件流转。每个阶段都是 append-only 账本上的一笔事件,每次跃迁都有明确的护栏,整条闭环都能从零重放。
专业分工,统一调度。
七个 Operational 角色由 Manager 风格的派发器统一协调。每个角色都有明确的工具白名单和契约,闭环不依赖任何单一 Agent 耍小聪明。
聚合来自 Prometheus / Loki / Tempo 以及外部通道的告警。通过静态规则和 LLM 语义去重,配合熔断器。
跨指标、日志、追踪、代码、主机、拓扑的只读因果链追踪器,附带置信度返回证据。
在关键严重度下检查证据链的同行审计员。只发出 needs_correction 标记,不发明问题。
每一个可变更动作的第二双眼睛。仅批准最小必要的爆炸半径。
窄域变更执行器。动作必须精确匹配一个已审批的事件、清单、资源、命令与 payload 哈希。
只调用 recovery.verify。4 项指标白名单,3 级告警分级,向管理器返回 VerifiedDelta。
基于预计算的 ReportFacts 撰写结构化周期报告。资源趋势、监控覆盖、变更 —— 绝不杜撰。
specialist-sre、specialist-network、specialist-compute、specialist-disk 和specialist-ops 随仓库 agents/ 目录一起发布, 会按路由规则挂载到对应事件上。
诊断只读,恢复写入 —— 而且必须有人点头。
OpsKeeper 在编排层把读和写分开。读工具始终可用,写工具必须先有提案、明确的人工审批人,以及精确的资源 / 命令 / payload 哈希匹配。
- 诊断工具默认只读 —— 可变更动作必须先有挂起的提案。
- 在派发任何恢复命令前,必须经过显式的人工审批。
- 对资源、命令、payload 哈希进行精确目标匹配 —— 未知工具和跨资源目标默认拒绝。
- loop_event_log 由数据库触发器强制 append-only;每个变更提案的跃迁都做 SHA256 链式记录。
- 独立验证器把"行动者"和"裁判者"分开,保证每一次恢复都有独立判定。
开箱即用。
OpsKeeper 是一个平台,三套紧耦合的子系统。每一套单独拿出来都可用、可观测。
智能体协作框架
Manager 风格的派发器,显式安全级别(L0–L3),7 个工作流角色,append-only 账本支撑的 7 阶段闭环。
技能生态
由 Nacos 支撑的技能注册中心,支持热加载,HTTP 2.x Config API,本地降级,并为 OpsKeeper Worker 插件提供 stdio MCP 服务。
可观测与审计
OpenTelemetry 追踪上下文、Prometheus 指标、Loki 日志、Tempo 追踪、Grafana 仪表盘 —— 外加 append-only 事件日志与 SHA256 链式提案审计。
把一个真实事件端到端写入闭环。
deploy/incident-events/ 内置 4 个可复现的 PostgreSQL 场景。选一个写入事件记忆库,然后在 Web Console 里看闭环从检测到复盘跑完全程。
- pg-connection-pool-exhaustion
- pg-disk-io-saturation
- pg-lock-wait-long-transaction
- pg-replica-replay-lag
# 克隆仓库,用根目录 compose 拉起整套本地环境
git clone https://github.com/vincent-wuhan/opskeeper.git
cd opskeeper
cp deploy/demo.env.example .env
docker compose up -d --build
# 把 4 个可复现 PostgreSQL 场景写入事件记忆库
go run ./cmd/incident-seed \
-dsn "postgres://opskeeper:opskeeper@localhost:5432/opskeeper?sslmode=disable" \
-dir deploy/incident-events
# 在 Web 控制台检视 timeline、证据、提案与审计
# → API + Swagger UI 见 http://localhost:8080和你已有的栈天然合得来。
OpsKeeper 自带 AgentTeams Dashboard 一方插件和标准可观测后端。MCP 服务同时支持 stdio 和 Streamable HTTP,任何 Worker 都能加入。
插件安装器 —— 侧边栏、路由、看板组件、详情面板、工具栏。
Worker/Manager 插件 + stdio MCP 代理(17 个工具,Bearer + HMAC + W3C traceparent)。
原生抓取配置,按 trace_id 关联日志 / 指标 / 追踪。
为闭环、审计账本、技能健康度预置仪表盘。
事件记忆、append-only 账本、MySQL GET_LOCK 风格的咨询锁。
向量检索 + 关键词召回 + RRF 融合排序,保留候选决策证据。
技能注册中心,30 秒轮询热加载,本地降级。
端到端 W3C traceparent 传递,覆盖 Worker → MCP → 控制平面。