v2026.09.03 · Apache-2.0 · 开源

授权可控、全程可审计的 多智能体运维事件响应平台

OpsKeeper 把告警证据根因分析人工审批窄域授权恢复独立验证事后复盘串成同一条闭环。 没有提案、人工审批、审计记录这三件套,任何变更动作都不会被执行。

默认安全 哈希链式审计 Postgres + Qdrant 7 个工作流角色
安装 · 本地环境
# Worker 插件 —— 从 AgentTeams Dashboard 安装
# (热部署:qwenpaw plugin install <path> --force)

# 或直接为任何 Worker 启动 stdio MCP 代理
cd plugins/opskeeper-teamharness
OPSKEEPER_BACKEND_URL=http://localhost:8080 \
OPSKEEPER_GATEWAY_KEY="$GATEWAY_KEY" \
python3 mcp/server.py
7
Operational Worker 角色
8
闭环阶段
4
可复现事件场景
100%
审计重放覆盖
基于你已经跑的开源技术栈搭建
PostgreSQL
Qdrant
Kubernetes
Prometheus
Loki
Tempo
Grafana
OpenTelemetry
Nacos
MCP
HMAC
W3C Traceparent
PostgreSQL
Qdrant
Kubernetes
Prometheus
Loki
Tempo
Grafana
OpenTelemetry
Nacos
MCP
HMAC
W3C Traceparent
闭环

八个阶段,每一次跃迁都可追溯。

OpsKeeper 用显式的状态机驱动事件流转。每个阶段都是 append-only 账本上的一笔事件,每次跃迁都有明确的护栏,整条闭环都能从零重放。

phase 01
检测
多源告警接入 + 语义去重
phase 02
关联
跨源事件分组与去重
phase 03
调查
只读因果链根因追踪
phase 04
评审
对 RCA 证据链的同行审计
phase 05
审批
对挂起提案的人工审批
phase 06
恢复
窄域授权的可变更动作
phase 07
验证
基于 4 项指标白名单的独立验证
phase 08
复盘
由预计算事实生成的 8 段报告
Worker 角色

专业分工,统一调度。

七个 Operational 角色由 Manager 风格的派发器统一协调。每个角色都有明确的工具白名单和契约,闭环不依赖任何单一 Agent 耍小聪明。

接入
alerter

聚合来自 Prometheus / Loki / Tempo 以及外部通道的告警。通过静态规则和 LLM 语义去重,配合熔断器。

根因
investigator

跨指标、日志、追踪、代码、主机、拓扑的只读因果链追踪器,附带置信度返回证据。

审计
critic

在关键严重度下检查证据链的同行审计员。只发出 needs_correction 标记,不发明问题。

预审
reviewer

每一个可变更动作的第二双眼睛。仅批准最小必要的爆炸半径。

修复
repairer

窄域变更执行器。动作必须精确匹配一个已审批的事件、清单、资源、命令与 payload 哈希。

验证
verifier

只调用 recovery.verify。4 项指标白名单,3 级告警分级,向管理器返回 VerifiedDelta。

复盘
reporter

基于预计算的 ReportFacts 撰写结构化周期报告。资源趋势、监控覆盖、变更 —— 绝不杜撰。

还有专家技能

specialist-srespecialist-networkspecialist-computespecialist-diskspecialist-ops 随仓库 agents/ 目录一起发布, 会按路由规则挂载到对应事件上。

查看 Worker 契约
安全边界

诊断只读,恢复写入 —— 而且必须有人点头。

OpsKeeper 在编排层把读和写分开。读工具始终可用,写工具必须先有提案、明确的人工审批人,以及精确的资源 / 命令 / payload 哈希匹配。

  • 诊断工具默认只读 —— 可变更动作必须先有挂起的提案。
  • 在派发任何恢复命令前,必须经过显式的人工审批。
  • 对资源、命令、payload 哈希进行精确目标匹配 —— 未知工具和跨资源目标默认拒绝。
  • loop_event_log 由数据库触发器强制 append-only;每个变更提案的跃迁都做 SHA256 链式记录。
  • 独立验证器把"行动者"和"裁判者"分开,保证每一次恢复都有独立判定。
三大支柱

开箱即用。

OpsKeeper 是一个平台,三套紧耦合的子系统。每一套单独拿出来都可用、可观测。

智能体协作框架

Manager 风格的派发器,显式安全级别(L0–L3),7 个工作流角色,append-only 账本支撑的 7 阶段闭环。

技能生态

由 Nacos 支撑的技能注册中心,支持热加载,HTTP 2.x Config API,本地降级,并为 OpsKeeper Worker 插件提供 stdio MCP 服务。

可观测与审计

OpenTelemetry 追踪上下文、Prometheus 指标、Loki 日志、Tempo 追踪、Grafana 仪表盘 —— 外加 append-only 事件日志与 SHA256 链式提案审计。

演示

把一个真实事件端到端写入闭环。

deploy/incident-events/ 内置 4 个可复现的 PostgreSQL 场景。选一个写入事件记忆库,然后在 Web Console 里看闭环从检测到复盘跑完全程。

  • pg-connection-pool-exhaustion
  • pg-disk-io-saturation
  • pg-lock-wait-long-transaction
  • pg-replica-replay-lag
seed · deploy/incident-events
# 克隆仓库,用根目录 compose 拉起整套本地环境
git clone https://github.com/vincent-wuhan/opskeeper.git
cd opskeeper
cp deploy/demo.env.example .env
docker compose up -d --build

# 把 4 个可复现 PostgreSQL 场景写入事件记忆库
go run ./cmd/incident-seed \
  -dsn "postgres://opskeeper:opskeeper@localhost:5432/opskeeper?sslmode=disable" \
  -dir deploy/incident-events

# 在 Web 控制台检视 timeline、证据、提案与审计
# → API + Swagger UI 见 http://localhost:8080
集成

和你已有的栈天然合得来。

OpsKeeper 自带 AgentTeams Dashboard 一方插件和标准可观测后端。MCP 服务同时支持 stdio 和 Streamable HTTP,任何 Worker 都能加入。

AgentTeams Dashboard

插件安装器 —— 侧边栏、路由、看板组件、详情面板、工具栏。

OpsKeeper TeamHarness

Worker/Manager 插件 + stdio MCP 代理(17 个工具,Bearer + HMAC + W3C traceparent)。

Prometheus + Loki + Tempo

原生抓取配置,按 trace_id 关联日志 / 指标 / 追踪。

Grafana 仪表盘

为闭环、审计账本、技能健康度预置仪表盘。

PostgreSQL

事件记忆、append-only 账本、MySQL GET_LOCK 风格的咨询锁。

Qdrant

向量检索 + 关键词召回 + RRF 融合排序,保留候选决策证据。

Nacos Config

技能注册中心,30 秒轮询热加载,本地降级。

OpenTelemetry

端到端 W3C traceparent 传递,覆盖 Worker → MCP → 控制平面。

开源 · Apache-2.0

把审计能力带进你的事件响应流程。

五分钟内本地跑起闭环,然后把真实的告警流指过去。