简介

欢迎使用 OpsKeeper

OpsKeeper 是授权可控、全程可审计的多智能体运维事件响应平台。本文档会带你了解如何运行它、如何扩展它,以及闭环是如何把变更动作关在提案、人工审批和审计留痕范围内的。

OpsKeeper 是什么

OpsKeeper 把告警接入证据采集根因分析人工审批窄域授权恢复独立验证事后复盘串成同一条闭环。 每个阶段都是带护栏的显式状态跃迁,每次跃迁都是 append-only 账本上的一笔事件。

面向谁

  • SRE / DevOps 团队 —— 想要智能体驱动的、有可验证审计的事件响应。
  • 平台团队 —— 在开源内核之上搭建内部事件响应产品。
  • 安全团队 —— 要求可变更动作经过授权、限定范围、可重放。

怎么读这份文档

如果你在评估 OpsKeeper,从 快速开始 架构 页开始。如果你在生产环境运行它, 运维手册 是 day-2 参考。如果你要扩展它,直接看 插件

闭环一段话讲清

每一个事件都流过相同的八个阶段,控制平面在护栏未满足前拒绝往下走:

closed-loop phases
detected → correlated → investigated → critiqued
     → approved → recovered → verified → postmortem

原则

  1. 诊断只读。只读工具始终可用。
  2. 恢复才写。可变更工具必须先有提案。
  3. 由人审批。审批与一份具体的资源、payload 哈希绑定。
  4. 独立 Worker 验证。“行动者”和“裁判者”不是同一个角色。
  5. 每次跃迁都可重放。账本是 HMAC 链式的。

下一步

继续看 快速开始 在本地跑一遍闭环,或跳到 架构 看数据平面。