应用场景

闭环最能体现价值的地方。

五个来自 OpsKeeper 工作流目录的真实模式。每一个都作为可复现场景合入仓库,你可以端到端跑一遍。

金融核心交易·PostgreSQL

凌晨三点的连接池风暴,MTTR 从 31 分钟降到 4 分钟。

问题

交易数据库出现连接池耗尽,级联触发订单拒绝告警和交易所侧超时。On-call 必须在压力下关联 Loki 日志、Prometheus 曲线和一次近期上线的迁移。

OpsKeeper 如何解决

OpsKeeper 把 47 条原始告警归并成一个事件,定位到新副本上连接池 floor 配置不匹配的问题,并提交一份带明确爆炸半径的修复提案。审批人 90 秒内签字。验证器按四项指标白名单确认恢复。

MTTR:31 分钟 → 4 分钟。无需回滚交易所侧。
工作流
pg-connection-pool-exhaustion
严重度
critical
SaaS 多租户·PostgreSQL · Kubernetes

在客户发微博之前,把"吵闹邻居"拦住。

问题

共享 Postgres 集群上一个租户拖累了副本延迟,所有租户的副本 replay lag 超过 60 秒。平台团队需要定位租户并把它的读流量切走,同时不影响其他 1200 个租户。

OpsKeeper 如何解决

OpsKeeper 通过 Qdrant 在历史模式上做向量召回,定位到唯一一个造成延迟飙升的租户,生成一份"只对该租户开启只读路由"的提案,并按 replay-lag 白名单验证恢复。整条闭环在到达审批关卡前都没有打扰人工。

一个租户受影响 4 分钟,其余 1200 个租户 0 影响。
工作流
pg-replica-replay-lag
严重度
warn
零售 POS·边缘部署

区域 POP 掉线,门店照常营业。

问题

一个区域 POP 失去上行链路。本地 POS 终端靠边缘缓存继续工作,但中心端 OpsKeeper 控制平面失联。团队需要一个既能自治、又能产出干净审计轨迹的边缘。

OpsKeeper 如何解决

opskeeper-edge 守护进程在本地缓存证据,POP 恢复后自动与控制平面重连。HMAC 链式账本在中心端完整重放,审计零缺口、零人工对账。

零数据丢失,零人工对账,19 家门店全程营业。
工作流
edge-resilience
严重度
error
制造 OT·IT·磁盘 · 计算

坏 checkpoint 击穿车间 historian。

问题

historian 数据库每晚的 checkpoint 与换班高峰的 IOPS 撞在一起,磁盘子系统饱和。产线遥测开始丢点。产线不能停,不允许人工介入。

OpsKeeper 如何解决

OpsKeeper 检测到磁盘饱和模式,定位到 checkpoint 时间窗口,并提议把 checkpoint 分散到两个副本。repairer 分阶段执行变更,verifier 按四项指标确认 IOPS 恢复到告警阈值以下,第二天早上复盘报告自动生成。

产线在线率 100%,部署后再无磁盘告警。
工作流
pg-disk-io-saturation
严重度
critical
手游后端·锁等待

一个长事务卡住了全球活动开服。

问题

上次发布遗留的索引缺失导致开服期间锁等待超过 30 秒。玩家侧查询被卡,On-call 盯着一长串被阻塞的事务。

OpsKeeper 如何解决

investigator 把 blocker 追溯到某个批处理任务,reviewer 在明确爆炸半径的前提下签字取消,verifier 确认锁等待回到基线。复盘报告在恢复后 60 秒内推到团队 Slack。

开服保住,复盘报告在恢复 60 秒内进 Slack。
工作流
pg-lock-wait-long-transaction
严重度
error

还有不在列表里的场景?

workflows/ 下加一个新工作流,再在 deploy/incident-events/ 配对应场景就能提 PR。 目录里的四个 PG 场景都是这样贡献出来的。