告警分级与阈值建议
本页用于统一告警口径:什么值得告警、到什么程度算 P1 / P2 / P3 / P4、出现告警后第一跳看哪里。
这页不替代 runbook,而是作为值班和巡检时的统一参考。
分级总则
建议先按三个维度判断:
- 影响面
- 持续时间
- 可恢复性
P1:全局不可用
建议纳入 P1 的典型信号:
- Dashboard 不可访问
- 管理 API 健康失败
- 健康节点数为
0 - 无可用模板且无法创建关键实例
- 持续大面积
5xx
P2:核心能力明显降级
建议纳入 P2 的典型信号:
- 多节点
degraded / not ready - 模板大量
FAILED / BUILDING - 创建成功率明显下降
- 管理 API 持续
500
P3:局部故障
建议纳入 P3 的典型信号:
- 单节点高水位或单节点异常
- 单模板、单入口、单类对象异常
401 / 403 / 404 / 409显著升高
P4:信息与趋势
建议纳入 P4 的典型信号:
- 资源高水位
- 暂停实例偏多
- 失败模板开始上升
- 限流接近阈值
告警矩阵建议
| 类别 | 建议观察项 | 触发方向 | 第一跳页面 |
|---|---|---|---|
| 控制面可用性 | health、Dashboard 可访问性 | 健康失败、持续不可达 | 控制面恢复与元数据排障 |
| 节点与容量 | 健康节点数、CPU/内存水位 | degraded、高水位 | 节点注册与资源排障 |
| 模板供应 | READY 数量、FAILED / BUILDING | 模板供应不足 | 模板构建排障 |
| 实例运行 | 创建成功率、运行中实例数 | 成功率下降 | 沙箱运行排障 |
| 入口与鉴权 | 401/403/500、域名入口 | 鉴权或入口异常 | 鉴权与 API Key 排障 |
升级与降级规则
建议:
- 趋势类异常先归为
P4 - 一旦影响扩大或持续时间拉长,再升级为
P3 / P2 - 一旦触发全局不可用或核心链路中断,直接升级为
P1