Skip to content

告警分级与阈值建议

本页用于统一告警口径:什么值得告警、到什么程度算 P1 / P2 / P3 / P4、出现告警后第一跳看哪里。

这页不替代 runbook,而是作为值班和巡检时的统一参考。

分级总则

建议先按三个维度判断:

  • 影响面
  • 持续时间
  • 可恢复性

P1:全局不可用

建议纳入 P1 的典型信号:

  • Dashboard 不可访问
  • 管理 API 健康失败
  • 健康节点数为 0
  • 无可用模板且无法创建关键实例
  • 持续大面积 5xx

P2:核心能力明显降级

建议纳入 P2 的典型信号:

  • 多节点 degraded / not ready
  • 模板大量 FAILED / BUILDING
  • 创建成功率明显下降
  • 管理 API 持续 500

P3:局部故障

建议纳入 P3 的典型信号:

  • 单节点高水位或单节点异常
  • 单模板、单入口、单类对象异常
  • 401 / 403 / 404 / 409 显著升高

P4:信息与趋势

建议纳入 P4 的典型信号:

  • 资源高水位
  • 暂停实例偏多
  • 失败模板开始上升
  • 限流接近阈值

告警矩阵建议

类别建议观察项触发方向第一跳页面
控制面可用性health、Dashboard 可访问性健康失败、持续不可达控制面恢复与元数据排障
节点与容量健康节点数、CPU/内存水位degraded、高水位节点注册与资源排障
模板供应READY 数量、FAILED / BUILDING模板供应不足模板构建排障
实例运行创建成功率、运行中实例数成功率下降沙箱运行排障
入口与鉴权401/403/500、域名入口鉴权或入口异常鉴权与 API Key 排障

升级与降级规则

建议:

  • 趋势类异常先归为 P4
  • 一旦影响扩大或持续时间拉长,再升级为 P3 / P2
  • 一旦触发全局不可用或核心链路中断,直接升级为 P1

推荐联动页面