Skip to content

生产值班与告警响应手册

本页用于值班交接、告警分级和首响响应。

它不替代具体专题页,而是帮助值班同学快速判断:

  • 现在问题影响多大
  • 第一轮该看哪里
  • 什么时候需要升级或转派

接班 / 班前检查

建议至少确认:

  1. Dashboard 可访问
  2. 管理 API 健康可用
  3. 至少一个健康节点可见
  4. 至少一个 READY 模板存在
  5. 最近维护窗口、未关闭告警和临时止血动作已交接

建议联动:

告警分级建议

更细的统一口径,可继续看 告警分级与阈值建议

P1:全局不可用

例如:

  • Dashboard 无法访问
  • 管理 API 健康失败
  • 无健康节点
  • 无法创建关键沙箱且影响面广

P2:核心能力明显降级

例如:

  • 多节点 degraded
  • 模板大量 FAILED / BUILDING
  • 持续大量 500
  • 创建成功率明显下降

P3:局部故障

例如:

  • 单节点、单模板、单入口问题
  • 401/403/404/409 等可定位问题

P4:信息或趋势类

例如:

  • 资源高水位
  • 暂停实例偏多
  • 失败数上升但尚未影响服务

首响 Checklist

前 5–15 分钟,建议先做:

  1. 记录最近一次变更和当前影响范围
  2. 用 Dashboard / API 判断问题更像模板、节点、网络还是控制面
  3. systemctl status → journalctl → /data/log/ → 对象页 跑第一轮检查
  4. 判断是否需要暂停变更或升级响应级别

转派与升级条件

建议在以下情况及时升级:

  • 控制面健康失败
  • 需要 restoredb、回滚或高危命令
  • MySQL / Redis / 元数据链路异常
  • 多节点同时异常
  • 持续 500 且短时间无法归因

建议在以下情况转派对应专题:

常见分流地图

值班时最常见的第一跳:

交班与复盘最小模板

建议至少记录:

  1. 当前告警级别
  2. 影响范围
  3. 已验证的事实
  4. 已做的止血动作
  5. 下一班要继续看的专题页

如果事件已经关闭,建议继续使用 事故复盘与行动项模板 做正式沉淀。

相关文档