生产值班与告警响应手册
本页用于值班交接、告警分级和首响响应。
它不替代具体专题页,而是帮助值班同学快速判断:
- 现在问题影响多大
- 第一轮该看哪里
- 什么时候需要升级或转派
接班 / 班前检查
建议至少确认:
- Dashboard 可访问
- 管理 API 健康可用
- 至少一个健康节点可见
- 至少一个
READY模板存在 - 最近维护窗口、未关闭告警和临时止血动作已交接
建议联动:
告警分级建议
更细的统一口径,可继续看 告警分级与阈值建议。
P1:全局不可用
例如:
- Dashboard 无法访问
- 管理 API 健康失败
- 无健康节点
- 无法创建关键沙箱且影响面广
P2:核心能力明显降级
例如:
- 多节点
degraded - 模板大量
FAILED / BUILDING - 持续大量
500 - 创建成功率明显下降
P3:局部故障
例如:
- 单节点、单模板、单入口问题
401/403/404/409等可定位问题
P4:信息或趋势类
例如:
- 资源高水位
- 暂停实例偏多
- 失败数上升但尚未影响服务
首响 Checklist
前 5–15 分钟,建议先做:
- 记录最近一次变更和当前影响范围
- 用 Dashboard / API 判断问题更像模板、节点、网络还是控制面
- 按
systemctl status → journalctl → /data/log/ → 对象页跑第一轮检查 - 判断是否需要暂停变更或升级响应级别
转派与升级条件
建议在以下情况及时升级:
- 控制面健康失败
- 需要
restoredb、回滚或高危命令 - MySQL / Redis / 元数据链路异常
- 多节点同时异常
- 持续
500且短时间无法归因
建议在以下情况转派对应专题:
- 鉴权 / API Key:转 鉴权与 API Key 排障
- 模板构建 / 副本:转模板相关 runbook
- 节点问题:转 节点注册与资源排障
- 控制面问题:转 控制面恢复与元数据排障
常见分流地图
值班时最常见的第一跳:
- 页面打不开 / 按钮失败 → Dashboard / 代理入口排障
401/403→ 鉴权与 API Key 排障- 模板异常 → 模板专题页
- 沙箱无日志 / guest 登录失败 → 沙箱专题页
- 多节点异常 /
/health失败 → 控制面专题页
交班与复盘最小模板
建议至少记录:
- 当前告警级别
- 影响范围
- 已验证的事实
- 已做的止血动作
- 下一班要继续看的专题页
如果事件已经关闭,建议继续使用 事故复盘与行动项模板 做正式沉淀。