Skip to content

故障排障(Troubleshooting)

这是一页面向运维和值班同学的排障入口页。它不试图替代详细 runbook,而是帮你先判断:

  • 问题更像安装失败,还是运行期异常
  • 应该先看服务状态、Dashboard、模板、节点,还是网络入口
  • 下一步最应该打开哪篇文档

如果你现在只想快速定位问题,不想先在长手册里翻找,可以先从这里开始。

如果你连“第一跳该去哪一页”都还没判断出来,建议先看 故障分流图与排查路径总览

先判断问题落在哪一层

可以先用下面的方式粗分问题:

安装阶段就失败了

常见表现:

  • install.sh 跑完但 smoke.sh 失败
  • 关键服务没起来
  • /dev/kvm、Docker、配置文件或 socket 缺失

优先阅读:

Dashboard 打不开或能打开但操作异常

常见表现:

  • 12088 端口打不开
  • /cubeapi/v1/health 无法通过 WebUI 访问
  • Dashboard 页面能打开,但按钮操作报错

优先阅读:

模板构建失败或长期不 READY

常见表现:

  • 模板一直 BUILDING
  • 模板进入 FAILED
  • 已创建模板但无法继续起沙箱

优先阅读:

沙箱能创建,但运行不正常

常见表现:

  • 沙箱没有日志
  • Pause / Resume 结果不符合预期
  • sandbox 无法进入 guest
  • 运行后很快报错或行为异常

优先阅读:

节点不健康或容量异常

常见表现:

  • 节点未注册到控制面
  • 节点长时间 degraded
  • CPU / 内存持续高水位
  • 模板副本分布不完整

优先阅读:

域名、代理或网络入口异常

常见表现:

  • cube.app 域名不通
  • 代理请求不稳定
  • 沙箱无法按预期访问外网
  • CoreDNS 或代理配置看起来不对

优先阅读:

最实用的排障顺序

如果你一时无法判断问题在哪,推荐统一按下面顺序排:

  1. 先看 systemctl status 或 Dashboard 当前状态页
  2. 再看 journalctl
  3. 再看 /data/log/ 下的业务日志
  4. 再看具体对象页:模板、沙箱、节点
  5. 最后再考虑整组重启或高风险修复动作

这条顺序的好处是:

  • 更容易保留现场
  • 更容易先确认问题到底是服务问题还是业务行为问题
  • 能减少“一上来就重启”的误操作

高价值排障入口

服务状态与日志

如果你要确认服务是否正常启动、重启后是否恢复、日志到底应该去哪里看,优先打开:

烟雾检查与关键健康检查

如果你要验证安装是否完整、关键 socket / 健康检查是否正常,优先打开:

Dashboard 视角综合定位

如果你更想从图形界面先看总体问题,再跳去对象页:

什么时候不要直接重启

以下情况不建议一上来就重启整套服务:

  • 还没看清是服务没起来,还是只是业务行为异常
  • 还没抓到关键日志
  • 现场信息还没有保存
  • 问题可能与网络、模板或具体节点有关,而不是整组服务本身

此时更推荐先结合:

下一步建议

如果你想继续把排障内容拆细,下一批最适合新增的子页通常是: