Skip to content

部署排障

本页面向“安装阶段就失败”或“安装看似完成但基础功能不可用”的场景,目标是尽快判断问题卡在哪一层。

建议先阅读总入口页:

先做 3 分钟快速定位

先跑下面三组检查,再决定往哪个方向深挖:

bash
# 1) 基础环境
uname -m
ls -la /dev/kvm
docker ps

# 2) 基础健康检查
curl -fsS http://127.0.0.1:19090/healthz
curl -fsS http://127.0.0.1:19090/readyz
curl -fsS http://127.0.0.1:3000/health

# 3) Web / API 入口
curl -I http://127.0.0.1:12088/
curl -fsS http://127.0.0.1:12088/cubeapi/v1/health

常见结论:

  • /dev/kvm 不存在:优先走 PVM 部署
  • 健康检查失败:先查服务状态与 journalctl
  • 3000 正常但 12088 异常:优先看 Dashboard / 反向代理配置

场景一:install.sh 成功,但 smoke.sh 失败

优先检查以下项目是否齐全:

  1. .one-click.env 是否存在、IP 和角色是否正确
  2. 关键 socket 是否存在:
    • /data/cubelet/cubelet.sock
    • /tmp/cube/network-agent-grpc.sock
  3. 关键配置是否存在:
    • CubeMaster/conf.yaml
    • Cubelet/config/config.toml
    • Cubelet/dynamicconf/conf.yaml

建议命令:

bash
cat /usr/local/services/cubetoolbox/.one-click.env
/usr/local/services/cubetoolbox/scripts/one-click/quickcheck.sh

如果这里就失败,不建议直接重装,先保留现场日志。

场景二:Dashboard 打不开

先区分“服务没起”还是“Web 入口异常”:

  • 如果 http://127.0.0.1:3000/health 正常,但 12088 异常,通常是 WebUI / 反代路径问题
  • 如果两者都异常,先回到服务状态排查

建议继续看:

场景三:普通云服务器没有 /dev/kvm

这是最常见的部署路径误选问题。处理建议:

  1. 不要继续按裸金属路径排查
  2. 直接切换到 PVM 路径
  3. 按文档完成 PVM 内核安装、重启和 CUBE_PVM_ENABLE=1

请直接参考:

场景四:PVM 已部署,但疑似仍走普通 guest 内核

重点确认三件事:

  1. uname -r 包含 cube.pvm.host
  2. .one-click.env 包含 CUBE_PVM_ENABLE=1
  3. 安装日志出现 installed PVM guest kernel 关键字

建议命令:

bash
uname -r
grep CUBE_PVM_ENABLE /usr/local/services/cubetoolbox/.one-click.env
lsmod | grep kvm_pvm
ls -l /usr/local/services/cubetoolbox/cube-kernel-scf/vmlinux

推荐排障顺序(部署场景)

  1. 先跑 quickcheck.sh
  2. 再看服务状态和 journalctl
  3. 再看 /data/log/ 下组件日志
  4. 最后再做重启或重装类动作

这样能避免“先破坏现场,再排查原因”。

相关文档