容器运维

一键巡检

概述

一键巡检对平台关键资源和服务进行全方位一键式健康检查,并针对风险项提出优化建议,确保平台资源和服务处于最佳状态,助力高效运维。

功能原理

  • 巡检类别和巡检项:

    一键巡检针对管理集群和业务集群提供基础服务、计算、网络三类巡检项,支持对集群节点、镜像服务器、网络组件等平台关键资源和服务进行巡检:

    • 基础服务:检测集群基础服务和组件的运行状态。
    • 计算:检测计算资源的使用状况和运行状态。
    • 网络:检测网络配置和状态。

    用户可自定义选择集群和巡检项进行一键巡检,启动巡检后,平台将对所选择的巡检项涉及的资源或服务进行健康检查。详细巡检项信息可参考巡检项总览

  • 巡检结果:

    一键巡检针对所巡检的资源或服务提供四种巡检结果,分别为正常、警告、故障和失败。

    • 正常:所巡检的资源或服务处于正常状态,通过绿色图标标识。
    • 警告:所巡检的资源或服务状态欠佳,可能会在一定程度上影响相关资源和服务的性能和稳定性,通过黄色图标标识。
    • 故障:所巡检的资源或服务状态非常危险,可能会严重影响业务的运行,通过红色图标标识。
    • 失败:资源或服务巡检失败,可能会严重影响业务的运行,通过灰色图标标识。
  • 健康评分:

    一键巡检内置健康评分机制,支持对所巡检的资源或服务的健康状态进行量化评分,帮助用户直观准确把握平台整体运行状态。

    • 巡检资源/服务评分:根据资源或服务的巡检结果进行评分。
      • 若某资源或服务巡检结果为正常,评分为100分。
      • 若某资源或服务巡检结果为警告,评分为50分。
      • 若某资源或服务巡检结果为故障或失败,评分为0分。
    • 巡检项评分:根据巡检项所涉及资源或服务的评分进行统计。具体如下:
      • 评分机制:(资源1评分 + 资源2评分 + …… + 资源N评分)/(N*100)*100。
      • 例子:假设某巡检项下涉及3个资源,巡检结果分别为正常、警告、故障/失败,对应的资源评分为100、50、0,则该巡检项的评分为:(100 + 50 + 0)/(3*100)*100=50分。
    • 集群评分:根据集群下各个巡检项所得评分及巡检项的权重进行综合统计。具体如下:
      • 评分机制:(巡检项1评分*巡检项1权重 + 巡检项2评分*巡检项2权重 + …… + 巡检项N评分*巡检项N权重)/(100*巡检项1权重+100*巡检项2权重+......100*巡检项N权重)*100
      • 例子:假设用户共选择了某集群下的3个巡检项进行一键巡检,巡检项的评分分别为100、50、0,对应的权重分别为1、2、3,则集群的评分为:(100*1 + 50*2 + 0*3)/(100*1+100*2+100*3)*100=33分。
    • 平台整体评分:各集群的评分取平均值
      • 评分机制:(集群1评分 + 集群2评分 + …… + 集群N评分)/N
      • 例子:假设用户共选择3个集群进行一键巡检,对应的评分为100、50、0,则平台总体评分为:(100 + 50+ 0)/3=50分。
  • 巡检建议:

    一键巡检针对警告和故障状态的巡检资源和服务,分析其面临的潜在风险以及对相关资源和服务的影响,并提供针对性的修复建议。详细巡检建议信息可参考巡检项总览

  • 巡检报告:

    一键巡检支持导出WORD格式的巡检报告,展示巡检信息总览、结果统计,并汇总所有异常巡检项详情按异常级别排列,为每条异常巡检项提供巡检建议。

功能优势

ZStack Zaku一键巡检具有以下优势:

  • 全方位高效自定义巡检:三大类巡检项涵盖平台上所有关键资源和服务,支持自定义选择巡检,分钟级交付。
  • 多级评分机制:内置资源/服务、巡检项、集群、平台四级评分机制,助力用户从微观至宏观掌控平台运行状态。
  • 智能风险排查建议:智能推送资源级风险分析和应对措施,助力精准高效运维。
  • 支持免登录执行巡检:在平台服务异常的情况下,仍然支持执行一键巡检,助力快速定位问题。

管理一键巡检

ZStack Zaku主菜单,点击容器运维 > 一键巡检,进入一键巡检界面。

一键巡检支持以下操作:
操作 描述
开始一键巡检 自定义需要巡检的集群及巡检项后,对所选巡检项进行一键巡检。
取消一键巡检 一键巡检进行中时,取消对所选巡检项进行一键巡检。
重新检测 一键巡检完成后,对上次一键巡检所选巡检项进行重新检查。
导出巡检报告 导出WORD格式的巡检报告。
设置自动巡检 支持设置自动巡检,平台将按照设置的巡检开始时间和巡检周期自动对所有巡检项进行巡检,巡检结束后,用户可进入一键巡检页面查看或导出巡检报告详情。
  • 自动巡检默认开启,巡检周期默认为8小时,可按需关闭。
  • 支持按需设置自动巡检的开始时间和巡检周期。
  • 支持按需开启邮件通知,若开启邮件通知,巡检发现异常巡检项时将发送邮件通知到指定的通知对象。
图 1所示:
图 1. 一键巡检


查看巡检结果

ZStack Zaku主菜单,点击容器运维 > 一键巡检,进入一键巡检界面。选择需进行巡检的集群及其巡检项后,点击开始一键巡检。完成巡检后,可查看巡检报告。

巡检结果通过分数量化的方式展示所选巡检项整体健康运行状态,并将所选巡检项根据状态进行分类汇总,方便用户快速查找状态异常的巡检项。同时通过列表形式清晰展示各个巡检项涉及资源的信息和状态,并提供相应的巡检建议。

  1. 整体健康检查结果

    巡检结果页面上半栏汇总统计本次所有巡检项数量以及处于异常状态的巡检项数量,并根据健康评分机制为本次巡检项进行整体统计打分,直观展示巡检项整体健康状态。同时,巡检结果记录本次一键巡检的用时以及完成时间,方便用户安排下次巡检时间。若需了解详细健康评分机制,可参考健康评分。

  2. 巡检项状态分类展示
    巡检结果页面左下栏汇总展示本次巡检的所有集群及其巡检项,同时将所有巡检项根据其涉及资源巡检结果分别归类为异常和正常。用户可自由切换正常和异常页面,快速搜索定位巡检项。巡检项具体分类机制如下:
    • 若巡检项所涉资源或服务的所有巡检结果均为正常,则该巡检项通过绿色图标标识,归类为正常。
    • 若巡检项所涉资源或服务的所有巡检结果为警告,或部分资源或服务的巡检结果为警告、其余为正常,则该巡检项通过黄色图标标识,归类为异常。
    • 若巡检项所涉资源或服务的所有巡检结果为故障,或部分资源或服务的巡检结果为故障、其余为正常或警告,则该巡检项通过红色图标标识,归类为异常。
    • 若巡检项所涉资源或服务的所有巡检结果为失败,或部分资源或服务的巡检结果为失败、其余为正常、警告或故障,则该巡检项通过灰色图标标识,归类为异常。
  3. 巡检资源信息状态和巡检建议
    用户可点击巡检报告页面左下栏任一巡检项,右下栏将以列表形式详细展示该巡检项所涉巡检资源的基本信息和巡检结果,并为巡检结果为警告和故障的巡检资源提供巡检建议。
    • 列表信息:
      • 基本信息:一键巡检为不同的巡检资源和服务展示不同的基本信息,例如节点时间同步检查巡检项可展示节点IP节点时间chronyd服务状态等。
      • 巡检结果:根据巡检资源和服务的健康状态展示相应的巡检结果,包括失败故障警告正常
        • 失败:无法对资源或服务进行巡检,通过灰色图标标识。
        • 故障:所巡检的资源或服务状态非常危险,可能会严重影响业务的运行,通过红色图标标识。
        • 警告:所巡检的资源或服务状态欠佳,可能会在一定程度上影响相关资源和服务的性能和稳定性,但不会严重影响业务的运行,通过黄色图标标识。
        • 正常:所巡检的资源或服务处于正常状态,通过绿色图标标识。
      • 巡检建议:一键巡检针对警告和故障状态的巡检资源和服务,分析其面临的潜在风险以及对相关资源和服务的影响,并提供针对性的修复建议,助力用户高效运维。详细巡检建议信息可参考巡检项总览
图 1所示:
图 1. 查看巡检结果


免登录执行一键巡检

在平台服务异常无法登录的情况下,支持免登录对管理集群执行一键巡检,方便快速定位问题。

可通过两种方式进入免登录一键巡检:
  • 登录页面点击一键巡检进入。
  • 直接访问免登录一键巡检地址进入,免登录一键巡检地址:http://${ZStack ZakuIP或域名}/ze/cs/inspection
Note: 进入免登录一键巡检地址后需验证巡检密码才能执行巡检。可登录管理集群节点,使用命令kubectl get secret inspection-secret -n zstack -ojsonpath={.data.password} |base64 -d -获取巡检密码。
图 1所示:
图 1. 登录


巡检项总览

巡检类型 巡检项 巡检项含义 巡检建议 权重
基础服务 (检测集群基础服务和组件的运行状态) etcd状态检查 检查etcd服务状态是否正常。 etcd服务状态异常,请执行systemctl status etcd命令检查etcd服务状态,如etcd服务未启动,请执行systemctl start etcd启动etcd服务。 3
kubelet状态检查 检查kubelet服务状态是否正常。 kubelet服务状态异常,请执行systemctl status kubelet检查kubelet服务状态,如kubelet服务未启动,请执行systemctl start kubelet启动kubelet服务。 3
运行时组件状态检查 检查运行时组件状态是否正常。 运行时组件状态异常,请执行systemctl status containerd检查containerd服务状态,如containerd服务未启动,请执行systemctl start containerd启动containerd服务。 3
kube-apiserver状态检查 检查kube-apiserver连通性。 kube-apiserver状态异常,请执行kubectl get pod -n kube-system确认kube-apiserver的pod状态,如发现pod异常,请重启异常pod。 3
kube-controller-manager状态检查 检查kube-controller-manager状态是否正常。 kube-controller-manager状态异常,请执行kubectl get pod -n kube-system确认 kube-apiserver和kube-controller-manager的pod状态,如发现pod异常,请重启异常pod。 3
kube-scheduler状态检查 检查kube-scheduler状态是否正常。 kube-scheduler状态异常,请执行kubectl get pod -n kube-system确认kube-apiserver和kube-scheduler的pod状态,如发现pod异常,请重启异常pod。 3
PostgreSQL状态检查 检查PostgrSQL状态是否健康。
  • 若检测到PostgreSQL状态为数据校验中,可能是因为PostgreSQL的pod曾发生异常,目前正在进行数据校验,通常情况下,数据校验将在1小时内完成,请等待一段时间后再进行检测。
  • 若检测到PostgreSQL状态为其他异常,请执 kubectl get pod -n zstack-middleware |grep postgres命令确认PostgreSQL的pod状态,如发现pod异常,请重启异常pod。
3
Redis状态检查 检查Redis状态是否健康。 Redis状态异常,请执行kubectl -n zstack-middleware get svc -lapp.kubernetes.io/name=redis -l app.kubernetes.io/component=sentinel获取redis sentinel service ip,并执行kubectl -n zstack-middleware get pod -l app.kubernetes.io/name=redis -l app.kubernetes.io/component=sentinel获取redis sentinel的pod,获取后,请使用kubectl -n zstack-middleware exec [redis sentinel pod 名称] -c sentinel -- redis-cli -h [redis sentinel service ip] -p 26379 info sentinel | grep status命令分别确认每个Redis的pod状态,如发现pod异常,请重启异常pod。 3
容器镜像仓库检查 检查容器镜像仓库是否正常。 容器镜像仓库异常,请执行kubectl get pod -n harbor检查harbor服务是否正常。 3
容器镜像仓库连通性检查 检查是否能正常连接到容器镜像仓库 从容器镜像仓库拉取镜像失败,请检查集群节点到容器镜像仓库的网络是否正常。 3
Docker Registry状态检查 检查管理节点Docker Registry状态是否正常。 部分管理节点Docker Registry状态异常。请登录各个管理节点,执行systemctl status registry.service检查节点Docker Registry状态,并通过journalctl -u registry.service命令查看Docker Registry日志,根据日志内容进行故障处理。 3
ChartMuseum状态检查 检查管理节点ChartMuseum状态是否正常。 部分管理节点ChartMuseum状态异常,请登录各个管理节点,执行systemctl status chartmuseum.service检查节点ChartMuseum状态,并通过journalctl -u chartmuseum.service命令查看ChartMuseum日志,根据日志内容进行故障处理。 3
zstack-edge-nginx状态检查 检查管理节点zstack-edge-nginx状态是否正常。 部分管理节点zstack-edge-nginx状态异常,请登录各个管理节点,执行systemctl status zstack-edge-nginx.service检查zstack-edge-nginx状态,并通过journalctl -u zstack-edge-nginx.service命令查看zstack-edge-nginx日志,根据日志内容进行故障处理。 3
Prometheus状态检查 检查Prometheus容器组状态是否为运行中。 Prometheus状态异常,请执行kubectl get pod -n monitoring确认Prometheus的pod状态,如发现pod异常,请重启异常pod。 1
Loki状态检查 检查Loki状态是否正常。 Loki 状态异常,请执行kubectl get pod -n monitoring 确认 Loki 的 pod 状态,如发现 pod 异常,请重启异常 pod。 1
监控数据盘使用率检查 检查监控数据盘使用率和使用量。 监控数据盘使用率超过80%,请检查监控数据保留时间设置是否合理,建议按需调小保留时间。必要时,建议对监控数据盘进行扩容。 1
日志数据盘使用率检查 检查日志数据盘使用率和使用量。 日志数据盘使用率超过80%,请检查日志保留时间设置是否合理,建议按需调小保留时间。必要时,建议对日志数据盘进行扩容。 1
容器镜像仓库数据盘使用率检查 检查容器镜像仓库数据盘使用率和使用量。 容器镜像仓库数据盘使用率超过80%,建议对容器镜像仓库数据盘进行扩容。 1
计算(检测计算资源的使用状况和运行状态) 节点CPU使用率检查 检查节点CPU使用率。 部分节点CPU使用率超过80%,请登录节点,检查是否存在业务异常,并按需优化运行业务。必要时,建议对集群进行扩容。 1
节点内存使用率检查 检查节点内存使用率。 部分节点内存使用率超过 80%,请登录节点,检查是否存在业务异常,并按需优化运行业务。必要时,建议对集群进行扩容。 1
节点系统盘使用量检查 检查节点系统盘使用率和使用量。 部分节点系统盘使用率超过 75%,请立即登录节点,检查并清理无业务影响的数据。系统盘使用率超过 85%,集群将自动驱逐容器组,影响业务正常访问。 1
节点时间同步检查 检查chronyd服务是否正常以及其它节点和第一个节点时间差是否小于等于2秒。 chronyd服务异常或节点时间不同步,请登录对应节点检查。 3
节点SWAP分区检查 检查节点SWAP分区是否关闭。 部分节点未关闭 SWAP 分区,可能导致集群异常,请立即登录对应节点关闭 SWAP 分区。 3
节点文件句柄数检查 检查节点系统文件句柄数使用率。 部分物理机系统文件句柄数使用率大于50%,请依次检查以下几项:
  • 是否存在进程占用较多句柄数,查看进程对应应用程序是否存在异常。
  • 查看/etc/sysctl.conf文件中fs.file-max值是否设置过小,适当调大文件句柄总数,并执行sysctl -p使设置生效。
3
节点CPU申请率检查 检查节点上所有pod的CPU请求量总和占CPU总量百分比。 CPU申请率超过80%,请登录集群检查节点资源分配是否合理,必要时建议扩容节点。 1
节点内存申请率检查 检查节点上所有pod的内存请求量总和占内存总量百分比。 内存申请率超过80%,请登录集群检查节点资源分配是否合理,必要时建议扩容内存。 1
节点状态检查 检查集群节点状态是否正常。 部分节点状态异常,请登录节点,执行 systemctl status kubelet 检查 kubelet 服务是否正常,执行systemctl status docker systemctl status containerd 检查运行时组件是否正常。 3
网络(检测网络配置和状态) 节点到管理集群连通性检查 检查节点到管理集群的连通性,及是否存在丢包情况。 部分节点到管理集群存在丢包或连接失败,请检查节点到管理集群的网络是否正常。 3
节点间网络检查 检查集群内节点间 IP 的连通性,及是否存在丢包情况。 部分节点网络存在丢包或连接失败,请检查对应节点的系统及网络是否正常。 3
Calico状态检查 检查Calico容器组状态是否为运行中。 Calico状态异常,请执行kubectl get pod -n kube-system |grep calico确认Calico的pod状态,如发现pod异常,请重启异常pod。 3
CoreDNS状态检查 检查CoreDNS组件状态是否正常。 CoreDNS状态异常,请执行kubectl get pod -n kube-system |grep coredns检查pod状态,并重启异常pod。 3
NodeLocalDNS状态检查 检查NodeLocalDNS组件状态是否正常。 NodeLocalDNS状态异常,请执行kubectl get pod -n kube-system |grep nodelocaldns检查pod状态,并重启异常pod。 3
ResolvConf文件状态检查 检查节点 ResolvConf 文件状态是否正常。 检测到节点ResolvConf文件状态异常,请检查以下几项:
  • ResolvConf文件是否存在。
  • ResolvConf文件中有配置DNS服务。
1

监控面板

概述

监控面板集成Grafana,内置多种监控面板,从集群、节点、命名空间、工作负载、容器组等多个维度提供CPU、内存、存储、网络等各种资源的监控数据,帮助用户快速掌握集群、节点、容器组等的资源使用情况,提高运维效率。

查看监控数据

ZStack Zaku主菜单,点击容器运维 > 监控面板,进入Grafana首页,在页面左上角点击General,即可展示所有监控面板,可按名称或标签搜索监控面板,以下介绍各监控面板详情:

  • Kubernetes集群资源监控

    进入Kubernetes / Compute Resources / Cluster监控面板,可查看Kubernetes集群CPU使用率、内存使用率,以及各个命名空间的CPU和内存使用情况。

    图 1、所示:
    图 1. Kubernetes / Compute Resources / Cluster




  • 节点上容器组资源监控

    进入Kubernetes / Compute Resources / Node(Pods)监控面板,可查看单台节点上容器组的CPU和内存使用情况。

    图 2所示:
    图 2. Kubernetes / Compute Resources / Node(Pods)


  • 工作负载资源监控

    进入Kubernetes / Compute Resources / Workload监控面板,可查看单个工作负载资源使用情况。

    图 3所示:
    图 3. Kubernetes / Compute Resources / Workload


  • 容器组网络资源监控

    进入Kubernetes / Networking / Pod监控面板,可查看单个容器组网络资源使用情况。

    图 4所示:
    图 4. Kubernetes / Networking / Pod


  • 工作负载网络资源监控

    进入Kubernetes / Networking / Workload监控面板,可查看单个工作负载网络资源使用情况。

    图 5所示:
    图 5. Kubernetes / Networking / Workload


  • 数据卷资源监控

    进入Kubernetes / Persistent Volumes监控面板,可查看单个数据卷存储使用率和存储使用量。

    图 6所示:
    图 6. Kubernetes / Persistent Volumes


  • 节点监控

    进入Nodes监控面板,可查看单台节点CPU、内存、磁盘、网络资源使用情况。

    图 7所示:
    图 7. Nodes


日志事件

容器日志

ZStack Zaku主菜单,点击容器运维 > 日志事件 > 容器日志,进入容器日志界面。

该界面集中展示集群内全部容器日志。

图 1所示:
图 1. 容器日志


用户可在该页面进行搜索筛选和日志统一管理:
  • 支持选择时间段,查看所选时间段的容器日志。可选的时间段包括:最近5分钟、最近15分钟、最近30分钟、最近1小时、最近6小时、最近12小时、最近24小时、最近3天、最近7天、自定义,默认展示最近5分钟的日志。
  • 支持通过输入关键词搜索日志。
  • 支持按集群、命名空间、工作负载、容器组、容器搜索日志。
  • 支持查看日志的上下文。用户可按关键字搜索上下文,关键字将在搜索结果中高亮标识。
  • 支持导出日志和日志上下文。

事件

ZStack Zaku主菜单,点击容器运维 > 日志事件 > 事件,进入事件界面。

该界面集中展示各集群各命名空间内所有 Kubernetes 事件。

图 1所示:
图 1. 事件


用户可在该页面进行搜索筛选和统一管理 Kubernetes 事件:
  • 支持将 Kubernetes 事件持久化保存,按需设置保存时间。
  • 支持选择时间段,查看所选时间段的 Kubernetes 事件。可选的时间段包括:最近30分钟、最近1小时、最近6小时、最近1天、最近1周、自定义,默认展示最近30分钟的事件。
  • 支持通过输入资源名称搜索事件。
  • 支持按事件类型、原因、资源类型筛选事件。
  • 支持按次数、最早发生时间、最晚发生时间对事件进行排序。

报警服务

报警消息

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 报警消息,进入报警消息界面。

该页面集中展示所有报警消息和报警恢复消息,包括报警消息的消息内容、报警资源、报警级别、确认状态、发生时间等。

图 1所示:
图 1. 报警消息


用户可在该页面对报警消息进行筛选搜索和统一管理:
  • 支持选择时间段,查看所选时间段的报警消息。可选的时间段包括:最近12小时、最近1天、最近3天、最近7天、自定义,默认展示最近7天的日志。
  • 支持通过资源名称、资源类型、确认状态搜索报警消息,默认展示7天内,全部资源的未确认报警消息。
  • 支持查看报警消息详情。
  • 支持将用户已知晓的报警消息状态变更为已确认。
  • 支持调整每页显示的报警消息数量,可选值为:10、20、50、100,且支持翻页操作。

报警器

概述

报警器用于监控并响应时序性数据的状态变化,并通过通知服务推送报警消息至指定的通知对象,用户可以创建报警器对资源进行监控。

创建报警器

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 报警器,进入报警器界面。点击创建报警器,弹出创建报警器界面。

可参考以下示例输入相应内容:
  • 名称:设置报警器名称。命名规则:长度限制1-128字符,只能包含中文汉字、英文字母、数字和以下7种特殊字符:(-) (_) (.) (() ()) (:) (+)
  • 简介:可选项,备注报警器相关信息
  • 资源类型:选择报警资源的类型,包括:节点、容器组、数据卷、集群
  • 报警条目:根据所选资源类型,选择报警条目
  • 资源范围:设置报警器应用的资源范围,支持应用于所选资源类型下的全部资源或指定资源:
    • 自定义单个资源创建报警器,该报警器只对其下的单个资源进行监控,该资源满足报警条件,即可触发报警。
    • 自定义批量资源创建报警器,该报警器对其下的批量资源进行监控,其中任一资源满足报警条件,即可触发报警。
    • 对全部资源创建报警器,该报警器对平台内该资源类型的全部资源进行监控,其中任一资源满足报警条件,即可触发报警。
    Note: 资源类型为容器组时,支持按容器组选择和按所属工作负载选择两种资源选择方式,按容器组选择时,对所选的容器组进行监控,按所属工作负载选择则时,对所选工作负载下的容器组进行监控。
  • 报警触发规则:设置报警触发规则
  • 报警级别:设置报警级别,支持紧急、严重、提示三种级别,不同级别的报警器会发出不同级别的报警消息
  • 重复报警:设置首次报警后,报警资源未得到及时恢复时,是否允许重复发送报警消息
    Note:
    • 开启重复报警:
      • 如报警器挂载单个资源,该资源触发一次报警后继续满足报警条件,该报警器将每3小时进行一次报警。
      • 如报警器挂载多个资源,其中某一资源触发一次报警后继续满足报警条件,该报警器将每3小时对该资源进行一次报警,若在3小时间隔期内有其他资源满足报警条件,则会直接进行其他资源的报警。
    • 不开启重复报警:
      • 如报警器挂载单个资源,该资源触发一次报警后继续满足报警条件,该报警器将不再报警,若该资源恢复正常后再次满足报警条件,将再次触发报警。
      • 如报警器挂载多个资源,其中某一资源触发一次报警后继续满足报警条件,该报警器将不再对该资源报警,若有其他资源满足报警条件,则会进行一次其他资源的报警。
  • 报警恢复通知:可选项,默认开启,若开启,当报警器内的任一资源从报警状态恢复至正常状态,系统将发送一次恢复通知。
  • 通知对象:可选项,默认为系统报警通知对象,报警消息会被发送到指定的通知对象
图 1所示:
图 1. 创建报警器


管理报警器

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 报警器,进入报警器界面。

报警器支持以下操作:
操作 描述
创建报警器 创建一个新的报警器。
修改 修改报警器,包括报警器简介、资源范围、报警触发规则、报警级别、重复报警、报警恢复通知、通知对象。
删除 将报警器删除。
Note: 删除后,该报警器将不再进行资源监控并发送报警消息,请谨慎操作。
启用 将停用的报警器启用。
停用 将启用的报警器停用。
Note: 停用后,该报警器仍会监控
停用报警器后仍然会监控报警器的状态,但是不会产生任何报警消息。

通知对象

概述

通知对象指用户获取订阅主题信息的方式,通知对象类型包括:系统、邮箱、企业微信、钉钉、Webhook。

创建通知对象

创建通知对象分为以下四种场景:
  • 创建邮箱类型通知对象
  • 创建企业微信类型通知对象
  • 创建钉钉类型通知对象
  • 创建Webhook类型通知对象

创建邮箱类型通知对象

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 通知对象,进入通知对象界面,点击创建通知对象,进入创建通知对象界面。

可参考以下示例输入相应内容:
  • 名称:设置通知对象名称。命名规则:长度限制1-128字符,只能包含中文汉字、英文字母、数字和以下7种特殊字符:(-) (_) (.) (() ()) (:) (+)
  • 简介:可选项,备注通知对象相关信息
  • 类型:选择邮箱
  • 邮箱地址:输入邮箱地址,支持添加多个邮箱地址,最多可添加100个
  • 通知语言:设置发送到通知对象的消息要使用的语言,支持中文简体、English,默认与当前平台语言一致。
图 1所示:
图 1. 创建通知对象


创建企业微信类型通知对象

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 通知对象,进入通知对象界面,点击创建通知对象,进入创建通知对象界面。

可参考以下示例输入相应内容:
  • 名称:设置通知对象名称。命名规则:长度限制1~128字符,只能包含中文汉字、英文字母、数字和以下7种特殊字符:(-) (_) (.) (() ()) (:) (+)
  • 简介:可选项,备注通知对象相关信息
  • 类型:选择企业微信
  • 群机器人地址:请在企业微信群内创建群机器人,并将群机器人的Webhook地址填写到此处。创建完成后,平台报警消息将通过群机器人推送到企业微信群内
  • 通知语言:设置发送到通知对象的消息要使用的语言,支持中文简体、English,默认与当前平台语言一致。
图 2所示:
图 2. 创建通知对象


创建钉钉类型通知对象

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 通知对象,进入通知对象界面,点击创建通知对象,进入创建通知对象界面。

可参考以下示例输入相应内容:
  • 名称:设置通知对象名称。命名规则:长度限制1-128字符,只能包含中文汉字、英文字母、数字和以下7种特殊字符:(-) (_) (.) (() ()) (:) (+)
  • 简介:可选项,备注通知对象相关信息
  • 类型:选择钉钉
  • 群机器人地址:请在钉钉群内创建自定义机器人,并将机器人的Webhook地址填写到此处。创建完成后,平台报警消息将通过机器人推送到钉钉群内
  • 加签密钥:如使用的钉钉版本要求对群机器人进行安全设置,请选择加签方式,并将获取的加签密钥填写到此处
  • 通知语言:设置发送到通知对象的消息要使用的语言,支持中文简体、English,默认与当前平台语言一致。
图 3所示:
图 3. 创建通知对象


创建 Webhook 类型通知对象

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 通知对象,进入通知对象界面,点击创建通知对象,进入创建通知对象界面。

可参考以下示例输入相应内容:
  • 名称:设置通知对象名称。命名规则:长度限制1-128字符,只能包含中文汉字、英文字母、数字和以下7种特殊字符:(-) (_) (.) (() ()) (:) (+)
  • 简介:可选项,备注通知对象相关信息
  • 类型:选择 Webhook
  • Webhook地址:输入Webhook地址,若认证方式为 Token,请在地址中携带 Token
  • 用户名:可选项,若指定的Webhook已设置用户名和密码才可访问,需按实填写用户名
  • 密码:可选项,若指定的Webhook已设置用户名和密码才可访问,需按实填写密码
  • 通知语言:设置发送到通知对象的消息要使用的语言,支持中文简体、English,默认与当前平台语言一致。
  • 报警消息模板:用户可指定报警消息模板,使报警消息按指定格式发送至该通知对象;若未指定,将使用当前项目的默认模板发送;若项目未创建默认模板,将使用系统内置模板发送。
图 4所示:
图 4. 创建通知对象

管理通知对象

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 通知对象,进入通知对象界面。

通知对象支持以下操作:
操作 描述
创建通知对象 创建一个新的通知对象。
修改 修改通知对象,除通知对象类型外其余内容均可修改。
删除 将通知对象删除,删除通知对象后,相关订阅消息将不会再发送到该通知对象,请谨慎操作。

消息模板

概述

消息模板是报警器向通知对象发送消息时使用的标准化文本模板,支持用户自定义格式与内容,可灵活适配不同通知场景的需求。

系统按以下优先级自动匹配模板:
  1. 若通知对象指定了专属模板则使用指定模板发送;
  2. 若未指定则使用项目的默认模板发送;
  3. 若项目无默认模板则自动使用系统内置模板发送。

创建消息模板

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 消息模板,进入消息模板界面。点击创建消息模板,弹出创建消息模板界面。

可参考以下示例输入相应内容:
  • 名称:设置消息模板名称。命名规则:长度限制1-128字符,只能包含中文汉字、英文字母、数字和以下7种特殊字符:(-) (_) (.) (() ()) (:) (+)
  • 简介:可选项,备注报警器相关信息
  • 类型:暂仅支持Webhook类型
  • 报警消息文本:设置报警消息内容模板。请输入符合 JSON 格式的报警消息文本,用于定义 Webhook 通知的内容结构。系统提供示例模板,用户可参考示例模板按需填写:
    {
      "facts": [
        {
          "name": "报警消息详情",
          "value": null
        },
        {
          "name": "资源类型",
          "value": "${ALARM_RESOURCE_TYPE}"
        },
       {
          "name": "报警资源",
          "value": "${ALARM_RESOURCE}"
        },
       {
          "name": "集群",
          "value": "${CLUSTER_NAME}"
        },
        {
          "name": "节点IP",
          "value": "${NODE_IP}"
        },
        {
          "name": "命名空间",
          "value": "${NAMESPACE}"
        },
        {
          "name": "报警器",
          "value": "${ALARM_NAME}"
        },
        {
          "name": "报警级别",
          "value": "${EMERGENCY_LEVEL}"
        },
        {
          "name": "报警触发条件",
          "value": "${ALARM_METRIC} ${COMPARISON_OPERATOR} ${ALARM_THRESHOLD}"
        },
        {
          "name": "当前值",
          "value": "${CURRENT_VALUE}"
        },
        {
          "name": "报警时间",
          "value": "${ALARM_TIME}"
        },
        {
          "name": "项目",
          "value": "${PROJECT_NAME}"
        },
      ]
    }
    Note: 文本中 ${} 包裹的变量将在发送时被实际报警数据自动替换,以生 成动态告警内容。若 ${} 包裹的变量为系统不支持项,将原样以字符串发送。系统支持变量如下:
    • ${ALARM_RESOURCE_TYPE}:资源类型
    • ${ALARM_RESOURCE}:报警资源
    • ${CLUSTER_NAME}:集群名称
    • ${NODE_IP}:节点 IP 地址
    • ${NAMESPACE}:命名空间
    • ${ALARM_NAME}:报警器名称
    • ${EMERGENCY_LEVEL}:报警级别
    • ${ALARM_METRIC}:报警条目
    • ${COMPARISON_OPERATOR}:报警比较运算符
    • ${ALARM_THRESHOLD}:报警阈值
    • ${CURRENT_VALUE}:指标当前值
    • ${ALARM_TIME}:报警触发时间
    • ${PROJECT_NAME}:项目名称
  • 报警恢复文本:设置报警恢复消息内容模板。请输入符合 JSON 格式的恢复消息文本,用于定义 Webhook 通知的内容结构。系统提供示例模板,用户可参考示例模板按需填写:
    {
      "facts": [
        {
          "name": "报警恢复详情",
          "value": null
        },
        {
          "name": "资源类型",
          "value": "${ALARM_RESOURCE_TYPE}"
        },
       {
          "name": "报警资源",
          "value": "${ALARM_RESOURCE}"
        },
       {
          "name": "集群",
          "value": "${CLUSTER_NAME}"
        },
        {
          "name": "节点IP",
          "value": "${NODE_IP}"
        },
        {
          "name": "命名空间",
          "value": "${NAMESPACE}"
        },
        {
          "name": "报警器",
          "value": "${ALARM_NAME}"
        },
        {
          "name": "报警级别",
          "value": "${EMERGENCY_LEVEL}"
        },
        {
          "name": "恢复触发条件",
          "value": "${ALARM_METRIC} ${COMPARISON_OPERATOR_RECOVERY} ${ALARM_THRESHOLD}"
        },
        {
          "name": "最早报警时间",
          "value": "${FIRST_ALARM_TIME}"
        },
       {
          "name": "报警恢复时间",
          "value": "${ALARM_RECOVERY_TIME}"
        },
        {
          "name": "项目",
          "value": "${PROJECT_NAME}"
        },
      ]
    }
    Note: 文本中 ${} 包裹的变量将在发送时被实际报警恢复数据自动替换,以生成动态恢复消息内容。若 ${} 包裹的变量为系统不支持项,将原样以字符串发送。系统支持变量如下:
    • ${ALARM_RESOURCE_TYPE}:资源类型
    • ${ALARM_RESOURCE}:报警资源
    • ${CLUSTER_NAME}:集群名称
    • ${NODE_IP}:节点 IP 地址
    • ${NAMESPACE}:命名空间
    • ${ALARM_NAME}:报警器名称
    • ${EMERGENCY_LEVEL}:报警级别
    • ${ALARM_METRIC}:报警条目
    • ${COMPARISON_OPERATOR_RECOVERY}:恢复比较运算符
    • ${ALARM_THRESHOLD}:报警阈值
    • ${FIRST_ALARM_TIME}:最早报警时间
    • ${ALARM_RECOVERY_TIME}:报警恢复时间
    • ${PROJECT_NAME}:项目名称
  • 默认模板:选择是否将该模板设置为默认模板,设置后,当前项目下未配置消息模板的Webhook类型通知对象的消息将按该模板发送
图 1所示:
图 1. 创建消息模板


管理消息模板

ZStack Zaku主菜单,点击容器运维 > 报警服务 > 消息模板,进入消息模板界面。

消息模板支持以下操作:
操作 描述
创建消息模板 创建一个新的消息模板。
修改 修改消息模板,除类型外其余内容均可修改。
设为默认 将消息模板设为默认模板,同一个项目同一种类型只能有一个默认模板,设为默认模板后,当前项目未设置消息模板的Webhook类型通知对象将使用该模板发送报警消息。
删除 将消息模板删除。
Note:
  • 删除消息模板后,原使用该模板的 Webhook 通知对象,将自动切换为当前项目的默认模板发送告警消息。
  • 若删除的是默认消息模板,未配置模板的 Webhook 通知对象,将自动采用系统内置模板发送告警。

操作记录

当前任务

ZStack Zaku主菜单,点击容器运维 > 操作记录 > 当前任务,进入当前任务界面。

该页面展示当前正在进行中的操作信息,包括操作描述、操作资源、资源数量、任务进度、操作员、创建时间。

图 1所示:
图 1. 当前任务


用户可在该页面进行搜索筛选和当前任务统一管理:
  • 支持通过操作描述、操作资源、操作员搜索当前任务。
  • 支持查看任务详情。
  • 支持调整每页显示的进行中任务数量,可选值为:10、20、50、100,且支持翻页操作。

操作历史

操作历史展示已完成的操作,提供集中查看和管理。

ZStack Zaku主菜单,点击容器运维 > 操作记录 > 操作历史,进入操作历史界面。

该页面展示所有已完成操作信息,包括作描述、操作资源、资源数量、任务结果、操作员、创建时间、完成时间。

图 1所示:
图 1. 操作历史


用户可在该页面进行搜索筛选和历史任务集中管理:
  • 支持选择时间段,查看所选时间段已完成操作的日志。可选的时间段包括:最近3天、最近7天、最近1个月、自定义,默认展示最近3天的日志。
  • 支持通过操作描述、操作资源、操作员、任务结果搜索历史日志。
  • 支持按创建时间/完成时间对已完成的操作进行排序。
  • 支持调整每页显示的已完成操作日志数量,可选值为:10、20、50、100,且支持翻页操作。