文档目录

概述

监控报警功能支持对时序化数据和事件进行监控,并通过通知服务(SNS)推送报警消息至指定的通知对象。支持资源报警器、事件报警器和扩展报警器三种报警器类型,支持系统/邮箱/钉钉/企业微信/飞书/Webhook/短信/Microsoft Teams/SNMP Trap接收端通知对象类型,部分资源报警器需安装性能优化工具才能使用。

监控报警功能示意图如图 1所示:
图 1. 监控报警功能


基本原理

  • 监控系统:
    监控系统提供以下功能:
    • 时序化监控:目前支持监控两种时序化数据类型:
      • 资源负载数据:例如云主机CPU使用率、物理机内存使用率等。
      • 资源容量数据:例如可用IP数量、运行中云主机的总数量等。
    • 事件收集:收集云平台中发生的预定义事件,例如物理机失联,云主机高可用功能启动等。
    • 报警功能:对时序化数据或事件进行报警。
    • 审计功能:记录所有操作并提供搜索。
    • 自定义功能:用户可自定义设置报警器和报警消息模板。
      • 报警器:目前支持以下报警器类型:
        • 资源报警器:对时序化数据进行报警。例如:对云主机CPU使用率设置一个报警器,当某云主机CPU使用率连续5分钟超过80%,以邮件方式报警。
        • 事件报警器:对事件进行报警,又称为事件订阅。例如:订阅物理机失联事件,当某个物理机失联后,以钉钉方式报警。
        • 扩展报警器:接收来自消息源的报警消息。例如:存储池降级,当某个Ceph企业版的存储池降级后,在云平台以系统方式报警。
      • 消息模板:报警器或事件向SNS系统的主题发送消息时使用的文本模板。
        • 系统自带一个报警消息和恢复消息默认模板,若用户没有创建模板,系统将使用自带模板。
        • 用户可以创建多个消息模板,但只能指定一个为默认模板,发送消息时只会使用默认模板格式化信息。
        • 模板中可以通过${}引用报警器或事件提供的变量。
        • 目前消息模板支持邮箱/钉钉/企业微信/飞书/Webhook/Microsoft Teams/短信七种通知对象平台。使用消息模板,可将通知邮件、钉钉消息、企业微信消息、飞书消息、Webhook、Microsoft Teams消息或短信以统一格式发出。
      • 消息源:用于连接扩展消息源,接管扩展报警消息并结合报警器统一推送至各类通知对象。方便报警消息统一管理的同时提高运维效率,目前支持接管Ceph企业版的报警消息。

  • 通知服务(SNS):

    通知服务将报警消息推送至通知对象,通知对象类型包括:系统/邮箱/钉钉/Webhook/短信/Microsoft Teams/企业微信/飞书/SNMP Trap接收端。

    通知对象设置:
    • 系统默认提供一个系统类型通知对象,若报警器绑定系统类型通知对象,UI界面右上角的最近消息按钮处会出现弹窗提醒。
    • 用户也可自行创建邮箱/钉钉/企业微信/飞书/Webhook/短信/Microsoft Teams/SNMP Trap接收端类型通知对象。

功能优势

ZStack Cloud监控系统具有以下功能优势:
  • 提供丰富的报警监控条目,对云平台核心资源以及事件进行全面监控报警;
  • 支持系统/邮箱/钉钉/企业微信/飞书/Webhook/短信/Microsoft Teams/SNMP Trap接收端通知对象用于订阅主题,用户可根据实际情况选择合适的报警接收方式;
  • 一个报警器可同时对多个资源进行监控;
  • 邮箱、钉钉、企业微信、飞书、短信、Webhook和Microsoft Teams通知对象支持自定义报警消息模板,用户可按需设置报警消息模板,从报警消息中快速定位关键信息。
  • 支持创建一组报警器规则的通用模板,关联资源分组后,将对组内资源创建相应的报警器进行监控。

典型应用场景

监控报警功能对云平台核心资源以及事件进行监控,并设置报警接收机制。当核心资源出现异常,监控报警控工将按照报警级别发出实时响应,帮助运维人员快速定位解决问题。

准备工作

  • admin请提前安装最新版本ZStack Cloud,并部署完成创建云主机必要的资源。
  • 部分报警条目需安装性能优化工具才能进行监控报警。
  • 扩展报警器需要提前创建消息源。

订阅客户端

使用监控报警功能需预先准备订阅客户端,按照通知对象不同分为以下类型:
  • 邮箱通知对象:需预先添加邮箱服务器,报警消息将以邮件方式通过邮箱服务器发送到指定的邮箱地址。
  • 钉钉通知对象:需预先添加钉钉群机器人,报警消息将以钉钉方式发送到指定的钉钉机器人地址。
  • 企业微信通知对象:需预先添加企业微信群机器人,报警消息将以企业微信方式发送到指定的企业微信机器人地址。
  • 飞书通知对象:需预先添加飞书群机器人,报警消息将以飞书方式发送到指定的飞书机器人地址。
  • Webhook通知对象:需预先准备Webhook地址,报警消息将以HTTP POST方式发送到指定的HTTP地址。
  • 短信通知对象:需在短信服务提供方开通短信服务。阿里云短信需额外在阿里云申请包含短信服务的Access Key,并申请短信报警模板。报警消息将以短信方式发送到指定的电话号码。
  • Microsoft Teams通知对象:需预先在Microsoft Teams获取Webhook地址,报警消息将以Webhook方式发送到指定的Microsoft Teams团队或频道。
  • SNMP Trap接收端通知对象:需预先开启云平台SNMP管理功能,并添加SNMP Trap接收端,报警消息将以Trap报文方式发送到SNMP Trap接收端。

具体添加方式如下:

邮箱通知对象|添加邮箱服务器

在ZStack Cloud主菜单,点击设置 > 系统设置 > 邮箱服务器,进入邮箱服务器界面,点击添加邮箱服务器按钮,在弹出的添加邮箱服务器界面,可参考以下示例输入相应内容:
  • 名称:设置邮箱服务器名称
  • 简介:可选项,可留空不填
  • 用户名:输入用户名
  • 密码:输入用户名对应的密码
  • 邮箱服务器类型:系统默认为smtp
  • 邮箱服务器:输入邮箱服务器地址
  • 邮箱服务器端口:输入邮箱服务器端口,默认为25
  • 加密类型:可选项,支持对邮箱服务器端口设置加密连接,加密类型有:STARTTLS、SSL/TLS、NONE
    Note:
    • 默认选择STARTTLS加密类型,端口25;
    • 选择SSL/TLS加密类型时,端口默认465;
    • 若SMTP服务器不使用加密连接,可选择NONE。
如图 2所示:
图 2. 添加邮箱服务器


点击确定按钮,系统会自动检测用户名、密码、邮箱服务器、邮箱服务器端口、加密类型是否正确,等待时间不超过5秒。若填写有误,请根据右上角消息提示修改后重新提交;若确认无误将返回到邮箱服务器界面,邮箱服务器添加成功。

钉钉通知对象|添加钉钉群机器人

以电脑版钉钉为例,选择一个钉钉群,点击右上角群设置按钮,点击群管理 > 机器人 > 添加机器人按钮,选择自定义机器人,如图 3所示:
图 3. 添加自定义机器人


点击添加 > 下一步按钮,设置机器人名称和安全设置。
Note: 钉钉机器人支持三种安全设置:
  • 自定义关键词:ZStack Cloud暂不支持发送包含指定关键词的报警消息,因此,请勿选择该安全设置,避免报警消息无法正常发送。
  • 加签:选择该方式将获取加签密钥,用户需将该密钥正确填写到ZStack Cloud创建通知对象界面,确保钉钉正常接收ZStack Cloud报警消息。
  • IP地址(段):选择该方式,用户需将ZStack Cloud管理节点IP地址和VIP地址全部添加到机器人的IP白名单,确保钉钉正常接收ZStack Cloud报警消息。
点击完成,获取钉钉机器人地址,如图 4所示:
图 4. 钉钉机器人地址


对于已添加完成的自定义钉钉机器人,用户也可在机器人设置页面获取钉钉机器人地址和加签密钥。

企业微信通知对象|添加企业微信群机器人

以电脑版企业微信为例,选择一个企业微信群,点击群设置按钮,选择添加群机器人 > 新创建一个机器人。设置机器人名称,并点击添加机器人,即可完成机器人添加,并获取机器人Webhook。

如图 5、图 6所示:
图 5. 添加企业微信机器人


图 6. 企业微信机器人地址


对于已添加完成的机器人,用户也可点击机器人头像,查看机器人地址。

飞书通知对象|添加飞书群机器人

以电脑版飞书为例,选择一个飞书群,点击群设置按钮,选择群机器人 > 添加机器人 > 自定义机器人:
  1. 设置自定义机器人基本信息,包括:机器人头像、机器人名称、描述,并点击添加。
  2. 获取机器人Webhook地址,并对机器人进行安全设置,飞书机器人支持三种安全设置:
    • 自定义关键词:ZStack Cloud暂不支持发送包含指定关键词的报警消息,因此,请勿选择该安全设置,避免报警消息无法正常发送。
    • 签名校验:选择该方式将获取加签密钥,用户需将该密钥正确填写到ZStack Cloud创建通知对象界面,确保飞书正常接收ZStack Cloud报警消息。
    • IP白名单:选择该方式,用户需将ZStack Cloud管理节点IP地址和VIP地址全部添加到机器人的IP白名单,确保飞书正常接收ZStack Cloud报警消息。

如图 7所示:

图 7. 添加飞书群机器人




Webhook通知对象|准备Webhook地址

使用Webhook通知对象需提前准备Webhook地址,当报警器触发时,Webhook地址将收到HTTP POST方式发来的报警消息。

短信通知对象|开通第三方短信服务

  • 以阿里云为例:
    1. 申请第三方AccessKey

      在阿里云申请包含短信服务的AccessKey。

    2. 申请阿里云短信服务
      以阿里云为例,在阿里云界面申请短信签名和短信模板,如图 8所示:
      图 8. 阿里云申请短信签名和模板


      Note: 需按照ZStack Cloud短信模板示例申请阿里云短信模板。
  • 以亿美软通为例,需从亿美软通供应商获得短信服务APPId、密钥和RequestUrl。

Microsoft Teams通知对象丨添加Webhook应用

以电脑版Microsoft Teams为例,点击左下角应用按钮,在应用页面中搜索Incoming Webhook,如图 9所示:
图 9. 搜索Webhook应用


点击Incoming Webhook卡片,在弹出的Incoming Webhook页面中点击添加到团队按钮,如图 10所示:
图 10. 添加到团队


选择需要接收报警消息的团队,点击设置连接器按钮,在弹出的设置连接器页面中自定义连接器的名称和图像,如图 11所示:
图 11. 设置连接器


设置完成后点击创建按钮,即可生成对应的Webhook地址,如图 12所示:
图 12. 获取Webhook地址


将地址复制并妥善保存后点击完成按钮,即可将Webhook应用添加至团队中。

SNMP Trap接收端通知对象 | 启用SNMP管理并添加SNMP Trap接收端

在ZStack Cloud主菜单,点击设置 > 系统设置 > SNMP管理,进入SNMP管理界面,点击去启用,弹出启用SNMP管理界面。

可参考以下示例输入相应内容:
  • SNMP Agent端口:指定SNMP Agent端口,用于接收并响应第三方监控平台发送的请求
    Note: SNMP Agent端口配置在云平台管理节点上,默认为1161,取值范围:1024-65565。
  • SNMP协议类型:选择SNMP协议类型,支持v2c、v3两种协议类型
    • 如选择v2c类型,需设置以下参数:
      • 团体字:设置团体字,用于第三方监控平台与云平台的连接认证
    • 如选择v3类型,请设置以下参数:
      • 用户名:设置用户名
      • 用户鉴权:可选项,开启第三方监控平台与云平台间的安全认证。开启后,需设置以下参数:
        • 鉴权协议:选择鉴权协议,支持MD5、SHA、SHA224、SHA256、SHA384、SHA512
        • 鉴权密码:设置鉴权密码
        • 确认鉴权密码:再次输入鉴权密码以保证准确性
      • 数据加密:可选项,需先开启用户鉴权后才可开启,需设置以下参数:
        • 加密协议:选择加密协议,支持DES、AES128、AES192、AES256、3DES
        • 加密密码:设置加密密码
        • 确认加密密码:再次输入加密密码以确保准确性
  • SNMP Trap接收端:可选项,填写第三方服务器名称、IP地址和端口,用于接收云平台推送的报警消息
如图 13所示:
图 13. 启用SNMP管理并添加SNMP Trap接收端


典型使用流程

准备工作完成后,可按照如下步骤部署监控报警:
  1. 按照通知对象类型预先准备订阅客户端,用于接收报警消息。如何创建订阅客户端请参考订阅客户端章节。
  2. 创建通知对象,用于订阅第一步中的客户端。
  3. 创建报警器,用于监控系统状态,支持用户自定义报警消息模板。

典型场景实践

ZWatch监控系统列举了以下几个典型场景实践:
  • 邮箱通知对象资源报警器场景
  • 钉钉报警器资源报警器场景
  • Webhook通知对象事件报警器场景
  • 企业微信通知对象事件报警器场景
  • 飞书通知对象事件报警器场景
  • 短信通知对象资源报警器场景
  • Microsoft Teams通知对象资源报警器场景
  • 扩展报警器场景

邮箱通知对象资源报警器

背景信息

场景设定:假定某企业因业务需要,需批量监控三台云主机的网卡入速度要求当任意一台云主机网卡入速度超过100Mbps时,即按照指定报警消息模板,发送报警消息至邮箱,只报警一次且不发送报警恢复消息。

具体实践流程如下:
  • 添加邮箱服务器;
  • 创建邮箱通知对象;
  • 创建报警消息模板并设置为默认;
  • 创建资源报警器;
  • 验证报警器是否生效。

操作步骤

  1. 添加邮箱服务器

    参考本教程订阅客户端章节,添加邮箱服务器。

  2. 创建邮箱通知对象

    参考《用户手册》创建通知对象章节,创建邮箱通知对象。

  3. 创建报警消息模板

    参考《用户手册》创建消息模板章节,创建报警消息模板。

  4. 创建资源报警器
    在ZStack Cloud主菜单,点击平台运维 > 云平台监控 > 报警服务 > 报警器,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
    • 名称:设置资源报警器名称
    • 简介:可选项,可留空不填
    • 资源类型:选择云主机
    • 报警条目:选择云主机网卡入速度
    • 云主机:将需要监控的三台云主机添加至列表
    • 报警触发规则:选择>100Mbps,持续5分钟
    • 报警间隔:选择仅一次
    • 报警级别:设置为紧急
    • 开启报警恢复通知:不开启
    • 通知对象:选择已创建的邮箱通知对象
    如图 14所示:
    图 14. 创建资源报警器


  5. 报警结果验证
    当任意一台云主机达到报警条件时,报警触发,邮件通知对象将收到报警邮件,且报警器页面报警状态变为已触发,如图 15所示:
    图 15. 邮件通知对象报警


后续操作

至此,邮箱通知对象资源报警器介绍完毕。

钉钉通知对象资源报警器

背景信息

场景设定:假定某用户使用云主机存储重要数据,需要监控云主机的全部磁盘剩余容量,当全部磁盘剩余容量小于100GB时,即持续发送报警消息至钉钉,并在容量恢复正常时发送报警恢复消息,此报警条目要求云主机中安装性能优化工具。

具体实践流程如下:
  • 添加钉钉群机器人;
  • 创建钉钉通知对象;
  • 在监测云主机中安装性能优化工具;
  • 创建资源报警器;
  • 验证报警器是否生效。

操作步骤

  1. 添加钉钉群机器人

    参考本教程订阅客户端章节,添钉钉群机器人。

  2. 创建钉钉通知对象

    参考《用户手册》创建通知对象章节,创建钉钉通知对象。

  3. 在监测云主机中安装性能优化工具

    参考《用户手册》的云主机性能优化工具章节,在监测云主机中安装性能优化工具。

  4. 创建资源报警器
    在ZStack Cloud主菜单,点击平台运维 > 云平台监控 > 报警服务 > 报警器,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
    • 名称:设置资源报警器名称
    • 简介:可选项,可留空不填
    • 资源类型:选择云主机
    • 报警条目:选择云主机全部磁盘剩余容量(需安装性能优化工具)
    • 云主机:选择需要监控的云主机
    • 报警触发规则:选择<100GB,持续10分钟
    • 报警间隔:选择每30分钟
    • 报警恢复通知:开启,在报警恢复后将收到报警恢复通知
    • 报警级别:选择紧急
    • 通知对象:选择已创建的钉钉通知对象
    如图 16所示:
    图 16. 创建资源报警器


  5. 报警结果验证
    当云主机达到报警条件时,报警触发,钉钉通知对象将收到报警消息,且报警器页面报警状态变为已触发。如果超过报警间隔时间后,依然满足报警条件,将再次收到报警消息。如图 17所示:
    图 17. 钉钉通知对象报警


    当云主机从报警状态恢复时,钉钉通知对象将收到报警恢复消息,且报警器页面报警状态变为监控中,如图 18所示:
    图 18. 钉钉通知对象报警恢复


后续操作

至此,钉钉通知对象资源报警器介绍完毕。

企业微信通知对象事件报警器

背景信息

场景设定:假定某公司需监控主存储健康状态,当主存储处于失联状态时,需发送报警消息到企业微信,提示运维人员及时处理。

具体实践流程如下:
  • 添加企业微信群机器人;
  • 创建企业微信通知对象;
  • 创建事件报警器;
  • 验证报警器是否生效。

操作步骤

  1. 添加企业微信群机器人

    参考本教程订阅客户端章节,添企业微信群机器人。

  2. 创建企业微信通知对象

    参考《用户手册》创建通知对象章节,创建企业微信通知对象。

  3. 创建事件报警器
    在ZStack Cloud主菜单,点击平台运维 > 云平台监控 > 报警服务 > 报警器,进入报警器界面,点击创建事件报警器,弹出创建事件报警器界面,可参考以下示例输入相应内容:
    • 资源类型:选择报警资源类型,此处选择主存储
    • 报警条目:选择报警条目,此处选择主存储未连接
    • 报警级别:选择报警级别,此处选择紧急
    • 通知对象:选择已创建的企业微信通知对象
    如图 19所示:
    图 19. 创建事件报警器


  4. 报警结果验证
    当主存储失联时,报警触发,企业微信通知对象将收到报警消息,如果再次满足报警条件,将再次收到报警消息。如图 20所示:
    图 20. 企业微信通知对象报警


后续操作

至此,企业微信通知对象事件报警器介绍完毕。

飞书通知对象事件报警器

背景信息

场景设定:假定某公司需监控物理机健康状态,当物理机处于失联状态时,需发送报警消息到飞书,提示运维人员及时处理。

具体实践流程如下:
  • 添加飞书群机器人;
  • 创建飞书通知对象;
  • 创建事件报警器;
  • 验证报警器是否生效。

操作步骤

  1. 添加飞书群机器人

    参考本教程订阅客户端章节,添飞书群机器人。

  2. 创建飞书通知对象

    参考《用户手册》创建通知对象章节,创建飞书通知对象。

  3. 创建事件报警器
    在ZStack Cloud主菜单,点击平台运维 > 云平台监控 > 报警服务 > 报警器,进入报警器界面,点击创建事件报警器,弹出创建事件报警器界面,可参考以下示例输入相应内容:
    • 资源类型:选择报警资源类型,此处选择物理机
    • 报警条目:选择报警条目,此处选择物理机未连接
    • 报警级别:选择报警级别,此处选择紧急
    • 通知对象:选择已创建的飞书通知对象
    如图 21所示:
    图 21. 创建事件报警器


  4. 报警结果验证
    当主存储失联时,报警触发,飞书通知对象将收到报警消息,如果再次满足报警条件,将再次收到报警消息。如图 22所示:
    图 22. 飞书通知对象报警


后续操作

至此,飞书通知对象资源报警器介绍完毕。

Webhook通知对象事件报警器

前提条件

场景设定:假定某企业需监控关键物理机状态,若发生物理机失联,即发送报警消息至指定Webhook地址,以便运维人员及时处理。

具体实践流程如下:
  • 准备Webhook通知对象地址;
  • 创建Webhook类型通知对象;
  • 创建事件报警器;
  • 验证报警器是否生效。

操作步骤

  1. 准备Webhook通知对象地址

    提前准备Webhook地址,当报警器触发时,Webhook通知对象将收到HTTP POST方式发来的报警消息。

  2. 创建Webhook类型通知对象

    参考《用户手册》创建通知对象章节,创建Webhook类型通知对象。

  3. 创建事件报警器
    在ZStack Cloud主菜单,点击平台运维 > 云平台监控 > 报警服务 > 报警器 > 事件报警器,进入事件报警器界面,点击创建事件报警器,在弹出的创建事件报警器界面,可参考以下示例输入相应内容:
    • 资源类型:选择物理机
    • 报警条目:选择物理机失联
    • 报警级别:选择紧急
    • 通知对象:选择已创建的Webhook通知对象
    如图 23所示:
    图 23. 创建事件报警器


  4. 报警结果验证

    当事件报警器达到报警条件时,报警触发,Webhook通知对象将收到报警消息,如果再次满足报警条件,将再次收到报警消息。如图 24所示:

    图 24. Webhook通知对象报警


后续操作

至此,Webhook通知对象事件报警器介绍完毕。

阿里云短信通知对象资源报警器

背景信息

场景设定:某企业需保证核心物理机的运行稳定,需监控物理机的CPU使用率,当CPU使用率大于50%时,即通过短信发送报警消息,方便运维人员进行维护。

具体实践流程如下:
  • 申请阿里云AccessKey;
  • 申请阿里云短信服务;
  • 创建阿里云短信报警消息模板;
  • 创建阿里云短信通知对象
  • 创建资源报警器;
  • 验证报警器是否生效。

操作步骤

  1. 申请阿里云AccessKey

    在阿里云申请包含短信服务的AccessKey。

  2. 申请阿里云短信服务
    在阿里云界面申请短信签名和短信模板,如图 25所示:
    图 25. 阿里云申请短信签名和模板


    Note: 需按照ZStack Cloud短信模板示例申请阿里云短信模板。
  3. 创建阿里云短信报警消息模板

    参考《用户手册》创建消息模板章节,创建阿里云短信报警消息模板。

  4. 创建短信通知对象

    参考《用户手册》创建通知对象章节,创建阿里云短信通知对象。

  5. 创建资源报警器
    在ZStack Cloud主菜单,点击平台运维 > 云平台监控 > 报警服务 > 报警器,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
    • 名称:设置资源报警器名称
    • 简介:可选项,可留空不填
    • 资源类型:选择物理机
    • 报警条目:选择物理机CPU使用率
    • 物理机:选择需要监控的物理机
    • 报警触发规则:选择>50%,持续10分钟
    • 报警间隔:选择每30分
    • 报警级别:选择紧急
    • 报警恢复通知:开启,在报警恢复后将收到报警恢复通知
    • 通知对象:选择已创建的短信通知对象
    如图 26所示:
    图 26. 创建资源报警器


  6. 报警结果验证
    当资源报警器达到报警条件时,报警触发,短信通知对象将收到报警消息,且报警器页面报警状态变为已触发。如果超过报警间隔时间后,依然满足报警条件,将再次收到报警消息。如图 27所示:
    图 27. 短信通知对象报警


后续操作

至此,阿里云短信通知对象资源报警器介绍完毕。

亿美软通短信通知对象资源报警器

背景信息

场景设定:某企业需保证核心物理机的运行稳定,需监控物理机的CPU使用率,当CPU使用率大于50%时,即通过短信发送报警消息,方便运维人员进行维护。

具体实践流程如下:
  • 申请亿美软通短信服务;
  • 创建通用短信报警消息模板;
  • 创建亿美软通短信通知对象
  • 创建资源报警器;
  • 验证报警器是否生效。

操作步骤

  1. 申请亿美软通短信服务

    向亿美软通服务商申请短信服务,并获取短信服务所需的AppId、SecretKey和RequestUrl。

  2. 创建通用短信报警消息模板

    参考《用户手册》创建消息模板章节,创建通用短信报警消息模板。

  3. 创建亿美软通短信通知对象

    参考《用户手册》创建通知对象章节,创建亿美软通短信通知对象。

  4. 创建资源报警器
    在ZStack Cloud主菜单,点击平台运维 > 云平台监控 > 报警服务 > 报警器,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
    • 名称:设置资源报警器名称
    • 简介:可选项,可留空不填
    • 资源类型:选择物理机
    • 报警条目:选择物理机CPU使用率
    • 物理机:选择需要监控的物理机
    • 报警触发规则:选择>50%,持续10分钟
    • 报警间隔:选择每30分
    • 报警级别:选择紧急
    • 报警恢复通知:开启,在报警恢复后将收到报警恢复通知
    • 通知对象:选择已创建的短信通知对象
    如图 28所示:
    图 28. 创建资源报警器


  5. 报警结果验证
    当资源报警器达到报警条件时,报警触发,短信通知对象将收到报警消息,且报警器页面报警状态变为已触发。如果超过报警间隔时间后,依然满足报警条件,将再次收到报警消息。如图 29所示:
    图 29. 短信通知对象报警


后续操作

至此,亿美软通短信通知对象资源报警器介绍完毕。

Microsoft Teams通知对象资源报警器

背景信息

场景设定:某国外企业为保证核心业务云主机运行稳定,需监控云主机内存已用百分比,当内存已用百分比大于80%时,即通过Microsoft Teams接收报警消息,方便运维人员进行维护。

具体实践流程如下:
  • 获取Microsoft Teams的Webhook地址;
  • 创建Microsoft Teams报警消息模板;
  • 创建Microsoft Teams通知对象;
  • 创建资源报警器;
  • 验证报警器是否生效。

操作步骤

  1. 获取Microsoft Teams的Webhook地址

    在Microsoft Teams团队中添加Webhook应用,获取Webhook地址,详情请参考订阅客户端的Microsoft Teams通知对象丨添加Webhook应用章节。

  2. 创建Microsoft Teams报警消息模板

    参考参考《用户手册》创建消息模板章节,创建报警消息模板。

  3. 创建Microsoft Teams通知对象

    参考《用户手册》创建通知对象章节,创建Microsoft Teams通知对象。

  4. 创建资源报警器
    在ZStack Cloud主菜单,点击平台运维 > 云平台监控 > 报警服务 > 报警器,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
    • 名称:设置资源报警器名称
    • 简介:可选项,可留空不填
    • 资源类型:选择云主机
    • 报警条目:选择云主机内存已用百分比
    • 云主机:选择需要监控的云主机
    • 报警触发规则:选择>80%,持续1分钟
    • 报警间隔:选择每30分
    • 报警级别:设置为紧急
    • 开启报警恢复通知:不开启
    • 通知对象:选择已创建的Microsoft Teams通知对象
    如图 30所示:
    图 30. 创建资源报警器


  5. 报警结果验证
    当资源报警器达到报警条件时,报警触发,Microsoft Teams通知对象将收到报警消息,且报警器页面报警状态变为已触发。如果超过报警间隔时间后,依然满足报警条件,将再次收到报警消息。如图 31所示:
    图 31. Microsoft Teams通知对象报警


后续操作

至此,Microsoft Teams通知对象资源报警器介绍完毕。

扩展报警器

背景信息

场景设定:某企业使用企业版存储,需在云平台监控企业版存储的健康状态。当企业版存储触发报警时,云平台系统通知对象也需要同步接收报警消息,方便运维人员进行维护。

具体实践流程如下:
  • 在企业版存储页面获取访问令牌;
  • 创建消息源;
  • 创建扩展报警器;
  • 验证报警器是否生效。

操作步骤

  1. 在企业版存储页面获取访问令牌
    在企业版存储管理页面,点击设置 > 访问令牌,进入访问令牌页面,点击生成按钮,即可生成访问令牌,如图 32所示:
    图 32. 生成访问令牌


  2. 创建消息源

    参考《用户手册》消息源章节,创建消息源。

  3. 创建扩展报警器

    在ZStack Cloud主菜单,点击平台运维 > 云平台监控 > 报警服务 > 报警器 > 扩展报警器,进入扩展报警器界面,点击创建扩展报警器,弹出创建扩展报警器界面,可参考以下示例输入相应内容:

    • 名称:设置扩展报警器的名称
    • 消息源:选择刚创建的消息源
    • 通知对象:选择系统通知对象
    如图 33所示:
    图 33. 创建扩展报警器


  4. 报警结果验证

    当企业版存储触发报警时,云平台系统将收到扩展报警消息,且在消息中心中进行记录。如果再次满足报警条件,将再次收到报警消息。

后续操作

至此,扩展报警器介绍完毕。

使用建议

  • 考虑到监控数据会占用一定系统资源,建议云平台相关资源按照如下配置:
    • 独立规划物理服务器作为云平台管理节点。
    • 考虑到监控数据可能会周期性消耗系统盘IO资源,建议使用SSD作为管理节点系统盘。
    • 为避免监控数据过大导致系统盘使用率过大,系统盘空间建议规划1T以上。
    • 若系统盘空间小于500G,则建议在全局设置中设置以下监控项:
      • 监控数据保留周期设置为1个月。
      • 监控数据保留大小设置为2的幂次方,例如32G、64G、128G。
  • 根据环境规模按需使用zstack-ctl set-deployment命令设置集群部署资源规模。不同资源数量的推荐规模如下:
    • default:默认环境,物理机数量50台以内时无需设置。
    • small:小型环境,物理机数量100以内,或云主机数量1000以内推荐使用该设置。
    • medium:中型环境,物理机数量400以内,或云主机数量4000以内推荐使用该设置。
    • large:大型环境,物理机数量1000以内,或云主机数量10000以内推荐使用该设置。

附录

资源报警条目

默认报警条目

物理机

资源类型 默认报警器 报警条目 描述
物理机 物理机根盘使用率报警器 物理机根盘使用率≥80%
  • 默认监控云平台所有物理机。
  • 任意物理机根盘使用率大于等于80%,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。

镜像服务器

资源类型 默认报警器 报警条目 描述
镜像服务器 镜像服务器存储可用容量报警器 镜像存储可用容量百分比<20%
  • 默认监控云平台所有镜像服务器。
  • 任意镜像服务器可用容量百分比小于20%,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。

主存储

资源类型 默认报警器 报警条目 描述
主存储 主存储可用容量报警器 该主存储可用容量百分比<20%
  • 默认监控云平台所有主存储。
  • 任意主存储可用容量百分比小于20%,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
主存储可用物理容量报警器 该主存储可用物理容量百分比<20%
  • 默认监控云平台所有主存储。
  • 任意主存储可用物理容量百分比小于20%,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。

管理节点

资源类型 默认报警器 报警条目 描述
管理节点 双管理节点数据库不同步报警器 双管理节点数据库不同步
  • 默认监控双管理节点环境数据库状态。
  • 若持续1小时检测到双管理节点数据库存在数据不同步,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
仲裁IP不可达报警器 仲裁IP不可达
  • 默认监控双管理节点环境仲裁IP状态。
  • 若持续10分钟检测到仲裁IP不可达,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。

系统数据目录

资源类型 默认报警器 报警条目 描述
系统数据目录 系统数据目录磁盘容量报警器 管理节点数据目录磁盘占用率≥70%
  • 默认监控云平台所有数据目录磁盘容量。
  • 任意管理节点数据目录磁盘占用率大于等于70%,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。

许可证

资源类型 默认报警器 报警条目 描述
许可证 许可证过期时间报警器 默认许可证过期时间≤15天
  • 默认监控云平台许可证、模块许可证和分布式存储许可证。
  • 任意许可证过期时间小于等于15天,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。

CDP任务

资源类型 默认报警器 报警条目 描述
CDP任务(需拥有持续数据保护CDP模块许可证) CDP任务已用容量报警器 CDP任务已用容量占规划容量百分比>80%
  • 默认监控云平台内所有CDP任务已用容量占规划容量的百分比。
  • 任一CDP任务的已用容量与规划容量的占比超过80%即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
CDP任务RPO偏移报警器 RPO偏移时间>5分钟
  • 默认监控云平台内所有CDP任务的RPO偏移情况。
  • 任一CDP任务的RPO偏移时间超过5分钟即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。

自定义报警条目

云主机

资源类型 子类型 报警条目 描述
云主机 CPU CPU使用率 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的CPU使用率,任一云主机的任一CPU使用率达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定CPU的使用率,达到报警条件即可触发报警。
CPU空闲率 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的CPU空闲率,任一云主机的任一CPU空闲率达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定CPU的空闲率,达到报警条件即可触发报警。
平均CPU使用率 批量监控单台云主机的平均CPU使用率。当所选云主机中,任一云主机的平均CPU使用率达到报警条件,即可触发报警。
全部CPU使用率 批量监控多台云主机的CPU使用率,任一云主机的全部CPU整体使用率达到报警条件即可触发报警。
Note: 全部CPU使用率可能略大于100%。
全部CPU空闲率 批量监控多台云主机的CPU空闲率,任一云主机的全部CPU整体空闲率达到报警条件即可触发报警。
Note: 全部CPU空闲率可能略大于100%。
CPU使用率(需安装agent) 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的CPU使用率,任一云主机的任一CPU使用率达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定CPU的使用率,达到报警条件即可触发报警。
磁盘 磁盘读IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的所有磁盘读IOPS,任一云主机的任一磁盘读IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定磁盘的读IOPS,达到报警条件即可触发报警。
全部磁盘读IOPS 批量监控多个云主机的磁盘读IOPS,任一云主机所有磁盘的读IOPS之和达到报警条件即可触发报警。
磁盘写IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的所有磁盘写IOPS,任一云主机的任一磁盘写IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定磁盘的写IOPS,达到报警条件即可触发报警。
全部磁盘写IOPS 批量监控多个云主机的磁盘写IOPS,任一云主机所有磁盘的写IOPS之和达到报警条件即可触发报警。
磁盘读速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的所有磁盘读速度,任一云主机的任一磁盘读速度达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定磁盘的读速度,达到报警条件即可触发报警。
全部磁盘读速度 批量监控多个云主机的磁盘读速度,任一云主机所有磁盘的读速度之和达到报警条件即可触发报警。
磁盘写速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的所有磁盘写速度,任一云主机的任一磁盘写速度达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定磁盘的写速度,达到报警条件即可触发报警。
全部磁盘写速度 批量监控多个云主机的磁盘写速度,任一云主机所有磁盘的写速度之和达到报警条件即可触发报警。
全部磁盘剩余容量(需安装agent) 批量监控多个云主机的磁盘剩余容量,任一云主机所有磁盘的剩余容量之和达到报警条件即可触发报警。
全部磁盘剩余容量百分比(需安装agent) 批量监控多个云主机的磁盘剩余容量百分比,任一云主机全部磁盘剩余容量百分比(百分比=所有磁盘剩余容量之和/所有磁盘容量之和)达到报警条件即可触发报警。
全部磁盘已使用容量(需安装agent) 批量监控多个云主机的磁盘已使用容量,任一云主机所有磁盘的已使用容量之和达到报警条件即可触发报警。
全部磁盘已使用容量百分比(需安装agent) 批量监控多个云主机的磁盘已使用容量百分比,任一云主机全部磁盘已使用容量百分比(百分比=所有磁盘已使用容量之和/所有磁盘容量之和)达到报警条件即可触发报警。
磁盘已使用容量(需安装agent) 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的磁盘已使用容量,任一云主机的任一磁盘已使用容量达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定磁盘的已使用容量,达到报警条件即可触发报警。
磁盘已使用容量百分比(需安装agent) 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的磁盘已使用容量百分比,任一云主机的任一磁盘已使用容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定磁盘的已使用容量百分比,达到报警条件即可触发报警。
磁盘剩余容量百分比(需安装agent) 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的磁盘剩余容量百分比,任一云主机的任一磁盘剩余容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定磁盘的剩余容量百分比,达到报警条件即可触发报警。
磁盘剩余容量(需安装agent) 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的磁盘剩余容量,任一云主机的任一磁盘剩余容量达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定磁盘的剩余容量,达到报警条件即可触发报警。
网卡 网卡入速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的网卡入速度,任一云主机的任一网卡入速度达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定网卡的入速度,达到报警条件即可触发报警。
全部网卡入速度 批量监控多个云主机的网卡入速度,任一云主机所有网卡入速度之和达到报警条件即可触发报警。
网卡入包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的网卡入包数,任一云主机的任一网卡入包数达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定网卡的入包数,达到报警条件即可触发报警。
全部网卡入包数 批量监控多个云主机的网卡入包数,任一云主机所有网卡入包数之和达到报警条件即可触发报警。
网卡入错误数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的网卡入错误数,任一云主机的任一网卡入错误数达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定网卡的入错误数,达到报警条件即可触发报警。
全部网卡入错误数 批量监控多个云主机的网卡入错误数,任一云主机所有网卡入错误数之和达到报警条件即可触发报警。
网卡出速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的网卡出速度,任一云主机的任一网卡出速度达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定网卡的出速度,达到报警条件即可触发报警。
全部网卡出速度 批量监控多个云主机的网卡出速度,任一云主机所有网卡出速度之和达到报警条件即可触发报警。
网卡出包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的网卡出包数,任一云主机的任一网卡出包数达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定网卡的出包数,达到报警条件即可触发报警。
全部网卡出包数 批量监控多个云主机的网卡出包数,任一云主机所有网卡出包数之和达到报警条件即可触发报警。
网卡出错误数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选云主机的网卡出错误数,任一云主机的任一网卡出错误数达到报警条件即可触发报警。
  • 指定配置:监控某个云主机指定网卡的出错误数,达到报警条件即可触发报警。
全部网卡出错误数 批量监控多个云主机的网卡出错误数,任一云主机所有网卡出错误数之和达到报警条件即可触发报警。
内存 内存空闲容量 批量监控多个云主机的内存空闲容量,任一云主机的内存空闲容量达到报警条件即可触发报警。
内存空闲百分比 批量监控多个云主机的内存空闲百分比,任一云主机的内存空闲百分比达到报警条件即可触发报警。
内存已用容量 批量监控多个云主机的内存已用容量,任一云主机的内存已用容量达到报警条件即可触发报警。
内存已用百分比 批量监控多个云主机的内存已用百分比,任一云主机的内存已用百分比达到报警条件即可触发报警。
内存已用百分比(需安装agent) 批量监控多个云主机的内存已用百分比,任一云主机的内存已用百分比达到报警条件即可触发报警。
其他 云主机数量 监控云平台内所有KVM云主机数量,达到报警条件即可触发报警。
运行云主机数量 监控云平台内所有运行状态的KVM云主机数量,达到报警条件即可触发报警。
运行云主机百分比 监控云平台内所有运行状态的KVM云主机百分比,达到报警条件即可触发报警。
停止云主机数量 监控云平台内所有停止状态的KVM云主机数量,达到报警条件即可触发报警。
停止云主机百分比 监控云平台内所有停止状态的KVM云主机百分比,达到报警条件即可触发报警。
其他状态云主机数量 监控云平台内所有其他状态(不包括:停止/运行)的KVM云主机数量,达到报警条件即可触发报警。
其他状态云主机百分比 监控云平台内所有其他状态(不包括:停止/运行)的KVM云主机百分比,达到报警条件即可触发报警。

裸金属主机

资源类型 子类型 报警条目 描述
裸金属主机(已安装裸金属管理模块许可证) CPU CPU使用率 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有CPU的使用率,任一裸金属主机的任一CPU使用率达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定CPU的使用率,达到报警条件即可触发报警。
磁盘 磁盘读IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有磁盘的读IOPS,任一裸金属主机的任一磁盘读IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定磁盘的读IOPS,达到报警条件即可触发报警。
磁盘写IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有磁盘的写IOPS,任一裸金属主机的任一磁盘写IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定磁盘的写IOPS,达到报警条件即可触发报警。
磁盘读速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有磁盘的读速度,任一裸金属主机的任一磁盘读速度达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定磁盘的读速度,达到报警条件即可触发报警。
磁盘写速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有磁盘的写速度,任一裸金属主机的任一磁盘写速度达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定磁盘的写速度,达到报警条件即可触发报警。
磁盘已使用容量 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有磁盘的已使用容量,任一裸金属主机的任一磁盘已使用容量达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定磁盘的已使用容量,达到报警条件即可触发报警。
磁盘已使用容量百分比 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有磁盘的已使用容量百分比,任一裸金属主机的任一磁盘已使用容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定磁盘的已使用容量百分比,达到报警条件即可触发报警。
磁盘剩余容量百分比 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有磁盘的剩余容量百分比,任一裸金属主机的任一磁盘剩余容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定磁盘的剩余容量百分比,达到报警条件即可触发报警。
磁盘剩余容量 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有磁盘的剩余容量,任一裸金属主机的任一磁盘剩余容量达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定磁盘的剩余容量,达到报警条件即可触发报警。
网卡 网卡入速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有网卡的入速度,任一裸金属主机的任一网卡入速度达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定网卡的入速度,达到报警条件即可触发报警。
网卡入包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有网卡的入包数,任一裸金属主机的任一网卡入包数达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定网卡的入包数,达到报警条件即可触发报警。
网卡入错误数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有网卡的入错误数,任一裸金属主机的任一网卡入错误数达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定网卡的入错误数,达到报警条件即可触发报警。
网卡出速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有网卡的出速度,任一裸金属主机的任一网卡出速度达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定网卡的出速度,达到报警条件即可触发报警。
网卡出包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有网卡的出包数,任一裸金属主机的任一网卡出包数达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定网卡的出包数,达到报警条件即可触发报警。
网卡出错误数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选裸金属主机所有网卡的出错误数,任一裸金属主机的任一网卡出错误数达到报警条件即可触发报警。
  • 指定配置:监控某个裸金属主机指定网卡的出错误数,达到报警条件即可触发报警。
内存 内存总量 批量监控多个裸金属主机的内存总量,任一裸金属主机的内存总量达到报警条件即可触发报警。
剩余内存量 批量监控多个裸金属主机的剩余内存量,任一裸金属主机的剩余内存量达到报警条件即可触发报警。
已用内存量 批量监控多个裸金属主机的已用内存量,任一裸金属主机的已用内存量达到报警条件即可触发报警。
可用内存量 批量监控多个裸金属主机的可用内存量,任一裸金属主机的可用内存量达到报警条件即可触发报警。
剩余内存百分比 批量监控多个裸金属主机的内存已用百分比,任一裸金属主机的内存已用百分比达到报警条件即可触发报警。
内存使用率 批量监控多个裸金属主机的内存使用率,任一裸金属主机的内存使用率达到报警条件即可触发报警。

弹性裸金属实例

资源类型 子类型 报警条目 描述
弹性裸金属实例(已安装裸金属管理模块许可证) CPU CPU使用率 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有CPU的使用率,任一弹性裸金属实例的任一CPU使用率达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定CPU的使用率,达到报警条件即可触发报警。
CPU平均使用率 批量监控多个弹性裸金属实例的平均CPU使用率,任一弹性裸金属实例的平均CPU使用率达到报警条件即可触发报警。
磁盘 磁盘读IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有磁盘的读IOPS,任一弹性裸金属实例的任一磁盘读IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定磁盘的读IOPS,达到报警条件即可触发报警。
磁盘写IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有磁盘的写IOPS,任一弹性裸金属实例的任一磁盘写IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定磁盘的写IOPS,达到报警条件即可触发报警。
磁盘读速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有磁盘的读速度,任一弹性裸金属实例的任一磁盘读速度达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定磁盘的读速度,达到报警条件即可触发报警。
磁盘写速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有磁盘的写速度,任一弹性裸金属实例的任一磁盘写速度达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定磁盘的写速度,达到报警条件即可触发报警。
磁盘已使用容量 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有磁盘的已使用容量,任一弹性裸金属实例的任一磁盘已使用容量达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定磁盘的已使用容量,达到报警条件即可触发报警。
磁盘已使用容量百分比 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有磁盘的已使用容量百分比,任一弹性裸金属实例的任一磁盘已使用容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定磁盘的已使用容量百分比,达到报警条件即可触发报警。
磁盘剩余容量 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有磁盘的剩余容量,任一弹性裸金属实例的任一磁盘剩余容量达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定磁盘的剩余容量,达到报警条件即可触发报警。
磁盘剩余容量百分比 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有磁盘的剩余容量百分比,任一弹性裸金属实例的任一磁盘剩余容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定磁盘的剩余容量百分比,达到报警条件即可触发报警。
网卡 网卡入速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有网卡的入速度,任一弹性裸金属实例的任一网卡入速度达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定网卡的入速度,达到报警条件即可触发报警。
网卡入包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有网卡的入包数,任一弹性裸金属实例的任一网卡入包数达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定网卡的入包数,达到报警条件即可触发报警。
网卡入错误数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有网卡的入错误数,任一弹性裸金属实例的任一网卡入错误数达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定网卡的入错误数,达到报警条件即可触发报警。
网卡出速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有网卡的出速度,任一弹性裸金属实例的任一网卡出速度达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定网卡的出速度,达到报警条件即可触发报警。
网卡出包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有网卡的出包数,任一弹性裸金属实例的任一网卡出包数达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定网卡的出包数,达到报警条件即可触发报警。
网卡出错误数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选弹性裸金属实例所有网卡的出错误数,任一弹性裸金属实例的任一网卡出错误数达到报警条件即可触发报警。
  • 指定配置:监控某个弹性裸金属实例指定网卡的出错误数,达到报警条件即可触发报警。
内存 内存总量 批量监控多个弹性裸金属实例的内存总量,任一弹性裸金属实例的内存总量达到报警条件即可触发报警。
剩余内存量 批量监控多个弹性裸金属实例的剩余内存量,任一弹性裸金属实例的剩余内存量达到报警条件即可触发报警。
已用内存量 批量监控多个弹性裸金属实例的已用内存量,任一弹性裸金属实例的已用内存量达到报警条件即可触发报警。
可用内存量 批量监控多个弹性裸金属实例的可用内存量,任一弹性裸金属实例的可用内存量达到报警条件即可触发报警。
剩余内存百分比 批量监控多个弹性裸金属实例的内存已用百分比,任一弹性裸金属实例的内存已用百分比达到报警条件即可触发报警。
内存使用率 批量监控多个弹性裸金属实例的内存使用率,任一弹性裸金属实例的内存使用率达到报警条件即可触发报警。

VPC路由器

资源类型 子类型 报警条目 描述
VPC路由器 CPU CPU使用率 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的CPU使用率,任一VPC路由器的任一CPU使用率达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定CPU的使用率,达到报警条件即可触发报警。
CPU空闲率 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的CPU空闲率,任一VPC路由器的任一CPU空闲率达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定CPU的空闲率,达到报警条件即可触发报警。
全部CPU使用率 批量监控多个VPC路由器的CPU使用率,任一VPC路由器的全部CPU整体使用率达到报警条件,即可触发报警。
Note: 全部CPU使用率可能略大于100%。
全部CPU空闲率 批量监控多个VPC路由器的CPU空闲率,任一VPC路由器的全部CPU整体空闲率达到报警条件即可触发报警。
Note: 全部CPU空闲率可能略大于100%
磁盘 磁盘读IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的所有磁盘读IOPS,任一VPC路由器的任一磁盘读IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定磁盘的读IOPS,达到报警条件即可触发报警。
全部磁盘读IOPS 批量监控多个VPC路由器的磁盘读IOPS,任一VPC路由器所有磁盘的读IOPS之和达到报警条件即可触发报警。
磁盘写IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的所有磁盘写IOPS,任一VPC路由器的任一磁盘写IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定磁盘的写IOPS,达到报警条件即可触发报警。
全部磁盘写IOPS 批量监控多个VPC路由器的磁盘写IOPS,任一VPC路由器所有磁盘的写IOPS之和达到报警条件即可触发报警。
磁盘读速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的所有磁盘读速度,任一VPC路由器的任一磁盘读速度达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定磁盘的读速度,达到报警条件即可触发报警。
全部磁盘读速度 批量监控多个VPC路由器的磁盘读速度,任一VPC路由器所有磁盘的读速度之和达到报警条件即可触发报警。
磁盘写速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的所有磁盘写速度,任一VPC路由器的任一磁盘写速度达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定磁盘的写速度,达到报警条件即可触发报警。
全部磁盘写速度 批量监控多个VPC路由器的磁盘写速度,任一VPC路由器所有磁盘的写速度之和达到报警条件即可触发报警。
全部磁盘剩余容量(已预装agent) 批量监控多个VPC路由器的全部磁盘剩余容量,任一VPC路由器全部磁盘剩余容量达到报警条件即可触发报警。
全部磁盘剩余容量百分比(已预装agent) 批量监控多个VPC路由器的全部磁盘剩余容量百分比,任一VPC路由器全部磁盘剩余容量百分比达到报警条件即可触发报警。
全部磁盘已使用容量(已预装agent) 批量监控多个VPC路由器的全部磁盘已使用容量,任一VPC路由器全部磁盘已使用容量达到报警条件即可触发报警。
全部磁盘已使用容量百分比(已预装agent) 批量监控多个VPC路由器的全部磁盘已使用容量百分比,任一VPC路由器全部磁盘已使用容量百分比达到报警条件即可触发报警。
磁盘剩余容量(已预装agent) 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的磁盘剩余容量,任一VPC路由器的任一磁盘剩余容量达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定磁盘的剩余容量,达到报警条件即可触发报警。
磁盘剩余容量百分比(已预装agent) 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器磁盘剩余容量百分比,任一VPC路由器的任一磁盘剩余容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定磁盘的剩余容量百分比,达到报警条件即可触发报警。
磁盘已使用容量(已预装agent) 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器磁盘已使用容量,任一VPC路由器的任一磁盘已使用容量达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定磁盘的已使用容量,达到报警条件即可触发报警。
磁盘已使用容量百分比(已预装agent) 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器磁盘已使用容量百分比,任一VPC路由器的任一磁盘已使用容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定磁盘的已使用容量百分比,达到报警条件即可触发报警。
网卡 网卡入速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的网卡入速度,任一VPC路由器的任一网卡入速度达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定网卡的入速度,达到报警条件即可触发报警。
全部网卡入速度 批量监控多个VPC路由器的网卡入速度,任一VPC路由器所有网卡入速度之和达到报警条件即可触发报警。
网卡入包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的网卡入包数,任一VPC路由器的任一网卡入包数达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定网卡的入包数,达到报警条件即可触发报警。
全部网卡入包数 批量监控多个VPC路由器的网卡入包数,任一VPC路由器所有网卡入包数之和达到报警条件即可触发报警。
网卡入错误数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的网卡入错误数,任一VPC路由器的任一网卡入错误数达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定网卡的入错误数,达到报警条件即可触发报警。
全部网卡入错误数 批量监控多个VPC路由器的网卡入错误数,任一VPC路由器所有网卡入错误数之和达到报警条件即可触发报警。
网卡出速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的网卡出速度,任一VPC路由器的任一网卡出速度达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定网卡的出速度,达到报警条件即可触发报警。
全部网卡出速度 批量监控多个VPC路由器的网卡出速度,任一VPC路由器所有网卡出速度之和达到报警条件即可触发报警。
网卡出包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的网卡出包数,任一VPC路由器的任一网卡出包数达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定网卡的出包数,达到报警条件即可触发报警。
全部网卡出包数 批量监控多个VPC路由器的网卡出包数,任一VPC路由器所有网卡出包数之和达到报警条件即可触发报警。
网卡出错误数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选VPC路由器的网卡出错误数,任一VPC路由器的任一网卡出错误数达到报警条件即可触发报警。
  • 指定配置:监控某个VPC路由器指定网卡的出错误数,达到报警条件即可触发报警。
全部网卡出错误数 批量监控多个VPC路由器的网卡出错误数,任一VPC路由器所有网卡出错误数之和达到报警条件即可触发报警。
内存 内存空闲容量 批量监控多个VPC路由器的内存空闲容量,任一VPC路由器的内存空闲容量达到报警条件即可触发报警。
内存空闲百分比 批量监控多个VPC路由器的内存空闲百分比,任一VPC路由器的内存空闲百分比达到报警条件即可触发报警。
内存已用容量 批量监控多个VPC路由器的内存已用容量,任一VPC路由器的内存已用容量达到报警条件即可触发报警。
内存已用百分比 批量监控多个VPC路由器的内存已用百分比,任一VPC路由器的内存已用百分比达到报警条件即可触发报警。

镜像

资源类型 子类型 报警条目 描述
镜像 镜像总数 监控云平台内镜像总数,达到报警条件即可触发报警。
可用镜像总数 监控云平台内可用镜像总数,达到报警条件即可触发报警。
可用镜像百分比 监控云平台内可用镜像百分比,达到报警条件即可触发报警。
根云盘镜像数量 监控云平台内根云盘镜像数量,达到报警条件即可触发报警。
根云盘镜像百分比 监控云平台内根云盘镜像百分比,达到报警条件即可触发报警。
数据云盘镜像数量 监控云平台内数据云盘镜像数量,达到报警条件即可触发报警。
数据云盘镜像百分比 监控云平台内数据云盘镜像百分比,达到报警条件即可触发报警。
ISO镜像数量 监控云平台内ISO镜像数量,达到报警条件即可触发报警。
ISO镜像百分比 监控云平台内ISO镜像百分比,达到报警条件即可触发报警。

镜像

资源类型 子类型 报警条目 描述
镜像 镜像总数 监控云平台内镜像总数,达到报警条件即可触发报警。
可用镜像总数 监控云平台内可用镜像总数,达到报警条件即可触发报警。
可用镜像百分比 监控云平台内可用镜像百分比,达到报警条件即可触发报警。
根云盘镜像数量 监控云平台内根云盘镜像数量,达到报警条件即可触发报警。
根云盘镜像百分比 监控云平台内根云盘镜像百分比,达到报警条件即可触发报警。
数据云盘镜像数量 监控云平台内数据云盘镜像数量,达到报警条件即可触发报警。
数据云盘镜像百分比 监控云平台内数据云盘镜像百分比,达到报警条件即可触发报警。
ISO镜像数量 监控云平台内ISO镜像数量,达到报警条件即可触发报警。
ISO镜像百分比 监控云平台内ISO镜像百分比,达到报警条件即可触发报警。

镜像服务器

资源类型 子类型 报警条目 描述
镜像服务器 全部镜像存储可用容量 监控云平台内所有镜像服务器的可用容量,所有镜像服务器的可用容量之和达到报警条件即可触发报警。
全部镜像存储可用容量百分比 监控云平台内所有镜像服务器的可用容量百分比(百分比=所有镜像服务器可用容量之和/所有镜像服务器容量之和),达到报警条件即可触发报警。
镜像存储可用容量 批量监控多个镜像服务器的可用容量,任一镜像服务器的可用容量达到报警条件即可触发报警。
镜像存储可用容量百分比 批量监控多个镜像服务器的可用容量百分比,任一镜像服务器的可用容量百分比达到报警条件即可触发报警。
全部镜像存储已用容量 监控云平台内所有镜像服务器的已用容量,所有镜像服务器的已用容量之和达到报警条件即可触发报警。
全部镜像存储已用容量百分比 监控云平台内所有镜像服务器的已用容量百分比(百分比=所有镜像服务器已用容量之和/所有镜像服务器容量之和),达到报警条件即可触发报警。
镜像存储已用容量 批量监控多个镜像服务器的已用容量,任一镜像服务器的已用容量达到报警条件即可触发报警。
镜像存储已用容量百分比 批量监控多个镜像服务器的已用容量百分比,任一镜像服务器的已用容量百分比达到报警条件即可触发报警。
镜像存储禁用容量 监控云平台内镜像服务器的保留容量配置,保留容量达到报警条件即可触发报警。
镜像存储禁用容量百分比 监控云平台内镜像服务器的保留容量配置,任一镜像服务器禁用容量百分比(百分比=保留容量/镜像服务器总容量)达到报警条件即可触发报警。

系统数据目录

资源类型 子类型 报警条目 描述
系统数据目录 管理节点数据目录磁盘空闲容量 监控管理节点数据目录磁盘的空闲容量,达到报警条件即可触发报警。
管理节点数据目录磁盘空闲率 监控管理节点数据目录磁盘的空闲率,达到报警条件即可触发报警。
管理节点数据目录磁盘已用容量 监控管理节点数据目录磁盘的已用容量,达到报警条件即可触发报警。
管理节点数据目录磁盘占用率 监控管理节点数据目录磁盘的占用率,达到报警条件即可触发报警。

物理机

资源类型 子类型 报警条目 描述
物理机 CPU CPU空闲率 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的CPU空闲率。支持选择一台或多台物理机,其中任一物理机的任一CPU空闲率达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定CPU的空闲率,该CPU的空闲率达到报警条件即可触发报警。
全部CPU空闲率 监控所选物理机的CPU空闲率。支持选择一台或多台物理机,其中任一物理机的全部CPU整体空闲率达到报警条件即可触发报警。
Note: 全部CPU空闲率可能略大于100%。
CPU使用率 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的CPU使用率。支持选择一台或多台物理机,其中任一物理机的任一CPU使用率达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定CPU的使用率,该CPU的使用率达到报警条件即可触发报警。
平均CPU使用率 监控所选物理机的CPU使用率。支持选择一台或多台物理机,其中任一物理机的平均CPU使用率达到报警条件即可触发报警。
全部CPU使用率 监控所选物理机的CPU使用率。支持选择一台或多台物理机,其中任一物理机的全部CPU整体使用率达到报警条件即可触发报警。
Note: 全部CPU使用率可能略大于100%。
已使用CPU数量 监控所选物理机的已使用CPU数量。支持选择一台或多台物理机,其中任一物理机的已使用CPU数量达到报警条件即可触发报警。
已使用CPU百分比 监控所选物理机的已使用CPU百分比。支持选择一台或多台物理机,其中任一物理机已使用的CPU数量占该物理机总CPU数量百分比达到报警条件即可触发报警。
可用CPU数量 监控所选物理机的可用CPU数量。支持选择一台或多台物理机,其中任一物理机的可用CPU数量达到报警条件即可触发报警。
可用CPU百分比 监控所选物理机的可用CPU百分比。支持选择一台或多台物理机,其中任一物理机可用CPU数量占该物理机总CPU数量百分比达到报警条件即可触发报警。
全部物理机CPU数量 监控云平台内所有物理机的CPU数量,所有物理机的CPU数量之和达到报警条件即可触发报警。
全部物理机已使用CPU数量 监控云平台内所有物理机已使用的CPU数量,所有物理机已使用CPU数量之和达到报警条件即可触发报警。
全部物理机已禁用CPU数量 监控云平台内所有物理机已禁用的CPU数量,所有物理机已禁用CPU数量之和达到报警条件即可触发报警。
全部物理机已使用CPU百分比 监控云平台内所有物理机总体CPU使用情况,所有物理机已使用CPU百分比(百分比=所有物理机已使用CPU数量之和/所有物理机总CPU数量)达到报警条件即可触发报警。
全部物理机已禁用CPU百分比 监控云平台内所有物理机总体CPU禁用情况,所有物理机已禁用CPU百分比(百分比=所有物理机已禁用CPU数量之和/所有物理机总CPU数量)达到报警条件即可触发报警。
全部物理机可用CPU数量 监控云平台内所有物理机可用CPU数量,所有物理机可用CPU数量之和达到报警条件即可触发报警。
全部物理机可用CPU百分比 监控云平台内所有物理机总体CPU可用情况,所有物理机可用CPU百分比(百分比=所有物理机可用CPU数量之和/所有物理机总CPU数量)达到报警条件即可触发报警。
内存 物理内存未使用量 监控所选物理机的物理内存未使用量。支持选择一台或多台物理机,其中任一物理机的物理内存未使用量达到报警条件即可触发报警。
物理内存未使用百分比 监控所选物理机的物理内存未使用百分比。支持选择一台或多台物理机,其中任一物理机的物理内存未使用百分比达到报警条件即可触发报警。
物理内存已使用量 监控所选物理机的物理内存已使用量。支持选择一台或多台物理机,其中任一物理机的物理内存已使用量达到报警条件即可触发报警。
物理内存已使用百分比 监控所选物理机的物理内存已使用百分比。支持选择一台或多台物理机,其中任一物理机的物理内存已使用百分比达到报警条件即可触发报警。
虚拟内存已使用量 监控所选物理机的虚拟内存已使用量。支持选择一台或多台物理机,其中任一物理机的虚拟内存已使用量达到报警条件即可触发报警。
虚拟内存已使用百分比 监控所选物理机的虚拟内存已使用百分比。支持选择一台或多台物理机,其中任一物理机的虚拟内存已使用百分比达到报警条件即可触发报警。
虚拟内存可用量 监控所选物理机的虚拟内存可用量。支持选择一台或多台物理机,其中任一物理机的虚拟内存可用量达到报警条件即可触发报警。
虚拟内存可用百分比 监控所选物理机的虚拟内存可用百分比。支持选择一台或多台物理机,其中任一物理机的虚拟内存可用百分比达到报警条件即可触发报警。
全部物理机物理内存容量 监控云平台内所有物理机的物理内存容量,所有物理机的物理内存容量总和达到报警条件即可触发报警。
全部物理机物理内存已使用量 监控云平台内所有物理机的物理内存已使用量,所有物理机物理内存已使用量总和达到报警条件即可触发报警。
全部物理机物理内存已使用百分比 监控云平台内所有物理机的总体物理内存使用情况,所有物理机内存已使用百分比(百分比=所有物理机已使用物理内存之和/所有物理机总物理内存)达到报警条件即可触发报警。
全部物理机物理内存已禁用量 监控云平台内所有物理机保留物理内存配置,所有物理机保留物理内存容量达到报警条件即可触发报警。
全部物理机物理内存已禁用百分比 监控云平台内物理机保留物理内存配置,所有物理机保留物理内存百分比(百分比=所有物理机保留物理内存之和/所有物理机总物理内存)达到报警条件即可触发报警。
全部物理机物理内存剩余量 监控云平台内所有物理机的剩余物理内存容量,所有物理机的剩余物理内存容量之和达到报警条件即可触发报警。
全部物理机物理内存剩余百分比 监控云平台内所有物理机的总体物理内存剩余情况,所有物理机的剩余物理内存容量百分比(百分比=所有物理机剩余物理内存容量之和/所有物理机总物理内存容量)达到报警条件即可触发报警。
磁盘 磁盘读IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的磁盘读IOPS,支持选择一台或多台物理机,其中任一物理机的任一磁盘读IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定磁盘的读IOPS,该磁盘达到报警条件即可触发报警。
全部磁盘读IOPS 监控所选物理机的磁盘读IOPS。支持选择一台或多台物理机,其中任一物理机的所有磁盘读IOPS之和达到报警条件即可触发报警。
磁盘写IOPS 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的磁盘写IOPS,支持选择一台或多台物理机,其中任一物理机的任一磁盘写IOPS达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定磁盘的写IOPS,该磁盘达到报警条件即可触发报警。
全部磁盘写IOPS 监控所选物理机的磁盘写IOPS。支持选择一台或多台物理机,其中任一物理机的所有磁盘写IOPS之和达到报警条件即可触发报警。
磁盘读速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的磁盘读速度。支持选择一台或多台物理机,其中任一物理机的任一磁盘读速度达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定磁盘的读速度,该磁盘达到报警条件即可触发报警。
全部磁盘读速度 监控所选物理机的磁盘读速度。支持选择一台或多台物理机,其中任一物理机的所有磁盘读速度之和达到报警条件即可触发报警。
磁盘写速度 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的磁盘写速度。支持选择一台或多台物理机,其中任一物理机的任一磁盘写速度达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定磁盘的写速度,该磁盘达到报警条件即可触发报警。
全部磁盘写速度 监控所选物理机的磁盘写速度。支持选择一台或多台物理机,其中任一物理机的所有磁盘写速度之和达到报警条件即可触发报警。
全部磁盘剩余容量 监控所选物理机的磁盘剩余容量。支持选择一台或多台物理机,其中任一物理机的所有磁盘剩余容量之和达到报警条件即可触发报警。
全部磁盘剩余容量百分比 监控所选物理机的磁盘容量剩余情况。支持选择一台或多台物理机,其中任一物理机的所有磁盘剩余容量百分比(百分比=该物理机所有磁盘剩余容量之和/该物理机所有磁盘容量之和)达到报警条件即可触发报警。
全部磁盘已使用容量 监控所选物理机的磁盘已使用容量。支持选择一台或多台物理机,其中任一物理机的所有磁盘已使用容量之和达到报警条件即可触发报警。
全部磁盘已使用容量百分比 监控所选物理机的磁盘容量已使用情况。支持选择一台或多台物理机,其中任一物理机的所有磁盘已使用容量百分比(百分比=该物理机所有磁盘已使用容量之和/该物理机所有磁盘容量之和)达到报警条件即可触发报警。
磁盘容量 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的磁盘容量,支持选择一台或多台物理机,其中任一物理机的任一磁盘容量达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定磁盘的容量,该磁盘达到报警条件即可触发报警。
磁盘剩余容量百分比 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的磁盘剩余容量百分比。支持选择一台或多台物理机,其中任一物理机的任一磁盘剩余容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定磁盘的剩余容量百分比,该磁盘达到报警条件即可触发报警。
磁盘已使用容量 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的磁盘已使用容量。支持选择一台或多台物理机,其中任一物理机的任一磁盘已使用容量达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定磁盘的已使用容量,该磁盘达到报警条件即可触发报警。
磁盘已使用容量百分比 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的磁盘已使用容量百分比,支持选择一台或多台物理机,其中任一物理机的任一磁盘已使用容量百分比达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定磁盘的已使用容量百分比,该磁盘达到报警条件即可触发报警。
根盘使用率 监控所选物理机的根盘使用率。支持选择一台或多台物理机,其中任一物理机的根盘使用率达到报警条件即可触发报警。
根盘使用容量 监控所选物理机的根盘使用容量。支持选择一台或多台物理机,其中任一物理机的根盘使用容量达到报警条件即可触发报警。
XFS文件系统碎片化程度百分比 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的XFS文件系统碎片化程度百分比。支持选择一台或多台物理机,其中任一物理机的XFS文件系统碎片化程度百分比达到报警条件即可触发报警。
  • 指定配置:监控某个物理机XFS文件系统的碎片化程度百分比,该物理机达到报警条件即可触发报警。
网卡 单个网卡入速度 监控所选物理机上指定网卡的入速度。
  • 支持选择一台或多台物理机,每台物理机可以指定一张网卡。
  • 支持为所选的每张网卡分别指定报警规则,对应网卡达到报警条件即可触发报警。
  • 没有单独指定报警规则的网卡可以使用统一的报警规则,任一网卡达到报警条件即可触发报警。
全部网卡入速度 监控所选物理机的网卡入速度。支持选择一台或多台物理机,其中任一物理机所有网卡入速度之和达到报警条件即可触发报警。
单个网卡入包数 监控所选物理机上指定网卡的入包数。
  • 支持选择一台或多台物理机,每台物理机可以指定一张网卡。
  • 支持为所选的每张网卡分别指定报警规则,对应网卡达到报警条件即可触发报警。
  • 没有单独指定报警规则的网卡可以使用统一的报警规则,任一网卡达到该报警条件即可触发报警。
全部网卡入包数 监控所选物理机的网卡入包数。支持选择一台或多台物理机,其中任一物理机所有网卡入包数之和达到报警条件即可触发报警。
单个网卡入错误 监控所选物理机上指定网卡的入错误数。
  • 支持选择一台或多台物理机,每台物理机可以指定一张网卡。
  • 支持为所选的每张网卡分别指定报警规则,对应网卡达到报警条件即可触发报警。
  • 没有单独指定报警规则的网卡可以使用统一的报警规则,任一网卡达到该报警条件即可触发报警。
全部网卡入错误数 监控所选物理机的网卡入错误数。支持选择一台或多台物理机,其中任一物理机所有网卡入错误数之和达到报警条件即可触发报警。
单个网卡出速度 监控所选物理机上指定网卡的出速度。
  • 支持选择一台或多台物理机,每台物理机可以指定一张网卡。
  • 支持为所选的每张网卡分别指定报警规则,对应网卡达到报警条件即可触发报警。
  • 没有单独指定报警规则的网卡可以使用统一的报警规则,任一网卡达到该报警条件即可触发报警。
全部网卡出速度 监控所选物理机的网卡出速度。支持选择一台或多台物理机,其中任一物理机所有网卡出速度之和达到报警条件即可触发报警。
单个网卡出包数 监控所选物理机上指定网卡的出包数。
  • 支持选择一台或多台物理机,每台物理机可以指定一张网卡。
  • 支持为所选的每张网卡分别指定报警规则,对应网卡达到报警条件即可触发报警。
  • 没有单独指定报警规则的网卡可以使用统一的报警规则,任一网卡达到该报警条件即可触发报警。
全部网卡出包数 监控所选物理机的网卡出报数。支持选择一台或多台物理机,其中任一物理机所有网卡出包数之和达到报警条件即可触发报警。
单个网卡出错误数 监控所选物理机上指定网卡的出错误数。
  • 支持选择一台或多台物理机,每台物理机可以指定一张网卡。
  • 支持为所选的每张网卡分别指定报警规则,对应网卡达到报警条件即可触发报警。
  • 没有单独指定报警规则的网卡可以使用统一的报警规则,任一网卡达到该报警条件即可触发报警。
全部网卡出错误数 监控所选物理机的网卡出错误数。支持选择一台或多台物理机,其中任一物理机所有网卡出错误数之和达到报警条件即可触发报警。
Conntrack连接数 监控所选物理机的Conntrack连接数。支持选择一台或多台物理机,其中任一物理机的Conntrack连接数达到报警条件即可触发报警。
Conntrack已使用百分比 监控所选物理机的Conntrack已使用百分比。支持选择一台或多台物理机,其中任一物理机Conntrack已使用百分比达到报警条件即可触发报警。
网卡入丢包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的网卡入丢包数。支持选择一台或多台物理机,其中任一物理机的任一网卡入丢包数达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定网卡的入丢包数,该网卡的入丢包数达到报警条件即可触发报警。
网卡出丢包数 是否指定配置,对资源的监控粒度不同。可按需选择:
  • 不指定配置:监控所选物理机的网卡出丢包数。支持选择一台或多台物理机,其中任一物理机的任一网卡出丢包数达到报警条件即可触发报警。
  • 指定配置:监控某个物理机指定网卡的入丢包数,该网卡的出丢包数达到报警条件即可触发报警。
HBA设备 FC-HBA链路故障总数 监控所选物理机的FC-HBA链路故障总数。支持选择一台或多台物理机,其中任一物理机的任一FC-HBA链路达到报警条件即可触发报警。
Note: 请确保被监控的FC-HBA设备存在/sys/class/fc_host/<Name>/statistics目录,如不存在,将无法监控该FC-HBA链路故障数并触发报警。
FC-HBA链路信号丢失次数 监控所选物理机的FC-HBA链路信号丢失次数。支持选择一台或多台物理机,其中任一物理机的任一FC-HBA链路达到报警条件即可触发报警。
Note: 请确保被监控的FC-HBA设备存在/sys/class/fc_host/<Name>/statistics目录,如不存在,将无法监控该FC-HBA链路信号丢失次数并触发报警。
其他 物理机数量 监控云平台内物理机数量,物理机总数达到报警条件即可触发报警。
已连接物理机数量 监控云平台内物理机数量,已连接物理机数量达到报警条件即可触发报警。
已连接物理机百分比 监控云平台内物理机数量,已连接物理机百分比(百分比=已连接物理机数量/物理机总数)达到报警条件即可触发报警。
未连接物理机数量 监控云平台内物理机数量,未连接物理机数量达到报警条件即可触发报警。
未连接物理机百分比 监控云平台内物理机数量,未连接物理机百分比(百分比=未连接物理机数量/物理机总数)达到报警条件即可触发报警。

裸金属网关节点

资源类型 子类型 报警条目 描述
弹性裸金属网关节点 弹性裸金属网关节点数量 监控云平台内弹性裸金属网关节点数量,弹性裸金属网关节点总数达到报警条件即可触发报警。
已连接弹性裸金属网关节点数量 监控云平台内弹性裸金属网关节点数量,已连接弹性裸金属网关节点数量达到报警条件即可触发报警。
已连接弹性裸金属网关节点百分比 监控云平台内弹性裸金属网关节点数量,已连接弹性裸金属网关节点百分比(百分比=已连接弹性裸金属网关节点数量/弹性裸金属网关节点总数)达到报警条件即可触发报警。
未连接弹性裸金属网关节点数量 监控云平台内弹性裸金属网关节点数量,未连接弹性裸金属网关节点数量达到报警条件即可触发报警。
未连接弹性裸金属网关节点百分比 监控云平台内弹性裸金属网关节点数量,未连接弹性裸金属网关节点百分比(百分比=未连接弹性裸金属网关节点数量/弹性裸金属网关节点总数)达到报警条件即可触发报警。

三层网络

资源类型 子类型 报警条目 描述
三层网络 全部可用IP数 (IPv4) 监控云平台内所有IPv4类型三层网络的IP地址数量,所有三层网络的可用IP数之和达到报警条件即可触发报警。
全部可用IP百分比 (IPv4) 监控云平台内所有IPv4类型三层网络的IP地址数量,全部可用IP百分比(全部可用IP百分比=所有三层网络可用IP总数/所有三层网络IP总数)达到报警条件即可触发报警。
全部已用IP数 (IPv4) 监控云平台内所有IPv4类型三层网络的IP地址数量,所有三层网络的已用IP数之和达到报警条件即可触发报警。
全部已用IP百分比 (IPv4) 监控云平台内所有IPv4类型三层网络的IP地址数量,全部已用IP百分比(全部已用IP百分比=所有三层网络已用IP总数/所有三层网络IP总数)达到报警条件即可触发报警。
全部已禁用IP数 (IPv4) 监控云平台内所有IPv4类型三层网络的IP地址数量,所有三层网络的已禁用IP数之和达到报警条件即可触发报警。
全部已禁用IP百分比 (IPv4) 监控云平台内所有IPv4类型三层网络的IP地址数量,全部已禁用IP百分比(全部已禁用IP百分比=所有三层网络禁用IP总数/所有三层网络IP总数)达到报警条件即可触发报警。
可用IP数 (IPv4) 批量监控多个IPv4类型三层网络的IP地址数量,任一三层网络的可用IP数达到报警条件即可触发报警。
可用IP百分比 (IPv4) 批量监控多个IPv4类型三层网络的IP地址数量,任一三层网络的可用IP百分比达到报警条件即可触发报警。
已用IP数 (IPv4) 批量监控多个IPv4类型三层网络的IP地址数量,任一三层网络的已用IP数达到报警条件即可触发报警。
已用IP百分比 (IPv4) 批量监控多个IPv4类型三层网络的IP地址数量,任一三层网络的已用IP百分比达到报警条件即可触发报警。

云盘

资源类型 子类型 报警条目 描述
云盘 云盘总数 监控云平台内根云盘和数据云盘数量,根云盘和数据云盘数量之和达到报警条件即可触发报警。
根云盘总数 监控云平台内根云盘数量,根云盘总数达到报警条件即可触发报警。
根云盘百分比 监控云平台内根云盘百分比(百分比=根云盘数量/根云盘和数据云盘数量之和),达到报警条件即可触发报警。
数据云盘总数 监控云平台内数据云盘数量,数据云盘总数达到报警条件即可触发报警。
数据云盘百分比 监控云平台内数据云盘百分比(百分比=数据云盘数量/根云盘和数据云盘数量之和),达到报警条件即可触发报警。
可用数据云盘总数 监控云平台内数据云盘状态,可用数据云盘数量达到报警条件即可触发报警。
可用数据云盘百分比 监控云平台内数据云盘状态,可用数据云盘百分比(百分比=可用数据云盘数量/数据云盘总量)达到报警条件即可触发报警。
云盘快照总数 监控云平台内云盘快照(数据云盘快照+根云盘快照)数量,云盘快照总数达到报警条件即可触发报警。
根云盘快照总数 监控云平台内根云盘快照数量,根云盘快照总数达到报警条件即可触发报警。
根云盘快照百分比 监控云平台内根云盘快照百分比(百分比=根云盘快照总数/根云盘快照与数据云盘快照之和),达到报警条件即可触发报警。
数据云盘快照总数 监控云平台内数据云盘快照数量,数据云盘快照总数达到报警条件即可触发报警。
数据云盘快照百分比 监控云平台内所有数据云盘快照百分比(百分比=数据云盘快照总数/根云盘快照与数据云盘快照之和),任一数据云盘快照百分比达到报警条件即可触发报警。
云盘使用容量百分比 监控云平台内所有云盘使用容量百分比(百分比=使用容量/云盘总容量),任一云盘使用容量百分比达到报警条件即可触发报警。
Note: 厚置备类型云盘(例如:Shared Block主存储上厚置备类型的云盘)的使用容量百分比为100%,设置此报警将立即触发。
(100GB及以上)碎片程度(Extent总数) 监控云平台内所有容量超过100GB云盘的碎片化程度,任一云盘碎片化程度的碎片程度(Extent总数)达到报警条件即可触发报警。
Note: 使用此报警条目需注意以下情况:
  • 系统默认XFS文件系统碎片化程度的监控数据采样时间间隔为12小时;
  • 注意匹配该采样周期,设置合理的报警器阈值持续时间。

虚拟IP

资源类型 子类型 报警条目 描述
虚拟IP 下行网络流量 批量监控多个虚拟IP的下行网络流量,任一虚拟IP的下行网络流量达到报警条件即可触发报警。
下行网络包数 批量监控多个虚拟IP的下行网络包数,任一虚拟IP的下行网络包数达到报警条件即可触发报警。
上行网络流量 批量监控多个虚拟IP的上行网络流量,任一虚拟IP的上行网络流量达到报警条件即可触发报警。
上行网络包数 批量监控多个虚拟IP的上行网络包数,任一虚拟IP的上行网络包数达到报警条件即可触发报警。

主存储

资源类型 子类型 报警条目 描述
主存储 全部容量 监控云平台内所有主存储容量,所有主存储容量之和达到报警条件即可触发报警。
全部可用容量 监控云平台内所有主存储可用容量,所有主存储可用容量之和达到报警条件即可触发报警。
全部可用容量百分比 监控云平台内所有主存储可用容量百分比(百分比=所有主存储可用容量之和/所有主存储容量之和),达到报警条件即可触发报警。
全部已用容量 监控云平台内所有主存储已用容量,所有主存储已用容量之和达到报警条件即可触发报警。
全部已用容量百分比 监控云平台内所有主存储已用容量百分比(百分比=所有主存储已用容量之和/所有主存储容量之和),达到报警条件即可触发报警。
全部已禁用容量 监控云平台内主存储保留容量配置,所有主存储保留容量之和达到报警条件即可触发报警。
全部已禁用容量百分比 监控云平台内所有主存储保留容量配置,主存储全部已禁用容量百分比(百分比=所有主存储保留容量之和/所有主存储容量之和)达到报警条件即可触发报警。
该主存储可用容量 批量监控多个主存储的可用容量,任一主存储的可用容量达到报警条件即可触发报警。
该主存储可用容量百分比 批量监控多个主存储的可用容量百分比(百分比=可用容量/主存储总容量),任一主存储的可用容量百分比达到报警条件即可触发报警。
该主存储已用容量 批量监控多个主存储的已用容量,任一主存储的已用容量达到报警条件即可触发报警。
该主存储已用容量百分比 批量监控多个主存储的已用容量百分比(百分比=已用容量/主存储总容量),任一主存储的已用容量百分比达到报警条件即可触发报警。
该主存储可用物理容量 批量监控多个主存储的可用物理容量,任一主存储的可用物理容量达到报警条件即可触发报警。
该主存储可用物理容量百分比 批量监控多个主存储的可用物理容量百分比(百分比=可用物理容量/主存储总物理容量),任一主存储的可用物理容量百分比达到报警条件即可触发报警。
该主存储已用物理容量 批量监控多个主存储的已用物理容量,任一主存储的已用物理容量达到报警条件即可触发报警。
该主存储已用物理容量百分比 批量监控多个主存储的已用物理容量百分比(百分比=已用物理容量/主存储总物理容量),任一主存储的已用物理容量百分比达到报警条件即可触发报警。
该主存储根云盘数量 批量监控多个主存储内的根云盘数量,任一主存储内的根云盘数量达到报警条件即可触发报警。
该主存储数据云盘数量 批量监控多个主存储内的数据云盘数量,任一主存储内的数据云盘数量达到报警条件即可触发报警。
该主存储快照数量 批量监控多个主存储内的快照数量,任一主存储内的快照数量达到报警条件即可触发报警。
该主存储预测物理容量使用率超过阈值时间 批量监控多个主存储的预测物理容量使用率,任一主存储的预测物理容量使用率超过阈值的时间达到报警条件即可触发报警。
Ceph存储池可用物理容量百分比 批量监控多个Ceph存储池的可用物理容量百分比,任一Ceph存储池可用物理容量百分比达到报警条件即可触发报警。
Ceph存储池已用物理容量百分比 批量监控多个Ceph存储池已用物理容量百分比,任一Ceph存储池已用物理容量百分比达到报警条件即可触发报警。
Ceph存储池可用虚拟容量百分比 批量监控多个Ceph存储池可用虚拟容量百分比,任一Ceph存储池可用虚拟容量百分比达到报警条件即可触发报警。
Ceph存储池预测物理容量使用率超过阈值时间 批量监控多个Ceph存储池的预测物理容量使用率,任一Ceph存储池的预测物理容量使用率超过阈值的时间达到报警条件即可触发报警。

监听器

资源类型 子类型 报警条目 描述
监听器 会话已用数量 批量监控多个监听器的会话数量,任一监听器的会话已用数量达到报警条件即可触发报警。
会话已用百分比 批量监控多个监听器的会话已用百分比(百分比=会话已用数量/会话总量),任一监听器的会话已用百分比达到报警条件即可触发报警。
检查不到健康的后端服务器 批量监控多个监听器的后端服务器组中的后端服务器状态,任一监听器的后端服务器组中存在不健康的后端服务器即可触发报警。

管理节点

资源类型 子类型 报警条目 描述
管理节点 仲裁IP不可达 监控双管理节点仲裁IP是否可达,当仲裁IP不可达时即可触发报警。
双管理节点数据库不同步 监控双管理节点数据库状态,当数据库异常或双管理节点数据库不同步时即可触发报警。

项目资源

资源类型 子类型 报警条目 描述
项目资源(需拥有租户管理模块许可证) 计算资源 云主机数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的云主机数量配额使用百分比,任一项目的云主机数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的云主机数量配额使用百分比,任一项目的云主机数量配额使用百分比达到阈值即可触发报警。
运行中云主机数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的运行中云主机数量配额使用百分比,任一项目的运行中云主机数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的运行中云主机数量配额使用百分比,任一项目的运行中云主机数量配额使用百分比达到阈值即可触发报警。
CPU数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的CPU数量配额使用百分比,任一项目的CPU数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的CPU数量配额使用百分比,任一项目的CPU数量配额使用百分比达到阈值即可触发报警。
内存配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的内存配额使用百分比,任一项目的内存配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的内存配额使用百分比,任一项目的内存配额使用百分比达到阈值即可触发报警。
GPU设备数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的GPU设备数量配额使用百分比,任一项目的GPU设备数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的GPU设备数量配额使用百分比,任一项目的GPU设备数量配额使用百分比达到阈值即可触发报警。
云主机调度策略数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的云主机调度策略数量配额使用百分比,任一项目的云主机调度策略数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的云主机调度策略数量配额使用百分比,任一项目的云主机调度策略数量配额使用百分比达到阈值即可触发报警。
存储资源 云盘快照数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的云盘快照数量配额使用百分比,任一项目的云盘快照数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的云盘快照数量配额使用百分比,任一项目的云盘快照数量配额使用百分比达到阈值即可触发报警。
数据云盘数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的数据云盘数量配额使用百分比,任一项目的数据云盘数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的数据云盘数量配额使用百分比,任一项目的数据云盘数量配额使用百分比达到阈值即可触发报警。
可用存储容量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的可用存储容量配额使用百分比,任一项目的可用存储容量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的可用存储容量配额使用百分比,任一项目的可用存储容量配额使用百分比达到阈值即可触发报警。
镜像数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的镜像数量配额使用百分比,任一项目的镜像数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的镜像数量配额使用百分比,任一项目的镜像数量配额使用百分比达到阈值即可触发报警。
所有镜像容量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的所有镜像容量配额使用百分比,任一项目的所有镜像容量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的所有镜像容量配额使用百分比,任一项目的所有镜像容量配额使用百分比达到阈值即可触发报警。
可用备份容量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的可用备份容量配额使用百分比,任一项目的可用备份容量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的可用备份容量配额使用百分比,任一项目的可用备份容量配额使用百分比达到阈值即可触发报警。
备份数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的备份数量配额使用百分比,任一项目的备份数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的备份数量配额使用百分比,任一项目的备份数量配额使用百分比达到阈值即可触发报警。
网络资源 VXLAN网络数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的VXLAN网络数量配额使用百分比,任一项目的VXLAN网络数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的VXLAN网络数量配额使用百分比,任一项目的VXLAN网络数量配额使用百分比达到阈值即可触发报警。
三层网络数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的三层网络数量配额使用百分比,任一项目的三层网络数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的三层网络数量配额使用百分比,任一项目的三层网络数量配额使用百分比达到阈值即可触发报警。
安全组数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的安全组数量配额使用百分比,任一项目的安全组数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的安全组数量配额使用百分比,任一项目的安全组数量配额使用百分比达到阈值即可触发报警。
虚拟IP数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的虚拟IP数量配额使用百分比,任一项目的虚拟IP数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的虚拟IP数量配额使用百分比,任一项目的虚拟IP数量配额使用百分比达到阈值即可触发报警。
弹性IP数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的弹性IP数量配额使用百分比,任一项目的弹性IP数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的弹性IP数量配额使用百分比,任一项目的弹性IP数量配额使用百分比达到阈值即可触发报警。
端口转发数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的端口转发数量配额使用百分比,任一项目的端口转发数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的端口转发数量配额使用百分比,任一项目的端口转发数量配额使用百分比达到阈值即可触发报警。
负载均衡器数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的负载均衡器数量配额使用百分比,任一项目的负载均衡器数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的负载均衡器数量配额使用百分比,任一项目的负载均衡器数量配额使用百分比达到阈值即可触发报警。
监听器数量配额使用百分比 报警范围支持全部资源和资源多选两种,可按需选择:
  • 全部资源:监控云平台内所有项目的监听器数量配额使用百分比,任一项目的监听器数量配额使用百分比达到阈值即可触发报警。
  • 资源多选:监控所选项目的监听器数量配额使用百分比,任一项目的监听器数量配额使用百分比达到阈值即可触发报警。

CDP任务

资源类型 子类型 报警条目 描述
CDP任务(需拥有持续数据保护CDP模块许可证) CDP任务已用容量占规划容量百分比 监控云平台内所有CDP任务已用容量占规划容量的百分比,任一CDP任务的已用容量与规划容量的占比达到阈值即可触发报警。
RPO偏移时间 监控云平台内所有CDP任务的RPO偏移时间,任一CDP任务的RPO偏移时间达到阈值即可触发报警。

事件报警条目

默认报警条目

资源类型 报警条目 描述
集群 集群内物理机QEMU版本待更新
  • 默认监控云平台所有集群。
  • 任一集群下存在物理机QEMU版本与平台推荐版本不一致时,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
物理机 物理机已连接
  • 默认监控云平台所有物理机。
  • 任一物理机从失联状态恢复连接,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
Note: 物理机连接状态与kvmagent进程相关。管理节点会定期发送请求确认kvmagent进程状态。若kvmagent进程正常回复,则表示物理机连接正常。
物理机未连接
  • 默认监控云平台所有物理机。
  • 任一物理机失联,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
Note: 物理机连接状态与kvmagent进程相关。管理节点会定期发送请求确认kvmagent进程状态。若kvmagent进程无回复,则表示物理机已失联。
物理机网卡未连接
  • 默认监控云平台所有物理机网卡。
  • 任一物理机网卡未连接,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
物理机网卡已连接
  • 默认监控云平台所有物理机网卡。
  • 任一物理机网卡从未连接状态恢复连接,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
物理机挂载路径错误
  • 监控云平台内指定主存储 (LocalStorage/NFS/SharedMountPoint/AliyunNAS) 的物理机挂载路径,当任一主存储的物理机挂载路径出现读写异常或无法连通时,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
物理机上发现未受系统管控的云主机
  • 默认监控云平台所有物理机上的云主机状态。
  • 任一物理机上发现未被数据库记录的云主机,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
物理机FC-HBA光口状态异常
  • 默认监控云平台所有物理机FC-HBA光口状态。
  • 任一物理机的任一FC-HBA光口处于异常状态,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
镜像服务器 镜像服务器已连接
  • 默认监控云平台所有镜像服务器。
  • 任一镜像服务器从失联状态恢复连接,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
镜像服务器未连接
  • 默认监控云平台所有镜像服务器。
  • 任一镜像服务器失联,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
主存储 主存储已连接
  • 默认监控云平台所有主存储。
  • 任一主存储从失联状态恢复连接,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
主存储未连接
  • 默认监控云平台所有主存储。
  • 任一主存储失联,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
主存储到物理机连接状态检查失败
  • 默认监控云平台所有主存储与物理机的连接状态。
  • 云平台未获取到主存储与物理机的连接状态时,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
SharedBlock主存储共享块状态异常
  • 默认监控云平台所有SharedBlock主存储下的共享块的健康状态。
  • 任一共享块健康状态异常,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
管理节点 管理节点已连接
  • 默认监控云平台所有管理节点。
  • 任一管理节点从失联状态恢复连接,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
管理节点未连接
  • 默认监控云平台所有管理节点。
  • 任一管理节点失联,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
云主机 云主机故障
  • 默认监控云平台所有已开启故障检测的云主机。
  • 任一云主机故障,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
Note: 云主机需安装最新版本的GuestTools工具,且该工具需处于运行状态。
云主机所在物理机异常变更
  • 默认监控云平台所有云主机。
  • 任一云主机所在物理机异常变更,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
云主机在物理机HA启动
  • 默认监控云平台所有云主机。
  • 任一云主机因高可用在物理机上启动,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
云主机长时间处于in shutdown状态
  • 默认监控云平台所有云主机。
  • 任一云主机长时间(约十分钟)处于in shutdown状态,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
云主机内IP被手动更改
  • 云主机内网卡 IP 地址发生变更时将触发该报警条目。
  • 仅监控关闭 IP 地址管理的扁平网络上的网卡。
  • 该报警需使用云主机内部监控,请提前安装云主机性能优化工具。
云主机内IP已被云平台资源占用
  • 云主机内配置的 IP 地址已被云平台其他资源占用时将触发该报警条目。
  • 仅监控关闭 IP 地址管理的扁平网络上的网卡。
  • 该报警需使用云主机内部监控,请提前安装云主机性能优化工具。
VPC路由器 VPC路由器已连接
  • 默认监控云平台所有VPC路由器。
  • 任一VPC路由器从失联状态恢复连接,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
VPC路由器未连接
  • 默认监控云平台所有VPC路由器。
  • 任一VPC路由器失联,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
VPC路由器磁盘空间被异常文件占用
  • 默认监控云平台所有VPC路由器。
  • 任一VPC路由器出现超过100 MB的单个文件即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
路由器的启用状态变为已暂停
  • 默认监控云平台所有VPC路由器。
  • 任一VPC路由器的启用状态变为已暂停即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
路由器主备切换
  • 默认监控云平台所有VPC路由器。
  • 任一VPC路由器出现主备切换,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
负载均衡 负载均衡实例磁盘空间被异常文件占用
  • 默认监控云平台所有性能独享型负载均衡实例。
  • 任一负载均衡实例内出现超过异常文件大小临界值的单个文件时即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
负载均衡实例未连接
  • 默认监控云平台所有负载均衡实例。
  • 任一负载均衡实例失联,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
负载均衡实例已连接
  • 默认监控云平台所有负载均衡实例。
  • 任一负载均衡实例从失联状态恢复连接,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
负载均衡实例主备切换
  • 默认监控性能独享型负载均衡实例。
  • 双节点模式下,任一性能独享型负载均衡实例发生主备实例切换,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
负载均衡实例配置同步失败
  • 默认监控性能独享型负载均衡实例。
  • 双节点模式下,任一性能独享型负载均衡实例配置自动同步失败超过5次,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
通知对象 短信发送失败
  • 默认监控云平台所有短信接收端。
  • 任一短信接收端无法接受短信报警消息,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
HA 物理机进入维护模式触发云主机迁移失败
  • 默认监控云平台内云主机的迁移情况。
  • 任一非本地存储的物理机进入维护模式触发云主机迁移失败,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
CDP任务(需拥有持续数据保护CDP模块许可证) CDP任务状态异常切换
  • 默认监控云平台内所有CDP任务的任务状态。
  • 任一CDP任务状态发生异常切换即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
Note: 触发CDP任务状态异常切换的原因:
  • CDP数据占用容量达到规划容量上限
  • CDP任务所在的备份服务器失联
SDN控制器 SDN控制器未连接
  • 默认监控云平台内所有的SDN控制器的状态。
  • 任一SDN控制器失联,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
SDN控制器已连接
  • 默认监控云平台内所有的SDN控制器的状态。
  • 任一SDN控制器从失联状态恢复连接,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
SDN集群 SDN集群健康
  • 默认监控云平台内所有SDN集群的健康状态。
  • 任一SDN集群从故障或降级状态恢复到健康状态,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
SDN集群不可用
  • 默认监控云平台内所有SDN集群的健康状态。
  • 任一SDN集群处于故障状态,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。
SDN集群降级
  • 默认监控云平台内所有SDN集群的健康状态。
  • 任一SDN集群处于降级状态,即可触发报警。
  • 默认触发云平台消息通知,绑定接收端之后,可通过接收端接收报警消息。

自定义报警条目

资源类型 报警条目 描述
云主机 云主机在物理机HA启动 监控云平台内所有NeverStop云主机,任一NeverStop云主机在物理机HA启动即可触发报警。
云主机在物理机上的状态发生变化 监控云平台内所有云主机在物理机上的状态,任一云主机的状态发生变化即可触发报警。
Note: 云主机异常的状态变化才会触发报警,正常的开关机等操作不会触发报警。
云主机长时间处于in shutdown状态 监控云平台内所有云主机状态,任一云主机长时间(约10分钟)处于in shutdown状态即可触发报警。
云主机故障 监控云平台内所有运行中的云主机状态,任一运行中的云主机出现故障即可触发报警。
Note: 云主机需安装最新版本的GuestTools工具,且该工具需处于运行状态。
云主机进入运行中状态 创建该事件报警器后,监控云平台内所有云主机;任一云主机进入运行中状态,即可触发报警。
云主机进入停止状态 创建该事件报警器后,监控云平台内所有云主机;任一云主机进入停止状态,即可触发报警。
VPC路由器 VPC路由器未连接 监控云平台内所有VPC路由器的就绪状态,任一路由器失联即可触发报警。
VPC路由器已连接 监控云平台内所有VPC路由器的就绪状态,任一VPC路由器连接后即可触发报警。
路由器主备切换 监控云平台高可用组内的VPC路由器状态,任意高可用组内的VPC路由器发生主备切换即可触发报警。
VPC路由器磁盘空间被异常文件占用 监控云平台所有VPC路由器内的磁盘占用情况,任一VPC路由器出现超过100 MB的单个文件即可触发报警。
负载均衡 负载均衡实例未连接 监控云平台内所有负载均衡实例的就绪状态,任一负载均衡实例失联即可触发报警。
负载均衡实例已连接 监控云平台内所有负载均衡实例的就绪状态,任一负载均衡实例连接后即可触发报警。
镜像服务器 镜像服务器未连接 监控云平台内所有镜像服务器的就绪状态,任一镜像服务器失联即可触发报警。
镜像服务器已连接 监控云平台内所有镜像服务器的就绪状态,任一镜像服务器连接后即可触发报警。
管理节点 管理节点未连接 监控云平台内所有管理节点的就绪状态,任一管理节点失联即可触发报警。
管理节点已连接 监控云平台内所有管理节点的就绪状态,任一管理节点连接后即可触发报警。
物理机 物理机上发现了未受系统管控的云主机 监控云平台内所有物理机上的云主机状态,任一实例云主机未被数据库记录即可触发报警。
物理机未连接 监控云平台内所有物理机的就绪状态,任一物理机失联即可触发报警。
Note: 物理机连接状态与kvmagent进程相关。管理节点会定期发送请求确认kvmagent进程状态。若kvmagent进程无回复,则表示物理机已失联。
物理机已连接 监控云平台内所有物理机的就绪状态,任一物理机连接后即可触发报警。
Note: 物理机连接状态与kvmagent进程相关。管理节点会定期发送请求确认kvmagent进程状态。若kvmagent进程正常回复,则表示物理机连接正常。
物理机网卡未连接 监控云平台内所有处于已连接状态的物理机的网卡就绪状态,任一物理机网卡未连接即可触发报警。
物理机网卡已连接 监控云平台内所有处于已连接状态的物理机的网卡就绪状态,任一物理机网卡恢复正常连接即可触发报警。
物理机挂载路径错误 监控云平台内指定主存储 (LocalStorage/NFS/SharedMountPoint/AliyunNAS) 的物理机挂载路径,当任一主存储的物理机挂载路径出现读写异常或无法连通时,即可触发报警。
主存储 主存储到物理机连接状态检查失败 监控云平台内主存储与物理机的连接状态,当云平台未获取到主存储与物理机的连接状态时,即可触发报警。
主存储未连接 监控云平台内所有主存储的就绪状态,任一主存储失联即可触发报警。
主存储已连接 监控云平台内所有主存储的就绪状态,任一主存储连接后即可触发报警。
vCenter vCenter物理机时间异常 监控已接管vCenter环境内所有物理机时间与云平台系统时间是否一致,任一vCenter物理机时间异常即可触发报警。
vCenter事件消息 展示已接管vCenter的事件消息,任一vCenter产生的事件消息均可通过报警的形式展示出来。
备份任务 任务结果失败 监控云平台内所有备份任务的执行状态,任一备份任务失败后即可触发报警。
项目资源(需拥有租户管理模块许可证) 项目已回收 监控云平台内所有项目状态,任一项目被回收即可触发报警。
HA 物理机进入维护模式触发云主机迁移失败 监控云平台内云主机的迁移情况,任一非本地存储的物理机进入维护模式触发云主机迁移失败即可触发报警。
CDP任务(需拥有持续数据保护CDP模块许可证) CDP任务失败 监控云平台内所有CDP任务的执行状态,任一CDP任务失败后即可触发报警。
CDP任务状态异常切换 监控云平台内所有CDP任务的任务状态,任一CDP任务状态发生异常切换即可触发报警。
Note: 触发CDP任务状态异常切换的原因:
  • CDP数据占用容量达到规划容量上限
  • CDP任务所在的备份服务器失联

术语表

实例

云平台中运行操作系统镜像的虚拟机或服务器,如云主机、弹性裸金属实例。

云主机(VM Instance)

运行在物理机上的虚拟机实例,具有独立的IP地址,可以访问公共网络,运行应用服务。

云盘(Volume)

为云主机提供存储,包括两种类型:根云盘、数据云盘。

根云盘(Root Volume)

云主机的系统云盘,用于支撑云主机的系统运行。

数据云盘(Data Volume)

云主机的数据云盘,用于云主机扩展的存储使用。

镜像(Image)

云主机或云盘使用的镜像模板文件,包括两种类型:系统镜像、云盘镜像。

计算规格(Instance Offering)

云主机涉及的CPU数量、内存、网络设置等规格定义。

云盘规格(Disk Offering)

云盘涉及的容量大小的规格定义。

SSH密钥(SSH Key)

SSH密钥是一种安全的云主机登录认证方式,由一个公钥和一个私钥组成。仅Linux云主机支持通过SSH密钥登录。

GPU规格(GPU Specification)

物理GPU设备或vGPU设备涉及的GPU帧数、显存、分辨率等规格定义,包括两种类型:物理GPU规格、vGPU规格。

vNUMA配置(vNUMA Configuration)

通过CPU绑定透传关联的物理机NUMA节点(pNUMA Node)拓扑,为云主机生成vNUMA节点(vNUMA Node)拓扑,实现云主机CPU优先访问所在vNUMA节点本地内存,提高云主机性能。

NUMA(Non-Uniform Memory Access)

非一致性内存访问,是一种计算机内存设计架构。该架构下,CPU访问内存的时间取决于CPU与内存的相对位置。通过优先访问相对位置较近的内存可缩短延迟,从而可提升主机系统性能。

pNUMA节点(pNUMA Node)

基于物理机NUMA架构预定义的NUMA节点,用于物理机CPU和内存管理。

pNUMA拓扑(pNUMA Topology)

CPU厂商基于NUMA架构预定义的物理机NUMA节点拓扑。

vNUMA节点(vNUMA Node)

基于CPU绑定透传关联的物理机NUMA节点而生成的云主机NUMA节点,用于云主机CPU和内存管理。

vNUMA拓扑(vNUMA Topology)

基于CPU绑定生成的云主机NUMA节点(vNUMA Node)拓扑。

本地内存(Local Memory)

CPU(pCPU或vCPU)通过所在NUMA节点(pNUMA节点或vNUMA节点)非CPU核部件中内存控制器可直接访问的内存。相比非本地内存,CPU访问本地内存的延迟更低。

CPU绑定配置(CPU Pinning)

将云主机的虚拟CPU(vCPU)与物理机的物理CPU(pCPU)严格关联,可为云主机分配特定的pCPU,提高云主机性能。

EmulatorPin配置(EmulatorPin Configuration)

将云主机中除vCPU和IO线程外的其他线程与物理机pCPU进行绑定,使云主机相关线程只运行在对应的pCPU上。

弹性伸缩组(Auto Scaling Group)

一组具有相同应用场景的云主机集合,可根据用户业务变化自动实现弹性伸缩或弹性自愈。

快照(Snapshot)

某一时间点某一磁盘的数据状态文件。

云主机调度策略(VM Scheduling Policy)

为云主机分配物理机的资源编排策略,可用于保障业务的高性能和高可用。

区域(Zone)

云平台内最大的一个资源定义,包括:集群、二层网络、主存储等资源。

集群(Cluster)

一组物理机(计算节点)的逻辑集合。

物理机(Host)

为云主机实例提供计算、网络、存储等资源的物理主机。

主存储(Primary Storage)

用于存储云主机磁盘文件(包括:根云盘、数据云盘、根云盘快照、数据云盘快照、镜像缓存等)的存储服务器。

镜像服务器(Backup Storage)

用于存储云主机镜像模板(含ISO)的存储服务器。

iSCSI存储(iSCSI Storage)

基于iSCSI协议构建的SAN存储。用户可将iSCSI存储上划分的块设备添加为Shared Block主存储,或直接透传给云主机使用。

FC存储(FC Storage)

基于FC协议构建的SAN存储。用户可将FC存储上划分的块设备添加为Shared Block主存储,或直接透传给云主机使用。

NVMe存储(NVMe Storage)

基于NVMe-oF协议构建的存储阵列,用户可将NVMe存储上划分的块设备添加为Shared Block主存储。

二层网络(L2 Network)

对应于一个二层广播域,进行二层相关的隔离。一般用物理网络的设备名称标识。

VXLAN网络池(VXLAN Pool)

在一组VXLAN隧道端点(VTEP)之上创建的VXLAN网络的集合,同一个VXLAN网络池内VXLAN网络标识符(VNI)不能重复。

三层网络(L3 Network)

云主机使用的网络配置,包括IP地址范围、网关、DNS等。

公有网络(Public Network)

一般表示可直接访问互联网的网络,由于公有网络是一个逻辑概念,在无法连接互联网的环境中,用户也可以自定义该网络。

扁平网络(Flat Network)

可与物理机网络直通,也可直接访问互联网的网络。云主机可使用扁平网络提供的分布式EIP访问公有网络。

VPC网络(VPC Network)

云主机使用的私有网络,可通过VPC路由器访问互联网。

管理网络(Management Network)

管理控制云平台相关物理资源的网络,例如:配置访问物理机、主存储、镜像服务器、VPC路由器时使用的网络。

流量网络(Flow Network)

端口镜像的专用网络,用于将网卡的网络流量镜像到远端。

VPC路由器(VPC vRouter)

一个定制的云主机,用于提供多种网络服务。

VPC路由器高可用组(VPC vRouter HA Group)

一对互为主备的VPC路由器,当主VPC路由器状态异常,自动切换至备VPC路由器,为业务高可用提供保障。

路由器镜像(vRouter Image)

封装网络服务,用于创建VPC路由器。路由器镜像不能直接用于创建业务云主机。

VPC路由器镜像(VPC vRouter Image)

封装了多种网络服务,只能用于创建VPC路由器,不能直接用于创建业务云主机。

高性能实例型负载均衡镜像(LB Image)

封装了高性能实例型负载均衡服务,只能用于创建负载均衡实例,不能直接用于创建业务云主机。

路由器规格(vRouter Offering)

定义VPC路由器使用的CPU、内存、镜像、管理网络、公有网络配置,用于创建VPC路由器,为公有网络/VPC网络提供多种网络服务。

负载均衡实例规格(LB Offering)

定义负载均衡实例使用的CPU、内存、镜像、管理网络配置,用于创建负载均衡实例,为公有网络/扁平网路/VPC网络提供负载均衡服务。

SDN控制器(SDN Controller)

SDN控制器是SDN架构的核心,负责集中管理和控制网络设备。

SDN集群(SDN Cluster)

一组由定制云主机构成的集群,用于提供高可用的SDN能力。

SDN实例(SDN Instance)

一台定制的云主机,用于提供SDN网络能力。

SDN镜像(SDN Image)

封装SDN软件的镜像,用于创建SDN实例。

SDN实例规格(SDN Instance Offering)

定义SDN实例使用的CPU、内存、SDN镜像以及管理网络配置,用于创建SDN实例。

安全组(Security Group)

为云主机网卡提供安全控制,按照指定的安全规则对进出网卡的TCP/UDP/ICMP等数据包进行有效过滤。

虚拟IP(VIP)

在桥接网络环境中,使用虚拟IP地址提供弹性IP、端口转发、负载均衡、IPsec隧道等网络服务,数据包会被发送到虚拟IP,再路由至云主机网络。

弹性IP(EIP)

基于网络地址转换(NAT)功能,将一个网络的IP地址转换成另一个网络的IP地址,从而可通过其他网络访问内部私有网络。

端口转发(Port Forwarding)

基于VPC路由器提供的三层转发服务,可将指定公有网络的IP地址端口流量转发到云主机对应协议的端口。在公网IP地址紧缺的情况下,通过端口转发可提供多个云主机对外服务,节省公网IP地址资源。

负载均衡(Load Balancer)

将虚拟IP的访问流量分发到后端服务器上,自动检测并隔离不可用的后端服务器,从而提高业务的服务能力和可用性。

监听器(Listener)

负责监听负载均衡的前端请求,按照指定策略分发给后端服务器,且监听器会对后端服务器进行健康检查。

转发规则(Forwarding Rule)

将来自不同域名或者不同URL的请求转发到不同的后端服务器组处理。

后端服务器组(Backend Server Group)

一组负责处理负载均衡分发的前端请求的后端服务器。负载均衡实例进行流量分发时,流量分配策略以后端服务器组为单位生效。

后端服务器(Backend Server)

负责处理负载均衡分发的前端请求的服务器。支持添加云主机或云平台之外的服务器作为后端服务器。

前端网络(Frontend Network)

负载均衡的前端网络,负载均衡将来自该网络的客户端请求按照指定策略分发给后端服务器。

后端网络(Backend Network)

负载均衡的后端网络,负责处理负载均衡分发前端请求的后端服务器所在的网络。

负载均衡实例(Load Balancer Instance)

一个定制的云主机,专用于提供负载均衡服务。

证书(Certificate)

当负载均衡监听器使用HTTPS协议,需绑定证书使用。支持上传证书和证书链。

防火墙(Firewall)

在VPC网络场景下,负责管控经由VPC路由器的流量,通过配置规则集和规则管控网络的访问控制策略。

防火墙规则集(Firewall RuleSet)

防火墙规则的集合,包含了一组规则,需要绑定到VPC路由器网卡的某个方向上才能生效。

防火墙规则(Firewall Rule)

配置至防火墙用于控制VPC网络流量的访问策略,由规则优先级、匹配条件、以及行为三部分组成。

规则模板(Rule Template)

将一组规则保存为模板,向防火墙或规则集添加规则时可直接选用该模板。

IP/端口集合(IP/Port Set)

将一组IP或端口进行保存,在向防火墙或规则集添加规则时可直接选用已建好的IP/端口集合。

IPsec隧道(IPsec Tunnel)

通过对IP协议的分组加密和认证来保护IP协议的网络传输数据,实现站点到站点(Site-to-Site)的虚拟私有网络(VPN)连接。

OSPF区域(OSPF Area)

OSPF协议按照一定标准将一个自治系统划分为不同区域,用于分层管理路由器。

NetFlow

通过Netflow对VPC路由器网卡的进出流量进行分析监控,支持两种数据流输出格式:V5、V9。

端口镜像(Port Mirroring)

将云主机网卡的网络流量复制一份到远端,对端口上的业务报文进行分析,方便对网络数据进行监控管理,在网络故障时可以快速定位故障。

路由表(Route Table)

用户自定义配置路由信息,包括目标网段、下一跳地址、路由优先级。

资源编排(CloudFormation)

一款帮助云计算用户简化云资源管理和自动化部署运维的服务。通过资源栈模板,定义所需的云资源、资源间的依赖关系、资源配置等,可实现自动化批量部署和配置资源,轻松管理云资源生命周期,通过API和SDK集成自动化运维能力。

资源栈(Resource Stack)

资源编排通过资源栈模板快速创建和配置一组资源(以及资源间的依赖关系),这组资源定义为一个资源栈,通过管理资源栈,维护这组资源。

资源栈模板(Stack Template)

一个UTF8编码格式的文件,基于模板可快速创建资源栈,用户在模板中定义所需的云资源、资源间的依赖关系、资源配置等,资源编排将解析模板,自动完成所有资源的创建和配置。

资源栈示例模板(Sample Template)

云平台提供了常用的示例模板,用户可基于已有示例模板创建资源栈。

可视化编排(Designer)

一个可视化的资源编排工具,通过在画布上拖曳连线建立资源间的依赖关系,直观高效编排云资源。

裸金属集群(Bare Metal Cluster)

为裸金属设备提供单独的集群管理。

部署服务器(Deployment Server)

一台单独的服务器,为裸金属设备提供PXE服务和控制台代理服务。

裸金属设备(Bare Metal Chassis)

用于创建裸金属主机,通过BMC接口以及IPMI配置进行唯一识别。

预配置模板(Preconfigured Template)

通过预配置模板,可快速生成预配置文件,实现无人值守批量安装裸金属主机操作系统。

裸金属主机(Bare Metal Instance)

安装操作系统的裸金属设备。

弹性裸金属管理(Elastice Baremetal Management)

不仅可为应用提供专属物理服务器,保障核心应用的高性能和稳定性,而且结合云平台中资源的弹性优势,可实现灵活申请,按需使用。

部署网络(Provision Network)

在网关代理集群中创建弹性裸金属实例时,用于PXE流程及下载镜像的专属网络。

弹性裸金属集群(Elastic BareMetal Cluster)

为裸金属节点提供单独的集群管理。

网关节点(Gateway Node)

负责云平台和网关代理集群中弹性裸金属实例间的流量转发。

裸金属节点(BareMetal Node)

用于创建弹性裸金属实例,通过BMC接口以及IPMI配置进行唯一识别。

弹性裸金属规格(Elastic BareMetal Offering)

弹性裸金属实例涉及的CPU、内存、CPU架构、CPU型号等规格定义。

弹性裸金属实例(Elastic BareMetal Instance)

性能媲美物理服务器的云实例,结合云平台中资源的弹性优势,可实现灵活申请,按需使用。

基础资源(vCenter)

云平台支持接管vCenter,并对已接管的vCenter虚拟化资源进行统一管理。

云主机(VM Instance)

运行在物理机上的ESXi虚拟机实例,具有独立的IP地址,可以访问公共网络,运行应用服务。

网络(Network)

vCenter云主机使用的网络配置,包括:IP地址范围、网关、网络服务等。

云盘(Volume)

为vCenter云主机提供存储,包括两种类型:根云盘、数据云盘。根云盘用于支撑云主机的系统运行,数据云盘用于云主机扩展的存储使用。

镜像(Image)

vCenter云主机或云盘使用的镜像模板,包括两种类型:系统镜像、云盘镜像。

事件消息(Event Message)

对已接管vCenter的事件报警消息进行集中展示查看,方便用户快速定位问题。

网络拓扑(Network Topology)

通过可视化方式展示云平台网络规划,帮助用户更高效地进行网络规划、管理和性能改进,支持两种类型:全局拓扑、自定义拓扑。

性能分析(Performance Analysis)

通过列表方式展示云平台核心资源的性能监控指标,提供外部和内部两种监控方式,支持按资源查看性能分析结果和自定义导出分析报表,方便用户掌控云平台性能状态,提高运维效率。

容量管理(Capacity Management)

通过可视化方式展示云平台核心资源的容量信息,方便用户掌控云平台容量使用情况,提高运维效率。

管理节点监控(MN Monitoring)

在多管理节点物理机高可用场景下,可直观查看每个管理节点的健康状态。

报警器(Alarm)

用于监控并响应时序性数据和事件的状态变化,支持资源报警器、事件报警器和扩展报警器。

一键报警(One-Click Alarm)

将种类繁多的资源监控项进行归纳整合,用于快速建立各种资源的监控报警服务。

报警模板(Rule Template)

一组报警器规则的通用模板,关联资源分组后,将对组内资源创建相应的报警器进行监控。

资源分组(Resource Group)

按照业务对资源进行分组,关联报警模板后,报警规则将直接作用于组内全部资源。

消息模版(Message Template)

报警器或事件向SNS系统的主题发送消息时使用的文本模板。

消息源(Message Source)

用于连接扩展消息源,接管扩展报警消息并结合报警器统一推送至各类通知对象。

通知对象(Endpoint)

用户获取订阅主题信息的方式,通知对象类型包括:系统、邮箱、钉钉、企业微信、飞书、Webhook、短信、Microsoft Teams、SNMP Trap接收端。

报警消息(Alarm Message)

报警器触发时发送的即时提示消息。

当前任务(Current Task)

展示当前正在进行中的操作,提供集中查看和管理。

操作日志(Operation Log)

云平台运行过程中变化的一种抽样,内容为指定对象的某些操作及其操作结果按时间的有序集合。

审计(Auditing)

实时监控并记录云平台的所有活动,可用于操作追踪、等保合规、安全分析、问题排查、自动运维等场景。

日志收集(Log Collection)

一键收集云平台以及各类节点在指定时间段内产生的日志,并支持下载查看。

一键巡检(One-Click Inspection)

对云平台关键资源和服务进行全方位一键式健康检查,并根据巡检结果为巡检资源和服务进行健康评分,同时提供巡检建议和巡检报告,助力高效运维,确保云平台资源和服务处于最佳状态。

灾备管理

灾备管理以业务为中心,融合定时增量备份、定时全量备份等多种灾备技术到云平台中,支持本地灾备、异地灾备等多种灾备方案,用户可根据自身业务特点,灵活选择合适的灾备方式。

灾备服务

在线备份云主机/数据云盘/弹性裸金属/云平台数据库数据到备份服务器,支持本地,跨地域和混合云多种备份场景,数据更可靠 。

备份任务(Backup Job)

通过备份任务,可将本地云主机/云盘/弹性裸金属实例/数据库定时备份到指定的存储服务器。

本地备份数据(Local Backup Data)

本地云主机/云盘/弹性裸金属实例/数据库的备份数据,存放在本地备份服务器中。

本地备份服务器(Local Backup Storage)

位于本地数据中心的存储服务器,用于存放本地备份数据或CDP数据。

远端备份服务器(Remote Backup Storage)

位于异地数据中心/公有云上的存储服务器,用于存放远端备份数据。

持续数据保护(CDP)

为云主机中的重要业务系统提供秒级细粒度的持续备份,既可以将云主机数据恢复到指定时间状态,又可以在不恢复系统的情况下找回文件。

CDP任务(CDP Task)

通过CDP任务,可将云主机数据持续备份到指定的备份服务器,实现持续数据保护。

CDP数据(CDP Data)

对云主机进行持续数据保护产生的备份数据,存放在指定的备份服务器中。

恢复点

进行CDP持续备份时产生的数据点,一个恢复点对应用户指定时间间隔内的云主机数据变化。

锁定恢复点

支持将恢复点进行锁定或解锁,锁定恢复点后,恢复点对应的数据将不会被自动清理或删除。

恢复任务

提供向导式的恢复流程,帮助用户通过指定CDP任务和恢复点快速进行数据恢复。同时提供恢复操作记录,方便后续审计和追溯。

密评合规

通过建立以商用密码为核心的云安全保障体系,满足企业在密评场景的云平台合规要求。

密码资源

提供身份认证和数据加密功能的密码设备。

第三方密码服务

支持添加第三方密码服务平台,用于对外提供验签、加密等密码服务。

密码机资源池

一组密码机的逻辑集合,对外提供统一的验签、加密等密码服务。

密码机

运用密码技术对信息实施加解密处理和认证的专用设备。

平台密评合规

通过密码机资源池提供的密码能力,满足云平台密评合规要求。

证书登录

可通过UKey设备对用户进行身份标识和鉴别,保证用户身份的真实性。

数据保护

可对云平台重要数据进行保护,保证数据的机密性和完整性。

定时任务(Scheduled Job)

一种预设任务,在指定时间执行指定行为。与定时器配合使用。

定时器(Scheduler)

承载定时任务的容器,尤其适用于长时间运行的操作。

标签(Tag)

一种资源标记,便于快速搜索和资源聚合。

迁移服务(Migration Service)

提供V2V迁移服务,可将其它虚拟化平台的云主机系统及数据完整迁移至当前云平台。

ZMigrate 迁移服务(ZMigrate Migration Service)

通过应用市场安装的迁移服务,用于将 VMware 环境中的云主机及其数据迁移至当前云平台。

V2V迁移(V2V Migration)

将VMware或KVM源云平台的云主机迁移至当前云平台。

迁移服务器(V2V Conversion Host)

V2V迁移需指定目标集群内的一台物理机作为迁移服务器,云主机系统和数据先缓存在迁移服务器中,再导入目标主存储。

用户(User)

表示自然人,是租户管理中的最基本单位。

成员组(Member Group)

有双重含义,既表示一组自然人的集合,也表示一组项目成员的集合,支持以成员组为单位进行权限控制。

角色(Role)

权限的集合,为用户和成员组赋予权限可获得调用相关API进行资源操作的能力。包括平台角色和项目角色两类。

统一认证(Single Sign On)

云平台提供的统一认证登录服务,支持无缝接入统一认证登录系统,相应统一认证用户将直接登录云平台,便捷使用云资源。

项目(Project)

项目即是租户,指在特定时间、资源、预算下指定相关人员完成特定目标的任务。租户管理中的租户主要指项目。支持以项目为导向进行资源规划,为一个具体项目建立独立的资源池。

项目成员(Project Member)

项目的基本组成人员,可在权限范围内使用项目资源完成任务目标,包括项目负责人、项目管理员和普通项目成员。

流程管理(Process Management)

为了更高效对项目提供基础资源支持,工单审批引入流程管理,包括默认流程和自定义流程两种类型。

我的审批(My Approvals)

仅admin/项目负责人/自定义审批人员拥有审批权限,可通过或驳回申请。若审批通过,资源会自动部署并下发至项目生效。

账单(Bills)

按计费价目在指定时间段统计的资源费用,计费精确至秒级。账单类型包括:项目账单、部门账单、账户账单。

计费价目(Pricing List)

一张包含不同资源计费单价的集合表,资源单价基于资源规格、资源使用时间而设置。

控制台代理(Console Proxy)

可通过代理地址登录云主机控制台。

AccessKey管理(AccessKey Management)

访问云平台API的身份凭证,具有该云平台完全的权限,包括:AccessKey ID(访问密钥 ID)和AccessKey Secret(秘密访问密钥)。

IP黑白名单(IP Blocklist/Allowlist)

云平台登录IP的黑白名单,通过对访客身份的识别和过滤,进一步提升云平台登录安全。

应用市场(Application Market)

通过内置的应用部署包或URL,快速部署应用服务并一键跳转使用,支持默认应用、拓展应用。

子账户管理(Sub-Account Management)

子账户由admin创建或统一认证系统同步,且受admin管理,子账户对自己创建的虚拟资源拥有管理权限。

主题外观(Theme)

用户可自定义设置云平台主题外观。

邮箱服务器(Email Server)

云平台报警选择邮箱类型的通知对象,需设置邮箱服务器,用来发送报警邮件。

日志服务器(Log Server)

添加日志服务器至云平台,收集管理节点或平台操作日志,可用于操作追溯和问题定位,提高云平台运维效率。

全局设置(Global Setting)

提供平台层面的功能特性设置,一经设置,云平台全局范围内生效。

场景封装(Scenario Template)

基于用户实际生产场景需求,提供场景化的一键全局设置,方便快速将云平台设置为所需状态,提高运维效率。

高可用策略(HA Policy)

云平台内计算、存储、网络资源发生故障或云主机异常停机时,确保相关业务持续稳定运行的机制。启用后,支持自定义云主机高可用策略,确保业务连续性。

API Inspector

云平台API调用的监视工具,用于记录用户在云平台上操作时所关联调用的API。

版本检查(Version Detection)

周期性自动检查最新版本并推送最新版本信息,包括版本号,版本亮点等。

时间管理(Time Management)

管理云平台时间和配置时间源,配置后云平台所有物理机将根据指定的时间源进行时间同步。

SNMP(Simple Network Management Protocol)

SNMP是简单网络管理协议,用于管理网络中的设备。第三方平台可通过该协议监控云平台上的资源和事件,并接收云平台推送的报警消息。

体验升级计划(Experience Improvement Plan)

体验升级计划是ZStack Cloud为提升产品操作体验和运行性能向用户推出的项目。征得用户同意后,该计划将统计和分析用户对云平台功能的使用情况,并将统计和分析数据用于指导产品改进优化,以期后续为用户提供更优质的服务。

共享带宽(Shared Bandwidth)

为多个虚拟IP提供带宽共享和集中限速服务,支持绑定虚拟IP的云主机使用同一条带宽,降低公网访问成本。

GPU设备(GPU Device)

拥有高计算能力的微处理器,可用于处理复杂的图形渲染和并行计算任务,帮助提高图形生产、视频处理和机器学习等业务的效率。

脚本库(Script Library)

脚本库集中存储和管理自动化脚本文件。对云主机执行脚本,可以完成复杂的运维操作和自动化任务。

XML Hook

一种脚本程序,用于在云主机XML文件中灵活插入或修改参数,从而实现定制化配置并扩展云主机功能。

容器管理(Container Management)

简单易用的容器管理,提供GPU管理调度、多租户、多集群、资源配额、CI/CD、微服务治理等功能。服务依据传统用户使用习惯,降低容器使用复杂性,帮助用户轻松实现容器集群管理和部署,快速上手,享受云原生便利。

QEMU

计算机模拟和虚拟化工具,提供完整的虚拟计算机模型用于运行客户操作系统。QEMU可完整模拟物理机CPU和其他硬件,或结合Hypervisor使客户操作系统直接执行在物理机CPU上,从而实现接近原生的性能表现。

Libvirt

虚拟化环境管理工具,提供稳定的API、命令行工具 (virsh) 和守护进程 (Libvirt),用于管理云平台上的虚拟机 (如创建、启动、关闭、迁移云主机等),并实现网络和存储配置。

Kernel

操作系统内核,负责管理CPU、内存、输入/输出设备等系统资源,协调计算机硬件和上层应用之间的交互,提供硬件抽象、资源分配、进程管理、进程间通信、系统资源安全控制等功能。

高级监控服务器(Advanced Monitoring Server)

一个定制的云主机,专用于接收和处理负载均衡等资源的高级监控数据。

高级监控服务器镜像(Advanced Monitoring Server Image)

封装了高级监控服务的镜像,专用于创建高级监控服务器,不可用于创建业务云主机。

高级监控服务器规格(Advanced Monitoring Server Offering)

定义高级监控服务器使用的CPU、内存、镜像、管理网络、公有网络配置,专用于创建高级监控服务器。

插件管理(Plugin Management)

将扩展资源或工具封装为标准化插件,便于在云平台上快速安装和集成,实现功能扩展。

可用区管理(Region Management)

可用区是一套完整的云环境,具有独立的管理节点、网络、硬件和云资源。多个可用区间可实现用户同步和免密登录。
监控报警功能使用教程 | 5.5.38 | ZStack Cloud · ZCF | ZStack 资源中心