概述
监控报警功能支持对时序化数据和事件进行监控,并通过通知服务(SNS)推送报警消息至指定的通知对象。支持资源报警器、事件报警器和扩展报警器三种报警器类型,支持系统/邮箱/钉钉/企业微信/飞书/Webhook/短信/Microsoft Teams/SNMP Trap接收端通知对象类型,部分资源报警器需安装性能优化工具才能使用。

基本原理
- 监控系统:监控系统提供以下功能:
- 时序化监控:目前支持监控两种时序化数据类型:
- 资源负载数据:例如云主机CPU使用率、物理机内存使用率等。
- 资源容量数据:例如可用IP数量、运行中云主机的总数量等。
- 事件收集:收集云平台中发生的预定义事件,例如物理机失联,云主机高可用功能启动等。
- 报警功能:对时序化数据或事件进行报警。
- 审计功能:记录所有操作并提供搜索。
- 自定义功能:用户可自定义设置报警器和报警消息模板。
- 报警器:目前支持以下报警器类型:
- 资源报警器:对时序化数据进行报警。例如:对云主机CPU使用率设置一个报警器,当某云主机CPU使用率连续5分钟超过80%,以邮件方式报警。
- 事件报警器:对事件进行报警,又称为事件订阅。例如:订阅物理机失联事件,当某个物理机失联后,以钉钉方式报警。
- 扩展报警器:接收来自消息源的报警消息。例如:存储池降级,当某个Ceph企业版的存储池降级后,在云平台以系统方式报警。
-
消息模板:报警器或事件向SNS系统的主题发送消息时使用的文本模板。
- 系统自带一个报警消息和恢复消息默认模板,若用户没有创建模板,系统将使用自带模板。
- 用户可以创建多个消息模板,但只能指定一个为默认模板,发送消息时只会使用默认模板格式化信息。
- 模板中可以通过
${}引用报警器或事件提供的变量。 - 目前消息模板支持邮箱/钉钉/企业微信/飞书/Webhook/Microsoft Teams/短信七种通知对象平台。使用消息模板,可将通知邮件、钉钉消息、企业微信消息、飞书消息、Webhook、Microsoft Teams消息或短信以统一格式发出。
-
消息源:用于连接扩展消息源,接管扩展报警消息并结合报警器统一推送至各类通知对象。方便报警消息统一管理的同时提高运维效率,目前支持接管Ceph企业版的报警消息。
- 报警器:目前支持以下报警器类型:
- 时序化监控:目前支持监控两种时序化数据类型:
- 通知服务(SNS):
通知服务将报警消息推送至通知对象,通知对象类型包括:系统/邮箱/钉钉/Webhook/短信/Microsoft Teams/企业微信/飞书/SNMP Trap接收端。
通知对象设置:- 系统默认提供一个系统类型通知对象,若报警器绑定系统类型通知对象,UI界面右上角的最近消息按钮处会出现弹窗提醒。
- 用户也可自行创建邮箱/钉钉/企业微信/飞书/Webhook/短信/Microsoft Teams/SNMP Trap接收端类型通知对象。
功能优势
- 提供丰富的报警监控条目,对云平台核心资源以及事件进行全面监控报警;
- 支持系统/邮箱/钉钉/企业微信/飞书/Webhook/短信/Microsoft Teams/SNMP Trap接收端通知对象用于订阅主题,用户可根据实际情况选择合适的报警接收方式;
- 一个报警器可同时对多个资源进行监控;
- 邮箱、钉钉、企业微信、飞书、短信、Webhook和Microsoft Teams通知对象支持自定义报警消息模板,用户可按需设置报警消息模板,从报警消息中快速定位关键信息。
- 支持创建一组报警器规则的通用模板,关联资源分组后,将对组内资源创建相应的报警器进行监控。
典型应用场景
监控报警功能对云平台核心资源以及事件进行监控,并设置报警接收机制。当核心资源出现异常,监控报警控工将按照报警级别发出实时响应,帮助运维人员快速定位解决问题。
准备工作
- admin请提前安装最新版本ZStack Cloud,并部署完成创建云主机必要的资源。
- 部分报警条目需安装性能优化工具才能进行监控报警。
- 扩展报警器需要提前创建消息源。
订阅客户端
- 邮箱通知对象:需预先添加邮箱服务器,报警消息将以邮件方式通过邮箱服务器发送到指定的邮箱地址。
- 钉钉通知对象:需预先添加钉钉群机器人,报警消息将以钉钉方式发送到指定的钉钉机器人地址。
- 企业微信通知对象:需预先添加企业微信群机器人,报警消息将以企业微信方式发送到指定的企业微信机器人地址。
- 飞书通知对象:需预先添加飞书群机器人,报警消息将以飞书方式发送到指定的飞书机器人地址。
- Webhook通知对象:需预先准备Webhook地址,报警消息将以HTTP POST方式发送到指定的HTTP地址。
- 短信通知对象:需在短信服务提供方开通短信服务。阿里云短信需额外在阿里云申请包含短信服务的Access Key,并申请短信报警模板。报警消息将以短信方式发送到指定的电话号码。
- Microsoft Teams通知对象:需预先在Microsoft Teams获取Webhook地址,报警消息将以Webhook方式发送到指定的Microsoft Teams团队或频道。
- SNMP Trap接收端通知对象:需预先开启云平台SNMP管理功能,并添加SNMP Trap接收端,报警消息将以Trap报文方式发送到SNMP Trap接收端。
具体添加方式如下:
邮箱通知对象|添加邮箱服务器
- 名称:设置邮箱服务器名称
- 简介:可选项,可留空不填
- 用户名:输入用户名
- 密码:输入用户名对应的密码
- 邮箱服务器类型:系统默认为smtp
- 邮箱服务器:输入邮箱服务器地址
- 邮箱服务器端口:输入邮箱服务器端口,默认为25
- 加密类型:可选项,支持对邮箱服务器端口设置加密连接,加密类型有:STARTTLS、SSL/TLS、NONENote:
- 默认选择STARTTLS加密类型,端口25;
- 选择SSL/TLS加密类型时,端口默认465;
- 若SMTP服务器不使用加密连接,可选择NONE。

钉钉通知对象|添加钉钉群机器人

- 自定义关键词:ZStack Cloud暂不支持发送包含指定关键词的报警消息,因此,请勿选择该安全设置,避免报警消息无法正常发送。
- 加签:选择该方式将获取加签密钥,用户需将该密钥正确填写到ZStack Cloud创建通知对象界面,确保钉钉正常接收ZStack Cloud报警消息。
- IP地址(段):选择该方式,用户需将ZStack Cloud管理节点IP地址和VIP地址全部添加到机器人的IP白名单,确保钉钉正常接收ZStack Cloud报警消息。

企业微信通知对象|添加企业微信群机器人
以电脑版企业微信为例,选择一个企业微信群,点击群设置按钮,选择。设置机器人名称,并点击添加机器人,即可完成机器人添加,并获取机器人Webhook。
对于已添加完成的机器人,用户也可点击机器人头像,查看机器人地址。
飞书通知对象|添加飞书群机器人
- 设置自定义机器人基本信息,包括:机器人头像、机器人名称、描述,并点击添加。
- 获取机器人Webhook地址,并对机器人进行安全设置,飞书机器人支持三种安全设置:
- 自定义关键词:ZStack Cloud暂不支持发送包含指定关键词的报警消息,因此,请勿选择该安全设置,避免报警消息无法正常发送。
- 签名校验:选择该方式将获取加签密钥,用户需将该密钥正确填写到ZStack Cloud创建通知对象界面,确保飞书正常接收ZStack Cloud报警消息。
- IP白名单:选择该方式,用户需将ZStack Cloud管理节点IP地址和VIP地址全部添加到机器人的IP白名单,确保飞书正常接收ZStack Cloud报警消息。
如图 7所示:


Webhook通知对象|准备Webhook地址
使用Webhook通知对象需提前准备Webhook地址,当报警器触发时,Webhook地址将收到HTTP POST方式发来的报警消息。
短信通知对象|开通第三方短信服务
-
以阿里云为例:
- 申请第三方AccessKey
在阿里云申请包含短信服务的AccessKey。
- 申请阿里云短信服务
- 申请第三方AccessKey
- 以亿美软通为例,需从亿美软通供应商获得短信服务APPId、密钥和RequestUrl。
Microsoft Teams通知对象丨添加Webhook应用




SNMP Trap接收端通知对象 | 启用SNMP管理并添加SNMP Trap接收端
在ZStack Cloud主菜单,点击,进入SNMP管理界面,点击去启用,弹出启用SNMP管理界面。
- SNMP Agent端口:指定SNMP
Agent端口,用于接收并响应第三方监控平台发送的请求Note: SNMP Agent端口配置在云平台管理节点上,默认为1161,取值范围:1024-65565。
- SNMP协议类型:选择SNMP协议类型,支持v2c、v3两种协议类型
- 如选择v2c类型,需设置以下参数:
- 团体字:设置团体字,用于第三方监控平台与云平台的连接认证
- 如选择v3类型,请设置以下参数:
- 用户名:设置用户名
- 用户鉴权:可选项,开启第三方监控平台与云平台间的安全认证。开启后,需设置以下参数:
- 鉴权协议:选择鉴权协议,支持MD5、SHA、SHA224、SHA256、SHA384、SHA512
- 鉴权密码:设置鉴权密码
- 确认鉴权密码:再次输入鉴权密码以保证准确性
- 数据加密:可选项,需先开启用户鉴权后才可开启,需设置以下参数:
- 加密协议:选择加密协议,支持DES、AES128、AES192、AES256、3DES
- 加密密码:设置加密密码
- 确认加密密码:再次输入加密密码以确保准确性
- 如选择v2c类型,需设置以下参数:
- SNMP Trap接收端:可选项,填写第三方服务器名称、IP地址和端口,用于接收云平台推送的报警消息

典型使用流程
- 按照通知对象类型预先准备订阅客户端,用于接收报警消息。如何创建订阅客户端请参考订阅客户端章节。
- 创建通知对象,用于订阅第一步中的客户端。
- 创建报警器,用于监控系统状态,支持用户自定义报警消息模板。
典型场景实践
- 邮箱通知对象资源报警器场景
- 钉钉报警器资源报警器场景
- Webhook通知对象事件报警器场景
- 企业微信通知对象事件报警器场景
- 飞书通知对象事件报警器场景
- 短信通知对象资源报警器场景
- Microsoft Teams通知对象资源报警器场景
- 扩展报警器场景
邮箱通知对象资源报警器
背景信息
场景设定:假定某企业因业务需要,需批量监控三台云主机的网卡入速度要求当任意一台云主机网卡入速度超过100Mbps时,即按照指定报警消息模板,发送报警消息至邮箱,只报警一次且不发送报警恢复消息。
- 添加邮箱服务器;
- 创建邮箱通知对象;
- 创建报警消息模板并设置为默认;
- 创建资源报警器;
- 验证报警器是否生效。
操作步骤
-
添加邮箱服务器
参考本教程订阅客户端章节,添加邮箱服务器。
-
创建邮箱通知对象
参考《用户手册》创建通知对象章节,创建邮箱通知对象。
-
创建报警消息模板
参考《用户手册》创建消息模板章节,创建报警消息模板。
-
创建资源报警器
在ZStack Cloud主菜单,点击,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
- 名称:设置资源报警器名称
- 简介:可选项,可留空不填
- 资源类型:选择云主机
- 报警条目:选择云主机网卡入速度
- 云主机:将需要监控的三台云主机添加至列表
- 报警触发规则:选择>100Mbps,持续5分钟
- 报警间隔:选择仅一次
- 报警级别:设置为紧急
- 开启报警恢复通知:不开启
- 通知对象:选择已创建的邮箱通知对象
如图 14所示:图 14. 创建资源报警器 
-
报警结果验证
后续操作
至此,邮箱通知对象资源报警器介绍完毕。
钉钉通知对象资源报警器
背景信息
场景设定:假定某用户使用云主机存储重要数据,需要监控云主机的全部磁盘剩余容量,当全部磁盘剩余容量小于100GB时,即持续发送报警消息至钉钉,并在容量恢复正常时发送报警恢复消息,此报警条目要求云主机中安装性能优化工具。
- 添加钉钉群机器人;
- 创建钉钉通知对象;
- 在监测云主机中安装性能优化工具;
- 创建资源报警器;
- 验证报警器是否生效。
操作步骤
-
添加钉钉群机器人
参考本教程订阅客户端章节,添钉钉群机器人。
-
创建钉钉通知对象
参考《用户手册》创建通知对象章节,创建钉钉通知对象。
-
在监测云主机中安装性能优化工具
参考《用户手册》的云主机性能优化工具章节,在监测云主机中安装性能优化工具。
-
创建资源报警器
在ZStack Cloud主菜单,点击,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
- 名称:设置资源报警器名称
- 简介:可选项,可留空不填
- 资源类型:选择云主机
- 报警条目:选择云主机全部磁盘剩余容量(需安装性能优化工具)
- 云主机:选择需要监控的云主机
- 报警触发规则:选择<100GB,持续10分钟
- 报警间隔:选择每30分钟
- 报警恢复通知:开启,在报警恢复后将收到报警恢复通知
- 报警级别:选择紧急
- 通知对象:选择已创建的钉钉通知对象
如图 16所示:图 16. 创建资源报警器 
- 报警结果验证
后续操作
至此,钉钉通知对象资源报警器介绍完毕。
企业微信通知对象事件报警器
背景信息
场景设定:假定某公司需监控主存储健康状态,当主存储处于失联状态时,需发送报警消息到企业微信,提示运维人员及时处理。
- 添加企业微信群机器人;
- 创建企业微信通知对象;
- 创建事件报警器;
- 验证报警器是否生效。
操作步骤
-
添加企业微信群机器人
参考本教程订阅客户端章节,添企业微信群机器人。
-
创建企业微信通知对象
参考《用户手册》创建通知对象章节,创建企业微信通知对象。
-
创建事件报警器
在ZStack Cloud主菜单,点击,进入报警器界面,点击创建事件报警器,弹出创建事件报警器界面,可参考以下示例输入相应内容:
- 资源类型:选择报警资源类型,此处选择主存储
- 报警条目:选择报警条目,此处选择主存储未连接
- 报警级别:选择报警级别,此处选择紧急
- 通知对象:选择已创建的企业微信通知对象
如图 19所示:图 19. 创建事件报警器 
-
报警结果验证
当主存储失联时,报警触发,企业微信通知对象将收到报警消息,如果再次满足报警条件,将再次收到报警消息。如图 20所示:
图 20. 企业微信通知对象报警 
后续操作
至此,企业微信通知对象事件报警器介绍完毕。
飞书通知对象事件报警器
背景信息
场景设定:假定某公司需监控物理机健康状态,当物理机处于失联状态时,需发送报警消息到飞书,提示运维人员及时处理。
- 添加飞书群机器人;
- 创建飞书通知对象;
- 创建事件报警器;
- 验证报警器是否生效。
操作步骤
-
添加飞书群机器人
参考本教程订阅客户端章节,添飞书群机器人。
-
创建飞书通知对象
参考《用户手册》创建通知对象章节,创建飞书通知对象。
-
创建事件报警器
在ZStack Cloud主菜单,点击,进入报警器界面,点击创建事件报警器,弹出创建事件报警器界面,可参考以下示例输入相应内容:
- 资源类型:选择报警资源类型,此处选择物理机
- 报警条目:选择报警条目,此处选择物理机未连接
- 报警级别:选择报警级别,此处选择紧急
- 通知对象:选择已创建的飞书通知对象
如图 21所示:图 21. 创建事件报警器 
-
报警结果验证
当主存储失联时,报警触发,飞书通知对象将收到报警消息,如果再次满足报警条件,将再次收到报警消息。如图 22所示:
图 22. 飞书通知对象报警 
后续操作
至此,飞书通知对象资源报警器介绍完毕。
Webhook通知对象事件报警器
前提条件
场景设定:假定某企业需监控关键物理机状态,若发生物理机失联,即发送报警消息至指定Webhook地址,以便运维人员及时处理。
- 准备Webhook通知对象地址;
- 创建Webhook类型通知对象;
- 创建事件报警器;
- 验证报警器是否生效。
操作步骤
-
准备Webhook通知对象地址
提前准备Webhook地址,当报警器触发时,Webhook通知对象将收到HTTP POST方式发来的报警消息。
-
创建Webhook类型通知对象
参考《用户手册》创建通知对象章节,创建Webhook类型通知对象。
-
创建事件报警器
在ZStack Cloud主菜单,点击,进入事件报警器界面,点击创建事件报警器,在弹出的创建事件报警器界面,可参考以下示例输入相应内容:
- 资源类型:选择物理机
- 报警条目:选择物理机失联
- 报警级别:选择紧急
- 通知对象:选择已创建的Webhook通知对象
如图 23所示:图 23. 创建事件报警器 
-
报警结果验证
当事件报警器达到报警条件时,报警触发,Webhook通知对象将收到报警消息,如果再次满足报警条件,将再次收到报警消息。如图 24所示:
图 24. Webhook通知对象报警 
后续操作
至此,Webhook通知对象事件报警器介绍完毕。
阿里云短信通知对象资源报警器
背景信息
场景设定:某企业需保证核心物理机的运行稳定,需监控物理机的CPU使用率,当CPU使用率大于50%时,即通过短信发送报警消息,方便运维人员进行维护。
- 申请阿里云AccessKey;
- 申请阿里云短信服务;
- 创建阿里云短信报警消息模板;
- 创建阿里云短信通知对象
- 创建资源报警器;
- 验证报警器是否生效。
操作步骤
-
申请阿里云AccessKey
在阿里云申请包含短信服务的AccessKey。
-
申请阿里云短信服务
-
创建阿里云短信报警消息模板
参考《用户手册》创建消息模板章节,创建阿里云短信报警消息模板。
-
创建短信通知对象
参考《用户手册》创建通知对象章节,创建阿里云短信通知对象。
-
创建资源报警器
在ZStack Cloud主菜单,点击,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
- 名称:设置资源报警器名称
- 简介:可选项,可留空不填
- 资源类型:选择物理机
- 报警条目:选择物理机CPU使用率
- 物理机:选择需要监控的物理机
- 报警触发规则:选择>50%,持续10分钟
- 报警间隔:选择每30分
- 报警级别:选择紧急
- 报警恢复通知:开启,在报警恢复后将收到报警恢复通知
- 通知对象:选择已创建的短信通知对象
图 26. 创建资源报警器 
-
报警结果验证
当资源报警器达到报警条件时,报警触发,短信通知对象将收到报警消息,且报警器页面报警状态变为已触发。如果超过报警间隔时间后,依然满足报警条件,将再次收到报警消息。如图 27所示:
图 27. 短信通知对象报警 
后续操作
至此,阿里云短信通知对象资源报警器介绍完毕。
亿美软通短信通知对象资源报警器
背景信息
场景设定:某企业需保证核心物理机的运行稳定,需监控物理机的CPU使用率,当CPU使用率大于50%时,即通过短信发送报警消息,方便运维人员进行维护。
- 申请亿美软通短信服务;
- 创建通用短信报警消息模板;
- 创建亿美软通短信通知对象
- 创建资源报警器;
- 验证报警器是否生效。
操作步骤
-
申请亿美软通短信服务
向亿美软通服务商申请短信服务,并获取短信服务所需的AppId、SecretKey和RequestUrl。
-
创建通用短信报警消息模板
参考《用户手册》创建消息模板章节,创建通用短信报警消息模板。
-
创建亿美软通短信通知对象
参考《用户手册》创建通知对象章节,创建亿美软通短信通知对象。
-
创建资源报警器
在ZStack Cloud主菜单,点击,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
- 名称:设置资源报警器名称
- 简介:可选项,可留空不填
- 资源类型:选择物理机
- 报警条目:选择物理机CPU使用率
- 物理机:选择需要监控的物理机
- 报警触发规则:选择>50%,持续10分钟
- 报警间隔:选择每30分
- 报警级别:选择紧急
- 报警恢复通知:开启,在报警恢复后将收到报警恢复通知
- 通知对象:选择已创建的短信通知对象
图 28. 创建资源报警器 
-
报警结果验证
当资源报警器达到报警条件时,报警触发,短信通知对象将收到报警消息,且报警器页面报警状态变为已触发。如果超过报警间隔时间后,依然满足报警条件,将再次收到报警消息。如图 29所示:
图 29. 短信通知对象报警 
后续操作
至此,亿美软通短信通知对象资源报警器介绍完毕。
Microsoft Teams通知对象资源报警器
背景信息
场景设定:某国外企业为保证核心业务云主机运行稳定,需监控云主机内存已用百分比,当内存已用百分比大于80%时,即通过Microsoft Teams接收报警消息,方便运维人员进行维护。
- 获取Microsoft Teams的Webhook地址;
- 创建Microsoft Teams报警消息模板;
- 创建Microsoft Teams通知对象;
- 创建资源报警器;
- 验证报警器是否生效。
操作步骤
-
获取Microsoft Teams的Webhook地址
在Microsoft Teams团队中添加Webhook应用,获取Webhook地址,详情请参考订阅客户端的Microsoft Teams通知对象丨添加Webhook应用章节。
-
创建Microsoft Teams报警消息模板
参考参考《用户手册》创建消息模板章节,创建报警消息模板。
-
创建Microsoft Teams通知对象
参考《用户手册》创建通知对象章节,创建Microsoft Teams通知对象。
-
创建资源报警器
在ZStack Cloud主菜单,点击,进入报警器界面,点击创建资源报警器,弹出创建资源报警器界面,可参考以下示例输入相应内容:
- 名称:设置资源报警器名称
- 简介:可选项,可留空不填
- 资源类型:选择云主机
- 报警条目:选择云主机内存已用百分比
- 云主机:选择需要监控的云主机
- 报警触发规则:选择>80%,持续1分钟
- 报警间隔:选择每30分
- 报警级别:设置为紧急
- 开启报警恢复通知:不开启
- 通知对象:选择已创建的Microsoft Teams通知对象
如图 30所示:图 30. 创建资源报警器 
-
报警结果验证
当资源报警器达到报警条件时,报警触发,Microsoft Teams通知对象将收到报警消息,且报警器页面报警状态变为已触发。如果超过报警间隔时间后,依然满足报警条件,将再次收到报警消息。如图 31所示:
图 31. Microsoft Teams通知对象报警 
后续操作
至此,Microsoft Teams通知对象资源报警器介绍完毕。
扩展报警器
背景信息
场景设定:某企业使用企业版存储,需在云平台监控企业版存储的健康状态。当企业版存储触发报警时,云平台系统通知对象也需要同步接收报警消息,方便运维人员进行维护。
- 在企业版存储页面获取访问令牌;
- 创建消息源;
- 创建扩展报警器;
- 验证报警器是否生效。
操作步骤
-
在企业版存储页面获取访问令牌
-
创建消息源
参考《用户手册》消息源章节,创建消息源。
-
创建扩展报警器
在ZStack Cloud主菜单,点击,进入扩展报警器界面,点击创建扩展报警器,弹出创建扩展报警器界面,可参考以下示例输入相应内容:
-
报警结果验证
当企业版存储触发报警时,云平台系统将收到扩展报警消息,且在消息中心中进行记录。如果再次满足报警条件,将再次收到报警消息。
后续操作
至此,扩展报警器介绍完毕。
使用建议
- 考虑到监控数据会占用一定系统资源,建议云平台相关资源按照如下配置:
- 独立规划物理服务器作为云平台管理节点。
- 考虑到监控数据可能会周期性消耗系统盘IO资源,建议使用SSD作为管理节点系统盘。
- 为避免监控数据过大导致系统盘使用率过大,系统盘空间建议规划1T以上。
- 若系统盘空间小于500G,则建议在全局设置中设置以下监控项:
- 监控数据保留周期设置为1个月。
- 监控数据保留大小设置为2的幂次方,例如32G、64G、128G。
- 根据环境规模按需使用
zstack-ctl set-deployment命令设置集群部署资源规模。不同资源数量的推荐规模如下:- default:默认环境,物理机数量50台以内时无需设置。
- small:小型环境,物理机数量100以内,或云主机数量1000以内推荐使用该设置。
- medium:中型环境,物理机数量400以内,或云主机数量4000以内推荐使用该设置。
- large:大型环境,物理机数量1000以内,或云主机数量10000以内推荐使用该设置。
附录
资源报警条目
默认报警条目
物理机
| 资源类型 | 默认报警器 | 报警条目 | 描述 |
|---|---|---|---|
| 物理机 | 物理机根盘使用率报警器 | 物理机根盘使用率≥80% |
|
镜像服务器
| 资源类型 | 默认报警器 | 报警条目 | 描述 |
|---|---|---|---|
| 镜像服务器 | 镜像服务器存储可用容量报警器 | 镜像存储可用容量百分比<20% |
|
主存储
| 资源类型 | 默认报警器 | 报警条目 | 描述 |
|---|---|---|---|
| 主存储 | 主存储可用容量报警器 | 该主存储可用容量百分比<20% |
|
| 主存储可用物理容量报警器 | 该主存储可用物理容量百分比<20% |
|
管理节点
| 资源类型 | 默认报警器 | 报警条目 | 描述 |
|---|---|---|---|
| 管理节点 | 双管理节点数据库不同步报警器 | 双管理节点数据库不同步 |
|
| 仲裁IP不可达报警器 | 仲裁IP不可达 |
|
系统数据目录
| 资源类型 | 默认报警器 | 报警条目 | 描述 |
|---|---|---|---|
| 系统数据目录 | 系统数据目录磁盘容量报警器 | 管理节点数据目录磁盘占用率≥70% |
|
许可证
| 资源类型 | 默认报警器 | 报警条目 | 描述 |
|---|---|---|---|
| 许可证 | 许可证过期时间报警器 | 默认许可证过期时间≤15天 |
|
CDP任务
| 资源类型 | 默认报警器 | 报警条目 | 描述 |
|---|---|---|---|
| CDP任务(需拥有持续数据保护CDP模块许可证) | CDP任务已用容量报警器 | CDP任务已用容量占规划容量百分比>80% |
|
| CDP任务RPO偏移报警器 | RPO偏移时间>5分钟 |
|
自定义报警条目
云主机
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 云主机 | CPU | CPU使用率 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
| CPU空闲率 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 平均CPU使用率 | 批量监控单台云主机的平均CPU使用率。当所选云主机中,任一云主机的平均CPU使用率达到报警条件,即可触发报警。 | ||
| 全部CPU使用率 | 批量监控多台云主机的CPU使用率,任一云主机的全部CPU整体使用率达到报警条件即可触发报警。 Note: 全部CPU使用率可能略大于100%。 |
||
| 全部CPU空闲率 | 批量监控多台云主机的CPU空闲率,任一云主机的全部CPU整体空闲率达到报警条件即可触发报警。 Note: 全部CPU空闲率可能略大于100%。 |
||
| CPU使用率(需安装agent) | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘 | 磁盘读IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
|
| 全部磁盘读IOPS | 批量监控多个云主机的磁盘读IOPS,任一云主机所有磁盘的读IOPS之和达到报警条件即可触发报警。 | ||
| 磁盘写IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部磁盘写IOPS | 批量监控多个云主机的磁盘写IOPS,任一云主机所有磁盘的写IOPS之和达到报警条件即可触发报警。 | ||
| 磁盘读速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部磁盘读速度 | 批量监控多个云主机的磁盘读速度,任一云主机所有磁盘的读速度之和达到报警条件即可触发报警。 | ||
| 磁盘写速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部磁盘写速度 | 批量监控多个云主机的磁盘写速度,任一云主机所有磁盘的写速度之和达到报警条件即可触发报警。 | ||
| 全部磁盘剩余容量(需安装agent) | 批量监控多个云主机的磁盘剩余容量,任一云主机所有磁盘的剩余容量之和达到报警条件即可触发报警。 | ||
| 全部磁盘剩余容量百分比(需安装agent) | 批量监控多个云主机的磁盘剩余容量百分比,任一云主机全部磁盘剩余容量百分比(百分比=所有磁盘剩余容量之和/所有磁盘容量之和)达到报警条件即可触发报警。 | ||
| 全部磁盘已使用容量(需安装agent) | 批量监控多个云主机的磁盘已使用容量,任一云主机所有磁盘的已使用容量之和达到报警条件即可触发报警。 | ||
| 全部磁盘已使用容量百分比(需安装agent) | 批量监控多个云主机的磁盘已使用容量百分比,任一云主机全部磁盘已使用容量百分比(百分比=所有磁盘已使用容量之和/所有磁盘容量之和)达到报警条件即可触发报警。 | ||
| 磁盘已使用容量(需安装agent) | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘已使用容量百分比(需安装agent) | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘剩余容量百分比(需安装agent) | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘剩余容量(需安装agent) | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡 | 网卡入速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
|
| 全部网卡入速度 | 批量监控多个云主机的网卡入速度,任一云主机所有网卡入速度之和达到报警条件即可触发报警。 | ||
| 网卡入包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡入包数 | 批量监控多个云主机的网卡入包数,任一云主机所有网卡入包数之和达到报警条件即可触发报警。 | ||
| 网卡入错误数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡入错误数 | 批量监控多个云主机的网卡入错误数,任一云主机所有网卡入错误数之和达到报警条件即可触发报警。 | ||
| 网卡出速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡出速度 | 批量监控多个云主机的网卡出速度,任一云主机所有网卡出速度之和达到报警条件即可触发报警。 | ||
| 网卡出包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡出包数 | 批量监控多个云主机的网卡出包数,任一云主机所有网卡出包数之和达到报警条件即可触发报警。 | ||
| 网卡出错误数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡出错误数 | 批量监控多个云主机的网卡出错误数,任一云主机所有网卡出错误数之和达到报警条件即可触发报警。 | ||
| 内存 | 内存空闲容量 | 批量监控多个云主机的内存空闲容量,任一云主机的内存空闲容量达到报警条件即可触发报警。 | |
| 内存空闲百分比 | 批量监控多个云主机的内存空闲百分比,任一云主机的内存空闲百分比达到报警条件即可触发报警。 | ||
| 内存已用容量 | 批量监控多个云主机的内存已用容量,任一云主机的内存已用容量达到报警条件即可触发报警。 | ||
| 内存已用百分比 | 批量监控多个云主机的内存已用百分比,任一云主机的内存已用百分比达到报警条件即可触发报警。 | ||
| 内存已用百分比(需安装agent) | 批量监控多个云主机的内存已用百分比,任一云主机的内存已用百分比达到报警条件即可触发报警。 | ||
| 其他 | 云主机数量 | 监控云平台内所有KVM云主机数量,达到报警条件即可触发报警。 | |
| 运行云主机数量 | 监控云平台内所有运行状态的KVM云主机数量,达到报警条件即可触发报警。 | ||
| 运行云主机百分比 | 监控云平台内所有运行状态的KVM云主机百分比,达到报警条件即可触发报警。 | ||
| 停止云主机数量 | 监控云平台内所有停止状态的KVM云主机数量,达到报警条件即可触发报警。 | ||
| 停止云主机百分比 | 监控云平台内所有停止状态的KVM云主机百分比,达到报警条件即可触发报警。 | ||
| 其他状态云主机数量 | 监控云平台内所有其他状态(不包括:停止/运行)的KVM云主机数量,达到报警条件即可触发报警。 | ||
| 其他状态云主机百分比 | 监控云平台内所有其他状态(不包括:停止/运行)的KVM云主机百分比,达到报警条件即可触发报警。 |
裸金属主机
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 裸金属主机(已安装裸金属管理模块许可证) | CPU | CPU使用率 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
| 磁盘 | 磁盘读IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
|
| 磁盘写IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘读速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘写速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘已使用容量 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘已使用容量百分比 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘剩余容量百分比 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘剩余容量 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡 | 网卡入速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
|
| 网卡入包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡入错误数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡出速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡出包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡出错误数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 内存 | 内存总量 | 批量监控多个裸金属主机的内存总量,任一裸金属主机的内存总量达到报警条件即可触发报警。 | |
| 剩余内存量 | 批量监控多个裸金属主机的剩余内存量,任一裸金属主机的剩余内存量达到报警条件即可触发报警。 | ||
| 已用内存量 | 批量监控多个裸金属主机的已用内存量,任一裸金属主机的已用内存量达到报警条件即可触发报警。 | ||
| 可用内存量 | 批量监控多个裸金属主机的可用内存量,任一裸金属主机的可用内存量达到报警条件即可触发报警。 | ||
| 剩余内存百分比 | 批量监控多个裸金属主机的内存已用百分比,任一裸金属主机的内存已用百分比达到报警条件即可触发报警。 | ||
| 内存使用率 | 批量监控多个裸金属主机的内存使用率,任一裸金属主机的内存使用率达到报警条件即可触发报警。 |
弹性裸金属实例
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 弹性裸金属实例(已安装裸金属管理模块许可证) | CPU | CPU使用率 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
| CPU平均使用率 | 批量监控多个弹性裸金属实例的平均CPU使用率,任一弹性裸金属实例的平均CPU使用率达到报警条件即可触发报警。 | ||
| 磁盘 | 磁盘读IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
|
| 磁盘写IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘读速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘写速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘已使用容量 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘已使用容量百分比 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘剩余容量 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘剩余容量百分比 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡 | 网卡入速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
|
| 网卡入包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡入错误数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡出速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡出包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡出错误数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 内存 | 内存总量 | 批量监控多个弹性裸金属实例的内存总量,任一弹性裸金属实例的内存总量达到报警条件即可触发报警。 | |
| 剩余内存量 | 批量监控多个弹性裸金属实例的剩余内存量,任一弹性裸金属实例的剩余内存量达到报警条件即可触发报警。 | ||
| 已用内存量 | 批量监控多个弹性裸金属实例的已用内存量,任一弹性裸金属实例的已用内存量达到报警条件即可触发报警。 | ||
| 可用内存量 | 批量监控多个弹性裸金属实例的可用内存量,任一弹性裸金属实例的可用内存量达到报警条件即可触发报警。 | ||
| 剩余内存百分比 | 批量监控多个弹性裸金属实例的内存已用百分比,任一弹性裸金属实例的内存已用百分比达到报警条件即可触发报警。 | ||
| 内存使用率 | 批量监控多个弹性裸金属实例的内存使用率,任一弹性裸金属实例的内存使用率达到报警条件即可触发报警。 |
VPC路由器
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| VPC路由器 | CPU | CPU使用率 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
| CPU空闲率 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部CPU使用率 | 批量监控多个VPC路由器的CPU使用率,任一VPC路由器的全部CPU整体使用率达到报警条件,即可触发报警。 Note: 全部CPU使用率可能略大于100%。 |
||
| 全部CPU空闲率 | 批量监控多个VPC路由器的CPU空闲率,任一VPC路由器的全部CPU整体空闲率达到报警条件即可触发报警。 Note: 全部CPU空闲率可能略大于100% |
||
| 磁盘 | 磁盘读IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
|
| 全部磁盘读IOPS | 批量监控多个VPC路由器的磁盘读IOPS,任一VPC路由器所有磁盘的读IOPS之和达到报警条件即可触发报警。 | ||
| 磁盘写IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部磁盘写IOPS | 批量监控多个VPC路由器的磁盘写IOPS,任一VPC路由器所有磁盘的写IOPS之和达到报警条件即可触发报警。 | ||
| 磁盘读速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部磁盘读速度 | 批量监控多个VPC路由器的磁盘读速度,任一VPC路由器所有磁盘的读速度之和达到报警条件即可触发报警。 | ||
| 磁盘写速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部磁盘写速度 | 批量监控多个VPC路由器的磁盘写速度,任一VPC路由器所有磁盘的写速度之和达到报警条件即可触发报警。 | ||
| 全部磁盘剩余容量(已预装agent) | 批量监控多个VPC路由器的全部磁盘剩余容量,任一VPC路由器全部磁盘剩余容量达到报警条件即可触发报警。 | ||
| 全部磁盘剩余容量百分比(已预装agent) | 批量监控多个VPC路由器的全部磁盘剩余容量百分比,任一VPC路由器全部磁盘剩余容量百分比达到报警条件即可触发报警。 | ||
| 全部磁盘已使用容量(已预装agent) | 批量监控多个VPC路由器的全部磁盘已使用容量,任一VPC路由器全部磁盘已使用容量达到报警条件即可触发报警。 | ||
| 全部磁盘已使用容量百分比(已预装agent) | 批量监控多个VPC路由器的全部磁盘已使用容量百分比,任一VPC路由器全部磁盘已使用容量百分比达到报警条件即可触发报警。 | ||
| 磁盘剩余容量(已预装agent) | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘剩余容量百分比(已预装agent) | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘已使用容量(已预装agent) | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘已使用容量百分比(已预装agent) | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡 | 网卡入速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
|
| 全部网卡入速度 | 批量监控多个VPC路由器的网卡入速度,任一VPC路由器所有网卡入速度之和达到报警条件即可触发报警。 | ||
| 网卡入包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡入包数 | 批量监控多个VPC路由器的网卡入包数,任一VPC路由器所有网卡入包数之和达到报警条件即可触发报警。 | ||
| 网卡入错误数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡入错误数 | 批量监控多个VPC路由器的网卡入错误数,任一VPC路由器所有网卡入错误数之和达到报警条件即可触发报警。 | ||
| 网卡出速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡出速度 | 批量监控多个VPC路由器的网卡出速度,任一VPC路由器所有网卡出速度之和达到报警条件即可触发报警。 | ||
| 网卡出包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡出包数 | 批量监控多个VPC路由器的网卡出包数,任一VPC路由器所有网卡出包数之和达到报警条件即可触发报警。 | ||
| 网卡出错误数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部网卡出错误数 | 批量监控多个VPC路由器的网卡出错误数,任一VPC路由器所有网卡出错误数之和达到报警条件即可触发报警。 | ||
| 内存 | 内存空闲容量 | 批量监控多个VPC路由器的内存空闲容量,任一VPC路由器的内存空闲容量达到报警条件即可触发报警。 | |
| 内存空闲百分比 | 批量监控多个VPC路由器的内存空闲百分比,任一VPC路由器的内存空闲百分比达到报警条件即可触发报警。 | ||
| 内存已用容量 | 批量监控多个VPC路由器的内存已用容量,任一VPC路由器的内存已用容量达到报警条件即可触发报警。 | ||
| 内存已用百分比 | 批量监控多个VPC路由器的内存已用百分比,任一VPC路由器的内存已用百分比达到报警条件即可触发报警。 |
镜像
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 镜像 | 镜像总数 | 监控云平台内镜像总数,达到报警条件即可触发报警。 | |
| 可用镜像总数 | 监控云平台内可用镜像总数,达到报警条件即可触发报警。 | ||
| 可用镜像百分比 | 监控云平台内可用镜像百分比,达到报警条件即可触发报警。 | ||
| 根云盘镜像数量 | 监控云平台内根云盘镜像数量,达到报警条件即可触发报警。 | ||
| 根云盘镜像百分比 | 监控云平台内根云盘镜像百分比,达到报警条件即可触发报警。 | ||
| 数据云盘镜像数量 | 监控云平台内数据云盘镜像数量,达到报警条件即可触发报警。 | ||
| 数据云盘镜像百分比 | 监控云平台内数据云盘镜像百分比,达到报警条件即可触发报警。 | ||
| ISO镜像数量 | 监控云平台内ISO镜像数量,达到报警条件即可触发报警。 | ||
| ISO镜像百分比 | 监控云平台内ISO镜像百分比,达到报警条件即可触发报警。 | ||
镜像
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 镜像 | 镜像总数 | 监控云平台内镜像总数,达到报警条件即可触发报警。 | |
| 可用镜像总数 | 监控云平台内可用镜像总数,达到报警条件即可触发报警。 | ||
| 可用镜像百分比 | 监控云平台内可用镜像百分比,达到报警条件即可触发报警。 | ||
| 根云盘镜像数量 | 监控云平台内根云盘镜像数量,达到报警条件即可触发报警。 | ||
| 根云盘镜像百分比 | 监控云平台内根云盘镜像百分比,达到报警条件即可触发报警。 | ||
| 数据云盘镜像数量 | 监控云平台内数据云盘镜像数量,达到报警条件即可触发报警。 | ||
| 数据云盘镜像百分比 | 监控云平台内数据云盘镜像百分比,达到报警条件即可触发报警。 | ||
| ISO镜像数量 | 监控云平台内ISO镜像数量,达到报警条件即可触发报警。 | ||
| ISO镜像百分比 | 监控云平台内ISO镜像百分比,达到报警条件即可触发报警。 | ||
镜像服务器
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 镜像服务器 | 全部镜像存储可用容量 | 监控云平台内所有镜像服务器的可用容量,所有镜像服务器的可用容量之和达到报警条件即可触发报警。 | |
| 全部镜像存储可用容量百分比 | 监控云平台内所有镜像服务器的可用容量百分比(百分比=所有镜像服务器可用容量之和/所有镜像服务器容量之和),达到报警条件即可触发报警。 | ||
| 镜像存储可用容量 | 批量监控多个镜像服务器的可用容量,任一镜像服务器的可用容量达到报警条件即可触发报警。 | ||
| 镜像存储可用容量百分比 | 批量监控多个镜像服务器的可用容量百分比,任一镜像服务器的可用容量百分比达到报警条件即可触发报警。 | ||
| 全部镜像存储已用容量 | 监控云平台内所有镜像服务器的已用容量,所有镜像服务器的已用容量之和达到报警条件即可触发报警。 | ||
| 全部镜像存储已用容量百分比 | 监控云平台内所有镜像服务器的已用容量百分比(百分比=所有镜像服务器已用容量之和/所有镜像服务器容量之和),达到报警条件即可触发报警。 | ||
| 镜像存储已用容量 | 批量监控多个镜像服务器的已用容量,任一镜像服务器的已用容量达到报警条件即可触发报警。 | ||
| 镜像存储已用容量百分比 | 批量监控多个镜像服务器的已用容量百分比,任一镜像服务器的已用容量百分比达到报警条件即可触发报警。 | ||
| 镜像存储禁用容量 | 监控云平台内镜像服务器的保留容量配置,保留容量达到报警条件即可触发报警。 | ||
| 镜像存储禁用容量百分比 | 监控云平台内镜像服务器的保留容量配置,任一镜像服务器禁用容量百分比(百分比=保留容量/镜像服务器总容量)达到报警条件即可触发报警。 | ||
系统数据目录
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 系统数据目录 | 管理节点数据目录磁盘空闲容量 | 监控管理节点数据目录磁盘的空闲容量,达到报警条件即可触发报警。 | |
| 管理节点数据目录磁盘空闲率 | 监控管理节点数据目录磁盘的空闲率,达到报警条件即可触发报警。 | ||
| 管理节点数据目录磁盘已用容量 | 监控管理节点数据目录磁盘的已用容量,达到报警条件即可触发报警。 | ||
| 管理节点数据目录磁盘占用率 | 监控管理节点数据目录磁盘的占用率,达到报警条件即可触发报警。 | ||
物理机
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 物理机 | CPU | CPU空闲率 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
| 全部CPU空闲率 | 监控所选物理机的CPU空闲率。支持选择一台或多台物理机,其中任一物理机的全部CPU整体空闲率达到报警条件即可触发报警。 Note: 全部CPU空闲率可能略大于100%。 |
||
| CPU使用率 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 平均CPU使用率 | 监控所选物理机的CPU使用率。支持选择一台或多台物理机,其中任一物理机的平均CPU使用率达到报警条件即可触发报警。 | ||
| 全部CPU使用率 | 监控所选物理机的CPU使用率。支持选择一台或多台物理机,其中任一物理机的全部CPU整体使用率达到报警条件即可触发报警。 Note: 全部CPU使用率可能略大于100%。 |
||
| 已使用CPU数量 | 监控所选物理机的已使用CPU数量。支持选择一台或多台物理机,其中任一物理机的已使用CPU数量达到报警条件即可触发报警。 | ||
| 已使用CPU百分比 | 监控所选物理机的已使用CPU百分比。支持选择一台或多台物理机,其中任一物理机已使用的CPU数量占该物理机总CPU数量百分比达到报警条件即可触发报警。 | ||
| 可用CPU数量 | 监控所选物理机的可用CPU数量。支持选择一台或多台物理机,其中任一物理机的可用CPU数量达到报警条件即可触发报警。 | ||
| 可用CPU百分比 | 监控所选物理机的可用CPU百分比。支持选择一台或多台物理机,其中任一物理机可用CPU数量占该物理机总CPU数量百分比达到报警条件即可触发报警。 | ||
| 全部物理机CPU数量 | 监控云平台内所有物理机的CPU数量,所有物理机的CPU数量之和达到报警条件即可触发报警。 | ||
| 全部物理机已使用CPU数量 | 监控云平台内所有物理机已使用的CPU数量,所有物理机已使用CPU数量之和达到报警条件即可触发报警。 | ||
| 全部物理机已禁用CPU数量 | 监控云平台内所有物理机已禁用的CPU数量,所有物理机已禁用CPU数量之和达到报警条件即可触发报警。 | ||
| 全部物理机已使用CPU百分比 | 监控云平台内所有物理机总体CPU使用情况,所有物理机已使用CPU百分比(百分比=所有物理机已使用CPU数量之和/所有物理机总CPU数量)达到报警条件即可触发报警。 | ||
| 全部物理机已禁用CPU百分比 | 监控云平台内所有物理机总体CPU禁用情况,所有物理机已禁用CPU百分比(百分比=所有物理机已禁用CPU数量之和/所有物理机总CPU数量)达到报警条件即可触发报警。 | ||
| 全部物理机可用CPU数量 | 监控云平台内所有物理机可用CPU数量,所有物理机可用CPU数量之和达到报警条件即可触发报警。 | ||
| 全部物理机可用CPU百分比 | 监控云平台内所有物理机总体CPU可用情况,所有物理机可用CPU百分比(百分比=所有物理机可用CPU数量之和/所有物理机总CPU数量)达到报警条件即可触发报警。 | ||
| 内存 | 物理内存未使用量 | 监控所选物理机的物理内存未使用量。支持选择一台或多台物理机,其中任一物理机的物理内存未使用量达到报警条件即可触发报警。 | |
| 物理内存未使用百分比 | 监控所选物理机的物理内存未使用百分比。支持选择一台或多台物理机,其中任一物理机的物理内存未使用百分比达到报警条件即可触发报警。 | ||
| 物理内存已使用量 | 监控所选物理机的物理内存已使用量。支持选择一台或多台物理机,其中任一物理机的物理内存已使用量达到报警条件即可触发报警。 | ||
| 物理内存已使用百分比 | 监控所选物理机的物理内存已使用百分比。支持选择一台或多台物理机,其中任一物理机的物理内存已使用百分比达到报警条件即可触发报警。 | ||
| 虚拟内存已使用量 | 监控所选物理机的虚拟内存已使用量。支持选择一台或多台物理机,其中任一物理机的虚拟内存已使用量达到报警条件即可触发报警。 | ||
| 虚拟内存已使用百分比 | 监控所选物理机的虚拟内存已使用百分比。支持选择一台或多台物理机,其中任一物理机的虚拟内存已使用百分比达到报警条件即可触发报警。 | ||
| 虚拟内存可用量 | 监控所选物理机的虚拟内存可用量。支持选择一台或多台物理机,其中任一物理机的虚拟内存可用量达到报警条件即可触发报警。 | ||
| 虚拟内存可用百分比 | 监控所选物理机的虚拟内存可用百分比。支持选择一台或多台物理机,其中任一物理机的虚拟内存可用百分比达到报警条件即可触发报警。 | ||
| 全部物理机物理内存容量 | 监控云平台内所有物理机的物理内存容量,所有物理机的物理内存容量总和达到报警条件即可触发报警。 | ||
| 全部物理机物理内存已使用量 | 监控云平台内所有物理机的物理内存已使用量,所有物理机物理内存已使用量总和达到报警条件即可触发报警。 | ||
| 全部物理机物理内存已使用百分比 | 监控云平台内所有物理机的总体物理内存使用情况,所有物理机内存已使用百分比(百分比=所有物理机已使用物理内存之和/所有物理机总物理内存)达到报警条件即可触发报警。 | ||
| 全部物理机物理内存已禁用量 | 监控云平台内所有物理机保留物理内存配置,所有物理机保留物理内存容量达到报警条件即可触发报警。 | ||
| 全部物理机物理内存已禁用百分比 | 监控云平台内物理机保留物理内存配置,所有物理机保留物理内存百分比(百分比=所有物理机保留物理内存之和/所有物理机总物理内存)达到报警条件即可触发报警。 | ||
| 全部物理机物理内存剩余量 | 监控云平台内所有物理机的剩余物理内存容量,所有物理机的剩余物理内存容量之和达到报警条件即可触发报警。 | ||
| 全部物理机物理内存剩余百分比 | 监控云平台内所有物理机的总体物理内存剩余情况,所有物理机的剩余物理内存容量百分比(百分比=所有物理机剩余物理内存容量之和/所有物理机总物理内存容量)达到报警条件即可触发报警。 | ||
| 磁盘 | 磁盘读IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
|
| 全部磁盘读IOPS | 监控所选物理机的磁盘读IOPS。支持选择一台或多台物理机,其中任一物理机的所有磁盘读IOPS之和达到报警条件即可触发报警。 | ||
| 磁盘写IOPS | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部磁盘写IOPS | 监控所选物理机的磁盘写IOPS。支持选择一台或多台物理机,其中任一物理机的所有磁盘写IOPS之和达到报警条件即可触发报警。 | ||
| 磁盘读速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部磁盘读速度 | 监控所选物理机的磁盘读速度。支持选择一台或多台物理机,其中任一物理机的所有磁盘读速度之和达到报警条件即可触发报警。 | ||
| 磁盘写速度 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 全部磁盘写速度 | 监控所选物理机的磁盘写速度。支持选择一台或多台物理机,其中任一物理机的所有磁盘写速度之和达到报警条件即可触发报警。 | ||
| 全部磁盘剩余容量 | 监控所选物理机的磁盘剩余容量。支持选择一台或多台物理机,其中任一物理机的所有磁盘剩余容量之和达到报警条件即可触发报警。 | ||
| 全部磁盘剩余容量百分比 | 监控所选物理机的磁盘容量剩余情况。支持选择一台或多台物理机,其中任一物理机的所有磁盘剩余容量百分比(百分比=该物理机所有磁盘剩余容量之和/该物理机所有磁盘容量之和)达到报警条件即可触发报警。 | ||
| 全部磁盘已使用容量 | 监控所选物理机的磁盘已使用容量。支持选择一台或多台物理机,其中任一物理机的所有磁盘已使用容量之和达到报警条件即可触发报警。 | ||
| 全部磁盘已使用容量百分比 | 监控所选物理机的磁盘容量已使用情况。支持选择一台或多台物理机,其中任一物理机的所有磁盘已使用容量百分比(百分比=该物理机所有磁盘已使用容量之和/该物理机所有磁盘容量之和)达到报警条件即可触发报警。 | ||
| 磁盘容量 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘剩余容量百分比 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘已使用容量 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 磁盘已使用容量百分比 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 根盘使用率 | 监控所选物理机的根盘使用率。支持选择一台或多台物理机,其中任一物理机的根盘使用率达到报警条件即可触发报警。 | ||
| 根盘使用容量 | 监控所选物理机的根盘使用容量。支持选择一台或多台物理机,其中任一物理机的根盘使用容量达到报警条件即可触发报警。 | ||
| XFS文件系统碎片化程度百分比 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡 | 单个网卡入速度 | 监控所选物理机上指定网卡的入速度。
|
|
| 全部网卡入速度 | 监控所选物理机的网卡入速度。支持选择一台或多台物理机,其中任一物理机所有网卡入速度之和达到报警条件即可触发报警。 | ||
| 单个网卡入包数 | 监控所选物理机上指定网卡的入包数。
|
||
| 全部网卡入包数 | 监控所选物理机的网卡入包数。支持选择一台或多台物理机,其中任一物理机所有网卡入包数之和达到报警条件即可触发报警。 | ||
| 单个网卡入错误 | 监控所选物理机上指定网卡的入错误数。
|
||
| 全部网卡入错误数 | 监控所选物理机的网卡入错误数。支持选择一台或多台物理机,其中任一物理机所有网卡入错误数之和达到报警条件即可触发报警。 | ||
| 单个网卡出速度 | 监控所选物理机上指定网卡的出速度。
|
||
| 全部网卡出速度 | 监控所选物理机的网卡出速度。支持选择一台或多台物理机,其中任一物理机所有网卡出速度之和达到报警条件即可触发报警。 | ||
| 单个网卡出包数 | 监控所选物理机上指定网卡的出包数。
|
||
| 全部网卡出包数 | 监控所选物理机的网卡出报数。支持选择一台或多台物理机,其中任一物理机所有网卡出包数之和达到报警条件即可触发报警。 | ||
| 单个网卡出错误数 | 监控所选物理机上指定网卡的出错误数。
|
||
| 全部网卡出错误数 | 监控所选物理机的网卡出错误数。支持选择一台或多台物理机,其中任一物理机所有网卡出错误数之和达到报警条件即可触发报警。 | ||
| Conntrack连接数 | 监控所选物理机的Conntrack连接数。支持选择一台或多台物理机,其中任一物理机的Conntrack连接数达到报警条件即可触发报警。 | ||
| Conntrack已使用百分比 | 监控所选物理机的Conntrack已使用百分比。支持选择一台或多台物理机,其中任一物理机Conntrack已使用百分比达到报警条件即可触发报警。 | ||
| 网卡入丢包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| 网卡出丢包数 | 是否指定配置,对资源的监控粒度不同。可按需选择:
|
||
| HBA设备 | FC-HBA链路故障总数 | 监控所选物理机的FC-HBA链路故障总数。支持选择一台或多台物理机,其中任一物理机的任一FC-HBA链路达到报警条件即可触发报警。 Note: 请确保被监控的FC-HBA设备存在/sys/class/fc_host/<Name>/statistics目录,如不存在,将无法监控该FC-HBA链路故障数并触发报警。 |
|
| FC-HBA链路信号丢失次数 | 监控所选物理机的FC-HBA链路信号丢失次数。支持选择一台或多台物理机,其中任一物理机的任一FC-HBA链路达到报警条件即可触发报警。 Note: 请确保被监控的FC-HBA设备存在/sys/class/fc_host/<Name>/statistics目录,如不存在,将无法监控该FC-HBA链路信号丢失次数并触发报警。 |
||
| 其他 | 物理机数量 | 监控云平台内物理机数量,物理机总数达到报警条件即可触发报警。 | |
| 已连接物理机数量 | 监控云平台内物理机数量,已连接物理机数量达到报警条件即可触发报警。 | ||
| 已连接物理机百分比 | 监控云平台内物理机数量,已连接物理机百分比(百分比=已连接物理机数量/物理机总数)达到报警条件即可触发报警。 | ||
| 未连接物理机数量 | 监控云平台内物理机数量,未连接物理机数量达到报警条件即可触发报警。 | ||
| 未连接物理机百分比 | 监控云平台内物理机数量,未连接物理机百分比(百分比=未连接物理机数量/物理机总数)达到报警条件即可触发报警。 |
裸金属网关节点
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 弹性裸金属网关节点 | 弹性裸金属网关节点数量 | 监控云平台内弹性裸金属网关节点数量,弹性裸金属网关节点总数达到报警条件即可触发报警。 | |
| 已连接弹性裸金属网关节点数量 | 监控云平台内弹性裸金属网关节点数量,已连接弹性裸金属网关节点数量达到报警条件即可触发报警。 | ||
| 已连接弹性裸金属网关节点百分比 | 监控云平台内弹性裸金属网关节点数量,已连接弹性裸金属网关节点百分比(百分比=已连接弹性裸金属网关节点数量/弹性裸金属网关节点总数)达到报警条件即可触发报警。 | ||
| 未连接弹性裸金属网关节点数量 | 监控云平台内弹性裸金属网关节点数量,未连接弹性裸金属网关节点数量达到报警条件即可触发报警。 | ||
| 未连接弹性裸金属网关节点百分比 | 监控云平台内弹性裸金属网关节点数量,未连接弹性裸金属网关节点百分比(百分比=未连接弹性裸金属网关节点数量/弹性裸金属网关节点总数)达到报警条件即可触发报警。 | ||
三层网络
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 三层网络 | 全部可用IP数 (IPv4) | 监控云平台内所有IPv4类型三层网络的IP地址数量,所有三层网络的可用IP数之和达到报警条件即可触发报警。 | |
| 全部可用IP百分比 (IPv4) | 监控云平台内所有IPv4类型三层网络的IP地址数量,全部可用IP百分比(全部可用IP百分比=所有三层网络可用IP总数/所有三层网络IP总数)达到报警条件即可触发报警。 | ||
| 全部已用IP数 (IPv4) | 监控云平台内所有IPv4类型三层网络的IP地址数量,所有三层网络的已用IP数之和达到报警条件即可触发报警。 | ||
| 全部已用IP百分比 (IPv4) | 监控云平台内所有IPv4类型三层网络的IP地址数量,全部已用IP百分比(全部已用IP百分比=所有三层网络已用IP总数/所有三层网络IP总数)达到报警条件即可触发报警。 | ||
| 全部已禁用IP数 (IPv4) | 监控云平台内所有IPv4类型三层网络的IP地址数量,所有三层网络的已禁用IP数之和达到报警条件即可触发报警。 | ||
| 全部已禁用IP百分比 (IPv4) | 监控云平台内所有IPv4类型三层网络的IP地址数量,全部已禁用IP百分比(全部已禁用IP百分比=所有三层网络禁用IP总数/所有三层网络IP总数)达到报警条件即可触发报警。 | ||
| 可用IP数 (IPv4) | 批量监控多个IPv4类型三层网络的IP地址数量,任一三层网络的可用IP数达到报警条件即可触发报警。 | ||
| 可用IP百分比 (IPv4) | 批量监控多个IPv4类型三层网络的IP地址数量,任一三层网络的可用IP百分比达到报警条件即可触发报警。 | ||
| 已用IP数 (IPv4) | 批量监控多个IPv4类型三层网络的IP地址数量,任一三层网络的已用IP数达到报警条件即可触发报警。 | ||
| 已用IP百分比 (IPv4) | 批量监控多个IPv4类型三层网络的IP地址数量,任一三层网络的已用IP百分比达到报警条件即可触发报警。 | ||
云盘
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 云盘 | 云盘总数 | 监控云平台内根云盘和数据云盘数量,根云盘和数据云盘数量之和达到报警条件即可触发报警。 | |
| 根云盘总数 | 监控云平台内根云盘数量,根云盘总数达到报警条件即可触发报警。 | ||
| 根云盘百分比 | 监控云平台内根云盘百分比(百分比=根云盘数量/根云盘和数据云盘数量之和),达到报警条件即可触发报警。 | ||
| 数据云盘总数 | 监控云平台内数据云盘数量,数据云盘总数达到报警条件即可触发报警。 | ||
| 数据云盘百分比 | 监控云平台内数据云盘百分比(百分比=数据云盘数量/根云盘和数据云盘数量之和),达到报警条件即可触发报警。 | ||
| 可用数据云盘总数 | 监控云平台内数据云盘状态,可用数据云盘数量达到报警条件即可触发报警。 | ||
| 可用数据云盘百分比 | 监控云平台内数据云盘状态,可用数据云盘百分比(百分比=可用数据云盘数量/数据云盘总量)达到报警条件即可触发报警。 | ||
| 云盘快照总数 | 监控云平台内云盘快照(数据云盘快照+根云盘快照)数量,云盘快照总数达到报警条件即可触发报警。 | ||
| 根云盘快照总数 | 监控云平台内根云盘快照数量,根云盘快照总数达到报警条件即可触发报警。 | ||
| 根云盘快照百分比 | 监控云平台内根云盘快照百分比(百分比=根云盘快照总数/根云盘快照与数据云盘快照之和),达到报警条件即可触发报警。 | ||
| 数据云盘快照总数 | 监控云平台内数据云盘快照数量,数据云盘快照总数达到报警条件即可触发报警。 | ||
| 数据云盘快照百分比 | 监控云平台内所有数据云盘快照百分比(百分比=数据云盘快照总数/根云盘快照与数据云盘快照之和),任一数据云盘快照百分比达到报警条件即可触发报警。 | ||
| 云盘使用容量百分比 | 监控云平台内所有云盘使用容量百分比(百分比=使用容量/云盘总容量),任一云盘使用容量百分比达到报警条件即可触发报警。 Note: 厚置备类型云盘(例如:Shared
Block主存储上厚置备类型的云盘)的使用容量百分比为100%,设置此报警将立即触发。 |
||
| (100GB及以上)碎片程度(Extent总数) | 监控云平台内所有容量超过100GB云盘的碎片化程度,任一云盘碎片化程度的碎片程度(Extent总数)达到报警条件即可触发报警。 Note: 使用此报警条目需注意以下情况:
|
||
虚拟IP
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 虚拟IP | 下行网络流量 | 批量监控多个虚拟IP的下行网络流量,任一虚拟IP的下行网络流量达到报警条件即可触发报警。 | |
| 下行网络包数 | 批量监控多个虚拟IP的下行网络包数,任一虚拟IP的下行网络包数达到报警条件即可触发报警。 | ||
| 上行网络流量 | 批量监控多个虚拟IP的上行网络流量,任一虚拟IP的上行网络流量达到报警条件即可触发报警。 | ||
| 上行网络包数 | 批量监控多个虚拟IP的上行网络包数,任一虚拟IP的上行网络包数达到报警条件即可触发报警。 | ||
主存储
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 主存储 | 全部容量 | 监控云平台内所有主存储容量,所有主存储容量之和达到报警条件即可触发报警。 | |
| 全部可用容量 | 监控云平台内所有主存储可用容量,所有主存储可用容量之和达到报警条件即可触发报警。 | ||
| 全部可用容量百分比 | 监控云平台内所有主存储可用容量百分比(百分比=所有主存储可用容量之和/所有主存储容量之和),达到报警条件即可触发报警。 | ||
| 全部已用容量 | 监控云平台内所有主存储已用容量,所有主存储已用容量之和达到报警条件即可触发报警。 | ||
| 全部已用容量百分比 | 监控云平台内所有主存储已用容量百分比(百分比=所有主存储已用容量之和/所有主存储容量之和),达到报警条件即可触发报警。 | ||
| 全部已禁用容量 | 监控云平台内主存储保留容量配置,所有主存储保留容量之和达到报警条件即可触发报警。 | ||
| 全部已禁用容量百分比 | 监控云平台内所有主存储保留容量配置,主存储全部已禁用容量百分比(百分比=所有主存储保留容量之和/所有主存储容量之和)达到报警条件即可触发报警。 | ||
| 该主存储可用容量 | 批量监控多个主存储的可用容量,任一主存储的可用容量达到报警条件即可触发报警。 | ||
| 该主存储可用容量百分比 | 批量监控多个主存储的可用容量百分比(百分比=可用容量/主存储总容量),任一主存储的可用容量百分比达到报警条件即可触发报警。 | ||
| 该主存储已用容量 | 批量监控多个主存储的已用容量,任一主存储的已用容量达到报警条件即可触发报警。 | ||
| 该主存储已用容量百分比 | 批量监控多个主存储的已用容量百分比(百分比=已用容量/主存储总容量),任一主存储的已用容量百分比达到报警条件即可触发报警。 | ||
| 该主存储可用物理容量 | 批量监控多个主存储的可用物理容量,任一主存储的可用物理容量达到报警条件即可触发报警。 | ||
| 该主存储可用物理容量百分比 | 批量监控多个主存储的可用物理容量百分比(百分比=可用物理容量/主存储总物理容量),任一主存储的可用物理容量百分比达到报警条件即可触发报警。 | ||
| 该主存储已用物理容量 | 批量监控多个主存储的已用物理容量,任一主存储的已用物理容量达到报警条件即可触发报警。 | ||
| 该主存储已用物理容量百分比 | 批量监控多个主存储的已用物理容量百分比(百分比=已用物理容量/主存储总物理容量),任一主存储的已用物理容量百分比达到报警条件即可触发报警。 | ||
| 该主存储根云盘数量 | 批量监控多个主存储内的根云盘数量,任一主存储内的根云盘数量达到报警条件即可触发报警。 | ||
| 该主存储数据云盘数量 | 批量监控多个主存储内的数据云盘数量,任一主存储内的数据云盘数量达到报警条件即可触发报警。 | ||
| 该主存储快照数量 | 批量监控多个主存储内的快照数量,任一主存储内的快照数量达到报警条件即可触发报警。 | ||
| 该主存储预测物理容量使用率超过阈值时间 | 批量监控多个主存储的预测物理容量使用率,任一主存储的预测物理容量使用率超过阈值的时间达到报警条件即可触发报警。 | ||
| Ceph存储池可用物理容量百分比 | 批量监控多个Ceph存储池的可用物理容量百分比,任一Ceph存储池可用物理容量百分比达到报警条件即可触发报警。 | ||
| Ceph存储池已用物理容量百分比 | 批量监控多个Ceph存储池已用物理容量百分比,任一Ceph存储池已用物理容量百分比达到报警条件即可触发报警。 | ||
| Ceph存储池可用虚拟容量百分比 | 批量监控多个Ceph存储池可用虚拟容量百分比,任一Ceph存储池可用虚拟容量百分比达到报警条件即可触发报警。 | ||
| Ceph存储池预测物理容量使用率超过阈值时间 | 批量监控多个Ceph存储池的预测物理容量使用率,任一Ceph存储池的预测物理容量使用率超过阈值的时间达到报警条件即可触发报警。 | ||
监听器
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 监听器 | 会话已用数量 | 批量监控多个监听器的会话数量,任一监听器的会话已用数量达到报警条件即可触发报警。 | |
| 会话已用百分比 | 批量监控多个监听器的会话已用百分比(百分比=会话已用数量/会话总量),任一监听器的会话已用百分比达到报警条件即可触发报警。 | ||
| 检查不到健康的后端服务器 | 批量监控多个监听器的后端服务器组中的后端服务器状态,任一监听器的后端服务器组中存在不健康的后端服务器即可触发报警。 | ||
管理节点
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 管理节点 | 仲裁IP不可达 | 监控双管理节点仲裁IP是否可达,当仲裁IP不可达时即可触发报警。 | |
| 双管理节点数据库不同步 | 监控双管理节点数据库状态,当数据库异常或双管理节点数据库不同步时即可触发报警。 | ||
项目资源
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| 项目资源(需拥有租户管理模块许可证) | 计算资源 | 云主机数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
| 运行中云主机数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| CPU数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 内存配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| GPU设备数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 云主机调度策略数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 存储资源 | 云盘快照数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
|
| 数据云盘数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 可用存储容量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 镜像数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 所有镜像容量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 可用备份容量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 备份数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 网络资源 | VXLAN网络数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
|
| 三层网络数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 安全组数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 虚拟IP数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 弹性IP数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 端口转发数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 负载均衡器数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
||
| 监听器数量配额使用百分比 | 报警范围支持全部资源和资源多选两种,可按需选择:
|
CDP任务
| 资源类型 | 子类型 | 报警条目 | 描述 |
|---|---|---|---|
| CDP任务(需拥有持续数据保护CDP模块许可证) | CDP任务已用容量占规划容量百分比 | 监控云平台内所有CDP任务已用容量占规划容量的百分比,任一CDP任务的已用容量与规划容量的占比达到阈值即可触发报警。 | |
| RPO偏移时间 | 监控云平台内所有CDP任务的RPO偏移时间,任一CDP任务的RPO偏移时间达到阈值即可触发报警。 | ||
事件报警条目
默认报警条目
| 资源类型 | 报警条目 | 描述 |
|---|---|---|
| 集群 | 集群内物理机QEMU版本待更新 |
|
| 物理机 | 物理机已连接 |
Note: 物理机连接状态与kvmagent进程相关。管理节点会定期发送请求确认kvmagent进程状态。若kvmagent进程正常回复,则表示物理机连接正常。
|
| 物理机未连接 |
Note: 物理机连接状态与kvmagent进程相关。管理节点会定期发送请求确认kvmagent进程状态。若kvmagent进程无回复,则表示物理机已失联。
|
|
| 物理机网卡未连接 |
|
|
| 物理机网卡已连接 |
|
|
| 物理机挂载路径错误 |
|
|
| 物理机上发现未受系统管控的云主机 |
|
|
| 物理机FC-HBA光口状态异常 |
|
|
| 镜像服务器 | 镜像服务器已连接 |
|
| 镜像服务器未连接 |
|
|
| 主存储 | 主存储已连接 |
|
| 主存储未连接 |
|
|
| 主存储到物理机连接状态检查失败 |
|
|
| SharedBlock主存储共享块状态异常 |
|
|
| 管理节点 | 管理节点已连接 |
|
| 管理节点未连接 |
|
|
| 云主机 | 云主机故障 |
Note: 云主机需安装最新版本的GuestTools工具,且该工具需处于运行状态。
|
| 云主机所在物理机异常变更 |
|
|
| 云主机在物理机HA启动 |
|
|
| 云主机长时间处于in shutdown状态 |
|
|
| 云主机内IP被手动更改 |
|
|
| 云主机内IP已被云平台资源占用 |
|
|
| VPC路由器 | VPC路由器已连接 |
|
| VPC路由器未连接 |
|
|
| VPC路由器磁盘空间被异常文件占用 |
|
|
| 路由器的启用状态变为已暂停 |
|
|
| 路由器主备切换 |
|
|
| 负载均衡 | 负载均衡实例磁盘空间被异常文件占用 |
|
| 负载均衡实例未连接 |
|
|
| 负载均衡实例已连接 |
|
|
| 负载均衡实例主备切换 |
|
|
| 负载均衡实例配置同步失败 |
|
|
| 通知对象 | 短信发送失败 |
|
| HA | 物理机进入维护模式触发云主机迁移失败 |
|
| CDP任务(需拥有持续数据保护CDP模块许可证) | CDP任务状态异常切换 |
Note: 触发CDP任务状态异常切换的原因:
|
| SDN控制器 | SDN控制器未连接 |
|
| SDN控制器已连接 |
|
|
| SDN集群 | SDN集群健康 |
|
| SDN集群不可用 |
|
|
| SDN集群降级 |
|
自定义报警条目
| 资源类型 | 报警条目 | 描述 |
|---|---|---|
| 云主机 | 云主机在物理机HA启动 | 监控云平台内所有NeverStop云主机,任一NeverStop云主机在物理机HA启动即可触发报警。 |
| 云主机在物理机上的状态发生变化 | 监控云平台内所有云主机在物理机上的状态,任一云主机的状态发生变化即可触发报警。 Note: 云主机异常的状态变化才会触发报警,正常的开关机等操作不会触发报警。 |
|
| 云主机长时间处于in shutdown状态 | 监控云平台内所有云主机状态,任一云主机长时间(约10分钟)处于in shutdown状态即可触发报警。 | |
| 云主机故障 | 监控云平台内所有运行中的云主机状态,任一运行中的云主机出现故障即可触发报警。 Note: 云主机需安装最新版本的GuestTools工具,且该工具需处于运行状态。 |
|
| VPC路由器 | VPC路由器未连接 | 监控云平台内所有VPC路由器的就绪状态,任一路由器失联即可触发报警。 |
| VPC路由器已连接 | 监控云平台内所有VPC路由器的就绪状态,任一VPC路由器连接后即可触发报警。 | |
| 路由器主备切换 | 监控云平台高可用组内的VPC路由器状态,任意高可用组内的VPC路由器发生主备切换即可触发报警。 | |
| VPC路由器磁盘空间被异常文件占用 | 监控云平台所有VPC路由器内的磁盘占用情况,任一VPC路由器出现超过100 MB的单个文件即可触发报警。 | |
| 负载均衡 | 负载均衡实例未连接 | 监控云平台内所有负载均衡实例的就绪状态,任一负载均衡实例失联即可触发报警。 |
| 负载均衡实例已连接 | 监控云平台内所有负载均衡实例的就绪状态,任一负载均衡实例连接后即可触发报警。 | |
| 镜像服务器 | 镜像服务器未连接 | 监控云平台内所有镜像服务器的就绪状态,任一镜像服务器失联即可触发报警。 |
| 镜像服务器已连接 | 监控云平台内所有镜像服务器的就绪状态,任一镜像服务器连接后即可触发报警。 | |
| 管理节点 | 管理节点未连接 | 监控云平台内所有管理节点的就绪状态,任一管理节点失联即可触发报警。 |
| 管理节点已连接 | 监控云平台内所有管理节点的就绪状态,任一管理节点连接后即可触发报警。 | |
| 物理机 | 物理机上发现了未受系统管控的云主机 | 监控云平台内所有物理机上的云主机状态,任一实例云主机未被数据库记录即可触发报警。 |
| 物理机未连接 | 监控云平台内所有物理机的就绪状态,任一物理机失联即可触发报警。 Note: 物理机连接状态与kvmagent进程相关。管理节点会定期发送请求确认kvmagent进程状态。若kvmagent进程无回复,则表示物理机已失联。 |
|
| 物理机已连接 | 监控云平台内所有物理机的就绪状态,任一物理机连接后即可触发报警。 Note: 物理机连接状态与kvmagent进程相关。管理节点会定期发送请求确认kvmagent进程状态。若kvmagent进程正常回复,则表示物理机连接正常。 |
|
| 物理机网卡未连接 | 监控云平台内所有处于已连接状态的物理机的网卡就绪状态,任一物理机网卡未连接即可触发报警。 | |
| 物理机网卡已连接 | 监控云平台内所有处于已连接状态的物理机的网卡就绪状态,任一物理机网卡恢复正常连接即可触发报警。 | |
| 物理机挂载路径错误 | 监控云平台内指定主存储 (LocalStorage/NFS/SharedMountPoint/AliyunNAS) 的物理机挂载路径,当任一主存储的物理机挂载路径出现读写异常或无法连通时,即可触发报警。 | |
| 主存储 | 主存储到物理机连接状态检查失败 | 监控云平台内主存储与物理机的连接状态,当云平台未获取到主存储与物理机的连接状态时,即可触发报警。 |
| 主存储未连接 | 监控云平台内所有主存储的就绪状态,任一主存储失联即可触发报警。 | |
| 主存储已连接 | 监控云平台内所有主存储的就绪状态,任一主存储连接后即可触发报警。 | |
| vCenter | vCenter物理机时间异常 | 监控已接管vCenter环境内所有物理机时间与云平台系统时间是否一致,任一vCenter物理机时间异常即可触发报警。 |
| vCenter事件消息 | 展示已接管vCenter的事件消息,任一vCenter产生的事件消息均可通过报警的形式展示出来。 | |
| 备份任务 | 任务结果失败 | 监控云平台内所有备份任务的执行状态,任一备份任务失败后即可触发报警。 |
| 项目资源(需拥有租户管理模块许可证) | 项目已回收 | 监控云平台内所有项目状态,任一项目被回收即可触发报警。 |
| HA | 物理机进入维护模式触发云主机迁移失败 | 监控云平台内云主机的迁移情况,任一非本地存储的物理机进入维护模式触发云主机迁移失败即可触发报警。 |
| CDP任务(需拥有持续数据保护CDP模块许可证) | CDP任务失败 | 监控云平台内所有CDP任务的执行状态,任一CDP任务失败后即可触发报警。 |
| CDP任务状态异常切换 | 监控云平台内所有CDP任务的任务状态,任一CDP任务状态发生异常切换即可触发报警。 Note: 触发CDP任务状态异常切换的原因:
|








