可观测性

ZCF 可观测性用于汇聚已接入组件的资源、监控、日志、报警和健康数据,帮助用户从全局、组件和资源维度查看运行状态,并进行运维分析和报表输出。

使用可观测性能力前,请先通过 ZCF 云联邦完成基础设施组件接入,并按需启用资源、监控或日志采集。接入和采集完成后,用户可通过首页总览、平台健康、仪表盘或自定义仪表盘、视图、报表、资产、基础架构、监控查询、日志查询、采集配置、报警与通知等能力查看不同层级的数据,并将异常转化为可持续跟踪的处理流程。

如果页面中未显示预期数据,请优先检查对应组件是否已接入、采集配置是否启用,以及最近一次采集或同步是否正常。

核心概念

使用可观测性能力前,建议先了解以下与数据来源、分析视图、报警和采集配置相关的概念:

概念说明
数据来源已通过 ZCF 云联邦接入并启用采集的组件或环境。可观测性页面中的资源、监控和日志数据会受接入范围和采集配置影响。
仪表盘用于集中展示资源健康、容量、性能和资产状态的可视化页面。用户可使用预置仪表盘,也可创建自定义仪表盘组合常用视图。
视图可复用的图表或数据展示单元,可用于按特定维度查看资源和监控数据。
报表模板用于定义报告内容和生成方式的模板,可用于按需或周期性生成运维报告。
生成记录报表生成后的历史记录,用于查看生成结果,并下载已生成的报表文件。
监控指标描述资源运行状态的数值型数据,例如 CPU、内存、容量、网络或服务状态等。
日志来自接入组件的运行、操作或审计类文本记录,用于排查问题、定位异常和追踪操作过程。
资产同步到 ZCF 的资源对象,例如物理机、云主机、容器资源和存储资源等。
平台健康ZCF 对平台关键服务、健康域、组件明细和外部依赖的健康汇总,用于发现控制面、数据链路和容量风险。
健康域平台健康检查的分组视角,按核心服务、监控采集、报警评估、通知链路、容量风险和基础依赖等范围汇总检查项,便于判断异常影响面。
报警中心集中展示报警消息,并管理报警规则、通知渠道、通知策略和消息模板的入口。
采集配置用于控制资源、监控和日志数据采集范围的配置。采集配置正常后,相关数据才会进入查询、仪表盘和报表能力。

进入可观测性页面

在主菜单右上角切换至全局管理后,可通过以下页面使用 ZCF 可观测性能力。不同页面面向不同运维任务:总览用于快速巡检,仪表盘和报表用于细粒度分析,运维页面用于查看平台健康、查询指标和日志、管理采集配置并处理报警。

页面 用途
首页 查看已接入组件的资源规模、健康状态、容量使用和性能情况,适合日常巡检和环境整体状态确认。
仪表盘与报表 查看全局或组件级仪表盘,创建和维护自定义仪表盘、视图和报表模板,并生成周期性或按需报表。
运维
  • 查看平台健康,确认关键服务、健康域、组件明细和外部依赖状态。
  • 查询监控指标和日志,分析性能趋势、资源异常和关键日志。
  • 查看资产与基础架构,了解已接入组件的资源清单、资源结构和容量分布。
  • 管理资源、监控和日志采集配置,并在报警中心跟踪风险、配置规则和通知。
Note: 可观测性数据依赖组件接入和采集配置。如果页面无数据,请先确认相关组件已接入 ZCF 云联邦,并检查资源、监控或日志采集状态。

配置数据采集

资源、监控和日志数据是可观测分析的基础。用户在云联邦中接入组件时,可按需勾选资源、监控或日志采集项;接入完成后,可在对应采集页面确认采集状态、补充采集配置或调整采集范围。采集正常后,首页、资产、基础架构、监控查询、日志查询、仪表盘和报表等页面才能展示对应数据。

配置资源采集

配置资源采集前,请确认以下条件:

  • 目标组件已通过云联邦 > 平台管理中的接入平台列表或区域接入 ZCF,并完成连接验证。接入时已勾选资源采集项,或后续已在平台配置中启用资源采集。
  • 当前账号具备云联邦和资源采集相关操作权限。

资源采集用于维护接入组件的资源同步范围,并查看资源同步状态。资源采集正常后,资产、基础架构、仪表盘和报表页面才能展示对应资源数据。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 统一资产 > 资源采集
  3. 确认目标组件是否已启用资源采集。

    如果页面提示已有组件未启用资源采集,可进入云联邦 > 平台管理,在接入平台列表或区域中打开目标组件的接入或配置页面,并勾选资源采集项。

  4. 在平台列表中选择目标组件,并查看资源采集状态。
    操作 说明
    查看同步状态 查看目标组件的资源总数、同步状态、最近同步时间和同步频率。
    查看资源类型结果 按资源类型查看同步结果,判断指定类型的资源数据是否已正常采集。
  5. 按需调整资源采集配置。
    操作 说明
    选择采集资源 选择需要同步到 ZCF 的资源类型。仅采集所选资源后,相关页面才会展示对应数据。
    设置同步频率 设置资源数据的自动同步周期。同步频率越高,数据更新越及时,但也会增加采集压力。
    手动同步资源 在需要立即刷新资源数据时,手动触发一次资源同步。
    停止资源采集 停止目标组件的资源同步。停止后,相关页面不再更新该组件的资源数据。
Note: 调整资源采集配置后,可进入资产、基础架构、仪表盘或报表页面确认资源数据是否符合预期。

配置监控采集

配置监控采集前,请确认以下条件:

  • 目标组件已通过云联邦 > 平台管理中的接入平台列表或区域接入 ZCF,并完成连接验证。接入时已勾选监控采集项,或后续已在监控采集管理页面新增采集。
  • 目标组件支持监控采集,且当前账号具备云联邦和监控采集相关操作权限。

监控采集管理用于查看和维护接入组件的指标采集状态。监控采集正常后,监控摘要、监控查询、仪表盘和报表页面才能展示对应指标数据。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 监控中心 > 监控采集管理
  3. 如目标组件尚未启用监控采集,添加采集配置。

    如果接入组件时未勾选监控采集项,可在本页面通过新增采集补充开启。

    操作 说明
    选择平台 选择需要采集监控指标的接入组件。若无可选组件,请先进入云联邦 > 平台管理,并按接入平台列表或区域中的页面入口操作。
    新增采集 为所选组件启用监控采集,使其指标数据可用于监控查询、仪表盘和报表。
  4. 查看监控采集状态。
    操作 说明
    采集状态 确认目标组件的指标采集是否正常。
    更新时间 确认最近一次采集信息更新时间,用于判断指标数据是否持续更新。
    删除采集 停止采集目标组件的监控指标。停止后,相关页面不再更新该组件的指标数据。
Note: 如果仪表盘或监控查询缺少指标数据,请先确认监控采集状态是否正常,再检查目标组件连接状态。

配置日志采集

配置日志采集前,请确认以下条件:

  • 目标组件已通过云联邦 > 平台管理中的接入平台列表或区域接入 ZCF,并完成连接验证。接入时已勾选日志采集项,或后续已在日志采集管理页面新增采集。
  • 目标组件支持日志采集,且当前账号具备云联邦和日志采集相关操作权限。
  • 如目标组件侧需要先开启审计或日志输出,请先按对应组件要求完成配置。

日志采集管理用于查看和维护接入组件的日志采集状态及采集目标。日志采集正常后,日志摘要、日志查询和实时流诊断页面才能展示对应日志数据。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 日志中心 > 日志采集管理
  3. 如目标组件尚未启用日志采集,添加采集配置。

    如果接入组件时未勾选日志采集项,可在本页面通过新增采集补充开启。

    操作 说明
    选择平台 选择需要采集日志的接入组件。若无可选组件,请先进入云联邦 > 平台管理,并按接入平台列表或区域中的页面入口操作。
    采集目标 选择需要采集的日志类型。无特殊要求时,可保留页面默认选择。
  4. 查看或调整日志采集状态。
    操作 说明
    采集状态 确认目标组件的日志采集是否正常。
    修改采集目标 调整已有采集配置中的日志类型,满足新的排障或审计分析需要。
    删除采集 停止采集目标组件的日志数据。停止后,相关页面不再更新该组件的日志数据。
Note: 如果日志摘要、日志查询或实时流诊断缺少数据,请先确认日志采集状态和采集目标是否正确,再检查目标组件连接状态。

掌握运行总览

用户可通过首页、仪表盘、资产和基础架构页面查看 ZCF 管理范围内的资源规模、健康状态、容量使用、性能趋势和资源分布。该链路适合日常巡检、环境总览和资源状态确认。

查看全局总览

首页用于查看 ZCF 全局运行概况,适合日常巡检、部署后确认、容量评估和异常初筛。用户可在一个页面中了解已接入组件的资源规模、健康状态、容量使用和性能情况。

区域 说明
全局核心态势汇总展示资源总览、健康总览和容量使用率,帮助用户快速了解当前环境整体状态。
云平台 · 虚拟化与基础资源展示 ZStack Cloud、ZSphere 虚拟化平台等相关资源规模和分布情况,例如云主机、物理机、网络和容量类资源。
网络服务接入 ZNS 后,展示网络服务资源状态,帮助用户从首页了解网络资源概况。
容器 · 编排展示 Kubernetes 集群、节点、工作负载和容器组等容器资源状态,用于了解容器环境运行情况。
存储 · 分布式展示存储服务器、硬盘等存储资源的状态和健康情况,用于了解存储资源可用性。
性能洞察 · 资源消耗排行展示资源性能相关排行,帮助用户快速定位需要关注的资源对象。
  1. 登录 ZCF。
  2. 在主菜单右上角切换至全局管理
  3. 在主菜单中单击首页
  4. 查看全局核心态势、资源规模、健康状态、容量使用和性能排行等信息。
Note: 首页展示结果依赖组件接入和采集状态。如果某类资源区域为空,请先确认对应组件已接入 ZCF 云联邦,并检查资源、监控或日志采集状态。如发现资源、健康或容量异常,可进入资产、基础架构、平台健康、仪表盘或报警中心继续确认。

查看平台健康

平台健康用于查看 ZCF 平台关键服务、健康域、组件明细和外部依赖等运行状态,适合日常巡检、升级前检查和故障定位。健康域用于按监控采集、报警评估、通知链路、容量风险等检查范围汇总健康结果。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 监控中心 > 平台健康
  3. 查看平台健康状态。
    查看项说明
    平台总体状态查看 ZCF 当前整体健康结果、最近更新时间和异常数量。
    健康域概览按检查域查看核心服务、监控采集、报警评估、通知链路、容量风险和基础依赖等状态。
    组件明细与外部依赖查看组件实例、服务明细和外部依赖状态,判断异常影响范围。
    异常与待处理项查看异常、降级或待确认的健康项,定位需要优先处理的问题。
  4. 打开异常健康项,查看检查结果、影响对象和建议处理方式。
  5. 根据异常类型,进入监控查询、日志查询、报警中心或资源详情继续排查。
Note: 平台健康关注 ZCF 平台自身及关键服务链路,不替代业务资源的监控查询和日志查询。

查看仪表盘

仪表盘用于从全局或组件维度查看资源健康、容量、性能和资产状态,适合在日常巡检、容量评估和问题分析时使用。用户可查看预置仪表盘,也可打开已有自定义仪表盘,按常用观察视角开展分析。接入 ZSphere 并启用采集后,用户可通过虚拟化仪表盘查看虚拟化资源的可用性、容量、性能和资产清单等数据。

仪表盘适用场景
运维总览查看已接入组件的整体运行态势,适合日常巡检和跨组件状态确认。
云平台仪表盘查看云平台资源的概览、可用性、容量、性能和资产清单,适合分析计算、网络和虚拟化资源状态。
虚拟化仪表盘查看虚拟化平台资源的可用性、容量、性能和资产清单,适合分析 ZSphere 等虚拟化资源状态。
容器仪表盘查看容器资源的概览、可用性、容量、性能、控制面和资产清单,适合分析 Kubernetes 相关资源状态。
存储仪表盘查看存储资源的概览、可用性、容量、性能和资产清单,适合分析存储容量、健康和性能状态。
自定义仪表盘查看用户自定义组合的视图,适合按业务、资源类型或团队职责沉淀常用观察视角。
  1. 在主菜单右上角切换至全局管理
  2. 进入仪表盘与报表 > 仪表盘
  3. 按需选择运维总览,或在专项仪表盘中选择云平台仪表盘、虚拟化仪表盘、容器仪表盘、存储仪表盘,也可打开自定义仪表盘。
  4. 查看对应仪表盘中的概览、可用性、容量、性能和资产清单等信息。
  5. 如发现容量、性能或可用性异常,可进入监控查询、日志查询、资产详情或报警中心继续确认。
Note: 仪表盘数据依赖资源、监控和日志采集状态。如果虚拟化仪表盘无数据,或页面提示“当前产品未部署或未启用采集。”,请确认 ZSphere 已接入 ZCF 云联邦,并已启用相关资源或指标采集。如需沉淀固定分析视角,可创建自定义仪表盘或视图。

查看资产

资产用于跨组件查看和搜索资源,适合资源盘点、异常对象定位和从首页、仪表盘或报警消息下钻分析。用户可按资源类型定位具体对象,再查看资源详情和关联指标。

查看项说明
资源类型按物理机、云主机、容器组等类型查看资源列表。
资源检索按字段和值搜索资源,用于快速定位目标对象。
列表与关系按页面支持的分组方式查看资源列表,并在资源详情中查看关联指标或资源关系。
资源详情查看资源明细、运行状态和关联监控信息。
  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 统一资产 > 资产
  3. 选择需要查看的资源类型。
  4. 按字段和值搜索资源,或按页面支持的分组方式查看资源列表。
  5. 打开资源详情,查看资源明细、关联监控信息或页面提供的资源关系。
Note: 如果目标资源未显示,请确认对应组件已接入并完成资源采集。如资源状态或指标异常,可进入监控查询、日志查询或报警中心继续排查。

查看基础架构

基础架构用于从全局、云联邦、云平台、虚拟化平台、存储、容器和 ZNS 网络中心等视角查看基础资源结构和容量分布,适合资源盘点、容量评估和部署后确认。用户可通过该页面了解已接入组件的资源组成、容量使用和资源分布情况。

查看项说明
资源组成查看总资产数以及云平台、虚拟化平台、存储、容器和网络服务等资源数量。
容量分布查看不同接入组件的 CPU、内存、存储等容量使用情况。
网络服务资源查看 ZNS 网络中心相关资源的规模和分布情况,用于辅助确认网络服务接入和资源采集结果。
  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 统一资产 > 基础架构
  3. 概览云联邦云平台虚拟化平台存储容器 (K8s)ZNS 网络中心等页签间切换。
  4. 查看资源数量、容量分布、资源状态或网络服务资源概要。
Note: 如果资源数量或容量分布与预期不一致,请先确认对应组件已接入,并检查资源采集状态。如需定位具体对象,可进入资产或监控查询继续查看。

构建分析视角与报表

用户可通过自定义仪表盘、内置视图或自定义视图沉淀常用分析维度,并将视图组织为报表模板,按需或周期生成运维报表。该链路适合周期巡检、容量分析、性能回顾和资产清单输出。

查看和维护视图

视图用于保存可复用的图表视图,沉淀常用资源或监控分析维度。用户可按云平台、虚拟化、容器、存储等分类查看内置视图,也可维护已有自定义视图,用于后续巡检、报表输出或问题分析。

  1. 在主菜单右上角切换至全局管理
  2. 进入仪表盘与报表 > 视图
  3. 概览页签查看内置视图,或在管理页签维护自定义视图。
    操作说明
    查看内置视图概览页签查看可用性、资产、性能、容量等常用分析视图。
    切换平台类型按云平台、虚拟化、容器、存储等平台类型切换视图展示范围。
    搜索或筛选视图按视图名称或适用平台类型查找视图。
    克隆或维护视图克隆内置视图,或编辑、克隆、删除自定义视图。
Note: 内置视图通常用于查看和克隆;自定义视图可编辑、克隆或删除。虚拟化视图可用于构建自定义仪表盘或报表模板;创建后的视图也可添加到自定义仪表盘,或在报表模板中作为报表内容使用。

创建自定义视图

当内置视图不能满足特定资源或指标分析需求时,可创建自定义视图。自定义视图创建后,可在视图列表中复用,也可作为报表模板的内容来源。

  1. 在主菜单右上角切换至全局管理
  2. 进入仪表盘与报表 > 视图
  3. 管理页签中,单击新建视图
  4. 按页面提示配置自定义视图参数。
    配置项说明
    名称自定义视图在视图列表和报表模板中的显示名称。建议使用能够体现分析对象或用途的名称。
    描述视图用途说明,便于后续识别该视图适用的巡检、分析或报表场景。
    视图类型选择视图的展示和分析类型。不同视图类型对应的配置项可能不同,请以页面展示为准。
    业务分类选择视图所属分类,便于在视图列表、报表模板和后续维护中筛选。
    适用平台类型选择视图适用的平台范围,例如云平台、容器或存储等类型。视图可用数据取决于已接入组件和采集状态。
    资源类型选择需要分析的资源对象类型。不同资源类型支持的字段、指标和过滤条件可能不同。
    视图配置按页面提示配置展示字段、指标、过滤条件或图表展示方式,用于定义视图的具体展示内容。
  5. 预览确认中确认展示效果,并保存视图。
Note: 自定义视图适合沉淀固定分析维度。创建前请确认对应资源或指标数据已完成采集,否则预览和后续报表中可能没有数据。

从监控查询保存视图

对需要反复查看的监控查询,可将查询条件和展示方式保存为视图。保存后的视图可在视图列表中复用,也可加入报表模板。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 监控中心 > 监控查询
  3. 按页面提示设置监控查询条件。
    配置项说明
    平台选择需要查询监控数据的平台或组件范围。可选范围取决于已接入组件和监控采集状态。
    资源范围选择需要分析的资源对象或资源分组,用于限定监控查询的数据范围。
    指标选择需要查看的一个或多个监控指标。不同平台和资源类型支持的指标可能不同。
    统计方式选择指标数据的聚合或统计方式,用于控制趋势图中的数据计算口径。
    图表样式选择查询结果的展示方式,便于按趋势、对比或分布等方式查看指标数据。
    时间范围选择监控数据查询的时间范围。保存为视图后,后续可基于该查询条件复用分析。
  4. 执行查询,并确认查询结果符合预期。
  5. 按页面提示将当前查询保存为视图。
  6. 进入仪表盘与报表 > 视图,确认已生成对应视图。

创建自定义仪表盘

自定义仪表盘用于把常用视图组合到同一页面,形成面向业务、资源类型或团队职责的观察视角。用户可从视图库添加视图,调整布局后保存为可重复使用的仪表盘。

  1. 在主菜单右上角切换至全局管理
  2. 进入仪表盘与报表 > 仪表盘,切换至管理页签。
  3. 单击新建仪表盘,填写仪表盘名称和描述。
  4. 添加视图面板选择需要展示的视图,并添加到画布。
    选择要点说明
    视图类型按巡检、资源分析、容量分析或告警跟踪等目标选择视图。
    资源范围按需选择全局、组件、可用区或资源类型范围,避免同一仪表盘中混入无关数据。
    时间范围为趋势类视图选择合适的时间范围,便于观察近期变化或历史趋势。
  5. 按需拖拽调整视图位置和大小。

    建议将关键状态、异常统计或容量风险放在页面上方;趋势、排行和明细类视图可按排查顺序排列。

  6. 保存仪表盘,并返回仪表盘列表确认自定义仪表盘已生成。
  7. 按需维护自定义仪表盘。
    操作说明
    编辑仪表盘调整仪表盘名称、描述、视图内容或布局。
    克隆仪表盘基于已有仪表盘创建副本,适合复用已有观察视角后再局部调整。
    导入或导出仪表盘通过 JSON 文件迁移或复用仪表盘配置。
    删除仪表盘删除不再使用的自定义仪表盘。
Note: 自定义仪表盘中的数据依赖所选视图的数据来源和采集状态。如果视图无数据,请先检查对应组件接入和采集配置。

创建报表模板

报表模板用于组合多个视图,形成可按需或周期生成的运维报告。用户可基于已有视图创建报表模板,用于容量分析、性能回顾、资产清单或可用性检查等场景。

  1. 在主菜单右上角切换至全局管理
  2. 进入仪表盘与报表 > 报表
  3. 报表模板页签中,单击新建报表模板
  4. 按页面提示配置报表模板参数。
    配置项说明
    模板名称报表模板在模板列表和生成记录中的显示名称。建议使用能够体现报表用途的名称。
    描述报表模板用途说明,便于区分容量分析、性能回顾、资产清单或可用性检查等不同模板。
    可用视图选择需要加入报表的视图。可用视图包括内置视图和已创建的自定义视图。
    视图分类按分类筛选可用视图,便于从容量、性能、资产、可用性等分析维度中选择报表内容。
    报表内容确认已添加的视图及展示顺序,决定报表生成后的主要内容结构。
  5. 在报表内容区域确认视图顺序和内容后,按页面提示保存模板。
Note: 如果可用视图不能满足报表内容需求,请先创建自定义视图,再将该视图添加到报表模板中。

查看和维护报表模板

报表模板用于定义报告内容和生成方式。用户可查看内置的容量、性能、资产清单和可用性模板,也可基于已有模板克隆出新的报表模板。

  1. 在主菜单右上角切换至全局管理
  2. 进入仪表盘与报表 > 报表
  3. 报表模板页签中查看、搜索或克隆报表模板。
    操作说明
    查看模板查看容量、性能、资产清单、可用性等报表模板,确认模板适用范围和报告内容。
    克隆模板基于已有模板复制生成新的报表模板,适合在内置模板基础上调整报告内容。
    搜索模板按报表模板名称搜索已有模板。

生成和下载报表

报表可基于报表模板按需立即生成,也可按计划周期生成。用户可在生成记录页签查看生成历史,并下载已生成的报表文件。

  1. 在主菜单右上角切换至全局管理
  2. 进入仪表盘与报表 > 报表
  3. 报表模板页签中选择需要使用的模板。
  4. 按需立即生成报表,或为模板配置定时生成规则。
    操作说明
    立即生成基于报表模板立即生成报告,适合临时输出巡检或分析结果。
    配置定时生成为报表模板配置周期性生成规则,适合固定周期输出容量、性能、资产清单或可用性报告。
    查看生成记录查看报表生成历史、执行状态和生成结果。
    下载报表下载已生成的报表文件。可用格式以页面展示为准。
  5. 生成记录页签查看生成结果,并下载报表文件。

排查监控与日志问题

用户可先通过监控摘要和日志摘要了解数据规模、来源分布和趋势,再进入监控查询或日志查询页面按指标、字段、级别和时间范围定位问题。该链路适合性能波动分析、异常日志排查和实时日志诊断。

查看监控摘要

查看监控摘要前,请确认目标组件已接入 ZCF,并已启用监控采集。

监控摘要用于查看监控数据是否正常进入 ZCF。用户可先通过该页面确认指标接入规模和来源分布,再决定是否进入监控查询进一步分析。

查看项说明
采集概况查看接入数量、在线状态、指标数量和监控数据总量,确认监控链路是否有数据流入。
来源分布查看不同组件的指标数量和数据占比,判断数据规模是否符合预期。
接入组件查看已接入监控的组件列表及数据规模,用于定位缺少监控数据的组件。
  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 监控中心 > 监控摘要
  3. 查看采集概况,确认监控数据是否持续进入 ZCF。
  4. 查看来源分布和接入组件列表,判断各组件的数据规模是否符合预期。
Note: 如果某个组件没有监控数据,请先检查该组件的接入状态、监控采集配置和采集状态;如果只有部分指标异常,可进入监控查询继续定位。

查询监控指标

查询前,请确认目标组件已接入 ZCF,并已启用监控采集。可查询的平台、资源和指标范围取决于组件接入状态、监控采集状态和当前用户权限。

监控查询用于按平台、资源和指标条件查询监控趋势,适合在发现性能波动、容量压力或资源异常后进一步定位影响对象。常用查询可保存为视图,便于后续复用分析。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 监控中心 > 监控查询
  3. 按页面提示设置监控查询条件。
    配置项 说明
    查询范围 选择需要分析的平台、组件或资源范围,用于限定指标数据来源。
    资源对象 选择具体资源或资源分组,用于查看单个对象状态,或对比多个对象的指标变化。
    指标 选择需要查看的指标。页面会根据查询范围提供可用指标,并展示指标单位或状态含义。
    时间范围 选择查询时间段,查看指标在指定时间范围内的变化趋势。
    展示方式 按需选择统计方式和图表样式,辅助对比趋势、峰值和异常点。
  4. 执行查询,查看指标趋势和异常点。
  5. 如需继续定位,可调整查询范围、时间范围或指标,并重新查询。
Note: 如果无法查询到目标指标,请先检查目标组件是否已接入,并确认监控采集配置、采集状态和当前用户权限是否正常。如果需要复用当前查询条件,可将监控查询保存为视图。

查看日志摘要

查看日志摘要前,请确认目标组件已接入 ZCF,并已启用日志采集。

日志摘要用于查看日志采集和写入的总体情况。用户可通过日志容量、事件数量、来源排行、日志趋势和级别分布,快速判断日志是否持续进入 ZCF,以及哪些来源更需要关注。

查看项说明
时间范围切换统计时间范围,观察日志容量、事件数量和来源排行是否随时间变化。
日志概况查看日志容量、日志事件数、摄入速率和活跃源数量,确认日志采集是否正常。
来源排行查看日志量较高的组件或数据源,定位日志突增或采集规模异常的来源。
级别分布查看 ERROR、WARN、INFO 等日志级别占比,识别错误或告警日志较集中的范围。
  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 日志中心 > 日志摘要
  3. 选择时间范围,查看日志概况和日志量趋势。
  4. 查看来源排行和级别分布,判断是否存在日志量突增、采集中断或错误日志集中的情况。
Note: 如果发现日志来源或级别异常,可进入日志查询按时间范围、来源和级别继续检索日志明细。

查询日志

查询日志前,请确认目标组件已接入 ZCF,并已启用日志采集。可查询的来源和字段范围取决于日志采集状态、日志解析结果和当前用户权限。

日志查询用于检索和分析历史日志。用户可按时间、来源、级别、关键字或结构化字段缩小范围,定位异常时间段、日志来源和关键日志内容。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 日志中心 > 日志查询
  3. 按页面提示设置日志查询条件。
    配置项 说明
    查询范围 选择需要检索的组件、日志来源和时间范围,限定日志数据范围。
    日志级别 按 ERROR、WARN、INFO 等级别过滤日志,用于优先查看异常或告警信息。
    关键字 输入错误码、资源名称、服务名或其他关键字,在日志正文中检索相关记录。
    字段过滤 根据日志解析出的平台、主机、服务、实例等字段缩小结果范围。
    日志明细 查看单条日志的时间、级别、来源、正文和扩展字段,用于确认异常上下文。
  4. 执行查询,查看日志分布和日志明细。
  5. 根据查询结果继续调整时间范围、来源或过滤条件,逐步缩小排查范围。
Note: 如果日志查询结果为空,请先检查目标组件是否已接入,并确认日志采集配置、采集状态、查询时间范围和当前用户权限是否正常。

使用实时流诊断日志

使用实时流前,请确认目标组件已接入 ZCF,日志采集处于正常状态,且当前时间有日志持续产生。

实时流用于查看持续写入的最新日志,适合在复现问题、执行运维操作或验证采集状态时观察即时输出。与日志查询相比,实时流更适合看“正在发生”的日志变化。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 日志中心 > 日志查询
  3. 切换至实时流页签。
  4. 选择需要观察的组件、日志来源或日志级别。
    配置项 说明
    组件或来源 选择需要观察的日志来源,避免实时输出过多无关日志。
    日志级别 按需只查看 ERROR、WARN 等关键级别,便于在复现过程中捕捉异常。
    关键字 输入资源名称、任务 ID、错误码或服务名,聚焦本次操作相关日志。
  5. 查看实时输出的日志内容,结合时间、级别和关键字段定位异常。
  6. 如需回看历史上下文,返回日志查询并按相同条件查询对应时间段日志。
Note: 如果实时流没有输出日志,请先确认目标组件已接入,并检查日志采集配置、采集状态和当前用户权限是否正常。

管理报警与通知

报警与通知用于将可观测性中的指标异常、事件风险和资源问题转化为可跟踪、可通知、可处理的报警流程。用户可先确认数据来源和采集状态,再通过报警规则定义风险识别条件,通过消息模板、通知渠道和通知策略将重要报警发送给对应团队,并在报警消息中查看和处理风险。

配置流程

  1. 确认目标组件已接入,并已启用资源、监控、日志或事件报警接入等数据来源。
  2. 创建报警规则,定义指标类风险的触发规则、报警级别和报警范围。
  3. 创建消息模板,定义外部通知的内容格式。
  4. 创建通知渠道,配置钉钉、企业微信、邮件、Webhook 或短信等发送目标。
  5. 创建通知策略,匹配需要外部通知的报警并绑定通知渠道。
  6. 查看和处理报警消息,确认报警状态、通知投递结果和后续处置。
Note: 接入组件事件报警属于组件接入或初始化阶段的能力,用于让组件侧事件进入 ZCF 报警中心;事件接入完成后,事件报警可与资源报警共用通知渠道和通知策略。

核心概念

概念说明
报警消息由报警规则或事件接入产生的风险记录,用于查看问题状态、影响对象、发生时间和处理进度。
报警规则定义报警触发规则、报警级别和报警范围,系统根据规则判断是否产生报警消息。
通知渠道外部通知的发送目标,例如钉钉、企业微信、邮件、Webhook 或短信。
通知策略按级别、来源、资源类型等条件匹配报警,并决定是否发送到外部通知渠道。
消息模板定义外部通知的内容和格式,由通知渠道引用。
事件报警集成接入已连接组件上报的事件类报警,使组件侧事件进入 ZCF 统一查看和通知。

启用事件报警集成

启用事件报警集成前,请确认目标组件已通过云联邦接入 ZCF、连接正常,且当前管理员具备云联邦和报警中心相关权限。

通过云联邦接入平台或组件后,可在事件报警集成页面开启事件报警集成。开启后,组件上报的事件报警会进入 ZCF 报警中心。用户可在报警消息中查看这些报警,并通过通知策略将重要报警发送到外部渠道。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 报警中心 > 事件报警集成
  3. 找到目标组件,点击启用,按页面提示开启事件报警集成。
  4. 查看组件的事件报警集成状态。
    查看项 说明
    事件报警托管 显示该组件是否已开启事件报警集成,并由 ZCF 统一接入和管理事件报警。
    配置同步 显示事件报警集成配置是否已下发到组件。若状态异常,可重新同步配置。
    最近下发 显示最近一次配置下发时间。
    最近事件报警 显示最近收到事件报警的时间。
    解析失败与未知事件 显示事件解析或识别异常情况。
    诊断详情 查看连接、同步、回调和日志检查结果。
  5. 如配置状态异常,执行同步操作。

    同步会将 ZCF 的事件报警集成配置下发到对应组件。同步失败时,请根据诊断详情检查组件连接、访问凭据和回调地址。

  6. 进入运维 > 报警中心 > 报警消息,查看事件报警或事件记录。

    如果事件报警集成状态正常但报警消息中没有数据,请先确认组件侧是否产生事件,再检查最近事件报警时间、解析失败和未知事件等状态。

  7. 如需外部通知,在运维 > 报警中心 > 通知设置中配置通知策略。

    事件报警进入报警中心后,可与资源报警共用通知渠道和通知策略。

Note: 事件报警集成用于接入组件上报的事件类报警。基于指标阈值触发的资源报警,请在报警规则中管理。

创建报警规则

创建报警规则前,请确认目标组件已接入 ZCF,且相关资源和指标数据已正常采集。

报警规则用于定义指标类风险的触发规则。用户可按平台类型、资源类型和报警条目设置触发规则、报警级别和报警范围,让系统在容量接近上限、性能异常或关键资源状态异常时生成报警消息。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 报警中心 > 报警规则
  3. 点击创建规则
  4. 填写报警规则参数。
    配置项 说明
    名称与简介 用于标识规则用途。建议体现资源类型、指标和风险场景,例如容量不足、连接异常或性能波动。
    平台类型 选择规则适用的平台类型。平台类型会影响后续可选资源类型和报警条目。
    资源类型 选择需要监控的资源类型。不同资源类型可选报警条目不同。
    报警条目 选择具体监控条目或指标项,用于确定规则关注的风险对象。
    报警触发规则 设置比较方式、阈值和持续条件等触发规则,用于判断何时生成报警。
    报警级别 按影响程度选择报警级别。级别会影响报警筛选和通知策略匹配。
    报警范围 选择规则生效的资源范围。仅需关注部分资源时,可缩小报警范围,减少无关报警。
  5. 保存报警规则。
  6. 返回报警规则列表,确认规则已创建并处于预期状态。
Note: 报警规则只定义风险如何被识别。规则触发后,可在运维 > 报警中心 > 报警消息查看报警;如需发送外部通知,请继续配置通知渠道和通知策略。

创建消息模板

如需创建自定义消息模板,请先确认通知渠道的接收端格式要求,例如群机器人使用 Markdown,邮件使用 HTML 或纯文本,Webhook 使用 JSON。

消息模板用于定义外部报警通知的内容格式。系统模板可满足常见通知场景;仅当不同通知渠道、团队或业务需要不同通知内容、格式或字段时,才需要创建自定义模板。

  1. 进入运维 > 报警中心 > 消息模板

    如果当前不在全局管理视图,请先在主菜单右上角切换至全局管理

  2. 查看系统模板或已有自定义模板。

    系统模板不建议直接修改;如需调整内容,可先克隆系统模板,再基于副本修改。

  3. 确认是否需要创建自定义模板。

    常见场景可直接使用系统模板。仅当不同通知渠道、团队或业务需要不同通知内容、格式或字段时,才创建自定义模板。

  4. 创建自定义模板。

    按以下说明填写模板参数:

    配置项 说明
    模板名称 用于区分模板用途。建议体现通知渠道或使用场景,例如值班群通知、严重报警邮件或 Webhook 回调。
    简介 说明模板适用范围,便于多人协作维护。
    内容格式 按接收端要求选择 Markdown、HTML、JSON 或纯文本。群机器人通常使用 Markdown,Webhook 通常使用 JSON。
    加载预置模板 按所选内容格式加载系统提供的预置模板,作为模板内容的编辑起点。首次创建模板,或希望沿用系统变量结构时,可先加载预置模板,再在源码编辑器中调整内容。
    模板内容 填写通知正文。可插入报警名称、级别、资源、状态、触发时间、摘要和处理建议等变量。
    变量手册 查看当前可用变量及含义,避免引用不存在的字段导致通知内容为空。
    实时预览 保存前预览模板渲染效果,确认关键信息完整、格式符合接收端要求。
  5. 保存消息模板。
  6. 进入运维 > 报警中心 > 通知设置,在通知渠道中选择消息模板。

    消息模板由通知渠道引用。通知策略决定哪些报警发送到渠道,模板决定这些报警在渠道中的展示内容。

  7. 测试通知渠道,确认模板内容可正常发送和展示。
Note: 如需删除已被通知渠道引用的模板,请先调整对应渠道使用的模板。模板变更后,建议重新测试引用该模板的通知渠道。

创建通知渠道

ZCF 当前支持钉钉、企业微信、邮件、Webhook 和短信通知渠道。创建通知渠道前,请根据计划使用的渠道完成以下准备:

  • 确认 ZCF 可访问目标通知系统或接收端地址。
  • 如果使用钉钉或企业微信,请在目标群中创建机器人,获取 Webhook 地址,并按机器人安全要求准备关键词、加签密钥或 IP 白名单等信息。
  • 如果使用邮件,请先完成邮件服务器配置并测试通过,准备收件人、抄送人或密送人邮箱地址。
  • 如果使用 Webhook,请准备接收端 URL、请求方法和鉴权请求头。
  • 如果使用短信,请先按短信服务商准备认证信息、短信签名、模板或接口地址,并确认短信额度满足通知要求。
  • 如需使用自定义通知内容,请先创建消息模板;也可使用系统预置模板。

通知渠道用于配置报警的外部发送目标。默认情况下,报警会进入运维 > 报警中心 > 报警消息;如需发送到钉钉、企业微信、邮件、Webhook 或短信,请先创建通知渠道,再通过通知策略引用该渠道。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 报警中心 > 通知设置
  3. 通知渠道页签中创建通知渠道。
  4. 选择渠道类型,并填写渠道基础信息和连接参数。
    渠道类型 配置项 填写说明
    全部渠道 渠道名称、描述、消息模板
    • 渠道名称用于区分通知对象或团队。
    • 消息模板决定通知内容格式,可使用系统预置模板。
    • 如需自定义通知内容,可先在消息模板中创建模板。
    钉钉 Webhook 地址、安全设置、@提醒对象
    • 填写钉钉群机器人的 Webhook 地址。
    • 如果机器人启用了安全设置,请同步填写关键词、加签密钥或 IP 白名单等信息。
    • 如需提醒指定人员,可填写手机号。
    企业微信 Webhook 地址、安全设置、@提醒对象
    • 填写企业微信群机器人的 Webhook 地址。
    • 如需安全校验,请填写对应密钥。
    • 如需定向提醒,请填写成员账号或 @all。
    邮件 收件人、抄送人、密送人
    • 收件人为必填项,支持填写多个邮箱地址。
    • 如需同步其他人员,可填写抄送人或密送人。
    • 邮件渠道依赖邮件服务器配置。未完成配置或测试未通过时,邮件不能正常发送。
    Webhook URL、请求方法、请求头、TLS 校验
    • 填写接收端 URL,并选择请求方法。
    • 需要鉴权时,在请求头中填写 Token 或其他认证信息。
    • 仅在受信任的测试环境或自签名证书场景下跳过 TLS 校验。
    短信 服务商、认证信息、短信签名、模板或接口地址、接收手机号
    • 按页面支持的短信服务商填写对应参数。
    • 阿里云短信需填写 AccessKey、签名、模板代码和接收手机号。
    • 亿美软通需填写接口地址、App ID、Secret Key、签名和接收手机号。
    • 通用 HTTP 需按短信网关要求填写接口地址、认证方式、请求体和成功匹配规则。
    • 短信按条计费,建议仅用于严重或紧急报警。
  5. 保存通知渠道后,执行测试发送。

    测试成功表示 ZCF 与目标渠道连通。测试通知会发送到对应接收端:钉钉群、企业微信群、邮件收件箱、Webhook 接收服务或短信接收手机。测试失败时,请检查地址、鉴权信息、机器人安全设置、邮件服务器或短信服务商配置。短信渠道测试会消耗短信额度。

  6. 创建或更新通知策略,将匹配的报警发送到该通知渠道。
Note: 通知渠道只定义报警发送目标。要让指定报警发送到该渠道,请继续创建通知策略。

创建通知策略

创建通知策略前,请确认以下条件:

  • 已创建并测试通过至少一个通知渠道。
  • 已明确需要发送外部通知的报警范围,例如报警级别、资源类型、来源组件、报警名称或事件域。

通知策略用于定义哪些报警需要发送到外部渠道,以及通知如何收敛。用户可按报警属性筛选消息,绑定一个或多个通知渠道,并设置恢复通知、分组和重复提醒策略,减少无关或重复通知。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 报警中心 > 通知设置
  3. 切换到通知策略页签,创建通知策略。
  4. 配置报警匹配条件、目标通知渠道和通知收敛方式。
    配置项 说明
    策略名称与描述 用于标识策略用途。建议体现通知对象或场景,例如严重报警值班通知、容量风险通知或指定组件报警通知。
    通知规则 用于筛选需要外部通知的报警。可按报警级别、产品类型、资源类型、地域、集群、主机、报警名称、来源系统、事件域、接入实例、生命周期状态和确认状态等条件匹配。
    匹配方式 支持等于、不等于、正则匹配和正则不匹配。需要覆盖一类对象时,可使用正则匹配;需要排除某类对象时,可使用不等于或正则不匹配。
    通知渠道 选择已启用的外部通知渠道。一条策略可绑定多个渠道,适用于同一类报警同时通知多个团队或系统。
    恢复报警 启用后,报警恢复时也会发送通知,便于值班人员确认风险已解除。
    分组与重复提醒 按资源、集群或报警名称等字段合并相似报警,并设置首次等待、分组间隔和重复提醒时间,减少同类报警频繁发送。
  5. 保存通知策略。
  6. 进入运维 > 报警中心 > 报警消息,查看报警消息和通知投递结果。

    匹配通知策略的报警会按策略发送到外部渠道。未匹配外部通知策略的报警仍会进入报警消息,但不会发送到外部渠道。

查看和处理报警消息

报警消息用于集中查看资源报警和事件报警。用户可筛选当前风险、确认处理状态、查看通知投递结果,并进入相关资源、监控或日志页面继续排查。若报警命中通知策略,且通知策略引用了通知渠道,ZCF 会将报警发送到对应外部渠道;用户可结合报警详情中的投递结果,到第三方渠道确认通知是否送达。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 报警中心 > 报警消息
  3. 选择报警视图。
    视图 用途
    活跃 查看尚未恢复或仍需关注的报警,适合值班人员优先处理当前风险。
    已恢复 查看近期已恢复的报警,适合确认风险解除情况。
    历史 追溯更早的报警记录,适合复盘故障过程和排查周期性问题。
    资源报警 查看由报警规则触发的资源类报警,适合排查指标异常、容量风险和资源状态异常。
    事件报警 查看已接入组件上报的事件类报警,适合关注组件侧的重要事件和状态变化。
    事件记录 查看一次性事件记录,适合了解组件上报的运行事件和操作事件。
  4. 按级别、状态、来源、资源、时间范围等条件筛选报警。

    日常值班可优先筛选紧急或严重级别的活跃报警;复盘问题时,可结合历史报警、已恢复报警和事件记录确认问题发生与恢复过程。

  5. 打开报警详情。
    查看项 用途
    报警摘要 了解报警名称、级别、状态、触发时间和恢复时间。
    影响对象 确认报警关联的组件、资源、区域或实例范围。
    触发条件 查看指标值、阈值、持续时间或事件来源,判断报警产生原因。
    通知投递结果/通知渠道 查看命中的通知策略、通知渠道、接收对象、投递状态、重试次数和失败原因。
    处理建议与评论 查看处理建议,并记录排查过程和处理结论。
  6. 按处理进展更新报警状态。

    点击确认表示已开始关注该报警;问题处理完成后,点击标记已处理。如需补充说明,可在报警详情中添加评论。

  7. 如果报警配置了外部通知渠道,到对应第三方渠道确认是否收到通知消息。

    以报警详情中的通知渠道、接收对象和投递状态为准,确认第三方渠道侧是否收到同一条通知。

  8. 根据报警详情继续排查。

    如页面提供资源、监控或日志入口,可进入对应页面查看资源状态、指标趋势或日志上下文。

Note: 如果报警未发送到外部通知渠道,请先在报警详情中查看投递明细,再检查通知渠道和通知策略配置。

管理报警规则

管理报警规则前,请确认已存在需要维护的报警规则。

报警规则用于集中查看和维护系统内置规则及自定义规则。用户可根据运维需要启用、禁用、编辑、克隆、导入、导出或删除规则,持续优化风险识别范围。

  1. 在主菜单右上角切换至全局管理
  2. 进入运维 > 报警中心 > 报警规则
  3. 查看现有报警规则。
    规则类型 使用方式
    系统内置 覆盖常见资源风险。可按页面支持的操作启用、禁用、调整可编辑项或恢复默认值。
    自定义 用于补充业务关注的指标条件。用户可创建、编辑、克隆、导入、导出或删除自定义规则。
  4. 按需维护报警规则。
    配置项 说明
    启用或禁用 控制规则是否参与报警判断。临时屏蔽某类报警时,可先禁用规则,排查完成后再启用。
    编辑 调整规则名称、简介、平台类型、资源类型、报警条目、报警触发规则、报警级别或报警范围。
    克隆 基于已有规则创建相似规则,适合复用指标条件后调整适用范围或阈值。
    导入或导出 通过规则文件迁移或复用自定义规则配置。
    恢复默认值 将调整过的系统内置规则恢复为预置配置。
    删除 删除不再使用的自定义规则。删除后,系统不再按该规则生成新报警。
Note: 调整报警规则后,建议持续关注报警消息数量和触发频率,确认规则变更符合预期。