可观测性
ZCF 可观测性用于汇聚已接入组件的资源、监控、日志、报警和健康数据,帮助用户从全局、组件和资源维度查看运行状态,并进行运维分析和报表输出。
使用可观测性能力前,请先通过 ZCF 云联邦完成基础设施组件接入,并按需启用资源、监控或日志采集。接入和采集完成后,用户可通过首页总览、平台健康、仪表盘或自定义仪表盘、视图、报表、资产、基础架构、监控查询、日志查询、采集配置、报警与通知等能力查看不同层级的数据,并将异常转化为可持续跟踪的处理流程。
如果页面中未显示预期数据,请优先检查对应组件是否已接入、采集配置是否启用,以及最近一次采集或同步是否正常。
核心概念
使用可观测性能力前,建议先了解以下与数据来源、分析视图、报警和采集配置相关的概念:
| 概念 | 说明 |
|---|---|
| 数据来源 | 已通过 ZCF 云联邦接入并启用采集的组件或环境。可观测性页面中的资源、监控和日志数据会受接入范围和采集配置影响。 |
| 仪表盘 | 用于集中展示资源健康、容量、性能和资产状态的可视化页面。用户可使用预置仪表盘,也可创建自定义仪表盘组合常用视图。 |
| 视图 | 可复用的图表或数据展示单元,可用于按特定维度查看资源和监控数据。 |
| 报表模板 | 用于定义报告内容和生成方式的模板,可用于按需或周期性生成运维报告。 |
| 生成记录 | 报表生成后的历史记录,用于查看生成结果,并下载已生成的报表文件。 |
| 监控指标 | 描述资源运行状态的数值型数据,例如 CPU、内存、容量、网络或服务状态等。 |
| 日志 | 来自接入组件的运行、操作或审计类文本记录,用于排查问题、定位异常和追踪操作过程。 |
| 资产 | 同步到 ZCF 的资源对象,例如物理机、云主机、容器资源和存储资源等。 |
| 平台健康 | ZCF 对平台关键服务、健康域、组件明细和外部依赖的健康汇总,用于发现控制面、数据链路和容量风险。 |
| 健康域 | 平台健康检查的分组视角,按核心服务、监控采集、报警评估、通知链路、容量风险和基础依赖等范围汇总检查项,便于判断异常影响面。 |
| 报警中心 | 集中展示报警消息,并管理报警规则、通知渠道、通知策略和消息模板的入口。 |
| 采集配置 | 用于控制资源、监控和日志数据采集范围的配置。采集配置正常后,相关数据才会进入查询、仪表盘和报表能力。 |
进入可观测性页面
在主菜单右上角切换至全局管理后,可通过以下页面使用 ZCF 可观测性能力。不同页面面向不同运维任务:总览用于快速巡检,仪表盘和报表用于细粒度分析,运维页面用于查看平台健康、查询指标和日志、管理采集配置并处理报警。
| 页面 | 用途 |
|---|---|
| 首页 | 查看已接入组件的资源规模、健康状态、容量使用和性能情况,适合日常巡检和环境整体状态确认。 |
| 仪表盘与报表 | 查看全局或组件级仪表盘,创建和维护自定义仪表盘、视图和报表模板,并生成周期性或按需报表。 |
| 运维 |
|
可观测性数据依赖组件接入和采集配置。如果页面无数据,请先确认相关组件已接入 ZCF 云联邦,并检查资源、监控或日志采集状态。
配置数据采集
资源、监控和日志数据是可观测分析的基础。用户在云联邦中接入组件时,可按需勾选资源、监控或日志采集项;接入完成后,可在对应采集页面确认采集状态、补充采集配置或调整采集范围。采集正常后,首页、资产、基础架构、监控查询、日志查询、仪表盘和报表等页面才能展示对应数据。
配置资源采集
配置资源采集前,请确认以下条件:
- 目标组件已通过云联邦 > 平台管理中的接入平台列表或区域接入 ZCF,并完成连接验证。接入时已勾选资源采集项,或后续已在平台配置中启用资源采集。
- 当前账号具备云联邦和资源采集相关操作权限。
资源采集用于维护接入组件的资源同步范围,并查看资源同步状态。资源采集正常后,资产、基础架构、仪表盘和报表页面才能展示对应资源数据。
在主菜单右上角切换至全局管理。
进入运维 > 统一资产 > 资源采集。
确认目标组件是否已启用资源采集。
如果页面提示已有组件未启用资源采集,可进入云联邦 > 平台管理,在接入平台列表或区域中打开目标组件的接入或配置页面,并勾选资源采集项。
在平台列表中选择目标组件,并查看资源采集状态。
操作 说明 查看同步状态 查看目标组件的资源总数、同步状态、最近同步时间和同步频率。 查看资源类型结果 按资源类型查看同步结果,判断指定类型的资源数据是否已正常采集。 按需调整资源采集配置。
操作 说明 选择采集资源 选择需要同步到 ZCF 的资源类型。仅采集所选资源后,相关页面才会展示对应数据。 设置同步频率 设置资源数据的自动同步周期。同步频率越高,数据更新越及时,但也会增加采集压力。 手动同步资源 在需要立即刷新资源数据时,手动触发一次资源同步。 停止资源采集 停止目标组件的资源同步。停止后,相关页面不再更新该组件的资源数据。
调整资源采集配置后,可进入资产、基础架构、仪表盘或报表页面确认资源数据是否符合预期。
配置监控采集
配置监控采集前,请确认以下条件:
- 目标组件已通过云联邦 > 平台管理中的接入平台列表或区域接入 ZCF,并完成连接验证。接入时已勾选监控采集项,或后续已在监控采集管理页面新增采集。
- 目标组件支持监控采集,且当前账号具备云联邦和监控采集相关操作权限。
监控采集管理用于查看和维护接入组件的指标采集状态。监控采集正常后,监控摘要、监控查询、仪表盘和报表页面才能展示对应指标数据。
在主菜单右上角切换至全局管理。
进入运维 > 监控中心 > 监控采集管理。
如目标组件尚未启用监控采集,添加采集配置。
如果接入组件时未勾选监控采集项,可在本页面通过新增采集补充开启。
操作 说明 选择平台 选择需要采集监控指标的接入组件。若无可选组件,请先进入云联邦 > 平台管理,并按接入平台列表或区域中的页面入口操作。 新增采集 为所选组件启用监控采集,使其指标数据可用于监控查询、仪表盘和报表。 查看监控采集状态。
操作 说明 采集状态 确认目标组件的指标采集是否正常。 更新时间 确认最近一次采集信息更新时间,用于判断指标数据是否持续更新。 删除采集 停止采集目标组件的监控指标。停止后,相关页面不再更新该组件的指标数据。
如果仪表盘或监控查询缺少指标数据,请先确认监控采集状态是否正常,再检查目标组件连接状态。
配置日志采集
配置日志采集前,请确认以下条件:
- 目标组件已通过云联邦 > 平台管理中的接入平台列表或区域接入 ZCF,并完成连接验证。接入时已勾选日志采集项,或后续已在日志采集管理页面新增采集。
- 目标组件支持日志采集,且当前账号具备云联邦和日志采集相关操作权限。
- 如目标组件侧需要先开启审计或日志输出,请先按对应组件要求完成配置。
日志采集管理用于查看和维护接入组件的日志采集状态及采集目标。日志采集正常后,日志摘要、日志查询和实时流诊断页面才能展示对应日志数据。
在主菜单右上角切换至全局管理。
进入运维 > 日志中心 > 日志采集管理。
如目标组件尚未启用日志采集,添加采集配置。
如果接入组件时未勾选日志采集项,可在本页面通过新增采集补充开启。
操作 说明 选择平台 选择需要采集日志的接入组件。若无可选组件,请先进入云联邦 > 平台管理,并按接入平台列表或区域中的页面入口操作。 采集目标 选择需要采集的日志类型。无特殊要求时,可保留页面默认选择。 查看或调整日志采集状态。
操作 说明 采集状态 确认目标组件的日志采集是否正常。 修改采集目标 调整已有采集配置中的日志类型,满足新的排障或审计分析需要。 删除采集 停止采集目标组件的日志数据。停止后,相关页面不再更新该组件的日志数据。
如果日志摘要、日志查询或实时流诊断缺少数据,请先确认日志采集状态和采集目标是否正确,再检查目标组件连接状态。
掌握运行总览
用户可通过首页、仪表盘、资产和基础架构页面查看 ZCF 管理范围内的资源规模、健康状态、容量使用、性能趋势和资源分布。该链路适合日常巡检、环境总览和资源状态确认。
查看全局总览
首页用于查看 ZCF 全局运行概况,适合日常巡检、部署后确认、容量评估和异常初筛。用户可在一个页面中了解已接入组件的资源规模、健康状态、容量使用和性能情况。
| 区域 | 说明 |
|---|---|
| 全局核心态势 | 汇总展示资源总览、健康总览和容量使用率,帮助用户快速了解当前环境整体状态。 |
| 云平台 · 虚拟化与基础资源 | 展示 ZStack Cloud、ZSphere 虚拟化平台等相关资源规模和分布情况,例如云主机、物理机、网络和容量类资源。 |
| 网络服务 | 接入 ZNS 后,展示网络服务资源状态,帮助用户从首页了解网络资源概况。 |
| 容器 · 编排 | 展示 Kubernetes 集群、节点、工作负载和容器组等容器资源状态,用于了解容器环境运行情况。 |
| 存储 · 分布式 | 展示存储服务器、硬盘等存储资源的状态和健康情况,用于了解存储资源可用性。 |
| 性能洞察 · 资源消耗排行 | 展示资源性能相关排行,帮助用户快速定位需要关注的资源对象。 |
- 登录 ZCF。
- 在主菜单右上角切换至全局管理。
- 在主菜单中单击首页。
- 查看全局核心态势、资源规模、健康状态、容量使用和性能排行等信息。
首页展示结果依赖组件接入和采集状态。如果某类资源区域为空,请先确认对应组件已接入 ZCF 云联邦,并检查资源、监控或日志采集状态。如发现资源、健康或容量异常,可进入资产、基础架构、平台健康、仪表盘或报警中心继续确认。
查看平台健康
平台健康用于查看 ZCF 平台关键服务、健康域、组件明细和外部依赖等运行状态,适合日常巡检、升级前检查和故障定位。健康域用于按监控采集、报警评估、通知链路、容量风险等检查范围汇总健康结果。
在主菜单右上角切换至全局管理。
进入运维 > 监控中心 > 平台健康。
查看平台健康状态。
查看项 说明 平台总体状态 查看 ZCF 当前整体健康结果、最近更新时间和异常数量。 健康域概览 按检查域查看核心服务、监控采集、报警评估、通知链路、容量风险和基础依赖等状态。 组件明细与外部依赖 查看组件实例、服务明细和外部依赖状态,判断异常影响范围。 异常与待处理项 查看异常、降级或待确认的健康项,定位需要优先处理的问题。 打开异常健康项,查看检查结果、影响对象和建议处理方式。
根据异常类型,进入监控查询、日志查询、报警中心或资源详情继续排查。
平台健康关注 ZCF 平台自身及关键服务链路,不替代业务资源的监控查询和日志查询。
查看仪表盘
仪表盘用于从全局或组件维度查看资源健康、容量、性能和资产状态,适合在日常巡检、容量评估和问题分析时使用。用户可查看预置仪表盘,也可打开已有自定义仪表盘,按常用观察视角开展分析。接入 ZSphere 并启用采集后,用户可通过虚拟化仪表盘查看虚拟化资源的可用性、容量、性能和资产清单等数据。
| 仪表盘 | 适用场景 |
|---|---|
| 运维总览 | 查看已接入组件的整体运行态势,适合日常巡检和跨组件状态确认。 |
| 云平台仪表盘 | 查看云平台资源的概览、可用性、容量、性能和资产清单,适合分析计算、网络和虚拟化资源状态。 |
| 虚拟化仪表盘 | 查看虚拟化平台资源的可用性、容量、性能和资产清单,适合分析 ZSphere 等虚拟化资源状态。 |
| 容器仪表盘 | 查看容器资源的概览、可用性、容量、性能、控制面和资产清单,适合分析 Kubernetes 相关资源状态。 |
| 存储仪表盘 | 查看存储资源的概览、可用性、容量、性能和资产清单,适合分析存储容量、健康和性能状态。 |
| 自定义仪表盘 | 查看用户自定义组合的视图,适合按业务、资源类型或团队职责沉淀常用观察视角。 |
- 在主菜单右上角切换至全局管理。
- 进入仪表盘与报表 > 仪表盘。
- 按需选择运维总览,或在专项仪表盘中选择云平台仪表盘、虚拟化仪表盘、容器仪表盘、存储仪表盘,也可打开自定义仪表盘。
- 查看对应仪表盘中的概览、可用性、容量、性能和资产清单等信息。
- 如发现容量、性能或可用性异常,可进入监控查询、日志查询、资产详情或报警中心继续确认。
仪表盘数据依赖资源、监控和日志采集状态。如果虚拟化仪表盘无数据,或页面提示“当前产品未部署或未启用采集。”,请确认 ZSphere 已接入 ZCF 云联邦,并已启用相关资源或指标采集。如需沉淀固定分析视角,可创建自定义仪表盘或视图。
查看资产
资产用于跨组件查看和搜索资源,适合资源盘点、异常对象定位和从首页、仪表盘或报警消息下钻分析。用户可按资源类型定位具体对象,再查看资源详情和关联指标。
| 查看项 | 说明 |
|---|---|
| 资源类型 | 按物理机、云主机、容器组等类型查看资源列表。 |
| 资源检索 | 按字段和值搜索资源,用于快速定位目标对象。 |
| 列表与关系 | 按页面支持的分组方式查看资源列表,并在资源详情中查看关联指标或资源关系。 |
| 资源详情 | 查看资源明细、运行状态和关联监控信息。 |
- 在主菜单右上角切换至全局管理。
- 进入运维 > 统一资产 > 资产。
- 选择需要查看的资源类型。
- 按字段和值搜索资源,或按页面支持的分组方式查看资源列表。
- 打开资源详情,查看资源明细、关联监控信息或页面提供的资源关系。
如果目标资源未显示,请确认对应组件已接入并完成资源采集。如资源状态或指标异常,可进入监控查询、日志查询或报警中心继续排查。
查看基础架构
基础架构用于从全局、云联邦、云平台、虚拟化平台、存储、容器和 ZNS 网络中心等视角查看基础资源结构和容量分布,适合资源盘点、容量评估和部署后确认。用户可通过该页面了解已接入组件的资源组成、容量使用和资源分布情况。
| 查看项 | 说明 |
|---|---|
| 资源组成 | 查看总资产数以及云平台、虚拟化平台、存储、容器和网络服务等资源数量。 |
| 容量分布 | 查看不同接入组件的 CPU、内存、存储等容量使用情况。 |
| 网络服务资源 | 查看 ZNS 网络中心相关资源的规模和分布情况,用于辅助确认网络服务接入和资源采集结果。 |
- 在主菜单右上角切换至全局管理。
- 进入运维 > 统一资产 > 基础架构。
- 在概览、云联邦、云平台、虚拟化平台、存储、容器 (K8s)、ZNS 网络中心等页签间切换。
- 查看资源数量、容量分布、资源状态或网络服务资源概要。
如果资源数量或容量分布与预期不一致,请先确认对应组件已接入,并检查资源采集状态。如需定位具体对象,可进入资产或监控查询继续查看。
构建分析视角与报表
用户可通过自定义仪表盘、内置视图或自定义视图沉淀常用分析维度,并将视图组织为报表模板,按需或周期生成运维报表。该链路适合周期巡检、容量分析、性能回顾和资产清单输出。
查看和维护视图
视图用于保存可复用的图表视图,沉淀常用资源或监控分析维度。用户可按云平台、虚拟化、容器、存储等分类查看内置视图,也可维护已有自定义视图,用于后续巡检、报表输出或问题分析。
在主菜单右上角切换至全局管理。
进入仪表盘与报表 > 视图。
在概览页签查看内置视图,或在管理页签维护自定义视图。
操作 说明 查看内置视图 在概览页签查看可用性、资产、性能、容量等常用分析视图。 切换平台类型 按云平台、虚拟化、容器、存储等平台类型切换视图展示范围。 搜索或筛选视图 按视图名称或适用平台类型查找视图。 克隆或维护视图 克隆内置视图,或编辑、克隆、删除自定义视图。
内置视图通常用于查看和克隆;自定义视图可编辑、克隆或删除。虚拟化视图可用于构建自定义仪表盘或报表模板;创建后的视图也可添加到自定义仪表盘,或在报表模板中作为报表内容使用。
创建自定义视图
当内置视图不能满足特定资源或指标分析需求时,可创建自定义视图。自定义视图创建后,可在视图列表中复用,也可作为报表模板的内容来源。
在主菜单右上角切换至全局管理。
进入仪表盘与报表 > 视图。
在管理页签中,单击新建视图。
按页面提示配置自定义视图参数。
配置项 说明 名称 自定义视图在视图列表和报表模板中的显示名称。建议使用能够体现分析对象或用途的名称。 描述 视图用途说明,便于后续识别该视图适用的巡检、分析或报表场景。 视图类型 选择视图的展示和分析类型。不同视图类型对应的配置项可能不同,请以页面展示为准。 业务分类 选择视图所属分类,便于在视图列表、报表模板和后续维护中筛选。 适用平台类型 选择视图适用的平台范围,例如云平台、容器或存储等类型。视图可用数据取决于已接入组件和采集状态。 资源类型 选择需要分析的资源对象类型。不同资源类型支持的字段、指标和过滤条件可能不同。 视图配置 按页面提示配置展示字段、指标、过滤条件或图表展示方式,用于定义视图的具体展示内容。 在预览确认中确认展示效果,并保存视图。
自定义视图适合沉淀固定分析维度。创建前请确认对应资源或指标数据已完成采集,否则预览和后续报表中可能没有数据。
从监控查询保存视图
对需要反复查看的监控查询,可将查询条件和展示方式保存为视图。保存后的视图可在视图列表中复用,也可加入报表模板。
在主菜单右上角切换至全局管理。
进入运维 > 监控中心 > 监控查询。
按页面提示设置监控查询条件。
配置项 说明 平台 选择需要查询监控数据的平台或组件范围。可选范围取决于已接入组件和监控采集状态。 资源范围 选择需要分析的资源对象或资源分组,用于限定监控查询的数据范围。 指标 选择需要查看的一个或多个监控指标。不同平台和资源类型支持的指标可能不同。 统计方式 选择指标数据的聚合或统计方式,用于控制趋势图中的数据计算口径。 图表样式 选择查询结果的展示方式,便于按趋势、对比或分布等方式查看指标数据。 时间范围 选择监控数据查询的时间范围。保存为视图后,后续可基于该查询条件复用分析。 执行查询,并确认查询结果符合预期。
按页面提示将当前查询保存为视图。
进入仪表盘与报表 > 视图,确认已生成对应视图。
创建自定义仪表盘
自定义仪表盘用于把常用视图组合到同一页面,形成面向业务、资源类型或团队职责的观察视角。用户可从视图库添加视图,调整布局后保存为可重复使用的仪表盘。
在主菜单右上角切换至全局管理。
进入仪表盘与报表 > 仪表盘,切换至管理页签。
单击新建仪表盘,填写仪表盘名称和描述。
从添加视图面板选择需要展示的视图,并添加到画布。
选择要点 说明 视图类型 按巡检、资源分析、容量分析或告警跟踪等目标选择视图。 资源范围 按需选择全局、组件、可用区或资源类型范围,避免同一仪表盘中混入无关数据。 时间范围 为趋势类视图选择合适的时间范围,便于观察近期变化或历史趋势。 按需拖拽调整视图位置和大小。
建议将关键状态、异常统计或容量风险放在页面上方;趋势、排行和明细类视图可按排查顺序排列。
保存仪表盘,并返回仪表盘列表确认自定义仪表盘已生成。
按需维护自定义仪表盘。
操作 说明 编辑仪表盘 调整仪表盘名称、描述、视图内容或布局。 克隆仪表盘 基于已有仪表盘创建副本,适合复用已有观察视角后再局部调整。 导入或导出仪表盘 通过 JSON 文件迁移或复用仪表盘配置。 删除仪表盘 删除不再使用的自定义仪表盘。
自定义仪表盘中的数据依赖所选视图的数据来源和采集状态。如果视图无数据,请先检查对应组件接入和采集配置。
创建报表模板
报表模板用于组合多个视图,形成可按需或周期生成的运维报告。用户可基于已有视图创建报表模板,用于容量分析、性能回顾、资产清单或可用性检查等场景。
在主菜单右上角切换至全局管理。
进入仪表盘与报表 > 报表。
在报表模板页签中,单击新建报表模板。
按页面提示配置报表模板参数。
配置项 说明 模板名称 报表模板在模板列表和生成记录中的显示名称。建议使用能够体现报表用途的名称。 描述 报表模板用途说明,便于区分容量分析、性能回顾、资产清单或可用性检查等不同模板。 可用视图 选择需要加入报表的视图。可用视图包括内置视图和已创建的自定义视图。 视图分类 按分类筛选可用视图,便于从容量、性能、资产、可用性等分析维度中选择报表内容。 报表内容 确认已添加的视图及展示顺序,决定报表生成后的主要内容结构。 在报表内容区域确认视图顺序和内容后,按页面提示保存模板。
如果可用视图不能满足报表内容需求,请先创建自定义视图,再将该视图添加到报表模板中。
查看和维护报表模板
报表模板用于定义报告内容和生成方式。用户可查看内置的容量、性能、资产清单和可用性模板,也可基于已有模板克隆出新的报表模板。
在主菜单右上角切换至全局管理。
进入仪表盘与报表 > 报表。
在报表模板页签中查看、搜索或克隆报表模板。
操作 说明 查看模板 查看容量、性能、资产清单、可用性等报表模板,确认模板适用范围和报告内容。 克隆模板 基于已有模板复制生成新的报表模板,适合在内置模板基础上调整报告内容。 搜索模板 按报表模板名称搜索已有模板。
生成和下载报表
报表可基于报表模板按需立即生成,也可按计划周期生成。用户可在生成记录页签查看生成历史,并下载已生成的报表文件。
在主菜单右上角切换至全局管理。
进入仪表盘与报表 > 报表。
在报表模板页签中选择需要使用的模板。
按需立即生成报表,或为模板配置定时生成规则。
操作 说明 立即生成 基于报表模板立即生成报告,适合临时输出巡检或分析结果。 配置定时生成 为报表模板配置周期性生成规则,适合固定周期输出容量、性能、资产清单或可用性报告。 查看生成记录 查看报表生成历史、执行状态和生成结果。 下载报表 下载已生成的报表文件。可用格式以页面展示为准。 在生成记录页签查看生成结果,并下载报表文件。
排查监控与日志问题
用户可先通过监控摘要和日志摘要了解数据规模、来源分布和趋势,再进入监控查询或日志查询页面按指标、字段、级别和时间范围定位问题。该链路适合性能波动分析、异常日志排查和实时日志诊断。
查看监控摘要
查看监控摘要前,请确认目标组件已接入 ZCF,并已启用监控采集。
监控摘要用于查看监控数据是否正常进入 ZCF。用户可先通过该页面确认指标接入规模和来源分布,再决定是否进入监控查询进一步分析。
| 查看项 | 说明 |
|---|---|
| 采集概况 | 查看接入数量、在线状态、指标数量和监控数据总量,确认监控链路是否有数据流入。 |
| 来源分布 | 查看不同组件的指标数量和数据占比,判断数据规模是否符合预期。 |
| 接入组件 | 查看已接入监控的组件列表及数据规模,用于定位缺少监控数据的组件。 |
- 在主菜单右上角切换至全局管理。
- 进入运维 > 监控中心 > 监控摘要。
- 查看采集概况,确认监控数据是否持续进入 ZCF。
- 查看来源分布和接入组件列表,判断各组件的数据规模是否符合预期。
如果某个组件没有监控数据,请先检查该组件的接入状态、监控采集配置和采集状态;如果只有部分指标异常,可进入监控查询继续定位。
查询监控指标
查询前,请确认目标组件已接入 ZCF,并已启用监控采集。可查询的平台、资源和指标范围取决于组件接入状态、监控采集状态和当前用户权限。
监控查询用于按平台、资源和指标条件查询监控趋势,适合在发现性能波动、容量压力或资源异常后进一步定位影响对象。常用查询可保存为视图,便于后续复用分析。
在主菜单右上角切换至全局管理。
进入运维 > 监控中心 > 监控查询。
按页面提示设置监控查询条件。
配置项 说明 查询范围 选择需要分析的平台、组件或资源范围,用于限定指标数据来源。 资源对象 选择具体资源或资源分组,用于查看单个对象状态,或对比多个对象的指标变化。 指标 选择需要查看的指标。页面会根据查询范围提供可用指标,并展示指标单位或状态含义。 时间范围 选择查询时间段,查看指标在指定时间范围内的变化趋势。 展示方式 按需选择统计方式和图表样式,辅助对比趋势、峰值和异常点。 执行查询,查看指标趋势和异常点。
如需继续定位,可调整查询范围、时间范围或指标,并重新查询。
如果无法查询到目标指标,请先检查目标组件是否已接入,并确认监控采集配置、采集状态和当前用户权限是否正常。如果需要复用当前查询条件,可将监控查询保存为视图。
查看日志摘要
查看日志摘要前,请确认目标组件已接入 ZCF,并已启用日志采集。
日志摘要用于查看日志采集和写入的总体情况。用户可通过日志容量、事件数量、来源排行、日志趋势和级别分布,快速判断日志是否持续进入 ZCF,以及哪些来源更需要关注。
| 查看项 | 说明 |
|---|---|
| 时间范围 | 切换统计时间范围,观察日志容量、事件数量和来源排行是否随时间变化。 |
| 日志概况 | 查看日志容量、日志事件数、摄入速率和活跃源数量,确认日志采集是否正常。 |
| 来源排行 | 查看日志量较高的组件或数据源,定位日志突增或采集规模异常的来源。 |
| 级别分布 | 查看 ERROR、WARN、INFO 等日志级别占比,识别错误或告警日志较集中的范围。 |
- 在主菜单右上角切换至全局管理。
- 进入运维 > 日志中心 > 日志摘要。
- 选择时间范围,查看日志概况和日志量趋势。
- 查看来源排行和级别分布,判断是否存在日志量突增、采集中断或错误日志集中的情况。
如果发现日志来源或级别异常,可进入日志查询按时间范围、来源和级别继续检索日志明细。
查询日志
查询日志前,请确认目标组件已接入 ZCF,并已启用日志采集。可查询的来源和字段范围取决于日志采集状态、日志解析结果和当前用户权限。
日志查询用于检索和分析历史日志。用户可按时间、来源、级别、关键字或结构化字段缩小范围,定位异常时间段、日志来源和关键日志内容。
在主菜单右上角切换至全局管理。
进入运维 > 日志中心 > 日志查询。
按页面提示设置日志查询条件。
配置项 说明 查询范围 选择需要检索的组件、日志来源和时间范围,限定日志数据范围。 日志级别 按 ERROR、WARN、INFO 等级别过滤日志,用于优先查看异常或告警信息。 关键字 输入错误码、资源名称、服务名或其他关键字,在日志正文中检索相关记录。 字段过滤 根据日志解析出的平台、主机、服务、实例等字段缩小结果范围。 日志明细 查看单条日志的时间、级别、来源、正文和扩展字段,用于确认异常上下文。 执行查询,查看日志分布和日志明细。
根据查询结果继续调整时间范围、来源或过滤条件,逐步缩小排查范围。
如果日志查询结果为空,请先检查目标组件是否已接入,并确认日志采集配置、采集状态、查询时间范围和当前用户权限是否正常。
使用实时流诊断日志
使用实时流前,请确认目标组件已接入 ZCF,日志采集处于正常状态,且当前时间有日志持续产生。
实时流用于查看持续写入的最新日志,适合在复现问题、执行运维操作或验证采集状态时观察即时输出。与日志查询相比,实时流更适合看“正在发生”的日志变化。
在主菜单右上角切换至全局管理。
进入运维 > 日志中心 > 日志查询。
切换至实时流页签。
选择需要观察的组件、日志来源或日志级别。
配置项 说明 组件或来源 选择需要观察的日志来源,避免实时输出过多无关日志。 日志级别 按需只查看 ERROR、WARN 等关键级别,便于在复现过程中捕捉异常。 关键字 输入资源名称、任务 ID、错误码或服务名,聚焦本次操作相关日志。 查看实时输出的日志内容,结合时间、级别和关键字段定位异常。
如需回看历史上下文,返回日志查询并按相同条件查询对应时间段日志。
如果实时流没有输出日志,请先确认目标组件已接入,并检查日志采集配置、采集状态和当前用户权限是否正常。
管理报警与通知
报警与通知用于将可观测性中的指标异常、事件风险和资源问题转化为可跟踪、可通知、可处理的报警流程。用户可先确认数据来源和采集状态,再通过报警规则定义风险识别条件,通过消息模板、通知渠道和通知策略将重要报警发送给对应团队,并在报警消息中查看和处理风险。
配置流程
- 确认目标组件已接入,并已启用资源、监控、日志或事件报警接入等数据来源。
- 创建报警规则,定义指标类风险的触发规则、报警级别和报警范围。
- 创建消息模板,定义外部通知的内容格式。
- 创建通知渠道,配置钉钉、企业微信、邮件、Webhook 或短信等发送目标。
- 创建通知策略,匹配需要外部通知的报警并绑定通知渠道。
- 查看和处理报警消息,确认报警状态、通知投递结果和后续处置。
接入组件事件报警属于组件接入或初始化阶段的能力,用于让组件侧事件进入 ZCF 报警中心;事件接入完成后,事件报警可与资源报警共用通知渠道和通知策略。
核心概念
| 概念 | 说明 |
|---|---|
| 报警消息 | 由报警规则或事件接入产生的风险记录,用于查看问题状态、影响对象、发生时间和处理进度。 |
| 报警规则 | 定义报警触发规则、报警级别和报警范围,系统根据规则判断是否产生报警消息。 |
| 通知渠道 | 外部通知的发送目标,例如钉钉、企业微信、邮件、Webhook 或短信。 |
| 通知策略 | 按级别、来源、资源类型等条件匹配报警,并决定是否发送到外部通知渠道。 |
| 消息模板 | 定义外部通知的内容和格式,由通知渠道引用。 |
| 事件报警集成 | 接入已连接组件上报的事件类报警,使组件侧事件进入 ZCF 统一查看和通知。 |
启用事件报警集成
启用事件报警集成前,请确认目标组件已通过云联邦接入 ZCF、连接正常,且当前管理员具备云联邦和报警中心相关权限。
通过云联邦接入平台或组件后,可在事件报警集成页面开启事件报警集成。开启后,组件上报的事件报警会进入 ZCF 报警中心。用户可在报警消息中查看这些报警,并通过通知策略将重要报警发送到外部渠道。
在主菜单右上角切换至全局管理。
进入运维 > 报警中心 > 事件报警集成。
找到目标组件,点击启用,按页面提示开启事件报警集成。
查看组件的事件报警集成状态。
查看项 说明 事件报警托管 显示该组件是否已开启事件报警集成,并由 ZCF 统一接入和管理事件报警。 配置同步 显示事件报警集成配置是否已下发到组件。若状态异常,可重新同步配置。 最近下发 显示最近一次配置下发时间。 最近事件报警 显示最近收到事件报警的时间。 解析失败与未知事件 显示事件解析或识别异常情况。 诊断详情 查看连接、同步、回调和日志检查结果。 如配置状态异常,执行同步操作。
同步会将 ZCF 的事件报警集成配置下发到对应组件。同步失败时,请根据诊断详情检查组件连接、访问凭据和回调地址。
进入运维 > 报警中心 > 报警消息,查看事件报警或事件记录。
如果事件报警集成状态正常但报警消息中没有数据,请先确认组件侧是否产生事件,再检查最近事件报警时间、解析失败和未知事件等状态。
如需外部通知,在运维 > 报警中心 > 通知设置中配置通知策略。
事件报警进入报警中心后,可与资源报警共用通知渠道和通知策略。
事件报警集成用于接入组件上报的事件类报警。基于指标阈值触发的资源报警,请在报警规则中管理。
创建报警规则
创建报警规则前,请确认目标组件已接入 ZCF,且相关资源和指标数据已正常采集。
报警规则用于定义指标类风险的触发规则。用户可按平台类型、资源类型和报警条目设置触发规则、报警级别和报警范围,让系统在容量接近上限、性能异常或关键资源状态异常时生成报警消息。
在主菜单右上角切换至全局管理。
进入运维 > 报警中心 > 报警规则。
点击创建规则。
填写报警规则参数。
配置项 说明 名称与简介 用于标识规则用途。建议体现资源类型、指标和风险场景,例如容量不足、连接异常或性能波动。 平台类型 选择规则适用的平台类型。平台类型会影响后续可选资源类型和报警条目。 资源类型 选择需要监控的资源类型。不同资源类型可选报警条目不同。 报警条目 选择具体监控条目或指标项,用于确定规则关注的风险对象。 报警触发规则 设置比较方式、阈值和持续条件等触发规则,用于判断何时生成报警。 报警级别 按影响程度选择报警级别。级别会影响报警筛选和通知策略匹配。 报警范围 选择规则生效的资源范围。仅需关注部分资源时,可缩小报警范围,减少无关报警。 保存报警规则。
返回报警规则列表,确认规则已创建并处于预期状态。
报警规则只定义风险如何被识别。规则触发后,可在运维 > 报警中心 > 报警消息查看报警;如需发送外部通知,请继续配置通知渠道和通知策略。
创建消息模板
如需创建自定义消息模板,请先确认通知渠道的接收端格式要求,例如群机器人使用 Markdown,邮件使用 HTML 或纯文本,Webhook 使用 JSON。
消息模板用于定义外部报警通知的内容格式。系统模板可满足常见通知场景;仅当不同通知渠道、团队或业务需要不同通知内容、格式或字段时,才需要创建自定义模板。
进入运维 > 报警中心 > 消息模板。
如果当前不在全局管理视图,请先在主菜单右上角切换至全局管理。
查看系统模板或已有自定义模板。
系统模板不建议直接修改;如需调整内容,可先克隆系统模板,再基于副本修改。
确认是否需要创建自定义模板。
常见场景可直接使用系统模板。仅当不同通知渠道、团队或业务需要不同通知内容、格式或字段时,才创建自定义模板。
创建自定义模板。
按以下说明填写模板参数:
配置项 说明 模板名称 用于区分模板用途。建议体现通知渠道或使用场景,例如值班群通知、严重报警邮件或 Webhook 回调。 简介 说明模板适用范围,便于多人协作维护。 内容格式 按接收端要求选择 Markdown、HTML、JSON 或纯文本。群机器人通常使用 Markdown,Webhook 通常使用 JSON。 加载预置模板 按所选内容格式加载系统提供的预置模板,作为模板内容的编辑起点。首次创建模板,或希望沿用系统变量结构时,可先加载预置模板,再在源码编辑器中调整内容。 模板内容 填写通知正文。可插入报警名称、级别、资源、状态、触发时间、摘要和处理建议等变量。 变量手册 查看当前可用变量及含义,避免引用不存在的字段导致通知内容为空。 实时预览 保存前预览模板渲染效果,确认关键信息完整、格式符合接收端要求。 保存消息模板。
进入运维 > 报警中心 > 通知设置,在通知渠道中选择消息模板。
消息模板由通知渠道引用。通知策略决定哪些报警发送到渠道,模板决定这些报警在渠道中的展示内容。
测试通知渠道,确认模板内容可正常发送和展示。
如需删除已被通知渠道引用的模板,请先调整对应渠道使用的模板。模板变更后,建议重新测试引用该模板的通知渠道。
创建通知渠道
ZCF 当前支持钉钉、企业微信、邮件、Webhook 和短信通知渠道。创建通知渠道前,请根据计划使用的渠道完成以下准备:
- 确认 ZCF 可访问目标通知系统或接收端地址。
- 如果使用钉钉或企业微信,请在目标群中创建机器人,获取 Webhook 地址,并按机器人安全要求准备关键词、加签密钥或 IP 白名单等信息。
- 如果使用邮件,请先完成邮件服务器配置并测试通过,准备收件人、抄送人或密送人邮箱地址。
- 如果使用 Webhook,请准备接收端 URL、请求方法和鉴权请求头。
- 如果使用短信,请先按短信服务商准备认证信息、短信签名、模板或接口地址,并确认短信额度满足通知要求。
- 如需使用自定义通知内容,请先创建消息模板;也可使用系统预置模板。
通知渠道用于配置报警的外部发送目标。默认情况下,报警会进入运维 > 报警中心 > 报警消息;如需发送到钉钉、企业微信、邮件、Webhook 或短信,请先创建通知渠道,再通过通知策略引用该渠道。
在主菜单右上角切换至全局管理。
进入运维 > 报警中心 > 通知设置。
在通知渠道页签中创建通知渠道。
选择渠道类型,并填写渠道基础信息和连接参数。
渠道类型 配置项 填写说明 全部渠道 渠道名称、描述、消息模板 - 渠道名称用于区分通知对象或团队。
- 消息模板决定通知内容格式,可使用系统预置模板。
- 如需自定义通知内容,可先在消息模板中创建模板。
钉钉 Webhook 地址、安全设置、@提醒对象 - 填写钉钉群机器人的 Webhook 地址。
- 如果机器人启用了安全设置,请同步填写关键词、加签密钥或 IP 白名单等信息。
- 如需提醒指定人员,可填写手机号。
企业微信 Webhook 地址、安全设置、@提醒对象 - 填写企业微信群机器人的 Webhook 地址。
- 如需安全校验,请填写对应密钥。
- 如需定向提醒,请填写成员账号或 @all。
邮件 收件人、抄送人、密送人 - 收件人为必填项,支持填写多个邮箱地址。
- 如需同步其他人员,可填写抄送人或密送人。
- 邮件渠道依赖邮件服务器配置。未完成配置或测试未通过时,邮件不能正常发送。
Webhook URL、请求方法、请求头、TLS 校验 - 填写接收端 URL,并选择请求方法。
- 需要鉴权时,在请求头中填写 Token 或其他认证信息。
- 仅在受信任的测试环境或自签名证书场景下跳过 TLS 校验。
短信 服务商、认证信息、短信签名、模板或接口地址、接收手机号 - 按页面支持的短信服务商填写对应参数。
- 阿里云短信需填写 AccessKey、签名、模板代码和接收手机号。
- 亿美软通需填写接口地址、App ID、Secret Key、签名和接收手机号。
- 通用 HTTP 需按短信网关要求填写接口地址、认证方式、请求体和成功匹配规则。
- 短信按条计费,建议仅用于严重或紧急报警。
保存通知渠道后,执行测试发送。
测试成功表示 ZCF 与目标渠道连通。测试通知会发送到对应接收端:钉钉群、企业微信群、邮件收件箱、Webhook 接收服务或短信接收手机。测试失败时,请检查地址、鉴权信息、机器人安全设置、邮件服务器或短信服务商配置。短信渠道测试会消耗短信额度。
创建或更新通知策略,将匹配的报警发送到该通知渠道。
通知渠道只定义报警发送目标。要让指定报警发送到该渠道,请继续创建通知策略。
创建通知策略
创建通知策略前,请确认以下条件:
- 已创建并测试通过至少一个通知渠道。
- 已明确需要发送外部通知的报警范围,例如报警级别、资源类型、来源组件、报警名称或事件域。
通知策略用于定义哪些报警需要发送到外部渠道,以及通知如何收敛。用户可按报警属性筛选消息,绑定一个或多个通知渠道,并设置恢复通知、分组和重复提醒策略,减少无关或重复通知。
在主菜单右上角切换至全局管理。
进入运维 > 报警中心 > 通知设置。
切换到通知策略页签,创建通知策略。
配置报警匹配条件、目标通知渠道和通知收敛方式。
配置项 说明 策略名称与描述 用于标识策略用途。建议体现通知对象或场景,例如严重报警值班通知、容量风险通知或指定组件报警通知。 通知规则 用于筛选需要外部通知的报警。可按报警级别、产品类型、资源类型、地域、集群、主机、报警名称、来源系统、事件域、接入实例、生命周期状态和确认状态等条件匹配。 匹配方式 支持等于、不等于、正则匹配和正则不匹配。需要覆盖一类对象时,可使用正则匹配;需要排除某类对象时,可使用不等于或正则不匹配。 通知渠道 选择已启用的外部通知渠道。一条策略可绑定多个渠道,适用于同一类报警同时通知多个团队或系统。 恢复报警 启用后,报警恢复时也会发送通知,便于值班人员确认风险已解除。 分组与重复提醒 按资源、集群或报警名称等字段合并相似报警,并设置首次等待、分组间隔和重复提醒时间,减少同类报警频繁发送。 保存通知策略。
进入运维 > 报警中心 > 报警消息,查看报警消息和通知投递结果。
匹配通知策略的报警会按策略发送到外部渠道。未匹配外部通知策略的报警仍会进入报警消息,但不会发送到外部渠道。
查看和处理报警消息
报警消息用于集中查看资源报警和事件报警。用户可筛选当前风险、确认处理状态、查看通知投递结果,并进入相关资源、监控或日志页面继续排查。若报警命中通知策略,且通知策略引用了通知渠道,ZCF 会将报警发送到对应外部渠道;用户可结合报警详情中的投递结果,到第三方渠道确认通知是否送达。
在主菜单右上角切换至全局管理。
进入运维 > 报警中心 > 报警消息。
选择报警视图。
视图 用途 活跃 查看尚未恢复或仍需关注的报警,适合值班人员优先处理当前风险。 已恢复 查看近期已恢复的报警,适合确认风险解除情况。 历史 追溯更早的报警记录,适合复盘故障过程和排查周期性问题。 资源报警 查看由报警规则触发的资源类报警,适合排查指标异常、容量风险和资源状态异常。 事件报警 查看已接入组件上报的事件类报警,适合关注组件侧的重要事件和状态变化。 事件记录 查看一次性事件记录,适合了解组件上报的运行事件和操作事件。 按级别、状态、来源、资源、时间范围等条件筛选报警。
日常值班可优先筛选紧急或严重级别的活跃报警;复盘问题时,可结合历史报警、已恢复报警和事件记录确认问题发生与恢复过程。
打开报警详情。
查看项 用途 报警摘要 了解报警名称、级别、状态、触发时间和恢复时间。 影响对象 确认报警关联的组件、资源、区域或实例范围。 触发条件 查看指标值、阈值、持续时间或事件来源,判断报警产生原因。 通知投递结果/通知渠道 查看命中的通知策略、通知渠道、接收对象、投递状态、重试次数和失败原因。 处理建议与评论 查看处理建议,并记录排查过程和处理结论。 按处理进展更新报警状态。
点击确认表示已开始关注该报警;问题处理完成后,点击标记已处理。如需补充说明,可在报警详情中添加评论。
如果报警配置了外部通知渠道,到对应第三方渠道确认是否收到通知消息。
以报警详情中的通知渠道、接收对象和投递状态为准,确认第三方渠道侧是否收到同一条通知。
根据报警详情继续排查。
如页面提供资源、监控或日志入口,可进入对应页面查看资源状态、指标趋势或日志上下文。
如果报警未发送到外部通知渠道,请先在报警详情中查看投递明细,再检查通知渠道和通知策略配置。
管理报警规则
管理报警规则前,请确认已存在需要维护的报警规则。
报警规则用于集中查看和维护系统内置规则及自定义规则。用户可根据运维需要启用、禁用、编辑、克隆、导入、导出或删除规则,持续优化风险识别范围。
在主菜单右上角切换至全局管理。
进入运维 > 报警中心 > 报警规则。
查看现有报警规则。
规则类型 使用方式 系统内置 覆盖常见资源风险。可按页面支持的操作启用、禁用、调整可编辑项或恢复默认值。 自定义 用于补充业务关注的指标条件。用户可创建、编辑、克隆、导入、导出或删除自定义规则。 按需维护报警规则。
配置项 说明 启用或禁用 控制规则是否参与报警判断。临时屏蔽某类报警时,可先禁用规则,排查完成后再启用。 编辑 调整规则名称、简介、平台类型、资源类型、报警条目、报警触发规则、报警级别或报警范围。 克隆 基于已有规则创建相似规则,适合复用指标条件后调整适用范围或阈值。 导入或导出 通过规则文件迁移或复用自定义规则配置。 恢复默认值 将调整过的系统内置规则恢复为预置配置。 删除 删除不再使用的自定义规则。删除后,系统不再按该规则生成新报警。
调整报警规则后,建议持续关注报警消息数量和触发频率,确认规则变更符合预期。
