可观测性
ZCF 可观测性用于汇聚已接入组件的资源、监控、日志、报警和健康数据,帮助用户从全局、组件和资源维度查看运行状态,并进行运维分析和报表输出。
使用可观测性能力前,请先通过 ZCF 云联邦完成基础设施组件接入,并按需启用资源、监控或日志采集。接入和采集完成后,用户可通过首页总览、平台健康、仪表盘或自定义仪表盘、视图、报表、资产、基础架构、监控查询、日志查询、采集配置、报警与通知等能力查看不同层级的数据,并将异常转化为可持续跟踪的处理流程。
如果页面中未显示预期数据,请优先检查对应组件是否已接入、采集配置是否启用,以及最近一次采集或同步是否正常。
核心概念
使用可观测性能力前,建议先了解以下与数据来源、分析视图、报警和采集配置相关的概念:
| 概念 | 说明 |
|---|---|
| 数据来源 | 已通过 ZCF 云联邦接入并启用采集的组件或环境。可观测性页面中的资源、监控和日志数据会受接入范围和采集配置影响。 |
| 仪表盘 | 用于集中展示资源健康、容量、性能和资产状态的可视化页面。用户可使用预置仪表盘,也可创建自定义仪表盘组合常用视图。 |
| 视图 | 可复用的图表或数据展示单元,可用于按特定维度查看资源和监控数据。 |
| 报表模板 | 用于定义报告内容和生成方式的模板,可用于按需或周期性生成运维报告。 |
| 生成记录 | 报表生成后的历史记录,用于查看生成结果,并下载已生成的报表文件。 |
| 监控指标 | 描述资源运行状态的数值型数据,例如 CPU、内存、容量、网络或服务状态等。 |
| 日志 | 来自接入组件的运行、操作或审计类文本记录,用于排查问题、定位异常和追踪操作过程。 |
| 资产 | 同步到 ZCF 的资源对象,例如物理机、云主机、容器资源和存储资源等。 |
| 平台健康 | ZCF 对平台关键服务、健康域、组件明细和外部依赖的健康汇总,用于发现控制面、数据链路和容量风险。 |
| 健康域 | 平台健康检查的分组视角,按核心服务、监控采集、报警评估、通知链路、容量风险和基础依赖等范围汇总检查项,便于判断异常影响面。 |
| 报警中心 | 集中展示报警消息,并管理报警规则、通知渠道、通知策略和消息模板的入口。 |
| 采集配置 | 用于控制资源、监控和日志数据采集范围的配置。采集配置正常后,相关数据才会进入查询、仪表盘和报表能力。 |
进入可观测性页面
在主菜单右上角切换至全局管理后,可通过以下页面使用 ZCF 可观测性能力。不同页面面向不同运维任务:总览用于快速巡检,仪表盘和报表用于细粒度分析,运维页面用于查看平台健康、查询指标和日志、管理采集配置并处理报警。
| 页面 | 用途 |
|---|---|
| 首页 | 查看已接入组件的资源规模、健康状态、容量使用和性能情况,适合日常巡检和环境整体状态确认。 |
| 仪表盘与报表 | 查看全局或组件级仪表盘,创建和维护自定义仪表盘、视图和报表模板,并生成周期性或按需报表。 |
| 运维 |
|
配置数据采集
资源、监控和日志数据是可观测分析的基础。用户在云联邦中接入组件时,可按需勾选资源、监控或日志采集项;接入完成后,可在对应采集页面确认采集状态、补充采集配置或调整采集范围。采集正常后,首页、资产、基础架构、监控查询、日志查询、仪表盘和报表等页面才能展示对应数据。
配置资源采集
配置资源采集前,请确认以下条件:
- 目标组件已通过中的接入平台列表或区域接入 ZCF,并完成连接验证。接入时已勾选资源采集项,或后续已在平台配置中启用资源采集。
- 当前账号具备云联邦和资源采集相关操作权限。
资源采集用于维护接入组件的资源同步范围,并查看资源同步状态。资源采集正常后,资产、基础架构、仪表盘和报表页面才能展示对应资源数据。
配置监控采集
配置监控采集前,请确认以下条件:
- 目标组件已通过中的接入平台列表或区域接入 ZCF,并完成连接验证。接入时已勾选监控采集项,或后续已在监控采集管理页面新增采集。
- 目标组件支持监控采集,且当前账号具备云联邦和监控采集相关操作权限。
监控采集管理用于查看和维护接入组件的指标采集状态。监控采集正常后,监控摘要、监控查询、仪表盘和报表页面才能展示对应指标数据。
配置日志采集
配置日志采集前,请确认以下条件:
- 目标组件已通过中的接入平台列表或区域接入 ZCF,并完成连接验证。接入时已勾选日志采集项,或后续已在日志采集管理页面新增采集。
- 目标组件支持日志采集,且当前账号具备云联邦和日志采集相关操作权限。
- 如目标组件侧需要先开启审计或日志输出,请先按对应组件要求完成配置。
日志采集管理用于查看和维护接入组件的日志采集状态及采集目标。日志采集正常后,日志摘要、日志查询和实时流诊断页面才能展示对应日志数据。
掌握运行总览
用户可通过首页、仪表盘、资产和基础架构页面查看 ZCF 管理范围内的资源规模、健康状态、容量使用、性能趋势和资源分布。该链路适合日常巡检、环境总览和资源状态确认。
查看全局总览
首页用于查看 ZCF 全局运行概况,适合日常巡检、部署后确认、容量评估和异常初筛。用户可在一个页面中了解已接入组件的资源规模、健康状态、容量使用和性能情况。
| 区域 | 说明 |
|---|---|
| 全局核心态势 | 汇总展示资源总览、健康总览和容量使用率,帮助用户快速了解当前环境整体状态。 |
| 云平台 · 虚拟化与基础资源 | 展示 ZStack Cloud、ZSphere 虚拟化平台等相关资源规模和分布情况,例如云主机、物理机、网络和容量类资源。 |
| 网络服务 | 接入 ZNS 后,展示网络服务资源状态,帮助用户从首页了解网络资源概况。 |
| 容器 · 编排 | 展示 Kubernetes 集群、节点、工作负载和容器组等容器资源状态,用于了解容器环境运行情况。 |
| 存储 · 分布式 | 展示存储服务器、硬盘等存储资源的状态和健康情况,用于了解存储资源可用性。 |
| 性能洞察 · 资源消耗排行 | 展示资源性能相关排行,帮助用户快速定位需要关注的资源对象。 |
- 登录 ZCF。
- 在主菜单右上角切换至全局管理。
- 在主菜单中单击首页。
- 查看全局核心态势、资源规模、健康状态、容量使用和性能排行等信息。
查看平台健康
平台健康用于查看 ZCF 平台关键服务、健康域、组件明细和外部依赖等运行状态,适合日常巡检、升级前检查和故障定位。健康域用于按监控采集、报警评估、通知链路、容量风险等检查范围汇总健康结果。
查看仪表盘
仪表盘用于从全局或组件维度查看资源健康、容量、性能和资产状态,适合在日常巡检、容量评估和问题分析时使用。用户可查看预置仪表盘,也可打开已有自定义仪表盘,按常用观察视角开展分析。接入 ZSphere 并启用采集后,用户可通过虚拟化仪表盘查看虚拟化资源的可用性、容量、性能和资产清单等数据。
| 仪表盘 | 适用场景 |
|---|---|
| 运维总览 | 查看已接入组件的整体运行态势,适合日常巡检和跨组件状态确认。 |
| 云平台仪表盘 | 查看云平台资源的概览、可用性、容量、性能和资产清单,适合分析计算、网络和虚拟化资源状态。 |
| 虚拟化仪表盘 | 查看虚拟化平台资源的可用性、容量、性能和资产清单,适合分析 ZSphere 等虚拟化资源状态。 |
| 容器仪表盘 | 查看容器资源的概览、可用性、容量、性能、控制面和资产清单,适合分析 Kubernetes 相关资源状态。 |
| 存储仪表盘 | 查看存储资源的概览、可用性、容量、性能和资产清单,适合分析存储容量、健康和性能状态。 |
| 自定义仪表盘 | 查看用户自定义组合的视图,适合按业务、资源类型或团队职责沉淀常用观察视角。 |
- 在主菜单右上角切换至全局管理。
- 进入。
- 按需选择运维总览,或在专项仪表盘中选择云平台仪表盘、虚拟化仪表盘、容器仪表盘、存储仪表盘,也可打开自定义仪表盘。
- 查看对应仪表盘中的概览、可用性、容量、性能和资产清单等信息。
- 如发现容量、性能或可用性异常,可进入监控查询、日志查询、资产详情或报警中心继续确认。
查看资产
资产用于跨组件查看和搜索资源,适合资源盘点、异常对象定位和从首页、仪表盘或报警消息下钻分析。用户可按资源类型定位具体对象,再查看资源详情和关联指标。
| 查看项 | 说明 |
|---|---|
| 资源类型 | 按物理机、云主机、容器组等类型查看资源列表。 |
| 资源检索 | 按字段和值搜索资源,用于快速定位目标对象。 |
| 列表与关系 | 按页面支持的分组方式查看资源列表,并在资源详情中查看关联指标或资源关系。 |
| 资源详情 | 查看资源明细、运行状态和关联监控信息。 |
- 在主菜单右上角切换至全局管理。
- 进入。
- 选择需要查看的资源类型。
- 按字段和值搜索资源,或按页面支持的分组方式查看资源列表。
- 打开资源详情,查看资源明细、关联监控信息或页面提供的资源关系。
查看基础架构
基础架构用于从全局、云联邦、云平台、虚拟化平台、存储、容器和 ZNS 网络中心等视角查看基础资源结构和容量分布,适合资源盘点、容量评估和部署后确认。用户可通过该页面了解已接入组件的资源组成、容量使用和资源分布情况。
| 查看项 | 说明 |
|---|---|
| 资源组成 | 查看总资产数以及云平台、虚拟化平台、存储、容器和网络服务等资源数量。 |
| 容量分布 | 查看不同接入组件的 CPU、内存、存储等容量使用情况。 |
| 网络服务资源 | 查看 ZNS 网络中心相关资源的规模和分布情况,用于辅助确认网络服务接入和资源采集结果。 |
- 在主菜单右上角切换至全局管理。
- 进入。
- 在概览、云联邦、云平台、虚拟化平台、存储、容器 (K8s)、ZNS 网络中心等页签间切换。
- 查看资源数量、容量分布、资源状态或网络服务资源概要。
构建分析视角与报表
用户可通过自定义仪表盘、内置视图或自定义视图沉淀常用分析维度,并将视图组织为报表模板,按需或周期生成运维报表。该链路适合周期巡检、容量分析、性能回顾和资产清单输出。
查看和维护视图
视图用于保存可复用的图表视图,沉淀常用资源或监控分析维度。用户可按云平台、虚拟化、容器、存储等分类查看内置视图,也可维护已有自定义视图,用于后续巡检、报表输出或问题分析。
创建自定义视图
当内置视图不能满足特定资源或指标分析需求时,可创建自定义视图。自定义视图创建后,可在视图列表中复用,也可作为报表模板的内容来源。
从监控查询保存视图
对需要反复查看的监控查询,可将查询条件和展示方式保存为视图。保存后的视图可在视图列表中复用,也可加入报表模板。
创建自定义仪表盘
自定义仪表盘用于把常用视图组合到同一页面,形成面向业务、资源类型或团队职责的观察视角。用户可从视图库添加视图,调整布局后保存为可重复使用的仪表盘。
创建报表模板
报表模板用于组合多个视图,形成可按需或周期生成的运维报告。用户可基于已有视图创建报表模板,用于容量分析、性能回顾、资产清单或可用性检查等场景。
查看和维护报表模板
报表模板用于定义报告内容和生成方式。用户可查看内置的容量、性能、资产清单和可用性模板,也可基于已有模板克隆出新的报表模板。
生成和下载报表
报表可基于报表模板按需立即生成,也可按计划周期生成。用户可在生成记录页签查看生成历史,并下载已生成的报表文件。
排查监控与日志问题
用户可先通过监控摘要和日志摘要了解数据规模、来源分布和趋势,再进入监控查询或日志查询页面按指标、字段、级别和时间范围定位问题。该链路适合性能波动分析、异常日志排查和实时日志诊断。
查看监控摘要
查看监控摘要前,请确认目标组件已接入 ZCF,并已启用监控采集。
监控摘要用于查看监控数据是否正常进入 ZCF。用户可先通过该页面确认指标接入规模和来源分布,再决定是否进入监控查询进一步分析。
| 查看项 | 说明 |
|---|---|
| 采集概况 | 查看接入数量、在线状态、指标数量和监控数据总量,确认监控链路是否有数据流入。 |
| 来源分布 | 查看不同组件的指标数量和数据占比,判断数据规模是否符合预期。 |
| 接入组件 | 查看已接入监控的组件列表及数据规模,用于定位缺少监控数据的组件。 |
- 在主菜单右上角切换至全局管理。
- 进入。
- 查看采集概况,确认监控数据是否持续进入 ZCF。
- 查看来源分布和接入组件列表,判断各组件的数据规模是否符合预期。
查询监控指标
查询前,请确认目标组件已接入 ZCF,并已启用监控采集。可查询的平台、资源和指标范围取决于组件接入状态、监控采集状态和当前用户权限。
监控查询用于按平台、资源和指标条件查询监控趋势,适合在发现性能波动、容量压力或资源异常后进一步定位影响对象。常用查询可保存为视图,便于后续复用分析。
查看日志摘要
查看日志摘要前,请确认目标组件已接入 ZCF,并已启用日志采集。
日志摘要用于查看日志采集和写入的总体情况。用户可通过日志容量、事件数量、来源排行、日志趋势和级别分布,快速判断日志是否持续进入 ZCF,以及哪些来源更需要关注。
| 查看项 | 说明 |
|---|---|
| 时间范围 | 切换统计时间范围,观察日志容量、事件数量和来源排行是否随时间变化。 |
| 日志概况 | 查看日志容量、日志事件数、摄入速率和活跃源数量,确认日志采集是否正常。 |
| 来源排行 | 查看日志量较高的组件或数据源,定位日志突增或采集规模异常的来源。 |
| 级别分布 | 查看 ERROR、WARN、INFO 等日志级别占比,识别错误或告警日志较集中的范围。 |
- 在主菜单右上角切换至全局管理。
- 进入。
- 选择时间范围,查看日志概况和日志量趋势。
- 查看来源排行和级别分布,判断是否存在日志量突增、采集中断或错误日志集中的情况。
查询日志
查询日志前,请确认目标组件已接入 ZCF,并已启用日志采集。可查询的来源和字段范围取决于日志采集状态、日志解析结果和当前用户权限。
日志查询用于检索和分析历史日志。用户可按时间、来源、级别、关键字或结构化字段缩小范围,定位异常时间段、日志来源和关键日志内容。
使用实时流诊断日志
使用实时流前,请确认目标组件已接入 ZCF,日志采集处于正常状态,且当前时间有日志持续产生。
实时流用于查看持续写入的最新日志,适合在复现问题、执行运维操作或验证采集状态时观察即时输出。与日志查询相比,实时流更适合看“正在发生”的日志变化。
管理报警与通知
报警与通知用于将可观测性中的指标异常、事件风险和资源问题转化为可跟踪、可通知、可处理的报警流程。用户可先确认数据来源和采集状态,再通过报警规则定义风险识别条件,通过消息模板、通知渠道和通知策略将重要报警发送给对应团队,并在报警消息中查看和处理风险。
配置流程
- 确认目标组件已接入,并已启用资源、监控、日志或事件报警接入等数据来源。
- 创建报警规则,定义指标类风险的触发规则、报警级别和报警范围。
- 创建消息模板,定义外部通知的内容格式。
- 创建通知渠道,配置钉钉、企业微信、邮件、Webhook 或短信等发送目标。
- 创建通知策略,匹配需要外部通知的报警并绑定通知渠道。
- 查看和处理报警消息,确认报警状态、通知投递结果和后续处置。
核心概念
| 概念 | 说明 |
|---|---|
| 报警消息 | 由报警规则或事件接入产生的风险记录,用于查看问题状态、影响对象、发生时间和处理进度。 |
| 报警规则 | 定义报警触发规则、报警级别和报警范围,系统根据规则判断是否产生报警消息。 |
| 通知渠道 | 外部通知的发送目标,例如钉钉、企业微信、邮件、Webhook 或短信。 |
| 通知策略 | 按级别、来源、资源类型等条件匹配报警,并决定是否发送到外部通知渠道。 |
| 消息模板 | 定义外部通知的内容和格式,由通知渠道引用。 |
| 事件报警集成 | 接入已连接组件上报的事件类报警,使组件侧事件进入 ZCF 统一查看和通知。 |
启用事件报警集成
启用事件报警集成前,请确认目标组件已通过云联邦接入 ZCF、连接正常,且当前管理员具备云联邦和报警中心相关权限。
通过云联邦接入平台或组件后,可在事件报警集成页面开启事件报警集成。开启后,组件上报的事件报警会进入 ZCF 报警中心。用户可在报警消息中查看这些报警,并通过通知策略将重要报警发送到外部渠道。
创建报警规则
创建报警规则前,请确认目标组件已接入 ZCF,且相关资源和指标数据已正常采集。
报警规则用于定义指标类风险的触发规则。用户可按平台类型、资源类型和报警条目设置触发规则、报警级别和报警范围,让系统在容量接近上限、性能异常或关键资源状态异常时生成报警消息。
创建消息模板
如需创建自定义消息模板,请先确认通知渠道的接收端格式要求,例如群机器人使用 Markdown,邮件使用 HTML 或纯文本,Webhook 使用 JSON。
消息模板用于定义外部报警通知的内容格式。系统模板可满足常见通知场景;仅当不同通知渠道、团队或业务需要不同通知内容、格式或字段时,才需要创建自定义模板。
创建通知渠道
ZCF 当前支持钉钉、企业微信、邮件、Webhook 和短信通知渠道。创建通知渠道前,请根据计划使用的渠道完成以下准备:
- 确认 ZCF 可访问目标通知系统或接收端地址。
- 如果使用钉钉或企业微信,请在目标群中创建机器人,获取 Webhook 地址,并按机器人安全要求准备关键词、加签密钥或 IP 白名单等信息。
- 如果使用邮件,请先完成邮件服务器配置并测试通过,准备收件人、抄送人或密送人邮箱地址。
- 如果使用 Webhook,请准备接收端 URL、请求方法和鉴权请求头。
- 如果使用短信,请先按短信服务商准备认证信息、短信签名、模板或接口地址,并确认短信额度满足通知要求。
- 如需使用自定义通知内容,请先创建消息模板;也可使用系统预置模板。
通知渠道用于配置报警的外部发送目标。默认情况下,报警会进入;如需发送到钉钉、企业微信、邮件、Webhook 或短信,请先创建通知渠道,再通过通知策略引用该渠道。
创建通知策略
创建通知策略前,请确认以下条件:
- 已创建并测试通过至少一个通知渠道。
- 已明确需要发送外部通知的报警范围,例如报警级别、资源类型、来源组件、报警名称或事件域。
通知策略用于定义哪些报警需要发送到外部渠道,以及通知如何收敛。用户可按报警属性筛选消息,绑定一个或多个通知渠道,并设置恢复通知、分组和重复提醒策略,减少无关或重复通知。
查看和处理报警消息
报警消息用于集中查看资源报警和事件报警。用户可筛选当前风险、确认处理状态、查看通知投递结果,并进入相关资源、监控或日志页面继续排查。若报警命中通知策略,且通知策略引用了通知渠道,ZCF 会将报警发送到对应外部渠道;用户可结合报警详情中的投递结果,到第三方渠道确认通知是否送达。
管理报警规则
管理报警规则前,请确认已存在需要维护的报警规则。
报警规则用于集中查看和维护系统内置规则及自定义规则。用户可根据运维需要启用、禁用、编辑、克隆、导入、导出或删除规则,持续优化风险识别范围。
