概述
高可用策略(HA Policy):云平台内计算、存储、网络资源发生故障或云主机异常停机时,确保相关业务持续稳定运行的机制。启用后,支持自定义云主机高可用策略,确保业务连续性。
相关定义
- 云主机高可用模式:用于设置云主机异常关机时是否自动重启,支持None和NeverStop两种模式:
- None:云主机关机时均不会自动重启。
- NeverStop:
- 云主机由于自身异常关机时会自动重启。
- 若由于相关计算、存储、网络等资源发生故障,云主机将根据自定义的故障迁移策略按需迁移至其他物理机HA启动。
- 手动关机或定时任务触发的计划性关机后,云主机不会自动重启,包括:
- 通过UI界面手动执行停止云主机、强制停止云主机、关闭云主机电源等操作;
- 进入云主机操作系统,手动执行
shutdown、poweroff、halt等命令; - 创建关闭云主机定时任务,触发计划性关机。
- 云主机高可用故障迁移策略:用于设置云主机相关计算、存储、网络等资源发生故障时是否迁移云主机至其他物理机启动。故障迁移策略支持检测以下资源状态:
- 管理网络连接状态:
- 检测云主机所在物理机与管理节点之间的网络连接状态。
- 若管理节点自身故障、或管理网络中断,均会导致管理网络连接状态故障。
- 存储网络连接状态 :
- 检测云主机访问其系统盘所在主存储资源的网络连接状态。
- 若云主机系统盘所在主存储自身故障、或存储网络中断,均会导致云主机存储网络连接状态故障。
- 业务网卡状态 :
- 若业务云主机二层网络关联的物理机业务网卡/业务网卡直连的交换机网口发生故障,均会导致云主机业务网卡故障。
- 业务网络组:支持将承担相同业务的冗余网络加入业务网络组并设置最小存活网络数,组内可用网络数小于该值时,才会判断为云主机业务网卡故障。Note:
- 如云主机使用业务网络组内的网络,加载的网络数(同一组内)应不小于该业务网络组的最小存活网络数,避免被误判为业务网络异常而触发非预期的高可用。
- 仅公有网络、扁平网络支持加入业务网络组。
- 仅开启业务网卡状态异常迁移时,支持设置业务网络组。
基于资源状态检测,ZStack Cloud可判断4种故障场景,并支持用户自定设置不同的故障场景下是否触发云主机高可用迁移:故障场景 管理网络连接状态 存储网络连接状态 业务网卡状态 故障时是否迁移云主机 场景一:业务网卡状态异常 正常 正常 故障 开启/关闭 场景二:存储网络连接异常 正常 故障 正常 开启/关闭 场景三:存储网络连接异常、业务网卡异常 正常 故障 故障 如场景一、场景二均为关闭,此处固定为关闭;如场景一、场景二任一为开启,此处默认固定为开启 场景四:管理网络连接异常 故障 正常 正常 关闭,不支持开启 Note: 故障时是否迁移云主机的策略仅对高可用模式为NeverStop的云主机生效。 - 管理网络连接状态:
功能原理
功能优势
- 全面&强大:覆盖所有主流高可用场景,包括各类故障场景以及意外停机场景。通过高可用机制确保用户关键业务稳定性和连续性。
- 灵活&可视化:提供直观简单的真值表,支持一键配置故障迁移策略,组合全局粒度和云主机粒度高可用模式配置,可极大提高业务高可用配置的灵活度。
应用场景
以下介绍高可用策略的应用场景。
- 物理机业务网卡故障场景:希望物理机业务网卡故障时,所有关联的云主机迁移至其他物理机,保障业务高可用。
- 例如:用户部署业务云主机承载MySQL数据库服务,要求云主机不允许出现业务长时间宕机的情况。可将这台云主机高可用模式设置为NeverStop,且设置业务网卡状态故障时触发迁移。在确保云平台内物理机资源充足情况下,当业务云主机所在物理机业务网卡故障时,云主机将迁至其他物理机上启动运行,不影响业务运行。
- 云主机异常停机场景:希望云主机异常停机时能自动HA启动。
- 例如:用户部署业务云主机运行公司重要业务,为避免诸如物理机掉电、云主机过载等各类因素导致云主机停机、业务无法自动恢复,可将这些云主机高可用模式设置为NeverStop。当云主机停机时触发高可用机制立刻重新启动,保障业务连续性。
准备工作
- 安装或升级最新版本的ZStack Cloud。
- 进入界面,启用云主机高可用策略。
- 启用云主机高可用策略后,确保高级设置创建云主机高可用模式默认值的值设置为NeverStop。
注意事项
- 管理网络状态故障时,不支持设置故障迁移策略。
- 存储网络连接状态仅支持检测共享存储,暂不支持本地存储。
- SharedBlock共享存储环境下,无论故障迁移策略是否设置为迁移,存储网络连接状态故障时云主机均会自动迁移。
- 若业务云主机二层网络为VXLAN类型或二层网络使用SR-IOV/智能网卡网络加速模式,关联的物理机业务网卡或其直连的交换机网口状态故障时,暂不支持高可用迁移。
- 存储连接状态与业务网卡状态同时故障时,对应迁移策略跟随任一状态故障时的迁移策略开启或关闭:
- 若存储连接状态和业务网卡状态故障场景的迁移策略均为不迁移,则为不迁移。
- 若存储连接状态或业务网卡状态其中一个故障场景的迁移策略为迁移,则为迁移。
- NeverStop模式仅在云主机因自身原因或所依赖的计算、存储、网络发生故障而意外关机时会触发自动重启;手动关机、因定时任务触发的计划性关机时,NeverStop模式不会触发云主机自动重启。
典型应用场景
云主机所在物理机业务网卡故障
场景假定:用户在物理机Host A上部署4台业务云主机承载MySQL数据库服务,要求物理机Host A业务网卡故障时,所有4台云主机迁移至其他物理机,以保障业务高可用。此场景下,可将这些云主机高可用模式均设置为NeverStop,且设置业务网卡状态故障时触发迁移,并确保云平台内物理机资源充足。
云主机高可用策略配置
云主机所在物理机与存储网失联
场景假定:用户在物理机Host A上部署了3台云主机用于运行重要业务,并使用Ceph主存储存储云主机数据。要求物理机Host A与Ceph存储网失联时,所有3台云主机迁移至其他物理机,以保障业务高可用。此场景下,可将这些云主机高可用模式均设置为NeverStop,且设置存储网络连接状态故障时触发迁移,并确保云平台内物理机资源充足。
云主机高可用策略配置
云主机高可用故障迁移
云主机高可用策略配置完成后,物理机Host A与Ceph存储网断开。此时,该物理机上的3台云主机立刻自动迁移至物理机Host B上启动。
云主机异常停机
场景假定:用户部署4台云主机运行公司重要业务,其中2台云主机部署在SharedBlock存储上,2台部署在本地存储上。要求任意一台云主机异常停机(例如,物理机掉电、云主机过载等各类因素导致云主机停机)后能自动重启,以保障业务连续性。
云主机高可用策略配置
- 确保4台云主机高可用模式为NeverStop。如图 10所示
图 10. 云主机高可用模式 
SharedBlock存储上云主机高可用启动
云主机VM-SharedBlock-1和VM-SharedBlock-2部署在物理机Host-B上,云主机数据存储在SharedBlock主存储中。物理机Host-B掉电后,这两台云主机在物理机Host-A上高可用启动。
本地存储上云主机异常停机后自动重启
云主机VM-LocalStorage-1和VM-LocalStorage-2分别部署在不同物理机上,云主机数据存储在本地存储上。两台云主机异常停机时,自动触发高可用启动。











