文档目录

硬件设施

区域

区域(Zone):云平台内最大的一个资源定义,包括:集群、二层网络、主存储等资源。

功能原理

  • 在数据中心中,区域一般对应了一个机房。
  • 区域定义了一个可见的边界,同一区域内的子资源互相可见并且可以形成某种关系,但不同区域内的子资源是不可见的,不能互相发生关系。

功能特点

  • 区域隔离:

    支持区域物理隔离,不同区域的主存储、物理机等物理子资源不互通,确保最大程度的稳定性和容错性。

    可减少网络时延,提高访问速度。

  • 资源管控:

    每个区域可设置平台管理员。一个平台管理员可管理一个或多个区域。

    每个项目的资源只能属于一个区域。

  • 全局查看:

    规划区域后,可在单独大屏查看某区域内所有的资源。支持按照KVM/vCenter分类进行查看资源使用情况。

区域支持以下操作:
操作 描述
创建区域 创建一个新的区域。
编辑区域 编辑区域的名称、简介信息。
启用区域 启用处于停用状态的区域。
Note:
  • 启用区域:启用区域会导致此区域下的所有集群及集群内所有物理主机均会被启用。
停用区域 停用选中的区域。
Note:
  • 停用区域,将同时停用该区域内所有子资源。
  • 停用区域会停用二层网络上加载的集群,导致二层网络和三层网络不可用,也不能用于创建云主机,但已有业务不受影响。
  • 区域停用后,用户可手动重新启用区域内的某些集群,也可创建新的集群到当前的区域中,而无需重新启用整个区域。
删除区域 删除选中的区域。
Note: 删除区域会删除集群、物理机、网络、主存储、已接管的vCenter等资源,同时还会删除各资源下的所有子级资源(如VPC路由器),请谨慎操作。

注意事项

规划区域时,需注意:
  1. 同一个物理二层广播域中的物理机应该在同一个区域,可属于同一个集群或分属于多个集群。
  2. 同一个物理二层广播域不应该跨越多个区域,而应该映射为单个区域的二层网络。
  3. 同一个主存储不应该跨越多个区域,而应该映射为单个区域的主存储。
  4. 一个数据中心可以有多个区域。
  5. 一个区域可以加载一个或多个镜像服务器。
    • 一个区域中的资源, 例如主存储,只能访问加载在同一区域中的镜像服务器。
    • 一个镜像服务器可以从一个区域中删除。删除后,区域中的资源不能再看见该镜像服务器。
    • 当数据中心的网络拓扑改变导致一个镜像服务器不能再被一个区域中的资源访问时,可以将镜像服务器从区域中卸载。
    • UI界面为便于管理镜像服务器和区域的关系,特别设置了一个镜像服务器在同一时间内只能加载到一个区域不能再加载到其它区域。UI界面上,添加镜像服务器,默认会加载到当前区域。删除区域的同时会直接删除加载此区域的镜像服务器。

集群

集群:一组物理机(计算节点)的逻辑集合。在数据中心中,一个集群一般对应了一个机架。

集群的目的:
  • 用于提高整体系统的计算能力、IO能力。
  • 提高服务的可靠性。
  • 提升系统的规模扩展能力,降低系统的运维成本。
规划集群时,需注意:
  • 集群内所有物理机须拥有相同的操作系统。
  • 集群内所有物理机须拥有相同的网络配置。
  • 集群内所有物理机须能够访问相同的主存储。
  • 集群需加载主存储、二层网络后,才可提供云主机服务。
  • 集群的规模,也就是每个集群中可以包含物理机的最大数量,没有限制。

以下对集群与各个资源之间的关系进行说明。

集群 | 区域

支持多集群操作。可在一个区域内创建多个集群,新增的物理机可以按需添加到不同的集群之中。

集群 | 主存储和二层网络

集群中可以加载或卸载主存储和二层网络。它们之间的结构关系如图 1所示:
图 1. 集群、主存储、二层网络的关系


Note:
主存储和二层网络加载到集群时需注意:
  1. 集群 | 主存储
    • 一个主存储可以加载到多个集群。
    • 一个集群可以加载多个主存储。
      目前支持的同类型主存储场景如下:
      • 一个集群可以加载一个或多个本地主存储。
      • 一个集群可以加载一个或多个NFS主存储。
      • 一个集群可以加载一个或多个Shared Block主存储。
      • 一个集群可以加载一个Shared Mount Point主存储。
      • 一个集群只能加载一个Ceph主存储。
      • 一个集群只能加载一个AliyunNAS主存储,除此之外不能再加载新的存储。
      • 一个集群只能加载一个AliyunEBS主存储,除此之外不能再加载新的存储。
      目前支持的组合类型主存储场景如下:
      • 一个集群可以加载一个本地主存储和一个NFS主存储。
      • 一个集群可以加载一个本地主存储和一个Shared Mount Point主存储。
      • 一个集群可以加载一个本地主存储和一个Shared Block主存储。
      • 一个集群可以加载一个Ceph主存储和最多三个本地存储。
      • 一个集群可以加载一个Ceph主存储和一个Shared Block主存储。
      • 一个集群可以加载一个Ceph主存储和多个Shared Block主存储。
      主存储与集群的依赖关系如表 1所示:
      主存储 集群
      Local Storage 支持加载一个或多个本地存储
      NFS 支持加载一个或多个NFS
      Shared Block 支持加载一个或多个Shared Block
      Shared Mount Point 支持加载一个Shared Mount Point
      Ceph 是加载到集群的Ceph,有且仅有一个
      AliyunNAS 是加载到集群的AliyunNAS,有且仅有一个
      AliyunEBS 是加载到集群的AliyunEBS,有且仅有一个
      Local Storage + NFS 支持加载1个Local Storage + 1个NFS
      Local Storage + SMP 支持加载1个Local Storage + 1个Shared Mount Point
      Local Storage + Shared Block 支持加载1个Local Storage + 1个Shared Block
      Ceph + LocalStorage 支持加载1个Ceph + 最多3个LocalStorage
      Ceph + Shared Block
      • 支持加载1个Ceph + 1个Shared Block
      • 支持加载1个Ceph + 多个Shared Block
    • 集群加载多个本地存储时,务必在添加物理机以及添加主存储之前,提前在物理机对应URL上做好分区,确保每个本地存储部署在独占的逻辑卷或物理磁盘上。
    • 主存储可以被所在集群中的所有物理机访问。
    • 如果数据中心的网络拓扑发生改变导致主存储不能被集群中的物理机继续访问,主存储可以从集群卸载。
  2. 集群 | 二层网络
    • 一个集群可以加载一个或多个二层网络;一个二层网络可以加载到多个集群。
    • 集群可以加载VXLAN Pool,VXLAN Pool下不同的VNI可用于创建不同的VxlanNetwork。
    • 一个网卡只能创建一个NoVlanNetwork。
    • 对于VlanNetwork,不同VLAN ID代表不同的二层网络。
    • 如果数据中心的网络拓扑发生改变导致集群中的物理机不再在二层网络所代表的物理二层广播域中,二层网络也可以从集群卸载。

集群 | 镜像服务器

集群与镜像服务器没有直接依赖关系,一个镜像服务器可以为多个集群提供服务。

集群中所加载的主存储和镜像服务器具有相关性,如表 2所示:
PS\BS ImageStore Ceph
Local Storage ×
NFS ×
Shared Mount Point ×
Ceph
Shared Block ×
  • 当主存储为LocalStorage、NFS、Shared Mount Point类型时,镜像服务器的默认类型为ImageStore。
  • 当主存储为NFS或Shared Mount Point类型时,可将相应共享目录手动加载到相应镜像服务器的本地目录上,从而使主存储和镜像服务器均能使用网络共享存储方式。
  • 当主存储为Ceph类型时,镜像服务器可以使用同一个Ceph集群作为镜像服务器,也可以使用ImageStore类型的镜像服务器。
  • 当主存储为Shared Block类型时,镜像服务器的默认类型为ImageStore。
  • 当主存储为AliyunNAS类型时,镜像服务器的默认ImageStore。
  • 当主存储为AliyunEBS类型时,镜像服务器的默认类型为AliyunEBS。

集群 | 物理机

  • 停用集群后,会停用此集群下所有的物理主机,停用后,此集群就不能作为候选用于申请新资源,原本运行的云主机不受影响,但这些运行的云主机停止后就不能再次在此集群启动。
  • 启用集群后,会同时启用此集群下所有的物理主机。

集群 | 全局设置

  • 集群详情页的高级设置项,可以在集群粒度设置内存超分率、CPU超分率、物理机保留内存等。此设置只对该集群内的资源生效,如不设置则默认使用全局设置的值。
    Note: 高级设置的数值需要根据不同系统和应用的需求进行配置,数值过大可能会严重影响性能,请谨慎操作。

集群 | 动态资源调度

动态资源调度(Distributed Resource Scheduler,简称DRS):以集群为单位监控物理机CPU或内存负载情况,根据配置的调度策略,动态调整物理机上运行的云主机业务。

云平台支持手动和自动两种调度策略:手动调度策略提供调度建议,用户可按照调度建议手动迁移云主机。自动调度策略,由系统根据调度算法自动执行资源调度。两种调度策略均可平衡集群负载,且有效提高云平台稳定性。

请确保以下条件全部满足,动态资源调度功能才能正常工作:
  • 确保集群内仅存在Ceph、Shared Block类型的主存储;
  • 确保集群内所有物理机CPU型号一致;
  • 确保集群内不存在已经绑定亲和组的云主机。
当以上条件全部满足,进入集群详情页的高级设置子页面,将动态资源调度开关开启,随后即可前往动态资源调度页面配置调度策略,配置策略完成后动态资源调度功能生效。

集群支持操作

集群支持以下操作:
操作 描述
创建集群 在当前区域内创建一个新的集群。
编辑集群 修改集群的名称与简介。
启用集群 将处于停用状态的集群启用。
停用集群 将处于启用状态的集群停用。
Note:
  • 停用集群,将同时停用该集群内所有物理机。
  • 集群停用后,用户可手动重新启用集群内的某些物理机,也可添加新的物理机到当前的集群中,而无需重新启用整个集群。
加载二层网络 将二层网络加载到集群。
卸载二层网络 将二层网络从集群卸载。
Note: 卸载二层网络后,相应的云主机网卡将被卸载,请谨慎操作。
加载主存储 将主存储加载到集群。
卸载主存储 将主存储从集群卸载。
Note: 将主存储从集群卸载,需要注意以下情况:
  • 此操作将导致该主存储上,与所选集群相关的云主机关机,影响业务运行,请谨慎操作。
  • 此操作将导致该主存储上,与所选集群相关的VPC路由器被删除,相关云主机的网络服务异常,请谨慎操作。
  • 此操作将导致该主存储上,与所选集群相关的云盘将不能正常使用,请谨慎操作。
删除集群 删除选中的集群。
Note:
  • 删除集群,将同时删除该集群内所有物理机。
  • 若主存储为本地存储(Local Storage),将同时删除物理机上的全部云主机、云盘和快照,请谨慎操作。

物理机

物理机:为云主机实例提供计算、网络、存储等资源的物理主机。该硬件设施是云平台的核心资产,云主机运行在物理机之上。

图 2所示:
图 2. 物理机


添加物理机注意事项

添加物理机需注意:
  • 管理节点的管理IP需正常访问物理机的SSH端口以部署代理程序。
  • 物理机的用户名须拥有sudo权限。
  • SSH端口需开启防火墙或iptables允许。
  • 需支持Intel VMX|AMD SVM的硬件虚拟化特性。
  • 添加或更改物理机的信息,需与实际环境相匹配 。
  • 物理机有一个字段managementIp,用于表示如果此物理机有多个IP的情况下,添加的IP地址用于管理节点对此物理机进行连接部署代理程序的IP。
  • 管理节点会周期性的向物理机发送ping命令以检查通道的健康状态; 一旦某个物理机响应失败,或者ping命令超时,此物理机就会变为失联状态,失联后物理机上运行的云主机会变成unknown状态,待物理机恢复连接后,会再次同步其上云主机的状态。
  • 管理节点会提供ntpdate时间服务器对各物理机进行时间同步。
物理机支持以下操作:
操作 描述 物理机状态
添加物理机 添加一个或多个物理机。 /
编辑物理机 编辑物理机名称、简介信息。 /
启用物理机 将处于停用状态的物理机启用。 停用
停用物理机 将处于启用状态的物理机停用。
Note: 物理机停用后,该物理机上原有资源不受影响,但申请新资源时不可作为候选物理机。
启用
重连物理机 重新连接物理机。
Note: 重连物理机操作一般用于物理机配置更新后。例如:物理机内存或者硬盘更新后,可通过重连物理机来更新数据库。
ALL
进入维护模式 物理机进入系统维护状态,可对此状态下的物理机进行物理停机、故障修复等操作。
  • 若主存储为本地存储:物理机进入维护模式后,其上云主机会停止。
  • 若主存储为共享存储:物理机进入维护模式后,其上云主机会自动迁移。
Note: 共享存储场景下,物理机进入维护模式,用户可自行设置迁移云主机失败策略。设置方法:
进入设置 > 平台设置 > 全局设置 > 高级设置 > 物理机,设置维护模式下迁移云主机失败策略
  • 若选择强制停止云主机:物理机进入维护模式,共享存储上的云主机会自动迁移到其它物理机上。未迁移的云主机将会被强制关闭。
  • 若选择非强制停止云主机:物理机进入维护模式,共享存储上的云主机会自动迁移到其它物理机上。如果物理机上还存在运行中的云主机,则进入维护模式失败。
已连接
添加聚合口 对物理机上的物理网口进行聚合操作,实现网口高可用或业务负载均衡,支持主备、链路聚合两种聚合模式。
  • 主备模式支持聚合1-2个物理网口,建议聚合2个网口,一个网口作为主网口,其余网口作为备网口,主网口默认处理全部网络流量,主网口故障时,由备网口处理全部网络流量。
  • 链路聚合模式支持聚合1-8个物理网口,建议聚合至少2个网口,网络流量平均发送至各网口处理,实现负载均衡。链路聚合模式下,网络流量出口通过哈希运算决定,支持如下哈希策略:
    • layer2+3:根据源MAC地址、目的MAC地址和IP地址进行哈希运算,决定数据包的发送网口。
    • layer3+4:根据IP地址和端口进行哈希运算,决定数据包的发送网口。支持TCP/IP协议栈。
    • layer2:根据源MAC地址和目的MAC地址进行哈希运算,决定数据包的发送网口。
ALL
开机 将物理机开机。 关机
关机 将物理机关机。
Note:
  • 关闭物理机可能会导致其上运行的云主机、VPC路由器、负载均衡实例等资源关机。为确保业务连续性和安全性,建议提前将物理机置入维护模式。
  • 若物理机同时被用作Ceph主存储的Mon节点,关闭物理机会同时关闭Ceph主存储Mon节点服务,影响存储集群稳定性,从而可能造成数据丢失。
  • 若物理机已被指定为迁移服务器,关闭物理机会导致其上正在执行的迁移任务失败。
开机/未知
重启 重新启动物理机。
Note:
  • 重启物理机可能会影响其上云主机、VPC路由器、负载均衡实例等资源的正常运行。为确保业务连续性和安全性,建议提前将物理机置入维护模式。
  • 若物理机同时被用作Ceph主存储的Mon节点,重启物理机会同时重启Ceph主存储Mon节点服务,影响存储集群稳定性,从而可能造成数据丢失。
  • 若物理机已被指定为迁移服务器,重启物理机会导致其上执行的迁移任务失败。
开机/未知
进入Web终端 进入物理机Web终端,对物理机进行操作。 开机/未知
绑定标签 为物理机绑定标签,选中一个或多个物理机。
Note:
  • 单个资源最多支持绑定50个标签,反之,单个标签支持绑定的资源数量无限制。
  • 标签-资源支持多对多绑定关系。
  • 租户创建的标签只能绑定到所属租户的资源,管理员标签可绑定到所有资源。
  • 管理员支持解绑/删除租户标签。
  • 资源标签按照绑定时间或标签名称(符号>数字>中文>英文)进行排序,可在设置 > 全局设置 > 基本设置中修改标签排序方式,默认按标签名称排序。
ALL
解绑标签 解除绑定物理机上的标签。
Note:
  • 管理员标签由管理员创建,归管理员所有,租户标签由租户创建,归租户所有。
  • 租户创建的标签只能绑定到所属租户的资源,管理员标签可绑定到所有资源。
  • 管理员支持解绑/删除租户标签。
  • 项目内的标签归属于项目所有,项目内所有人(项目负责人/项目管理员/项目成员)均可操作。
  • 标签暂不支持更改所有者操作。
  • 资源更改所有者,其上所有租户标签将会解绑,管理员标签不受影响。
  • 云平台无缝升级后,已有旧标签将自动更新,以最新方式展示标签。若有异常,请刷新浏览器或重新创建标签。
  • 支持将单个资源上的批量标签解绑,也支持将单个标签上的批量资源解绑。
  • 租户只能解绑所属租户资源上的标签,管理员可解绑所有资源上的标签。
ALL
更新IPMI信息 修改物理机IPMI用户名和密码。
Note: 仅支持修改电源状态未知的物理机IPMI信息。
未知
更新SSH密码 更新物理机的SSH密码,密码更新后将自动重连物理机。 /
删除物理机 删除物理机。
Note: 删除物理机需要注意以下情况:
  • 删除物理机,将会停止该物理机上所有云主机。
  • 若主存储为本地存储:
    • 若物理机所属集群挂载了本地存储(Local Storage),将同时删除物理机上的全部云主机和云盘。
    • 即使将已删除的物理机重新添加至云平台,系统也将重新部署该物理机,若之前数据库未备份,相关业务数据将无法恢复。
  • 若主存储为共享存储:
    • 若已关闭云主机高可用模式

      删除云主机所在的物理机后,相应的云主机会停止。

    • 若已开启云主机高可用模式

      删除云主机所在的物理机后,如其它物理机资源允许,该物理机上设置高可用的云主机会先停止,然后迁移到其它物理机上自动启动,且不会影响数据安全性;若物理机资源不足,相应的云主机会停止。

    • 删除物理机对共享存储上的数据云盘无影响。
  • 若物理机已被征用为迁移服务器,删除物理机将同时删除相应的迁移服务器,且该迁移服务器上正在执行的迁移任务将自动取消。
/

物理机使用注意事项

使用物理机需注意:
  • 物理机维护模式 ,主要用于管理员对物理机进行计划关机实施维护操作,例如:添加内存/添加硬盘/更换网卡等。
  • 物理机维护模式,若主存储为本地存储,则会停止此物理机上所有云主机,若主存储为共享存储,则会自动迁移其上云主机到可用物理机上,如果其他物理机资源不足,则会停止这些云主机。
  • 物理机添加内存规范操作流程为:
    1. 将物理机进入维护模式。
    2. 等待物理机上所有云主机自动迁移完成或者停机,对物理机进行shutdown关机操作。
    3. 物理机下电,添加内存。
    4. 物理机通电后,通过手动或IPMI启动,成功引导操作系统。
    5. 将物理机设置为启用状态。
  • 物理机停用后,原本运行的云主机依然保持运行状态,如果停止后将不能使用此物理机启动。
  • 物理机停用或维护后,此物理机不能再作为候选用于申请新资源,只有再次启用后,才可正常使用 。
  • 物理机失联或者进入维护模式后,才可删除物理机 。
  • 删除本地存储上的物理机会直接彻底删除此物理机上所有的云主机或云盘 。这里的删除,只是移除物理机、云主机、云盘等信息在ZStack Cloud中的记录,并不删除真实的数据。
  • 删除共享存储上的物理机,不会直接删除其上的云主机或云盘,这些资源可在其他物理机上重新启用或使用。
  • 删除物理机后,即使再次添加回来,系统也将无法识别删除的云主机,需慎重删除 。
  • 如果打算使用GPU透传功能,物理机的BIOS需开启VT-d功能,添加物理机时,需勾选IOMMU选项,以扫描IOMMU设备。IOMMU启用状态为启用, IOMMU就绪状态为可用时,才可使用GPU设备透传功能。

物理机运维异常检查事项

物理机运维出现异常需检查:
  • 管理节点日志

    在管理节点检查/usr/local/zstack/apache-tomcat/logs/management-server.log是否存在异常。

  • 物理机agent进程

    在物理机检查ps -ef|grep kvmagent,检查kvmagnet代理进程是否存在异常。

  • 物理机日志

    在物理机检查/var/log/zstack/zstack-kvmagent.log是否存在异常。

  • 物理机libvirt状态

    在物理机检查service libvirtd status状态是否存在异常。

  • 物理机系统日志

    在物理机检查/var/log/messages是否存在异常。

  • 物理机与主存储连接

    检查物理机是否与主存储连接是否出现异常。

物理机运维(扩展)

物理机计划性关机

维护性关机

维护性关机前,需要确保云平台处于正常情况,且物理主机和主存储都处于已连接状态。维护性关机步骤如下:
  • 普通场景
    1. 将所有主存储进入维护模式。待所有主存储进入维护模式后,确保所有云主机已经关机。
    2. 将所有物理主机进入维护模式。
    3. 在管理节点上执行zstack-ctl stop命令,关闭管理节点服务。
    4. 确保云平台主存储没有IO操作后,在各物理机执行sync & poweroff正常关闭所有物理机。
  • 管理节点物理机高可用场景
    1. 将所有主存储进入维护模式。待所有主存储进入维护模式后,确保所有云主机已经关机。
    2. 将所有物理主机进入维护模式。
    3. 依次在两个管理节点上执行zsha2 stop-node命令,关闭管理节点服务。
    4. 确保云平台主存储没有IO操作后,在各物理机执行sync & poweroff正常关闭所有物理机。

维护性关机后上电

  • 普通场景
    1. 将所有服务器上电。
    2. 登录管理节点执行zstack-ctl status 命令查看管理节点状态,等待ZStack Cloud服务启动成功。
    3. 登录ZStack Cloud云平台,启用所有主存储和所有物理机,确保物理机和主存储是已连接状态。
  • 管理节点高可用场景
    1. 将所有服务器上电。
    2. 针对管理节点云主机高可用场景,在任一台物理机上执行zsha status命令查看管理节点高可用服务状态,等待服务正常启动成功。
    3. 针对管理节点物理机高可用场景,在两个管理节点执行zsha2 status命令查看管理节点高可用服务状态,等待服务正常启动成功。
    4. 登录ZStack Cloud云平台,启用所有主存储和所有物理机,确保物理机和主存储是已连接状态。

物理机扩容

新增物理设备扩容计算资源

新增物理设备扩容计算资源步骤如下:
  1. 新增物理设备扩容计算资源。
  2. 按照用户手册进行安装部署服务器并配置网络。
  3. 登录UI,在添加物理机界面,添加物理机,完成计算服务器扩容。详情请参考《用户手册》中添加物理机章节。
Note:
  • Ceph企业版分离/融合部署场景需要将此计算节点添加到存储作为网关角色使用(注意:需要提前配置好主机名、hosts文件、免密、防火墙、selinux、时间同步等)。
  • 对接san存储场景需要提前配置好san设备lun映射到此物理机。

新增物理设备扩容存储资源

  • Ceph企业版扩容存储
    1. 分离/融合部署场景。
    2. 准备官网发布ISO进行安装服务器,硬盘设置为直通模式。
    3. 按照用户手册进行安装部署服务器并配置网络;做好免密、时间同步、hostname等配置。
    4. 在Ceph企业版存储管理界面依次执行以下操作:添加此存储服务器为存储服务器 > 添加缓存盘 > 添加硬盘 > 添加拓扑 > 将硬盘添加到存储池内,然后等待服务器自动平衡数据、重连ZStack Cloud主存储,完成存储扩容。
  • SAN设备扩容
    1. 联系SAN厂商进行扩容lun;
    2. ZStack Cloud云平台重连Shared Block类型对接的SAN做主存储,完成存储扩容。

物理机更换

更换物理机步骤如下:
  1. 登录UI界面,将需要更换的物理机设置进入维护模式。
    Note: 进入维护模式前,请迁移业务云主机。
  2. 待物理机上无业务云主机后,删除该物理机。
  3. 将新的物理机安装ZStack Cloud定制版操作系统(安装为计算节点)并配置基础网络。
  4. 添加物理机界面,添加这些新的物理机,详情请参考《用户手册》中添加物理机章节。

重连物理主机

重连物理主机会重新部署代理程序进行相关检查。

重连物理主机失败需检查的因素:
  1. 管理节点无法正常访问物理主机22端口,例如以下,需先解决管理节点可以正常ssh到物理主机的问题。
     ssh: connect to host 192.168.0.65 port 22: Network is unreachable
  2. 物理主机应可访问管理节点,以将agent代理的结果返回给管理节点。
  3. 没有使用ZStack Cloud定制版ISO安装计算节点,导致升级失败,出现类似以下软件包安装冲突的错误,需要使用ZStack Cloud定制版ISO来重新安装系统,才可解决。
     ERROR: command pkg_list=`rpm -q openssh-clients qemu-kvm bridge-utils wget qemu-img libvirt-python libvirt nfs-utils vconfig libvirt-client net-tools iscsi-initiator-utils lighttpd dnsmasq iproute sshpass rsync nmap | grep \"not installed\" | awk '{ print $2 }'` && for pkg in $pkg_list; do yum --disablerepo=* --enablerepo=zstack-local install -y $pkg; done;failed!
  4. 物理主机的libvirt服务状态应正常:

    可通过systemctl status/start/stop/restart libvirtd进行状态/启动/停止/重启检查。

  5. 重连物理主机会检查其所属集群的网络挂载情况,假如集群挂载的二层网络指定的设备是eth1,但是物理主机的网卡设备号发生变化,不存在eth1,那么此物理主机将无法重连成功。
  6. 如果物理主机系统盘的存储容量已经用完,此时物理主机将无法重连成功。
  7. 对于要求挂载NFS主存储的物理主机,如果挂载失败,物理主机将无法重连成功,此时需要检查物理主机到NFS主存储的链路,例如以下错误,就需检查物理主机到NFS存储的连接。
    failed to execute shell command: mount 192.168.18.242:/home/Storage/zhu /opt/zstack/nfsprimarystorage/prim-751565713a6340da884c33a8668a8916
  8. 使用分布式块存储的物理主机,如果存在存储网络,则要求物理主机可直接访问存储网络。
  9. 如果使用VXLAN网络,其挂载集群时指定的VTEP IP应该存在,如果不存在,物理主机将无法重连成功。

单个物理机运维

修改物理机密码

  • UI方式:
    1. 登录云平台,物理机详情页,点击密码后面的修改按钮,重新设置物理机密码。
    2. 手动重连物理机,应用修改后的密码。
  • 命令行方式:
    1. 执行如下命令以admin方式登录云平台:
      [root@localhost ~]# zstack-cli
      admin>> LogInByAccount accountName=admin password=PASSWORD   # PASSWORD为登录密码
    2. 执行如下命令修改物理机密码:
      admin>> UpdateKVMHost uuid=HOST_UUID password=NEW_PASSWORD   # HOST_UUID为物理机UUID;NEW_PASSWORD为新密码

物理机开启IOMMU功能

确保物理机BIOS已开启Intel VT-d / AMD IOMMU选项时,开启IOMMU功能才能生效,开启方法如下:
  • 通过UI方式登录云平台,在物理机详情页的基本属性页面,将IOMMU启动状态调至启动,然后重启系统,指定物理机开启IOMMU功能。

批量物理机运维

批量添加物理机

ZStack Cloud支持UI和cli命令行两种方式批量添加物理机,具体方法如下:
  • UI方式:
    1. 通过UI方式登录ZStack Cloud,在添加物理机界面,选择模板导入方式添加物理机。
    2. 点击下载配置模板按钮下载模板,并按照规划填写模板。
    3. 将填写好的模板添加到ZStack Cloud,点击确定按钮开始批量添加物理机。
    详情请参考《用户手册》中添加物理机章节。

批量物理机执行免密等操作

批量物理机相互免密、时间同步、hostname配置流程如下:
  1. 准备免密工具包,步骤如下:
    #下载工具包
    [root@localhost ~]# wget http://cdn.zstack.io/tools/zstack_tools.tar.gz
    #解压工具包
    [root@localhost ~]# tar zxvf zstack_tools.tar.gz
    #进入工具包路径
    [root@localhost ~]# cd zstack_tools/   
  2. 修改ansible/hosts.example下面的配置:
    Note:
    • 在nodes下列出所有节点的管理网络IP地址。
    • ansible_user代表ssh 用户名。
    • ansible_pass代表ssh密码。
    • 各物理机密码初始应配置相同密码,在chrony下面列出待配置的时间同步服务器,脚本会自动配置此节点作为时间同步服务器。
    [root@localhost zstack_tools]# vim ansible/hosts.example
    #修改成如下内容
    #节点IP
    [nodes]
    10.10.0.11
    10.10.0.12
    10.10.0.13
    #节点用户/密码
    [nodes:vars]
    ansible_user=root
    ansible_ssh_pass=password
    #时间同步服务器
    [chrony]
    10.10.0.13
    #保存退出
    编辑hostname前缀
    修改ansible/group_vars/nodes下hostname前缀
    vim ansible/group_vars/nodes
    #修改如下内容
    hostname_prefix: ceph-
    #保存退出,各个hostname前缀会被配置为ceph-1,ceph-2类似格式
  3. 执行以下命令,一键准备环境,此脚本会部署各节点之间SSH免密,时间同步,/etc/hosts,关闭防火墙等操作:
    [root@localhost ~]# ./prepare.sh -i ./ansible/hosts.example

批量修改物理机密码和平台上物理机密码

批量修改云平台物理机系统密码和云平台上物理机密码(仅限KVM物理机,前提:加入云平台的物理机都采用root用户)流程如下:
  • 方法一
    1. 执行如下命令以admin方式登录云平台:
      [root@localhost ~]# zstack-cli
      admin>> LogInByAccount accountName=admin password=PASSWORD   # PASSWORD为登录密码
    2. 在管理节点依次执行如下命令,批量修改物理机root密码:
      admin>> QueryHost fields=managementIp, "hypervisorType"=KVM
      admin>>  for i in $(zstack-cli QueryHost fields=managementIp, hypervisorType=KVM|awk -F "\"" '/managementIp/ {print $4}');
      do \
      ssh $i -i \
      /usr/local/zstack/apache-tomcat/webapps/zstack/WEB-INF/classes/ansible/rsaKeys/id_rsa 'echo "NEW_PSAAWORD" | passwd --stdin root';
      done    #NEW_PSAAWORD为新的密码
  • 方法二
    1. 在管理节点执行以下zstack-cli命令批量修改云平台上的物理机密码:
      [root@localhost ~]# for i in $(zstack-cli QueryHost fields=uuid, hypervisorType=KVM|awk -F "\"" '/uuid/ {print $4}')
      [root@localhost ~]# do zstack-cli UpdateKVMHost uuid=$i password=NEW_PSAAWORD   #NEW_PSAAWORD为新的密码
      [root@localhost ~]# done

批量物理机创建sudo用户及云平台修改用户名密码

批量物理机创建sudo用户及修改云平台物理机用户名密码(仅限KVM物理机,前提:加入云平台的物理机都采用root用户)步骤如下:
  • 方法一:在管理节点执行以下命令批量创建test用户,将加入云平台的所有KVM物理机创建拥有sudo权限的test用户修改密码为NEW_PSAAWORD:
    [root@localhost ~]# zstack-cli LogInByAccount accountName=admin password=password
    admin>>  for i in $(zstack-cli QueryHost fields=managementIp, hypervisorType=KVM|awk -F "\"" '/managementIp/ {print $4}');
    do \
    ssh $i -i \
    /usr/local/zstack/apache-tomcat/webapps/zstack/WEB-INF/classes/ansible/rsaKeys/id_rsa \
    'adduser test;echo "NEW_PSAAWORD" | passwd --stdin test;echo "test   ALL=(ALL)       NOPASSWD: ALL" >>/etc/sudoers;'   #NEW_PSAAWORD为新的密码
    admin>>  done
  • 方法二:在管理节点执行以下zstack-cli命令批量修改云平台上的物理机用户名为NEW_NAME,密码为NEW_PSAAWORD:
    [root@localhost ~]# for i in $(zstack-cli QueryHost fields=uuid, hypervisorType=KVM|awk -F "\"" '/uuid/ {print $4}')
    [root@localhost ~]# do
    [root@localhost ~]# zstack-cli UpdateKVMHost uuid=$i password=password123 username=test
    [root@localhost ~]# done

外接设备运维

GPU设备

GPU设备包括物理GPU和vGPU,作用于不同的场景:
  • 物理GPU:直接透传到云主机,让云主机享有物理机强劲的GPU并行计算能力,不仅适用于3D渲染、高清转解码场景,还适用于诸多高性能计算(HPC)场景,如:机器学习、医疗成像、石油勘探数据分析、比特币挖掘等具有大量密集运算特点的场景。
  • vGPU:物理GPU虚拟化切割后的产物,可加载到云主机使用,分别加载到不同云主机使用,在满足GPU使用场景的情况下,扩展GPU数量,避免GPU资源浪费。

注意事项

使用物理GPU透传功能需注意以下情况:
  • ZStack Cloud支持以下型号的物理GPU透传:
    NVIDIA AMD
    • Tesla T4
    • Tesla M6/M10/M60
    • Tesla P100/P40/P6/P4
    • Tesla V100
    • RTX 6000/8000
    • NVIDIA A30/60/100
    • 等等...
    • FirePro S7150
    • FirePro S7150X2
    Note: NVIDIA显卡支持透传的型号较多,仅列举常用显卡,更多详情请参考NVIDIA官方文档
  • 使用物理GPU需要提前完成以下准备工作:
    • 确保物理机BIOS中开启Intel VT-d / AMD IOMMU功能,且物理机内核已开启IOMMU支持。
    • 按需设置全局设置:进入设置 > 平台设置 > 全局设置界面,按需调整全局设置,以下几个全局设置与物理GPU透传相关:
      • PCI设备热插拔开关:用于设置是否允许云主机热插拔GPU设备,默认为true。若热插拔时出现硬件兼容性错误,或不支持该硬件设备时,建议关闭此功能(设置为false)。
      • GPU设备配额:用于设置账户/项目使用GPU设备(包括:物理GPU和vGPU)数量配额,默认为20。
    • NVIDIA A系列物理GPU需额外确保物理机操作系统Kernel版本升级至4.18,GCC版本升级至8.3.1。
    • 已安装最新版本ZStack Cloud,并部署完成创建云主机必要的资源。

  • ZStack Cloud云平台已内置基础ROM文件,满足绝大部分物理GPU透传。若用户需要使用其他ROM文件,请自行在显卡供应商官网获取所需的ROM文件并上传。
    • 请务必上传与物理GPU匹配且版本信息正确的ROM文件,否则可能导致透传后的物理GPU不能正常工作。
    • 最新上传的ROM文件会覆盖之前上传的ROM文件。
  • 添加物理主机时,请勾选扫描物理主机的IOMMU设备,勾选此项后,会遍历物理主机可用的GPU设备,扫描后,需重启物理主机以使得IOMMU配置在内核生效。
  • IOMMU启用状态:表示IOMMU设备直通的状态,勾选表示已在内核启用IOMMU配置,需系统重启后生效。
  • IOMMU就绪状态:确保物理主机IOMMU为就绪状态才可正常使用GPU设备透传。如果不就绪,表示物理主机BIOS或者内核的IOMMU选项未打开。
  • 使用GPU透传后物理主机的GPU设备透传给云主机后,接入的显示器只显示云主机的界面,物理主机的界面将不再显示。
  • GPU设备透传需先建立云主机后,再动态加载GPU设备到相应的云主机上,加载后,需安装相应的显卡驱动,才可正常显示。
  • 拥有GPU透传设备的云主机不支持迁移功能,需卸载后迁移。
  • 拥有GPU透传设备的云主机关机后,只能从原本拥有GPU设备的物理主机启动,不支持跨物理主机启动。
  • 共享存储上的云主机,在关机情况下加载GPU设备时,可以选择任意物理主机,但启动时会从选定的物理主机启动,如果此物理主机资源不足,会启动失败。
  • 单个云主机可以挂载多个GPU设备,但是这些GPU设备只能来源于同一个物理主机。
使用vGPU需要注意以下情况:
  • ZStack Cloud支持对以下型号显卡进行虚拟化切割:
    NVIDIA AMD
    • Tesla T4
    • Tesla M6/M10/M60
    • Tesla P100/P40/P6/P4
    • Tesla V100
    • RTX 6000/8000
    • NVIDIA A30/60/100
    • 更多请参考NVIDIA官方文档
    • FirePro S7150
    • FirePro S7150X2
    Note: NVIDIA显卡支持虚拟化切割的型号较多,仅列举常用显卡,更多详情请参考NVIDIA官方文档
  • 使用vGPU功能需要提前准备以下工作:
    1. 使用vGPU功能需要做以下基础准备工作:
      • 确保物理机BIOS中开启Intel VT-d / AMD IOMMU功能,且物理机内核已开启IOMMU支持。
      • 确保物理机BIOS中开启SR-IOV和Memory Mapped I/O above 4GB功能。
      • 按需设置全局设置:进入设置 > 全局设置 > 高级设置界面,按需调整全局设置,以下几个全局设置与物理GPU透传相关:
        • PCI设备热插拔开关:用于设置是否允许云主机热插拔GPU设备,默认为true。若热插拔时出现硬件兼容性错误,或不支持该硬件设备时,建议关闭此功能(设置为false)。
        • GPU设备配额:用于设置账户/项目使用GPU设备(包括:物理GPU和vGPU)数量配额,默认为20。
      • 已安装最新版本ZStack Cloud,并部署完成创建云主机必要的资源。

    2. NVIDIA vGPU需要额外做以下准备工作:
      • NVIDIA vGPU功能与操作系统内核存在依赖关系,请使用h76ch79c版本ISO。
      • 若使用NVIDIA vGPU,请参考NVIDIA官方文档提前购买License,搭建License Server并导入License。
      • NVIDIA A系列vGPU需确保物理机操作系统Kernel版本升级至4.18,GCC版本升级至8.3.1。
    3. AMD vGPU需要额外做以下准备工作:
      确保高级设置云主机Hyper-V开关状态为false,否则云主机无法正常加载AMD vGPU驱动。可通过以下几种方式按需关闭该高级设置:
      • 进入云主机详情页的高级设置页面,针对单个云主机关闭云主机Hyper-V开关
      • 进入集群详情页的高级设置页面,针对集群关闭云主机Hyper-V开关
      • 进入设置 > 全局设置 > 基本设置 > 资源中心 > 云主机页面,针对整个云平台关闭云主机Hyper-V开关
  • 添加物理主机时,请勾选扫描物理主机的IOMMU设备,勾选此项后,会遍历物理主机可用的GPU设备,扫描后,需重启物理主机以使得IOMMU配置在内核生效。
  • IOMMU启用状态:表示IOMMU设备直通的状态,勾选表示已在内核启用IOMMU配置,需系统重启后生效。
  • IOMMU就绪状态:确保物理主机IOMMU为就绪状态才可正常使用GPU设备透传。如果不就绪,表示物理主机BIOS或者内核的IOMMU选项未打开。
  • 物理GPU执行虚拟化切割前请确保满足以下条件:
    • 确保此物理GPU型号支持虚拟化切割。
    • 物理GPU未透传给云主机使用。
    • 确保物理机BIOS中开启Intel VT-d / AMD IOMMU功能,且物理机内核已开启IOMMU支持。
    • 确保云平台中添加的物理机IOMMU就绪状态为“可用”。
  • NVIDIA 物理GPU和AMD 物理GPU切割方式不同:NVIDIA 物理支持每个核心独立切割;AMD 物理GPU仅支持同时切割物理机上所有AMD 物理GPU。
    • 切割规格显示此物理GPU可被切割的所有规格列表。例如:GRID M60-2A(4ins-2048 MiB-1280*1024)表示将一个核心的物理GPU虚拟化切割成4个帧数为60FPS、显存为2048MB、分辨率为1280*1024的vGPU。
    • 若需要将vGPU还原成物理GPU,请点击操作 > 虚拟化还原按钮执行操作。虚拟化还原NVIDIA vGPU需确保此物理GPU相关的vGPU已经全部从云主机卸载。
    • 若需要将vGPU还原成物理GPU,请点击操作 > 虚拟化还原按钮执行操作。虚拟化还原AMD vGPU需确保当前物理机上所有AMD vGPU全部已经从云主机卸载。
    • 一台云主机支持同时加载一个vGPU,暂不支持将物理GPU和vGPU同时加载到同一台云主机使用。
    • 若需要释放GPU设备,选中GPU设备,点击操作 > 卸载按钮,释放GPU设备。
    • 执行加载、卸载vGPU操作前,请确保云主机状态为已停止

vGPU设备

ZStack Cloud支持vGPU功能,通过GPU虚拟化技术,将物理GPU切割成更细粒度的 vGPU,形成vGPU资源池。用户可使用vGPU规格快速创建轻量的vGPU云主机,实现更灵活弹性的资源部署、提高资源利用率、以及节约成本。该功能适用于云游戏、VDI、VR/AR、AI推理以及机器学习教学等轻量级GPU计算场景。

ZStack Cloud支持对以下型号显卡进行虚拟化切割:
NVIDIA AMD
  • Tesla T4
  • Tesla M6/M10/M60
  • Tesla P100/P40/P6/P4
  • Tesla V100
  • RTX 6000/8000
  • 更多请参考NVIDIA官方文档
  • FirePro S7150
  • FirePro S7150X2
Note: NVIDIA显卡支持虚拟化切割的型号较多,仅列举常用显卡,更多详情请参考NVIDIA官方文档

USB设备透传

USB设备透传:物理主机USB设备可直接透传至该物理主机上所运行的云主机,从而让云主机能够直接使用物理主机上的USB设备。USB设备透传包括以下几种模式:
  • 直连:将USB设备加载到此物理机上的云主机,迁移云主机时需要卸载此USB设备;
  • 转发:将USB设备加载到此物理机所在区域内的云主机,迁移云主机时不需要卸载此USB设备。

注意事项

使用USB设备透传需要注意以下情况:
  • USB默认设备名采用厂商名+编号的形式,支持修改设备名(点击操作 > 修改设备名),建议用户自行修改设备名,提高USB设备辨识度。
  • USB版本根据USB插入的接口决定。例如:USB3.0设备插入USB2.0接口时,USB版本显示2.00。
  • 同一个USB设备只能透传给一台云主机使用。
  • 同一台云主机最多支持加载1个USB1.0设备、最多支持加载6个USB2.0设备、最多支持加载4个USB3.0设备。
  • 运行中状态或本地存储已停止状态的云主机只支持加载云主机所在物理机上的可用USB设备,不支持跨物理机加载USB设备。
  • 共享存储上已停止状态的云主机支持加载云主机所在集群内某台物理机上的多个USB设备。
  • 若需要卸载USB设备,点击操作 > 卸载按钮执行卸载操作。
  • Windows XP、Windows Server 2003 R2、Windows Server 2008 R2和Windows 7系统,不支持USB 3.0设备的直接加载,需要手动安装驱动。请从以下路径获取驱动文件并双击安装:http://cdn.zstack.io/tools/renesas_usb30_21390.exe

  • 对于USB2.0设备,Linux和Windows云主机均可加载并识别。
  • 对于USB3.0设备,Linux云主机可加载并识别;Windows云主机中,Windows XP、Windows Server 2003 R2、Windows Server 2008 R2和Windows 7系统需要手动安装,或将USB3.0设备插在USB2.0口中,以提高识别率。

SR-IOV网卡虚拟化

SR-IOV(Single Root I/O Virtualization)是一种基于硬件的虚拟化解决方案,它允许多个云主机高效共享PCIe设备,且同时获得与物理设备性能媲美的I/O性能,能有效提高性能和可伸缩性。

ZStack Cloud支持基于SR-IOV规范,将一张物理网卡虚拟化切割成多张VF类型网卡,直接分配给云主机使用。实现弹性灵活使用资源的同时,提高资源利用率、节约成本。相比传统的vNIC虚拟化网卡,VF网卡具有以下功能优势:
  • VF网卡可直接分配给云主机,越过虚拟化层,缩短数据传输路径,使云主机获得接近物理设备的I/O性能。
  • 明显减少对物理机CPU资源的消耗,即使物理机CPU压力较大,也能有效减少网络丢包,提高传输效率。
  • VF网卡可直接分配给云主机,越过虚拟化层,缩短数据传输路径,使云主机获得接近物理设备的I/O性能。
  • 明显减少对物理机CPU资源的消耗,即使物理机CPU压力较大,也能有效减少网络丢包,提高传输效率。
图 3所示:
图 3. SR-IOV工作原理


注意事项

  • 使用SR-IOV功能前须严格确保准备工作全部完成,否则此功能无法正常使用。
  • 若VF网卡已分配给云主机使用,请勿卸载物理网卡驱动,否则可能导致VF网卡强行回收。
  • 若物理网卡已配置bond,继续使用SR-IOV功能可能导致VF与vNIC网卡相互通信受影响,推荐使用方式如下:
    • 推荐针对单个物理网卡配置bond,并继续使用SR-IOV功能。
    • 多个物理网卡配置bond时,推荐仅对其中一个物理网卡进行SR-IOV切割。
  • VF网卡不支持QoS功能。
  • 使用启用SR-IOV功能的三层网络创建的云主机,暂时不支持使用以下网络服务:
    • 使用公有网络/扁平网络创建的云主机,其VF网卡不支持使用安全组和弹性IP网络服务。
    • 使用路由器网络/VPC网络创建的云主机,其VF网卡不支持使用安全组网络服务。
  • 运行状态且加载VF网卡的云主机不支持迁移、存储迁移操作。须停用云主机或卸载VF网卡才能执行这些操作。
  • 停用云主机将自动释放VF网卡;启用云主机时重新获取,若无可用VF网卡,将导致启用云主机失败。

主存储

主存储:用于存储云主机磁盘文件(包括:根云盘、数据云盘、根云盘快照、数据云盘快照、镜像缓存等)的存储服务器。

主存储支持的类型可分为以下两大类:
  • 本地存储 (Local Storage):使用物理机的硬盘进行存储。
  • 网络共享存储:支持NFS、Shared Mount Point、Ceph、Shared Block、AliyunNAS、AliyunEBS类型。
    • NFS为网络文件系统的存储方式。
    • Shared Mount Point支持常用的分布式文件系统提供的网络共享存储,支持的常见类型有MooseFS、GlusterFS、OCFS2、GFS2等。
    • Ceph采用了分布式块存储方式。
    • Shared Block采用了共享块存储方式。
    • AliyunNAS采用了分布式文件存储方式。
    • AliyunEBS采用了分布式块存储方式。
主存储与集群的依赖关系:
主存储 集群
Local Storage 支持加载一个或多个本地存储
NFS 支持加载一个或多个NFS
Shared Block 支持加载一个或多个Shared Block
Shared Mount Point 支持加载一个Shared Mount Point
Ceph 是加载到集群的Ceph,有且仅有一个
AliyunNAS 是加载到集群的AliyunNAS,有且仅有一个
AliyunEBS 是加载到集群的AliyunEBS,有且仅有一个
Local Storage + NFS 支持加载1个Local Storage + 1个NFS
Local Storage + SMP 支持加载1个Local Storage + 1个Shared Mount Point
Local Storage + Shared Block 支持加载1个Local Storage + 1个Shared Block
Ceph + LocalStorage 支持加载1个Ceph + 最多3个LocalStorage
Ceph + Shared Block
  • 支持加载1个Ceph + 1个Shared Block
  • 支持加载1个Ceph + 多个Shared Block
主存储支持以下操作:
操作 描述
添加主存储 添加一个主存储到系统中。
编辑主存储 修改主存储的名称与简介。
启用主存储 将处于停用状态的主存储启用。
停用主存储 将处于启用状态的主存储停用。停用主存储后,将无法基于该主存储创建新的云主机、云盘、快照,原有资源不受影响。
重连主存储 重新连接主存储。重连主存储会更新主存储相关的存储信息。
Note: 如果有任意一台物理机正常连接到主存储,该主存储的就绪状态会显示为已连接
进入维护模式 将主存储进入维护模式。
Note:
  • 进入维护模式将同时停止该主存储上的云主机等相关资源。
  • 进入维护模式后,该主存储上的云盘将不能使用。
创建云盘 在主存储上创建一个云盘,此云盘为实例化云盘。
Note: 共享云盘支持Ceph存储以及Shared Block存储,其他类型的主存储暂不支持。
加载集群 将主存储加载到指定的集群上。一个集群可以加载多个主存储。
目前支持的同类型主存储场景如下:
  • 一个集群可以加载一个或多个本地主存储。
  • 一个集群可以加载一个或多个NFS主存储。
  • 一个集群可以加载一个或多个Shared Block主存储。
  • 一个集群可以加载一个Shared Mount Point主存储。
  • 一个集群只能加载一个Ceph主存储。
  • 一个集群只能加载一个AliyunNAS主存储,除此外不能再加载新的存储。
  • 一个集群只能挂载一个AliyunEBS主存储,除此外不能再加载新的存储。
目前支持的组合类型主存储场景如下:
  • 一个集群可以加载一个本地主存储和一个NFS主存储。
  • 一个集群可以加载一个本地主存储和一个Shared Mount Point主存储。
  • 一个集群可以加载一个本地主存储和一个Shared Block主存储。
  • 一个集群可以加载一个Ceph主存储和一个Shared Block主存储。
  • 一个集群可以加载一个Ceph主存储和多个Shared Block主存储。
卸载集群 将主存储从指定的集群卸载。
Note:
将主存储从集群卸载,需要注意以下情况:
  • 此操作将导致该主存储上,与所选集群相关的云主机关机,影响业务运行,请谨慎操作。
  • 此操作将导致该主存储上,与所选集群相关的VPC路由器被删除,相关云主机的网络服务异常,请谨慎操作。
  • 此操作将导致该主存储上,与所选集群相关的云盘将不能正常使用,请谨慎操作。
将主存储从弹性裸金属集群卸载,需要注意以下情况:
  • 此操作将导致该主存储上,与所选弹性裸金属集群相关的弹性裸金属实例将关机,影响业务运行,请谨慎操作。
  • 此操作将导致该主存储上,与所选弹性裸金属集群相关的云盘将不能正常使用,请谨慎操作。
删除主存储 将主存储删除。
Note: 删除主存储需要注意以下情况:
  • 执行删除操作前请从所有集群卸载该主存储,否则不能删除。
  • 删除主存储是非常危险的操作,此操作会直接删除该主存储上的所有资源,如云主机、弹性裸金属实例、云盘、快照等,即使重新添加此主存储,也无法自动识别原有的文件。
数据清理 清理跨Ceph存储迁移、跨NFS存储迁移以及跨Shared Block迁移保留的原始数据。在主存储详情页的数据清理子页面,点击清理按钮,清理存储迁移保留的原始数据,清理后不可恢复,请谨慎操作。
清理主存储回收站 清空Ceph主存储回收站中保留的数据。
  • Ceph主存储上删除的数据将被放入存储回收站中保存。用户可通过全局设置Ceph主存储删除数据保留时间指定删除数据的保留时间,在该时间范围内,用户可以从回收站中找回被删除的数据,超过该时间,数据将被彻底删除,不可找回。
  • 在保留时间范围内,用户也可手动清空主存储回收站,被清空的数据不可找回,请谨慎操作。

注意事项

使用主存储需注意:
  • 本地存储、NFS、Shared Mount Point主存储基于qcow2。
  • 以虚拟容量来计算云主机的根云盘和数据云盘消耗。
  • 主存储停用后,将不能使用此主存储申请新资源,但不影响当前运行中的云主机,只是不能新建云主机和新建数据盘。
  • 主存储维护后,将不能使用此主存储申请新资源,原本运行中的云主机也会被停止。
  • 主存储 | 镜像服务器之间的约束关系:
    • 本地存储、NFS、Shared Mount Point、Ceph、Shared Block、主存储支持匹配镜像仓库类型镜像服务器使用。
    • Ceph主存储支持匹配镜像仓库类型镜像服务器使用,以及匹配同一Ceph镜像服务器使用。
  • 主存储的使用基于瘦身模式,支持超分,超分比例设置过大时,需留意真实物理容量的使用。
  • ZStack Cloud创建云盘时使用的是虚拟大小,如果虚拟大小不足以提供需要的容量,此时创建云盘会提示失败。
  • 删除主存储会删除主存储所有的云主机、云盘和快照。需谨慎操作!这里的删除,只是移除主存储、云主机、云盘和快照等信息在ZStack Cloud中的记录,并不删除真实的数据。
  • 共享存储可以设置独立的存储网络与管理网络隔离,管理节点依据此存储网络来判断云主机健康状态,如果不存在独立的存储网络,可以留空不填,表示采用管理网络来判断云主机健康状态。

本地存储

本地存储:如果主存储类型采用本地存储(Local Storage),那么使用各物理机的本地硬盘目录作为主存储,匹配镜像仓库,容量由各物理机的目录容量累加。

本地存储特性

  • 使用物理主机的本地存储空间,存放云盘数据。
  • 云主机数据保护需依赖节点RAID阵列技术。
  • 投资低、性能高、大规模,但云主机热迁移存在问题,需要业务层高可靠。
  • 适用于软件开发测试环境、分布式应用、应用与数据分离的场景。

注意事项

使用本地主存储需注意:
  • 不能使用以下://dev//proc//sys//usr/bin/bin等系统目录,使用这些目录可能会导致物理主机异常。
  • 本地主存储的状态一般为Connected。
  • 本地主存储容量由各物理主机的主存储目录的容量累加。
  • 镜像缓存在添加镜像后,会自动分发到各物理主机的主存储目录进行缓存,使用此镜像的不同云主机共享使用此镜像缓存作为base。
  • 因为存储的隔离性,使用本地存储的云主机,不支持从其他物理机启动,不支持指定物理主机启动,支持设置高可用级别为NeverStop,设置高可用级别为NeverStop后,当所在物理机处于启用已连接状态时,该云主机会一直运行。即使强制关机,该云主机也会再次启动。
  • 使用本地存储的云主机默认支持冷迁移。
  • 使用本地存储的云主机支持在线热迁移,默认关闭,需要在全局设置打开,本地存储的云主机不支持带数据盘的热迁移,Windows操作系统的云主机不支持热迁移。
  • 本地存储的镜像缓存在删除镜像后,如果没有任何云主机使用,此镜像缓存会自动删除。
  • 本地存储一般都处于可连接状态,若某物理主机失联,则此物理主机上的本地存储容量将被扣除,一旦物理主机再次连接,容量会被再次计算进来。
  • 一个集群支持挂载多个本地主存储,创建云主机时,可指定任意主存储;若未指定,系统自动选择可用容量最充足的本地主存储。

NFS

NFS主存储:使用网络文件系统作为主存储,需提供NFS的共享文件目录。

NFS主存储特性

  • 云盘存放在集中存储,数据需通过存储双控和RAID技术保护。
  • 需要构建万兆存储网络,购买集中存储,云主机受高可用保护。
  • 特点:构建了存储网、云主机支持高可用、数据支持安全保护、IO性能有瓶颈(8~10节点/一个存储)。
  • 场景:适用于传统应用、应用数据紧密、SLA高可用保证、数据安全场景。

注意事项

使用NFS主存储需注意:
  • NFS使用时添加的URL支持输入IP,输入格式为:NFS_Server_IP:/NFS_Share_folder
  • NFS的挂载目录需提供读写权限,NFS的挂载参数需NFS Server端支持。
  • ZStack Cloud会在所有的物理主机上自动挂载此目录作为主存储。
  • 只要集群内任一物理主机可访问NFS主存储,则主存储就处于可连接状态。
  • NFS属于共享存储,支持云主机在线迁移。
  • NFS主存储是所有物理主机共享带宽访问同一目录,效率和性能具有瓶颈 。
  • NFS主存储只会拷贝一份镜像缓存到主存储的共享目录。
  • NFS存储支持输入存储网络CIDR,表示基于此存储网络来判断云主机的健康状态。
  • 一个集群支持挂载多个NFS主存储,创建云主机时,可指定任意主存储,若未指定,系统随机分配可用主存储。
  • 一个集群支持挂载一个NFS主存储和一个本地主存储,在创建云主机时,可指定任意主存储,如果带数据云盘,则需指定数据云盘所使用的主存储;如果不指定主存储,则使用本地主存储来创建云主机。
  • 使用NFS+本地主存储的云主机,进行迁移前,需卸载其本地主存储上的云盘。这里的迁移仅限于同一主存储内部,不可跨主存储迁移。

Shared Mount Point

Shared Mount Point主存储:采用共享文件系统存储为主存储,支持SAN存储,格式化为MooseFS,GlusterFS,OCFS2,GFS2等文件系统。

Shared Mount Point主存储特性

  • 云盘存放在集中存储,数据需通过存储双控和RAID技术保护。
  • 需要构建万兆存储网络,购买集中存储,云主机受高可用保护。
  • 特点:构建了存储网、云主机支持高可用、数据支持安全保护,IO性能有瓶颈(8~10节点/一个存储)。
  • 场景:适用于传统应用、应用数据紧密、SLA高可用保证、数据安全场景。

注意事项

使用Shared Mount Point主存储需注意:
  • 需在各物理主机提前挂载各挂载点,挂载到相同目录。
  • 在添加到ZStack Cloud时,需提供挂载到物理主机的本地目录。
  • 支持在线迁移,对应挂载目录需提供读写权限。
  • Shared Mount Point存储支持输入存储网络CIDR,表示基于此存储网络来判断云主机的健康状态。
  • 一个集群支持挂载一个Shared Mount Point和本地主存储,创建云主机时,可指定任意主存储,如果带数据云盘,则需指定数据云盘所使用的主存储;如果不指定主存储,则使用本地主存储来创建云主机。
  • 使用Shared Mount Point+本地主存储的云主机,进行迁移前,需卸载其本地主存储上的云盘。这里的迁移仅限于同一主存储内部,不可跨主存储迁移。

Ceph

Ceph主存储:Ceph集群提供的分布式块存储作为主存储。ZStack Cloud主存储支持对接以下版本Ceph:
  • Ceph开源版:J版本、L版本和N版本。
  • ZStack Ceph企业版:所有已发布的ZStack Ceph企业版。若更关注数据安全和IO性能,推荐使用ZStack Ceph企业版,详情请联系官方技术支持获取帮助。

Ceph分布式存储特性

  • 云盘存放在分布式存储,数据通过多副本或纠删码机制提供保护。
  • 需要构建存储网络,基于x86通用服务器提供存储服务,云主机受高可用保护。
  • 特点:构建了存储网,云主机支持高可用,数据支持多副本,计算和存储都可以横向扩展。
  • 适用场景:租用平台、通用型应用、应用数据紧密、SLA高可用保证、大规模环境。
  • 支持以Pool为单位显示其容量。

注意事项

使用Ceph主存储需注意:
  • 需输入Mon IP节点信息以部署相关的代理程序。
  • 如果指定了镜像缓存、根云盘、数据云盘的Ceph存储池名,则这些存储池需提前在Ceph集群自行创建。
  • 存储池名为可选项,如果不指定,则ZStack Cloud会自动创建以uuid相关命名的存储池,如果指定了存储池名,但是实际不存在,添加Ceph主存储会提示失败。
  • 添加Ceph主存储,可添加镜像仓库类型的镜像服务器,或者添加同一Ceph集群存储作为镜像服务器。
  • Ceph主存储可指定多个Mon IP,需至少一个Mon处于连接状态。
  • Ceph存储支持共享云盘,要求使用VirtioSCSI类型作为前提。
  • Ceph集群工作异常时,主存储会失联,可通过ceph -s检查状态。
  • Ceph存储支持输入存储网络,表示基于此存储网络来判断云主机的健康状态。
  • Ceph存储支持添加扩展池,用于存储数据云盘,可表示不同性能的云盘。可添加或创建Ceph存储池,添加表示使用Ceph集群中已经存在的Pool,如果Ceph存储池已经存在,需进行添加,如果不存在,可指定存储池名来创建,创建时,会采用默认的CRUSH Map。
  • 存储迁移至Ceph主存储时,支持指定存储池。
  • 删除扩展池,会删除Pool下所有的数据盘。这里的删除只移除Ceph Pool在ZStack Cloud的记录,并不删除真实数据,Ceph存储集群依然可看到此Pool及其上数据。
  • 拥有独立存储网络的Ceph存储,节点管理IP表示管理节点连接存储节点的IP,Mon IP表示存储网络的监控节点IP,可以通过ceph -s读取。
  • 对使用ZStack Ceph企业版的用户,当ZStack Ceph企业版许可证过期时间小于等于15天时,将在界面进行提示,为不影响您的售后服务,请尽快联系云平台相关人员进行授权更新。
  • 对使用ZStack Ceph企业版的用户,支持添加ZStack Ceph企业版存储产品的访问令牌,即可实现云平台对该存储产品的接管。

Shared Block

Shared Block(共享块存储)可将用户在SAN存储上划分的LUN设备直接作为存储池,再提供给业务云主机使用。与SMP类型的主存储相比,Shared Block主存储具备便捷部署、灵活扩展、性能优异等优势。
  • Shared Block主存储采用了共享块存储方式,匹配镜像仓库;
  • 支持在线添加共享块设备(即LUN设备)。
  • 支持一个集群添加多个Shared Block主存储。
  • 支持一个集群添加1个LocalStorage+1个Shared Block主存储。
  • 支持云主机关机状态下带云盘(除共享云盘外)存储迁移。
  • 支持云主机开机状态下跨Shared Block主存储整机迁移。
    Note: 若云主机挂载共享云盘,不支持整机存储迁移。
  • 支持精简置备和厚置备两种置备方式:
    • 厚置备:预先分配需要的存储空间,提供充足的存储容量,保证存储性能
    • 精简置备:按实际使用情况分配存储空间,实现更高的存储利用率
  • 支持Windows故障转移群集的云主机平滑热迁移
    Note:ZStack Cloud 3.9.0版本开始,ZStack Cloud针对Windows故障转移群集做了特定支持,云主机热迁移不会产生任何不良影响。
  • 支持设置云盘和快照在SharedBlock主存储 LUN上的落盘策略,提供全局性和单个SharedBlock主存储设置粒度。支持策略包括根据系统分配、创建在容量剩余最多的LUN中、创建在 LV(快照+云盘)数量最少的LUN中。
    • 选择根据盘符排序,在 SharedBlock 主存储上创建云盘或快照时,根据盘符顺序在首个可用容量充足的 LUN 上落盘。
    • 选择创建在容量剩余最多的 LUN 中,在 SharedBlock 主存储上创建云盘或快照时,在云盘和快照数量总和最少且可用容量充足的 LUN 上落盘。
    • 选择创建在 LV(快照+云盘)数量最少的LUN中,在 SharedBlock 主存储上创建云盘或快照时,在可用容量最多的 LUN 上落盘。
    Note: 若单独为SharedBlock主存储设置 LUN 分配策略,全局设置将不对该主存储生效。

注意事项

  • 添加Shared Block主存储时,清理块设备按钮默认不勾选。
    • 勾选后,将强制清理块设备中的数据,如文件系统、RAID或分区表中的签名等。
    • 若块设备中存有数据,不清理块设备,将导致添加共享块或挂载主存储失败。
    • 添加的块设备中不能有分区,否则会添加失败。
  • 如Shared Block使用iSCSI存储提供的块设备,需保证Shared Block主存储与关联的iSCSI存储挂载在同一集群下。

主存储运维(扩展)

本地存储运维

本地主存储扩容

本地主存储扩容步骤如下:
  1. 设置待扩容的物理主机进入维护模式。
  2. 插入新的大容量磁盘至物理主机,并进行分区格式化(假定设备名称为/dev/sdc)。
  3. 创建新目录/new_volume,执行命令mount /dev/sdc1 /new_volume挂载此磁盘。
  4. 执行命令rsync -a /zstack_ps /new_volume/拷贝原始的磁盘文件至新磁盘。
  5. 添加内容至/etc/fstab,并将物理磁盘挂载点与/zstack_ps目录绑定。
  6. 重启物理机,然后使用df -h /zstack_ps命令检查扩容后的空间增量。
  7. 重启ZStack Cloud管理节点服务。
  8. 重连物理机,继续使用ZStack Cloud

维护本地主存储

计划性维护主存储将停止此存储上所有云主机,请Admin提前迁移重要云主机。计划性维护主存储步骤如下:
  1. 通过UI方式登录ZStack Cloud,在主存储界面,点击进入维护模式按钮,将主存储进入维护模式。
  2. 进入主存储后台进行维护操作。
  3. 维护完成后,通过UI方式,在主存储界面,点击启动按钮,启动维护完成的主存储。

NFS存储运维

NFS存储扩容

扩容已有NFS存储容量步骤如下:
  1. 对原NFS共享目录进行扩容,请联系官方技术支持。
  2. 在管理节点重连NFS存储。
  3. 重连物理机,继续使用ZStack Cloud
使用新目录提供NFS步骤如下:
  1. 选择NFS存储集群的物理机,挂载新的NFS存储至该物理机的/NFS_volume目录,参考命令:mount NFS_IP:/<url>/NFS_volume
  2. 执行命令rsync-a/NFS_ps/NFS_volume/拷贝原始的磁盘文件至新磁盘。
  3. 更新NFS配置文件,改写共享目录名称。
  4. 在管理节点配置重连NFS存储。
  5. 重连物理机,继续使用ZStack Cloud

维护NFS存储

计划性维护主存储将停止此存储上所有云主机,请Admin提前迁移重要云主机。计划性维护主存储步骤如下:
  1. 通过UI方式登录ZStack Cloud,在主存储界面,点击进入维护模式按钮,将主存储进入维护模式。
  2. 进入主存储后台进行维护操作。
  3. 维护完成后,通过UI方式,在主存储界面,点击启动按钮,启动维护完成的主存储。

Shared Mount Point存储运维

Shared Mount Point存储扩容

在线扩容已有Shared Mount Point存储容量步骤如下:
  1. 保证正常业务运行情况下质询对应存储厂商在线扩容方式。
  2. 待存储厂商完成存储在线扩容后验证是否扩容成功。
  3. 重连此主存储并识别扩容后新容量,完成在线扩容。
离线扩容已有Shared Mount Point存储容量步骤如下:
  1. 通过UI登录ZStack Cloud云平台,将此主存储进入维护模式。
  2. 将Shared Mount Point主存储进行下电扩容。
  3. 上电此主存储,并在计算节点上确保已经识别到扩容后的存储容量。
  4. 通过UI登录ZStack Cloud云平台,启用主存储,完成扩容。

维护Shared Mount Point存储

计划性维护主存储将停止此存储上所有云主机,请Admin提前迁移重要云主机。计划性维护主存储步骤如下:
  1. 通过UI方式登录ZStack Cloud,在主存储界面,点击进入维护模式按钮,将主存储进入维护模式。
  2. 进入主存储后台进行维护操作。
  3. 维护完成后,通过UI方式,在主存储界面,点击启动按钮,启动维护完成的主存储。

Ceph企业版存储运维

如需进行Ceph企业版存储运维,请联系官方技术支持。

Ceph存储扩容

Ceph存储扩容步骤如下:
  1. 在Ceph存储相应的物理机添加需要扩容的硬盘。
  2. 进入Ceph平台的硬盘管理添加硬盘,待添加成功后刷新存储池。
  3. 通过UI方式登录ZStack Cloud云平台,重连Ceph主存储。

Ceph存储变更管理IP地址

Ceph存储变更管理IP地址步骤如下:
  1. 获取网络修改工具:network-tool-1.1.tar.gz (请联系官方技术支持获取)
    Note: 该离线修改网络工具不支持文件网关、块存储客户端组、对象存储S3网关、对象路由、NFS网关服务的地址修改。若需要修改以上服务,请先删除挂载这些服务的相关网络,待其他网络修改完成后在对应网络重新添加这些服务。
  2. 执行以下命令,查看master db所在的服务器:
    [root@managementnode ~]# xms-manage db list
  3. 上传network-tool-1.1.tar.gz工具包,并依次执行以下命令,在master db所在的服务器上执行停止集群服务的工具:
    #解压工具包
    [root@localhost ~]# tar zxf network-tool-1.0.tar.gz
    #运行脚本
    [root@localhost ~]# ./prepare.sh  
    脚本执行之后,需手动输入UI的账号密码,并输入yes确认,该脚本会停止所有的服务。
  4. 手动修改所有服务器的网卡地址。
    Note: 不能修改服务器的主机名。
  5. 修改脚本的网络文件配置。需要修改/opt/sds/network-tool/conf/network.conf 中的各网络信息,修改/opt/sds/network-tool/conf/hosts 中的主机管理网 IP 信息。
  6. 执行命令./modify-network.sh,运行服务修改脚本。修改完成后,等待Ceph状态健康即可。
    Note:
    • 脚本文件执行成功之后,xdc 恢复很慢,可能需要等待5min , 需要等待Ceph和 xdc 恢复之后再进行创建操作。验证方法:进行创建块存储卷操作。
    • 脚本执行过程中ceph.conf 还没更新完,可能会出现重起 osd的现象,会导致脚本执行完成后,查看ceph 状态出现osd down error。

      解决办法:先查看/etc/ceph/ceph.conf 地址是否更新,如果是,执行命令systemctl restart ceph-osd.target重启服务 (重启osd的命令)。
  7. 修改管理节点IP地址。根据管理节点存在形式,可通过如下方法进行修改:
    • 管理节点为物理机修改方法如下:

      通过UI方式登录云平台,在主存储详情页的监控节点界面,删除旧的监控节点IP。

    • 管理节点为云主机修改方法如下:
      1. 执行命令zsha export-config,导出管理节点云主机配置文件到目录:/tmp/current.config.json
      2. 执行vim /tmp/current.config.json命令,进入配置文件编辑模式,调整配置文件中的Node、MonAddrs、Chronyservers选项。
      3. 配置文件调整完成后,执行zsha import-config /tmp/current.config.json命令,重新导入配置文件。
      4. 执行zsha start命令,启动管理节点服务。
      5. 通过UI方式登录云平台,在主存储详情页的监控节点界面,删除旧的监控节点IP。

Ceph存储更换物理机

若超融合服务器故障,先确认故障点并修复,可能存在的故障如下:
  • 若网卡故障,请更换网卡。
  • 若进程异常,请修复进程。
  • 若服务器部分硬盘故障,请更换部分硬盘。
  • 若服务器操作系统损坏,请修复操作系统。
  • 若操作系统无法修复,请重装操作系统。
故障排除后,根据以下步骤更换物理机:
  1. 通过UI方式登录云平台,将故障物理机进入维护模式。
  2. 将所有有用业务云主机迁移后,删除此物理机。
  3. 通过UI方式登录Ceph企业版,将存储pool内故障服务器上所有硬盘踢除。
  4. 设置存储平台禁止数据恢复、服务器拓扑处移除此故障服务器。
  5. 删除故障服务器osd硬盘、删除故障服务器缓存盘、删除故障服务器。
  6. 维护或者更换故障服务器,然后重新部署新服务器。
    Note: 重新部署新服务器需要注意以下情况:
    1. 安装操作系统后配置网络与原服务器一致。
    2. 进行初始化安装存储服务器(免密、hosts域名解析、时间同步)。
  7. 在Ceph企业版的存储管理界面添加新服务器、添加新缓存盘、添加新osd硬盘。
  8. 将新服务器拖拽至拓扑图内。
  9. 在pool内添加新服务器硬盘。
  10. 在平台设置存储自恢复带宽QoS,开启数据自恢复。
  11. 通过UI方式登录ZStack Cloud云平台,在物理机界面,手动添加此物理机。
  12. 检测数据平衡,待数据自动平衡完成后,故障更换操作完成。

Ceph存储新增计算节点

Ceph存储新增计算节点步骤如下:
  1. 为新的计算节点安装操作系统,并配置网络与之前一致。
  2. 进行初始化安装存储服务器(免密、hosts域名解析、时间同步)。
  3. 通过UI方式登录Ceph企业版,在存储管理上添加新服务器(网关服务器)。
  4. 通过UI方式登录ZStack Cloud云平台,在物理机界面,手动添加此物理机为计算节点,完成Ceph存储新增计算节点。

Ceph存储新增存储节点

Ceph存储新增存储节点步骤如下:
  1. 新增存储节点安装操作系统后配置网络与原节点一致。
  2. 进行初始化安装存储服务器(免密、hosts域名解析、时间同步)。
  3. 通过UI方式登录Ceph企业版,在存储管理上添加新服务器(存储服务器)、添加新缓存盘、添加新osd硬盘。
  4. 将新服务器拖拽入拓扑内。
  5. 在pool内添加新服务器硬盘。
  6. 在平台设置存储自恢复带宽QoS,开启数据自恢复。
  7. 待存储自动平衡完数据后本次操作完成。

维护Ceph企业版存储

计划性维护主存储将停止此存储上所有云主机,请Admin提前迁移重要云主机。计划性维护主存储步骤如下:
  1. 通过UI方式登录ZStack Cloud,在主存储界面,点击进入维护模式按钮,将主存储进入维护模式。
  2. 进入主存储后台进行维护操作。
  3. 维护完成后,通过UI方式,在主存储界面,点击启动按钮,启动维护完成的主存储。

维护Ceph企业版注意事项

  • 通过浏览器(推荐Firefox或Chrome)访问Ceph企业版网页控制台:http://管控节点IP:8056/ (管理节点+端口)。
  • 通过UI方式可在主存储详情页,已创建的存储池获取其UUID。也可以在后台执行 ceph osd pool ls 命令查看此 pool uuid。
  • 添加主存储和镜像服务器时,未指定Ceph企业版存储的pool,会导致Ceph主存储间歇性失联、不可用。

Shared Block存储运维

Shared Block扩容

底层FCSAN扩容步骤如下:
  1. 扩容前请先与存储提供厂商确认最佳扩容方案。
  2. 确认不影响业务情况下进行存储扩容。
  3. 存储扩容完成后,通过UI方式登录云平台,在主存储详情页刷新容量,容量正常显示表示存储扩容完成。

维护Shared Block存储

计划性维护主存储将停止此存储上所有云主机,请Admin提前迁移重要云主机。计划性维护主存储步骤如下:
  1. 通过UI方式登录ZStack Cloud,在主存储界面,点击进入维护模式按钮,将主存储进入维护模式。
  2. 进入主存储后台进行维护操作。
  3. 维护完成后,通过UI方式,在主存储界面,点击启动按钮,启动维护完成的主存储。

重连主存储

重连主存储会重新部署代理程序进行相关检查。

重连主存储失败需检查的因素:
  1. 本地存储一般处于可连接状态。
  2. NFS主存储保证有可用物理主机可以连接此主存储。重连失败时,需检查NFS Server的IP地址、NFS共享目录、NFS挂载参数是否正确。
  3. Ceph主存储需检查分布式块存储是否正常。重连失败时,需检查Ceph IP地址、Ceph SSH 端口、用户名、密码、用户名是否有sudo权限,Ceph集群状态是否正常。
  4. Shared Mount Point主存储需在物理主机手动挂载此目录,建议在/etc/rc.local里进行定义,开机自启动挂载。

镜像服务器

镜像服务器(Backup Storage):用于存储云主机镜像模板(含ISO)的存储服务器。

  • 镜像服务器加载到区域之后,区域中的资源才能访问它。通过镜像服务器,可在多个区域之间共享镜像。
    图 4所示:
    图 4. 镜像服务器


  • UI界面为便于管理镜像服务器和区域的关系,特别设置了一个镜像服务器只能对应一个区域。UI界面上,添加镜像服务器,默认会加载到当前区域。删除区域的同时会直接删除加载此区域的镜像服务器。

镜像服务器相关定义

镜像服务器支持以下类型:
  1. ImageStore(镜像仓库)
    • 以镜像切片方式存储镜像文件,支持增量存储。
    • 支持云主机的在线/关机快照、在线/关机创建镜像。
    • 不带数据云盘克隆云主机时,支持在线/暂停/关机克隆。
    • 整机克隆时,LocalStorage、NFS、SMP、Ceph、Shared Block类型的主存储,支持在线/暂停/关机克隆。
    • 同一管理节点下的ImageStore类型的镜像服务器间支持镜像同步。
    • 支持获取已有镜像,可获取该镜像服务器中URL路径下的已有镜像文件。
  2. Ceph镜像服务器
    • 以Ceph分布式块存储方式存储镜像文件。
    • 支持云主机的在线/关机快照、在线/关机创建镜像。
    • 不带数据云盘克隆云主机时,支持在线/暂停/关机克隆。
    • 整机克隆时,Ceph类型的主存储,支持在线/暂停/关机克隆。
    • 导出镜像支持在镜像服务器和UI上导出。
      • 支持在UI上直接导出镜像,复制导出镜像URL以及下载导出镜像。
      • 在镜像服务器上导出镜像:

        假定使用的镜像路径为:ceph://bak-t-c9923f9821bf45498fdf9cdfa1749943/61ece0adc7244b0cbd12dafbc5494f0c

        则需在镜像服务器上执行:
        rbd export -p bak-t-c9923f9821bf45498fdf9cdfa1749943 --image 61ece0adc7244b0cbd12dafbc5494f0c --path /root/export-test.image
        
        # bak-t-c9923f9821bf45498fdf9cdfa1749943表示镜像所在的pool的名字
        # 61ece0adc7244b0cbd12dafbc5494f0c表示镜像的名字
        # /root/export-test.image表示导出的目标文件名字
  3. AliyunEBS镜像服务器
    • 以对象存储方式存储镜像文件。
    • 支持云主机的在线/关机快照、在线/关机创建镜像。
    • 不带数据云盘克隆云主机时,支持在线/暂停/关机克隆。
    • 不支持整机克隆。
    • 导出镜像需在镜像服务器上导出(如有需求请咨询官方技术支持获取帮助)。

镜像服务器 | 主存储

镜像服务器的类型与主存储的类型有关联性要求,如主存储与镜像服务器的关系所示:
PS\BS ImageStore Ceph
Local Storage ×
NFS ×
Shared Mount Point ×
Ceph
Shared Block ×
  • 当主存储为LocalStorage、NFS、Shared Mount Point类型时,镜像服务器的默认类型为ImageStore。
  • 当主存储为NFS或Shared Mount Point类型时,可将相应共享目录手动加载到相应镜像服务器的本地目录上,从而使主存储和镜像服务器均能使用网络共享存储方式。
  • 当主存储为Ceph类型时,镜像服务器可以使用同一个Ceph集群作为镜像服务器,也可以使用ImageStore类型的镜像服务器。
  • 当主存储为Shared Block类型时,镜像服务器的默认类型为ImageStore。
  • 当主存储为AliyunNAS类型时,镜像服务器的默认ImageStore。
  • 当主存储为AliyunEBS类型时,镜像服务器的默认类型为AliyunEBS。

镜像服务器支持操作

镜像服务器支持以下操作:
操作 描述
创建镜像服务器 创建一个新的镜像服务器。
编辑镜像服务器 编辑镜像服务器的名称、简介信息。
启用镜像服务器 启用处于停止状态的镜像服务器。
停用镜像服务器 停用选中的镜像服务器。
Note: 停用镜像服务器将不能添加新镜像,已添加镜像不受影响,仍可用于创建云主机,不影响正常业务。
重连镜像服务器 重连选中的镜像服务器,重连镜像服务器会更新镜像服务器上相关的存储信息。
Note:
  • 重连过程中其上资源暂时无法操作。
  • 如果任意一台物理机正常连接到镜像服务器,该镜像服务器的就绪状态就会显示为已连接
数据清理 清理镜像服务器中已被彻底删除的无效数据和过期的临时数据,释放存储空间。
Note:
  • 将某镜像文件(包括普通镜像和路由器镜像)彻底删除,并将使用该镜像创建的云主机彻底删除,这时执行数据清理操作,就可释放镜像服务器的存储空间,清理完毕后,界面会显示本次清理释放的空间大小。
  • 仅ImageStore类型的镜像服务器支持该操作。
  • 数据清理期间,请避免执行写入数据相关操作。
更新密码 更新镜像服务器的密码,更新密码后需要手动重连镜像服务器。
删除镜像服务器 删除选中的镜像服务器。
Note:
  • 删除操作只是删除镜像服务器和镜像在ZStack Cloud中的记录,并不移除真实的数据。
  • 若镜像服务器与本地备份服务器复用,删除该镜像服务器将同时删除本地备份服务器上的CDP任务和CDP数据,请谨慎操作。

注意事项

关于镜像服务器支持克隆、快照、创建镜像的相关说明:
  • 在线克隆:镜像仓库支持不带云盘克隆和整机克隆。Ceph支持不带云盘克隆。
  • 关机克隆:镜像仓库支持不带云盘克隆和整机克隆。Ceph支持不带云盘克隆。
  • 在线快照:镜像仓库、Ceph支持。
  • 关机快照:镜像仓库、Ceph均支持。
  • 在线创建镜像:镜像仓库、Ceph支持。
  • 关机创建镜像:镜像仓库、Ceph均支持。

ImageStore(镜像仓库)

ImageStore(镜像仓库)以镜像切片方式存储镜像文件,当主存储为本地存储(LocalStorage)、NFS、Shared Mount Point、Ceph、SharedBlock类型时,可匹配ImageStore类型镜像服务器使用。

  • 以镜像切片方式存储镜像文件,支持增量存储。
  • 支持云主机的在线/关机快照、在线/关机创建镜像。
  • 不带数据云盘克隆云主机时,支持在线/暂停/关机克隆。
  • 整机克隆时,LocalStorage、NFS、SMP、Ceph、Shared Block类型的主存储,支持在线/暂停/关机克隆。
  • 同一管理节点下的ImageStore类型的镜像服务器间支持镜像同步。
  • 支持获取已有镜像,可获取该镜像服务器中URL路径下的已有镜像文件。

Ceph

Ceph镜像服务器以Ceph分布式块存储方式存储镜像文件,当主存储为Ceph类型时,可匹配Ceph类型镜像服务器使用。

ZStack Cloud镜像服务器支持对接以下版本Ceph:
  • Ceph开源版:J版本、L版本和N版本。
  • ZStack Ceph企业版:所有已发布的ZStack Ceph企业版。若更关注数据安全和IO性能,推荐使用ZStack Ceph企业版,详情请联系官方技术支持获取帮助。

注意事项

  • 以Ceph分布式块存储方式存储镜像文件。
  • 支持云主机的在线/关机快照、在线/关机创建镜像。
  • 不带数据云盘克隆云主机时,支持在线/暂停/关机克隆。
  • 整机克隆时,Ceph类型的主存储,支持在线/暂停/关机克隆。
  • 导出镜像支持在镜像服务器和UI上导出。
    • 支持在UI上直接导出镜像,复制导出镜像URL以及下载导出镜像。
    • 在镜像服务器上导出镜像:

      假定使用的镜像路径为:ceph://bak-t-c9923f9821bf45498fdf9cdfa1749943/61ece0adc7244b0cbd12dafbc5494f0c

      则需在镜像服务器上执行:
      rbd export -p bak-t-c9923f9821bf45498fdf9cdfa1749943 --image 61ece0adc7244b0cbd12dafbc5494f0c --path /root/export-test.image
      
      # bak-t-c9923f9821bf45498fdf9cdfa1749943表示镜像所在的pool的名字
      # 61ece0adc7244b0cbd12dafbc5494f0c表示镜像的名字
      # /root/export-test.image表示导出的目标文件名字

镜像服务器运维(扩展)

ImageStore镜像服务器运维

ImageStore镜像服务器扩容

ImageStore镜像服务器扩容步骤如下:
  1. 停用本地镜像服务器。
  2. 添加新的大容量磁盘至物理机,并进行分区格式化,假定设备名称为/dev/sdc
  3. 创建新目录/new_volume,执行命令mount /dev/sdc1 /new_volume挂载此磁盘。
  4. 执行命令rsync -a /zstack_bs /new_volume/拷贝原始的磁盘文件至新磁盘。
  5. 添加内容至/etc/fstab,并将物理磁盘挂载点与/zstack_bs目录绑定。
  6. 重启物理机,使用df -h /zstack_bs检查扩容后的空间增量。
  7. 重启ZStack Cloud管理节点服务。
  8. 重连物理机继续使用ZStack Cloud

维护ImageStore镜像服务器

ImageStore镜像服务器计划性维护步骤如下:
  1. 停用ImageStore镜像服务器。
  2. 镜像服务器界面,选中ImageStore镜像服务器,点击数据清理按钮,清理镜像服务器中已被彻底删除的无效数据和过期的临时数据,释放存储空间。
  3. 清理完成后,启用ImageStore镜像服务器,继续使用。

Ceph镜像服务器运维

如需进行Ceph镜像服务器运维,请联系官方技术支持。

Ceph镜像服务器扩容

Ceph镜像服务器扩容步骤如下:
  1. 在Ceph存储相应的物理机添加需要扩容的硬盘。
  2. 进入Ceph平台的硬盘管理添加硬盘,待添加成功后刷新存储池。
  3. 通过UI方式登录ZStack Cloud云平台,重连Ceph镜像服务器。

Ceph镜像服务器变更IP地址

  1. 获取网络修改工具:network-tool-1.1.tar.gz (请联系官方技术支持获取)
    Note: 该离线修改网络工具不支持文件网关、块存储客户端组、对象存储S3网关、对象路由、NFS网关服务的地址修改。若需要修改以上服务,请先删除挂载这些服务的相关网络,待其他网络修改完成后在对应网络重新添加这些服务。
  2. 执行以下命令,查看master db所在的服务器:
    [root@managementnode ~]# xms-manage db list
  3. 上传network-tool-1.1.tar.gz工具包,并依次执行以下命令,在master db所在的服务器上执行停止集群服务的工具:
    #解压工具包
    [root@localhost ~]# tar zxf network-tool-1.0.tar.gz
    #运行脚本
    [root@localhost ~]# ./prepare.sh  
    脚本执行之后,需手动输入UI的账号密码,并输入yes确认,该脚本会停止所有的服务。
  4. 手动修改所有服务器的网卡地址。
    Note: 不能修改服务器的主机名。
  5. 修改脚本的网络文件配置。需要修改/opt/sds/network-tool/conf/network.conf 中的各网络信息,修改/opt/sds/network-tool/conf/hosts 中的主机管理网 IP 信息。
  6. 执行命令./modify-network.sh,运行服务修改脚本。修改完成后,等待Ceph状态健康即可。
    Note:
    • 脚本文件执行成功之后,xdc 恢复很慢,可能需要等待5min , 需要等待Ceph和 xdc 恢复之后再进行创建操作。验证方法:进行创建块存储卷操作。
    • 脚本执行过程中ceph.conf 还没更新完,可能会出现重起 osd的现象,会导致脚本执行完成后,查看ceph 状态出现osd down error。

      解决办法:先查看/etc/ceph/ceph.conf 地址是否更新,如果是,执行命令systemctl restart ceph-osd.target重启服务 (重启osd的命令)。
  7. 修改镜像服务器的监控节点:

    通过UI方式登录云平台,在镜像服务器详情页的监控节点界面,删除旧的监控节点IP。

重连镜像服务器

重连镜像服务器会重新部署代理程序进行相关检查。

重连镜像服务器失败需检查的因素:
  1. 镜像仓库需检查SSH端口号、用户名、密码、用户名是否拥有sudo权限。
  2. Ceph镜像服务器需检查分布式块存储是否正常。重连失败时,需检查Ceph IP地址、Ceph SSH 端口、用户名、密码、用户名是否有sudo权限,Ceph集群状态是否正常。

SAN存储

SAN存储分为iSCSI存储(iSCSI Storage)和FC存储(FC Storage):
  • iSCSI存储(iSCSI Storage):基于iSCSI协议构建的SAN存储。用户可将iSCSI存储上划分的块设备添加为Shared Block主存储,或直接透传给云主机使用。
  • FC存储(FC Storage):基于FC协议构建的SAN存储。用户可将FC存储上划分的块设备添加为Shared Block主存储,或直接透传给云主机使用。
iSCSI存储支持以下操作:
操作 描述
添加iSCSI存储 添加一个新的iSCSI存储。
编辑 修改iSCSI存储的名称。
启用iSCSI存储 将处于停用状态的iSCSI存储启用。
停用iSCSI存储 将处于启用状态的iSCSI存储停用。
加载集群 将iSCSI存储加载到集群。
卸载集群 将iSCSI存储从已加载的集群上卸载。
同步数据 同步iSCSI存储上的数据。
删除iSCSI存储 删除iSCSI存储。
Note:
  • iSCSI存储从集群卸载后才能删除,卸载集群会断开物理机与iSCSI存储的连接。
  • 块设备作为主存储使用,删除iSCSI存储将会使主存储失联。
  • 块设备透传给云主机使用,删除iSCSI存储将会有数据丢失风险。
FC存储支持以下操作:
操作 描述
同步设备信息 手动刷新FC存储列表,识别最新的FC存储列表。

应用场景

  • 将iSCSI磁盘或FC磁盘直接透传给云主机使用。
  • 以共享块的方式,将iSCSI磁盘或FC磁盘添加为Shared Block主存储。

注意事项

iSCSI存储:
  • 未被加载到云主机的磁盘,支持添加为Shared Block主存储。
  • 添加为主存储的LUN不可用于其他用途。
  • 未添加为主存储的磁盘支持加载到云主机。
  • 一个磁盘支持加载到多个云主机,一个云主机支持加载多个磁盘。
FC存储:
  • 集群状态正常且未被加载到云主机的块设备,支持添加为Shared Block主存储。
  • 添加为主存储的LUN不可用于其他用途。
  • 未添加为主存储的块设备支持加载到云主机。
  • 一个块设备支持加载到多个云主机,一个云主机支持加载多个块设备。

SAN存储运维(扩展)

iSCSI存储运维

iSCSI存储计划性运维步骤如下:
  1. 添加新iSCSI设备到ZStack Cloud云平台。
  2. 在iSCSI的server端配置远端可访问服务器IP等信息,确保iSCSI服务端能正常访问iSCSI服务器。
  3. 通过UI方式登录云平台,在SAN存储 > iSCSI存储界面,添加iSCSI服务器。
  4. 输入登录iSCSI存储登录信息进行登录。
  5. 完成后勾选iSCSI存储同步数据即可。

FC-SAN存储运维

FC-SAN存储计划性运维步骤如下:
  1. 添加FC-SAN存储到ZStack Cloud云平台。
  2. 联系存储厂商将FC-SAN映射到物理服务器上,确保服务器上能正常识别到此FC-SAN划分的存储lun。
  3. 通过UI方式登录云平台,在SAN存储 > FC存储界面查看映射的FC-SAN存储。
  4. 完成扫描后可点击同步设备信息按钮同步存储数据。

物理网络

物理网络:物理环境中部署的真实网络,包括管理网络、存储网络、业务网络、备份网络、迁移网络,不同类型网络对应不同的应用场景,用户可根据实际规划,为对应的物理网口标记网络类型。

物理网络类型

物理环境中部署的网络资源主要分为以下几种类型:
  • 管理网络:管理网络是管理控制云平台相关物理资源的网络。管理节点通过管理网络与平台上的物理机、主存储、镜像服务器、VPC路由器,及独享型负载均衡实例通信。ZStack Cloud会自动识别环境中部署的管理网络:
    • 资源中心 > 网络资源 > 专用网络中添加的管理网络属于此处定义的管理网络。
    • ZStack Cloud 展示的物理机IP所在网络属于管理网络。
    • 物理机回调地址所在的网络属于管理网络。
  • 存储网络:存储网络是存储服务使用的专门网络,云平台通过存储网络判断云主机的健康状态。为避免潜在风险,建议部署单独的存储网络。
  • 业务网络:业务网络是供云主机使用,以对外提供应用服务的网络。用户可将实际部署的业务网络添加为云平台上的二层网络、三层网络资源,并加载给云主机使用。
  • 备份网络:本地灾备场景下,本地业务数据备份和还原使用的专门网络。使用灾备服务高级功能需部署此网络。
  • 迁移网络:用于云主机在当前云平台内迁移的专门网络。
图 5所示:
图 5. 物理网络部署


功能特点

  • 物理网络界面实际展示物理机上部署的网口(包括聚合网口和未聚合网口),物理机通过这些网口实现网络连接,用户通过物理网口进行物理网络管理。
  • 用户可根据实际网络规划,为物理网口标记对应的网络类型。管理网络类型由系统自动标记,其他网络类型由用户自行标记:
    • 网络资源 > 专用网络中添加的管理网络,其对应的二层网络接口将自动绑定管理网络标签。
    • 物理机IP所在网络的网口将自动绑定管理网络标签。
    • 物理机回调地址所在网络的网口将自动绑定管理网络标签。
  • 标记完成后,用户可分别查看各类型网络的流量监控,灵活、精准掌握网络负载情况。

物理网络操作

物理网络支持以下操作:
操作 描述
标记物理网口类型 为物理网口绑定网络类型标签。
修改物理网络类型 为物理网口添加或删除网络类型标签。
Note: 管理网络标签由系统自动绑定到对应网卡。不支持为物理网口自定义添加或删除管理网络标签。
运维手册 | 4.8.38 | ZStack Cloud · ZCF | ZStack 资源中心