文档目录

高级功能

裸金属管理

裸金属设备无法获取硬件信息,怎么办?

裸金属设备无法获取硬件信息一般有以下两种原因,可根据原因分类,尝试参考解决方案进行排查解决:

原因一

服务器存在多个IPMI地址,同时存在共享网络配置地址、专有网络地址。

解决方案

登录服务器带外管理页面,关闭bmc共享网络配置地址,保留专有网络地址后重新获取裸金属设备硬件信息。

原因二

裸金属主机BIOS模式需配置为Legacy。

解决方案

修改裸金属主机BIOS模式为Legacy后,重新获取硬件信息。关于裸金属功能,详情请参考《用户手册》裸金属管理章节

解决方案

若非以上两种原因,可尝试检查以下配置进行排查:

  • 请确认部署网络内除了部署服务器没有其它DHCP服务。
  • 请确认裸金属设备连接部署网络的网卡在BIOS中开启PXE功能。

    需确保该PXE网卡为首张启动网卡,或启动顺位在PXE网卡之前的所有网卡均关闭PXE功能。

Ceph主存储创建裸金属主机失败,如何解决?

原因

带宽过低导致创建超时。

解决方案

操作步骤

  1. SSH连接至管理节点。
  2. 依次执行以下命令,修改超时时间为24小时:
    [root@localhost ~]# zstack-cli
    admin >>>LogInByAccount accountName=admin password=$password //密码为平台admin用户密码
    admin >>> UpdateGlobalConfig category=baremetal2 name=convert.volume.to.local.disk.timeout value=24h

弹性裸金属管理

裸金属节点无法获取硬件信息,如何解决?

原因

裸金属节点无法获取硬件信息一般有以下三类原因:
  • 网络问题:
    • 添加网关节点时,网关节点的网卡和裸金属节点PXE启动网卡可能未在同一个二层网络。
    • 裸金属节点可能接入了其他DHCP网络,PXE启动时获取了其他DHCP服务提供的地址。
  • 配置问题:
    • 裸金属节点BIOS可能未设置UEFI启动。
    • 裸金属节点与网关节点互联的网卡可能未设置PXE模式启动。
    • 网关节点上的TFTP等服务可能没有正常启动。
  • 服务器硬件兼容性问题:
    • 服务器硬件和云平台可能会存在兼容性问题,导致弹性裸金属功能无法正常使用,例如网卡固件版本可能存在不支持UEFI启动的问题。

解决方案

可根据以上问题分类,尝试以下步骤进行排查:

  • 排查网络问题:
    1. 请与网络工程师确认,添加网关节点时所选择的网卡是否和裸金属节点的部署网卡同属一个VLAN网络。若不属于同一个VLAN网络,需重新部署二层网络。
    2. 登录至网关节点系统,查看/var/log/zstack/baremetal/dnsmasq.log日志文件,确认裸金属节点是否获取了除部署网络之外的IP地址。若存在部署网络之外的IP地址,按照实际情况移除或修改该网络配置。
  • 排查裸金属节点配置问题:
    1. 重启裸金属节点进入BIOS界面,在BOOT Manager处确认裸金属节点BIOS模式。若为Legacy模式,修改成UEFI模式即可。
    2. 重启裸金属节点进入BIOS界面,在BOOT Manager处检查并按需设置网卡启动模式为PXE启动。
  • 排查网关节点配置问题:
    若网络连接正确,且BIOS设置均正确,仍无法获取硬件信息,可能是网关节点上的TFTP服务没有正常启动。
    1. 进入网关节点系统,执行命令systemctl status zstack-baremetal-tftpd查看TFTP服务状态。若服务状态异常,可执行systemctl start zstack-baremetal-tftpd手动启动TFTP服务,或直接登录云平台删除网关节点,并重新添加。
  • 排查服务器硬件兼容性问题:
    若以上网络连接和配置均无问题,可能是由于服务器硬件本身不兼容。此时可同时联系对应服务器硬件提供商和ZStack Cloud云平台技术支持协同解决。

解决方案

可尝试检查以下步骤进行排查:

  • 请确认网关节点的网卡和裸金属节点PXE启动网卡在同一个独立二层网络互联。
  • 请确认部署网络内不存在其他DHCP服务,避免DHCP冲突。
  • 请确认裸金属节点BIOS已设置UEFI启动。
  • 请确认裸金属节点与网关节点互联的网卡已设置PXE模式启动。
  • 请确认网关节点上的DHCP、TFTP等服务已正常启动。
  • 请确认服务器硬件兼容性良好。

弹性裸金属实例登录缓慢,如何解决?

原因

弹性裸金属实例配置了DNS解析导致登录缓慢。

解决方案

操作步骤

  1. SSH连接至弹性裸金属实例。
  2. 禁用/etc/ssh/sshd_config文件中的UseDNS选项,并注释/etc/resovle.conf文件中的DNS域名。

网关节点添加失败,如何解决?

原因

网关节点没有映射LUN设备,导致添加网关节点所选择的弹性裸金属集群无法挂载IPSAN主存储。

解决方案

将LUN设备映射给网关节点即可。关于弹性裸金属功能,详情请参考《用户手册》弹性裸金属管理章节

灾备管理

本地备份任务失败,如何解决?

原因

进程打开的文件数超过限制。

解决方案

操作步骤

  1. 登录本地备份服务器,执行以下命令查看连接数:
    [root@localhost ~]# lsof -p `pgrep zstore`|wc -l
    Note: max open files参数值为4096。若返回的连接数大于4096,表示进程打开的文件数超过了限制。
  2. 执行以下命令,重启zstore服务释放连接数:
    [root@localhost ~]#  systemctl restart zstack-imagestorebackupstorage.service

如何手动取消灾备任务?

解决方案

  • 可通过重启云主机快速取消灾备任务。
  • 若因业务限制不能重启云主机,可参考以下步骤:
    1. 备份过程中,可登录云主机所在的物理机,执行以下命令查看灾备任务:
      [root@localhost ~]#  virsh qemu-monitor-command UUID --pretty '{ "execute": "query-block-jobs" }'
    2. 执行以下命令取消灾备任务:
      [root@localhost ~]#  virsh qemu-monitor-command UUID '{"execute": "block-job-cancel", "arguments": {"device": "zs-516"}}'
      Note: 参数"device": "zs-516"由步骤一中的命令查询得到。若存在两块盘,需执行两次命令,并将device修改为对应标号。

迁移服务

如何将Hyper-V平台云主机迁移至本云平台?

解决方案

操作步骤

    可通过以下步骤实现:

  1. 登录Hyper-V平台。
  2. 找到源云主机并进行导出。
  3. 将导出云主机的vhdx文件传输至本云平台目标物理机中。
  4. 进入目标物理机系统,执行以下命令检查vhdx文件完整性:
    [root@localhost ~]# qemu-img check -r all 1001045.vhdx
    Note: 返回No errors were found on the image则表示通过文件完整性检查。
  5. 执行以下命令转换文件格式:
    [root@localhost ~]# qemu-img convert -O qcow2 1001045.vhdx vm-1100074-disk-0.qcow2
    Note: 转换后的文件包含源云主机系统盘镜像以及数据盘镜像。
  6. 将源云主机系统盘镜像和数据盘镜像上传至本云平台,分别作为新建云主机的系统镜像和云盘镜像。
  7. 在本云平台使用所上传的系统镜像和云盘镜像创建云主机。

VMware双系统云主机迁移至本云平台时报错,如何解决?

原因

V2V迁移时,若云主机使用多操作系统,系统默认不会自动指定第一启动项,导致迁移报错。

解决方案

操作步骤

    可进入管理节点系统,执行以下命令修改全局设置,开启系统自动指定第一启动项功能:

  1. 开启zstack-cli会话:
    [root@localhost ~]# zstack-cli
  2. 使用admin账户登录云平台:
    admin >>> LogInByAccount accountName=admin password=xxx //密码为平台admin用户密码
  3. 开启系统自动指定第一启动项功能:
    admin >>> UpdateGlobalConfig category=v2v name=v2v.enableRootFirst value=true

如何将KVM平台的云主机迁移至本云平台中?

解决方案

ZStack Cloud提供V2V迁移服务,支持将基于KVM的源云平台的云主机及数据完整迁移至ZStack Cloud云平台。详情请参考《迁移服务使用教程》。

云主机迁移失败,怎么办?

现象

云主机迁移失败出现以下报错信息:
{
  "error": {
    "code": "HOST.1009",
    "description": "Failed to migrate vm on hypervisor",
    "details": "failed to migrate vm[uuid:90bb61f55e774f5f89c9e1ea46db7661] from kvm host[uuid:e5105c61114a4efe8bcc025f744226bd, ip:10.0.247.244] to dest host[ip:10.0.197.238], unable to migrate vm[uuid:90bb61f55e774f5f89c9e1ea46db7661] to qemu+tcp://10.0.197.238/system, internal error: Attempt to migrate guest to the same host localhost.domain.com"
  },
  "createdTime": 1488170137857,
  "type": {
    "_name": "key.event.API.API_EVENT"
  },
  "id": "e6bcd7c33ad9446b919e11cd647fc8dc"
}

原因

两台物理机hostname相同。KVM云主机在线迁移依靠hostname进行确认物理机,若hostname相同即被认定为同一台物理机。

解决方案

建议对物理机设置不同的hostname。若遇到以上报错,请联系官方技术支持获取帮助。

云主机V2V迁移失败,如何解决?

云主机V2V迁移失败一般存在多种现象和原因,可根据以下现象和原因分类,尝试参考解决方案进行排查解决:

现象

云主机V2V迁移失败一般可能出现以下七种现象:
  • 现象一:云主机V2V迁移失败,出现libguestfs error: grep:/etc/selinux/disabled/contexts/files/file_contexts: No such file ordirectory报错。
  • 现象二:云主机V2V迁移任务提示超时。
  • 现象三:云主机V2V迁移失败,出现operation error, because:target host cannot Access NFS报错。
  • 现象四:云主机V2V迁移失败,出现Expecting VMX entry 'numvcpus' to be an unsigned integer (1 or a multiple of 2) but found 3报错。
  • 现象五:ZStack Cloud 3.1版本迁移至ZStack Cloud 3.6版本失败,出现unsupported flags (0x4) in function qemuDomainBlockCopy报错。
  • 现象六:Windows云主机迁移失败。
  • 现象七:V2V迁移提示无法识别到源物理机上的云主机。

原因一

出现现象一,可能是由于selinux相关配置存在问题。

解决方案

在云主机系统内执行vi /etc/selinux/config命令,将参数修改为SELINUXTYPE=targeted即可。
图 1所示:
图 1. 修改配置


原因二

出现现象二,可能是由于迁移数据量过大,导致迁移超时任务失败。

解决方案

在云主机系统内依次执行以下命令,修改V2V迁移超时时间:
[root@localhost ~]# zstack-cli
admin >>> LogInByAccount accountName=admin password=$password  //密码为平台admin用户密码
admin >>> UpdateGlobalConfig name=longJob.api.timeout category=longJob value=xxx  //xxx为超时时间

原因三

出现现象三,可能是由于源物理机qemu版本过低。

解决方案

检查源云平台物理机qemu版本是否低于1.1,若低于1.1版本,需升级源云平台物理机qemu。
Note: 本云平台同一集群内所有物理机qemu版本需保持一致。

原因四

出现现象四,可能是由于云主机CPU数量需要为1或者2的倍数。

解决方案

修改云主机CPU数量为1或者2的倍数后,重新迁移云主机。

原因五

出现现象五,可能是由于源物理机Libvirt版本过低。

解决方案

升级源云平台版本,此操作将自动升级Libvirt版本,升级完成后重新V2V迁移。

原因六

出现现象六,可能是由于源云平台Windows云主机未关闭休眠功能。

解决方案

在Windows系统内执行以下命令,关闭系统休眠功能:
#cmd-->“powercfg -h off”
Note: 若有系统休眠相关需求,可在迁移完成后手动打开系统休眠。

原因七

出现现象七,可能是由于源物理机SSH配置有访问控制。

解决方案

在源物理机系统内编辑/etc/hosts.allow文件,添加需要放行的IP地址。添加完成后重新创建迁移任务。
Note: 建议新增访问规则只对迁移服务主机放行,避免大范围网段放行。

云主机V2V迁移后系统异常,如何解决?

现象

迁移后云主机无法打开进入系统。

原因

云主机系统未安装或不支持virtio驱动。

解决方案

修改云主机平台类型为Other,重启云主机,再次进入系统。

云主机V2V迁移后网络异常,如何解决?

现象

使用V2V迁移Linux系统云主机后,在云主机内无法正常启动网络服务。

原因

VMware类型源云平台的网卡设备名为ens33等,而KVM类型源云平台的网卡设备名为eth0、eth1等,二者网卡设备名不一致导致配置文件不能正常识别网卡,无法启动网络服务。

解决方案

操作步骤

  1. 在云主机系统内执行以下命令,进入云主机网卡配置文件目录:
    [root@localhost ~]#  cd /etc/sysconfig/network-scripts/
  2. 执行以下命令,修改网卡配置文件:
    [root@localhost ~]#  vim ifcfg-ens33
  3. 修改NAMEDEVICE参数为eth0。
    图 2所示:
    图 2. 修改配置文件


  4. 执行以下命令,保存修改并退出:
    [root@localhost ~]#  mv /etc/sysconfig/network-scripts/ifcfg-ens32 /etc/sysconfig/network-scripts/ifcfg-e
  5. 执行以下命令,重启网络服务:
    [root@localhost ~]#  systemctl network restart
    Note: 变更网络配置及重启网络服务前需确保该物理机没有业务正在运行。

云主机V2V迁移后Windows2003开机蓝屏,如何解决?

现象

云主机V2V迁移后Windows2003开机蓝屏。

原因

由于硬件配置变化导致蓝屏错误 。

解决方案

操作步骤

  1. vmware侧卸载guest tools,以及相关驱动。
  2. 云主机根盘配置为IDE。

    示例:win2003编辑设置>磁盘1>虚拟设备节点,将虚拟设备节点选项卡设置为IDE 0。

  3. MergeIDE iso配置。

    使用V2V辅助工具:记录IDE控制器的信息, 挂载到MergeIDE iso。启动VM后,执行MergeIDE iso文件。

  4. 导出OVF模板。
    执行路径:操作-win-2003>模板>导出OVF模板。
  5. OVF模板导入ZStack Cloud
    将新导出的OVF模板导入ZStack Cloud,然后启动VM。
    Note: 若导入OVF失败,可通过上传VMDK文件的方式创建云主机。

V2V迁移报错“could not find domain with name 'xxxx'”,如何解决?

现象

V2V迁移过程中,源主机名字符类型问题触发报错。

原因

源云主机名字存在云平台不支持的字符 。

解决方案

修改源云主机名称为全英文,即可正常完成迁移流程。

V2V迁移报错“failed to run virt-v2v”,如何解决?

现象

V2V迁移报错:failed to run virt-v2v,because unable to mount the disk image for writing

原因

源云主机windows系统已开启休眠模式 。

解决方案

  • 在windows内部执行:powercfg -h off
  • 继续执行:shutdown -s
  • 完成后关机,重新执行迁移命令。

租户管理

账户权限异常,如何解决?

现象

自定义角色无法加载负载均衡服务。

原因

自定义角色权限配置错误。

解决方案

操作步骤

  1. 修改自定义角色权限配置,点击运营管理 > 租户管理 > 人员与权限 > 角色,进入角色界面。在自定义角色详情页的API权限子页面中,点击修改
  2. 勾选其他服务权限和ZWatch相关接口中的查询获取权限。
    Note: 建议按照最小权限原则为角色赋权。
    图 3所示:
    图 3. 修改API权限


租户管理项目配额无法修改,如何解决?

原因

可能是由于浏览器缓存或插件问题。

解决方案

更换浏览器可临时解决,推荐使用谷歌Chrome 62及以上版本浏览器。

vCenter

为什么纳管vCenter的云主机无法打开控制台?

功能说明

VMware无法为运行中的云主机修改VNC配置。只有通过ZStack Cloud创建、重启或者热迁移的vCenter云主机才可以直接开启控制台。

纳管的云主机无法挂载云盘,如何解决?

原因

不支持热加载或加载数量超过上限。

解决方案

操作步骤

  1. 可尝试关闭云主机后挂载云盘。
  2. 检查云主机是否存在CD-ROM、软驱等可卸载设备,若存在,请尝试卸载后再挂载云盘。

创建云主机异常,如何解决?

现象

纳管VMware创建云主机无法选择集群和物理机。

原因

VMware物理机空间不足。

解决方案

检查VMware ESXI物理主机存储空间,若空间不足,需在第三方云平台中进行扩容操作。

纳管vCenter时出现“没有系统标签与资源类型【VolumeVO】匹配”报错,怎么办?

原因

可能是由于添加vCenter时,填写的vCenter用户权限不够导致。

解决方案

  • 检查用户权限,必要时可以开启全部权限。
  • 重新添加vCenter,使用administrator@vsphere.local用户名。

使用AMD R7-5800H型号CPU在VMware嵌套环境创建云主机失败,如何解决?

现象

在VMware嵌套环境中创建云主机出现如下报错:
libvirt error: internal error: qemu unexpectedly closed the monitor: 2020-10-28T02:35:23.836129Z qemu-kvm: error: failed to set MSR 0x10a to 0x0 q

解决方案

操作步骤

  1. 检查物理机dmesg日志,会发现kvm: vcpu0 unhandled rdmsr: 0x199报错。
  2. 在物理机系统内执行以下命令,向KVM模块传递参数:
    echo 1 > /sys/module/kvm/parameters/ignore_msrs
  3. 完成KVM模块传参后即可解决。

vCenter云主机控制台打不开,提示需下载受信任的根CA证书后再试,如何解决?

现象

点击vCenter云主机控制台,无法打开控制台并出现以下提示信息:控制台打开异常,请使用浏览器登录vCenter并在登陆界面下载受信任的根CA证书后再试。

解决方案

操作步骤

  1. 打开浏览器,输入vCenter IP地址,进入vCenter主界面。
  2. 在vCenter主界面,右键点击下载受信任的根CA证书,选择将链接另存为


  3. 下载并解压CA证书。
  4. 在Windows中搜索打开Internet属性
  5. Internet属性弹窗中,点击内容选项卡,然后选择证书


  6. 证书弹窗中,点击受信任的根证书颁发机构选项卡,然后选择导入


  7. 证书导入向导弹窗中,跟随向导上传解压后的CA证书文件。


  8. 重启浏览器
  9. 在云平台打开vCenter云主机控制台。
常见问题解答(FAQ) | 4.8.38 | ZStack Cloud · ZCF | ZStack 资源中心