文档目录

概述

物理服务器正常运行过程中,若突发机房断电且无备用电源,会造成其上的云主机和物理机的硬盘磁头骤停或写入位置错误,进而导致数据文件乃至系统文件损坏,致使云主机和物理机无法正常启动系统。本文档涵盖云主机系统和物理机系统两类故障场景,并针对不同故障场景提供对应修复方案,供运维工程师手动修复系统时参考使用。

云主机系统修复

物理机异常断电时,不同类型的云主机系统故障的类型和程度均可能不同。本章节主要阐述以下两种类型云主机故障场景和修复方案:

Windows云主机系统修复

Windows云主机无法进入系统

故障场景

若Windows云主机启动时出现The Boot Configuration Data for your PC is missing or contains errors提示,推测故障原因可能为物理机异常断电,造成云主机引导文件丢失,云主机系统保留分区被标记为非活动分区,导致云主机启动时无法进入系统。

如图 1所示:
图 1. 报错提示


修复方案

针对上述故障场景,可尝试参考以下步骤排查解决:
  1. 登录云平台,点击资源中心 > 云资源池 > 虚拟资源 > 云主机,进入云主机界面。选择故障云主机,在该云主机详情页的基本信息中,点击编辑平台和操作系统,弹出修改平台和操作系统界面,确认云主机类型为Windows云主机。
    如图 2所示:
    图 2. 云主机平台和操作系统


  2. 在故障云主机详情页中,点击配置信息 > 资源配置 > 虚拟光驱,进入虚拟光驱界面。点击操作 > 加载ISO,加载PE系统ISO文件至故障云主机。
    Note: 建议选择主流PE系统或工程师常用型号PE系统。
  3. 点击更多操作 > 系统配置 > 设置启动顺序,弹出设置启动顺序界面。将云主机启动顺序设置为CdRom (光盘)启动,并勾选仅在下一次启动生效,之后将恢复从硬盘启动选项。
    如图 3所示:
    图 3. 设置启动顺序


  4. 重启云主机进入PE系统,打开计算机管理界面,点击计算机管理 (本地) > 存储 > 磁盘管理,进入磁盘管理界面。右键点击系统保留分区,选择将分区标记为活动分区,修改后重启云主机,系统恢复。
    如图 4所示:
    图 4. 标记活动分区


Windows系统文件损坏

故障场景

相关系统文件正在执行写操作时,突发物理机断电,造成Windows系统盘/windows/system32目录下文件损坏,导致云主机无法正常开机。

修复方案

针对上述故障场景,可尝试参考以下步骤排查解决:
  1. 登录云平台,点击资源中心 > 云资源池 > 虚拟资源 > 云主机,进入云主机界面。选择故障云主机,点击操作 > 快照与镜像 > 创建镜像,弹出创建镜像界面,为云主机创建镜像备份。
    Note: 执行系统修复操作前,需为云主机创建备份,避免因系统修复过程中对云主机系统文件产生不可逆损坏,而造成数据丢失。
    如图 5所示:
    图 5. 创建镜像


  2. 在故障云主机详情页中,点击配置信息 > 资源配置 > 虚拟光驱,进入虚拟光驱界面。点击操作 > 加载ISO,加载PE系统ISO文件至故障云主机。
    Note: 建议选择主流PE系统或工程师常用型号PE系统。
  3. 点击更多操作 > 系统配置 > 设置启动顺序,弹出设置启动顺序界面。将云主机启动顺序设置为CdRom (光盘)启动,并勾选仅在下一次启动生效,之后将恢复从硬盘启动选项。
    如图 6所示:
    图 6. 设置启动顺序


  4. 重启云主机进入PE系统,打开此电脑界面,选中磁盘后右键点击属性,弹出磁盘属性界面,点击工具 > 检查,启动Windows磁盘修复。
    如图 7所示:
    图 7. Windows磁盘修复


  5. 修复完成后,测试能否正常打开/windows/system32目录下config文件夹,并重启云主机测试是否修复成功。若仍未解决,需重新进入PE系统,将/windows/system32/config/Regback目录下所有文件拷贝至/windows/system32/config目录下后,重启恢复。

Windows云主机出现蓝屏

故障场景

物理机断电恢复后,若重启Windows云主机出现蓝屏,无法正常开机。推测故障原因可能为Windows云主机驱动损坏,需要重新安装驱动。

如图 8所示:
图 8. Windows云主机蓝屏


修复方案

针对上述故障场景,可尝试参考以下步骤排查解决:
  1. 登录云平台,点击资源中心 > 云资源池 > 虚拟资源 > 云主机,进入云主机界面。选择故障云主机,在该云主机详情页的基本信息中,点击编辑平台和操作系统,弹出修改平台和操作系统界面,根据实际情况修改云主机平台和操作系统。
    如图 9所示:
    图 9. 修改平台和操作系统


  2. 在故障云主机详情页的高级配置信息中,关闭Virtio开关,修改云主机磁盘类型。
    如图 10所示:
    图 10. 关闭Virtio


  3. 安装性能优化工具,重新安装驱动后,Windows云主机恢复。
    如图 11所示:
    图 11. 安装性能优化工具


Linux云主机系统修复

Linux云主机grub.cfg文件丢失

故障场景

若Linux云主机系统进入GRUB命令行(grub>)模式,推测故障原因可能为Linux云主机/boot/grub2/grub.cfg文件丢失,导致系统无法正常启动。

修复方案

针对上述故障场景,本章节将针对不同模式的Linux云主机分别介绍对应的修复方案:
UEFI模式云主机可尝试参考以下步骤排查解决:
  1. 打开云主机控制台,执行ls命令查询磁盘分区。可根据命令返回结果判断磁盘分区,其中hd表示云主机磁盘,gpt表示磁盘分区,例如:(hd0, gpt1)表示磁盘0上的分区1。
    如图 12所示:
    图 12. 查询磁盘分区


  2. 执行ls (hd0,gpt1)/命令查看分区1中的文件。通过查看分区中的文件,查询grub2或grub目录所在分区,即boot分区。本场景中,boot分区为 (hd0, gpt2)。
    如图 13所示:
    图 13. 查看分区文件


  3. 执行ls命令找到根分区所在分区。根分区下通常存在/etc、/dev、/proc等目录。
  4. 执行cat (lvm/centos-root)/etc/fstab命令查看挂载信息,并记录根目录所在分区信息。
    Note: 系统分区方式为LVM时,可尝试通过LVM类型系统根分区路径/dev/mapper/centos-root查看挂载信息。
    如图 14所示:
    图 14. 查看挂载信息


  5. 执行set root=(hd0,gpt2)命令设置引导分区,即boot分区,本场景为(hd0, gpt2)。
    如图 15所示:
    图 15. 设置引导分区


  6. 执行以下命令,加载内核启动映像,设置根分区:
    grub> linuxefi /vmlinuz-3.10.0-862.e17.x86_64 root=uuid=0404c631-636f-4983-9e7e-7d5375a38611
    • root=后填写步骤4中查看到的根分区UUID信息。
    • 若步骤4中查看到的根目录挂载信息为/dev/vda1形式,则填写root=/dev/vda1。
    • 若系统分区类型为LVM,则可以尝试填写root=/dev/mapper/centos-root。
    如图 16所示:
    图 16. 加载内核启动映像


  7. 设置Linux内核映像的初始ramdisk,输入initrdefi /initramfs-命令后,可按tab键补全命令。
    如图 17所示:
    图 17. 设置初始ramdisk


  8. 执行上述操作后,输入执行boot命令,启动并进入系统。
    如图 18所示:
    图 18. 启动系统


  9. 执行grub2-mkconfig -o /boot/efi/EFI/centos/grub.cfg命令,重新生成grub.cfg文件。文件生成后重启云主机,检查确认grub文件是否正常。至此UEFI模式云主机系统修复已完毕。
    如图 19所示:
    图 19. 生成grub.cfg文件


Legacy模式云主机可尝试参考以下步骤排查解决:
  1. 打开云主机控制台,执行ls命令查询磁盘分区。
    如图 20所示:
    图 20. 查询磁盘分区


  2. 执行ls (hd0,msdos1)/grub2命令或ls (hd0,msdos2)/grub2命令查询grub2目录所在分区位置,即boot分区。执行上述命令,返回结果为device.map i386-pc/ locale/ fonts/ grubenv的即为boot分区。本场景中,boot分区为 (hd0,msdos1)。
    如图 21所示:
    图 21. 查询分区


  3. 执行set root=(hd0,msdos1)命令,设置引导分区,即系统分区。
    如图 22所示:
    图 22. 设置引导分区


  4. 执行以下命令,挂载根设备,将boot分区设置为启动分区:
    Note: 需根据实际情况确定系统位置,可查看参考正常物理机。
    grub> linux16 /vmlinuz-3.10.0-957.27.6.da38eal.el7.x86_64 root=/dev/vda1
    如图 23所示:
    图 23. 挂载根设备


  5. 执行以下命令,指定初始化镜像:
    grub> initrd16 /initramfs-3.10.0-957.27.6.da38eal.el7.x86_64.img
    如图 24所示:
    图 24. 指定初始化镜像


  6. 执行上述操作后,输入执行boot命令,启动并进入系统。
    如图 25所示:
    图 25. 启动系统


  7. 执行grub2-mkconfig -o /boot/grub2/grub.cfg命令,重新生成gurb.cfg文件。
    如图 26所示:
    图 26. 生成grub.cfg文件


  8. 执行ll /boot/grub2命令,查看grub.cfg文件是否存在。至此Legacy模式云主机系统修复已完毕。
    如图 27所示:
    图 27. 查看grub.cfg文件


Linux云主机grub.cfg文件损坏

故障场景

若Linux云主机无法进入系统,推测原因可能为物理机异常断电造成系统/boot/grub文件损坏,导致云主机无法执行系统命令,进入系统失败。

修复方案

针对上述故障场景,可尝试参考以下步骤排查解决:
Note: 需根据环境具体报错信息进行对应修复。
  1. 登录云平台,点击资源中心 > 云资源池 > 虚拟资源 > 云主机,进入云主机界面。选择故障云主机,点击操作 > 电源 > 关闭电源,关闭云主机电源。
  2. 在故障云主机详情页中,点击配置信息 > 资源配置 > 虚拟光驱,进入虚拟光驱界面。点击操作 > 加载ISO,为云主机加载CentOS ISO文件。
    Note: 若虚拟光驱已加载ISO文件,需创建一个新的光驱后加载CentOS ISO文件。
    如图 28所示:
    图 28. 加载ISO


  3. 点击更多操作 > 系统配置 > 设置启动顺序,进入设置启动顺序界面,修改云主机启动顺序为CdRom (光盘)启动。
    如图 29所示:
    图 29. 设置启动顺序


  4. 重启该云主机,打开控制台,选择Troubleshooting。
    如图 30所示:
    图 30. 选择Troubleshooting


  5. 选择Rescue a CentOS system进入救援模式。
    如图 31所示:
    图 31. 救援CentOS系统


  6. 在救援模式界面,输入1以继续操作。
    如图 32所示:
    图 32. 输入1以继续操作


  7. 根据系统提示,执行chroot /mnt/sysimage命令,将根目录切换至硬盘系统的根目录中。
    如图 33所示:
    图 33. 切换根目录


  8. 执行ls /boot/grub命令,检查/boot/grub文件,发现grub目录已丢失。
    如图 34所示:
    图 34. 检查/boot/grub文件


  9. 执行lsblk命令,查看磁盘信息。
    如图 35所示:
    图 35. 查看磁盘信息


  10. 执行grub2-install --boot-directory=/boot /dev/vda命令,重新安装grub2文件。
    如图 36所示:
    图 36. 安装grub2文件


  11. 执行grub2-mkconfig -o /boot/grub2/grub.cfg命令,重新生成grub.cfg文件。
    如图 37所示:
    图 37. 生成grub.cfg文件


  12. 重启云主机后,可正常进入系统。

Linux云主机MBR损坏

故障场景

物理机断电恢复后,若Linux云主机无法正常启动,此时推测原因可能为云主机硬盘主引导记录(Master Boot Record)损坏导致云主机启动失败。

修复方案

针对上述故障场景,可尝试参考以下步骤排查解决:
Note: 需根据环境具体报错信息进行对应修复。
  1. 登录云平台,点击资源中心 > 云资源池 > 虚拟资源 > 云主机,进入云主机界面。选择故障云主机,点击操作 > 电源 > 关闭电源,关闭云主机电源。
  2. 在故障云主机详情页中,点击配置信息 > 资源配置 > 虚拟光驱,进入虚拟光驱界面。点击操作 > 加载ISO,为云主机加载CentOS ISO文件。
    Note: 若虚拟光驱已加载ISO文件,需创建一个新的光驱后加载CentOS ISO文件。
    如图 38所示:
    图 38. 加载ISO


  3. 点击更多操作 > 系统配置 > 设置启动顺序,进入设置启动顺序界面,修改云主机启动顺序为CdRom (光盘)启动。
    如图 39所示:
    图 39. 设置启动顺序


  4. 重启该云主机,打开控制台,选择Troubleshooting。
    如图 40所示:
    图 40. 选择Troubleshooting


  5. 选择Rescue a CentOS system进入救援模式。
    如图 41所示:
    图 41. 救援CentOS系统


  6. 在救援模式界面,输入1以继续操作。
    如图 42所示:
    图 42. 输入1以继续操作


  7. 根据系统提示,执行chroot /mnt/sysimage命令,将根目录切换至硬盘系统的根目录中。
    如图 43所示:
    图 43. 切换根目录


  8. 执行hexdump -C /dev/vda -n 521 -v命令,检查根云盘前521字节信息,发现MBR区域已损坏。
    如图 44所示:
    图 44. 检查MBR区域


  9. 执行grub2-install /dev/vda命令,修复磁盘MBR。
    如图 45所示:
    图 45. 修复磁盘MBR


  10. 执行hexdump -C /dev/vda -n 416 -v命令,再次检查根云盘MBR区域信息,发现返回结果非全0,MBR区域已修复。
    如图 46所示:
    图 46. 检查MBR区域


  11. 返回云平台,点击资源中心 > 云资源池 > 虚拟资源 > 云主机,进入云主机界面。选择问题云主机,点击操作 > 系统配置 > 设置启动顺序,进入设置启动顺序界面,修改云主机启动顺序为HardDisk (硬盘)启动。
    如图 47所示:
    图 47. 设置启动顺序


  12. 重启云主机后,可正常进入系统。

Linux云主机启动进入紧急模式

故障场景

若Linux云主机启动后,系统进入紧急模式,此时推测原因可能为物理机意外断电导致/etc/fstab/文件挂载分区所在的磁盘损坏。

修复方案

针对上述故障场景,可尝试参考以下步骤排查解决:
  1. 在紧急模式界面中,输入操作系统密码,进入紧急模式进行修复。
    如图 48所示:
    图 48. 输入操作系统密码


  2. 修改对应配置文件。
    Note:
    • 若存储设备正常,需将/etc/fstab配置文件中的错误挂载信息修改正确。
    • 若存储设备异常,需将异常设备的挂载信息进行删除或注释。
    如图 49所示:
    图 49. 修改配置文件




  3. 执行mount -a命令,重新挂载/etc/fstab配置文件分区信息。
    如图 50所示:
    图 50. 重新挂载分区信息


  4. 重启云主机,即可正常进入系统。

Linux云主机启动出现Attempted to kill init报错

故障场景

本地存储环境下物理机异常断电恢复后,启动Linux云主机时,出现Attempted to kill init报错。

修复方案

针对上述故障场景,可尝试参考以下步骤排查解决:
  1. 登录云平台,点击资源中心 > 云资源池 > 虚拟资源 > 云主机,进入云主机界面。选择故障云主机,点击操作 > 电源 > 关闭电源,关闭云主机电源。
  2. 在故障云主机详情页中,点击配置信息 > 资源配置 > 虚拟光驱,进入虚拟光驱界面。点击操作 > 加载ISO,为云主机虚拟光驱加载CentOS 6.9的ISO文件。
    Note: 若虚拟光驱已加载ISO文件,需创建一个新的光驱再加载CentOS 6.9 ISO文件。
    如图 51所示:
    图 51. 加载ISO文件


  3. 点击更多操作 > 系统配置 > 设置启动顺序,进入设置启动顺序界面,修改云主机启动顺序为CdRom (光盘)启动,并勾选仅在下一次启动生效,之后将恢复从硬盘启动选项。
    如图 52所示:
    图 52. 设置启动顺序


  4. 重启云主机,进入安装启动菜单,选择Rescue installed system进入救援模式。
    如图 53所示:
    图 53. 进入救援模式


  5. 选择语言和键盘,语言默认为English,键盘默认为us。
    如图 54、图 55所示:
    图 54. 选择语言


    图 55. 选择键盘


  6. 按需设置网络,若需要设置网络选择Yes,若不需要则选择No。
    如图 56所示:
    图 56. 设置网络


  7. 若选择设置网络,进入以下界面选择网卡。
    如图 57所示:
    图 57. 选择网卡


  8. 进入以下界面设置IP。
    Note: IP设置需与云主机原IP地址保持一致。
    如图 58所示:
    图 58. 设置IP


  9. 进入选择Rescue选项界面,选择Continue。
    如图 59所示:
    图 59. 选择Rescue






  10. 原系统挂载于/mnt/sysimage路径下,若需切换至root环境下,执行chroot /mnt/sysimage命令即可。
  11. 选择shell Start shell进入shell命令行模式。
    如图 60所示:
    图 60. 进入shell命令行模式


  12. 在shell命令行模式界面中,输入执行chroot /mnt/sysimage命令,将/mnt/sysimage目录下文件切换至根目录下,出现error while loading shared libraries: libc.so.6: cannot open shared object file: No such file or directory报错。
    如图 61所示:
    图 61. 执行chroot命令


  13. 在一台正常的配置相同的云主机中,执行ls -l libc.so.6命令,查找libc.so.6文件所在目录及文件类型。
    如图 62所示:
    图 62. 查找libc.so.6文件


    1. 在故障云主机系统中,执行cd /mnt/sysimage/lib64命令进入该目录。
    2. 执行ls libc.so.6命令,查看libc.so.6文件是否存在,发现无此文件。
    3. 执行ls libc-2.12.so命令,查看libc-2.12.so文件,发现存在此文件。
    4. 执行ln -s libc-2.12.so libc.so.6命令,创建软链接。
    5. 执行ls -l libc.so.6命令查看文件,发现创建成功。
    6. 重新执行chroot /mnt/sysimage命令,成功切换至系统根目录。
    如图 63所示:
    图 63. 切换系统根目录


  14. 输入执行exit命令退出后,重启云主机,成功进入系统。

物理机系统修复

物理机系统盘硬盘故障

修复方案

针对物理机系统硬盘故障场景,可尝试参考以下步骤排查解决:
  1. 准备新硬盘,新硬盘需满足以下条件:
    • 置换的硬盘应是同型号、同系列、同容量的硬盘。
    • 硬盘需是全新硬盘或者为未分区、未格式化的硬盘。
    • 硬盘需插回原RAID通道,即原故障硬盘的插槽。
  2. 确认故障硬盘所在服务器的位置,避免拔除正常硬盘。
  3. 确认硬盘是否支持热插拔。若故障硬盘所在物理机上运行着较为重要的云主机,建议先将云主机热迁移至其它物理机,避免云主机因物理机更换硬盘期间异常重启而受到影响。
以下为物理机系统盘硬盘故障修复的详细步骤,可供参考:
  1. 登录云平台,点击资源中心 > 硬件设施 > 计算设施 > 物理机,进入物理机界面。选择故障硬盘所在的物理机,在该物理机详情页的关联资源子页面中,点击云主机,查看该物理机上运行的云主机。
    如图 64所示:
    图 64. 查看云主机


  2. 选中待迁移的云主机,点击操作 > 更改物理机,进入更改物理机界面,选择目标物理机进行迁移。
    Note:
    • 建议勾选启用自动收敛模式以确保云主机热迁移成功。
    • 为保证迁移任务效率,建议云主机并发迁移任务数量不超过三个。
    如图 65所示:
    图 65. 更改物理机


  3. 云主机迁移完成后,返回至物理机界面。选择故障硬盘所在的物理机,点击操作 > 进入维护模式,等待物理机启用状态更新为进入维护模式。
    如图 66所示:
    图 66. 物理机进入维护模式


  4. SSH登录至待变更服务器系统,执行sync && sync && poweroff命令,安全关闭待变更服务器。
  5. 待服务器完全停止后,更换服务器上的故障硬盘,插入新硬盘。
  6. 查看新硬盘状态,可参考以下两种方式查看:
    • 启动服务器,进入阵列卡配置界面,查看确认新硬盘状态为Rebuild,表示硬盘数据正在同步中。
      如图 67所示:
      图 67. 查看硬盘状态


    • 登录服务器带外管理页面,查看新硬盘状态和数据同步进度。
      如图 68所示:
      图 68. 查看硬盘状态和数据同步进度


  7. 重启服务器,并引导至操作系统,检查确认对应的管理网络和存储网络均可正常通信。执行zs-show-network命令,检查节点网卡状态。
  8. 登录云平台,点击资源中心 > 硬件设施 > 计算设施 > 物理机,进入物理机界面。选择进入维护模式的物理机,点击操作 > 启用,启用物理机。等待物理机连接成功后,可将云主机迁移回该物理机。

物理机底层系统故障

故障场景

若物理机系统提示无法正常开机,推测原因可能为物理机异常断电造成系统或引导文件损坏,由此可能出现以下故障场景:
  • 物理机grub.cfg文件丢失
  • 物理机grub.cfg文件损坏
  • 物理机MBR损坏
  • 物理机进入紧急模式
  • 物理机启动出现Attempted to kill init报错

修复方案

针对上述故障场景,可参考本文档Linux云主机系统修复具体章节,对物理机底层系统故障进行相应修复。

术语表

实例

云平台中运行操作系统镜像的虚拟机或服务器,如云主机、弹性裸金属实例。

云主机(VM Instance)

运行在物理机上的虚拟机实例,具有独立的IP地址,可以访问公共网络,运行应用服务。

云盘(Volume)

为云主机提供存储,包括两种类型:根云盘、数据云盘。

根云盘(Root Volume)

云主机的系统云盘,用于支撑云主机的系统运行。

数据云盘(Data Volume)

云主机的数据云盘,用于云主机扩展的存储使用。

镜像(Image)

云主机或云盘使用的镜像模板文件,包括两种类型:系统镜像、云盘镜像。

计算规格(Instance Offering)

云主机涉及的CPU数量、内存、网络设置等规格定义。

云盘规格(Disk Offering)

云盘涉及的容量大小的规格定义。

SSH密钥(SSH Key)

SSH密钥是一种安全的云主机登录认证方式,由一个公钥和一个私钥组成。仅Linux云主机支持通过SSH密钥登录。

GPU规格(GPU Specification)

物理GPU设备或vGPU设备涉及的GPU帧数、显存、分辨率等规格定义,包括两种类型:物理GPU规格、vGPU规格。

vNUMA配置(vNUMA Configuration)

通过CPU绑定透传关联的物理机NUMA节点(pNUMA Node)拓扑,为云主机生成vNUMA节点(vNUMA Node)拓扑,实现云主机CPU优先访问所在vNUMA节点本地内存,提高云主机性能。

NUMA(Non-Uniform Memory Access)

非一致性内存访问,是一种计算机内存设计架构。该架构下,CPU访问内存的时间取决于CPU与内存的相对位置。通过优先访问相对位置较近的内存可缩短延迟,从而可提升主机系统性能。

pNUMA节点(pNUMA Node)

基于物理机NUMA架构预定义的NUMA节点,用于物理机CPU和内存管理。

pNUMA拓扑(pNUMA Topology)

CPU厂商基于NUMA架构预定义的物理机NUMA节点拓扑。

vNUMA节点(vNUMA Node)

基于CPU绑定透传关联的物理机NUMA节点而生成的云主机NUMA节点,用于云主机CPU和内存管理。

vNUMA拓扑(vNUMA Topology)

基于CPU绑定生成的云主机NUMA节点(vNUMA Node)拓扑。

本地内存(Local Memory)

CPU(pCPU或vCPU)通过所在NUMA节点(pNUMA节点或vNUMA节点)非CPU核部件中内存控制器可直接访问的内存。相比非本地内存,CPU访问本地内存的延迟更低。

CPU绑定配置(CPU Pinning)

将云主机的虚拟CPU(vCPU)与物理机的物理CPU(pCPU)严格关联,可为云主机分配特定的pCPU,提高云主机性能。

EmulatorPin配置(EmulatorPin Configuration)

将云主机中除vCPU和IO线程外的其他线程与物理机pCPU进行绑定,使云主机相关线程只运行在对应的pCPU上。

弹性伸缩组(Auto Scaling Group)

一组具有相同应用场景的云主机集合,可根据用户业务变化自动实现弹性伸缩或弹性自愈。

快照(Snapshot)

某一时间点某一磁盘的数据状态文件。

云主机调度策略(VM Scheduling Policy)

为云主机分配物理机的资源编排策略,可用于保障业务的高性能和高可用。

区域(Zone)

云平台内最大的一个资源定义,包括:集群、二层网络、主存储等资源。

集群(Cluster)

一组物理机(计算节点)的逻辑集合。

物理机(Host)

为云主机实例提供计算、网络、存储等资源的物理主机。

主存储(Primary Storage)

用于存储云主机磁盘文件(包括:根云盘、数据云盘、根云盘快照、数据云盘快照、镜像缓存等)的存储服务器。

镜像服务器(Backup Storage)

用于存储云主机镜像模板(含ISO)的存储服务器。

iSCSI存储(iSCSI Storage)

基于iSCSI协议构建的SAN存储。用户可将iSCSI存储上划分的块设备添加为Shared Block主存储,或直接透传给云主机使用。

FC存储(FC Storage)

基于FC协议构建的SAN存储。用户可将FC存储上划分的块设备添加为Shared Block主存储,或直接透传给云主机使用。

NVMe存储(NVMe Storage)

基于NVMe-oF协议构建的存储阵列,用户可将NVMe存储上划分的块设备添加为Shared Block主存储。

二层网络(L2 Network)

对应于一个二层广播域,进行二层相关的隔离。一般用物理网络的设备名称标识。

VXLAN网络池(VXLAN Pool)

在一组VXLAN隧道端点(VTEP)之上创建的VXLAN网络的集合,同一个VXLAN网络池内VXLAN网络标识符(VNI)不能重复。

三层网络(L3 Network)

云主机使用的网络配置,包括IP地址范围、网关、DNS等。

公有网络(Public Network)

一般表示可直接访问互联网的网络,由于公有网络是一个逻辑概念,在无法连接互联网的环境中,用户也可以自定义该网络。

扁平网络(Flat Network)

可与物理机网络直通,也可直接访问互联网的网络。云主机可使用扁平网络提供的分布式EIP访问公有网络。

VPC网络(VPC Network)

云主机使用的私有网络,可通过VPC路由器访问互联网。

管理网络(Management Network)

管理控制云平台相关物理资源的网络,例如:配置访问物理机、主存储、镜像服务器、VPC路由器时使用的网络。

流量网络(Flow Network)

端口镜像的专用网络,用于将网卡的网络流量镜像到远端。

VPC路由器(VPC vRouter)

一个定制的云主机,用于提供多种网络服务。

VPC路由器高可用组(VPC vRouter HA Group)

一对互为主备的VPC路由器,当主VPC路由器状态异常,自动切换至备VPC路由器,为业务高可用提供保障。

路由器镜像(vRouter Image)

封装网络服务,用于创建VPC路由器。路由器镜像不能直接用于创建业务云主机。

VPC路由器镜像(VPC vRouter Image)

封装了多种网络服务,只能用于创建VPC路由器,不能直接用于创建业务云主机。

高性能实例型负载均衡镜像(LB Image)

封装了高性能实例型负载均衡服务,只能用于创建负载均衡实例,不能直接用于创建业务云主机。

路由器规格(vRouter Offering)

定义VPC路由器使用的CPU、内存、镜像、管理网络、公有网络配置,用于创建VPC路由器,为公有网络/VPC网络提供多种网络服务。

负载均衡实例规格(LB Offering)

定义负载均衡实例使用的CPU、内存、镜像、管理网络配置,用于创建负载均衡实例,为公有网络/扁平网路/VPC网络提供负载均衡服务。

SDN控制器(SDN Controller)

SDN控制器是SDN架构的核心,负责集中管理和控制网络设备。

SDN集群(SDN Cluster)

一组由定制云主机构成的集群,用于提供高可用的SDN能力。

SDN实例(SDN Instance)

一台定制的云主机,用于提供SDN网络能力。

SDN镜像(SDN Image)

封装SDN软件的镜像,用于创建SDN实例。

SDN实例规格(SDN Instance Offering)

定义SDN实例使用的CPU、内存、SDN镜像以及管理网络配置,用于创建SDN实例。

安全组(Security Group)

为云主机网卡提供安全控制,按照指定的安全规则对进出网卡的TCP/UDP/ICMP等数据包进行有效过滤。

虚拟IP(VIP)

在桥接网络环境中,使用虚拟IP地址提供弹性IP、端口转发、负载均衡、IPsec隧道等网络服务,数据包会被发送到虚拟IP,再路由至云主机网络。

弹性IP(EIP)

基于网络地址转换(NAT)功能,将一个网络的IP地址转换成另一个网络的IP地址,从而可通过其他网络访问内部私有网络。

端口转发(Port Forwarding)

基于VPC路由器提供的三层转发服务,可将指定公有网络的IP地址端口流量转发到云主机对应协议的端口。在公网IP地址紧缺的情况下,通过端口转发可提供多个云主机对外服务,节省公网IP地址资源。

负载均衡(Load Balancer)

将虚拟IP的访问流量分发到后端服务器上,自动检测并隔离不可用的后端服务器,从而提高业务的服务能力和可用性。

监听器(Listener)

负责监听负载均衡的前端请求,按照指定策略分发给后端服务器,且监听器会对后端服务器进行健康检查。

转发规则(Forwarding Rule)

将来自不同域名或者不同URL的请求转发到不同的后端服务器组处理。

后端服务器组(Backend Server Group)

一组负责处理负载均衡分发的前端请求的后端服务器。负载均衡实例进行流量分发时,流量分配策略以后端服务器组为单位生效。

后端服务器(Backend Server)

负责处理负载均衡分发的前端请求的服务器。支持添加云主机或云平台之外的服务器作为后端服务器。

前端网络(Frontend Network)

负载均衡的前端网络,负载均衡将来自该网络的客户端请求按照指定策略分发给后端服务器。

后端网络(Backend Network)

负载均衡的后端网络,负责处理负载均衡分发前端请求的后端服务器所在的网络。

负载均衡实例(Load Balancer Instance)

一个定制的云主机,专用于提供负载均衡服务。

证书(Certificate)

当负载均衡监听器使用HTTPS协议,需绑定证书使用。支持上传证书和证书链。

防火墙(Firewall)

在VPC网络场景下,负责管控经由VPC路由器的流量,通过配置规则集和规则管控网络的访问控制策略。

防火墙规则集(Firewall RuleSet)

防火墙规则的集合,包含了一组规则,需要绑定到VPC路由器网卡的某个方向上才能生效。

防火墙规则(Firewall Rule)

配置至防火墙用于控制VPC网络流量的访问策略,由规则优先级、匹配条件、以及行为三部分组成。

规则模板(Rule Template)

将一组规则保存为模板,向防火墙或规则集添加规则时可直接选用该模板。

IP/端口集合(IP/Port Set)

将一组IP或端口进行保存,在向防火墙或规则集添加规则时可直接选用已建好的IP/端口集合。

IPsec隧道(IPsec Tunnel)

通过对IP协议的分组加密和认证来保护IP协议的网络传输数据,实现站点到站点(Site-to-Site)的虚拟私有网络(VPN)连接。

OSPF区域(OSPF Area)

OSPF协议按照一定标准将一个自治系统划分为不同区域,用于分层管理路由器。

NetFlow

通过Netflow对VPC路由器网卡的进出流量进行分析监控,支持两种数据流输出格式:V5、V9。

端口镜像(Port Mirroring)

将云主机网卡的网络流量复制一份到远端,对端口上的业务报文进行分析,方便对网络数据进行监控管理,在网络故障时可以快速定位故障。

路由表(Route Table)

用户自定义配置路由信息,包括目标网段、下一跳地址、路由优先级。

资源编排(CloudFormation)

一款帮助云计算用户简化云资源管理和自动化部署运维的服务。通过资源栈模板,定义所需的云资源、资源间的依赖关系、资源配置等,可实现自动化批量部署和配置资源,轻松管理云资源生命周期,通过API和SDK集成自动化运维能力。

资源栈(Resource Stack)

资源编排通过资源栈模板快速创建和配置一组资源(以及资源间的依赖关系),这组资源定义为一个资源栈,通过管理资源栈,维护这组资源。

资源栈模板(Stack Template)

一个UTF8编码格式的文件,基于模板可快速创建资源栈,用户在模板中定义所需的云资源、资源间的依赖关系、资源配置等,资源编排将解析模板,自动完成所有资源的创建和配置。

资源栈示例模板(Sample Template)

云平台提供了常用的示例模板,用户可基于已有示例模板创建资源栈。

可视化编排(Designer)

一个可视化的资源编排工具,通过在画布上拖曳连线建立资源间的依赖关系,直观高效编排云资源。

裸金属集群(Bare Metal Cluster)

为裸金属设备提供单独的集群管理。

部署服务器(Deployment Server)

一台单独的服务器,为裸金属设备提供PXE服务和控制台代理服务。

裸金属设备(Bare Metal Chassis)

用于创建裸金属主机,通过BMC接口以及IPMI配置进行唯一识别。

预配置模板(Preconfigured Template)

通过预配置模板,可快速生成预配置文件,实现无人值守批量安装裸金属主机操作系统。

裸金属主机(Bare Metal Instance)

安装操作系统的裸金属设备。

弹性裸金属管理(Elastice Baremetal Management)

不仅可为应用提供专属物理服务器,保障核心应用的高性能和稳定性,而且结合云平台中资源的弹性优势,可实现灵活申请,按需使用。

部署网络(Provision Network)

在网关代理集群中创建弹性裸金属实例时,用于PXE流程及下载镜像的专属网络。

弹性裸金属集群(Elastic BareMetal Cluster)

为裸金属节点提供单独的集群管理。

网关节点(Gateway Node)

负责云平台和网关代理集群中弹性裸金属实例间的流量转发。

裸金属节点(BareMetal Node)

用于创建弹性裸金属实例,通过BMC接口以及IPMI配置进行唯一识别。

弹性裸金属规格(Elastic BareMetal Offering)

弹性裸金属实例涉及的CPU、内存、CPU架构、CPU型号等规格定义。

弹性裸金属实例(Elastic BareMetal Instance)

性能媲美物理服务器的云实例,结合云平台中资源的弹性优势,可实现灵活申请,按需使用。

基础资源(vCenter)

云平台支持接管vCenter,并对已接管的vCenter虚拟化资源进行统一管理。

云主机(VM Instance)

运行在物理机上的ESXi虚拟机实例,具有独立的IP地址,可以访问公共网络,运行应用服务。

网络(Network)

vCenter云主机使用的网络配置,包括:IP地址范围、网关、网络服务等。

云盘(Volume)

为vCenter云主机提供存储,包括两种类型:根云盘、数据云盘。根云盘用于支撑云主机的系统运行,数据云盘用于云主机扩展的存储使用。

镜像(Image)

vCenter云主机或云盘使用的镜像模板,包括两种类型:系统镜像、云盘镜像。

事件消息(Event Message)

对已接管vCenter的事件报警消息进行集中展示查看,方便用户快速定位问题。

网络拓扑(Network Topology)

通过可视化方式展示云平台网络规划,帮助用户更高效地进行网络规划、管理和性能改进,支持两种类型:全局拓扑、自定义拓扑。

性能分析(Performance Analysis)

通过列表方式展示云平台核心资源的性能监控指标,提供外部和内部两种监控方式,支持按资源查看性能分析结果和自定义导出分析报表,方便用户掌控云平台性能状态,提高运维效率。

容量管理(Capacity Management)

通过可视化方式展示云平台核心资源的容量信息,方便用户掌控云平台容量使用情况,提高运维效率。

管理节点监控(MN Monitoring)

在多管理节点物理机高可用场景下,可直观查看每个管理节点的健康状态。

报警器(Alarm)

用于监控并响应时序性数据和事件的状态变化,支持资源报警器、事件报警器和扩展报警器。

一键报警(One-Click Alarm)

将种类繁多的资源监控项进行归纳整合,用于快速建立各种资源的监控报警服务。

报警模板(Rule Template)

一组报警器规则的通用模板,关联资源分组后,将对组内资源创建相应的报警器进行监控。

资源分组(Resource Group)

按照业务对资源进行分组,关联报警模板后,报警规则将直接作用于组内全部资源。

消息模版(Message Template)

报警器或事件向SNS系统的主题发送消息时使用的文本模板。

消息源(Message Source)

用于连接扩展消息源,接管扩展报警消息并结合报警器统一推送至各类通知对象。

通知对象(Endpoint)

用户获取订阅主题信息的方式,通知对象类型包括:系统、邮箱、钉钉、企业微信、飞书、Webhook、短信、Microsoft Teams、SNMP Trap接收端。

报警消息(Alarm Message)

报警器触发时发送的即时提示消息。

当前任务(Current Task)

展示当前正在进行中的操作,提供集中查看和管理。

操作日志(Operation Log)

云平台运行过程中变化的一种抽样,内容为指定对象的某些操作及其操作结果按时间的有序集合。

审计(Auditing)

实时监控并记录云平台的所有活动,可用于操作追踪、等保合规、安全分析、问题排查、自动运维等场景。

日志收集(Log Collection)

一键收集云平台以及各类节点在指定时间段内产生的日志,并支持下载查看。

一键巡检(One-Click Inspection)

对云平台关键资源和服务进行全方位一键式健康检查,并根据巡检结果为巡检资源和服务进行健康评分,同时提供巡检建议和巡检报告,助力高效运维,确保云平台资源和服务处于最佳状态。

灾备管理

灾备管理以业务为中心,融合定时增量备份、定时全量备份等多种灾备技术到云平台中,支持本地灾备、异地灾备等多种灾备方案,用户可根据自身业务特点,灵活选择合适的灾备方式。

灾备服务

在线备份云主机/数据云盘/弹性裸金属/云平台数据库数据到备份服务器,支持本地,跨地域和混合云多种备份场景,数据更可靠 。

备份任务(Backup Job)

通过备份任务,可将本地云主机/云盘/弹性裸金属实例/数据库定时备份到指定的存储服务器。

本地备份数据(Local Backup Data)

本地云主机/云盘/弹性裸金属实例/数据库的备份数据,存放在本地备份服务器中。

本地备份服务器(Local Backup Storage)

位于本地数据中心的存储服务器,用于存放本地备份数据或CDP数据。

远端备份服务器(Remote Backup Storage)

位于异地数据中心/公有云上的存储服务器,用于存放远端备份数据。

持续数据保护(CDP)

为云主机中的重要业务系统提供秒级细粒度的持续备份,既可以将云主机数据恢复到指定时间状态,又可以在不恢复系统的情况下找回文件。

CDP任务(CDP Task)

通过CDP任务,可将云主机数据持续备份到指定的备份服务器,实现持续数据保护。

CDP数据(CDP Data)

对云主机进行持续数据保护产生的备份数据,存放在指定的备份服务器中。

恢复点

进行CDP持续备份时产生的数据点,一个恢复点对应用户指定时间间隔内的云主机数据变化。

锁定恢复点

支持将恢复点进行锁定或解锁,锁定恢复点后,恢复点对应的数据将不会被自动清理或删除。

恢复任务

提供向导式的恢复流程,帮助用户通过指定CDP任务和恢复点快速进行数据恢复。同时提供恢复操作记录,方便后续审计和追溯。

密评合规

通过建立以商用密码为核心的云安全保障体系,满足企业在密评场景的云平台合规要求。

密码资源

提供身份认证和数据加密功能的密码设备。

第三方密码服务

支持添加第三方密码服务平台,用于对外提供验签、加密等密码服务。

密码机资源池

一组密码机的逻辑集合,对外提供统一的验签、加密等密码服务。

密码机

运用密码技术对信息实施加解密处理和认证的专用设备。

平台密评合规

通过密码机资源池提供的密码能力,满足云平台密评合规要求。

证书登录

可通过UKey设备对用户进行身份标识和鉴别,保证用户身份的真实性。

数据保护

可对云平台重要数据进行保护,保证数据的机密性和完整性。

定时任务(Scheduled Job)

一种预设任务,在指定时间执行指定行为。与定时器配合使用。

定时器(Scheduler)

承载定时任务的容器,尤其适用于长时间运行的操作。

标签(Tag)

一种资源标记,便于快速搜索和资源聚合。

迁移服务(Migration Service)

提供V2V迁移服务,可将其它虚拟化平台的云主机系统及数据完整迁移至当前云平台。

ZMigrate 迁移服务(ZMigrate Migration Service)

通过应用市场安装的迁移服务,用于将 VMware 环境中的云主机及其数据迁移至当前云平台。

V2V迁移(V2V Migration)

将VMware或KVM源云平台的云主机迁移至当前云平台。

迁移服务器(V2V Conversion Host)

V2V迁移需指定目标集群内的一台物理机作为迁移服务器,云主机系统和数据先缓存在迁移服务器中,再导入目标主存储。

用户(User)

表示自然人,是租户管理中的最基本单位。

成员组(Member Group)

有双重含义,既表示一组自然人的集合,也表示一组项目成员的集合,支持以成员组为单位进行权限控制。

角色(Role)

权限的集合,为用户和成员组赋予权限可获得调用相关API进行资源操作的能力。包括平台角色和项目角色两类。

统一认证(Single Sign On)

云平台提供的统一认证登录服务,支持无缝接入统一认证登录系统,相应统一认证用户将直接登录云平台,便捷使用云资源。

项目(Project)

项目即是租户,指在特定时间、资源、预算下指定相关人员完成特定目标的任务。租户管理中的租户主要指项目。支持以项目为导向进行资源规划,为一个具体项目建立独立的资源池。

项目成员(Project Member)

项目的基本组成人员,可在权限范围内使用项目资源完成任务目标,包括项目负责人、项目管理员和普通项目成员。

流程管理(Process Management)

为了更高效对项目提供基础资源支持,工单审批引入流程管理,包括默认流程和自定义流程两种类型。

我的审批(My Approvals)

仅admin/项目负责人/自定义审批人员拥有审批权限,可通过或驳回申请。若审批通过,资源会自动部署并下发至项目生效。

账单(Bills)

按计费价目在指定时间段统计的资源费用,计费精确至秒级。账单类型包括:项目账单、部门账单、账户账单。

计费价目(Pricing List)

一张包含不同资源计费单价的集合表,资源单价基于资源规格、资源使用时间而设置。

控制台代理(Console Proxy)

可通过代理地址登录云主机控制台。

AccessKey管理(AccessKey Management)

访问云平台API的身份凭证,具有该云平台完全的权限,包括:AccessKey ID(访问密钥 ID)和AccessKey Secret(秘密访问密钥)。

IP黑白名单(IP Blocklist/Allowlist)

云平台登录IP的黑白名单,通过对访客身份的识别和过滤,进一步提升云平台登录安全。

应用市场(Application Market)

通过内置的应用部署包或URL,快速部署应用服务并一键跳转使用,支持默认应用、拓展应用。

子账户管理(Sub-Account Management)

子账户由admin创建或统一认证系统同步,且受admin管理,子账户对自己创建的虚拟资源拥有管理权限。

主题外观(Theme)

用户可自定义设置云平台主题外观。

邮箱服务器(Email Server)

云平台报警选择邮箱类型的通知对象,需设置邮箱服务器,用来发送报警邮件。

日志服务器(Log Server)

添加日志服务器至云平台,收集管理节点或平台操作日志,可用于操作追溯和问题定位,提高云平台运维效率。

全局设置(Global Setting)

提供平台层面的功能特性设置,一经设置,云平台全局范围内生效。

场景封装(Scenario Template)

基于用户实际生产场景需求,提供场景化的一键全局设置,方便快速将云平台设置为所需状态,提高运维效率。

高可用策略(HA Policy)

云平台内计算、存储、网络资源发生故障或云主机异常停机时,确保相关业务持续稳定运行的机制。启用后,支持自定义云主机高可用策略,确保业务连续性。

API Inspector

云平台API调用的监视工具,用于记录用户在云平台上操作时所关联调用的API。

版本检查(Version Detection)

周期性自动检查最新版本并推送最新版本信息,包括版本号,版本亮点等。

时间管理(Time Management)

管理云平台时间和配置时间源,配置后云平台所有物理机将根据指定的时间源进行时间同步。

SNMP(Simple Network Management Protocol)

SNMP是简单网络管理协议,用于管理网络中的设备。第三方平台可通过该协议监控云平台上的资源和事件,并接收云平台推送的报警消息。

体验升级计划(Experience Improvement Plan)

体验升级计划是ZStack Cloud为提升产品操作体验和运行性能向用户推出的项目。征得用户同意后,该计划将统计和分析用户对云平台功能的使用情况,并将统计和分析数据用于指导产品改进优化,以期后续为用户提供更优质的服务。

共享带宽(Shared Bandwidth)

为多个虚拟IP提供带宽共享和集中限速服务,支持绑定虚拟IP的云主机使用同一条带宽,降低公网访问成本。

GPU设备(GPU Device)

拥有高计算能力的微处理器,可用于处理复杂的图形渲染和并行计算任务,帮助提高图形生产、视频处理和机器学习等业务的效率。

脚本库(Script Library)

脚本库集中存储和管理自动化脚本文件。对云主机执行脚本,可以完成复杂的运维操作和自动化任务。

XML Hook

一种脚本程序,用于在云主机XML文件中灵活插入或修改参数,从而实现定制化配置并扩展云主机功能。

容器管理(Container Management)

简单易用的容器管理,提供GPU管理调度、多租户、多集群、资源配额、CI/CD、微服务治理等功能。服务依据传统用户使用习惯,降低容器使用复杂性,帮助用户轻松实现容器集群管理和部署,快速上手,享受云原生便利。

QEMU

计算机模拟和虚拟化工具,提供完整的虚拟计算机模型用于运行客户操作系统。QEMU可完整模拟物理机CPU和其他硬件,或结合Hypervisor使客户操作系统直接执行在物理机CPU上,从而实现接近原生的性能表现。

Libvirt

虚拟化环境管理工具,提供稳定的API、命令行工具 (virsh) 和守护进程 (Libvirt),用于管理云平台上的虚拟机 (如创建、启动、关闭、迁移云主机等),并实现网络和存储配置。

Kernel

操作系统内核,负责管理CPU、内存、输入/输出设备等系统资源,协调计算机硬件和上层应用之间的交互,提供硬件抽象、资源分配、进程管理、进程间通信、系统资源安全控制等功能。

高级监控服务器(Advanced Monitoring Server)

一个定制的云主机,专用于接收和处理负载均衡等资源的高级监控数据。

高级监控服务器镜像(Advanced Monitoring Server Image)

封装了高级监控服务的镜像,专用于创建高级监控服务器,不可用于创建业务云主机。

高级监控服务器规格(Advanced Monitoring Server Offering)

定义高级监控服务器使用的CPU、内存、镜像、管理网络、公有网络配置,专用于创建高级监控服务器。

插件管理(Plugin Management)

将扩展资源或工具封装为标准化插件,便于在云平台上快速安装和集成,实现功能扩展。

可用区管理(Region Management)

可用区是一套完整的云环境,具有独立的管理节点、网络、硬件和云资源。多个可用区间可实现用户同步和免密登录。
操作系统修复指南 | 5.5.38 | ZStack Cloud · ZCF | ZStack 资源中心