GPU设备

GPU设备是一种拥有高并行计算能力的微处理器,可用于加速大规模计算负载。除图形渲染任务外,GPU现已成为AI训练与推理的核心硬件,能够有效提升深度学习、大模型推理、数据处理等业务效率。通过透传、vGPU、dGPU、整卡调度、显存切分等技术,GPU可以以整卡或细粒度切片的形式,为云主机和容器提供弹性化的算力支撑,提升AI服务的吞吐能力、响应速度和资源利用率。

GPU技术

云平台支持多种GPU分配方式,可将GPU通过以下技术挂载至云主机或容器:
  • 云主机
    • 透传

      将物理GPU机器关联外设 (如显卡、声卡、推理卡等) 作为整体单元直接分配给云主机使用。云主机完全独占该物理GPU,获得物理GPU强劲的并行计算能力。

      以下GPU型号支持透传:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090
      Quadro RTX 8000、Quadro RTX 6000
      M4000、P2000
      GTX 1650/1660、GTX 1060ti
      H100、H200、H800、H20
      Note: 仅ZStack CloudH84R ISO支持。
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A100、Nvidia A30
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100、Tesla P4/6/40/100、M6/10/60
      K6000
      AMD Radeon v620、Radeon RX5700
      RRO W7800
      Note: 暂不支持透传使用Windows操作系统的云主机
      FirePro S7150、FirePro S7150X2
      华为 Atlas 300i pro
      Note: 仅支持透传ARM物理机上的本型号GPU
      910B3/4
      Note: 仅支持透传ARM物理机上的本型号GPU
      Hygon Z100、Z100L
      K100-AI
      燧原 S60
      天数智芯 智铠MR-V100
      天垓
      瀚博 SV100、SG100
      Note: SG100不建议直接透传,建议切分vGPU后再加载使用。
      昆仑芯 P800
      阿里PPU PPU-ZW810E
      其他 沐曦N100、摩尔线程、寒武纪等
    • 虚拟化切割 (vGPU)
      通过GPU虚拟化技术,将单张物理GPU切割为多个更小规格的vGPU,形成细粒度vGPU资源池,便于用户快速创建轻量化云主机,实现资源弹性部署,有效提升GPU利用率,节约成本。
      Note: 目前,暂不支持使用vGPU部署云主机AI服务。
      以下GPU型号支持虚拟化切割:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      Quadro RTX 8000、Quadro RTX 6000
      H100、H200、H800、H20
      Note: 仅ZStack CloudH84R ISO支持。
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100、Tesla P4/6/40/100、M6/10/60
      AMD FirePro S7150、FirePro S7150X2
      瀚博 SV100、SG100
    • 动态切分与调度 (dGPU)
      基于CUDA API拦截转发技术,按需切分物理GPU显存,并动态分配给多个云主机使用,最大化资源利用率。适用于AI推理、深度学习等业务场景。
      Note: 使用本功能,需购买dGPU算力切分许可证。
      以下GPU型号支持dGPU功能:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090
      Quadro RTX 8000、Quadro RTX 6000
      H100、H200、H800、H20
      Note: 仅ZStack CloudH84R ISO支持。
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A100、Nvidia A30
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100
  • 容器
    • 整卡调度

      将物理GPU设备直接加载给容器使用。

      以下GPU型号支持容器整卡调度:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090
      Quadro RTX 8000、Quadro RTX 6000
      M4000、P2000
      GTX 1650/1660、GTX 1060ti
      H100、H200、H800、H20
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A100、Nvidia A30
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100、Tesla P4/6/40/100、M6/10/60
      K6000
      华为 Atlas 300i pro
      Note: 仅容器管理Kylin10SP3 2403版支持
      910B3/4
      Note: 仅容器管理ARM-Kylin10SP3 2403版支持
      Hygon Z100、Z100L
      Note: 仅容器管理x86-Kylin10SP3 2403版支持
      K100-AI
      Note: 仅容器管理x86-Kylin10SP3 2403版支持
      燧原 S60
      Note: 仅容器管理Kylin10SP3版支持
      天数智芯 智铠MR-V100
      Note: 仅容器管理H84R、x86-Kylin10SP3 2403版支持
      天垓
      Note: 仅容器管理H84R、x86-Kylin10SP3 2403版支持
    • 显存切分

      对物理机上的单个或多个GPU进行显存切分和隔离,并为物理机上的容器分别分配显存。仅单卡支持显存切分。

      以下GPU型号支持容器显存切分:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090
      Quadro RTX 8000、Quadro RTX 6000
      M4000、P2000
      GTX 1650/1660、GTX 1060ti
      H100、H200、H800、H20
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A100、Nvidia A30
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100、Tesla P4/6/40/100、M6/10/60
      K6000
      华为 Atlas 300i pro
      Note:
      • 仅支持单卡切分
      • 仅容器管理Kylin10SP3 2403版支持
      910B3/4
      Note:
      • 仅支持单卡切分
      • 仅容器管理ARM-Kylin10SP3 2403版支持
      Hygon Z100、Z100L
      Note:
      • 仅支持单卡切分
      • 仅容器管理x86-Kylin10SP3 2403版支持
      K100-AI
      Note:
      • 仅支持单卡切分
      • 仅容器管理x86-Kylin10SP3 2403版支持
      天数智芯 智铠MR-V100
      Note:
      • 仅支持单卡切分
      • 仅容器管理H84R、x86-Kylin10SP3 2403版支持
      天垓
      Note:
      • 仅支持单卡切分
      • 仅容器管理H84R、x86-Kylin10SP3 2403版支持

推理部署

部署推理服务时,为运行该服务的云主机或容器加载GPU设备,为推理服务提供强大算力。

以下是各GPU型号支持的推理部署模式:
厂商 型号 单机多卡 (云主机) 多机多卡 (云主机) 单机多卡 (容器) 多机多卡 (容器)
NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 支持 支持 支持 支持
GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 支持 支持 支持 支持
Quadro RTX 8000、Quadro RTX 6000 支持 支持 支持 支持
P2000、M4000 计算能力低,不推荐使用
GTX 1650/1660、GTX 1060ti 计算能力低,不推荐使用
H100、H800、H200、H20 支持 支持 支持 支持
Nvidia L40、Nvidia L20、Nvidia L4 支持 支持 支持 支持
Nvidia A100、Nvidia A30 支持 支持 支持 支持
Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 支持 支持 支持 支持
Tesla V100、Tesla P4/6/40/100、M6/10/60 计算能力低,不推荐使用
K6000 计算能力低,不推荐使用
华为 910B3/4 仅ARM-KylinSP3 2403版支持 仅ARM-KylinSP3 2403版支持 仅ARM-Kylin10SP3 2403版支持 仅ARM-Kylin10SP3 2403版支持
Hygon K100-AI 仅支持LLM+RAG模型 不支持 仅支持LLM+RAG模型 不支持
阿里PPU PPU-ZW810E 支持 支持 不支持 不支持

概述

GPU设备是一种拥有高并行计算能力的微处理器,可用于加速大规模计算负载。除图形渲染任务外,GPU现已成为AI训练与推理的核心硬件,能够有效提升深度学习、大模型推理、数据处理等业务效率。通过透传、vGPU、dGPU、整卡调度、显存切分等技术,GPU可以以整卡或细粒度切片的形式,为云主机和容器提供弹性化的算力支撑,提升AI服务的吞吐能力、响应速度和资源利用率。

GPU技术

云平台支持多种GPU分配方式,可将GPU通过以下技术挂载至云主机或容器:
  • 云主机
    • 透传

      将物理GPU机器关联外设 (如显卡、声卡、推理卡等) 作为整体单元直接分配给云主机使用。云主机完全独占该物理GPU,获得物理GPU强劲的并行计算能力。

      以下GPU型号支持透传:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090
      Quadro RTX 8000、Quadro RTX 6000
      M4000、P2000
      GTX 1650/1660、GTX 1060ti
      H100、H200、H800、H20
      Note: 仅云平台 H84R ISO支持。
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A100、Nvidia A30
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100、Tesla P4/6/40/100、M6/10/60
      K6000
      AMD Radeon v620、Radeon RX5700
      RRO W7800
      Note: 暂不支持透传使用Windows操作系统的云主机
      FirePro S7150、FirePro S7150X2
      华为 Atlas 300i pro
      Note: 仅支持透传ARM物理机上的本型号GPU
      910B3/4
      Note: 仅支持透传ARM物理机上的本型号GPU
      Hygon Z100、Z100L
      K100-AI
      燧原 S60
      天数智芯 智铠MR-V100
      天垓
      瀚博 SV100、SG100
      Note: SG100不建议直接透传,建议切分vGPU后再加载使用。
      昆仑芯 P800
      阿里PPU PPU-ZW810E
      其他 沐曦N100、摩尔线程、寒武纪等
    • 虚拟化切割 (vGPU)
      通过GPU虚拟化技术,将单张物理GPU切割为多个更小规格的vGPU,形成细粒度vGPU资源池,便于用户快速创建轻量化云主机,实现资源弹性部署,有效提升GPU利用率,节约成本。
      Note: 目前,暂不支持使用vGPU部署云主机AI服务。
      以下GPU型号支持虚拟化切割:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      Quadro RTX 8000、Quadro RTX 6000
      H100、H200、H800、H20
      Note: 仅云平台H84R ISO支持。
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100、Tesla P4/6/40/100、M6/10/60
      AMD FirePro S7150、FirePro S7150X2
      瀚博 SV100、SG100
    • 动态切分与调度 (dGPU)
      基于CUDA API拦截转发技术,按需切分物理GPU显存,并动态分配给多个云主机使用,最大化资源利用率。适用于AI推理、深度学习等业务场景。
      Note: 使用本功能,需购买dGPU算力切分许可证。
      以下GPU型号支持dGPU功能:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090
      Quadro RTX 8000、Quadro RTX 6000
      H100、H200、H800、H20
      Note: 仅云平台H84R ISO支持。
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A100、Nvidia A30
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100
  • 容器
    • 整卡调度

      将物理GPU设备直接加载给容器使用。

      以下GPU型号支持容器整卡调度:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090
      Quadro RTX 8000、Quadro RTX 6000
      M4000、P2000
      GTX 1650/1660、GTX 1060ti
      H100、H200、H800、H20
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A100、Nvidia A30
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100、Tesla P4/6/40/100、M6/10/60
      K6000
      华为 Atlas 300i pro
      Note: 仅容器管理Kylin10SP3 2403版支持
      910B3/4
      Note: 仅容器管理ARM-Kylin10SP3 2403版支持
      Hygon Z100、Z100L
      Note: 仅容器管理x86-Kylin10SP3 2403版支持
      K100-AI
      Note: 仅容器管理x86-Kylin10SP3 2403版支持
      燧原 S60
      Note: 仅容器管理Kylin10SP3版支持
      天数智芯 智铠MR-V100
      Note: 仅容器管理H84R、x86-Kylin10SP3 2403版支持
      天垓
      Note: 仅容器管理H84R、x86-Kylin10SP3 2403版支持
    • 显存切分

      对物理机上的单个或多个GPU进行显存切分和隔离,并为物理机上的容器分别分配显存。仅单卡支持显存切分。

      以下GPU型号支持容器显存切分:
      厂商 型号
      NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000
      GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090
      Quadro RTX 8000、Quadro RTX 6000
      M4000、P2000
      GTX 1650/1660、GTX 1060ti
      H100、H200、H800、H20
      Nvidia L40、Nvidia L20、Nvidia L4
      Nvidia A100、Nvidia A30
      Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4
      Tesla V100、Tesla P4/6/40/100、M6/10/60
      K6000
      华为 Atlas 300i pro
      Note:
      • 仅支持单卡切分
      • 仅容器管理Kylin10SP3 2403版支持
      910B3/4
      Note:
      • 仅支持单卡切分
      • 仅容器管理ARM-Kylin10SP3 2403版支持
      Hygon Z100、Z100L
      Note:
      • 仅支持单卡切分
      • 仅容器管理x86-Kylin10SP3 2403版支持
      K100-AI
      Note:
      • 仅支持单卡切分
      • 仅容器管理x86-Kylin10SP3 2403版支持
      天数智芯 智铠MR-V100
      Note:
      • 仅支持单卡切分
      • 仅容器管理H84R、x86-Kylin10SP3 2403版支持
      天垓
      Note:
      • 仅支持单卡切分
      • 仅容器管理H84R、x86-Kylin10SP3 2403版支持

查看GPU设备

登录 ZCF,切换至对应可用区,在主菜单,点击资源中心 > 硬件设施 > GPU设备,进入GPU设置界面。

GPU设备 | 物理GPU、vGPU、dGPU

GPU设备界面展示当前区域内所有GPU设备,分为物理GPU、vGPU、dGPU三个列表:物理机、弹性裸金属节点、容器集群节点上的GPU设备将被自动识别并展示在物理GPU列表,由物理GPU虚拟化切割的vGPU设备将进入vGPU列表,基于dGPU技术切分而成并已分配给云主机使用的设备将进入dGPU列表。

GPU设备 | 筛选

  • GPU设备界面左上方提供KVM集群、容器、裸金属标签页,用户可点击查看不同类型集群下的GPU设备。
  • 选择集群类型后,可以查看指定集群下的GPU设备,其中,KVM集群可以进一步查看指定物理机上的GPU设备。

GPU设备 | 状态、分布和详情

  • GPU设备界面上方,提供GPU工作状态和分配概览,帮助用户快速掌握当前区域或指定范围内的GPU基本情况:
    • 工作状态:展示当前区域或指定范围内正常、故障或未知状态的GPU设备数量。
    • 分配概览:
      • 物理GPU、vGPU:展示当前区域或指定范围内已分配给云主机/弹性裸金属实例/容器和未分配的GPU设备数量。
      • dGPU:展示当前区域或指定范围内dGPU显存分配情况和显存分配Top3设备。
  • GPU设备列表展示各GPU的详细信息和监控数据,包括:厂商、型号、类型、规格、硬件资源、加载实例、工作状态、利用率、显存利用率、温度、功耗等。
如图 1所示:
图 1. 查看GPU设备


管理GPU设备

登录 ZCF,切换至对应可用区,在主菜单,点击资源中心 > 硬件设施 > GPU设备,进入GPU设备界面。

管理物理GPU

支持在GPU设备界面对物理GPU进行以下操作:
操作 描述
编辑名称 修改GPU设备名称。
启用物理GPU 启用物理GPU设备,启用后该物理GPU可直接透传给云主机使用。
Note: 弹性裸金属集群、容器集群的GPU不支持该操作。
停用物理GPU 停用物理GPU设备,停用后该物理GPU设备不可继续透传给云主机使用。
Note:
  • 正在被云主机使用的物理GPU设备可以正常使用,不受影响,直至被卸载。
  • 弹性裸金属集群、容器集群的GPU不支持该操作。
设置共享模式 设置物理GPU设备的共享模式,支持全局共享、指定共享、不共享。
启用dGPU模式 为物理GPU设备开启dGPU模式,允许系统通过CUDA API拦截转发技术,按需切分物理GPU显存,动态分配给不同云主机使用。
Note:
  • 启用前,需确保GPU型号支持dGPU功能,适配详情可参考GPU设备
  • 启用前,需确保物理机使用x86_64架构,并安装CUDA (12.1或以上版本) 和NVIDIA GPU驱动 (570.x或以上版本) 。
  • 启用前,需确保物理机BIOS已开启Intel VT-d / AMD IOMMU功能,且物理机内核已开启IOMMU支持。
  • 为云主机加载dGPU设备,需确保云主机使用Linux操作系统并已安装性能优化工具。
  • 物理GPU启用dGPU模式后,将无法使用透传和vGPU功能;正在使用透传和vGPU功能的物理GPU无法启用dGPU模式。
  • 仅KVM集群的GPU支持该操作。
关闭dGPU模式 为物理GPU设备关闭dGPU模式,不再对其进行显存切分和动态分配。
Note: 关闭前,需确保所有相关dGPU已从云主机卸载。
虚拟化切割 将未透传的物理GPU设备,虚拟化切割为vGPU设备。不同厂商的物理GPU虚拟化切割方式略有不同。
  • NVIDIA:按照所选切割规格,单独虚拟化切割NVIDIA物理GPU。
  • AMD:按照所选切割数量,同时虚拟化切割当前AMD卡对应的所有物理GPU。
Note: 虚拟化切割物理GPU设备需要满足以下条件:
  • 确保该物理GPU型号支持虚拟化切割。
  • 确保该物理GPU未透传给云主机使用。
  • 确保该物理机BIOS已开启Intel VT-d / AMD IOMMU功能,且物理机内核已开启IOMMU支持。
  • 确保平台中添加的物理机IOMMU就绪状态为可用。
  • 仅KVM集群的GPU支持该操作。
虚拟化还原 将vGPU设备虚拟化还原为物理GPU设备。不同厂商的物理GPU虚拟化还原方式略有不同。
  • NVIDIA:虚拟化还原NVIDIA vGPU需确保此物理GPU相关的vGPU已经全部从云主机卸载。
  • AMD:虚拟化还原AMD vGPU需确保当前AMD卡对应的所有vGPU全部已经从云主机卸载。
Note: 确保该物理GPU切割成的vGPU已全部从云主机卸载,才可执行虚拟化还原操作。

管理vGPU

目前,仅KVM集群含有vGPU设备。支持在GPU设备界面对vGPU进行以下操作:
操作 描述
启用vGPU 启用vGPU设备,启用后该vGPU设备可加载给云主机使用。
停用vGPU 停用vGPU设备,停用后该vGPU设备不可继续加载给云主机使用。
Note: 正在被云主机使用的vGPU设备可以正常使用,不受影响,直至被卸载。
设置共享模式 设置vGPU设备的共享模式,支持全局共享、指定共享、不共享。

管理dGPU

已被动态切分并加载给云主机使用的dGPU将显示在该列表。用户可对dGPU进行以下操作:
操作 描述
加载dGPU 为云主机加载dGPU设备,系统将自动按照所选的GPU设备/规格和显存模板,为云主机分配对应显存。
Note:
  • 用户可在创建云主机时加载dGPU,或在云主机操作列表/详情页通过修改GPU配置为云主机加载dGPU。
  • 加载前,需确保云主机已安装性能优化工具。
  • 仅Linux云主机可加载dGPU。
卸载dGPU 为云主机卸载dGPU设备,卸载后,系统将回收对应显存,并可分配给其他云主机使用。
Note: 用户可在云主机操作列表/详情页通过修改GPU配置为云主机卸载dGPU。

GPU设备监控

在GPU设备界面,点击GPU设备名称,进入GPU设备详情页,可查看该GPU设备的详细监控数据和监控图表。

  • 物理GPU设备支持查看:GPU利用率、显存利用率、功耗、温度、风扇转速;部分NVIDIA GPU还支持查看PCIe Rx吞吐量、PCIe Tx吞吐量。
  • vGPU设备支持查看:vGPU利用率、显存利用率。
  • dGPU设备支持查看:dGPU利用率、显存利用率。

平台默认展示15分钟内GPU负载的变化曲线,用户也可以自定义时间跨度,查看指定时间范围内的GPU负载变化,包括:15分钟、1小时、6小时、1天、1周、1月、1年、自定义。

如图 2、图 3所示:
图 2. GPU设备实时负载


图 3. GPU设备负载变化




GPU驱动

查看GPU负载监控需正确安装GPU驱动和agent工具:
  • 物理机 | 物理GPU设备:
    • 如GPU设备未透传给云主机使用,为物理机安装GPU驱动后可查看GPU负载监控。
    • 如GPU设备已透传给云主机使用,为云主机安装GPU驱动和性能优化工具后可查看GPU负载监控。
  • 物理机 | vGPU设备:为物理机安装GPU驱动后可查看GPU负载监控。
  • 弹性裸金属 | 物理GPU设备:为弹性裸金属实例安装GPU驱动和agent后可查看GPU负载监控。
  • 容器 | 物理GPU设备:为容器集群节点安装GPU驱动后可查看GPU负载监控。
推荐使用以下版本的GPU驱动:
GPU 物理机推荐驱动版本 云主机/弹性裸金属实例推荐驱动版本
NVIDIA
  • GPU驱动:NVIDIA-Linux-x86_64-510.47.03-grid.run
  • vGPU驱动:NVIDIA-Linux-x86_64-510.47.03-vgpu-kvm.run
使用NVIDIA官方推荐最新版本:详见NVIDIA官方文档
AMD rocm-smi 6.1.2及以上版本 rocm-smi 6.1.2及以上版本
Note: 如云主机使用RHEL7系列操作系统,需确保云主机内核为4.18.0或以上版本。
Hygon

rock-5.2.0-5.16.29-V01.13.run

/
华为

Ascend-hdk-310p-npu-driver_24.1.rc1_linux-aarch64.run

Ascend-hdk-310p-npu-driver_24.1.rc1_linux-aarch64.run

天数智芯
  • x86架构:corex-installer-linux64-4.0.1_x86_64_10.2.run
  • ARM架构:corex-installer-linux64-4.0.1_arm64_10.2.run
  • x86架构:corex-installer-linux64-4.0.1_x86_64_10.2.run
  • ARM架构:corex-installer-linux64-4.0.1_arm64_10.2.run
Note: 查看容器集群GPU设备监控,为容器集群节点安装GPU驱动即可,无推荐版本限制。

注意事项

  • Hygon GPU透传给云主机使用后,暂不支持通过驱动查看负载监控。
  • 如已为物理机安装GPU驱动,但仍无法查看对应的GPU设备监控,可尝试重连物理机,使系统识别该GPU驱动。
  • 如已为物理机或云主机安装GPU驱动 (云主机需额外安装性能优化工具),但仍无法查看对应的GPU设备监控,且检查日志文件 (物理机查看kvmagent.log,云主机查看zwatch-vm-agent.log) ,发现未找到smi报错 (例如,npu-smi not found) ,请将smi工具存放到以下任意目录:/usr/bin、/var/lib/zstack/virtualenv/kvm/bin、/sbin、/usr/sbin、/bin,建议存放到/usr/bin
  • 如使用双芯片AMD卡 (AMD Firepro S7150 X2) ,并将其对应的两个物理GPU设备分别透传给不同云主机使用,请为云主机安装相同版本的驱动,以保证正常获取GPU监控数据。
ZStack Cloud | ZStack Cloud · ZCF | ZStack 资源中心