GPU设备
GPU设备是一种拥有高并行计算能力的微处理器,可用于加速大规模计算负载。除图形渲染任务外,GPU现已成为AI训练与推理的核心硬件,能够有效提升深度学习、大模型推理、数据处理等业务效率。通过透传、vGPU、dGPU、整卡调度、显存切分等技术,GPU可以以整卡或细粒度切片的形式,为云主机和容器提供弹性化的算力支撑,提升AI服务的吞吐能力、响应速度和资源利用率。
GPU技术
- 云主机
- 透传
将物理GPU机器关联外设 (如显卡、声卡、推理卡等) 作为整体单元直接分配给云主机使用。云主机完全独占该物理GPU,获得物理GPU强劲的并行计算能力。
以下GPU型号支持透传:厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 Quadro RTX 8000、Quadro RTX 6000 M4000、P2000 GTX 1650/1660、GTX 1060ti H100、H200、H800、H20 Note: 仅ZStack CloudH84R ISO支持。Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A100、Nvidia A30 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100、Tesla P4/6/40/100、M6/10/60 K6000 AMD Radeon v620、Radeon RX5700 RRO W7800 Note: 暂不支持透传使用Windows操作系统的云主机FirePro S7150、FirePro S7150X2 华为 Atlas 300i pro Note: 仅支持透传ARM物理机上的本型号GPU910B3/4 Note: 仅支持透传ARM物理机上的本型号GPUHygon Z100、Z100L K100-AI 燧原 S60 天数智芯 智铠MR-V100 天垓 瀚博 SV100、SG100 Note: SG100不建议直接透传,建议切分vGPU后再加载使用。昆仑芯 P800 阿里PPU PPU-ZW810E 其他 沐曦N100、摩尔线程、寒武纪等 - 虚拟化切割
(vGPU)通过GPU虚拟化技术,将单张物理GPU切割为多个更小规格的vGPU,形成细粒度vGPU资源池,便于用户快速创建轻量化云主机,实现资源弹性部署,有效提升GPU利用率,节约成本。Note: 目前,暂不支持使用vGPU部署云主机AI服务。以下GPU型号支持虚拟化切割:
厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 Quadro RTX 8000、Quadro RTX 6000 H100、H200、H800、H20 Note: 仅ZStack CloudH84R ISO支持。Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100、Tesla P4/6/40/100、M6/10/60 AMD FirePro S7150、FirePro S7150X2 瀚博 SV100、SG100 - 动态切分与调度 (dGPU)基于CUDA API拦截转发技术,按需切分物理GPU显存,并动态分配给多个云主机使用,最大化资源利用率。适用于AI推理、深度学习等业务场景。Note: 使用本功能,需购买dGPU算力切分许可证。以下GPU型号支持dGPU功能:
厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 Quadro RTX 8000、Quadro RTX 6000 H100、H200、H800、H20 Note: 仅ZStack CloudH84R ISO支持。Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A100、Nvidia A30 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100
- 透传
- 容器
- 整卡调度
将物理GPU设备直接加载给容器使用。
以下GPU型号支持容器整卡调度:厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 Quadro RTX 8000、Quadro RTX 6000 M4000、P2000 GTX 1650/1660、GTX 1060ti H100、H200、H800、H20 Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A100、Nvidia A30 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100、Tesla P4/6/40/100、M6/10/60 K6000 华为 Atlas 300i pro Note: 仅容器管理Kylin10SP3 2403版支持910B3/4 Note: 仅容器管理ARM-Kylin10SP3 2403版支持Hygon Z100、Z100L Note: 仅容器管理x86-Kylin10SP3 2403版支持K100-AI Note: 仅容器管理x86-Kylin10SP3 2403版支持燧原 S60 Note: 仅容器管理Kylin10SP3版支持天数智芯 智铠MR-V100 Note: 仅容器管理H84R、x86-Kylin10SP3 2403版支持天垓 Note: 仅容器管理H84R、x86-Kylin10SP3 2403版支持 - 显存切分
对物理机上的单个或多个GPU进行显存切分和隔离,并为物理机上的容器分别分配显存。仅单卡支持显存切分。
以下GPU型号支持容器显存切分:厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 Quadro RTX 8000、Quadro RTX 6000 M4000、P2000 GTX 1650/1660、GTX 1060ti H100、H200、H800、H20 Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A100、Nvidia A30 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100、Tesla P4/6/40/100、M6/10/60 K6000 华为 Atlas 300i pro Note:- 仅支持单卡切分
- 仅容器管理Kylin10SP3 2403版支持
910B3/4 Note:- 仅支持单卡切分
- 仅容器管理ARM-Kylin10SP3 2403版支持
Hygon Z100、Z100L Note:- 仅支持单卡切分
- 仅容器管理x86-Kylin10SP3 2403版支持
K100-AI Note:- 仅支持单卡切分
- 仅容器管理x86-Kylin10SP3 2403版支持
天数智芯 智铠MR-V100 Note:- 仅支持单卡切分
- 仅容器管理H84R、x86-Kylin10SP3 2403版支持
天垓 Note:- 仅支持单卡切分
- 仅容器管理H84R、x86-Kylin10SP3 2403版支持
- 整卡调度
推理部署
部署推理服务时,为运行该服务的云主机或容器加载GPU设备,为推理服务提供强大算力。
| 厂商 | 型号 | 单机多卡 (云主机) | 多机多卡 (云主机) | 单机多卡 (容器) | 多机多卡 (容器) |
|---|---|---|---|---|---|
| NVIDIA | Nvidia RTX 6000Ada、Nvidia RTX A6000 | 支持 | 支持 | 支持 | 支持 |
| GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 | 支持 | 支持 | 支持 | 支持 | |
| Quadro RTX 8000、Quadro RTX 6000 | 支持 | 支持 | 支持 | 支持 | |
| P2000、M4000 | 计算能力低,不推荐使用 | ||||
| GTX 1650/1660、GTX 1060ti | 计算能力低,不推荐使用 | ||||
| H100、H800、H200、H20 | 支持 | 支持 | 支持 | 支持 | |
| Nvidia L40、Nvidia L20、Nvidia L4 | 支持 | 支持 | 支持 | 支持 | |
| Nvidia A100、Nvidia A30 | 支持 | 支持 | 支持 | 支持 | |
| Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 | 支持 | 支持 | 支持 | 支持 | |
| Tesla V100、Tesla P4/6/40/100、M6/10/60 | 计算能力低,不推荐使用 | ||||
| K6000 | 计算能力低,不推荐使用 | ||||
| 华为 | 910B3/4 | 仅ARM-KylinSP3 2403版支持 | 仅ARM-KylinSP3 2403版支持 | 仅ARM-Kylin10SP3 2403版支持 | 仅ARM-Kylin10SP3 2403版支持 |
| Hygon | K100-AI | 仅支持LLM+RAG模型 | 不支持 | 仅支持LLM+RAG模型 | 不支持 |
| 阿里PPU | PPU-ZW810E | 支持 | 支持 | 不支持 | 不支持 |
概述
GPU设备是一种拥有高并行计算能力的微处理器,可用于加速大规模计算负载。除图形渲染任务外,GPU现已成为AI训练与推理的核心硬件,能够有效提升深度学习、大模型推理、数据处理等业务效率。通过透传、vGPU、dGPU、整卡调度、显存切分等技术,GPU可以以整卡或细粒度切片的形式,为云主机和容器提供弹性化的算力支撑,提升AI服务的吞吐能力、响应速度和资源利用率。
GPU技术
- 云主机
- 透传
将物理GPU机器关联外设 (如显卡、声卡、推理卡等) 作为整体单元直接分配给云主机使用。云主机完全独占该物理GPU,获得物理GPU强劲的并行计算能力。
以下GPU型号支持透传:厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 Quadro RTX 8000、Quadro RTX 6000 M4000、P2000 GTX 1650/1660、GTX 1060ti H100、H200、H800、H20 Note: 仅云平台 H84R ISO支持。Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A100、Nvidia A30 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100、Tesla P4/6/40/100、M6/10/60 K6000 AMD Radeon v620、Radeon RX5700 RRO W7800 Note: 暂不支持透传使用Windows操作系统的云主机FirePro S7150、FirePro S7150X2 华为 Atlas 300i pro Note: 仅支持透传ARM物理机上的本型号GPU910B3/4 Note: 仅支持透传ARM物理机上的本型号GPUHygon Z100、Z100L K100-AI 燧原 S60 天数智芯 智铠MR-V100 天垓 瀚博 SV100、SG100 Note: SG100不建议直接透传,建议切分vGPU后再加载使用。昆仑芯 P800 阿里PPU PPU-ZW810E 其他 沐曦N100、摩尔线程、寒武纪等 - 虚拟化切割
(vGPU)通过GPU虚拟化技术,将单张物理GPU切割为多个更小规格的vGPU,形成细粒度vGPU资源池,便于用户快速创建轻量化云主机,实现资源弹性部署,有效提升GPU利用率,节约成本。Note: 目前,暂不支持使用vGPU部署云主机AI服务。以下GPU型号支持虚拟化切割:
厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 Quadro RTX 8000、Quadro RTX 6000 H100、H200、H800、H20 Note: 仅云平台H84R ISO支持。Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100、Tesla P4/6/40/100、M6/10/60 AMD FirePro S7150、FirePro S7150X2 瀚博 SV100、SG100 - 动态切分与调度 (dGPU)基于CUDA API拦截转发技术,按需切分物理GPU显存,并动态分配给多个云主机使用,最大化资源利用率。适用于AI推理、深度学习等业务场景。Note: 使用本功能,需购买dGPU算力切分许可证。以下GPU型号支持dGPU功能:
厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 Quadro RTX 8000、Quadro RTX 6000 H100、H200、H800、H20 Note: 仅云平台H84R ISO支持。Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A100、Nvidia A30 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100
- 透传
- 容器
- 整卡调度
将物理GPU设备直接加载给容器使用。
以下GPU型号支持容器整卡调度:厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 Quadro RTX 8000、Quadro RTX 6000 M4000、P2000 GTX 1650/1660、GTX 1060ti H100、H200、H800、H20 Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A100、Nvidia A30 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100、Tesla P4/6/40/100、M6/10/60 K6000 华为 Atlas 300i pro Note: 仅容器管理Kylin10SP3 2403版支持910B3/4 Note: 仅容器管理ARM-Kylin10SP3 2403版支持Hygon Z100、Z100L Note: 仅容器管理x86-Kylin10SP3 2403版支持K100-AI Note: 仅容器管理x86-Kylin10SP3 2403版支持燧原 S60 Note: 仅容器管理Kylin10SP3版支持天数智芯 智铠MR-V100 Note: 仅容器管理H84R、x86-Kylin10SP3 2403版支持天垓 Note: 仅容器管理H84R、x86-Kylin10SP3 2403版支持 - 显存切分
对物理机上的单个或多个GPU进行显存切分和隔离,并为物理机上的容器分别分配显存。仅单卡支持显存切分。
以下GPU型号支持容器显存切分:厂商 型号 NVIDIA Nvidia RTX 6000Ada、Nvidia RTX A6000 GeForce RTX 5090、Geforce RTX 4090、Nvidia RTX 3090 Quadro RTX 8000、Quadro RTX 6000 M4000、P2000 GTX 1650/1660、GTX 1060ti H100、H200、H800、H20 Nvidia L40、Nvidia L20、Nvidia L4 Nvidia A100、Nvidia A30 Nvidia A40、Nvidia A16、Nvidia A10、Nvidia T4 Tesla V100、Tesla P4/6/40/100、M6/10/60 K6000 华为 Atlas 300i pro Note:- 仅支持单卡切分
- 仅容器管理Kylin10SP3 2403版支持
910B3/4 Note:- 仅支持单卡切分
- 仅容器管理ARM-Kylin10SP3 2403版支持
Hygon Z100、Z100L Note:- 仅支持单卡切分
- 仅容器管理x86-Kylin10SP3 2403版支持
K100-AI Note:- 仅支持单卡切分
- 仅容器管理x86-Kylin10SP3 2403版支持
天数智芯 智铠MR-V100 Note:- 仅支持单卡切分
- 仅容器管理H84R、x86-Kylin10SP3 2403版支持
天垓 Note:- 仅支持单卡切分
- 仅容器管理H84R、x86-Kylin10SP3 2403版支持
- 整卡调度
查看GPU设备
登录 ZCF,切换至对应可用区,在主菜单,点击,进入GPU设置界面。
GPU设备 | 物理GPU、vGPU、dGPU
GPU设备界面展示当前区域内所有GPU设备,分为物理GPU、vGPU、dGPU三个列表:物理机、弹性裸金属节点、容器集群节点上的GPU设备将被自动识别并展示在物理GPU列表,由物理GPU虚拟化切割的vGPU设备将进入vGPU列表,基于dGPU技术切分而成并已分配给云主机使用的设备将进入dGPU列表。
GPU设备 | 筛选
- GPU设备界面左上方提供KVM集群、容器、裸金属标签页,用户可点击查看不同类型集群下的GPU设备。
- 选择集群类型后,可以查看指定集群下的GPU设备,其中,KVM集群可以进一步查看指定物理机上的GPU设备。
GPU设备 | 状态、分布和详情
- GPU设备界面上方,提供GPU工作状态和分配概览,帮助用户快速掌握当前区域或指定范围内的GPU基本情况:
- 工作状态:展示当前区域或指定范围内正常、故障或未知状态的GPU设备数量。
- 分配概览:
- 物理GPU、vGPU:展示当前区域或指定范围内已分配给云主机/弹性裸金属实例/容器和未分配的GPU设备数量。
- dGPU:展示当前区域或指定范围内dGPU显存分配情况和显存分配Top3设备。
- GPU设备列表展示各GPU的详细信息和监控数据,包括:厂商、型号、类型、规格、硬件资源、加载实例、工作状态、利用率、显存利用率、温度、功耗等。

管理GPU设备
登录 ZCF,切换至对应可用区,在主菜单,点击,进入GPU设备界面。
管理物理GPU
| 操作 | 描述 |
|---|---|
| 编辑名称 | 修改GPU设备名称。 |
| 启用物理GPU | 启用物理GPU设备,启用后该物理GPU可直接透传给云主机使用。 Note: 弹性裸金属集群、容器集群的GPU不支持该操作。 |
| 停用物理GPU | 停用物理GPU设备,停用后该物理GPU设备不可继续透传给云主机使用。 Note:
|
| 设置共享模式 | 设置物理GPU设备的共享模式,支持全局共享、指定共享、不共享。 |
| 启用dGPU模式 | 为物理GPU设备开启dGPU模式,允许系统通过CUDA
API拦截转发技术,按需切分物理GPU显存,动态分配给不同云主机使用。 Note:
|
| 关闭dGPU模式 | 为物理GPU设备关闭dGPU模式,不再对其进行显存切分和动态分配。 Note: 关闭前,需确保所有相关dGPU已从云主机卸载。 |
| 虚拟化切割 | 将未透传的物理GPU设备,虚拟化切割为vGPU设备。不同厂商的物理GPU虚拟化切割方式略有不同。
Note: 虚拟化切割物理GPU设备需要满足以下条件:
|
| 虚拟化还原 | 将vGPU设备虚拟化还原为物理GPU设备。不同厂商的物理GPU虚拟化还原方式略有不同。
Note: 确保该物理GPU切割成的vGPU已全部从云主机卸载,才可执行虚拟化还原操作。 |
管理vGPU
| 操作 | 描述 |
|---|---|
| 启用vGPU | 启用vGPU设备,启用后该vGPU设备可加载给云主机使用。 |
| 停用vGPU | 停用vGPU设备,停用后该vGPU设备不可继续加载给云主机使用。 Note: 正在被云主机使用的vGPU设备可以正常使用,不受影响,直至被卸载。 |
| 设置共享模式 | 设置vGPU设备的共享模式,支持全局共享、指定共享、不共享。 |
管理dGPU
| 操作 | 描述 |
|---|---|
| 加载dGPU | 为云主机加载dGPU设备,系统将自动按照所选的GPU设备/规格和显存模板,为云主机分配对应显存。 Note:
|
| 卸载dGPU | 为云主机卸载dGPU设备,卸载后,系统将回收对应显存,并可分配给其他云主机使用。 Note: 用户可在云主机操作列表/详情页通过修改GPU配置为云主机卸载dGPU。 |
GPU设备监控
在GPU设备界面,点击GPU设备名称,进入GPU设备详情页,可查看该GPU设备的详细监控数据和监控图表。
- 物理GPU设备支持查看:GPU利用率、显存利用率、功耗、温度、风扇转速;部分NVIDIA GPU还支持查看PCIe Rx吞吐量、PCIe Tx吞吐量。
- vGPU设备支持查看:vGPU利用率、显存利用率。
- dGPU设备支持查看:dGPU利用率、显存利用率。
平台默认展示15分钟内GPU负载的变化曲线,用户也可以自定义时间跨度,查看指定时间范围内的GPU负载变化,包括:15分钟、1小时、6小时、1天、1周、1月、1年、自定义。
GPU驱动
- 物理机 | 物理GPU设备:
- 如GPU设备未透传给云主机使用,为物理机安装GPU驱动后可查看GPU负载监控。
- 如GPU设备已透传给云主机使用,为云主机安装GPU驱动和性能优化工具后可查看GPU负载监控。
- 物理机 | vGPU设备:为物理机安装GPU驱动后可查看GPU负载监控。
- 弹性裸金属 | 物理GPU设备:为弹性裸金属实例安装GPU驱动和agent后可查看GPU负载监控。
- 容器 | 物理GPU设备:为容器集群节点安装GPU驱动后可查看GPU负载监控。
| GPU | 物理机推荐驱动版本 | 云主机/弹性裸金属实例推荐驱动版本 |
|---|---|---|
| NVIDIA |
|
使用NVIDIA官方推荐最新版本:详见NVIDIA官方文档 |
| AMD | rocm-smi 6.1.2及以上版本 | rocm-smi
6.1.2及以上版本 Note: 如云主机使用RHEL7系列操作系统,需确保云主机内核为4.18.0或以上版本。 |
| Hygon |
rock-5.2.0-5.16.29-V01.13.run |
/ |
| 华为 |
Ascend-hdk-310p-npu-driver_24.1.rc1_linux-aarch64.run |
Ascend-hdk-310p-npu-driver_24.1.rc1_linux-aarch64.run |
| 天数智芯 |
|
|
注意事项
- Hygon GPU透传给云主机使用后,暂不支持通过驱动查看负载监控。
- 如已为物理机安装GPU驱动,但仍无法查看对应的GPU设备监控,可尝试重连物理机,使系统识别该GPU驱动。
- 如已为物理机或云主机安装GPU驱动 (云主机需额外安装性能优化工具),但仍无法查看对应的GPU设备监控,且检查日志文件 (物理机查看kvmagent.log,云主机查看zwatch-vm-agent.log) ,发现未找到smi报错 (例如,npu-smi not found) ,请将smi工具存放到以下任意目录:/usr/bin、/var/lib/zstack/virtualenv/kvm/bin、/sbin、/usr/sbin、/bin,建议存放到/usr/bin
- 如使用双芯片AMD卡 (AMD Firepro S7150 X2) ,并将其对应的两个物理GPU设备分别透传给不同云主机使用,请为云主机安装相同版本的驱动,以保证正常获取GPU监控数据。



