算力配置
「算力配置」面向平台管理员,用于配置 GPU 调度策略、超分策略、虚拟卡、资源池、GPU 错误码知识库、监控指标以及 License 管理。
入口路径:左侧菜单 K8s 集群管理 > 算力配置。

调度策略
查看与配置全局调度策略
- 进入 K8s 集群管理 > 算力配置 > 调度策略。
- 页面加载当前集群调度配置并回显。
- 配置项包括:
- 资源感知:
- 按分配率:依据已分配 GPU 资源调度,适合资源预留与独占场景。
- 按使用率:依据实际 GPU 使用率调度,适合资源利用优化场景。
- 节点策略:
- 紧凑调度(Binpack):优先使用已分配 GPU 的节点,减少节点占用。
- 均衡调度(Spread):将 Pod 均衡分布到所有 GPU 节点,提高可用性与容错能力。
- 显卡策略:
- 紧凑调度:优先使用已分配 GPU 的显卡,减少显卡占用。
- 均衡调度:将 GPU 负载均衡分布到所有 GPU。
- 资源感知:
- 资源池调度开关:开启后可为不同业务/资源池设置独立调度策略;关闭后全集群统一管理。
- 点击「保存」统一提交全局策略与资源池开关。

超分策略
查看超分策略
- 进入 K8s 集群管理 > 算力配置 > 超分策略。
- 列表默认按上次更新时间倒序展示:策略名称、策略类型、厂商、型号、vGPU 切分比、算力超分比、显存超分比、备注、是否可用、节点、设备、上次更新时间。
- 使用顶部搜索框按名称、厂商、型号、显存、算力、备注、更新时间全文搜索。
- 支持按名称/厂商/型号列筛选、手动刷新、CSV 导出、列显隐切换。

添加超分策略

- 点击「添加超分策略」。
- 填写:
- 策略名称:便于识别。
- 厂商:NVIDIA / Ascend 等。
- 型号:GPU 卡型号。
- vGPU 切分比:如 1/2、1/4、1/8。
- 显存超分比:数值,如 2。
- 算力超分比:数值,如 2。
- 备注:可选。
- 切分模式固定为 soft(hami-core),界面不暴露切分模式选择。
- 点击「保存」。
配置节点绑定

- 在超分策略行内点击「配置节点」。
- 节点多选下拉仅列出装有匹配厂商/型号设备且支持对应切分模式的节点。
- hard 切分模式下,存在已分配资源池显卡的节点会被禁选。
- 选择节点后点击「确定」。
管理策略
- 编辑/删除:仅自定义策略可编辑删除;固定策略受保护不可修改。
- 批量操作:支持批量删除自定义策略。
虚拟卡
查看虚拟卡
- 进入 K8s 集群管理 > 算力配置 > 虚拟卡。
- 列表展示:名称(锁图标区分物理卡/虚拟卡)、设备类型、虚拟卡类型(自定义/固定)、厂商、型号、可用状态、算力、显存。
- 使用顶部筛选栏按可用/不可用状态、名称、厂商、型号查询。

添加自定义虚拟卡

- 点击「添加自定义虚拟卡」。
- 填写:
- 名称:虚拟卡名称。
- 厂商与卡型号:级联选择,仅列出支持虚拟化且支持自定义切分的型号。
- 算力:1-100 整数百分比。
- 显存:不超过物理型号显存上限。
- 点击「创建」。
添加固定虚拟卡

- 点击「添加固定虚拟卡」。
- 选择厂商、卡型号与切分个数:
- 2 个:生成 1/2 档位。
- 4 个:生成 1/2、1/4 档位。
- 8 个:生成 1/2、1/4、1/8 档位。
- 系统按「型号-档位-显存 GB」自动命名并批量创建。
- 点击「创建」。
管理虚拟卡
- 点击「刷新」同步所有设备模型状态。
- 仅自定义虚拟设备支持行级删除;固定虚拟卡受保护。
资源池
查看资源池
- 进入 K8s 集群管理 > 算力配置 > 资源池。
- 列表展示:资源池名称(可点击跳转详情)、租户标签、策略类型(共享/独享/预留/超卖)、vGPU 配额余量、算力配额余量(含分配率)、显存配额余量(含分配率)。
- 点击资源池名称进入详情页。

资源池详情

- 概览页签:
- vGPU/算力/显存配额已用/总量比例。
- 池内 GPU 设备列表(状态/型号/算力/显存)。
- 容器组页签:
- 资源池全局配额卡片以环形图展示 vGPU/算力/显存及分配百分比。
- 下方展示该资源池的 GPU 设备分组表格。
- 监控页签:
- GPU 分配趋势(算力分配、显存分配)。
- 使用趋势(算力使用、显存使用)。
- 功耗趋势、温度趋势。
- 支持时间范围选择。
GPU 错误配置
- 进入 K8s 集群管理 > 算力配置 > GPU 错误配置。
- 页面覆盖 NVIDIA/Ascend/Metax/Kunlunxin/Hygon/Cambricon/Enflame/Iluvatar/Alibaba 共 9 家厂商。
- 选择厂商页签,查看错误配置列表:错误类型、严重级别、错误码、错误信息、错误描述。
- 使用搜索框跨错误类型、严重程度、错误码、错误信息、错误描述全文搜索。
- 部分厂商暂无详细错误码数据时,页面展示空状态提示。
- 支持 CSV 导出。

监控指标
- 进入 K8s 集群管理 > 算力配置 > 监控指标。
- 左侧分类导航:全部 / 节点指标 / 设备指标 / 推理指标;二级分组显示实际分类(如错误与健康、算力、显存等)。
- 列表展示:指标名称、分类、优先级、单位、正常范围、预警阈值、严重阈值、适用对象。
- 点击指标名称进入详情页,查看指标描述、适用硬件、分级阈值、Prometheus 指标名与采集方式、影响面与实现难度说明。
- 支持列排序、分页、CSV 导出。

License
- 进入 K8s 集群管理 > 算力配置 > License。
- 列表展示:UUID、显卡型号、节点名称、授权状态(未授权/已过期/已授权)、过期时间。
- 授权状态以不同颜色圆点区分;已过期会显示天数提示。
- 点击「导入」上传许可证配置文件。
- 点击「复制所有 UUID」一键复制全部许可证 UUID。
- 支持搜索过滤和列显隐切换。

常见问题
Q:修改调度策略后多久生效? A:调度策略由 GPU 调度器控制,保存后通常即时生效;新创建的 Pod 会按新策略调度,已运行 Pod 不受影响。
Q:为什么某些节点在超分策略配置节点时被禁选? A:hard 切分模式下,已分配资源池显卡的节点不支持绑定新的超分策略;请选择未分配的节点。
Q:固定虚拟卡和自定义虚拟卡有什么区别? A:固定虚拟卡按固定档位(1/2、1/4、1/8)批量生成;自定义虚拟卡可手动指定算力百分比和显存大小。
Q:License 已过期会怎样? A:过期后相关显卡可能无法继续使用切分或超分功能;请及时导入新的许可证。