Skip to content

算力配置

「算力配置」面向平台管理员,用于配置 GPU 调度策略、超分策略、虚拟卡、资源池、GPU 错误码知识库、监控指标以及 License 管理。

入口路径:左侧菜单 K8s 集群管理 > 算力配置

算力配置模块菜单

调度策略

查看与配置全局调度策略

  1. 进入 K8s 集群管理 > 算力配置 > 调度策略
  2. 页面加载当前集群调度配置并回显。
  3. 配置项包括:
    • 资源感知
      • 按分配率:依据已分配 GPU 资源调度,适合资源预留与独占场景。
      • 按使用率:依据实际 GPU 使用率调度,适合资源利用优化场景。
    • 节点策略
      • 紧凑调度(Binpack):优先使用已分配 GPU 的节点,减少节点占用。
      • 均衡调度(Spread):将 Pod 均衡分布到所有 GPU 节点,提高可用性与容错能力。
    • 显卡策略
      • 紧凑调度:优先使用已分配 GPU 的显卡,减少显卡占用。
      • 均衡调度:将 GPU 负载均衡分布到所有 GPU。
  4. 资源池调度开关:开启后可为不同业务/资源池设置独立调度策略;关闭后全集群统一管理。
  5. 点击「保存」统一提交全局策略与资源池开关。

调度策略配置页

超分策略

查看超分策略

  1. 进入 K8s 集群管理 > 算力配置 > 超分策略
  2. 列表默认按上次更新时间倒序展示:策略名称、策略类型、厂商、型号、vGPU 切分比、算力超分比、显存超分比、备注、是否可用、节点、设备、上次更新时间。
  3. 使用顶部搜索框按名称、厂商、型号、显存、算力、备注、更新时间全文搜索。
  4. 支持按名称/厂商/型号列筛选、手动刷新、CSV 导出、列显隐切换。

超分策略列表页

添加超分策略

添加超分策略表单

  1. 点击「添加超分策略」。
  2. 填写:
    • 策略名称:便于识别。
    • 厂商:NVIDIA / Ascend 等。
    • 型号:GPU 卡型号。
    • vGPU 切分比:如 1/2、1/4、1/8。
    • 显存超分比:数值,如 2。
    • 算力超分比:数值,如 2。
    • 备注:可选。
  3. 切分模式固定为 soft(hami-core),界面不暴露切分模式选择。
  4. 点击「保存」。

配置节点绑定

超分策略配置节点

  1. 在超分策略行内点击「配置节点」。
  2. 节点多选下拉仅列出装有匹配厂商/型号设备且支持对应切分模式的节点。
  3. hard 切分模式下,存在已分配资源池显卡的节点会被禁选。
  4. 选择节点后点击「确定」。

管理策略

  • 编辑/删除:仅自定义策略可编辑删除;固定策略受保护不可修改。
  • 批量操作:支持批量删除自定义策略。

虚拟卡

查看虚拟卡

  1. 进入 K8s 集群管理 > 算力配置 > 虚拟卡
  2. 列表展示:名称(锁图标区分物理卡/虚拟卡)、设备类型、虚拟卡类型(自定义/固定)、厂商、型号、可用状态、算力、显存。
  3. 使用顶部筛选栏按可用/不可用状态、名称、厂商、型号查询。

虚拟卡列表页

添加自定义虚拟卡

添加自定义虚拟卡表单

  1. 点击「添加自定义虚拟卡」。
  2. 填写:
    • 名称:虚拟卡名称。
    • 厂商与卡型号:级联选择,仅列出支持虚拟化且支持自定义切分的型号。
    • 算力:1-100 整数百分比。
    • 显存:不超过物理型号显存上限。
  3. 点击「创建」。

添加固定虚拟卡

添加固定虚拟卡表单

  1. 点击「添加固定虚拟卡」。
  2. 选择厂商、卡型号与切分个数:
    • 2 个:生成 1/2 档位。
    • 4 个:生成 1/2、1/4 档位。
    • 8 个:生成 1/2、1/4、1/8 档位。
  3. 系统按「型号-档位-显存 GB」自动命名并批量创建。
  4. 点击「创建」。

管理虚拟卡

  1. 点击「刷新」同步所有设备模型状态。
  2. 仅自定义虚拟设备支持行级删除;固定虚拟卡受保护。

资源池

查看资源池

  1. 进入 K8s 集群管理 > 算力配置 > 资源池
  2. 列表展示:资源池名称(可点击跳转详情)、租户标签、策略类型(共享/独享/预留/超卖)、vGPU 配额余量、算力配额余量(含分配率)、显存配额余量(含分配率)。
  3. 点击资源池名称进入详情页。

资源池列表页

资源池详情

资源池详情页

  1. 概览页签:
    • vGPU/算力/显存配额已用/总量比例。
    • 池内 GPU 设备列表(状态/型号/算力/显存)。
  2. 容器组页签:
    • 资源池全局配额卡片以环形图展示 vGPU/算力/显存及分配百分比。
    • 下方展示该资源池的 GPU 设备分组表格。
  3. 监控页签:
    • GPU 分配趋势(算力分配、显存分配)。
    • 使用趋势(算力使用、显存使用)。
    • 功耗趋势、温度趋势。
    • 支持时间范围选择。

GPU 错误配置

  1. 进入 K8s 集群管理 > 算力配置 > GPU 错误配置
  2. 页面覆盖 NVIDIA/Ascend/Metax/Kunlunxin/Hygon/Cambricon/Enflame/Iluvatar/Alibaba 共 9 家厂商。
  3. 选择厂商页签,查看错误配置列表:错误类型、严重级别、错误码、错误信息、错误描述。
  4. 使用搜索框跨错误类型、严重程度、错误码、错误信息、错误描述全文搜索。
  5. 部分厂商暂无详细错误码数据时,页面展示空状态提示。
  6. 支持 CSV 导出。

GPU 错误配置页

监控指标

  1. 进入 K8s 集群管理 > 算力配置 > 监控指标
  2. 左侧分类导航:全部 / 节点指标 / 设备指标 / 推理指标;二级分组显示实际分类(如错误与健康、算力、显存等)。
  3. 列表展示:指标名称、分类、优先级、单位、正常范围、预警阈值、严重阈值、适用对象。
  4. 点击指标名称进入详情页,查看指标描述、适用硬件、分级阈值、Prometheus 指标名与采集方式、影响面与实现难度说明。
  5. 支持列排序、分页、CSV 导出。

监控指标列表页

License

  1. 进入 K8s 集群管理 > 算力配置 > License
  2. 列表展示:UUID、显卡型号、节点名称、授权状态(未授权/已过期/已授权)、过期时间。
  3. 授权状态以不同颜色圆点区分;已过期会显示天数提示。
  4. 点击「导入」上传许可证配置文件。
  5. 点击「复制所有 UUID」一键复制全部许可证 UUID。
  6. 支持搜索过滤和列显隐切换。

License 列表页

常见问题

Q:修改调度策略后多久生效? A:调度策略由 GPU 调度器控制,保存后通常即时生效;新创建的 Pod 会按新策略调度,已运行 Pod 不受影响。

Q:为什么某些节点在超分策略配置节点时被禁选? A:hard 切分模式下,已分配资源池显卡的节点不支持绑定新的超分策略;请选择未分配的节点。

Q:固定虚拟卡和自定义虚拟卡有什么区别? A:固定虚拟卡按固定档位(1/2、1/4、1/8)批量生成;自定义虚拟卡可手动指定算力百分比和显存大小。

Q:License 已过期会怎样? A:过期后相关显卡可能无法继续使用切分或超分功能;请及时导入新的许可证。

基于 Rise 智算平台 release-2606.v2.2.x 生成