Skip to content

资源总览

「资源总览」提供集群资源全景视图,帮助运维人员快速掌握集群健康度、节点状态、GPU 资源使用情况以及近期集群事件。

入口路径:左侧菜单 K8s 集群管理 > 资源总览

资源总览页面整体效果

智算中心运营大屏

「智算中心运营大屏」提供面向运维与运营人员的集群级可视化大盘,展示算力资源、租户资源池、模型 Token 消耗、告警等核心指标。

入口路径:左侧菜单 K8s 集群管理 > 资源总览 > 运营大屏,或直接访问 /camp/k8s-dashboard/operation

查看多集群概览

  1. 进入运营大屏后,默认展示「多集群管理」视图。
  2. 页面顶部展示所有集群的汇总指标:集群总数、节点总数、CPU 核数、GPU 卡数、总算力(TFLOPS)。
  3. 每个集群以卡片形式展示关键信息:
    • 集群名称与在线状态
    • 资源分配与利用率:CPU 分配、内存分配、GPU 算力使用、GPU 显存利用
    • 实时负载趋势

多集群管理概览

进入单个集群大屏

  1. 在多集群管理页面,点击目标集群卡片(如「主集群」)。
  2. 页面跳转至该集群的运营大屏,URL 形如 /camp/k8s-dashboard/operation/cluster/<cluster-name>
  3. 单集群大屏包含:
    • 算力资源概览:GPU 算力、GPU 显存、CPU、内存的实时利用率。
    • Top 5 型号负载率:按显卡型号展示负载排行。
    • Top 5 租户资源池:展示资源池配额与使用率。
    • 告警中心:统计告警、预警、提示、已清除数量及 7 天趋势。
    • 算力资源使用趋势:GPU 算力、显存、CPU、内存的时序曲线。
    • 模型 Token 消耗分析:近 7 天/今日 Token 消耗及模型排行。
    • 模型性能指标:平均时延、吞吐量、QPS、缓存率、P99/P95 时延等。

单集群运营大屏

概览

查看集群统计

  1. 进入 K8s 集群管理 > 资源总览
  2. 页面顶部展示集群基础信息:
    • 集群提供商
    • 集群名称
    • Kubernetes 版本
    • 管理地址
    • 节点数(含未就绪数)
    • Pods 总数(含失败/等待中数量)
    • 命名空间数
    • 服务数
  3. 中部展示「资源请求」环形图:
    • GPU 使用率(TFLOPS):requests / limits / total
    • GPU 显存使用量(GiB):requests / limits / total
    • CPU 使用率(核心):requests / limits / total
    • 内存使用率(GiB):requests / limits / total
  4. 下方展示「最近集群事件」列表,包含事件内容及上报组件(reporter)。

资源总览概览区域

查看资源趋势

  1. 若集群已开启 Prometheus,页面底部展示近 24 小时趋势图。
  2. 图表每 30 秒自动刷新,包含:
    • GPU 资源利用率:GPU 算力使用率、GPU 显存使用率
    • 通算资源利用率:CPU、内存
    • 网络用量:入站/出站
    • 磁盘 I/O 用量:读取/写入
  3. 将鼠标悬停在曲线上,查看具体时间点数值。

节点管理

查看节点列表

  1. 进入 K8s 集群管理 > 资源总览 > 节点管理(或在概览页点击节点相关入口)。
  2. 列表展示:节点名称、状态、角色、IP 地址、GPU 厂商、调度场景、GPU 数量、容器组、CPU/内存、算力、显存、K8s 版本、创建时间。
  3. 状态列以彩色徽标展示:就绪、未就绪、调度已禁用、网络不可用、内存压力、磁盘压力、PID 压力等。
  4. 使用顶部搜索框按名称、版本、操作系统、状态、角色、IP 查询;搜索词按集群本地记忆。
  5. 点击列表右上角「监控视图」或相关入口切换展示方式。

节点管理列表页

节点详情

节点详情页

  1. 点击节点名称进入详情页。
  2. 概览页签:
    • 状态概览:节点状态、角色、内部 IP、Pod CIDR。
    • 节点信息:Kubelet 版本、主机名、操作系统镜像、内核版本、架构、容器运行时、标签/注解。
    • 资源容量:CPU/内存/算力/显存/容器组/临时存储的容量与可分配对照。
    • 设备配置健康状态面板:聚合健康结论、异常原因、调和条件、修复建议。
    • 节点污点列表与节点状况(Ready/MemoryPressure/DiskPressure 等 condition)。
  3. 容器组页签:展示该节点上的 Pod 列表,点击可跳转 Pod 详情。
  4. GPU页签:按厂商分卡片展示设备配置及该节点显卡列表。
  5. 显卡拓扑页签:展示 GPU 互联拓扑矩阵(如 NVLink)。
  6. 监控页签:支持时间范围选择与自动刷新档位(5~60 秒),展示 GPU 算力/显存、CPU/内存、网络、磁盘等多指标。

批量配置节点

批量配置节点弹窗

  1. 在节点列表左侧勾选多个节点。
  2. 点击「批量配置」,统一下发设备配置:
    • 调度场景:hami(开发/推理)、volcano(训练/微调)。
    • 厂商、整卡/硬切/软切/超分类型。
    • 算力模板。
  3. 弹窗提供变更前后对照预览,自动识别并跳过已锁定节点。
  4. 确认后提交。

批量分配 GPU 卡

批量分配 GPU 卡弹窗

  1. 勾选多个节点,点击「批量分配卡」。
  2. 将节点 GPU 分配到租户预留资源池。
  3. 逐节点选卡,列表显示已分配状态;支持取消分配。
  4. 可查看 GPU 互联拓扑辅助选卡。
  5. 确认后提交。

节点运维操作

节点运维操作按钮

  1. 在节点详情页顶部点击对应按钮:
    • 节点配置:修改节点设备配置。
    • 分配卡:将节点 GPU 分配到资源池。
    • 排空(drain):可选强制排空、删除本地数据、忽略 DaemonSet、自定义宽限期。
    • 停止调度/恢复调度(cordon/uncordon):控制节点是否接受新 Pod 调度。
    • 污点管理:添加/移除 NoSchedule/PreferNoSchedule/NoExecute 污点。
    • kubectl describe:查看节点 describe 输出。
    • 终端:打开节点 Web 终端。

显卡管理

查看显卡总览

  1. 进入 K8s 集群管理 > 资源总览 > 显卡管理
  2. 页面顶部展示:
    • GPU 总卡数(含正常/异常拆分)
    • 异常卡数(XID、ECC 等错误)
    • 算力利用率(5 分钟均值)
    • 集群总功耗
  3. 下方展示分布环形图:运行状态、厂商、型号、用途。

显卡管理总览

查看显卡列表

  1. 列表展示:显卡别名/ID、是否健康、是否启用、资源池、厂商、型号、节点、算力(已分配/总量)、显存(已分配/总量)。
  2. 算力与显存列采用双进度条展示分配率(请求/可分配)与使用率(实际使用/物理总量)。
  3. 使用顶部搜索框按别名、ID、型号、UUID、节点、厂商、健康与启用状态查询。
  4. 点击资源池名称可跳转对应资源池页面;未分配的显卡显示「未分配」标识。

显卡列表页

启用/禁用显卡

  1. 在显卡列表行内点击「启用」或「禁用」。
  2. 禁用时可选择是否驱逐该卡上的 Pod;禁用后显卡不再接受新 Pod 调度。
  3. 批量操作:勾选多张显卡后点击「批量启用」或「批量禁用」。

显卡详情

显卡详情页

  1. 点击显卡 UUID 或名称进入详情页。
  2. 概览页签展示:
    • 设备 ID、UUID(可复制)、节点名称(可跳转)、节点状态、健康与启用状态、资源池。
    • 许可证状态:已授权/已过期/未授权及过期时间。
    • 硬件信息:厂商、型号、架构、计算架构、共享模式、虚拟显存/物理显存。
    • vGPU 配置:算力超配倍数、显存超配倍数、超配模板名(只读)。
  3. 异常算力页签:展示错误列表,含严重程度、错误类型、错误码、错误信息、出现次数、首次/末次出现时间。
  4. Pod 列表页签:展示当前节点上实际引用该显卡的 Pod 列表。
  5. 监控页签:展示算力/显存分配率与使用率、GPU 功率、GPU 温度等趋势图;支持时间范围选择(10 分钟至 30 天或自定义)与自动刷新档位(5~60 秒)。

常见问题

Q:节点状态显示 NotReady 怎么办? A:查看节点详情页「节点状况」和「事件」页签,常见原因包括网络异常、kubelet 异常、磁盘压力、内存压力等。

Q:显卡健康状态异常如何排查? A:进入显卡详情页「异常算力」页签,查看具体错误码和错误信息;可参考「算力配置 > GPU 错误配置」中的厂商错误码知识库。

Q:批量配置节点时部分节点被跳过? A:被跳过的节点可能处于锁定状态或已有任务运行;请检查节点状态,必要时先停止调度或排空节点。

基于 Rise 智算平台 release-2606.v2.2.x 生成