资源总览
「资源总览」提供集群资源全景视图,帮助运维人员快速掌握集群健康度、节点状态、GPU 资源使用情况以及近期集群事件。
入口路径:左侧菜单 K8s 集群管理 > 资源总览。

智算中心运营大屏
「智算中心运营大屏」提供面向运维与运营人员的集群级可视化大盘,展示算力资源、租户资源池、模型 Token 消耗、告警等核心指标。
入口路径:左侧菜单 K8s 集群管理 > 资源总览 > 运营大屏,或直接访问
/camp/k8s-dashboard/operation。
查看多集群概览
- 进入运营大屏后,默认展示「多集群管理」视图。
- 页面顶部展示所有集群的汇总指标:集群总数、节点总数、CPU 核数、GPU 卡数、总算力(TFLOPS)。
- 每个集群以卡片形式展示关键信息:
- 集群名称与在线状态
- 资源分配与利用率:CPU 分配、内存分配、GPU 算力使用、GPU 显存利用
- 实时负载趋势

进入单个集群大屏
- 在多集群管理页面,点击目标集群卡片(如「主集群」)。
- 页面跳转至该集群的运营大屏,URL 形如
/camp/k8s-dashboard/operation/cluster/<cluster-name>。 - 单集群大屏包含:
- 算力资源概览:GPU 算力、GPU 显存、CPU、内存的实时利用率。
- Top 5 型号负载率:按显卡型号展示负载排行。
- Top 5 租户资源池:展示资源池配额与使用率。
- 告警中心:统计告警、预警、提示、已清除数量及 7 天趋势。
- 算力资源使用趋势:GPU 算力、显存、CPU、内存的时序曲线。
- 模型 Token 消耗分析:近 7 天/今日 Token 消耗及模型排行。
- 模型性能指标:平均时延、吞吐量、QPS、缓存率、P99/P95 时延等。

概览
查看集群统计
- 进入 K8s 集群管理 > 资源总览。
- 页面顶部展示集群基础信息:
- 集群提供商
- 集群名称
- Kubernetes 版本
- 管理地址
- 节点数(含未就绪数)
- Pods 总数(含失败/等待中数量)
- 命名空间数
- 服务数
- 中部展示「资源请求」环形图:
- GPU 使用率(TFLOPS):requests / limits / total
- GPU 显存使用量(GiB):requests / limits / total
- CPU 使用率(核心):requests / limits / total
- 内存使用率(GiB):requests / limits / total
- 下方展示「最近集群事件」列表,包含事件内容及上报组件(reporter)。

查看资源趋势
- 若集群已开启 Prometheus,页面底部展示近 24 小时趋势图。
- 图表每 30 秒自动刷新,包含:
- GPU 资源利用率:GPU 算力使用率、GPU 显存使用率
- 通算资源利用率:CPU、内存
- 网络用量:入站/出站
- 磁盘 I/O 用量:读取/写入
- 将鼠标悬停在曲线上,查看具体时间点数值。
节点管理
查看节点列表
- 进入 K8s 集群管理 > 资源总览 > 节点管理(或在概览页点击节点相关入口)。
- 列表展示:节点名称、状态、角色、IP 地址、GPU 厂商、调度场景、GPU 数量、容器组、CPU/内存、算力、显存、K8s 版本、创建时间。
- 状态列以彩色徽标展示:就绪、未就绪、调度已禁用、网络不可用、内存压力、磁盘压力、PID 压力等。
- 使用顶部搜索框按名称、版本、操作系统、状态、角色、IP 查询;搜索词按集群本地记忆。
- 点击列表右上角「监控视图」或相关入口切换展示方式。

节点详情

- 点击节点名称进入详情页。
- 概览页签:
- 状态概览:节点状态、角色、内部 IP、Pod CIDR。
- 节点信息:Kubelet 版本、主机名、操作系统镜像、内核版本、架构、容器运行时、标签/注解。
- 资源容量:CPU/内存/算力/显存/容器组/临时存储的容量与可分配对照。
- 设备配置健康状态面板:聚合健康结论、异常原因、调和条件、修复建议。
- 节点污点列表与节点状况(Ready/MemoryPressure/DiskPressure 等 condition)。
- 容器组页签:展示该节点上的 Pod 列表,点击可跳转 Pod 详情。
- GPU页签:按厂商分卡片展示设备配置及该节点显卡列表。
- 显卡拓扑页签:展示 GPU 互联拓扑矩阵(如 NVLink)。
- 监控页签:支持时间范围选择与自动刷新档位(5~60 秒),展示 GPU 算力/显存、CPU/内存、网络、磁盘等多指标。
批量配置节点

- 在节点列表左侧勾选多个节点。
- 点击「批量配置」,统一下发设备配置:
- 调度场景:hami(开发/推理)、volcano(训练/微调)。
- 厂商、整卡/硬切/软切/超分类型。
- 算力模板。
- 弹窗提供变更前后对照预览,自动识别并跳过已锁定节点。
- 确认后提交。
批量分配 GPU 卡

- 勾选多个节点,点击「批量分配卡」。
- 将节点 GPU 分配到租户预留资源池。
- 逐节点选卡,列表显示已分配状态;支持取消分配。
- 可查看 GPU 互联拓扑辅助选卡。
- 确认后提交。
节点运维操作

- 在节点详情页顶部点击对应按钮:
- 节点配置:修改节点设备配置。
- 分配卡:将节点 GPU 分配到资源池。
- 排空(drain):可选强制排空、删除本地数据、忽略 DaemonSet、自定义宽限期。
- 停止调度/恢复调度(cordon/uncordon):控制节点是否接受新 Pod 调度。
- 污点管理:添加/移除 NoSchedule/PreferNoSchedule/NoExecute 污点。
- kubectl describe:查看节点 describe 输出。
- 终端:打开节点 Web 终端。
显卡管理
查看显卡总览
- 进入 K8s 集群管理 > 资源总览 > 显卡管理。
- 页面顶部展示:
- GPU 总卡数(含正常/异常拆分)
- 异常卡数(XID、ECC 等错误)
- 算力利用率(5 分钟均值)
- 集群总功耗
- 下方展示分布环形图:运行状态、厂商、型号、用途。

查看显卡列表
- 列表展示:显卡别名/ID、是否健康、是否启用、资源池、厂商、型号、节点、算力(已分配/总量)、显存(已分配/总量)。
- 算力与显存列采用双进度条展示分配率(请求/可分配)与使用率(实际使用/物理总量)。
- 使用顶部搜索框按别名、ID、型号、UUID、节点、厂商、健康与启用状态查询。
- 点击资源池名称可跳转对应资源池页面;未分配的显卡显示「未分配」标识。

启用/禁用显卡
- 在显卡列表行内点击「启用」或「禁用」。
- 禁用时可选择是否驱逐该卡上的 Pod;禁用后显卡不再接受新 Pod 调度。
- 批量操作:勾选多张显卡后点击「批量启用」或「批量禁用」。
显卡详情

- 点击显卡 UUID 或名称进入详情页。
- 概览页签展示:
- 设备 ID、UUID(可复制)、节点名称(可跳转)、节点状态、健康与启用状态、资源池。
- 许可证状态:已授权/已过期/未授权及过期时间。
- 硬件信息:厂商、型号、架构、计算架构、共享模式、虚拟显存/物理显存。
- vGPU 配置:算力超配倍数、显存超配倍数、超配模板名(只读)。
- 异常算力页签:展示错误列表,含严重程度、错误类型、错误码、错误信息、出现次数、首次/末次出现时间。
- Pod 列表页签:展示当前节点上实际引用该显卡的 Pod 列表。
- 监控页签:展示算力/显存分配率与使用率、GPU 功率、GPU 温度等趋势图;支持时间范围选择(10 分钟至 30 天或自定义)与自动刷新档位(5~60 秒)。
常见问题
Q:节点状态显示 NotReady 怎么办? A:查看节点详情页「节点状况」和「事件」页签,常见原因包括网络异常、kubelet 异常、磁盘压力、内存压力等。
Q:显卡健康状态异常如何排查? A:进入显卡详情页「异常算力」页签,查看具体错误码和错误信息;可参考「算力配置 > GPU 错误配置」中的厂商错误码知识库。
Q:批量配置节点时部分节点被跳过? A:被跳过的节点可能处于锁定状态或已有任务运行;请检查节点状态,必要时先停止调度或排空节点。