管理员快速入门
本文面向使用「管理后台」的项目/租户管理员、平台运维和平台运营者,介绍如何登录管理后台、完成平台首轮配置,并建立工作空间、项目、资源池、配额、AI 资产、策略与告警的完整治理链路。

1. 登录管理后台
- 打开浏览器,访问
https://<camp-domain>/camp/admin/login。 - 使用管理员账号登录。
- 登录后默认进入 AI 智算管理 > 管理员工作台。
- 顶部导航可切换 AI 智算管理、大模型服务、计量计费、告警中心、集群管理;平台管理与 K8s 集群管理通过对应菜单进入。

2. 了解管理员工作台
「管理员工作台」是平台运营总览页,展示:
- 平台核心 KPI:资源总量、已分配/已使用配额、运行中负载。
- 资源使用趋势:GPU/CPU/内存/显存近 7/30 天走势。
- 模型调用 Top 榜:调用量、Token 消耗、费用排名。
- 告警与通知:待处理告警、系统消息。
通过该页面,管理员可以快速判断平台健康度和资源瓶颈。
3. 配置 AI 资产管理
在将资源分配给租户之前,建议先配置好公共资源:
- 进入 AI 智算管理 > AI 资产管理。
- 配置 存储服务:添加公共存储后端,供工作空间挂载。
- 配置 数据存储卷:创建可被多个项目共享的数据卷。
- 配置 算力规格:定义 CPU、内存、GPU 卡数、显存等模板。
- 配置 镜像源 / 镜像服务:维护公共镜像仓库与平台镜像。
- 配置 凭证与密钥:统一管理镜像仓库、SSH、API 等敏感凭证。
- 配置 标签:为资源打标签,便于后续筛选与计费归集。
详细操作参见 AI 智算管理 / AI 资产管理。
4. 规划工作空间与项目
工作空间对应租户/团队,项目对应 K8s Namespace,是资源隔离与权限控制的基础。
- 进入 AI 智算管理 > 工作空间与项目 > 工作空间管理。
- 点击「创建工作空间」,填写名称、负责人、配额策略。
- 在工作空间详情中,为工作空间绑定 资源池。
- 进入 项目管理,为每个业务团队创建独立项目。
- 进入 配额管理,为工作空间/项目设置 CPU、内存、GPU、显存上限。
- 进入 成员管理,邀请用户并分配项目角色。
详细操作参见 AI 智算管理 / 工作空间与项目。
5. 配置策略管理
为避免资源长期占用、保障训练任务调度公平,需要配置策略:
- 进入 AI 智算管理 > 策略管理。
- 配置 训练调度策略:设置队列优先级、抢占策略、 gang-scheduling 规则。
- 配置 资源回收策略:定义闲置实例、任务的自动回收时间。
- 配置 优先级策略:为不同项目或任务类型设置调度权重。
详细操作参见 AI 智算管理 / 策略管理。
6. 配置模型与 AI 网关
如果平台需要对外提供大模型服务,按以下顺序配置:
- 进入 AI 智算管理 > 模型管理,发布模型到模型广场并创建部署模板。
- 进入 AI 智算管理 > AI 网关,接入外部模型渠道(OpenAI、Claude、国产模型等)。
- 配置 AI 路由:按模型、租户、项目设置路由与限流降级策略。
- 配置 API Key 与 MCP:管理调用凭证与模型上下文协议。
详细操作参见 AI 智算管理 / 模型管理、AI 智算管理 / AI 网关。
7. 配置告警与值班
为及时发现平台异常,建议配置告警中心:
- 进入 告警中心 > 规则管理,创建告警规则,定义触发条件与告警等级。
- 进入 告警中心 > 告警管理 > 消息模板,配置通知内容模板。
- 进入 告警中心 > 告警管理 > 订阅策略,配置告警接收人与通知渠道。
- 进入 告警中心 > 告警管理 > 降噪配置,配置告警收敛策略,避免告警风暴。
- 进入 告警中心 > 值班管理,创建值班小组与排班计划。
详细操作参见 告警中心 / 规则管理、告警中心 / 告警管理。
8. 查看 K8s 集群状态
平台运维需要持续关注集群健康:
- 进入 K8s 集群管理 > 资源总览,查看集群整体健康度、节点/GPU 状态。
- 在 算力配置 中配置 GPU 调度策略、超分策略和资源池。
- 在 工作负载 中排查 Pod、Deployment 等运行状态。
- 在 流量、存储、容器配置、安全、其他 中管理 Ingress、PVC、ConfigMap、RBAC、Namespace 等。
详细操作参见 K8s 集群管理 / 资源总览。
9. 配置平台与集群参数
最后,根据企业安全与合规要求配置全局参数:
- 进入 平台管理 > 平台配置,配置全局参数、第三方登录、OAuth 应用、应用管理、密码安全、导航排序。
- 进入 平台管理 > 平台与成员,管理多 K8s 集群纳管、平台用户与角色。
- 进入 集群管理 > 集群配置,查看集群参数,配置敏感操作的二次验证方式。
- 进入 集群管理 > 日志和消息,查看操作审计与系统通知。
详细操作参见 平台管理 / 平台配置、集群管理 / 集群配置。
10. 查看计量计费
平台运行一段时间后,可在 计量计费 中查看成本:
- 租户资源总览:按平台/租户/项目/用户查看 GPU/CPU/内存资源成本。
- Token 治理:按模型/API Key/用户统计大模型调用应收费用。
- API 渠道:对比上游账单与平台记录,完成渠道对账。
- 物理资源总览:按物理节点/GPU 卡统计集群运营成本。
详细操作参见 计量计费 / 租户资源总览。
下一步
- 治理租户与资源:参见 AI 智算管理 / 工作空间与项目、AI 智算管理 / AI 资产管理。
- 保障平台稳定:参见 K8s 集群管理 / 资源总览、告警中心 / 规则管理。
- 精细化成本核算:参见 计量计费 / 租户资源总览、计量计费 / Token 治理。
- 了解费用详情:参见 费用说明。