Skip to content

基本概念

在使用 Rise 智算平台控制台之前,建议先了解以下核心概念,它们贯穿算力申请、任务提交、服务部署与计费分析。

多租户模型

Workspace(工作空间)
    └── Project(项目 / Namespace)
            ├── Quota(资源配额)
            ├── Tenant DataStorage(租户数据存储)
            ├── Image / Repository(镜像)
            └── Model(模型)
  • Workspace:租户边界,成员、配额、资源池分配都以工作空间为维度。
  • Project:对应 Kubernetes Namespace,是任务、服务、数据集的实际归属。
  • Namespace = Project name:权限判定以项目为粒度, admin 账号短路所有检查。

租户与算力资源的整体关系如下:租户下划分多个项目,项目可按共享池/独享池、按卡/按节点等方式使用底层异构算力节点:

多租户体系架构图

算力资源层级

层级作用
物理 GPU 卡节点上的真实显卡,由 HAMi 设备插件纳管。
ResourcePool(资源池)按共享/独享/超分模式组织显卡,可绑定到节点或单卡。
Flavor(规格)定义 CPU/内存/架构/vGPU/算力百分比/显存,创建任务时直接选用。
Quota(配额)工作空间/项目可用的资源上限,支持动态调整。

任务类型

任务说明
容器实例(Notebook)交互式开发环境,支持 Jupyter / VS Code / CloudShell / SSH。
训练任务(TrainingJob)分布式训练,支持 PyTorch / TensorFlow / MPI / DeepSpeed。
微调任务(FineTuningJob)基于 LLaMA-Factory,支持 LoRA / QLoRA / Full / PPO 等。
评测任务(EvaluationJob)与微调任务 1:N 关联,支持 Auto-Eval 与 LLM-as-Judge。
推理服务(Inference)模型在线服务,支持 vLLM / SGLang / MindIE / vLLM-Ascend。
自定义服务(CustomService)通用 HTTP 长稳服务,基于 Deployment + Ingress。

数据与模型

  • Dataset:多版本数据集,支持文件上传/下载/预览/编辑,ModelScope / HuggingFace Hub 导入。
  • Model Repository:平台模型仓库,支持上架/下架、价格展示、一键部署。
  • Model-X:大模型服务模块,包括模型广场、Playground、API Key 与个人用量。

网关与计费

  • AiProvider(API 渠道):外部模型渠道,支持 OpenAI / Anthropic / 智谱等协议。
  • AiRoute(AI 路由):模型谓词、路径谓词与上游渠道组合,支持降级与限流。
  • Token 治理:用户应付视角,按 model / workspace / api_key 聚合。
  • API 渠道成本:渠道成本视角,按 provider / upstream model 聚合。

工作空间/项目/配额关系示意图

基于 Rise 智算平台 release-2606.v2.2.x 生成