产品架构
本文内容整理自《Rise 算力管理平台技术白皮书》,介绍 Rise 智算平台的技术架构分层、核心组件与 AI 芯片支持清单。运行环境要求单独成章,见 运行环境。
技术架构
平台采用分层调用逻辑架构,自上而下依次为:

| 层级 | 说明 |
|---|---|
| 接入层 | Higress 网关统一承接南北向流量(前端、业务 API、MCP Server);cert-manager 负责 TLS 证书自动签发与续期。 |
| 前端层 | console-ui 管理控制台(Vue 3 微前端),提供智算开发平台与管理后台两套入口。 |
| 业务后端层 | auc(认证与用户中心)、nova(算力资源调度引擎)、duty(告警与值班)、novanotebook(Notebook 与自定义服务生命周期 Operator)。 |
| VAST 平台底座层 | 自研云原生 APIServer(vast-apiserver/controller):GPU 设备管理、镜像仓库(Harbor)集成、Pod 设备资源与拉取密钥注入。 |
| 异构算力层 | GPU/NPU 虚拟化与调度(HAMi)、分布式批调度(Volcano、LWS)、各厂商 device-plugin;运行指标由 dcgm-exporter、npu-exporter 采集上送。 |
| 数据/存储/可观测层 | PostgreSQL(Patroni 高可用)、Redis、MinIO(对象存储/日志持久化)、nfs-provider(NFS 动态供给)、Prometheus、fluent-bit(日志采集)、tempo(链路追踪)。 |
| AI 助手层(旁路) | 平台内置聊天助手基于大语言模型,经 camp-mcp-server 与 acuvity-mcp-server 提供的 MCP 工具能力对外服务,不侵入主链路。 |
架构特点
- 异构 GPU 资源统一调度:在操作系统用户层实现跨厂商算力池化调度,不侵入 Linux 与 K8s 内核。
- 高可用架构:实时监测组件状态、故障自动重启/重调度;管控与计算分离。
- 快速迭代:组件容器化交付、微服务松耦合,支持灰度发布与回滚,组件可独立升级。
- 多架构部署:容器镜像与 K8s API 屏蔽底层差异,支持跨云、本地及边缘部署,支持 x86 与 ARM 架构。
- 可观测平台:Prometheus 指标采集 + 可视化界面,覆盖设备层到任务层的全链路监控。
核心组件
平台组件按前端层、可观测层、后端层与基础设施层组织:

| 组件 | 核心功能 |
|---|---|
| Higress 网关 | 统一南北向流量入口,路由前端、业务 API、MCP Server |
| cert-manager | 集群内 TLS 证书自动签发与续期 |
| console-ui | 算力平台管理控制台,会话与登录态 |
| k8s-dashboard | 多集群节点/Pod/存储管理,集成终端访问 |
| auc | 认证与用户中心,部门/主机/集群定时同步 |
| nova | GPU/vGPU 算力资源管理与调度引擎,资源回收/清理/计费/微调训练/数据集管理 |
| duty | 告警与值班管理:告警接收、升级、排班轮转、通知 |
| VAST(vast-apiserver/controller) | 自研云原生 APIServer:GPU 设备管理、镜像仓库集成、Pod 资源注入 |
| novanotebook | Notebook 与自定义服务生命周期管理(Operator) |
| cloudtty | Pod/节点终端管理 |
| sftgo | 模型权重/文件上传管理 |
| camp-ai-assistant | 平台 AI 助手,通过 MCP 调用工具 |
| camp-mcp-server | 向 AI 助手暴露平台数据查询工具(应用/资源/任务) |
| acuvity-mcp-server | 提供绘图/图表生成等 MCP 工具能力 |
| hami | 异构算力虚拟化(vGPU 显存/算力切分)+ 调度器 |
| volcano | 分布式训练批调度,Gang 调度 |
| lws | LeaderWorkerSet,分布式训练 Leader/Worker 协调 |
| metax-operator | 沐曦 GPU 设备管理与调度 |
| device-plugin | 各厂商显卡设备 K8s 插件(GPU/NPU 等) |
| dcgm-exporter | NVIDIA GPU 指标采集(DaemonSet) |
| npu-exporter | 昇腾 NPU 指标采集(DaemonSet) |
| postgresql / pg-patroni | 关系型数据持久化 + 高可用 |
| redis | 缓存/会话/队列 |
| fluent-bit | 节点日志采集与转发(DaemonSet) |
| tempo | 分布式链路追踪存储 |
| minio | 日志与对象存储 |
| nfs-provider | CSI 共享存储对接 NFS,供各 GPU 节点文件共享挂载 |
| prometheus | 监控指标采集与存储 |
AI 芯片厂商支持清单
| 厂商 | 型号 | 池化支持 |
|---|---|---|
| NVIDIA | 全系 | ✅ 支持 |
| 昇腾 | 310P / 910A / 910B2、B3、B4 / 910C | ✅ 支持 |
| 海光 | DCU Z100、Z100L / K100、K100_AI | ✅ 支持 |
| 沐曦 | 曦云 C500 | ✅ 支持 |
| 寒武纪 | 370X4、X8 / 370S4、S8 / 590 | ✅ 支持 |
| 天数智芯 | 天垓 BI-V100、BI-V150 / 智铠 MR-V100 | ✅ 支持 |
| 摩尔线程 | MTT S4000 / M1000 | ✅ 支持 |
| 昆仑芯 | 3 代 P800 | ✅ 支持 |
| 燧原 | S60 | ✅ 支持 |
| 平头哥 | PPU | ✅ 支持 |
运行环境要求(软件依赖、资源配置建议、部署拓扑、操作系统与 AI 框架支持)见 运行环境。