Skip to content

运行环境

本文内容整理自《Rise 算力管理平台技术白皮书》,介绍部署 Rise 智算平台所需的软件依赖、生产资源配置建议、硬件与操作系统兼容性,以及 AI 框架支持范围。

软件依赖

类别软件版本
操作系统Ubuntu20.04
容器Docker / containerd20.10+
编排Kubernetes1.23+
存储NFS 共享存储平台数据库与模型数据存储

生产资源配置建议

  • 管理节点(Master):至少 3 台 CPU 服务器高可用部署;CPU 2.5 GHz/10 核以上,内存 32 GB 以上,磁盘 200 GB 以上,10G 网络上联。
  • GPU 工作节点(Worker):1~n 台;CPU 2.5 GHz/10 核以上,内存 64 GB 以上,磁盘 200 GB 以上;NVIDIA GPU ≥ 2 卡或昇腾/天数等其他算力卡。需要多机多卡训练/推理时,建议至少 200G 参数交换机互联。

部署拓扑

典型生产环境划分为推理训练区、存储区与管理区,算力服务器通过 200/400GE IB 或 RoCE 网络互联,管理、业务与存储流量走 10G/25GE 交换机:

Rise 智算平台典型部署拓扑

硬件与操作系统

  • 处理器:x86 架构(Intel、海光等)与 ARM 架构(鲲鹏、昇腾等)。
  • 操作系统:CentOS 7/8、RHEL 7/8、Ubuntu 20/22,以及欧拉 22.03-LTS、统信 UOS、麒麟 V10-SP1 等国产化操作系统。

AI 框架支持

  • 计算库:CUDA 9.x+、cuDNN 7.4.2+、CANN(昇腾)、Neuware(寒武纪)、DTK(海光)、ROCm 等。
  • 训练框架:PyTorch 1.0+、TensorFlow 1.8+、PaddlePaddle 1.5+、MindSpore 2.0+、MXNet 1.4+、ONNX 1.0+。

基于 Rise 智算平台 release-2606.v2.2.x 生成