算力服务
「算力服务」是开发者日常使用最多的模块,提供三类工作负载:
- 容器实例:带 GPU 的交互式开发环境(Jupyter / VS Code / SSH)。
- 推理服务:将模型部署为在线 API 服务(vLLM / SGLang / MindIE 等引擎)。
- 自定义服务:将任意容器镜像发布为长稳 HTTP 服务。
入口路径:左侧菜单 AI 智算开发 > 算力服务,页面路由
/admin/ai/deployer/compute。

容器实例
容器实例适合调试代码、运行 Notebook、保存环境镜像。一个实例对应一个 Kubernetes Pod,关机不释放资源,释放才会回收。
创建容器实例
- 进入 AI 智算开发 > 算力服务 > 容器实例,点击「创建容器实例」。
- 基础信息
- 工作空间/项目:默认带入当前租户和项目;无权限的项目不会显示。
- 实例名称:2-50 个字符,支持中文、字母、数字、中划线和下划线。
- 算力规格
- 选择架构(x86 / ARM)。
- 选择 GPU 类型:共享 GPU、独享 GPU 或超分 GPU。
- 在规格列表中选择一行,确认 CPU、内存、GPU 卡数/算力百分比/显存。
- 实例镜像
- 基础镜像:平台预置的 Jupyter / PyTorch / TensorFlow 等镜像。
- 自定义镜像:租户或项目自己保存/上传的镜像。
- 外部镜像地址:填写
docker pull后的镜像地址;如有仓库密码,填写用户名/密码。
- 存储配置
- 公共存储:平台管理员配置的只读或读写存储,可多选。
- 自定义存储:租户数据存储,用于存放代码、数据、模型文件。
- 高级配置(选填)
- 开发工具:勾选 Jupyter / VS Code / SSH,实例运行后列表会显示对应入口。
- 注解/环境变量:按 key-value 添加,会注入到容器。
- Web 服务配置:暴露额外 HTTP 端口。
- 启动命令/启动参数:覆盖镜像默认启动行为。
- 密钥:选择已创建的镜像仓库密钥或 SSH 密钥。
- 自动关机/自动释放:按时间点或运行 N 小时后自动执行。
- 共享内存:多卡通信场景建议开启。
- 底部选择创建数量(1-10 个),点击「创建」。

使用容器实例

实例状态变为 运行中 后:
- 点击列表行内的 Jupyter / VS Code / Web 终端 图标进入开发环境。
- 点击「SSH 信息」查看登录地址与端口,用于本地 IDE 远程连接。
- 在实例内修改环境后,点击「保存镜像」可将当前容器保存为新的自定义镜像。
常见操作
| 操作 | 说明 |
|---|---|
| 开机/关机 | 关机保留磁盘,停止计费;开机恢复环境。 |
| 释放 | 彻底删除实例并回收资源;误删可先到回收站恢复。 |
| 克隆 | 用已有实例的配置快速创建新实例。 |
| 编辑 | 仅部分字段(如存储、开发工具)支持编辑后更新。 |
| TensorBoard | 多选运行中实例,一键对比指标。 |

推理服务
推理服务用于将模型部署为可被 Playground 或外部系统调用的 API。平台默认以 StatefulSet 部署,支持单机与多机(LWS)两种模式。
创建推理服务
- 进入 AI 智算开发 > 算力服务 > 推理服务,点击「创建推理服务」。
- 基础信息
- 工作空间/项目:默认带入,可在管理员视角切换。
- 模型来源:选择「模型广场」或「自定义模型」。
- 模型:从下拉中选择要部署的模型。
- 服务别名:用于在列表和调用示例中识别该服务。
- 部署方式:
- 单机:单 Pod 单卡/多卡,适合大多数模型。
- 多机(LWS):多个节点组成 Leader-Worker Set,适合大参数模型分布式推理。
- 部署模板:选择预置的 vLLM / SGLang / MindIE 模板,模板会决定默认启动参数。
- 实例数量:服务运行副本数。
- 滚动更新:升级/回滚时允许的最大不可用百分比。
- 算力规格:同容器实例,选择 GPU 规格。
- 实例镜像:基础/自定义/外部镜像,系统会根据部署模板自动推荐推理引擎标签。
- 存储配置:挂载公共/自定义存储,用于加载模型文件或输出日志。
- 部署参数(选填)
- 注解、标签、环境变量、启动命令、启动参数。
- 健康检查:就绪/存活/启动探针。
- workingDir、hostNetwork、hostIPC、启动用户、共享内存。
- 点击「创建」,等待服务状态变为 运行中。

调用推理服务

服务运行后:
- 在列表点击服务名称进入详情。
- 详情页顶部会显示 API 调用地址 和 API Key。
- 复制 curl 示例,或在 大模型服务 > 在线体验 中选择该模型进行对话测试。
服务运维
| 操作 | 说明 |
|---|---|
| 启动/停止 | 停止后不再计费,释放 GPU;保留配置便于下次启动。 |
| 升级/回滚 | 修改配置或切换模型版本后重新部署;支持按版本回退。 |
| 扩缩容 | 手动调整副本数;也支持 HPA 按 GPU/显存/QPS 自动扩缩。 |
| 克隆 | 基于当前服务配置快速创建新服务。 |
| OpenWebUI | 一键将服务绑定到 OpenWebUI 聊天界面。 |

自定义服务
自定义服务适合部署任意 HTTP 长稳应用(如模型网关、业务 API、可视化工具)。底层是 Kubernetes Deployment + Ingress。
创建自定义服务
- 进入 AI 智算开发 > 算力服务 > 自定义服务,点击「创建自定义服务」。
- 基础信息:工作空间/项目、服务名称、副本数、滚动更新百分比。
- HTTP 服务:添加端口与路径映射,平台会自动生成 Ingress 访问地址。
- 算力规格:如服务无需 GPU,可选择纯 CPU 规格。
- 实例镜像:选择或填写镜像地址。
- 存储配置:挂载需要的存储卷。
- 部署参数:环境变量、启动命令、启动参数、工作目录、启动用户等。
- 高级配置:健康检查、共享内存、定时扩缩容(CronScale)、自动扩缩容(HPA)。
- 点击「创建」。

访问自定义服务
服务运行后,在列表查看暴露的 访问地址,或在详情页「HTTP 服务」页签复制 URL。

常见问题
Q:实例一直 Pending 怎么办? A:进入详情页查看「事件」或「调度事件」,常见原因是资源池配额不足、镜像拉取失败或节点 GPU 不足。
Q:推理服务状态 Running 但调用返回 503? A:检查服务详情中的健康检查配置与启动参数,确认模型文件路径已正确挂载到存储。
Q:自定义服务如何绑定域名? A:在 HTTP 服务配置中填写路径与端口后,平台会自动生成集群域名;如需自定义域名,请联系平台管理员配置 Ingress。