推理服务上线全流程
本文以「从零把一个模型部署为可调用、可计费、可在线体验的推理服务」为目标,串联管理员与开发者的完整操作链路。单步功能的详细字段说明见 算力服务 与 模型管理。
角色分工:「准备工作」大多由管理员在管理后台完成;「启动与访问」由开发者在用户界面完成。
1. 准备工作(管理员)
1.1 上传推理引擎镜像
将推理引擎镜像(如 vLLM、SGLang、vllm-ascend)推送到平台可访问的镜像仓库:
bash
# 离线环境:导入镜像包
docker load -i vllm-ascend:v0.22.1rc1.tar.gz
# 互联网环境:直接拉取
docker pull m.daocloud.io/quay.io/ascend/vllm-ascend:v0.22.1rc1
# 改 tag 为内部镜像仓库地址(示例仓库 harbor.rise.io,按实际替换)
docker tag m.daocloud.io/quay.io/ascend/vllm-ascend:v0.22.1rc1 \
harbor.rise.io/ascendhub/vllm-ascend:v0.22.1rc1
# 登录并推送
docker login harbor.rise.io
docker push harbor.rise.io/ascendhub/vllm-ascend:v0.22.1rc1然后在 AI 智算管理 > AI 资产管理 > 镜像服务 中同步镜像,并在镜像详情中「修改标签」,在任务场景里勾选 推理服务——只有打了推理标签的镜像才能在创建推理服务时被选中。


1.2 下载模型文件到共享存储
bash
# 公网下载(以 ModelScope 为例),共享文件路径按实际替换
cd /data/share/models/
git lfs install
GIT_LFS_SKIP_SMUDGE=1 git clone https://www.modelscope.cn/deepseek-ai/DeepSeek-R1-Distill-Qwen-1.5B.git
cd DeepSeek-R1-Distill-Qwen-1.5B/
git lfs pull
# 或从本地同步
rsync -ah --progress --stats /opt/Deepseek-R1-bf16-hfd-w8a8 /data/share/models/也可以使用 SFTP 客户端(XFTP、WinSCP 等)上传到存储对应的 models 目录,SFTP 服务的初始化见 账号安全 > SFTP 配置。
1.3 配置部署模板
进入 AI 智算管理 > 模型管理 > 部署模板,确认已有与推理引擎匹配的部署模板(模板决定默认启动参数与引擎标签)。没有则创建,注意先同步推理引擎镜像并配置引擎标签。

1.4 配置模型信息
进入 AI 智算管理 > 模型管理 > 模型仓库,点击「创建模型」:填写模型名称、分类、上下文长度、模型文件在存储中的路径等。配置后模型才会出现在模型广场与推理服务的模型下拉中。


2. 启动推理服务(开发者)
- 进入 AI 智算开发 > 算力服务 > 推理服务,点击「创建推理服务」。
- 模型来源选择「模型广场」,选择上一步配置的模型;部署模板会自动带出默认值。
- 选择算力规格与实例数量,挂载包含模型文件的存储。
- 启动命令与启动参数可按需自定义,其余保持默认。
- 点击「创建」,等待状态变为 运行中。

提示:使用内置工作空间(如 gen-studio)部署前,确认该工作空间已分配 GPU 配额,详见 平台初始化。
3. 访问推理服务
3.1 Web 对话
- 在线体验:进入 大模型服务 > 在线体验,页面会自动列出运行中的模型,左上角切换模型即可对话,详见 在线体验。
- OpenWebUI 聊天:部署时选择对接 OpenWebUI 的服务,可在 推理服务详情页右上角 点击「聊天」打开对话界面。
3.2 API 调用
- 在 个人中心 > 账号安全 > API 密钥 创建 API Key,并确认 Key 已被授予目标模型的调用权限(授权后台同步约需 1 分钟)。
- 在推理服务详情页复制调用示例(curl),选择 API Key 后直接粘贴到终端测试。
- 调用产生的 Token 计量与费用可在 我的调用与用量 中查看。

4. 服务管理与排错
推理服务列表页支持快捷停止、启动、升级、扩缩容副本数、调整授权。详情页各页签用途:
| 页签 | 用途 |
|---|---|
| 概览 | 模型信息、镜像版本、规格、创建时的高级配置 |
| 容器组 | 副本 Pod 列表:Pod IP、所在节点、显卡 ID、Web 终端、YAML、describe、单 Pod 重启 |
| 服务监控 | 推理引擎指标:首 Token 时延、端到端耗时、Token 数 |
| 资源监控 | 显存、算力、CPU、内存、网络 |
| 运行日志 | 容器组标准输出日志 |
| 事件 | 平台、控制器、Pod 事件 |
| 调度过程 | 各节点调度评分与失败原因(Pending 排错首选) |
| 版本记录 | 升级历史,支持查看 YAML 与一键回滚 |
常见问题:
- 服务长时间 Pending:看「调度过程」与「事件」,多为配额不足或镜像拉取失败。
- 状态运行中但调用 503:检查健康检查配置与模型文件挂载路径。
- 在线体验里看不到模型:确认服务状态为运行中,且当前账号的 API Key 有该模型权限。
5. 管理员视角(可选)
管理员可在 AI 智算管理 > 算力服务 > 推理服务 查看全平台所有工作空间的推理服务,进行统一的启停与排错。
